IN22GenBitextMining
IN22GenBitextMining An MTEB dataset Massive Text Embedding Benchmark IN22-Gen is a n-way parallel general-purpose multi-domain benchmark dataset for…
575 results
IN22GenBitextMining An MTEB dataset Massive Text Embedding Benchmark IN22-Gen is a n-way parallel general-purpose multi-domain benchmark dataset for…
Marathi OCR model training dataset
CLERC Épée v0.2 — Sign Language Data Layer
Team and Homepage Official Website: Hugging Face Organization: Contact If you encounter any issues with the dataset or…
Novelist: TinyStories Multilingual Edition Dataset Summary The TinyStories Multilingual Edition is a high-fidelity synthetic dataset of short,…
Tatoeba An MTEB dataset Massive Text Embedding Benchmark 1,000 English-aligned sentence pairs for each language based on the…
HAT: Hallucination Annotation for Translation
Open PII Masking 500k Ai4Privacy Dataset
FloresBitextMining An MTEB dataset Massive Text Embedding Benchmark FLORES is a benchmark dataset for machine translation between English…
Dataset Card for panlex-meanings This is a dataset of words in several thousand languages, extracted from Dataset Details…
Alexandria Multudialectal Arabic Conversational Dataset for Machine Translation
CroissantLLM: A Truly Bilingual French-English Language Model Dataset Licenses Data redistributed here is subject to the original license…