SETimes – A Parallel Corpus of English and South-East European Languages
SETimes – A Parallel Corpus of English and South-East European Languages
1,501 results
SETimes – A Parallel Corpus of English and South-East European Languages
WMT Human + TTS Audio WMT human evaluation data (zouharvi/wmt-human-all) extended with TTS-synthesised source audio, covering 49 language…
Team and Homepage Official Website: Hugging Face Organization: Contact If you encounter any issues with the dataset or…
Shaistagi (شائستگی) Clean Urdu Mega-Dataset
IN22GenBitextMining An MTEB dataset Massive Text Embedding Benchmark IN22-Gen is a n-way parallel general-purpose multi-domain benchmark dataset for…
Team and Homepage Official Website: Hugging Face Organization: Contact If you encounter any issues with the dataset or…
HAT: Hallucination Annotation for Translation
BioMatrix-SFT This is the supervised fine-tuning (SFT) / instruction-tuning corpus used to train BioMatrix, a multimodal foundation model…
FloresBitextMining An MTEB dataset Massive Text Embedding Benchmark FLORES is a benchmark dataset for machine translation between English…
Mixed Arabic Datasets (MAD) Corpus
Alexandria Multudialectal Arabic Conversational Dataset for Machine Translation