Datasets
3,216 results
WenYanWen_English_Parallel
Dataset Card for WenYanWen English Parallel Dataset Summary The WenYanWen English Parallel dataset is a multilingual parallel corpus…
mmarco-contrastive
mMARCO-contrastive The dataset is a modification of mMARCO focusing on French and English parts. The aim is to…
MultiMed-ST
MultiMed-ST: Large-scale Many-to-many Multilingual Medical Speech Translation 📘 EMNLP 2025 Khai Le-Duc , Tuyen Tran , Bach Phan…
quickmt-train.fr-en
quickmt fr-en Training Corpus Contains the following datasets downloaded with mtdata after deduplication, and basic filtering with quickmt:…
DeepResearch Bench Multilingual Prompts
DeepResearch Bench Multilingual Prompts
African Languages Lab Multi-Open
African Languages Lab Multi-Open
quickmt-train.zh-en
quickmt zh-en Training Corpus Contains the following datasets downloaded with mtdata after deduplication and basic filtering with quickmt:…
Gov-ZA Cabinet Statements (Sentence-Aligned)
Gov-ZA Cabinet Statements (Sentence-Aligned)
Parallel Corpus from United Nations Digital Library Official Document System aligned by file
Parallel Corpus from United Nations Digital Library Official Document System aligned by file
Banque_Sonore_Dialectes_Bretons
!NOTE Dataset origin: Description Issue du site Banque Sonore des Dialectes Bretons Présentation du projet La Banque Sonore…