Skip to content
Advertisement

Datasets

3,216 results

Text

OPUS-100

OPUS-100

10M–100M·Custom / Research-only·Parquet
Text

WenYanWen_English_Parallel

Dataset Card for WenYanWen English Parallel Dataset Summary The WenYanWen English Parallel dataset is a multilingual parallel corpus…

1M–10M·MIT·Parquet
Text

mmarco-contrastive

mMARCO-contrastive The dataset is a modification of mMARCO focusing on French and English parts. The aim is to…

100K–1M·Apache-2.0·Parquet
Text

ECDC

ECDC

10K–100K·Custom / Research-only
AudioMultimodalText

MultiMed-ST

MultiMed-ST: Large-scale Many-to-many Multilingual Medical Speech Translation 📘 EMNLP 2025 Khai Le-Duc , Tuyen Tran , Bach Phan…

10K–100K·MIT·Parquet
Text

quickmt-train.fr-en

quickmt fr-en Training Corpus Contains the following datasets downloaded with mtdata after deduplication, and basic filtering with quickmt:…

100M–1B·Parquet
Text

quickmt-train.zh-en

quickmt zh-en Training Corpus Contains the following datasets downloaded with mtdata after deduplication and basic filtering with quickmt:…

10M–100M·Parquet
Advertisement