Text
2,175 results
WMT20 – MultiLingual Quality Estimation (MLQE) Task3
WMT20 - MultiLingual Quality Estimation (MLQE) Task3
nmt-parallel-corpus
Neural Machine Translation parallel corpora Introduction We use OpusTools to extract resources from the OPUS project, a renowned…
translator-rules-dataset
Translator Rules Dataset A high-quality Arabic↔English machine-translation dataset built from the WAM (Web Archive Management) translation corpus —…
Turkish Academic Theses Abstracts (TR/EN)
Turkish Academic Theses Abstracts (TR/EN)
NorwegianCourtsBitextMining
NorwegianCourtsBitextMining An MTEB dataset Massive Text Embedding Benchmark Nynorsk and Bokmål parallel corpus from Norwegian courts. Norwegian…
undl_ar2en_aligned
Dataset Card for "undl ar2en aligned" More Information needed
M4LE
Introduction M4LE is a Multi-ability, Multi-range, Multi-task, bilingual benchmark for long-context evaluation. We categorize long-context…
CodeMixBench
ℹ️Dataset Card for CodeMixBench EMNLP'25 CodeMixBench: Evaluating Code-Mixing Capabilities of LLMs Across 18 Languages Code-mixing is a linguistic…
ALEE Datasets (AMR English Foils)
ALEE Datasets (AMR English Foils)
Maori_English_New_Zealand
Dataset for Translation from Maori to English The source of this dataset is scraped from the website TEARA.…
quickmt-train.hu-en
quickmt hu-en Training Corpus Contains the following datasets downloaded with mtdata after deduplication and basic filtering with quickmt:…
20k-en-zh-translation-pinyin-hsk
20,000+ chinese sentences with translations and pinyin Source: Contributed by: Brian Vaughan Dataset Structure Each sample consists of:…