Skip to content
Advertisement

Text

2,175 results

Text

nmt-parallel-corpus

Neural Machine Translation parallel corpora Introduction We use OpusTools to extract resources from the OPUS project, a renowned…

>1B·CC-BY-NC·Parquet
Text

translator-rules-dataset

Translator Rules Dataset A high-quality Arabic↔English machine-translation dataset built from the WAM (Web Archive Management) translation corpus —…

10K–100K·Parquet
Text

NorwegianCourtsBitextMining

NorwegianCourtsBitextMining An MTEB dataset Massive Text Embedding Benchmark Nynorsk and Bokmål parallel corpus from Norwegian courts. Norwegian…

1K–10K·CC-BY·Parquet
MultimodalTabularText

M4LE

Introduction M4LE is a Multi-ability, Multi-range, Multi-task, bilingual benchmark for long-context evaluation. We categorize long-context…

10K–100K·MIT·JSON
Text

CodeMixBench

ℹ️Dataset Card for CodeMixBench EMNLP'25 CodeMixBench: Evaluating Code-Mixing Capabilities of LLMs Across 18 Languages Code-mixing is a linguistic…

10K–100K·Apache-2.0·CSV
Text

Maori_English_New_Zealand

Dataset for Translation from Maori to English The source of this dataset is scraped from the website TEARA.…

1K–10K·Other·CSV
Text

ACES

ACES

10K–100K·CC-BY-NC-SA·JSON
Text

quickmt-train.hu-en

quickmt hu-en Training Corpus Contains the following datasets downloaded with mtdata after deduplication and basic filtering with quickmt:…

100M–1B·Parquet
Text

iSign

iSign

100K–1M·CC-BY-NC-SA·CSV
Text

20k-en-zh-translation-pinyin-hsk

20,000+ chinese sentences with translations and pinyin Source: Contributed by: Brian Vaughan Dataset Structure Each sample consists of:…

100K–1M·Text (raw)
Advertisement