CC-BY
672 results
Bangla–English Synthetic Parallel Corpus
Bangla–English Synthetic Parallel Corpus
IN22ConvBitextMining
IN22ConvBitextMining An MTEB dataset Massive Text Embedding Benchmark IN22-Conv is a n-way parallel conversation domain benchmark dataset for…
RosettIA Chanka Quechua — Judicial Parallel Data (redistributable subset)
RosettIA Chanka Quechua — Judicial Parallel Data (redistributable subset)
Flickr30k
Team and Homepage Official Website: Hugging Face Organization: Contact If you encounter any issues with the dataset or…
Gov-ZA Cabinet Statements (Sentence-Aligned)
Gov-ZA Cabinet Statements (Sentence-Aligned)
The Vuk’uzenzele South African Multilingual Corpus
The Vuk'uzenzele South African Multilingual Corpus
Synthetic Parallel EN-LG (external)
Synthetic Parallel EN-LG (external)
wmt-human-all-TTS
WMT Human + TTS Audio WMT human evaluation data (zouharvi/wmt-human-all) extended with TTS-synthesised source audio, covering 49 language…
IN22GenBitextMining
IN22GenBitextMining An MTEB dataset Massive Text Embedding Benchmark IN22-Gen is a n-way parallel general-purpose multi-domain benchmark dataset for…
tatoeba-bitext-mining
Tatoeba An MTEB dataset Massive Text Embedding Benchmark 1,000 English-aligned sentence pairs for each language based on the…
BornholmBitextMining
BornholmBitextMining An MTEB dataset Massive Text Embedding Benchmark Danish Bornholmsk Parallel Corpus. Bornholmsk is a Danish dialect spoken…