Text
2,175 results
croissant_dataset
CroissantLLM: A Truly Bilingual French-English Language Model Dataset Licenses Data redistributed here is subject to the original license…
IndicGenBenchFloresBitextMining
IndicGenBenchFloresBitextMining An MTEB dataset Massive Text Embedding Benchmark Flores-IN dataset is an extension of Flores dataset released as…
OpenSakura Eve LN Aligned Dataset
OpenSakura Eve LN Aligned Dataset
WikidataLabels
Wikidata Labels Large parallel corpus for machine translation Entity label data extracted from Wikidata (2022-01-03), filtered for item…
MultiUN (Multilingual Corpus from United Nation Documents)
MultiUN (Multilingual Corpus from United Nation Documents)
Translated German-English ASR Dataset
Translated German-English ASR Dataset
English to Hinglish or English to Hinglish
English to Hinglish or English to Hinglish
BornholmBitextMining
BornholmBitextMining An MTEB dataset Massive Text Embedding Benchmark Danish Bornholmsk Parallel Corpus. Bornholmsk is a Danish dialect spoken…
United Nations Parallel Corpus
United Nations Parallel Corpus