IndicGenBenchFloresBitextMining
IndicGenBenchFloresBitextMining An MTEB dataset Massive Text Embedding Benchmark Flores-IN dataset is an extension of Flores dataset released as…
1,501 results
IndicGenBenchFloresBitextMining An MTEB dataset Massive Text Embedding Benchmark Flores-IN dataset is an extension of Flores dataset released as…
OpenSakura Eve LN Aligned Dataset
Wikidata Labels Large parallel corpus for machine translation Entity label data extracted from Wikidata (2022-01-03), filtered for item…
MultiUN (Multilingual Corpus from United Nation Documents)
Translated German-English ASR Dataset
English to Hinglish or English to Hinglish
BornholmBitextMining An MTEB dataset Massive Text Embedding Benchmark Danish Bornholmsk Parallel Corpus. Bornholmsk is a Danish dialect spoken…
United Nations Parallel Corpus
Multilingual TEDx (mTEDx) — SLR100
OPUS Europarl (European Parliament Proceedings Parallel Corpus)
Traditional Chinese-aya collection