IndicGenBenchFloresBitextMining
IndicGenBenchFloresBitextMining An MTEB dataset Massive Text Embedding Benchmark Flores-IN dataset is an extension of Flores dataset released as…
575 results
IndicGenBenchFloresBitextMining An MTEB dataset Massive Text Embedding Benchmark Flores-IN dataset is an extension of Flores dataset released as…
OpenSakura Eve LN Aligned Dataset
Wikidata Labels Large parallel corpus for machine translation Entity label data extracted from Wikidata (2022-01-03), filtered for item…
MultiUN (Multilingual Corpus from United Nation Documents)
Translated German-English ASR Dataset
English to Hinglish or English to Hinglish
United Nations Parallel Corpus
Multilingual TEDx (mTEDx) — SLR100