Translation
253 results
BornholmBitextMining
BornholmBitextMining An MTEB dataset Massive Text Embedding Benchmark Danish Bornholmsk Parallel Corpus. Bornholmsk is a Danish dialect spoken…
United Nations Parallel Corpus
United Nations Parallel Corpus
Multilingual TEDx (mTEDx) — SLR100
Multilingual TEDx (mTEDx) — SLR100
OPUS Europarl (European Parliament Proceedings Parallel Corpus)
OPUS Europarl (European Parliament Proceedings Parallel Corpus)
Traditional_Chinese-aya_collection
Traditional Chinese-aya collection
Bambara-ASR-All Audio Dataset
Bambara-ASR-All Audio Dataset
Sunbird African Language Technology (SALT) dataset
Sunbird African Language Technology (SALT) dataset
dowis
Do What I Say (DOWIS): A Spoken Prompt Dataset for Instruction-Following NEW DOWIS now also contains spoken and…
UniST
UniST This dataset contains UniST codec-token training data exported from local metadata and codec results. We train UniSS…
alconost-multilingual-speech-gold
Multilingual Speech & Translation Dataset — EN↔JA/AR-EG/PL/RU (10 phrases, dual-take) Description 10 English source phrases with expert human…