Automatic Speech Recognition
267 results
KYNMAW — Khasi Bhashini Multi-Task Dataset
KYNMAW — Khasi Bhashini Multi-Task Dataset
dialogue-episodes
Multi-Language Dialogue Episodes Dataset Dataset Description This dataset contains dialogue episodes with multi-language transcripts and separated…
MultiMed-ST
MultiMed-ST: Large-scale Many-to-many Multilingual Medical Speech Translation 📘 EMNLP 2025 Khai Le-Duc , Tuyen Tran , Bach Phan…
Banque_Sonore_Dialectes_Bretons
!NOTE Dataset origin: Description Issue du site Banque Sonore des Dialectes Bretons Présentation du projet La Banque Sonore…
Synthetic Parallel EN-LG (external)
Synthetic Parallel EN-LG (external)
2M-Flores – American Sign Language Flores
2M-Flores - American Sign Language Flores
Translated German-English ASR Dataset
Translated German-English ASR Dataset
Multilingual TEDx (mTEDx) — SLR100
Multilingual TEDx (mTEDx) — SLR100
Irodori-Ja-Spk2-10k
SynDataLab/Irodori-Ja-Spk2-10k 10,000 single-speaker conversational Japanese utterances synthesized with Irodori-TTS-500M-v2. Part of a 4-speaker…
ivrit.ai – Knesset Plenums Whisper Training
ivrit.ai - Knesset Plenums Whisper Training
Bambara-ASR-All Audio Dataset
Bambara-ASR-All Audio Dataset
Eka Medical Asr Sample Noise Eval Dataset
Eka Medical Asr Sample Noise Eval Dataset
emova-sft-speech-231k
EMOVA-SFT-Speech-231K 🤗 EMOVA-Models 🤗 EMOVA-Datasets 🤗 EMOVA-Demo 📄 Paper 🌐 Project-Page 💻 Github 💻 EMOVA-Speech-Tokenizer-Github Overview…