Audio
514 results
TELUS Digital AI Data Solutions
Labeling & AnnotationAI training-data and annotation division of TELUS Digital, formed from its 2020 Lionbridge AI and 2021 Playment acquisitions.
AudioImageTextVideoSoundingEarth
SoundingEarth SoundingEarth is a geo-referenced soundscape dataset that pairs Google Earth imagery with geotagged environmental audio recordings…
KYNMAW — Khasi Bhashini Multi-Task Dataset
KYNMAW — Khasi Bhashini Multi-Task Dataset
Tamazight-Arabic Speech Translation Dataset
Tamazight-Arabic Speech Translation Dataset
dialogue-episodes
Multi-Language Dialogue Episodes Dataset Dataset Description This dataset contains dialogue episodes with multi-language transcripts and separated…
ScreenTalk_JA2ZH-XS
ScreenTalk JA2ZH-XS ScreenTalk JA2ZH-XS is a paired dataset of Japanese speech and Chinese translated text released by DataLabX.…
MultiMed-ST
MultiMed-ST: Large-scale Many-to-many Multilingual Medical Speech Translation 📘 EMNLP 2025 Khai Le-Duc , Tuyen Tran , Bach Phan…
Banque_Sonore_Dialectes_Bretons
!NOTE Dataset origin: Description Issue du site Banque Sonore des Dialectes Bretons Présentation du projet La Banque Sonore…
Synthetic Parallel EN-LG (external)
Synthetic Parallel EN-LG (external)
wmt-human-all-TTS
WMT Human + TTS Audio WMT human evaluation data (zouharvi/wmt-human-all) extended with TTS-synthesised source audio, covering 49 language…
Translated German-English ASR Dataset
Translated German-English ASR Dataset
Multilingual TEDx (mTEDx) — SLR100
Multilingual TEDx (mTEDx) — SLR100
LVOmniBench (QA repackaged for lmms-eval)
LVOmniBench (QA repackaged for lmms-eval)
Unify-OmniBench
Unify-OmniBench 统一格式的多模态评测数据集,由 Unify-OmniBench 框架转换生成。 包含四个 benchmark,在 Dataset Viewer 右上角下拉框切换。 数据概览 Config (bench) 题目数 模态 媒体 daily omni ~1197…