Datasets
464 results
EuroSpeech
EuroSpeech Dataset Dataset Description EuroSpeech is a large-scale multilingual speech corpus containing high-quality aligned parliamentary speech…
covost2
This is a partial copy of CoVoST2 dataset. The main difference is that the audio data is included…
Crowd Recital Yiddish – Source Dataset
Crowd Recital Yiddish - Source Dataset
yodas2_sidon
YODAS2-Sidon Overview This dataset is a cleansed version of YODAS-2 with Sidon speech restoration mode for Speech Synthesis…
AudioMCQ-StrongAC-GeminiCoT
ICLR 2026 DCASE 2026 Training Set AudioMCQ-StrongAC-GeminiCoT This dataset is a highly curated subset of the AudioMCQ dataset,…
The Cross-lingual TRansfer Evaluation of Multilingual Encoders for Speech (XTREME-S) benchmark is a
The Cross-lingual TRansfer Evaluation of Multilingual Encoders for Speech (XTREME-S) benchmark is a benchmark designed to evaluate speech…
coraal
Corpus of Regional African American Language (CORAAL) Dataset link: Hugging Face Hub preparation scripts: coraal Citation Kendall, Tyler…
VoxSafeBench
VoxSafeBench Demopage: demopage/ Code: This dataset is uploaded as raw files (JSONL + audio), not parquet. Subset: Safety-tier1…
SoulTide-AudioData-Dataset
目录结构 character/ └── char / ├── resource/ │ ├── audio/ 原始音频 │ ├── srt/ 原始srt │ └── processed/…
Multilingual Speech Commands Dataset (15 Languages, Augmented)
Multilingual Speech Commands Dataset (15 Languages, Augmented)