Skip to content
Advertisement

Audio

514 results

AudioMultimodalText

EuroSpeech

EuroSpeech Dataset Dataset Description EuroSpeech is a large-scale multilingual speech corpus containing high-quality aligned parliamentary speech…

10M–100M·Custom / Research-only·Parquet
AudioMultimodalText

covost2

This is a partial copy of CoVoST2 dataset. The main difference is that the audio data is included…

1M–10M·Parquet
AudioMultimodalText

yodas2_sidon

YODAS2-Sidon Overview This dataset is a cleansed version of YODAS-2 with Sidon speech restoration mode for Speech Synthesis…

1M–10M·CC-BY·WebDataset
AudioMultimodalText

coraal

Corpus of Regional African American Language (CORAAL) Dataset link: Hugging Face Hub preparation scripts: coraal Citation Kendall, Tyler…

<1K·CC-BY-NC-SA·Parquet
AudioMultimodalText

VoxSafeBench

VoxSafeBench Demopage: demopage/ Code: This dataset is uploaded as raw files (JSONL + audio), not parquet. Subset: Safety-tier1…

1K–10K·Apache-2.0·JSON
AudioMultimodalText

SoulTide-AudioData-Dataset

目录结构 character/ └── char / ├── resource/ │ ├── audio/ 原始音频 │ ├── srt/ 原始srt │ └── processed/…

1K–10K·CC0·Audio (folder)
Advertisement