tts-pretrain-clones-3m-mos
TTS Pretrain Clones (3M) — with DNSMOS This is SynDataLab/tts-pretrain-clones-3m with an added per-utterance dnsmos column (DNSMOS P.835…
3,216 results
TTS Pretrain Clones (3M) — with DNSMOS This is SynDataLab/tts-pretrain-clones-3m with an added per-utterance dnsmos column (DNSMOS P.835…
A Multilingual Speech Dataset for SLU and Beyond
LIEPA-3 Lithuanian Speech Corpus
DailyTalkContiguous This repo contains a concatenated version of the DailyTalk dataset (official repo). Rather than having separate files…
AstraMindAI/BigAudioDataset Dataset Description AstraMindAI/BigAudioDataset is a large-scale, multilingual dataset designed for a wide range of audio…
CV22-Sidon Overview This dataset hosts a release of Mozilla Common Voice 22 restored with the Sidon speech restoration…
English-Centric Multilingual Audio Dataset
Streaming ASR Dataset This dataset is designed for training real-time (streaming) ASR models, with a focus on handling…
IndicVoices: Towards building an Inclusive Multilingual Speech Dataset for Indian Languages Updates 23 December 2025 We now have…
Crowd Whatsapp Yiddish - Source Dataset
Knesset Plenum Source Dataset
Synthetic ASR data — hi Generated by Valsea-ASR/synthetic-data-pipeline. Audio is synthetic (TTS), targeted as training data for downstream…