Skip to content
Advertisement

10M–100M

169 results

AudioMultimodalText

EuroSpeech-24kHz

EuroSpeech 24 kHz Dataset Dataset Description EuroSpeech is a large-scale multilingual speech corpus containing high-quality aligned parliamentary…

10M–100M·MIT·Parquet
AudioMultimodalText

mls_sidon

MLS-Sidon Overview This dataset is a cleansed version of Multilingual LibriSpeech (MLS) with Sidon speech restoration mode for…

10M–100M·CC-BY·WebDataset
AudioMultimodalText

commonvoice22_sidon

CV22-Sidon Overview This dataset hosts a release of Mozilla Common Voice 22 restored with the Sidon speech restoration…

10M–100M·CC0·WebDataset
AudioMultimodalText

X-Voice-Dataset-Train

X-Voice Training Dataset Overview The X-Voice training dataset is a large-scale multilingual speech corpus curated for high-performance speech…

10M–100M·Custom / Research-only·WebDataset
Text

Danbooruwildcards

This is a set of wildcards for danbooru tags. Artist:Prompts for random artist styles, covering approximately 0.6M different…

10M–100M·Custom / Research-only·Text (raw)
AudioMultimodalText

EuroSpeech

EuroSpeech Dataset Dataset Description EuroSpeech is a large-scale multilingual speech corpus containing high-quality aligned parliamentary speech…

10M–100M·Custom / Research-only·Parquet
Advertisement