Parquet
1,501 results
Risale-i Nur Sesli Külliyat — Risale-i Nur Audio Corpus
Risale-i Nur Sesli Külliyat — Risale-i Nur Audio Corpus
Loubna Stories Arabic Speech Dataset
Loubna Stories Arabic Speech Dataset
ne-tts-nnp
NE-TTS Wancho (nnp) Cleaned TTS dataset for Wancho (nnp), a North East Indian language. Derived from the Vaani…
Emolia · Filtered · NanoCodec (FSQ) Tokens
Emolia · Filtered · NanoCodec (FSQ) Tokens
vctk
VCTK This is a processed clone of the VCTK dataset with leading and trailing silence removed using Silero…
Speech Brain Noise Evaluation Dataset
Speech Brain Noise Evaluation Dataset
Eka Medical ASR Evaluation Dataset
Eka Medical ASR Evaluation Dataset
spoken-magpie-ja
Spoken-magpie LLMの日本語Instruction Tuning用データllm-jp/magpie-sft-v1.0をCosyVoice2 TTSを使用して音声化した商用利用可能な日本語の音声言語モデルのSFT用データセットです。 ある程度の話者多様性を持つように生成されています。…
Yoruba Speech-Text Parallel Dataset
Yoruba Speech-Text Parallel Dataset
Magpie-Speech-Orpheus-125k
Magpie-Speech-Orpheus-125k A ~125k-sample synthetic speech dataset generated by applying the Magpie instruction-synthesis approach to the Orpheus-TTS…
vaja-thai
Vaja-Thai (วาจา) — Combined Thai TTS Dataset A unified, quality-filtered Thai speech dataset combining multiple sources for Text-to-Speech…