Skip to content
Advertisement

Multimodal

2,368 results

AudioMultimodalText

OpenDialog

OpenDialog OpenDialog is a 6.8k hours spoken dialogue dataset, introduced in the paper ZipVoice-Dialog: Non-Autoregressive Spoken Dialogue Generation…

100K–1M·CC-BY-NC·WebDataset
AudioMultimodalText

Emilia-NV

NVSpeech Dataset Overview The NVSpeech dataset provides extensive annotations of paralinguistic vocalizations for Mandarin Chinese speech, aimed at…

100K–1M·CC-BY-NC-SA·WebDataset
AudioMultimodalText

spoken-magpie-ja

Spoken-magpie LLMの日本語Instruction Tuning用データllm-jp/magpie-sft-v1.0をCosyVoice2 TTSを使用して音声化した商用利用可能な日本語の音声言語モデルのSFT用データセットです。 ある程度の話者多様性を持つように生成されています。…

100K–1M·Apache-2.0·Parquet
MultimodalTabularText

UniST

UniST This dataset contains UniST codec-token training data exported from local metadata and codec results. We train UniSS…

10M–100M·CC-BY-NC
AudioMultimodalText

Magpie-Speech-Orpheus-125k

Magpie-Speech-Orpheus-125k A ~125k-sample synthetic speech dataset generated by applying the Magpie instruction-synthesis approach to the Orpheus-TTS…

100K–1M·Other·Parquet
AudioMultimodalText

vieneu-tts-140h-dataset

pnnbao-ump/VieNeu-TTS-140h Mô tả Dataset Dataset tiếng Việt chất lượng cao cho Text-to-Speech (TTS) với 74,858 mẫu audio và…

10K–100K·Apache-2.0·Arrow
AudioMultimodalText

vaja-thai

Vaja-Thai (วาจา) — Combined Thai TTS Dataset A unified, quality-filtered Thai speech dataset combining multiple sources for Text-to-Speech…

100K–1M·Custom / Research-only·Parquet
AudioMultimodalText

CSEMOTIONS

CSEMOTIONS: High-Quality Mandarin Emotional Speech Dataset Paper Code CSEMOTIONS is a high-quality Mandarin emotional speech dataset designed for…

1K–10K·Apache-2.0·Parquet
Advertisement