1M–10M
329 results
MultimodalTabularText
mls-annotated
Dataset Card for Annotations of non English MLS This dataset consists in annotations of a the Non English…
1M–10M·CC-BY·Parquet
Text
Emolia · Filtered · NanoCodec (FSQ) Tokens
Emolia · Filtered · NanoCodec (FSQ) Tokens
1M–10M·Apache-2.0·Parquet
AudioMultimodalText
Yoruba Speech-Text Parallel Dataset
Yoruba Speech-Text Parallel Dataset
1M–10M·CC-BY·Parquet
MultimodalTabularText
VoxCPM Ghana — Precomputed AudioVAE Latents
VoxCPM Ghana — Precomputed AudioVAE Latents
1M–10M·CC-BY·Parquet
MultimodalTabularText
enhanced-audiosnippets-long-2-8M
Enhanced Audiosnippets Long 2.8M Enhanced version of mitermix/audiosnippets long 2 8M with speech enhancement, emotion annotations, speaker…
1M–10M·CC-BY·Parquet
Text
Chinese Conversational TTS Text (10M)
Chinese Conversational TTS Text (10M)
1M–10M·Apache-2.0·Parquet
ImageMultimodalText
emova-alignment-7m
EMOVA-Alignment-7M 🤗 EMOVA-Models 🤗 EMOVA-Datasets 🤗 EMOVA-Demo 📄 Paper 🌐 Project-Page 💻 Github 💻 EMOVA-Speech-Tokenizer-Github Overview…
1M–10M·Apache-2.0·Parquet
ImageMultimodalText
emova-sft-4m
EMOVA-SFT-4M 🤗 EMOVA-Models 🤗 EMOVA-Datasets 🤗 EMOVA-Demo 📄 Paper 🌐 Project-Page 💻 Github 💻 EMOVA-Speech-Tokenizer-Github Overview EMOVA-SFT-4M is…
1M–10M·Apache-2.0·Parquet