MIT
552 results
Eka Medical Asr Sample Noise Eval Dataset
Eka Medical Asr Sample Noise Eval Dataset
Urdu-Munch-Lina
Urdu-Munch-Lina Processed version of zuhri025/Urdu-Munch with LinaCodec encoding. Dataset Structure This dataset contains 2 batches of audio data…
InstructTTSEval
InstructTTSEval InstructTTSEval is a comprehensive benchmark designed to evaluate Text-to-Speech (TTS) systems' ability to follow complex…
audio_data_russian_backup
Dataset Audio Russian Backup This is a backup dataset with Russian audio data, split into train 0 to…
Ace-Taffy-voice
关注永雏塔菲喵,关注永雏塔菲谢谢喵 永雏塔菲语音数据集 数据来自永雏塔菲直播,使用 silero vad + whisper-large-v3-trubo 粗略标注后,人工修正。 微调示例代码:
UltraVoice
UltraVoice: Scaling Fine-Grained Style-Controlled Speech Conversations for Spoken Dialogue Models 📝 Abstract Spoken dialogue models currently lack…
Speech Brain Noise Evaluation Dataset
Speech Brain Noise Evaluation Dataset
Eka Medical ASR Evaluation Dataset
Eka Medical ASR Evaluation Dataset
MintTTS Pre-tokenized Audio (somu9/hindi-hq)
MintTTS Pre-tokenized Audio (somu9/hindi-hq)
audio_data_russian
Dataset Audio Russian This is a dataset with Russian audio data, split into train for tasks like text-to-speech,…
Urdu-ONYX-WAV-kanade-Annotated
Urdu-ONYX-WAV-real-Annotated Enhanced version of Urdu-ONYX-WAV-real with phoneme annotations and Kanade tokenizer features. Dataset Statistics Total…
BibleMMS
The Dataset associated with the Paper "Meta Learning Text-to-Speech Synthesis in over 7000 Languages" by Florian Lux, Sarina…
SPS-Bopha-Voice-Dataset-v1
VibeVoice Fine-Tuning Dataset: SPS-Bopha-Voice-Dataset-v1 This dataset is formatted for fine-tuning VibeVoice. Structure training data.jsonl: The…
CARLA Autopilot Multimodal Dataset
CARLA Autopilot Multimodal Dataset
IndustryShapes
IndustryShapes Project Page Paper IndustryShapes is a new benchmark dataset tailored for 6D object pose estimation in industrial…