Multimodal
2,368 results
Bo du lieu giong noi tieng Viet
Bo du lieu giong noi tieng Viet
Daily-Omni (QA repackaged for lmms-eval)
Daily-Omni (QA repackaged for lmms-eval)
floras
FLORAS FLORAS is a 50-language benchmark For LOng-form Recognition And Summarization of spoken language. The goal of FLORAS…
urbansound8K
(card and dataset copied from This dataset contains 8732 labeled sound excerpts (<=4s) of urban sounds from 10…
cineaudiosynth
CineAudioSynth Synthetic cinematic audio for source separation. 453 scenes, ~22.8 h, 48 kHz / 16-bit / stereo WAV.…
mu-bench
Dataset Card for μ-Bench (Leaderboard Code) μ-Bench is a multilingual transcription benchmark built from real customer-service phone conversations.…
Multilingual MFA-Aligned Speech Dataset
Multilingual MFA-Aligned Speech Dataset
police-scanner-audio
Police Scanner Audio Dataset A comprehensive collection of police and emergency services radio communications from multiple US cities,…
captioned-ai-music-snippets
Dataset Overview A collection of short audio snippets (3–30 seconds) extracted from publicly shared Suno‑generated songs and captioned…
multi_lingo_data
Multi-lingual TTS Data (leeoxiang/multi lingo data) Large-scale cross-lingual + same-lingual TTS corpus for training expressive multi-lingual…
echo-clones-4m-en
echo-clones-4m-en ~4 M English TTS clone utterances generated with EchoTTS (jordand/echo-tts-base). Sample rate: 44 100 Hz, 16-bit PCM…