Multimodal
2,368 results
IndicVoices
IndicVoices: Towards building an Inclusive Multilingual Speech Dataset for Indian Languages Updates 23 December 2025 We now have…
Crowd Whatsapp Yiddish – Source Dataset
Crowd Whatsapp Yiddish - Source Dataset
Knesset Plenum Source Dataset
Knesset Plenum Source Dataset
synthetic-asr-hi
Synthetic ASR data — hi Generated by Valsea-ASR/synthetic-data-pipeline. Audio is synthetic (TTS), targeted as training data for downstream…
open-asr-leaderboard
ESB Test Sets: Parquet & Sorted This dataset takes the open-asr-leaderboard/datasets-test-only data and sorts each split by audio…
FreeSound.org LAION-640k Dataset
FreeSound.org LAION-640k Dataset
JavisInst-Omni
JavisGPT: A Unified Multi-modal LLM for Sounding-Video Comprehension and Generation HomePage Paper GitHub TL;DR We introduce JavisGPT, a…
AVQA JSONL (Audio Multiple-Choice QA)
AVQA JSONL (Audio Multiple-Choice QA)
NatureLM-audio-training
NatureLM-audio-training
synthetic-asr-zh
Synthetic ASR data — zh Generated by Valsea-ASR/synthetic-data-pipeline. Audio is synthetic (TTS), targeted as training data for downstream…
malaysian-youtube
Malaysian Youtube Malaysian and Singaporean youtube channels, total up to 60k audio files with total 18.7k hours. URLs…
TAVGBench_1m
Installation Download this repo to a local folder, and unzip these .zip files under the TAVGBench 1m/data/. Then,…