Skip to content
Advertisement

Open

2,922 results

AudioMultimodalText

AudioMarathon

AudioMarathon AudioMarathon is a long-context audio benchmark for evaluating multimodal LLMs on speech, music, environmental audio, and meetings.…

<1K·Custom / Research-only·CSV
AudioMultimodalText

audioset-16khz-wds

AudioSet AudioSet 1 is a large-scale dataset comprising approximately 2 million 10-second YouTube audio clips, categorised into 527…

1M–10M·WebDataset
AudioMultimodalText

meow-10k

Dataset Card for Meow-10K Meow-10K is a high-fidelity, synchronized quad-modal dataset comprising 10,000 feline samples. It is the…

10K–100K·Apache-2.0·JSON
AudioMultimodalText

libritts_r

Dataset Card for LibriTTS-R LibriTTS-R 1 is a sound quality improved version of the LibriTTS corpus ( which…

100K–1M·CC-BY·Parquet
AudioMultimodalText

MMAE

MMAE: A Massive Multitask Audio Editing Benchmark 📖 arXiv 🎬 MMAE Demo Video 🛠️ GitHub Code 🔊 HuggingFace…

1K–10K·Audio (folder)
AudioMultimodalText

AISHELL-3

AISHELL-3 is a large-scale and high-fidelity multi-speaker Mandarin speech corpus published by Beijing Shell Shell Technology Co.,Ltd. It…

10K–100K·Apache-2.0
Advertisement