Skip to content
Advertisement

100K–1M

595 results

Video

X-WAM-RoboTwin

X-WAM Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising Dataset Summary This is the RoboTwin…

100K–1M·Apache-2.0
AudioMultimodalText

libritts

Dataset Card for LibriTTS LibriTTS is a multi-speaker English corpus of approximately 585 hours of read English speech…

100K–1M·CC-BY·Parquet
AudioMultimodalText

FalAR

FalAR FalAR is a large-scale, speaker-annotated European Portuguese speech corpus built from recordings of parliamentary sessions of the…

100K–1M·CC-BY·Parquet
AudioMultimodalText

libritts_r

Dataset Card for LibriTTS-R LibriTTS-R 1 is a sound quality improved version of the LibriTTS corpus ( which…

100K–1M·CC-BY·Parquet
AudioMultimodalText

MRSAudio

MRSAudio: A Large-Scale Multimodal Recorded Spatial Audio Dataset with Refined Annotations Humans rely on multisensory integration to perceive…

100K–1M·CC-BY·CSV
AudioMultimodalText

synthetic_vocal_bursts

This repository contains the vocal bursts like giggling, laughter, shouting, crying, etc. from the following repository. We captioned…

100K–1M·Apache-2.0·WebDataset
Audio

JamendoMaxCaps

JamendoMaxCaps Dataset JamendoMaxCaps is a large-scale dataset of over 362,000 instrumental tracks sourced from the Jamendo platform. It…

100K–1M·CC-BY-SA·Parquet
AudioMultimodalText

openwhisper

Streaming ASR Dataset This dataset is designed for training real-time (streaming) ASR models, with a focus on handling…

100K–1M·MIT·Parquet
Advertisement