Skip to content
Advertisement

1K–10K

598 results

Video

Cosmos3-DROID

DROID: Distributed Robot Interaction Dataset Dataset Summary DROID (Distributed Robot Interaction Dataset) is a large-scale "in-the-wild" robot…

1K–10K·Other
Audio

open-swara

Open Swara The largest open-source humanized voice library -- 4,065 voice samples across 44 languages, free forever under…

1K–10K·CC-BY-SA
AudioMultimodalText

esc50

The dataset is available under the terms of the Creative Commons Attribution Non-Commercial license. K. J. Piczak. ESC:…

1K–10K·Parquet
AudioMultimodalText

MMAE

MMAE: A Massive Multitask Audio Editing Benchmark 📖 arXiv 🎬 MMAE Demo Video 🛠️ GitHub Code 🔊 HuggingFace…

1K–10K·Audio (folder)
AudioMultimodalVideo

rh20t_cfg1

rh20t cfg1 — RH20T → LeRobot v3 (flexiv) Unofficial LeRobot Dataset v3 reformatting of an RH20T config. RGB…

1K–10K·Custom / Research-only·Audio (folder)
AudioMultimodalText

urbansound8K

(card and dataset copied from This dataset contains 8732 labeled sound excerpts (<=4s) of urban sounds from 10…

1K–10K·CC-BY-NC·Parquet
AudioMultimodalText

cineaudiosynth

CineAudioSynth Synthetic cinematic audio for source separation. 453 scenes, ~22.8 h, 48 kHz / 16-bit / stereo WAV.…

1K–10K·CC-BY-NC-SA·Audio (folder)
AudioMultimodalText

mu-bench

Dataset Card for μ-Bench (Leaderboard Code) μ-Bench is a multilingual transcription benchmark built from real customer-service phone conversations.…

1K–10K·CC-BY-NC·Audio (folder)
AudioMultimodalText

police-scanner-audio

Police Scanner Audio Dataset A comprehensive collection of police and emergency services radio communications from multiple US cities,…

1K–10K·CC-BY·Audio (folder)
AudioMultimodalTabular

multi_lingo_data

Multi-lingual TTS Data (leeoxiang/multi lingo data) Large-scale cross-lingual + same-lingual TTS corpus for training expressive multi-lingual…

1K–10K·CC-BY-NC
Advertisement