Skip to content
Advertisement

Open

2,922 results

AudioMultimodalText

floras

FLORAS FLORAS is a 50-language benchmark For LOng-form Recognition And Summarization of spoken language. The goal of FLORAS…

10K–100K·CC-BY·Parquet
AudioMultimodalText

urbansound8K

(card and dataset copied from This dataset contains 8732 labeled sound excerpts (<=4s) of urban sounds from 10…

1K–10K·CC-BY-NC·Parquet
AudioMultimodalText

cineaudiosynth

CineAudioSynth Synthetic cinematic audio for source separation. 453 scenes, ~22.8 h, 48 kHz / 16-bit / stereo WAV.…

1K–10K·CC-BY-NC-SA·Audio (folder)
Audio

JamendoMaxCaps

JamendoMaxCaps Dataset JamendoMaxCaps is a large-scale dataset of over 362,000 instrumental tracks sourced from the Jamendo platform. It…

100K–1M·CC-BY-SA·Parquet
AudioMultimodalText

police-scanner-audio

Police Scanner Audio Dataset A comprehensive collection of police and emergency services radio communications from multiple US cities,…

1K–10K·CC-BY·Audio (folder)
AudioMultimodalTabular

multi_lingo_data

Multi-lingual TTS Data (leeoxiang/multi lingo data) Large-scale cross-lingual + same-lingual TTS corpus for training expressive multi-lingual…

1K–10K·CC-BY-NC
AudioMultimodalText

echo-clones-4m-en

echo-clones-4m-en ~4 M English TTS clone utterances generated with EchoTTS (jordand/echo-tts-base). Sample rate: 44 100 Hz, 16-bit PCM…

1M–10M·Apache-2.0·Parquet
AudioMultimodalText

AISHELL-4

AISHELL-4 Identifier: SLR111 Summary: A Free Mandarin Multi-channel Meeting Speech Corpus, provided by Beijing Shell Shell Technology Co.,Ltd…

Apache-2.0
Advertisement