Skip to content
Advertisement

Audio

514 results

AudioMultimodalText

IndicVoices

IndicVoices: Towards building an Inclusive Multilingual Speech Dataset for Indian Languages Updates 23 December 2025 We now have…

1M–10M·CC-BY·Parquet
AudioMultimodalText

synthetic-asr-hi

Synthetic ASR data — hi Generated by Valsea-ASR/synthetic-data-pipeline. Audio is synthetic (TTS), targeted as training data for downstream…

10K–100K·JSON
Audio

finetuned-hindi-punjabi-denoised

Multilingual Speaker Diarization Dataset This dataset contains synthetic multilingual speaker diarization data with Hindi, English, and Punjabi audio…

1K–10K·MIT
Audio

WearVox

WearVox: An Egocentric Multichannel Voice Assistant Benchmark for Wearables Paper: WearVox: An Egocentric Multichannel Voice Assistant Benchmark for…

1K–10K·CC-BY-NC·Audio (folder)
AudioMultimodalVideo

JavisInst-Omni

JavisGPT: A Unified Multi-modal LLM for Sounding-Video Comprehension and Generation HomePage Paper GitHub TL;DR We introduce JavisGPT, a…

10K–100K·Apache-2.0
AudioMultimodalText

synthetic-asr-zh

Synthetic ASR data — zh Generated by Valsea-ASR/synthetic-data-pipeline. Audio is synthetic (TTS), targeted as training data for downstream…

10K–100K·JSON
Audio

GTSinger

GTSinger: A Global Multi-Technique Singing Corpus with Realistic Music Scores for All Singing Tasks Yu Zhang , Changhao…

<1K·Audio (folder)
AudioMultimodalText

malaysian-youtube

Malaysian Youtube Malaysian and Singaporean youtube channels, total up to 60k audio files with total 18.7k hours. URLs…

10K–100K·Parquet
Audio

NOTSOFAR

Introduction Welcome to the "NOTSOFAR-1: Distant Meeting Transcription with a Single Device" Challenge. This repo contains the baseline…

10K–100K·Audio (folder)
Advertisement