Automatic Speech Recognition
267 results
Ganjoor Persian Poetry Recitations (Full)
Ganjoor Persian Poetry Recitations (Full)
Emolia-Thinking (VoiceNet balanced subset)
Emolia-Thinking (VoiceNet balanced subset)
linto-dataset-audio-ar-tn-augmented
LinTO DataSet Audio for Arabic Tunisian Augmented A collection of Tunisian dialect audio and its annotations for STT…
nonverbalspeech38k
🎉 🎉 🎉 NonVerbalSpeech-38K: A Scalable Pipeline for Enabling Non-Verbal Speech Generation and Understanding The official repository for…
a novel large-scale Vietnamese speech corpus (LSVSC)
a novel large-scale Vietnamese speech corpus (LSVSC)
SimbaBench_dataset
SibmaBench Data Release & Benchmarking To evaluate your model on SimbaBench across all supported tasks (ASR, TTS, and…
enhanced-audiosnippets-long-2-8M
Enhanced Audiosnippets Long 2.8M Enhanced version of mitermix/audiosnippets long 2 8M with speech enhancement, emotion annotations, speaker…
moore_audio_data
~70h of Mooré paired audio+text data from jw.org and jwsoup Headers: audio, text
Uzbek YouTube Speech Dataset
Uzbek YouTube Speech Dataset
NaturalVoices Restored (48 kHz, Sidon + UTMOS-filtered)
NaturalVoices Restored (48 kHz, Sidon + UTMOS-filtered)
Open Bible Resources — African Languages
Open Bible Resources — African Languages
C3T
C3T: Cross-modal Capabilities Conservation Test Dataset Description C3T (Cross-modal Capabilities Conservation Test) is a benchmark for assessing the…