Skip to content
Advertisement

Automatic Speech Recognition

267 results

AudioMultimodalText

everyayah-phonemes

Phoneme-labelled Quran Datatset This dataset contains recitations from 45 professional Quran reciters, sourced from EveryAyah and QUL. The…

100K–1M·CC-BY·Parquet
Audio

northern-kurdish-raw-audio

Northern Kurdish Raw Audio Collection Overview This repository contains a large collection of raw Northern Kurdish (Kurmanji Kurdish)…

1K–10K·Audio (folder)
Text

en

WTForbes/en Corpus JSONL files are in corpus dir jsonl/. Audio payloads are stored in audio parquet/ shards. WAV…

1M–10M·Custom / Research-only·JSON
AudioMultimodalText

parczech4speech-segmented

ParCzech4Speech (Sentence-Segmented Variant) Dataset Summary ParCzech4Speech (Sentence-Segmented Variant) is a large-scale Czech speech dataset based…

100K–1M·CC-BY·WebDataset
AudioMultimodalText

Pretraining-V1

Indic TTS Unified v1 A large-scale, unified collection of speech data for text-to-speech (TTS) and speech research. This…

10M–100M·CC-BY·Parquet
Text

LEMAS-Dataset-train

Overview This dataset is part of LEMAS-Project (lemas-project.github.io/LEMAS-Project). It contains a large-scale training set (150k+ hours) and a…

100M–1B·CC-BY·JSON
ImageMultimodalText

emova-alignment-7m

EMOVA-Alignment-7M 🤗 EMOVA-Models 🤗 EMOVA-Datasets 🤗 EMOVA-Demo 📄 Paper 🌐 Project-Page 💻 Github 💻 EMOVA-Speech-Tokenizer-Github Overview…

1M–10M·Apache-2.0·Parquet
ImageMultimodalText

emova-sft-4m

EMOVA-SFT-4M 🤗 EMOVA-Models 🤗 EMOVA-Datasets 🤗 EMOVA-Demo 📄 Paper 🌐 Project-Page 💻 Github 💻 EMOVA-Speech-Tokenizer-Github Overview EMOVA-SFT-4M is…

1M–10M·Apache-2.0·Parquet
Advertisement