moss-character-voices-bestof64
MOSS Character Voices — Best-of-64 (Stage 2) Best-of-64 voice-acting takes from the 4.55B MOSS-TTS-Local voice-acting model…
81 results
MOSS Character Voices — Best-of-64 (Stage 2) Best-of-64 voice-acting takes from the 4.55B MOSS-TTS-Local voice-acting model…
Dialogs: Expressive Conversational Russian Speech Corpus
NaturalVoices Restored (16 kHz, Sidon + UTMOS-filtered)
Kazakh Traditional Audio Archive
Proof-Carrying Multimodal Timelines Artifact
Dataset Card for First Impressions V2 The first impressions data set, comprises 10000 clips (average duration 15s) extracted…
PROCESS-2: Speech Dataset for Early Cognitive Impairment Detection
Suno AI Music Dataset — Multi-Genre Curated
Audio2Tool — Spoken Tool-Calling Benchmark
Vietnamese Restaurant Order Speech
AudioSet AudioSet 1 is a large-scale dataset comprising approximately 2 million 10-second YouTube audio clips, categorised into 527…
AudioMarathon AudioMarathon is a long-context audio benchmark for evaluating multimodal LLMs on speech, music, environmental audio, and meetings.…
Quranic Recitation Dataset (Word-by-Word)
FreeSound.org LAION-640k Dataset (16 KHz)
香港立法會會議語音數據集 本數據集係由香港立法會會議製成嘅大規模語音數據集。原始錄音總時長 22,196 個鐘,切分語音後總時長 20,471 個鐘。數據集分兩個子集,raw同segmented,分別為原始錄音同VAD識別切分後嘅語音。 數據集製作流程 先去香港特別行政區立法會…