Pretraining-V1
Indic TTS Unified v1 A large-scale, unified collection of speech data for text-to-speech (TTS) and speech research. This…
575 results
Indic TTS Unified v1 A large-scale, unified collection of speech data for text-to-speech (TTS) and speech research. This…
Overview This dataset is part of LEMAS-Project (lemas-project.github.io/LEMAS-Project). It contains a large-scale training set (150k+ hours) and a…
EMOVA-Alignment-7M 🤗 EMOVA-Models 🤗 EMOVA-Datasets 🤗 EMOVA-Demo 📄 Paper 🌐 Project-Page 💻 Github 💻 EMOVA-Speech-Tokenizer-Github Overview…
EMOVA-SFT-4M 🤗 EMOVA-Models 🤗 EMOVA-Datasets 🤗 EMOVA-Demo 📄 Paper 🌐 Project-Page 💻 Github 💻 EMOVA-Speech-Tokenizer-Github Overview EMOVA-SFT-4M is…
Quranic Translation Audio Data
Talker-T2AV-Data Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling Paper (arXiv 2604.23586) · Code (GitHub) · Model ·…
Google Open Images Hair Style Dataset
UAV Landing Surface Segmentation (AirSim)
RealText-V2: A Large-Scale Multilingual Document Forgery Analysis Benchmark 💾 Dataset Description RealText-V2 is a large-scale multilingual document…
ZJU Eye-Pretrain (Private Shanghai Topcon + 56 public cohorts, 8 modalities)
SAINetset - Wildfire Smoke Detection Dataset
OCR Text Detection and Recognition Dataset
ReceiptSense: Beyond Traditional OCR - A Dataset for Receipt Understanding 🔥 News 2024 ReceiptSense dataset is now publicly…