Multimodal
2,368 results
ProLongVid_data
Dataset Card for ProLongVid-data Uses This dataset is used for the training of the ProLongVid model. We only…
L2D
TL;DR of L2D, the world's largest self-driving dataset! Read more about L2D on the official Huggingface blog: LeRobot…
common_corpus
Common Corpus Full paper - ICLR 2026 oral Common Corpus is the largest open licensed text dataset, comprising…
shofo-tiktok-general-small
Shofo TikTok General (Small) Overview Shofo TikTok General (Small) is a dataset containing 50,000 TikTok videos with comprehensive…
AutoMathText-V2
🚀 AutoMathText-V2: A 2.46 Trillion Token AI-Curated STEM Pretraining Dataset 🎉 AutoMathText-v2 has surpassed 1.5 million downloads!…
agibot_alpha_v30
This dataset was created using LeRobot. Dataset Structure meta/info.json: { "codebase version": "v3.0", "robot type": "AgiBot A2D", "total…
The Cross-lingual TRansfer Evaluation of Multilingual Encoders for Speech (XTREME-S) benchmark is a
The Cross-lingual TRansfer Evaluation of Multilingual Encoders for Speech (XTREME-S) benchmark is a benchmark designed to evaluate speech…
coraal
Corpus of Regional African American Language (CORAAL) Dataset link: Hugging Face Hub preparation scripts: coraal Citation Kendall, Tyler…
VoxSafeBench
VoxSafeBench Demopage: demopage/ Code: This dataset is uploaded as raw files (JSONL + audio), not parquet. Subset: Safety-tier1…
SoulTide-AudioData-Dataset
目录结构 character/ └── char / ├── resource/ │ ├── audio/ 原始音频 │ ├── srt/ 原始srt │ └── processed/…
RealCam-Vid
RealCam-Vid Dataset News 25/04/08: We provide torch dataset demo code for example usage of our RealCam-Vid. 25/03/26: Release…