Skip to content
Advertisement

Multimodal

2,368 results

MultimodalTextVideo

ProLongVid_data

Dataset Card for ProLongVid-data Uses This dataset is used for the training of the ProLongVid model. We only…

1M–10M·Apache-2.0·JSON
MultimodalTabularText

common_corpus

Common Corpus Full paper - ICLR 2026 oral Common Corpus is the largest open licensed text dataset, comprising…

10K–100K·Parquet
MultimodalTabularText

AutoMathText-V2

🚀 AutoMathText-V2: A 2.46 Trillion Token AI-Curated STEM Pretraining Dataset   🎉 AutoMathText-v2 has surpassed 1.5 million downloads!…

100M–1B
MultimodalTabularText

agibot_alpha_v30

This dataset was created using LeRobot. Dataset Structure meta/info.json: { "codebase version": "v3.0", "robot type": "AgiBot A2D", "total…

10M–100M·Apache-2.0·Parquet
AudioMultimodalText

coraal

Corpus of Regional African American Language (CORAAL) Dataset link: Hugging Face Hub preparation scripts: coraal Citation Kendall, Tyler…

<1K·CC-BY-NC-SA·Parquet
AudioMultimodalText

VoxSafeBench

VoxSafeBench Demopage: demopage/ Code: This dataset is uploaded as raw files (JSONL + audio), not parquet. Subset: Safety-tier1…

1K–10K·Apache-2.0·JSON
AudioMultimodalText

SoulTide-AudioData-Dataset

目录结构 character/ └── char / ├── resource/ │ ├── audio/ 原始音频 │ ├── srt/ 原始srt │ └── processed/…

1K–10K·CC0·Audio (folder)
MultimodalTabularText

RealCam-Vid

RealCam-Vid Dataset News 25/04/08: We provide torch dataset demo code for example usage of our RealCam-Vid. 25/03/26: Release…

100K–1M·MIT·CSV
Advertisement