Skip to content
Advertisement

Datasets

3,216 results

MultimodalTextVideo

videomarathon

Dataset Card for VideoMarathon VideoMarathon is a large-scale long video instruction-following dataset with a total duration of approximately…

1M–10M·Apache-2.0·Parquet
MultimodalTextVideo

optimism_train

Optimism Bias World Model Benchmark — Training Data Training data for VLM-as-judge models evaluating world model predictions. Structure…

<1K·MIT
MultimodalTabularText

MVTamperBenchEnd

MVTamperBench Dataset Overview MVTamperBenchEnd is a robust benchmark designed to evaluate Vision-Language Models (VLMs) against adversarial video…

10K–100K·MIT·JSON
MultimodalTextVideo

ReVSI

ICML 2026 Yiming Zhang1 , Jiacheng Chen1 , Jiaqi Tan1, Yongsen Mao2, Wenhu Chen3, Angel X. Chang1,4 1…

10K–100K·Apache-2.0·Parquet
Image

SandThink

SandThink Dataset (v1.0) SandThink 是一个专为具身智能 (Embodied AI) 任务设计的大规模指令微调与偏好对齐数据集。该数据集通过结构化的 Chain-of-Thought (CoT) 推理过程,显著提升了 Vision-Language-Action…

<1K·MIT·Images (folder)
MultimodalTextVideo

LongVALE

Dataset Card for LongVALE Uses This dataset is designed for training and evaluating models on omni-modal (vision-audio-language-event) fine-grained…

100K–1M·CC-BY-NC-SA·Parquet
Text

MapTrace

MapTrace: A 2M-Sample Synthetic Dataset for Path Tracing on Maps Welcome to the MapTrace dataset! If you use…

10K–100K·CC-BY·Parquet
ImageMultimodalText

finevision-sample

FineVision Sample Dataset A comprehensive multimodal dataset containing samples across multiple categories, designed for visual question answering…

100K–1M·MIT·Parquet
MultimodalTextVideo

VideoHallu

VideoHallu: Evaluating and Mitigating Multi-modal Hallucinations for Synthetic Videos Zongxia Li , Xiyang Wu , Guangyao Shi, Yubin…

1K–10K·Apache-2.0·Parquet
Image

M2RAG

Data statices of M2RAG Click the links below to view our paper and Github project. If you find…

MIT
Advertisement