Skip to content
Advertisement

MIT

552 results

MultimodalTextVideo

optimism_train

Optimism Bias World Model Benchmark — Training Data Training data for VLM-as-judge models evaluating world model predictions. Structure…

<1K·MIT
MultimodalTabularText

MVTamperBenchEnd

MVTamperBench Dataset Overview MVTamperBenchEnd is a robust benchmark designed to evaluate Vision-Language Models (VLMs) against adversarial video…

10K–100K·MIT·JSON
Image

SandThink

SandThink Dataset (v1.0) SandThink 是一个专为具身智能 (Embodied AI) 任务设计的大规模指令微调与偏好对齐数据集。该数据集通过结构化的 Chain-of-Thought (CoT) 推理过程,显著提升了 Vision-Language-Action…

<1K·MIT·Images (folder)
ImageMultimodalText

finevision-sample

FineVision Sample Dataset A comprehensive multimodal dataset containing samples across multiple categories, designed for visual question answering…

100K–1M·MIT·Parquet
Image

M2RAG

Data statices of M2RAG Click the links below to view our paper and Github project. If you find…

MIT
ImageMultimodalText

MathVerse

Dataset Card for MathVerse Dataset Description Paper Information Dataset Examples Leaderboard Citation Dataset Description The capabilities of…

1K–10K·MIT·Parquet
Video

full-modality-bench

Multimodal Video QA Dataset This dataset contains challenging video question-answering tasks that require understanding both visual and audio…

1K–10K·MIT
Text

ChartQAPro

ChartQAPro: A More Diverse and Challenging Benchmark for Chart Question Answering 🤗Dataset 🖥️Code 📄Paper The abstract of the…

1K–10K·MIT·Parquet
MultimodalTabularText

MVTamperBenchStart

MVTamperBench Dataset Overview MVTamperBenchStart is a robust benchmark designed to evaluate Vision-Language Models (VLMs) against adversarial video…

10K–100K·MIT·JSON
ImageMultimodalText

VideoThinkBench

CVPR 2026 Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm 🎊 News 2026.02 🔥🔥Our work…

1K–10K·MIT·Parquet
MultimodalTabularText

CG-Bench

CG-Bench Project Website: Repository: (includes running code) Summary We introduce CG-Bench, a groundbreaking benchmark for clue-grounded question…

10K–100K·MIT·JSON
ImageMultimodalText

Obshazard-bench

ObsCrisis-Bench A multimodal benchmark for evaluating large vision-language models on extreme weather event analysis tasks. Dataset Description…

<1K·MIT
MultimodalTextVideo

UrbanVideo-Bench

ACL'25 Oral UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces This repository contains…

1K–10K·MIT·Parquet
Image

ViFailback-Dataset

ViFailback Dataset: Real-World Robotic Manipulation Failure Dataset with Visual Symbol Guidance A real-world dataset for diagnosing, correcting, and…

<1K·MIT·Images (folder)
Advertisement