Skip to content
Advertisement

Visual Question Answering

339 results

Text

MapTrace

MapTrace: A 2M-Sample Synthetic Dataset for Path Tracing on Maps Welcome to the MapTrace dataset! If you use…

10K–100K·CC-BY·Parquet
ImageMultimodalText

finevision-sample

FineVision Sample Dataset A comprehensive multimodal dataset containing samples across multiple categories, designed for visual question answering…

100K–1M·MIT·Parquet
MultimodalTextVideo

VideoHallu

VideoHallu: Evaluating and Mitigating Multi-modal Hallucinations for Synthetic Videos Zongxia Li , Xiyang Wu , Guangyao Shi, Yubin…

1K–10K·Apache-2.0·Parquet
Image

M2RAG

Data statices of M2RAG Click the links below to view our paper and Github project. If you find…

MIT
AudioImageMultimodal

Unify-OmniBench

Unify-OmniBench 统一格式的多模态评测数据集,由 Unify-OmniBench 框架转换生成。 包含四个 benchmark,在 Dataset Viewer 右上角下拉框切换。 数据概览 Config (bench) 题目数 模态 媒体 daily omni ~1197…

1K–10K·Custom / Research-only·Parquet
ImageMultimodalText

MathVerse

Dataset Card for MathVerse Dataset Description Paper Information Dataset Examples Leaderboard Citation Dataset Description The capabilities of…

1K–10K·MIT·Parquet
ImageMultimodalText

HoloCount

HoloCount: A Holistic Visual Counting Benchmark for MLLMs Abstract Visual counting is a fundamental pillar of multimodal intelligence,…

1K–10K·CC-BY·Images (folder)
MultimodalTabularText

TVBench

Lost in Time: A New Temporal Benchmark for Video LLMs Daniel Cores , Michael Dorkenwald , Manuel Mucientes,…

1K–10K·CC-BY·JSON
MultimodalTextVideo

lapchole-focus-vqa

LapChole-FOCUS-VQA A clinically grounded benchmark for long-context video understanding in minimally invasive surgery. 💻 Code  •  🏆…

10K–100K·Custom / Research-only·Parquet
MultimodalTextVideo

V1-33K

V1: Toward Multimodal Reasoning by Designing Auxiliary Tasks 🚀 Toward Multimodal Reasoning via Unsupervised Task -- Future Prediction…

10K–100K·Apache-2.0·JSON
ImageMultimodalText

StepCountQA-SFT

StepCountQA-SFT StepCountQA-SFT is a multimodal supervised fine-tuning (SFT) dataset for visual object counting with step-by-step reasoning. Built…

1M–10M·ODC-BY·Parquet
Video

full-modality-bench

Multimodal Video QA Dataset This dataset contains challenging video question-answering tasks that require understanding both visual and audio…

1K–10K·MIT
ImageMultimodalText

ImgCode-8.6M

MathCoder-VL: Bridging Vision and Code for Enhanced Multimodal Mathematical Reasoning Repo: Paper: Introduction We introduce MathCoder-VL, a series…

1M–10M·Apache-2.0·Parquet
Advertisement