Skip to content
Advertisement

Image

1,418 results

Image

C3B

English 简体中文 C³B: Comics Cross-Cultural Benchmark Culture In a Frame: C³B as a Comic-Based Benchmark for Multimodal Cultural…

1K–10K·CC-BY·Images (folder)
ImageMultimodalText

STRIDE-QA-Dataset

STRIDE-QA Dataset 📦 Dataset STRIDE-QA is a large-scale visual question answering (VQA) dataset for physically grounded spatiotemporal reasoning…

100K–1M·WebDataset
ImageMultimodalText

VideoThinkBench

CVPR 2026 Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm 🎊 News 2026.02 🔥🔥Our work…

1K–10K·MIT·Parquet
ImageMultimodalText

ChartVerse-SFT-1.8M

ChartVerse-SFT-1800K is an extended large-scale chart reasoning dataset with Chain-of-Thought (CoT) annotations, developed as part of the…

1M–10M·Apache-2.0·Parquet
ImageMultimodalText

MMBench-ru

MMBench-ru This is a translated version of original MMBench dataset and stored in format supported for lmms-eval pipeline.…

1K–10K·Apache-2.0·Parquet
ImageMultimodalTabular

SLAKE

Dataset Info: SLAKE: A Semantically-Labeled Knowledge-Enhanced Dataset for Medical Visual Question Answering ISBI 2021 oral Project Page: click…

10K–100K·CC-BY·JSON
ImageMultimodalText

ship-dataset

ShipBench: A Drawing-Grounded VLM Benchmark for Ship Structural Reasoning ShipBench is a metadata-grounded vision-language benchmark on…

10K–100K·CC-BY·JSON
ImageMultimodalText

Obshazard-bench

ObsCrisis-Bench A multimodal benchmark for evaluating large vision-language models on extreme weather event analysis tasks. Dataset Description…

<1K·MIT
Advertisement