Skip to content
Advertisement

Open

2,922 results

MultimodalTextVideo

UrbanVideo-Bench

ACL'25 Oral UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces This repository contains…

1K–10K·MIT·Parquet
Video

ViCA-322K

ViCA-322K: A Dataset for Visuospatial Cognition in Real-World Indoor Videos Quickstart You can load our dataset using the…

Image

VisuLogic

VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models A Challenging Visual-centric Benchmark for Evaluating…

1K–10K·Apache-2.0·Images (folder)
ImageMultimodalText

SDG-30K

SDG-30K — Structured Defect Grounding Dataset A 30,000-image dataset for structured defect grounding in text-to-image generations. Each image…

10K–100K·CC-BY-NC·JSON
ImageMultimodalText

GenEvolve-Data-Bench

GenEvolve Data and Bench This repository contains the open-source data release for GenEvolve: Config Directory Records Images Purpose…

10K–100K·Apache-2.0·Parquet
ImageMultimodalText

QCalEval

QCalEval Dataset Description The dataset contains scientific plots from quantum computing calibration experiments, paired with vision-language…

<1K·CC-BY·Parquet
Advertisement