Skip to content
Advertisement

10K–100K

748 results

MultimodalTextVideo

V1-33K-Old

V1: Toward Multimodal Reasoning by Designing Auxiliary Tasks 🚀 Toward Multimodal Reasoning via Unsupervised Task -- Future Prediction…

10K–100K·Apache-2.0·JSON
ImageMultimodalText

VLFeedback

Dataset Card for VLFeedback Homepage: Repository: Paper: Dataset Summary VLFeedback is a large-scale vision-language preference dataset, annotated by…

10K–100K·Parquet
ImageMultimodalTabular

AgentVQA

AgentVQA: A Multi-Domain Visual Question Answering Dataset AgentVQA is a comprehensive dataset for training and evaluating visual agents…

10K–100K·MIT
ImageMultimodalText

BoundingDocs

BoundingDocs 🔍 The largest spatially-annotated dataset for Document Question Answering Dataset Description BoundingDocs is a unified dataset for…

10K–100K·CC-BY·Parquet
ImageMultimodalText

SDG-30K

SDG-30K — Structured Defect Grounding Dataset A 30,000-image dataset for structured defect grounding in text-to-image generations. Each image…

10K–100K·CC-BY-NC·JSON
ImageMultimodalText

GenEvolve-Data-Bench

GenEvolve Data and Bench This repository contains the open-source data release for GenEvolve: Config Directory Records Images Purpose…

10K–100K·Apache-2.0·Parquet
ImageMultimodalText

PhyX

PhyX: Does Your Model Have the "Wits" for Physical Reasoning? Dataset for the paper "PhyX: Does Your Model…

10K–100K·MIT·Parquet
Text

OpenDocVQA

Dataset Card for OpenDocVQA This is a training and evaluation QA data file for VDocRAG, a new RAG…

10K–100K·Parquet
Image

PanoEnv

CVPR 2026 Highlight - PanoEnv-QA: A Large-Scale Geometry-Grounded Panoramic VQA Benchmark for 3D Spatial Intelligence 📖 Overview PanoEnv-QA…

10K–100K·CC-BY·Images (folder)
MultimodalTabularText

MVTamperBenchEnd

MVTamperBench Dataset Overview MVTamperBenchEnd is a robust benchmark designed to evaluate Vision-Language Models (VLMs) against adversarial video…

10K–100K·MIT·JSON
Advertisement