V1-33K-Old
V1: Toward Multimodal Reasoning by Designing Auxiliary Tasks 🚀 Toward Multimodal Reasoning via Unsupervised Task -- Future Prediction…
748 results
V1: Toward Multimodal Reasoning by Designing Auxiliary Tasks 🚀 Toward Multimodal Reasoning via Unsupervised Task -- Future Prediction…
Dataset Card for VLFeedback Homepage: Repository: Paper: Dataset Summary VLFeedback is a large-scale vision-language preference dataset, annotated by…
AgentVQA: A Multi-Domain Visual Question Answering Dataset AgentVQA is a comprehensive dataset for training and evaluating visual agents…
BoundingDocs 🔍 The largest spatially-annotated dataset for Document Question Answering Dataset Description BoundingDocs is a unified dataset for…
M3CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought
SDG-30K — Structured Defect Grounding Dataset A 30,000-image dataset for structured defect grounding in text-to-image generations. Each image…
GenEvolve Data and Bench This repository contains the open-source data release for GenEvolve: Config Directory Records Images Purpose…
DCVLM-Baseline (200B tokens)
PhyX: Does Your Model Have the "Wits" for Physical Reasoning? Dataset for the paper "PhyX: Does Your Model…
Dataset Card for OpenDocVQA This is a training and evaluation QA data file for VDocRAG, a new RAG…
Molmo2 PointArena SFT Data (LAION + Molmo-7B-D)
MVTamperBench Dataset Overview MVTamperBenchEnd is a robust benchmark designed to evaluate Vision-Language Models (VLMs) against adversarial video…