Visual Question Answering
339 results
SciReC: Diagnostic Evaluation of Relational Reasoning in Multimodal Scientific Conversations with Ad
SciReC: Diagnostic Evaluation of Relational Reasoning in Multimodal Scientific Conversations with Adaptive Interaction
MindCraft
MindCraft Benchmark for spatio-temporal reasoning during vision-and-language navigation, used with LASAR. Layout mindcraft/ 000001/ data.npz 1.mp4…
ANAKIN: manipulated videos and mask annotations
ANAKIN: manipulated videos and mask annotations
ViFailback-Dataset
ViFailback Dataset: Real-World Robotic Manipulation Failure Dataset with Visual Symbol Guidance A real-world dataset for diagnosing, correcting, and…
FUSION-Finetune-12M
FUSION-12M Dataset Please see paper & website for more information: Overview FUSION-12M is a large-scale, diverse multimodal instruction-tuning…
VideoKR-Train
VideoKR-Train 📄 ArXiv | 💻 Code | 🤗 Collection About This repository contains the VideoKR training data presented…
WorldMemArena
WorldMemArena WorldMemArena is a large-scale multimodal memory benchmark designed to evaluate how well AI systems retain, update, and…
Molmo2-SynMultiImageQA
Molmo2-SynMultiImageQA Molmo2-SynMultiImageQA is a collection of synthetic multi-image question-answer pairs about various kinds of text-rich images,…
MMFineReason-Full-2.3M-Qwen3-VL-235B-Thinking
MMFineReason-Full-2.3M The Complete Pre-Selection Dataset — Before Quality Filtering 📖 Overview MMFineReason-Full-2.3M is the complete pre-selection…
ULVR-filtered
ULVR-filtered Filtered subset of RuoliuYang/ULVR v2 clean: the 101,951 training samples that Qwen2.5-VL-7B-Instruct answered incorrectly given only…