Datasets
1,204 results
EO-Data1.5M
🤖 EO-Data-1.5M A Large-Scale Interleaved Vision-Text-Action Dataset for Embodied AI The first large-scale interleaved embodied dataset emphasizing…
VLM-SubtleBench
VLM-SubtleBench VLM-SubtleBench: How Far Are VLMs from Human-Level Subtle Comparative Reasoning? The ability to distinguish subtle differences…
Robo2VLM-1
Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets Abstract Vision-Language Models (VLMs) acquire…
ULVR_v2_clean
ULVR v2 clean Universal Latent Visual Reasoning training data, cleaned. 8 categories (subsets); each has train + validation…
CharXiv
CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs NeurIPS 2024 🏠Home (🚧Still in construction) 🤗Data 🥇Leaderboard…
MAmmoTH-VL-Instruct-12M
MAmmoTH-VL-Instruct-12M 🏠 Homepage 🤖 MAmmoTH-VL-8B 💻 Code 📄 Arxiv 📕 PDF 🖥️ Demo Introduction Our simple yet scalable…
Zebra-CoT
Zebra‑CoT A diverse large-scale dataset for interleaved vision‑language reasoning traces. Dataset Description Zebra‑CoT is a diverse large‑scale…
SynthUX Visual Computer-Use Trajectories
SynthUX Visual Computer-Use Trajectories
SciReC: Diagnostic Evaluation of Relational Reasoning in Multimodal Scientific Conversations with Ad
SciReC: Diagnostic Evaluation of Relational Reasoning in Multimodal Scientific Conversations with Adaptive Interaction
MindCraft
MindCraft Benchmark for spatio-temporal reasoning during vision-and-language navigation, used with LASAR. Layout mindcraft/ 000001/ data.npz 1.mp4…
ANAKIN: manipulated videos and mask annotations
ANAKIN: manipulated videos and mask annotations
ViFailback-Dataset
ViFailback Dataset: Real-World Robotic Manipulation Failure Dataset with Visual Symbol Guidance A real-world dataset for diagnosing, correcting, and…