Robo2VLM-1
Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets Abstract Vision-Language Models (VLMs) acquire…
807 results
Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets Abstract Vision-Language Models (VLMs) acquire…
VBVR-Dataset: Very Big Video Reasoning Training Data
ULVR v2 clean Universal Latent Visual Reasoning training data, cleaned. 8 categories (subsets); each has train + validation…
MAmmoTH-VL-Instruct-12M 🏠 Homepage 🤖 MAmmoTH-VL-8B 💻 Code 📄 Arxiv 📕 PDF 🖥️ Demo Introduction Our simple yet scalable…
MindCraft Benchmark for spatio-temporal reasoning during vision-and-language navigation, used with LASAR. Layout mindcraft/ 000001/ data.npz 1.mp4…
FUSION-12M Dataset Please see paper & website for more information: Overview FUSION-12M is a large-scale, diverse multimodal instruction-tuning…
VideoKR-Train 📄 ArXiv | 💻 Code | 🤗 Collection About This repository contains the VideoKR training data presented…
MMFineReason-Full-2.3M The Complete Pre-Selection Dataset — Before Quality Filtering 📖 Overview MMFineReason-Full-2.3M is the complete pre-selection…
ULVR-filtered Filtered subset of RuoliuYang/ULVR v2 clean: the 101,951 training samples that Qwen2.5-VL-7B-Instruct answered incorrectly given only…
GUIDE: Resolving Domain Bias in GUI Agents through Real-Time Web Video Retrieval and Plug-and-Play Annotation GUI Unbiasing via…
Cambrian Vision-Centric Benchmark (CV-Bench)
Banana-Merged: Multi-page VQA with Hard Negatives
MMMU-Pro (A More Robust Multi-discipline Multimodal Understanding Benchmark) 🌐 Homepage 🏆 Leaderboard 🤗 Dataset 🤗 Paper 📖 arXiv…
Irodori TTS Reference Voices v2 (10K) 10,000 reference voices generated with Aratako/Irodori-TTS-500M-v2-VoiceDesign (no ref=True) using a richer…