Open X-Embodiment
1M+ real-robot trajectories from 20+ institutions.
AgentVQA: A Multi-Domain Visual Question Answering Dataset AgentVQA is a comprehensive dataset for training and evaluating visual agents across…
AgentVQA: A Multi-Domain Visual Question Answering Dataset AgentVQA is a comprehensive dataset for training and evaluating visual agents across multiple domains, including GUI interaction, spatial reasoning, game understanding, robot manipulation, and video perception. The dataset contains multiple-choice questions based on screenshots, images, and videos. Dataset Structure The dataset is organized into five main domains: 1. Web Agents Domain (GUI Interaction)… See the full description on the dataset page:
Source: Hugging Face Hub (AgentVQA/AgentVQA). Metadata imported from the dataset’s Hub tags.