Skip to content
Advertisement
ImageMultimodalTabularText

AgentVQA

AgentVQA: A Multi-Domain Visual Question Answering Dataset AgentVQA is a comprehensive dataset for training and evaluating visual agents across…

AgentVQA: A Multi-Domain Visual Question Answering Dataset AgentVQA is a comprehensive dataset for training and evaluating visual agents across multiple domains, including GUI interaction, spatial reasoning, game understanding, robot manipulation, and video perception. The dataset contains multiple-choice questions based on screenshots, images, and videos. Dataset Structure The dataset is organized into five main domains: 1. Web Agents Domain (GUI Interaction)… See the full description on the dataset page:

Source: Hugging Face Hub (AgentVQA/AgentVQA). Metadata imported from the dataset’s Hub tags.

Advertisement