Open X-Embodiment
1M+ real-robot trajectories from 20+ institutions.
VisToolBench Dataset A benchmark dataset for evaluating vision-language models on tool-use tasks. Dataset Statistics Total samples: 1204 Single-turn: 603 Multi-turn: 601 Schema Column Type Description id string Unique task identifier turncase string Either “single-turn” or “multi-turn” num turns int Number of conversation turns (1 for single-turn) prompt category string Task category (e.g., “medical”, “scientific”, “general”) eval focus… See the full description on the dataset page:
Source: Hugging Face Hub (ScaleAI/VisualToolBench). Metadata imported from the dataset’s Hub tags.