Skip to content
Advertisement
ImageMultimodalText

VisualToolBench

VisualToolBench

VisToolBench Dataset A benchmark dataset for evaluating vision-language models on tool-use tasks. Dataset Statistics Total samples: 1204 Single-turn: 603 Multi-turn: 601 Schema Column Type Description id string Unique task identifier turncase string Either “single-turn” or “multi-turn” num turns int Number of conversation turns (1 for single-turn) prompt category string Task category (e.g., “medical”, “scientific”, “general”) eval focus… See the full description on the dataset page:

Source: Hugging Face Hub (ScaleAI/VisualToolBench). Metadata imported from the dataset’s Hub tags.

Advertisement