Open X-Embodiment
1M+ real-robot trajectories from 20+ institutions.
VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge 🏠Homepage 📊 VisualPuzzles 💻 Github 📄 Arxiv 📕 PDF 🖥️ Zeno Model Output Overview VisualPuzzles is a multimodal benchmark specifically designed to evaluate reasoning abilitiesin large models while deliberately minimizing reliance on domain-specific knowledge. Key features: 1168 diverse puzzles 5 reasoning categories: Algorithmic, Analogical, Deductive, Inductive, Spatial… See the full description on the dataset page:
Source: Hugging Face Hub (neulab/VisualPuzzles). Metadata imported from the dataset’s Hub tags.