Question Answering
190 results
MMMU_Pro
MMMU-Pro (A More Robust Multi-discipline Multimodal Understanding Benchmark) 🌐 Homepage 🏆 Leaderboard 🤗 Dataset 🤗 Paper 📖 arXiv…
C3T
C3T: Cross-modal Capabilities Conservation Test Dataset Description C3T (Cross-modal Capabilities Conservation Test) is a benchmark for assessing the…
NautData
NautData Paper Project Page Code NautData is a large-scale underwater instruction-following dataset containing 1.45 million image-text pairs. It…
S-Chain
S-Chain: Structured Visual Chain-of-Thought for Medicine ⭐ If you find this project helpful, please consider giving it a…
Creative Professionals Agentic Tasks (1M)
Creative Professionals Agentic Tasks (1M)
Creative Professionals Agentic Tasks (1M)
Creative Professionals Agentic Tasks (1M)
Edge Agent Reasoning WebSearch 260K
Edge Agent Reasoning WebSearch 260K
Edge Agent Reasoning WebSearch 260K
Edge Agent Reasoning WebSearch 260K
Edge Agent Reasoning WebSearch 260K
Edge Agent Reasoning WebSearch 260K
Edge Agent Reasoning WebSearch 260K
Edge Agent Reasoning WebSearch 260K
BenchCAD
BenchCAD Three-config dataset for CAD evaluation: edit-bench — held-out CAD edit benchmark. code gen — 17,900 synthetic CadQuery…
Edge Agent Reasoning WebSearch 260K
Edge Agent Reasoning WebSearch 260K
Edge Agent Reasoning WebSearch 260K
Edge Agent Reasoning WebSearch 260K
Edge Agent Reasoning WebSearch 260K
Edge Agent Reasoning WebSearch 260K
Creative Professionals Agentic Tasks (1M)
Creative Professionals Agentic Tasks (1M)
Mesh2QA ScanNet 3D Question Answering
Mesh2QA ScanNet 3D Question Answering
medicine-tasks
Adapting LLMs to Domains via Continual Pre-Training (ICLR 2024) This repo contains the evaluation datasets for our paper…
reward-bench-2
Code Leaderboard Results Paper RewardBench 2 Evaluation Dataset Card The RewardBench 2 evaluation dataset is the new version…