aime_2025
AIME 2025 This dataset contains 30 problems from the 2025 AIME tests, including: AIME I: 15 problems AIME…
439 results
AIME 2025 This dataset contains 30 problems from the 2025 AIME tests, including: AIME I: 15 problems AIME…
Iris Species Dataset The Iris dataset was used in R.A. Fisher's classic 1936 paper, The Use of Multiple…
ResearchClawBench Evaluating AI Agents for Automated Research from Re-Discovery to New-Discovery Quick Start…
Description Dataset V1-2 v1-2 train.tar.gz and v1-2 val.tar.gz Data (train and val set) associated with ActivityNet release 1.2…
Indian Sign Language Dictionary (H265 Re-encoded)
PhyWorldBench This repository hosts the core assets of PhyWorldBench, the 1,050 JSON prompt files, the evaluation standards, and…
YCB-LUMA: YCB Object Dataset with Luminance Keying for Object Localization
Flat-Pack Bench Evals 🧪 This repository contains evaluation artifacts for Flat-Pack Bench, a CVPR 2026 benchmark for fine-grained…
PhyGround Project Page GitHub Paper PhyGround is a criteria-grounded benchmark for evaluating physical reasoning in video generation. The…
RoboCerebra VideoQA Benchmark This directory contains the Video Question Answering benchmark for evaluating RoboCerebra models on action progress…
RoboMemArena 数据集文件元信息以及数据文件,请浏览“数据集文件”页面获取。 当前数据集卡片使用的是默认模版,数据集的贡献者未提供更加详细的数据集介绍,但是您可以通过如下GIT Clone命令,或者ModelScope SDK来下载数据集 下载方法 Task Categories…
FakeParts: A New Family of AI-Generated DeepFakes Abstract We introduce FakeParts, a new class of deepfakes characterized by…
Suno AI Music Dataset — Multi-Genre Curated
AudioMarathon AudioMarathon is a long-context audio benchmark for evaluating multimodal LLMs on speech, music, environmental audio, and meetings.…