Skip to content
Advertisement

Datasets

1,204 results

AudioImageMultimodal

Unify-OmniBench

Unify-OmniBench 统一格式的多模态评测数据集,由 Unify-OmniBench 框架转换生成。 包含四个 benchmark,在 Dataset Viewer 右上角下拉框切换。 数据概览 Config (bench) 题目数 模态 媒体 daily omni ~1197…

1K–10K·Custom / Research-only·Parquet
ImageMultimodalText

MathVerse

Dataset Card for MathVerse Dataset Description Paper Information Dataset Examples Leaderboard Citation Dataset Description The capabilities of…

1K–10K·MIT·Parquet
ImageMultimodalText

HoloCount

HoloCount: A Holistic Visual Counting Benchmark for MLLMs Abstract Visual counting is a fundamental pillar of multimodal intelligence,…

1K–10K·CC-BY·Images (folder)
ImageMultimodalText

StepCountQA-SFT

StepCountQA-SFT StepCountQA-SFT is a multimodal supervised fine-tuning (SFT) dataset for visual object counting with step-by-step reasoning. Built…

1M–10M·ODC-BY·Parquet
ImageMultimodalText

ImgCode-8.6M

MathCoder-VL: Bridging Vision and Code for Enhanced Multimodal Mathematical Reasoning Repo: Paper: Introduction We introduce MathCoder-VL, a series…

1M–10M·Apache-2.0·Parquet
Image

causalphys

Causal-VL Dataset Causal reasoning VQA dataset with 4 categories × 4 subcategories (3062 questions). Structure Each subcategory contains:…

<1K·Apache-2.0·Images (folder)
ImageMultimodalText

MathCanvas-Bench

MathCanvas-Bench 🚀 Data Usage from datasets import load dataset dataset = load dataset("shiwk24/MathCanvas-Bench") print(dataset) 📖 Introduction…

1K–10K·Apache-2.0·Parquet
Image

C3B

English 简体中文 C³B: Comics Cross-Cultural Benchmark Culture In a Frame: C³B as a Comic-Based Benchmark for Multimodal Cultural…

1K–10K·CC-BY·Images (folder)
ImageMultimodalText

STRIDE-QA-Dataset

STRIDE-QA Dataset 📦 Dataset STRIDE-QA is a large-scale visual question answering (VQA) dataset for physically grounded spatiotemporal reasoning…

100K–1M·WebDataset
Advertisement