Skip to content
Advertisement

Open

2,922 results

ImageMultimodalText

MathCanvas-Bench

MathCanvas-Bench 🚀 Data Usage from datasets import load dataset dataset = load dataset("shiwk24/MathCanvas-Bench") print(dataset) 📖 Introduction…

1K–10K·Apache-2.0·Parquet
Image

C3B

English 简体中文 C³B: Comics Cross-Cultural Benchmark Culture In a Frame: C³B as a Comic-Based Benchmark for Multimodal Cultural…

1K–10K·CC-BY·Images (folder)
ImageMultimodalText

STRIDE-QA-Dataset

STRIDE-QA Dataset 📦 Dataset STRIDE-QA is a large-scale visual question answering (VQA) dataset for physically grounded spatiotemporal reasoning…

100K–1M·WebDataset
MultimodalTextVideo

Vript_Chinese

🎬 Vript: Refine Video Captioning into Video Scripting Github Repo We construct a fine-grained video-text dataset with 44.7K…

100K–1M·JSON
ImageMultimodalText

VideoThinkBench

CVPR 2026 Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm 🎊 News 2026.02 🔥🔥Our work…

1K–10K·MIT·Parquet
ImageMultimodalText

ChartVerse-SFT-1.8M

ChartVerse-SFT-1800K is an extended large-scale chart reasoning dataset with Chain-of-Thought (CoT) annotations, developed as part of the…

1M–10M·Apache-2.0·Parquet
ImageMultimodalText

MMBench-ru

MMBench-ru This is a translated version of original MMBench dataset and stored in format supported for lmms-eval pipeline.…

1K–10K·Apache-2.0·Parquet
Text

pixelrag-tiles

PixelRAG tile corpus Rendered screenshot tiles for PixelRAG, a visual retrieval-augmented-generation system that retrieves over page images instead…

>1B·CC-BY-SA
Advertisement