Skip to content
Advertisement

Parquet

1,501 results

ImageMultimodalText

MathCanvas-Bench

MathCanvas-Bench 🚀 Data Usage from datasets import load dataset dataset = load dataset("shiwk24/MathCanvas-Bench") print(dataset) 📖 Introduction…

1K–10K·Apache-2.0·Parquet
ImageMultimodalText

VideoThinkBench

CVPR 2026 Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm 🎊 News 2026.02 🔥🔥Our work…

1K–10K·MIT·Parquet
ImageMultimodalText

ChartVerse-SFT-1.8M

ChartVerse-SFT-1800K is an extended large-scale chart reasoning dataset with Chain-of-Thought (CoT) annotations, developed as part of the…

1M–10M·Apache-2.0·Parquet
ImageMultimodalText

MMBench-ru

MMBench-ru This is a translated version of original MMBench dataset and stored in format supported for lmms-eval pipeline.…

1K–10K·Apache-2.0·Parquet
ImageMultimodalText

CoSyn-400K

CoSyn-400k CoSyn-400k is a collection of synthetic question-answer pairs about very diverse range of computer-generated images. The data…

100K–1M·ODC-BY·Parquet
MultimodalTextVideo

UrbanVideo-Bench

ACL'25 Oral UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces This repository contains…

1K–10K·MIT·Parquet
MultimodalTextVideo

heico-focus-vqa

HeiCo-FOCUS (Beta release) A clinically grounded dataset for long-context video understanding in minimally invasive surgery. 📄 Paper  • …

10K–100K·CC-BY-NC-SA·Parquet
ImageMultimodalText

EO-Data1.5M

🤖 EO-Data-1.5M A Large-Scale Interleaved Vision-Text-Action Dataset for Embodied AI The first large-scale interleaved embodied dataset emphasizing…

1M–10M·Apache-2.0·Parquet
ImageMultimodalText

Robo2VLM-1

Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets Abstract Vision-Language Models (VLMs) acquire…

100K–1M·Apache-2.0·Parquet
Advertisement