Skip to content
Advertisement

100K–1M

595 results

ImageMultimodalText

FineBench

Dataset Card for FineBench FineBench is a large-scale, multiple-choice Video Question Answering (VQA) dataset designed specifically to evaluate…

100K–1M·MIT·JSON
ImageMultimodalText

llava-en-zh-300k

This dataset is composed by 150k examples of English Visual Instruction Data from LLaVA. 150k examples of English…

100K–1M·Apache-2.0·Parquet
ImageMultimodalText

pixmo-docs

PixMo-Docs We now recommend using CoSyn-400k and CoSyn-point over these datasets. They are improved versions with more images…

100K–1M·ODC-BY·Parquet
Text

synthvision-validated-qwen-by-kimi

synthvision-validated-qwen-by-kimi Qwen 3.5 annotations validated by Kimi K2.5 (93.1% pass rate) Records: 55,359 About Cross-validated subset from…

100K–1M·Apache-2.0·Parquet
ImageMultimodalText

ChartVerse-SFT-600K

ChartVerse-SFT-600K is a large-scale, high-quality chart reasoning dataset with Chain-of-Thought (CoT) annotations, developed as part of the…

100K–1M·Apache-2.0·Parquet
MultimodalTextVideo

LongVALE

Dataset Card for LongVALE Uses This dataset is designed for training and evaluating models on omni-modal (vision-audio-language-event) fine-grained…

100K–1M·CC-BY-NC-SA·Parquet
ImageMultimodalText

finevision-sample

FineVision Sample Dataset A comprehensive multimodal dataset containing samples across multiple categories, designed for visual question answering…

100K–1M·MIT·Parquet
ImageMultimodalText

STRIDE-QA-Dataset

STRIDE-QA Dataset 📦 Dataset STRIDE-QA is a large-scale visual question answering (VQA) dataset for physically grounded spatiotemporal reasoning…

100K–1M·WebDataset
Advertisement