100K–1M
595 results
OpenSakura Eve LN Aligned Dataset
OpenSakura Eve LN Aligned Dataset
Multilingual TEDx (mTEDx) — SLR100
Multilingual TEDx (mTEDx) — SLR100
PlantInquiryVQA — Thinking Like a Botanist
PlantInquiryVQA — Thinking Like a Botanist
FineBench
Dataset Card for FineBench FineBench is a large-scale, multiple-choice Video Question Answering (VQA) dataset designed specifically to evaluate…
llava-en-zh-300k
This dataset is composed by 150k examples of English Visual Instruction Data from LLaVA. 150k examples of English…
pixmo-docs
PixMo-Docs We now recommend using CoSyn-400k and CoSyn-point over these datasets. They are improved versions with more images…
Nornikel Metallurgy VL Dataset
Nornikel Metallurgy VL Dataset
synthvision-validated-qwen-by-kimi
synthvision-validated-qwen-by-kimi Qwen 3.5 annotations validated by Kimi K2.5 (93.1% pass rate) Records: 55,359 About Cross-validated subset from…
ChartVerse-SFT-600K
ChartVerse-SFT-600K is a large-scale, high-quality chart reasoning dataset with Chain-of-Thought (CoT) annotations, developed as part of the…
LongVALE
Dataset Card for LongVALE Uses This dataset is designed for training and evaluating models on omni-modal (vision-audio-language-event) fine-grained…
OpenDocVQA-Corpus
Dataset Card for OpenDocVQA This is a training and evaluation corpus data file for VDocRAG, a new RAG…
finevision-sample
FineVision Sample Dataset A comprehensive multimodal dataset containing samples across multiple categories, designed for visual question answering…
STRIDE-QA-Dataset
STRIDE-QA Dataset 📦 Dataset STRIDE-QA is a large-scale visual question answering (VQA) dataset for physically grounded spatiotemporal reasoning…