Skip to content
Advertisement

Datasets

2,147 results

ImageMultimodalText

GQA-ru

GQA-ru This is a translated version of original GQA dataset and stored in format supported for lmms-eval pipeline.…

10K–100K·Apache-2.0·Parquet
MultimodalTextVideo

V1-33K-Old

V1: Toward Multimodal Reasoning by Designing Auxiliary Tasks 🚀 Toward Multimodal Reasoning via Unsupervised Task -- Future Prediction…

10K–100K·Apache-2.0·JSON
ImageMultimodalText

VLFeedback

Dataset Card for VLFeedback Homepage: Repository: Paper: Dataset Summary VLFeedback is a large-scale vision-language preference dataset, annotated by…

10K–100K·Parquet
ImageMultimodalTabular

AgentVQA

AgentVQA: A Multi-Domain Visual Question Answering Dataset AgentVQA is a comprehensive dataset for training and evaluating visual agents…

10K–100K·MIT
ImageMultimodalText

BoundingDocs

BoundingDocs 🔍 The largest spatially-annotated dataset for Document Question Answering Dataset Description BoundingDocs is a unified dataset for…

10K–100K·CC-BY·Parquet
ImageMultimodalText

S1-MMAlign

S1-MMAlign A Large-Scale Multi-Disciplinary Scientific Multimodal Dataset S1-MMAlign is a large-scale, multi-disciplinary multimodal dataset…

10M–100M·CC-BY-NC·WebDataset
Advertisement