Skip to content
Advertisement

Datasets

3,216 results

ImageMultimodalTabular

FIP1

The FIP 1.0 Data Set: Highly Resolved Annotated Image Time Series of 4,000 Wheat Plots Grown in Six…

1K–10K·CC-BY·Parquet
ImageMultimodalVideo

GOKU-2M

Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing GOKU-2M is a large-scale, unified instruction-based…

1M–10M·CC-BY-NC
ImageMultimodalText

ai2d

@misc{kembhavi2016diagram, title={A Diagram Is Worth A Dozen Images}, author={Aniruddha Kembhavi and Mike Salvato and Eric Kolve and Minjoon…

1K–10K·Parquet
ImageMultimodalText

Vero-600k

Vero-600k Vero is a fully open reinforcement learning (RL) recipe for training and evaluating multi-task visual reasoning with…

100K–1M·Apache-2.0·Parquet
Image

SAR2Opt

Dataset Card for SAR2Opt A collection of 600x600 SAR/EO image pairs at a spatial resolution of 1m. Dataset…

1K–10K·MIT·Images (folder)
Image

game_character_skins

Game Character Skins Dataset Summary This comprehensive dataset contains game character skins and artwork from multiple popular mobile…

1K–10K·CC-BY
ImageMultimodalText

BLINK

BLINK: Multimodal Large Language Models Can See but Not Perceive 🌐 Homepage 💻 Code 📖 Paper 📖 arXiv…

1K–10K·Apache-2.0·Parquet
ImageMultimodalTabular

Recap-DataComp-1B

Dataset Card for Recap-DataComp-1B Recap-DataComp-1B is a large-scale image-text dataset that has been recaptioned using an advanced…

>1B·CC-BY·Parquet
ImageMultimodalText

megalith-mdqa

Images from Megalith, synthetically captioned using Moondream, with the questions then transformed to short-form QA using an LLM.

1M–10M·OpenRAIL·Parquet
Image

Holo360D

ECCV 2026 Holo360D: A Large-Scale Real-World Dataset with Continuous Trajectories for Advancing Panoramic 3D Reconstruction and Beyond 🎉…

100K–1M·Images (folder)
ImageMultimodalText

FLUX-Reason-6M

FLUX-Reason-6M FLUX-Reason-6M is a massive, 6-million-scale text-to-image dataset engineered to instill complex reasoning capabilities in generative…

1M–10M·Apache-2.0·Parquet
ImageMultimodalText

GSA_volc

GSA volc - GSA Embodied Perception Training Dataset Large-scale Grounding-Spatial-Affordance (GSA) training data for embodied perception Teacher…

1M–10M·Apache-2.0·JSON
Advertisement