Skip to content
Advertisement

Multimodal

2,368 results

MultimodalTabularText

fineweb-edu-fortified

Fineweb-Edu-Fortified The composition of fineweb-edu-fortified, produced by automatically clustering a 500k row sample in Airtrain What is it?…

100M–1B·ODC-BY·Parquet
MultimodalTabularText

FineFineWeb

FineFineWeb: A Comprehensive Study on Fine-Grained Domain Web Corpus arXiv: Coming Soon Project Page: Coming Soon Blog: Coming…

>1B·Apache-2.0
ImageMultimodalText

COCO-Caption

Large-scale Multi-modality Models Evaluation Suite Accelerating the development of large-scale multi-modality models (LMMs) with lmms-eval 🏠 Homepage…

10K–100K·Parquet
ImageMultimodalText

Imagenet21K

NOTE: I have recaptioned all images here This dataset is the entire 21K ImageNet dataset with about 13…

10M–100M·Parquet
ImageMultimodalTabular

FIP1

The FIP 1.0 Data Set: Highly Resolved Annotated Image Time Series of 4,000 Wheat Plots Grown in Six…

1K–10K·CC-BY·Parquet
ImageMultimodalVideo

GOKU-2M

Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing GOKU-2M is a large-scale, unified instruction-based…

1M–10M·CC-BY-NC
ImageMultimodalText

ai2d

@misc{kembhavi2016diagram, title={A Diagram Is Worth A Dozen Images}, author={Aniruddha Kembhavi and Mike Salvato and Eric Kolve and Minjoon…

1K–10K·Parquet
ImageMultimodalText

Vero-600k

Vero-600k Vero is a fully open reinforcement learning (RL) recipe for training and evaluating multi-task visual reasoning with…

100K–1M·Apache-2.0·Parquet
ImageMultimodalText

BLINK

BLINK: Multimodal Large Language Models Can See but Not Perceive 🌐 Homepage 💻 Code 📖 Paper 📖 arXiv…

1K–10K·Apache-2.0·Parquet
Advertisement