Image Text To Text
58 results
ImageMultimodalText
Vero-600k
Vero-600k Vero is a fully open reinforcement learning (RL) recipe for training and evaluating multi-task visual reasoning with…
100K–1M·Apache-2.0·Parquet
ImageMultimodalText
Innovator-VL-Instruct-46M
Innovator-VL-Instruct-46M Paper Code 🤗🤗 The data is being uploaded continuously Introduction To further enhance the model’s ability to…
10M–100M·MIT·Parquet
ImageMultimodalText
personalized visual instruction tuning
personalized visual instruction tuning
1M–10M·Apache-2.0·JSON
ImageMultimodalText
LLaVA-OneVision-1.5-Instruct-Data
LLaVA-OneVision-1.5 Instruction Data Paper Code 📌 Introduction This dataset, LLaVA-OneVision-1.5-Instruct, was collected and integrated during the…
10M–100M·Apache-2.0
ImageMultimodalText
LLaVA-OneVision-2-Data
LLaVA-OneVision-2-Data Training data for the LLaVA-OneVision-2 multimodal model family, covering large-scale video and spatial reasoning corpora used…
<1K·Apache-2.0·Parquet