Skip to content
Advertisement

Image Text To Text

58 results

ImageMultimodalText

Vero-600k

Vero-600k Vero is a fully open reinforcement learning (RL) recipe for training and evaluating multi-task visual reasoning with…

100K–1M·Apache-2.0·Parquet
Image

FinErva

🌌 FinErva: Interpretable Multimodal Reasoning for Robo-Advisory A dataset & lightweight training framework that teaches small models to…

1K–10K·Apache-2.0·Images (folder)
ImageMultimodalText

LLaVA-OneVision-2-Data

LLaVA-OneVision-2-Data Training data for the LLaVA-OneVision-2 multimodal model family, covering large-scale video and spatial reasoning corpora used…

<1K·Apache-2.0·Parquet
Advertisement