Image Text To Text
58 results
MMFineReason-1.8M-Qwen3-VL-235B-Thinking
MMFineReason Closing the Multimodal Reasoning Gap via Open Data-Centric Methods Average score across mathematical reasoning and multimodal…
ImgCode-8.6M
MathCoder-VL: Bridging Vision and Code for Enhanced Multimodal Mathematical Reasoning Repo: Paper: Introduction We introduce MathCoder-VL, a series…
MathCanvas-Bench
MathCanvas-Bench 🚀 Data Usage from datasets import load dataset dataset = load dataset("shiwk24/MathCanvas-Bench") print(dataset) 📖 Introduction…
ChartVerse-SFT-1.8M
ChartVerse-SFT-1800K is an extended large-scale chart reasoning dataset with Chain-of-Thought (CoT) annotations, developed as part of the…
EO-Data1.5M
🤖 EO-Data-1.5M A Large-Scale Interleaved Vision-Text-Action Dataset for Embodied AI The first large-scale interleaved embodied dataset emphasizing…
Zebra-CoT
Zebra‑CoT A diverse large-scale dataset for interleaved vision‑language reasoning traces. Dataset Description Zebra‑CoT is a diverse large‑scale…
Kvasir-VQA-x1
Kvasir-VQA-x1 A Multimodal Dataset for Medical Reasoning and Robust MedVQA in Gastrointestinal Endoscopy Kvasir-VQA-x1 on GitHub Original Image…
CoLT_Train_Dataset
CoLT Training Data This repository contains the training data for CoLT, a latent reasoning model without relying on…
GRAID NuImages Question-Answer Dataset
GRAID NuImages Question-Answer Dataset
GRAID BDD100K Question-Answer Dataset
GRAID BDD100K Question-Answer Dataset
motor-nameplate
Motor Nameplate A small image dataset of electric motor nameplates collected from public Google Images results, intended for…
OneThinker-eval
This repository contains the evaluation data presented in: OneThinker: All-in-one Reasoning Model for Image and Video Code: About…
Neuro Evolution for eXtensible Universal Semantics Dataset
Neuro Evolution for eXtensible Universal Semantics Dataset
H&M Personalized Fashion Recommendations
H&M Personalized Fashion Recommendations
Open-Qwen2VL-Data
Introduction This repository contains the data for Open-Qwen2VL: Compute-Efficient Pre-Training of Fully-Open Multimodal LLMs on Academic Resources.…