Skip to content
Advertisement

Image-to-Text

122 results

Text

MapTrace

MapTrace: A 2M-Sample Synthetic Dataset for Path Tracing on Maps Welcome to the MapTrace dataset! If you use…

10K–100K·CC-BY·Parquet
ImageMultimodalText

finevision-sample

FineVision Sample Dataset A comprehensive multimodal dataset containing samples across multiple categories, designed for visual question answering…

100K–1M·MIT·Parquet
ImageMultimodalText

ImgCode-8.6M

MathCoder-VL: Bridging Vision and Code for Enhanced Multimodal Mathematical Reasoning Repo: Paper: Introduction We introduce MathCoder-VL, a series…

1M–10M·Apache-2.0·Parquet
Text

pixelrag-tiles

PixelRAG tile corpus Rendered screenshot tiles for PixelRAG, a visual retrieval-augmented-generation system that retrieves over page images instead…

>1B·CC-BY-SA
Image

VLM-SubtleBench

VLM-SubtleBench VLM-SubtleBench: How Far Are VLMs from Human-Level Subtle Comparative Reasoning? The ability to distinguish subtle differences…

10K–100K·CC-BY-NC
Text

OmniCorpus-CC

🐳 OmniCorpus: A Unified Multimodal Corpus of 10 Billion-Level Images Interleaved with Text ⭐️ NOTE: Several parquet files…

100M–1B·CC-BY·Parquet
ImageMultimodalText

emova-alignment-7m

EMOVA-Alignment-7M 🤗 EMOVA-Models 🤗 EMOVA-Datasets 🤗 EMOVA-Demo 📄 Paper 🌐 Project-Page 💻 Github 💻 EMOVA-Speech-Tokenizer-Github Overview…

1M–10M·Apache-2.0·Parquet
ImageMultimodalText

emova-sft-4m

EMOVA-SFT-4M 🤗 EMOVA-Models 🤗 EMOVA-Datasets 🤗 EMOVA-Demo 📄 Paper 🌐 Project-Page 💻 Github 💻 EMOVA-Speech-Tokenizer-Github Overview EMOVA-SFT-4M is…

1M–10M·Apache-2.0·Parquet
Advertisement