Image-to-Text
122 results
finevision-sample
FineVision Sample Dataset A comprehensive multimodal dataset containing samples across multiple categories, designed for visual question answering…
ImgCode-8.6M
MathCoder-VL: Bridging Vision and Code for Enhanced Multimodal Mathematical Reasoning Repo: Paper: Introduction We introduce MathCoder-VL, a series…
Viva Mais Synthetic PT-BR Travel Document Vision Dataset
Viva Mais Synthetic PT-BR Travel Document Vision Dataset
pixelrag-tiles
PixelRAG tile corpus Rendered screenshot tiles for PixelRAG, a visual retrieval-augmented-generation system that retrieves over page images instead…
VLM-SubtleBench
VLM-SubtleBench VLM-SubtleBench: How Far Are VLMs from Human-Level Subtle Comparative Reasoning? The ability to distinguish subtle differences…
OmniCorpus-CC
🐳 OmniCorpus: A Unified Multimodal Corpus of 10 Billion-Level Images Interleaved with Text ⭐️ NOTE: Several parquet files…
emova-alignment-7m
EMOVA-Alignment-7M 🤗 EMOVA-Models 🤗 EMOVA-Datasets 🤗 EMOVA-Demo 📄 Paper 🌐 Project-Page 💻 Github 💻 EMOVA-Speech-Tokenizer-Github Overview…
emova-sft-4m
EMOVA-SFT-4M 🤗 EMOVA-Models 🤗 EMOVA-Datasets 🤗 EMOVA-Demo 📄 Paper 🌐 Project-Page 💻 Github 💻 EMOVA-Speech-Tokenizer-Github Overview EMOVA-SFT-4M is…