Skip to content
Advertisement

Text

2,175 results

ImageMultimodalText

CharXiv

CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs NeurIPS 2024 🏠Home (🚧Still in construction) 🤗Data 🥇Leaderboard…

1K–10K·CC-BY-SA·Parquet
Text

OmniCorpus-CC

🐳 OmniCorpus: A Unified Multimodal Corpus of 10 Billion-Level Images Interleaved with Text ⭐️ NOTE: Several parquet files…

100M–1B·CC-BY·Parquet
ImageMultimodalText

MAmmoTH-VL-Instruct-12M

MAmmoTH-VL-Instruct-12M 🏠 Homepage 🤖 MAmmoTH-VL-8B 💻 Code 📄 Arxiv 📕 PDF 🖥️ Demo Introduction Our simple yet scalable…

10M–100M·Apache-2.0·WebDataset
ImageMultimodalText

Zebra-CoT

Zebra‑CoT A diverse large-scale dataset for interleaved vision‑language reasoning traces. Dataset Description Zebra‑CoT is a diverse large‑scale…

100K–1M·CC-BY-NC·Parquet
ImageMultimodalText

FUSION-Finetune-12M

FUSION-12M Dataset Please see paper & website for more information: Overview FUSION-12M is a large-scale, diverse multimodal instruction-tuning…

1K–10K·Apache-2.0·Parquet
Text

VideoKR-Train

VideoKR-Train 📄 ArXiv  |  💻 Code  |  🤗 Collection About This repository contains the VideoKR training data presented…

100K–1M·Apache-2.0·JSON
ImageMultimodalText

Molmo2-SynMultiImageQA

Molmo2-SynMultiImageQA Molmo2-SynMultiImageQA is a collection of synthetic multi-image question-answer pairs about various kinds of text-rich images,…

100K–1M·ODC-BY·Parquet
ImageMultimodalText

ULVR-filtered

ULVR-filtered Filtered subset of RuoliuYang/ULVR v2 clean: the 101,951 training samples that Qwen2.5-VL-7B-Instruct answered incorrectly given only…

100K–1M·Apache-2.0·Parquet
ImageMultimodalText

REVERSE

REVERSE Dataset Dataset for REVERSE (Reinforcing Evidence Verification and Search for Agentic Image Geolocation). This dataset supports training…

1M–10M·CC-BY·Parquet
ImageMultimodalText

GUIDE-dataset

GUIDE: Resolving Domain Bias in GUI Agents through Real-Time Web Video Retrieval and Plug-and-Play Annotation GUI Unbiasing via…

Apache-2.0
ImageMultimodalText

Kvasir-VQA-x1

Kvasir-VQA-x1 A Multimodal Dataset for Medical Reasoning and Robust MedVQA in Gastrointestinal Endoscopy Kvasir-VQA-x1 on GitHub Original Image…

100K–1M·CC-BY-NC·Parquet
Advertisement