Skip to content
Advertisement

Parquet

1,501 results

Text

HR-Bench

Divide, Conquer and Combine: A Training-Free Framework for High-Resolution Image Perception in Multimodal Large Language Models 🌐Homepage 📖…

1K–10K·Custom / Research-only·Parquet
ImageMultimodalText

ULVR_v2_clean

ULVR v2 clean Universal Latent Visual Reasoning training data, cleaned. 8 categories (subsets); each has train + validation…

1M–10M·Apache-2.0·Parquet
ImageMultimodalText

CharXiv

CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs NeurIPS 2024 🏠Home (🚧Still in construction) 🤗Data 🥇Leaderboard…

1K–10K·CC-BY-SA·Parquet
Text

OmniCorpus-CC

🐳 OmniCorpus: A Unified Multimodal Corpus of 10 Billion-Level Images Interleaved with Text ⭐️ NOTE: Several parquet files…

100M–1B·CC-BY·Parquet
ImageMultimodalText

Zebra-CoT

Zebra‑CoT A diverse large-scale dataset for interleaved vision‑language reasoning traces. Dataset Description Zebra‑CoT is a diverse large‑scale…

100K–1M·CC-BY-NC·Parquet
ImageMultimodalText

FUSION-Finetune-12M

FUSION-12M Dataset Please see paper & website for more information: Overview FUSION-12M is a large-scale, diverse multimodal instruction-tuning…

1K–10K·Apache-2.0·Parquet
ImageMultimodalText

Molmo2-SynMultiImageQA

Molmo2-SynMultiImageQA Molmo2-SynMultiImageQA is a collection of synthetic multi-image question-answer pairs about various kinds of text-rich images,…

100K–1M·ODC-BY·Parquet
ImageMultimodalText

ULVR-filtered

ULVR-filtered Filtered subset of RuoliuYang/ULVR v2 clean: the 101,951 training samples that Qwen2.5-VL-7B-Instruct answered incorrectly given only…

100K–1M·Apache-2.0·Parquet
ImageMultimodalText

REVERSE

REVERSE Dataset Dataset for REVERSE (Reinforcing Evidence Verification and Search for Agentic Image Geolocation). This dataset supports training…

1M–10M·CC-BY·Parquet
ImageMultimodalText

Kvasir-VQA-x1

Kvasir-VQA-x1 A Multimodal Dataset for Medical Reasoning and Robust MedVQA in Gastrointestinal Endoscopy Kvasir-VQA-x1 on GitHub Original Image…

100K–1M·CC-BY-NC·Parquet
ImageMultimodalText

ChartGalaxy

ChartGalaxy: A Dataset for Infographic Chart Understanding and Generation 🤗 Dataset 🖥️ Code 📄 Paper 🔥 News 2026.02…

1K–10K·CC-BY-NC·Parquet
ImageMultimodalText

Cauldron-JA

Dataset Card for The Cauldron-JA Dataset description The Cauldron-JA is a Vision Language Model dataset that translates 'The…

1M–10M·CC-BY·Parquet
ImageMultimodalText

MMMU_Pro

MMMU-Pro (A More Robust Multi-discipline Multimodal Understanding Benchmark) 🌐 Homepage 🏆 Leaderboard 🤗 Dataset 🤗 Paper 📖 arXiv…

1K–10K·Apache-2.0·Parquet
AudioMultimodalText

Irodori-Ja-Spk2-10k

SynDataLab/Irodori-Ja-Spk2-10k 10,000 single-speaker conversational Japanese utterances synthesized with Irodori-TTS-500M-v2. Part of a 4-speaker…

10K–100K·CC-BY-NC-SA·Parquet
Advertisement