Skip to content
Advertisement

Image

1,418 results

ImageMultimodalText

Kvasir-VQA-x1

Kvasir-VQA-x1 A Multimodal Dataset for Medical Reasoning and Robust MedVQA in Gastrointestinal Endoscopy Kvasir-VQA-x1 on GitHub Original Image…

100K–1M·CC-BY-NC·Parquet
ImageMultimodalText

ChartGalaxy

ChartGalaxy: A Dataset for Infographic Chart Understanding and Generation 🤗 Dataset 🖥️ Code 📄 Paper 🔥 News 2026.02…

1K–10K·CC-BY-NC·Parquet
ImageMultimodalText

RoboBench

RoboBench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain 📋 Overview RoboBench is a…

<1K·CC-BY
ImageMultimodalText

Cauldron-JA

Dataset Card for The Cauldron-JA Dataset description The Cauldron-JA is a Vision Language Model dataset that translates 'The…

1M–10M·CC-BY·Parquet
ImageMultimodalText

MMMU_Pro

MMMU-Pro (A More Robust Multi-discipline Multimodal Understanding Benchmark) 🌐 Homepage 🏆 Leaderboard 🤗 Dataset 🤗 Paper 📖 arXiv…

1K–10K·Apache-2.0·Parquet
ImageMultimodalText

emova-sft-speech-231k

EMOVA-SFT-Speech-231K 🤗 EMOVA-Models 🤗 EMOVA-Datasets 🤗 EMOVA-Demo 📄 Paper 🌐 Project-Page 💻 Github 💻 EMOVA-Speech-Tokenizer-Github Overview…

100K–1M·Apache-2.0·Parquet
ImageMultimodalText

emova-alignment-7m

EMOVA-Alignment-7M 🤗 EMOVA-Models 🤗 EMOVA-Datasets 🤗 EMOVA-Demo 📄 Paper 🌐 Project-Page 💻 Github 💻 EMOVA-Speech-Tokenizer-Github Overview…

1M–10M·Apache-2.0·Parquet
ImageMultimodalText

emova-sft-4m

EMOVA-SFT-4M 🤗 EMOVA-Models 🤗 EMOVA-Datasets 🤗 EMOVA-Demo 📄 Paper 🌐 Project-Page 💻 Github 💻 EMOVA-Speech-Tokenizer-Github Overview EMOVA-SFT-4M is…

1M–10M·Apache-2.0·Parquet
Image

UniVA-Bench

UniVA-Bench Paper: UniVA: Universal Video Agent towards Open-Source Next-Generation Video Generalist Project Page: Code: UniVA-Bench is a…

1K–10K·Images (folder)
Advertisement