Skip to content
Advertisement

Datasets

1,204 results

ImageMultimodalText

RoboBench

RoboBench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain 📋 Overview RoboBench is a…

<1K·CC-BY
ImageMultimodalText

Cauldron-JA

Dataset Card for The Cauldron-JA Dataset description The Cauldron-JA is a Vision Language Model dataset that translates 'The…

1M–10M·CC-BY·Parquet
ImageMultimodalText

MMMU_Pro

MMMU-Pro (A More Robust Multi-discipline Multimodal Understanding Benchmark) 🌐 Homepage 🏆 Leaderboard 🤗 Dataset 🤗 Paper 📖 arXiv…

1K–10K·Apache-2.0·Parquet
ImageMultimodalText

emova-sft-speech-231k

EMOVA-SFT-Speech-231K 🤗 EMOVA-Models 🤗 EMOVA-Datasets 🤗 EMOVA-Demo 📄 Paper 🌐 Project-Page 💻 Github 💻 EMOVA-Speech-Tokenizer-Github Overview…

100K–1M·Apache-2.0·Parquet
ImageMultimodalText

emova-alignment-7m

EMOVA-Alignment-7M 🤗 EMOVA-Models 🤗 EMOVA-Datasets 🤗 EMOVA-Demo 📄 Paper 🌐 Project-Page 💻 Github 💻 EMOVA-Speech-Tokenizer-Github Overview…

1M–10M·Apache-2.0·Parquet
ImageMultimodalText

emova-sft-4m

EMOVA-SFT-4M 🤗 EMOVA-Models 🤗 EMOVA-Datasets 🤗 EMOVA-Demo 📄 Paper 🌐 Project-Page 💻 Github 💻 EMOVA-Speech-Tokenizer-Github Overview EMOVA-SFT-4M is…

1M–10M·Apache-2.0·Parquet
Image

UniVA-Bench

UniVA-Bench Paper: UniVA: Universal Video Agent towards Open-Source Next-Generation Video Generalist Project Page: Code: UniVA-Bench is a…

1K–10K·Images (folder)
Image

LCSD

LCSD

<1K·Apache-2.0·Images (folder)
ImageMultimodalTabular

nutriderm-dataset

NutriDermAI Dataset Dataset for NutriDermAI — Multimodal AI System for Dermatology with ABCDE Explainability and VQA. M.Tech Thesis…

1M–10M·CC-BY·Parquet
Image

Diffseg30k

🖼️ DiffSeg30k -- A multi-turn diffusion-editing dataset for localized AIGC detection A dataset for segmenting diffusion-based edits —…

Apache-2.0
ImageMultimodalText

IndustryShapes

IndustryShapes Project Page Paper IndustryShapes is a new benchmark dataset tailored for 6D object pose estimation in industrial…

10K–100K·MIT·Parquet
Advertisement