Skip to content
Advertisement

Multimodal

2,368 results

ImageMultimodalText

PhyX

PhyX: Does Your Model Have the "Wits" for Physical Reasoning? Dataset for the paper "PhyX: Does Your Model…

10K–100K·MIT·Parquet
ImageMultimodalText

VLAA-Thinking

SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models 🌐 Project Page • 📄…

<1K·Apache-2.0·Images (folder)
MultimodalTextVideo

VideoMarathon

Dataset Card for VideoMarathon VideoMarathon is a large-scale long video instruction-following dataset with a total duration of approximately…

1M–10M·Apache-2.0·Parquet
MultimodalTextVideo

Video-opd-Dataset

Video-opd-Dataset A video temporal grounding dataset with 2,500 samples sourced from TimeLens-100K. Dataset Description This dataset contains video…

1K–10K·Apache-2.0·Parquet
ImageMultimodalText

ChartVerse-SFT-600K

ChartVerse-SFT-600K is a large-scale, high-quality chart reasoning dataset with Chain-of-Thought (CoT) annotations, developed as part of the…

100K–1M·Apache-2.0·Parquet
MultimodalTextVideo

videomarathon

Dataset Card for VideoMarathon VideoMarathon is a large-scale long video instruction-following dataset with a total duration of approximately…

1M–10M·Apache-2.0·Parquet
MultimodalTextVideo

optimism_train

Optimism Bias World Model Benchmark — Training Data Training data for VLM-as-judge models evaluating world model predictions. Structure…

<1K·MIT
MultimodalTabularText

MVTamperBenchEnd

MVTamperBench Dataset Overview MVTamperBenchEnd is a robust benchmark designed to evaluate Vision-Language Models (VLMs) against adversarial video…

10K–100K·MIT·JSON
MultimodalTextVideo

ReVSI

ICML 2026 Yiming Zhang1 , Jiacheng Chen1 , Jiaqi Tan1, Yongsen Mao2, Wenhu Chen3, Angel X. Chang1,4 1…

10K–100K·Apache-2.0·Parquet
MultimodalTextVideo

LongVALE

Dataset Card for LongVALE Uses This dataset is designed for training and evaluating models on omni-modal (vision-audio-language-event) fine-grained…

100K–1M·CC-BY-NC-SA·Parquet
Advertisement