Skip to content
Advertisement

Video

706 results

MultimodalTextVideo

ReVSI

ICML 2026 Yiming Zhang1 , Jiacheng Chen1 , Jiaqi Tan1, Yongsen Mao2, Wenhu Chen3, Angel X. Chang1,4 1…

10K–100K·Apache-2.0·Parquet
MultimodalTextVideo

LongVALE

Dataset Card for LongVALE Uses This dataset is designed for training and evaluating models on omni-modal (vision-audio-language-event) fine-grained…

100K–1M·CC-BY-NC-SA·Parquet
MultimodalTextVideo

VideoHallu

VideoHallu: Evaluating and Mitigating Multi-modal Hallucinations for Synthetic Videos Zongxia Li , Xiyang Wu , Guangyao Shi, Yubin…

1K–10K·Apache-2.0·Parquet
AudioImageMultimodal

Unify-OmniBench

Unify-OmniBench 统一格式的多模态评测数据集,由 Unify-OmniBench 框架转换生成。 包含四个 benchmark,在 Dataset Viewer 右上角下拉框切换。 数据概览 Config (bench) 题目数 模态 媒体 daily omni ~1197…

1K–10K·Custom / Research-only·Parquet
MultimodalTabularText

TVBench

Lost in Time: A New Temporal Benchmark for Video LLMs Daniel Cores , Michael Dorkenwald , Manuel Mucientes,…

1K–10K·CC-BY·JSON
MultimodalTextVideo

lapchole-focus-vqa

LapChole-FOCUS-VQA A clinically grounded benchmark for long-context video understanding in minimally invasive surgery. 💻 Code  •  🏆…

10K–100K·Custom / Research-only·Parquet
MultimodalTextVideo

V1-33K

V1: Toward Multimodal Reasoning by Designing Auxiliary Tasks 🚀 Toward Multimodal Reasoning via Unsupervised Task -- Future Prediction…

10K–100K·Apache-2.0·JSON
Video

full-modality-bench

Multimodal Video QA Dataset This dataset contains challenging video question-answering tasks that require understanding both visual and audio…

1K–10K·MIT
MultimodalTabularText

MVTamperBenchStart

MVTamperBench Dataset Overview MVTamperBenchStart is a robust benchmark designed to evaluate Vision-Language Models (VLMs) against adversarial video…

10K–100K·MIT·JSON
MultimodalTextVideo

Vript_Chinese

🎬 Vript: Refine Video Captioning into Video Scripting Github Repo We construct a fine-grained video-text dataset with 44.7K…

100K–1M·JSON
ImageMultimodalText

VideoThinkBench

CVPR 2026 Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm 🎊 News 2026.02 🔥🔥Our work…

1K–10K·MIT·Parquet
MultimodalTabularText

CG-Bench

CG-Bench Project Website: Repository: (includes running code) Summary We introduce CG-Bench, a groundbreaking benchmark for clue-grounded question…

10K–100K·MIT·JSON
Advertisement