Visual Question Answering
339 results
MVTamperBench
MVTamperBench Dataset Overview MVTamperBench is a robust benchmark designed to evaluate Vision-Language Models (VLMs) against adversarial video…
MVBench
MVBench Important Update 18/10/2024 Due to NTU RGB+D License, 320 videos from NTU RGB+D need to be downloaded…
zendo-synthetic-data
Zendo Synthetic Visual Reasoning Dataset Synthetic Zendo-style scenes with associated rules and per-scene tensor representations. Each scene either…
VSI-Bench
Dataset arXiv Website Code VSI-Bench VSI-Bench-Debiased !IMPORTANT Nov. 7, 2025 UPDATE: This Dataset has been updated to include…
MentalBlackboard
MentalBlackboard Benchmark This repository contains the MentalBlackboard benchmark with multiple tasks: - Prediction - Planning Dataset Sources
Vript
🎬 Vript: Refine Video Captioning into Video Scripting Github Repo We construct a fine-grained video-text dataset with 12K…
finevideo
FineVideo FineVideo Description Dataset Explorer Revisions Dataset Distribution How to download and use FineVideo Using datasets Using huggingface…
ParaVT-Source
ParaVT-Source Source media archives for the ParaVT training corpus. Pair this repository with the annotations in ParaVT/ParaVT-Parquet. Overview…
Daily-Omni (QA repackaged for lmms-eval)
Daily-Omni (QA repackaged for lmms-eval)