English
1,233 results
VideoHallu
VideoHallu: Evaluating and Mitigating Multi-modal Hallucinations for Synthetic Videos Zongxia Li , Xiyang Wu , Guangyao Shi, Yubin…
Unify-OmniBench
Unify-OmniBench 统一格式的多模态评测数据集,由 Unify-OmniBench 框架转换生成。 包含四个 benchmark,在 Dataset Viewer 右上角下拉框切换。 数据概览 Config (bench) 题目数 模态 媒体 daily omni ~1197…
MathVerse
Dataset Card for MathVerse Dataset Description Paper Information Dataset Examples Leaderboard Citation Dataset Description The capabilities of…
TVBench
Lost in Time: A New Temporal Benchmark for Video LLMs Daniel Cores , Michael Dorkenwald , Manuel Mucientes,…
lapchole-focus-vqa
LapChole-FOCUS-VQA A clinically grounded benchmark for long-context video understanding in minimally invasive surgery. 💻 Code • 🏆…
V1-33K
V1: Toward Multimodal Reasoning by Designing Auxiliary Tasks 🚀 Toward Multimodal Reasoning via Unsupervised Task -- Future Prediction…
StepCountQA-SFT
StepCountQA-SFT StepCountQA-SFT is a multimodal supervised fine-tuning (SFT) dataset for visual object counting with step-by-step reasoning. Built…
MathVerse-lmmseval
Dataset Card for MathVerse This is the version for lmms-eval. This shares the same data with the official…
full-modality-bench
Multimodal Video QA Dataset This dataset contains challenging video question-answering tasks that require understanding both visual and audio…
ImgCode-8.6M
MathCoder-VL: Bridging Vision and Code for Enhanced Multimodal Mathematical Reasoning Repo: Paper: Introduction We introduce MathCoder-VL, a series…
causalphys
Causal-VL Dataset Causal reasoning VQA dataset with 4 categories × 4 subcategories (3062 questions). Structure Each subcategory contains:…
MVTamperBenchStart
MVTamperBench Dataset Overview MVTamperBenchStart is a robust benchmark designed to evaluate Vision-Language Models (VLMs) against adversarial video…
DenseFusion-1M for comprehensive image descriptions
DenseFusion-1M for comprehensive image descriptions