Tabular
1,117 results
AgentVQA
AgentVQA: A Multi-Domain Visual Question Answering Dataset AgentVQA is a comprehensive dataset for training and evaluating visual agents…
GUIGuard-Bench (Public Ladder)
GUIGuard-Bench (Public Ladder)
MVBench
MVBench Forked from for reproducibility. Important Update 18/10/2024 Due to NTU RGB+D License, 320 videos from NTU RGB+D…
MVTamperBenchEnd
MVTamperBench Dataset Overview MVTamperBenchEnd is a robust benchmark designed to evaluate Vision-Language Models (VLMs) against adversarial video…
AVQA (Audio-Visual QA) — Videos + Annotations
AVQA (Audio-Visual QA) — Videos + Annotations
TVBench
Lost in Time: A New Temporal Benchmark for Video LLMs Daniel Cores , Michael Dorkenwald , Manuel Mucientes,…
MVTamperBenchStart
MVTamperBench Dataset Overview MVTamperBenchStart is a robust benchmark designed to evaluate Vision-Language Models (VLMs) against adversarial video…
CG-Bench
CG-Bench Project Website: Repository: (includes running code) Summary We introduce CG-Bench, a groundbreaking benchmark for clue-grounded question…
SLAKE
Dataset Info: SLAKE: A Semantically-Labeled Knowledge-Enhanced Dataset for Medical Visual Question Answering ISBI 2021 oral Project Page: click…
ESpeech datasets annotate by Balalaika
ESpeech datasets annotate by Balalaika
Speech DAC Tokens (3 Codebooks)
Speech DAC Tokens (3 Codebooks)