MMS-VPR: A Fine-Grained Multimodal Street-Level Visual Place Recognition Dataset and Evaluation Benc
MMS-VPR: A Fine-Grained Multimodal Street-Level Visual Place Recognition Dataset and Evaluation Benchmark for Dense Pedestrian Environments
73 results
MMS-VPR: A Fine-Grained Multimodal Street-Level Visual Place Recognition Dataset and Evaluation Benchmark for Dense Pedestrian Environments
MVBench Forked from for reproducibility. Important Update 18/10/2024 Due to NTU RGB+D License, 320 videos from NTU RGB+D…
Optimism Bias World Model Benchmark — Training Data Training data for VLM-as-judge models evaluating world model predictions. Structure…
Multimodal Video QA Dataset This dataset contains challenging video question-answering tasks that require understanding both visual and audio…
🎬 Vript: Refine Video Captioning into Video Scripting Github Repo We construct a fine-grained video-text dataset with 44.7K…
VBVR-Dataset: Very Big Video Reasoning Training Data
ANAKIN: manipulated videos and mask annotations
GUIDE: Resolving Domain Bias in GUI Agents through Real-Time Web Video Retrieval and Plug-and-Play Annotation GUI Unbiasing via…
DAVIS 2017 — 480p MP4 Sequences Pre-encoded MP4 versions of all 90 sequences from the DAVIS 2017 trainval…
VOID-Compatible Quadmask Counterfactual Video Dataset
BaboonLand Dataset: Tracking Primates in the Wild and Automating Behaviour Recognition from Drone Videos
MOT17 – Normalized Parquet Dataset Multi-Object Tracking Benchmark (MOTChallenge) in a de-duplicated, Parquet-native layout. Structure mot17-parquet/…
Prompt-to-Gesture: Measuring the Capabilities of Image-to-Video Deictic Gesture Generation
CausalVerse Image Dataset This dataset contains two families of splits: Physics splits: Fall, Refraction, Slope, Spring Static image…