Open
2,922 results
UrbanVideo-Bench
ACL'25 Oral UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces This repository contains…
ICDAR2019’s Scanned Receipts OCR and Information Extraction (SROIE)
ICDAR2019's Scanned Receipts OCR and Information Extraction (SROIE)
M3CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought
M3CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought
SDG-30K
SDG-30K — Structured Defect Grounding Dataset A 30,000-image dataset for structured defect grounding in text-to-image generations. Each image…
GenEvolve-Data-Bench
GenEvolve Data and Bench This repository contains the open-source data release for GenEvolve: Config Directory Records Images Purpose…
PlantInquiryVQA — Thinking Like a Botanist
PlantInquiryVQA — Thinking Like a Botanist
QCalEval
QCalEval Dataset Description The dataset contains scientific plots from quantum computing calibration experiments, paired with vision-language…
LVOmniBench (QA repackaged for lmms-eval)
LVOmniBench (QA repackaged for lmms-eval)