English
1,233 results
DocVQA-2026
DocVQA 2026 ICDAR2026 Competition on Multimodal Reasoning over Documents in Multiple Domains Building upon previous DocVQA benchmarks, this…
V1-33K-Old
V1: Toward Multimodal Reasoning by Designing Auxiliary Tasks 🚀 Toward Multimodal Reasoning via Unsupervised Task -- Future Prediction…
AgentVQA
AgentVQA: A Multi-Domain Visual Question Answering Dataset AgentVQA is a comprehensive dataset for training and evaluating visual agents…
S1-MMAlign
S1-MMAlign A Large-Scale Multi-Disciplinary Scientific Multimodal Dataset S1-MMAlign is a large-scale, multi-disciplinary multimodal dataset…
UrbanVideo-Bench
ACL'25 Oral UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces This repository contains…
ICDAR2019’s Scanned Receipts OCR and Information Extraction (SROIE)
ICDAR2019's Scanned Receipts OCR and Information Extraction (SROIE)