Indian Competitive Exams (JEE/NEET) LLM Benchmark
Indian Competitive Exams (JEE/NEET) LLM Benchmark
552 results
Indian Competitive Exams (JEE/NEET) LLM Benchmark
Optimism Bias World Model Benchmark — Training Data Training data for VLM-as-judge models evaluating world model predictions. Structure…
MVTamperBench Dataset Overview MVTamperBenchEnd is a robust benchmark designed to evaluate Vision-Language Models (VLMs) against adversarial video…
FineVision Sample Dataset A comprehensive multimodal dataset containing samples across multiple categories, designed for visual question answering…
Dataset Card for MathVerse Dataset Description Paper Information Dataset Examples Leaderboard Citation Dataset Description The capabilities of…
Multimodal Video QA Dataset This dataset contains challenging video question-answering tasks that require understanding both visual and audio…
ChartQAPro: A More Diverse and Challenging Benchmark for Chart Question Answering 🤗Dataset 🖥️Code 📄Paper The abstract of the…
MVTamperBench Dataset Overview MVTamperBenchStart is a robust benchmark designed to evaluate Vision-Language Models (VLMs) against adversarial video…
CVPR 2026 Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm 🎊 News 2026.02 🔥🔥Our work…
CG-Bench Project Website: Repository: (includes running code) Summary We introduce CG-Bench, a groundbreaking benchmark for clue-grounded question…
ObsCrisis-Bench A multimodal benchmark for evaluating large vision-language models on extreme weather event analysis tasks. Dataset Description…
ACL'25 Oral UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces This repository contains…
SynthUX Visual Computer-Use Trajectories
ViFailback Dataset: Real-World Robotic Manipulation Failure Dataset with Visual Symbol Guidance A real-world dataset for diagnosing, correcting, and…