English
1,233 results
VLAA-Thinking
SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models 🌐 Project Page • 📄…
VideoMarathon
Dataset Card for VideoMarathon VideoMarathon is a large-scale long video instruction-following dataset with a total duration of approximately…
Indian Competitive Exams (JEE/NEET) LLM Benchmark
Indian Competitive Exams (JEE/NEET) LLM Benchmark
Video-opd-Dataset
Video-opd-Dataset A video temporal grounding dataset with 2,500 samples sourced from TimeLens-100K. Dataset Description This dataset contains video…
ChartVerse-SFT-600K
ChartVerse-SFT-600K is a large-scale, high-quality chart reasoning dataset with Chain-of-Thought (CoT) annotations, developed as part of the…
Molmo2 PointArena SFT Data (LAION + Molmo-7B-D)
Molmo2 PointArena SFT Data (LAION + Molmo-7B-D)
videomarathon
Dataset Card for VideoMarathon VideoMarathon is a large-scale long video instruction-following dataset with a total duration of approximately…
MVTamperBenchEnd
MVTamperBench Dataset Overview MVTamperBenchEnd is a robust benchmark designed to evaluate Vision-Language Models (VLMs) against adversarial video…
ReVSI
ICML 2026 Yiming Zhang1 , Jiacheng Chen1 , Jiaqi Tan1, Yongsen Mao2, Wenhu Chen3, Angel X. Chang1,4 1…
AVQA (Audio-Visual QA) — Videos + Annotations
AVQA (Audio-Visual QA) — Videos + Annotations
LongVALE
Dataset Card for LongVALE Uses This dataset is designed for training and evaluating models on omni-modal (vision-audio-language-event) fine-grained…
ShareGPT4V Captions 1.2M Dataset Card
ShareGPT4V Captions 1.2M Dataset Card
OpenDocVQA-Corpus
Dataset Card for OpenDocVQA This is a training and evaluation corpus data file for VDocRAG, a new RAG…
MMFineReason-1.8M-Qwen3-VL-235B-Thinking
MMFineReason Closing the Multimodal Reasoning Gap via Open Data-Centric Methods Average score across mathematical reasoning and multimodal…
finevision-sample
FineVision Sample Dataset A comprehensive multimodal dataset containing samples across multiple categories, designed for visual question answering…