Skip to content
Advertisement

<1K

439 results

ImageMultimodalText

QCalEval

QCalEval Dataset Description The dataset contains scientific plots from quantum computing calibration experiments, paired with vision-language…

<1K·CC-BY·Parquet
ImageMultimodalText

VLAA-Thinking

SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models 🌐 Project Page • 📄…

<1K·Apache-2.0·Images (folder)
MultimodalTextVideo

optimism_train

Optimism Bias World Model Benchmark — Training Data Training data for VLM-as-judge models evaluating world model predictions. Structure…

<1K·MIT
Image

SandThink

SandThink Dataset (v1.0) SandThink 是一个专为具身智能 (Embodied AI) 任务设计的大规模指令微调与偏好对齐数据集。该数据集通过结构化的 Chain-of-Thought (CoT) 推理过程,显著提升了 Vision-Language-Action…

<1K·MIT·Images (folder)
Image

causalphys

Causal-VL Dataset Causal reasoning VQA dataset with 4 categories × 4 subcategories (3062 questions). Structure Each subcategory contains:…

<1K·Apache-2.0·Images (folder)
ImageMultimodalText

Obshazard-bench

ObsCrisis-Bench A multimodal benchmark for evaluating large vision-language models on extreme weather event analysis tasks. Dataset Description…

<1K·MIT
ImageMultimodalText

FlowLearn

cr--- task categories: - visual-question-answering language: - en size categories: - 1K<n<10K References The original articles are maintained…

<1K·CC-BY-NC-SA·Images (folder)
Video

LLaVA-Video-large-swift

Dataset Card LLaVA-Video-medium-swift A subset of LLaVA-Video-178K for educational purposes to learn how to fine-tune video models.

<1K·Apache-2.0
Image

ViFailback-Dataset

ViFailback Dataset: Real-World Robotic Manipulation Failure Dataset with Visual Symbol Guidance A real-world dataset for diagnosing, correcting, and…

<1K·MIT·Images (folder)
ImageMultimodalText

RoboBench

RoboBench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain 📋 Overview RoboBench is a…

<1K·CC-BY
Advertisement