Skip to content
Advertisement

Video Text To Text

54 results

MultimodalTextVideo

V1-33K-Old

V1: Toward Multimodal Reasoning by Designing Auxiliary Tasks 🚀 Toward Multimodal Reasoning via Unsupervised Task -- Future Prediction…

10K–100K·Apache-2.0·JSON
ImageMultimodalTabular

AgentVQA

AgentVQA: A Multi-Domain Visual Question Answering Dataset AgentVQA is a comprehensive dataset for training and evaluating visual agents…

10K–100K·MIT
MultimodalTextVideo

VideoKR-Eval

VideoKR-Eval 📄 ArXiv  |  💻 Code  |  🤗 Collection About This repository contains the VideoKR-Eval benchmark presented in…

1K–10K·Apache-2.0·JSON
ImageMultimodalText

FineBench

Dataset Card for FineBench FineBench is a large-scale, multiple-choice Video Question Answering (VQA) dataset designed specifically to evaluate…

100K–1M·MIT·JSON
MultimodalTextVideo

VideoMarathon

Dataset Card for VideoMarathon VideoMarathon is a large-scale long video instruction-following dataset with a total duration of approximately…

1M–10M·Apache-2.0·Parquet
MultimodalTextVideo

Video-opd-Dataset

Video-opd-Dataset A video temporal grounding dataset with 2,500 samples sourced from TimeLens-100K. Dataset Description This dataset contains video…

1K–10K·Apache-2.0·Parquet
MultimodalTextVideo

videomarathon

Dataset Card for VideoMarathon VideoMarathon is a large-scale long video instruction-following dataset with a total duration of approximately…

1M–10M·Apache-2.0·Parquet
MultimodalTextVideo

V1-33K

V1: Toward Multimodal Reasoning by Designing Auxiliary Tasks 🚀 Toward Multimodal Reasoning via Unsupervised Task -- Future Prediction…

10K–100K·Apache-2.0·JSON
Video

stream-data

Streaming Video Dataset Description A consolidated collection of video datasets for streaming video understanding research, including temporal…

100K–1M·CC-BY
Video

LLaVA-Video-large-swift

Dataset Card LLaVA-Video-medium-swift A subset of LLaVA-Video-178K for educational purposes to learn how to fine-tune video models.

<1K·Apache-2.0
ImageMultimodalText

EO-Data1.5M

🤖 EO-Data-1.5M A Large-Scale Interleaved Vision-Text-Action Dataset for Embodied AI The first large-scale interleaved embodied dataset emphasizing…

1M–10M·Apache-2.0·Parquet
Advertisement