Skip to content
Advertisement

Datasets

634 results

MultimodalTextVideo

Vript

🎬 Vript: Refine Video Captioning into Video Scripting Github Repo We construct a fine-grained video-text dataset with 12K…

100K–1M·JSON
Video

ByteDance_Synthetic_Videos

Dataset Name CGI synthetic videos generated in paper "Synthetic Video Enhances Physical Fidelity in Video Synthesis" ( Dataset…

10K–100K·Apache-2.0
ImageMultimodalVideo

GOKU-2M

Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing GOKU-2M is a large-scale, unified instruction-based…

1M–10M·CC-BY-NC
MultimodalTextVideo

finevideo

FineVideo FineVideo Description Dataset Explorer Revisions Dataset Distribution How to download and use FineVideo Using datasets Using huggingface…

10K–100K·Other·Parquet
MultimodalTabularText

full-modality-data

Full Modality Dataset Statistics Video Statistics Total Videos: 28,472 Total Duration: 1422.33 hours Average Duration: 179.84 seconds Median…

1M–10M·MIT·Parquet
MultimodalSensor / Time-seriesTabular

pusht

This dataset was created using LeRobot. Dataset Structure meta/info.json: { "codebase version": "v2.0", "robot type": "unknown", "total episodes":…

10K–100K·MIT·Parquet
Video

RoVid-X

Rethinking Video Generation Model for the Embodied World If you like our project, please give us a star…

>1B·CC-BY
Video

MVLU

MLVU: Multi-task Long Video Understanding Benchmark This repo contains the annotation data and evaluation code for the paper…

CC-BY-NC-SA
Advertisement