Skip to content
Advertisement

Video

706 results

MultimodalTextVideo

phyground

PhyGround Project Page GitHub Paper PhyGround is a criteria-grounded benchmark for evaluating physical reasoning in video generation. The…

<1K·JSON
Video

PhysicalAI-SmartSpaces

Physical AI Smart Spaces Dataset Overview Comprehensive, annotated dataset for multi-camera tracking and 2D/3D object detection. This dataset…

1K–10K·CC-BY
Video

VAP-Data

Video-As-Prompt: Unified Semantic Control for Video Generation 🔥 News Oct 24, 2025: 📖 We release the first unified…

10K–100K·Apache-2.0
Video

FantasyPortrait-Multi-Expr

FantasyPortrait: Enhancing Multi-Character Portrait Animation with Expression-Augmented Diffusion Transformers 🔥 Latest News!! August 10, 2025: We…

10K–100K·Apache-2.0
Video

RoboMemArena

RoboMemArena 数据集文件元信息以及数据文件,请浏览“数据集文件”页面获取。 当前数据集卡片使用的是默认模版,数据集的贡献者未提供更加详细的数据集介绍,但是您可以通过如下GIT Clone命令,或者ModelScope SDK来下载数据集 下载方法 Task Categories…

<1K·Apache-2.0
Video

AgiBot-World-Beta-no-torso-movement

Dataset taken from BAAI-DataCube/agibot-lerobot-v30-217-task-collection, in LeRobot Datasets v3.0 format. Fisheye video features are dropped so there…

10K–100K·CC-BY-NC-SA
Video

PhysicTran38K

PhysicTran38K We provide 38K video-based dataset for physics-aware image editing, by casting editing as physical state transitions. To…

10K–100K·Apache-2.0
MultimodalTextVideo

Vript

🎬 Vript: Refine Video Captioning into Video Scripting Github Repo We construct a fine-grained video-text dataset with 12K…

100K–1M·JSON
Video

ByteDance_Synthetic_Videos

Dataset Name CGI synthetic videos generated in paper "Synthetic Video Enhances Physical Fidelity in Video Synthesis" ( Dataset…

10K–100K·Apache-2.0
ImageMultimodalVideo

GOKU-2M

Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing GOKU-2M is a large-scale, unified instruction-based…

1M–10M·CC-BY-NC
MultimodalTextVideo

finevideo

FineVideo FineVideo Description Dataset Explorer Revisions Dataset Distribution How to download and use FineVideo Using datasets Using huggingface…

10K–100K·Other·Parquet
Advertisement