Skip to content
Advertisement

Open

2,922 results

MultimodalTextVideo

phyground

PhyGround Project Page GitHub Paper PhyGround is a criteria-grounded benchmark for evaluating physical reasoning in video generation. The…

<1K·JSON
Video

PhysicalAI-SmartSpaces

Physical AI Smart Spaces Dataset Overview Comprehensive, annotated dataset for multi-camera tracking and 2D/3D object detection. This dataset…

1K–10K·CC-BY
Video

FantasyPortrait-Multi-Expr

FantasyPortrait: Enhancing Multi-Character Portrait Animation with Expression-Augmented Diffusion Transformers 🔥 Latest News!! August 10, 2025: We…

10K–100K·Apache-2.0
Video

AgiBot-World-Beta-no-torso-movement

Dataset taken from BAAI-DataCube/agibot-lerobot-v30-217-task-collection, in LeRobot Datasets v3.0 format. Fisheye video features are dropped so there…

10K–100K·CC-BY-NC-SA
Video

PhysicTran38K

PhysicTran38K We provide 38K video-based dataset for physics-aware image editing, by casting editing as physical state transitions. To…

10K–100K·Apache-2.0
MultimodalTextVideo

Vript

🎬 Vript: Refine Video Captioning into Video Scripting Github Repo We construct a fine-grained video-text dataset with 12K…

100K–1M·JSON
Video

ByteDance_Synthetic_Videos

Dataset Name CGI synthetic videos generated in paper "Synthetic Video Enhances Physical Fidelity in Video Synthesis" ( Dataset…

10K–100K·Apache-2.0
MultimodalTabularText

full-modality-data

Full Modality Dataset Statistics Video Statistics Total Videos: 28,472 Total Duration: 1422.33 hours Average Duration: 179.84 seconds Median…

1M–10M·MIT·Parquet
Advertisement