Skip to content
Advertisement

Text-to-Video

50 results

MultimodalTextVideo

phyground

PhyGround Project Page GitHub Paper PhyGround is a criteria-grounded benchmark for evaluating physical reasoning in video generation. The…

<1K·JSON
ImageMultimodalVideo

GOKU-2M

Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing GOKU-2M is a large-scale, unified instruction-based…

1M–10M·CC-BY-NC
MultimodalTextVideo

Vript

🎬 Vript: Refine Video Captioning into Video Scripting Github Repo We construct a fine-grained video-text dataset with 12K…

100K–1M·JSON
Video

Vera-Layered-Video-Dataset

Dataset for Vera: A Layered Diffusion Model for Content-Preserving Video Editing Hongkai Zheng¹²  ·  Ta-Ying Cheng²  ·  Benjamin…

10K–100K·Apache-2.0
MultimodalTextVideo

ChronoMagic-Bench

NeurIPS D&B 2024 Spotlight ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation If you like our…

1K–10K·CC-BY·CSV
Text

Vchitect_T2V_DataVerse

Vchitect-T2V-Dataverse Vchitect Team1 1Shanghai Artificial Intelligence Laboratory Paper Project Page Data Overview The Vchitect-T2V-Dataverse is the…

1M–10M·Apache-2.0·WebDataset
ImageMultimodalVideo

GOKU-2M

Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing GOKU-2M is a large-scale, unified instruction-based…

1M–10M·CC-BY-NC
Image

IntuitivePhysics

WorldBench WorldBench is a new benchmark designed to evaluate the physical understanding and prediction of modern world models…

100K–1M·Images (folder)
Advertisement