PermaVid ยท full-GT revisit benchmark

Does a video model remember the scene when the camera returns?

A comprehensive evaluation of camera-controlled / world-model video generation. Every model gets an observed context + the real camera trajectory and must generate the rest; because the scene is fully rendered, every generated frame is scored against a real GT frame (whole-trajectory + multi_visit + moving_back).

๐Ÿ†
Comprehensive comparison
Video-first: every example plays all methods vs real GT in sync, then a same-camera-pose frame comparison at the revisit. Plus ranked table (multi_visit + moving_back) + degradation curve. Start here.
๐ŸŽฌ
The dataset
78 UE scenes ร— ~20 diverse camera trajectories, with stats and per-scene detail.
๐Ÿ”
Per-scene results
GT-vs-render montages for each held-out scene + metrics table.
๐Ÿ“‰
Revisit degradation
Per-visit fidelity curves + playable clips showing who drifts on the return.