视频DiT直接「长」出 4D 世界!浙大仅用1K条数据打通统一接口
详细介绍
今天的视频生成模型,已经越来越像一个会拍电影的导演。
论文:https://arxiv.org/abs/2608.10744
项目主页:https://hayd-zju.github.io/Beyond-Pixels/
GitHub:https://github.com/hayd-zju/Beyond-Pixels
Hugging Face:https://huggingface.co/papers/2608.10744
文本、图像及其他视频控制条件产生的 latent,可以沿同一条路径转化为可从新视角观察的动态4D场景。
利用视频生成先验构建4D内容,最自然的办法是「先生成,再重建」。
传统路线先将latent解码成RGB,再用独立模型进行4D重建;Latent-to-4D则通过L4AR直接把最终去噪latent转化为结构化4Dlatent。
研究团队注意到,不同的视频DiT未必拥有相同的架构、参数量和条件输入,但它们可能共享同一个VAE。
视频VAE latent不能直接塞进预训练4D解码器。
冻结的视频VAE提供输入latent,L4AR负责对齐与时空细化,预训练4D解码层级最终输出相机与动态世界空间点图。
L4AR首先通过三线性重采样,把视频latent调整到4D解码层级所需的时空分辨率。
局部对齐之后,模型还需要推理长距离对应、视角变化与动态结构。
前者守住物体轮廓和局部几何,后者把跨帧运动、镜头变化与长距离对应连接起来。
经过多层细化后,4D Decoder会预测每一帧的相机、深度和世界空间射线,并将它们组合成统一坐标系中的动态点图。
到了推理阶段,只需要进行一次替换:
把真实视频编码得到的latent,换成兼容视频DiT生成的最终去噪latent。
4D几何监督一向稀缺,但这项工作并没有重新采集一套巨型数据。
它们覆盖不同参数规模的Text-to-Video模型和Image-to-Video模型,但共享同一套Wan VAE。
为了弄清提升究竟来自哪里,团队设计了严格的same-latent对比。
评测分别在200个文本条件案例构成的Text4D-200,以及200个图像条件案例构成的I4D-200上进行。
定性结果更加直观。
在机械师检修汽车、火与水元素互动、阳台衣物摆动以及植物叶片等案例中,传统重建方法容易遗漏背景、细长结构或大面积表面。
Text-to-4D对比。红色虚线框标出了其他方法中的结构缺失与破碎区域。
Image-to-4D对比。Latent-to-4D在多种开放场景中恢复出更完整的可见几何。
视频模型会什么,4D世界就有机会继承什么
如果Latent-to-4D只能支持文本和图像,那么它仍然只是两个任务的组合。
同一个L4AR checkpoint可以继承上游模型中的运动、外观、姿态和轨迹控制。
动作条件latent沿同一条路径转化为动态4D场景。
论文同时划出了清晰边界。
