忘记密码?
其他方式登录

视频DiT直接「长」出 4D 世界!浙大仅用1K条数据打通统一接口

2026年8月20日

详细介绍

今天的视频生成模型,已经越来越像一个会拍电影的导演。

论文:https://arxiv.org/abs/2608.10744

项目主页:https://hayd-zju.github.io/Beyond-Pixels/

GitHub:https://github.com/hayd-zju/Beyond-Pixels

Hugging Face:https://huggingface.co/papers/2608.10744

文本、图像及其他视频控制条件产生的 latent,可以沿同一条路径转化为可从新视角观察的动态4D场景。

利用视频生成先验构建4D内容,最自然的办法是「先生成,再重建」。

传统路线先将latent解码成RGB,再用独立模型进行4D重建;Latent-to-4D则通过L4AR直接把最终去噪latent转化为结构化4Dlatent。

研究团队注意到,不同的视频DiT未必拥有相同的架构、参数量和条件输入,但它们可能共享同一个VAE。

视频VAE latent不能直接塞进预训练4D解码器。

冻结的视频VAE提供输入latent,L4AR负责对齐与时空细化,预训练4D解码层级最终输出相机与动态世界空间点图。

L4AR首先通过三线性重采样,把视频latent调整到4D解码层级所需的时空分辨率。

局部对齐之后,模型还需要推理长距离对应、视角变化与动态结构。

前者守住物体轮廓和局部几何,后者把跨帧运动、镜头变化与长距离对应连接起来。

经过多层细化后,4D Decoder会预测每一帧的相机、深度和世界空间射线,并将它们组合成统一坐标系中的动态点图。

到了推理阶段,只需要进行一次替换:

把真实视频编码得到的latent,换成兼容视频DiT生成的最终去噪latent。

4D几何监督一向稀缺,但这项工作并没有重新采集一套巨型数据。

它们覆盖不同参数规模的Text-to-Video模型和Image-to-Video模型,但共享同一套Wan VAE。

为了弄清提升究竟来自哪里,团队设计了严格的same-latent对比。

评测分别在200个文本条件案例构成的Text4D-200,以及200个图像条件案例构成的I4D-200上进行。

定性结果更加直观。

在机械师检修汽车、火与水元素互动、阳台衣物摆动以及植物叶片等案例中,传统重建方法容易遗漏背景、细长结构或大面积表面。

Text-to-4D对比。红色虚线框标出了其他方法中的结构缺失与破碎区域。

Image-to-4D对比。Latent-to-4D在多种开放场景中恢复出更完整的可见几何。

视频模型会什么,4D世界就有机会继承什么

如果Latent-to-4D只能支持文本和图像,那么它仍然只是两个任务的组合。

同一个L4AR checkpoint可以继承上游模型中的运动、外观、姿态和轨迹控制。

动作条件latent沿同一条路径转化为动态4D场景。

论文同时划出了清晰边界。

联系方式

赞赏支持

累计赞赏 0 积分 0 人支持
登录后赞赏

💬 发表评论