忘记密码?
其他方式登录

世界模型的三维难题新思路:原生一体生成左右眼完整视频流

2026年8月31日

详细介绍

世界模型的三维难题新思路:原生一体生成左右眼完整视频流

近年来,视频生成模型已经能够合成高度逼真的动态画面,进一步加入相机轨迹或动作指令后,模型还可以向前移动、转向或探索新的视角,因此逐渐具备了“世界模型”的雏形。但大多数现有世界模型仍然通过单目RGB视频表示世界。

给定单张图像、场景文本描述,以及WASD键控制的平移和上下左右键控制的方向,StereoWorld通过统一建模相机与视频帧RoPE编码的方式,同时生成后续的左眼视频和右眼视频。结果如下:

在最初的双目生成设置中,StereoWorld主要面向标准的校正双目相机:左右相机保持固定的水平基线,并沿着相同轨迹同步运动。在进一步拓展中,研究团队发现,StereoWorld并没有被限制在这一固定相机配置中。得益于统一的Camera-Frame RoPE对相机内外参及相对位姿的显式建模,模型能够进一步支持相对关系随时间变化的双相机轨迹。

结果如下:

世界模型的三维难题新思路:原生一体生成左右眼完整视频流

原始StereoWorld采用双向注意力,一次生成的视频长度受到81帧限制,研究团队进一步将其蒸馏为四步生成的因果自回归模型,并为左右视图分别维护带有相机位置编码的KV Cache。蒸馏后的模型能够生成约10秒的双目视频,速度从0.25 FPS提升至约3 FPS,速度提升约10倍,为长时、交互式立体世界生成提供了初步基础。下面展示了蒸馏后的模型在长时视频推理的结果:

更进一步,研究团队发现,StereoWorld不仅可以从初始画面出发,同时生成左右两路视频,还可以迁移到另一种推理模式:给定一段完整的左视图视频,以及另一条目标相机轨迹,由模型补全对应的右视图视频。

此次开源版本展现出的灵活双相机控制与跨视图补全能力说明,StereoWorld的双目联合生成学习到的并非某一种固定视差模式,而是相机运动、场景内容与跨视图几何之间更一般的联合分布关系。沿着这一方向,StereoWorld有望能够从双相机扩展到更加自由的多视角配置,比如支持数量不固定的相机或更复杂的相对轨迹;另一方面,view inpainting的能力也有望将大规模单目视频资源转化为可控的立体或多视角内容,并服务于 VR/AR、虚拟摄影和沉浸式内容创作。

联系方式

赞赏支持

累计赞赏 0 积分 0 人支持
登录后赞赏

💬 发表评论