忘记密码?
其他方式登录

虚幻引擎CEO围观最新世界模型:代码驱动,视频模型生成画面

2026年9月8日

详细介绍

近年来,视频生成模型在清晰度、时序一致性和可控性上快速进步。给定文本、图像、相机轨迹或玩家动作,模型已经能够合成连贯的后续画面,也让「可交互视频世界」逐渐从概念走向可观看、可操作的原型。

项目主页:https://buaacyw.github.io/cwm/

代码仓库:https://github.com/buaacyw/code-world-model

图 1  Code World Model的核心分工:coding agent通过code演化world state,proxy将相关状态转换为视觉条件,video model生成最终画面。

围绕上述分工,Code World Model 将世界的运行过程拆成三个彼此衔接的部分。

图 2  Code World Model 总体框架。完整构想包含视觉反馈;当前原型重点验证 coding agent / code → world state → proxy → video model 的前向链路。

完成职责拆分后,还剩下一个关键的接口问题:coding agent 与 code 维护的是可执行状态,video model 接收的却是文本、图像或视频 token。二者之间需要一种既容易由程序构造,又能够提供逐帧空间约束的共同语言。

要让 video model 学会理解 proxy,训练样本需要同时包含 proxy video、结构化文本与目标 RGB 视频,而且 proxy 与 RGB 必须在时间、相机和实体身份上严格对齐。

图 3a  游戏数据中的目标 RGB(上)与同帧 proxy(下)。

图 3b  真实视频中的目标 RGB(上),以及利用相机标定、3D 重建和物体标注离线构造的 proxy(下)。

当前原型采用MiniMax-H3的Ref2VA backbone作为video model,对全部50个transformer block进行rank-128 LoRA适配,可训练参数约为 5.96 亿。训练使用8张NVIDIA H800 GPU,共完成3个 epoch、3,534个优化步骤。

定性结果显示,即使只使用约5.6小时gameplay source video进行LoRA适配,模型仍能在角色、环境和风格明显偏离训练外观时,遵循proxy指定的人物位置、动作轨迹、场景布局与相机运动,同时补充丰富的纹理、光照和局部动态。

图 4  proxy提供人物位置与动作轨迹,video model将同一粗粒度骨架呈现为不同身份和画风的角色。上:proxy;下:生成结果。

图 5  简单几何primitive对复杂物体与相机运动施加约束。上:proxy;下:生成结果。

https://arxiv.org/abs/2608.25927

联系方式

赞赏支持

累计赞赏 0 积分 0 人支持
登录后赞赏

💬 发表评论