忘记密码?
其他方式登录

世界模型一口气输出小时级视频不跑偏,开源了

2026年8月18日

详细介绍

视频世界模型跑久了,往往面临三个问题:

画面发灰发糊或者过曝过饱和、场景悄悄换了地方、显存先撑不住。

三者彼此打架:历史留在去噪器上下文或KV cache里,每步开销就随会话变长;开窗口、逐出缓存能按住成本,代价却是丢信息——“能跑多久”和“能记多少”被迫互换。另一边,低延迟只能做几步去噪,得从慢老师蒸馏,学生天花板由老师的监督时长和条件方式决定。

世界模型一口气输出小时级视频不跑偏,开源了

学生只留最近19个latent帧、约3.2秒。走出这3.2秒的内容不再进上下文,而是写进一个以相机位姿为索引的外部“世界状态银行”,只有三个操作:

最后把能力搬进三步学生:自强制rollout下做30秒全窗口分布匹配(DMD),从1个真值前缀起步生成20个片段、共189个latent帧,老师与critic对整条轨迹联合打分。

逐片段文本条件让提示词能在生成中途换掉,论文称之为evocation。下面几条都在第3个片段切换指令:场景不会推倒重来,而是在原有世界里自然唤出新内容。

世界模型一口气输出小时级视频不跑偏,开源了

EVOKE给出的是一条完整清晰的交互式世界模型训练方案:即世界模型不必把“记忆”和“实时”压在同一个去噪器上。空间状态外置成显式存储,时间一致性和指令切换能力由长时程重做过的老师监督训练得到,会话时长就不再被上下文预算封顶。

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0

联系方式

赞赏支持

累计赞赏 0 积分 0 人支持
登录后赞赏

💬 发表评论