角色离场再回来,AI就换了个人?浙大、港大开源轻量化记忆路由器
详细介绍
你以为,AI只要能连续生成一分钟视频,就算解决了「长视频」?
论文设计了100个未参与训练的三镜头prompt,专门测试主体、颜色、位置和场景四类长时记忆压力,每类25个案例,并与13个长视频生成或记忆增强基线进行比较。
很多人第一反应是:既然模型会忘,那就扩大缓存,或者让每一层都读取远期历史。
LayerRecall把长视频记忆拆成两条路线。
训练记忆路由器还有一个难题:现实中没有人逐帧标注「此刻应该找回第几个历史chunk」。高质量长视频训练样本本来就稀缺,显式记忆分配标签更不存在。
项目主页还展示了一个很有意思的案例:人物第一幕穿着蓝色内搭,离场后重新出现时,内搭一度变成错误的浅色花纹;随着人物在当前镜头中变得更清晰,服装颜色和纹理又恢复到历史外观,而动作、人物身份和场景没有整体重置。
团队还把训练好的LayerRecall路由参数直接迁移到LongLive和Self-Forcing,不再重新优化路由器,只改用目标骨干自己的记忆层profile。
这次公开的不是一个只有6.6MB的完整视频模型,而是一份叠加在Wan2.2-TI2V-5B与LongLive-2.0之上的轻量路由权重:layer_recall_chpm_v3_step200.pt。
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0
联系方式
赞赏支持
累计赞赏 0 积分
0 人支持
登录后赞赏
