忘记密码?
其他方式登录

ECCV 2026 | 智能助手何时该主动开口?Vinci2让第一视角AI助手从「有问必答」走向「主动服务」

2026年8月17日

详细介绍

请想象这样一种居家场景:当你戴着 AI 眼镜在厨房准备晚饭,用刀切菜时,它会立刻提醒你注意安全;当你连续几天形成举着手机长时间录像的习惯时,它会主动建议你换一种更省力的记录方式。前者需要 AI 助手根据当前场景服务用户,后者则需要调用跨越数天的记忆,总结用户生活规律。

针对这一研究空白,来自大连理工大学、Alaya Lab 与东京大学的团队联合提出 Vinci2,将主动服务(Proactive Assistance)形式化为一个基于持续视频流的「决策 + 生成」联合任务:智能体在每个时刻不仅要感知正在发生什么,还要基于长时程累积的上下文,决定当前是否介入、如何介入。Vinci2 包含两大核心组件:首个主动服务评测基准 EgoServe,以及免训练的记忆增强智能体 EgoMemo

现有视频理解基准难以评测「主动性」:离线视频问答基准只考察对预分割片段的理解,流式视频理解基准不涉及长期记忆和介入决策,已有的主动对话基准则依赖于用户预先给定的显式指令。EgoServe 是首个同时具备第一视角、多天时间跨度、主动服务评测与流式推理协议的基准,构建于 EgoLife(多人多天连续日常记录)、HoloAssist(任务型交互)与 CaptainCook4D(含错误执行的烹饪记录)的基础上,覆盖超过 128 小时视频、超 3400 个服务实例。

研究团队构造了免训练智能体 EgoMemo,持续处理第一人称视频,以流式方式对输入视频帧构建多模态记忆并进行检索增强推理。

研究团队分别在 EgoServe 和多个在线以及离线视频理解基准上评测了 EgoMemo,取得了多个 SOTA 结果。

Vinci2 首次将「是否介入、何时介入、如何介入」作为显式的推理问题引入第一人称视频助手,用 EgoServe 定义了评测标准,用 EgoMemo 证明了免训练路线的可行性。当前所有方法的绝对分数仍不高,恰恰说明主动服务是一个远未解决、值得深挖的方向。基准与代码均已开源,欢迎社区在此基础上探索介入时机学习、音频上下文与多用户场景等后续方向。

本文第一作者龚思同为大连理工大学卢湖川团队博士生,前三位共同作者均为 Alaya Lab 实习生。大连理工大学卢湖川团队的主要研究方向为目标跟踪与显著性目标检测。Alaya Lab 侧重于世界模型与游戏智能体研究。东京大学佐藤洋一实验室的主要研究方向为第一人称视觉与人类行为感知理解。通讯作者黄逸飞为东京大学博士后和 Alaya Lab 研究员,研究方向为第一人称视觉与具身智能。

联系方式

赞赏支持

累计赞赏 0 积分 0 人支持
登录后赞赏

💬 发表评论