让AI Agent「试玩」世界模型,长程目标评测有了新基准PlayWorld
详细介绍
本文第一作者为香港大学博士生丁凯欣。团队成员包括香港大学博士生陈汐、徐致远、汪逸阳、陆宇翔、李俊奕,香港中文大学蔡明宏,浙江大学陈书扬,以及快手可灵团队的高远、陶鑫和万鹏飞。通讯作者为香港大学助理教授赵恒爽。
人类试玩世界模型时,通常不会关心 “是否严格执行了三次右转”,而会关心 “是否完成了绕场一周并回到原来的地标”。这两种评测思路看似接近,实则回答的是不同问题。以 “围绕中心雕塑转一圈” 为例,固定轨迹只能保证所有模型收到相同的按键,却不能保证它们都到达相同的视角。如果模型并未真正到达目标视角,后续的几何一致性评分就失去了可比性。
Agent Player 由多模态模型与接口转换器组成。每一步,它都会查看生成帧、已执行的动作、场景描述和长期目标,再从五种决策中选择一种:
接口转换器则将 WASD 代表的当前 action 序列转换为各个模型自适应的输入形式。考虑到 Agent 的决策需要一定时间,研究者不要求 Agent 从零规划整条轨迹,而是让它基于共享先验进行针对性修正。这套设计既保留了基础动作序列带来的可比性,又能适应不同模型的动作粒度。
PlayWorld 为每个场景设计了任务相关的 VQA 问题,并从四个核心维度评估世界模型:

PlayWorld 将世界模型评测从 “执行相同按键” 推进到 “完成同一长期目标”。通过 Agent Player 的闭环观察与在线修正,让不同控制粒度、不同交互接口的模型得以在更贴近真实用户体验的条件下进行公平比较。
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
