具身导航大模型白训了?coding-agent裸接机器人,成功率78%反超工业级专用模型
详细介绍
不建图、不记忆、零训练:coding-agent 被直接扔进屋里,导航成绩反超工业级专用模型。
一图看懂这篇论文。左:三条路线的区别在「谁主导决策循环」:policy 是一张网络每步出动作,workflow 是固定流水线,agentic 是模型自己掌舵。中:最小接口探针,一个 coding-agent,一路单目相机,四个动作,别的什么都没有。右:R2R-CE 主结果。
先交代下背景。视觉语言导航是具身智能的经典难题:给机器人一句话,比如「出卧室,沿走廊走,在盆栽处右转,停在沙发旁」,它得在没见过的房子里走到指定位置。
然后让推理模型自己决定每一步:自己看图、自己想、自己走,走错了自己发现、自己退回去重走。论文把这种组织方式称为 agentic embodied control:推理模型直接掌舵每一个动作,推理和控制始终对齐。
在 R2R-CE val-unseen 随机抽取的 100 条路径上(全部零样本,不做任何训练):
研究团队在三套 coding-agent 框架(mini-swe-agent、Claude Agent SDK、Codex CLI)× 多个前沿模型上跑完了整个消融矩阵,结论很干脆:
更有意思的是通用性测试:同一套循环、同一个 agent,不做任何针对性开发,直接换基准:
先泼盆冷水:78% 是短指令基准上的成绩。团队特意换上路线更长、指令更啰嗦的 RxR-CE 再跑(同一模型、同一框架),成功率直接掉到 26%;就算把路径点预测器递给它,也只爬到 39%,比自己在 R2R-CE 上的成绩低了 30 个点。
团队还把同一个 Agent 部署到了宇树 Go2 机器狗上,在两个真实室内场景跑了 31 条诊断任务。这批任务是手工设计的,普遍比标准 VLN/EQA 基准更刁钻:有的指令埋着要先观察世界才能判断的条件分支(「出门后看左边,如果只有一个垃圾桶就走过去停下,是多个就改去电梯」);有的要求边走边数数,还不能数重(「数数这间屋里有几把高椅子,矮凳不算」);有的要求多段折返回到之前经过的物体旁,还有专门测「身体意识」的过门任务。标准基准考「照路线走」,这批题考的是走路的同时还得动脑、记数、知道自己身子有多大。
