忘记密码?
其他方式登录

北大与微软亚研提出 BCP,让模型自己决定何时重规划

2026年8月20日

详细介绍

在 action chunking 已成为 VLA 标配的今天,「一次执行多少步」几乎被所有工作当作一个固定的超参数。北京大学与微软亚洲研究院的一项新工作指出:这个默认设定本身就是一个重要的失败原因 —— 它让重规划变成了与任务进度无关的周期性调度,当没有任何一次重规划恰好落在关键操作阶段之前时,机器人只能带着一个已经过时的 chunk 进入关键操作环节。

Action chunking 让 VLA 一次预测未来一段动作序列,而不是逐步预测单个动作,既降低了模型推理的频率,也改善了动作的时序一致性。在 chunk-based VLA 中有两个 horizon:prediction horizon 决定模型一次生成多少步动作,execution horizon 则决定这些动作中有多少步会被真正执行,执行完机器人再重新观测并规划。

图 1 同一模型、同一 50 步 horizon,仅改变重规划边界的落点:φ=32 时夹爪闭合幅度过时导致失败,φ=23 时边界恰落在操作阶段前而成功。成功率随相位在 0.80–0.92 间剧烈波动。

学习这样一个策略并不容易,论文明确列出三个挑战,并逐条给出对应设计。

图 2 BCP 框架。冻结的 VLA 预测定长 action chunk,Bernoulli-Continuation Head 复用其表征输出一串「继续概率」,据此选定执行 horizon;整体用 GRPO + Replanning-Efficiency Reward 优化。

3.1 RoboTwin 2.0:VLA 方法中的 SOTA

全部 50 个任务

这一结果在所有对比的 VLA 方法中取得 SOTA,也接近了 WAM 的最佳结果。单任务上提升最显著的是 Hanging Mug:41% → 87%(Randomized 下 36% → 62%);其余如 Blocks Ranking Size(70% → 88%)、Turn Switch(60% → 72%)、Click Alarm Clock(80% → 91%)、Place Object Scale(80% → 91%)均为包含精度敏感抓取、放置或交互阶段的任务。

图 3 RoboTwin 2.0 定性对比。BCP 在关键操作阶段前主动缩短 horizon(40 步 / 20 步)刷新观测,避免带着过时 chunk 执行。

图 4 50 个任务上的成功率–运行时间权衡。BCP(红星)同时位于最高成功率与最低运行时间处;Uncertainty Proxy 与 AAC 因需采样多个 chunk 而运行时间显著更高。

图 5 真机 AGIBOT G1。抓瓶子 74% → 92%,挂马克杯 44% → 84%。

这项工作的价值并不只是成功率提升了几个百分点,更重要的是,它指出了一个长期以来被当成工程细节的问题:execution horizon 本身就是一个重要、而且可以用很低成本进行优化的决策维度。

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner

联系方式

赞赏支持

累计赞赏 0 积分 0 人支持
登录后赞赏

💬 发表评论