Facet-0:NTU王子为团队让机器人在精密装配中「看得懂、插得准、出错能恢复」
详细介绍
机器人正在变得越来越「通用」。
从抓取日常物品,到根据语言指令完成多步骤操作,视觉 — 语言 — 动作(VLA)模型正在让机器人摆脱过去「一项任务、一套程序」的开发方式。但当机器人真正走向制造现场,问题也随之发生了变化:会不会做,已经不是唯一标准;能不能在毫米甚至亚毫米级接触中稳定完成,并在出错后自己恢复,才决定它能否真正进入生产环节。
针对这一问题,新加坡南洋理工大学(NTU)PINE Lab 团队研发了面向接触丰富型精密操作的机器人基础模型 Facet-0,试图让机器人不仅理解「要做什么」,还能够在真实接触中判断「做得对不对」,并根据失败经验持续改进。
Facet-0 完成 RAM、CPU、Disk、GPU 等装配任务
更重要的是,82% 并不是单纯依靠扩大预训练得到的。Facet-0 的完整训练流程将成功率从预训练阶段的 16% 提升到 RL 后训练阶段的 38%,再通过轻量化适配达到 82%。在部署后训练对比中,人工干预率由 47% 降至 24%,失败恢复率由 44% 提升至 81%。
发生卡滞后回撤、重新对齐并完成插入
通用 VLA 模型已经能够理解指令、识别物体,并完成许多日常操作。但制造现场真正困难的部分,往往发生在视觉「已经完成任务」之后。
要让模型学会这种能力,首先需要让数据本身包含「接触是如何发生的」。
但即使机器人已经能够感知和控制接触,还有一个更难的问题:一次装配最终成功了,是否意味着中间所有动作都值得学习?
对于制造机器人而言,真正难以规模化的,从来不是做出一次漂亮的 Demo。
【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。
项目地址:https://github.com/InternLM/xtuner
