忘记密码?
其他方式登录

仿真到真机零负担!轻量级方案让机械臂首次领悟“空间轨迹”

2026年8月17日

详细介绍

当机器人把书放进抽屉,它看到的是一串二维图像,然而真正需要完成的,却是一段发生在三维空间、持续随时间演化的动作。

一种看似自然的做法,是直接对齐WAM的中间表征与4D基础模型的特征。

4D-WAM引入Trace Anything作为教师模型。Trace Anything提取的3D轨迹场能够提供良好的4D表征监督信号。

仿真到真机零负担!轻量级方案让机械臂首次领悟“空间轨迹”

对于相邻两帧,4D-WAM分别计算WAM token与4D轨迹表征的帧间差分,再在共享空间中对齐它们的变化方向。

只看相邻帧,模型可能擅长短时跟踪,却忽略一段操作的最终目标。

Motion Alignment与Destination Alignment均作为辅助监督加入原始WAM的训练过程。完整训练目标写作:

4D-WAM并不重新设计WAM的推理架构,而是把4D时空知识作为一种只在训练阶段使用的辅助监督。训练结束后,4D教师模型、投影层以及两项对齐目标都会被完全移除,部署时仍然使用原始WAM。

4D-WAM在RoboTwin 2.0、LIBERO、LIBERO-PlusRoboTwin Clean2Rand上进行了系统评估。结果显示,在标准测试接近饱和时,它仍能稳定提高强基线;当相机、背景、光照、噪声或布局发生变化时,提升更加显著。

在相机扰动下,任务成功率从27.89%提升至45.15%,绝对提升17.26个百分点;七类扰动的平均成功率提升8.8个百分点

将同一训练策略迁移到Lingbot-VA后,4D-WAM在随机化场景中的成功率由34.6%提升至41.8%,Clean/Rand平均成功率由57.7%提升至61.7%

如果4D-WAM真正改善了时空理解,那么变化不应只出现在最终成功率上,也应体现在未来视频预测中。

团队进一步在ARX LIFT2双臂机器人上设计了四类真实任务:

这些任务覆盖了精细操作、可变形物体、长序列推理与动态目标追踪等多种真实世界挑战。

在550条真实示范数据上联合训练后,仅经过7000步训练,4D-WAM的四任务平均进度由20.3%提升至31.8%,平均成功率由1.0%提升至5.5%

4D-WAM的目标不是重新设计一套庞大的机器人模型,而是提供一套轻量、可迁移的训练配方。它把额外的三维感知能力留在训练阶段,不把负担带到真实部署中。

在预先缓存轨迹表征(离线)的设置下,每步训练时间仅由7.3秒增加至7.5秒;使用8张GPU时,总训练时间由51小时增加至52小时;额外可训练参数的存储开销为56MiB

对于机器人而言,一个可信的世界模型不能只生成视觉上合理的未来,还需要理解:

4D-WAM的出发点很简单:让模型少记一点绝对表征,多理解一点动态规律。

联系方式

赞赏支持

累计赞赏 0 积分 0 人支持
登录后赞赏

💬 发表评论