忘记密码?
其他方式登录

20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA!

2026年9月7日

详细介绍

机器人 VLA 还在疯狂卷数据,StarVLA 团队这次却把目光放到了另一个问题上:除了继续 scale 数据以外,能不能让每一条数据都学得更值?

图 1|VLAct 主要结果一览:RoboDojo、RoboTwin 2.0、RoboCasa-GR1,以及 16 GPUs 与全开源。(项目宣传图)

过去几年,大模型已经证明了一条非常有效的路线:数据更多、模型更大、算力更强,能力就不断往上走。VLA 自然也希望复制这条 Scaling 路线。

图 2|Naive VLA pre-training 容易绑定预训练场景;VLAct 把目标转向更可迁移的 Action-aware Representation。

VLAct 真正的起点,来自团队前期实验中一个很有意思的现象。现在很多 VLA 都会从一个 VLM 出发,挂上 Action Head,再用机器人数据继续训练。很自然的想法是:Action 预测越准,说明这次 VLA 预训练越成功。

图 3|Action supervision 会直接塑造 Backbone:同 Head 性能提升,并不自动转化为 Cross-head 迁移能力。

围绕这个目标,VLAct 没有重新发明复杂的 Policy Architecture,而是在 continued pre-training 阶段做了三件事。

图 4|VLAct 完整训练框架:Preserve VLM Prior、Multi-head Continuous Supervision、Partially Unified Action Space,下游重新初始化 Action Head。(论文 Figure 3 原图裁切)

最终,这种 Representation 能不能迁移,还是得看结果。在 LIBERO-Plus 上,VLAct 达到 82.6%;到了双臂操作的 RoboTwin 2.0,Data Scaling 设置下 Clean 成功率进一步达到 92.5%,Random 设置也达到 90.8%

图 5|真实机器人评测任务:包括 In-domain 与 Out-of-domain、短时序、长时序和双臂操作。(论文 Figure 11 原图裁切)

最能体现迁移能力的实验来自 RoboCasa-GR1。GR-1 这种机器人在 VLAct continued pre-training 的数据里一次都没有出现过:预训练阶段模型看到的是 Franka、AgileX 等机器人,然后再把 Backbone 拿到 GR-1 上进行下游 Fine-tuning。

图 6|论文 Figure 5:真机单臂/长时序/双臂结果,以及 RoboCasa-GR1 跨本体迁移;20%下游数据已超过公开 full-data baselines。

VLAct 并不是想证明“数据不重要”。机器人数据当然还需要继续 Scale,但由于机器人数据昂贵、稀缺,而且很难完整覆盖真实物理世界,Representation Quality 本身也应该成为 VLA Scaling 的一条独立轴线。

20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA!

联系方式

赞赏支持

累计赞赏 0 积分 0 人支持
登录后赞赏

💬 发表评论