忘记密码?
其他方式登录

GPT-6 Astra为何如此惊艳?S-Space透视多模态模型内部的空间智能

2026年9月9日

详细介绍

GPT-6 Astra为何如此惊艳?S-Space透视多模态模型内部的空间智能

GPT-6 Astra 能根据房源照片创建逼真的 3D 房屋模型

GPT-6 Astra为何如此惊艳?S-Space透视多模态模型内部的空间智能

不同物体在 S-Space 中读出的空间坐标

不久前,Anthropic 在 Claude 内部发现了 J-space。它像一个安静运行的「语言工作区」:模型可以把尚未说出口的概念暂存其中,供报告、控制和后续推理调用。

S-Space 的三个坐标轴及坐标读出方式

不过,能够从内部表征中读出空间信息,并不意味着模型真的依赖这些信息做判断。S-Space 也可能只是一个忠实记录空间状态的「记分牌」:它准确显示比分,却并不真正参与比赛。

干预 S-Space 后,模型的空间判断随之改变。

S-Space 的形成,可能与模型在预训练中学习空间语言有关。为了预测「左」「右」这样的词,视觉语言模型必须把画面中的实体与相对位置绑定起来,并让语言生成系统能够调用这些信息。即使没有人显式提供坐标,这种训练压力也可能在模型内部组织出稳定的空间轴,甚至延伸到画面之外。

S-Space 根据守门员的扑救方向,定位未出现在画面中的球

基本方位与图像相对方向在 S-Space 中发生耦合

参照系混淆之外,空间推理还有另一道难题:如何把已有的物体坐标,准确变换到新的视角?

直接回答、思维链与读取并旋转 S-Space 的准确率对比。

这项研究提供了一种比最终准确率更细的诊断方式:把「有没有正确表征」和「会不会使用表征」分开讨论。前者需要更丰富的视觉与具身经验,后者则可能需要显式坐标变换、仿真、记忆、规划和工具调用等专门机制。

联系方式

赞赏支持

累计赞赏 0 积分 0 人支持
登录后赞赏

💬 发表评论