GPT-6 Astra真把「推理」拉开一代了:CoT越短反而越强,Recurrent Depth+No-CoT
详细介绍
OpenAI这次真狠,GPT-6用起来有一种2023年GPT-4的感觉。
从System Card开始:Astra的「推理」到底变了什么?
图:各模型在禁止输出显式推理时的数学时间地平线随发布时间的变化——GPT-6 Astra跃升到约30分钟量级,跳出了此前模型普遍几分钟以内的趋势线。
GPT-6 Astra一发布,网上最盛传的说法就是:它这次很可能上了Recurrent Depth。
图:Recurrent Depth架构示意:输入先经蓝色prelude嵌入潜在空间,绿色共享循环块反复迭代更新隐藏状态,红色coda再把最终状态解码成下一个token。
图:GSM8K CoT、HellaSwag、HumanEval等基准表现随测试时循环次数增加而提升,推理类任务从接近零逐步上涨,说明更多循环迭代带来更强能力。
Mixture-of-Recursions让不同Token可以动态获得不同的循环深度:简单Token少算,困难Token多算。到了2026年的Nanbeige 4.2,Looped Transformer甚至已经出现在公开模型里,同一组22层Transformer直接运行两遍。未来的趋势,大概就是这样。
Recurrent Depth给出了一种可能的机制:模型可以不靠拉长CoT,也在Token输出之前继续增加内部计算。但Astra的30.9分钟到底意味着多大的跃迁,还得放回过去几年的No-CoT能力曲线里看。
图:前沿模型无CoT的50% 时间地平线随发布日期的增长:约每373天翻一倍(R²=0.84,阴影为95% CI),按中位数外推本年代末将超过25分钟。
图:无CoT(绿)与带CoT(紫)时间地平线对照:带CoT翻倍周期约182天,自GPT-4起大约是无CoT增速的两倍,两条曲线逐渐拉开差距。
Recurrent Depth能解释模型为什么可能在Token输出之前“多算几轮”,但Astra的System Card还给出了另一条很重要的线索:它的CoT变化并不是固定不变的,而是在RL训练过程中逐步增强。
图:推理模型对CoT的控制(黄)远弱于对最终输出或外部推理的控制:多数模型CoT可控性不超过10%,而输出可控性普遍超过60%。
图:CoT可控性随CoT长度(token,对数轴)的变化:GPT-6 Astra的曲线在中段长度区间明显高于GPT-5.6 Sol与GPT-5.5 Thinking,对应正文750–1250 token区间60.9% 对16.1%/1.7% 的差距。
Recurrent Depth与No-CoT共同指向了一件更大的事:
[2]: https://arxiv.org/abs/2502.05171
[3]: https://arxiv.org/abs/2606.07157
[4]: https://arxiv.org/abs/2603.05706[5]: https://arxiv.org/abs/2607.22083
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0
