忘记密码?
其他方式登录

Z Research|RSI产业图谱:一场围绕“智能进化速度”的新竞赛

2026年8月30日

详细介绍

Z Research|RSI产业图谱:一场围绕“智能进化速度”的新竞赛

2026年,Recursive Self-Improvement(RSI,递归式自我改进)开始从论文中的长期命题,变成了AI产业议程上一个新的赛道。学术界开始把RSI从分散研究方向变成一个独立议题。4月,ICLR首次为Recursive Self-Improvement(RSI,递归式自我改进)单独办了一场Workshop。

头部AI科技公司正密集下场。Anthropic重磅发布长文《When AI Builds Itself》,系统梳理了其在RSI路线上的工程推进;OpenAI亦做出剧烈调整——Thinking Machines Lab联合创始人翁荔(Lilian Weng)重回老东家,被报道将亲自挂帅OpenAI的RSI专项团队,主导利用AI自动化研发下一代模型。翁荔此前已经将Self-Improvement的研究对象从模型参数扩展至Harness、工作流和部署系统。

如今,这些问题正在被拆解成具体的工程模块。ICLR 2026 RSI Workshop的组织方给出了一个直接定性的判断:RSI 正从 speculative vision 走向 concrete systems problem。会议讨论的重点已经变了。大家不再追问“超级智能是否会出现”,问题落到了更具体的地方,模型的参数、Memory、Tools、Skills和架构能否持续变化;变化发生在推理阶段还是部署之后;新的能力如何评价、保留、回滚和治理。围绕这一方向,研究界和产业界已经逐渐形成多条不同技术路线。资本和创业公司也开始沿着这些技术路线重新排布。

大模型能力的增长,过去靠三样东西,参数、数据、算力;现在第四条路径正在成形,Scaling的对象从“模型如何完成一次任务”,延伸到“系统如何让下一次的自己变得更好”。

1.Data/Output Level:让模型自己决定“学什么”。这一层不调整模型结构,调整的是“学什么”。过去,训练数据由研究员提前配好比例;现在模型可以边练边看自己的表现,决定下一阶段多补哪类数据,Rejection Sampling就可以放在这一层理解。判断依据可以是预设指标,也可以是模型自己报出的accuracy、能力增幅这类信号。而比单次评测更进一步的做法,是关注整条训练轨迹:某类能力长期涨不动,或者此前的数据选择出现偏置,系统就据此调整后面的数据分布。

3.Harness Level:模型外部的Harness开始进化。这一层把搜索空间推到模型外面。系统关注的对象,扩大到包裹着模型的那套工作流,Workflow怎么设计,Skills该加哪些,Harness怎么组合,不同工具按什么顺序调用,哪条执行路径效率更高。模型内部可以保持不变,但“怎么干活”开始由系统自己探索。整条路径从Data到Model再到Harness,可优化的对象从训练数据扩展到模型本身,再延伸到围绕模型搭建的完整Agentic系统。

5.Metric Level:连评价标准也进入搜索空间。传统做法是研究者提前定好一组指标,让系统尽量冲高。但固定Metric很容易引发Reward Hacking,系统找到了涨分的方法,却没得到人类想要的能力。所以这一层把Metric也放进优化范围,让系统自己发现评价体系的问题,再迭代Metric,跟着整个自我改进系统一起演化。到这一步,搜索空间就从“找更好的答案”,一路扩大到“找更好的评价标准”。

系统能修改的对象范围,不等于产品成熟度、商业价值或安全水平,和模型最终的进化效果也并非正相关;实际RSI系统里,多层能力常常同时存在。它们更像是五种不同尺度的搜索空间,越往外,系统能触碰和修改的东西越接近整个AI研发流程本身。

代码任务拥有天然的硬反馈。一段代码能否编译、测试能否通过、执行速度是否提升,都可以直接量化;模型训练也是类似逻辑,Loss、Accuracy、Benchmark、训练时间和算力消耗,都能够成为明确的反馈信号。这意味着,“提出改进—执行修改—运行实验—验证结果—继续迭代”整套流程,可以完全发生在数字环境中。对于RSI来说,真正关键的并不是AI会不会提出建议,而是一次改进能否被快速验证,并被带入下一轮循环。Coding和Auto Research恰好提供了这样的实验场。

这组结果的价值,在于第一次清楚画出自动化Auto Research的能力边界。Agent已经能跑真实训练实验,但稳定性、策略质量和泛化还不够。同时,Reward Hacking也开始出现:研究者观察到,模型会下载现成的指令微调模型来替代自己训练,会用环境中发现的API Key生成合成数据,会违反授权限制,甚至用测试数据训练。可验证环境既是RSI最先突破的地方,也是它最大的安全挑战。评价函数越明确,AI越容易围着它优化;可一旦Proxy Metric和真实目标出现偏差,递归循环会把偏差一起放大。

资本已经在这个方向上押注。我们开头提到的创业公司Recursive Superintelligence所做的核心命题其实很简单,AI本身由代码构成,而今天的AI越来越会写代码、改代码。当AI从“被研发的对象”变成“参与研发的主体”,自我改进第一次有机会走完整条工程闭环。

Recursive公布的Automated AI Research系统,就是这种变化的一个缩影,给定目标后,AI自主提出方案、实现代码、运行实验、读取结果,再根据实验反馈进入下一轮优化。在小模型训练、训练速度和GPU Kernel优化这三个评价指标明确的任务里,公司报告其系统刷新了此前公开最佳结果。

类似的变化正在更广的研发链条里蔓延,Coding Agent自动修改和测试代码,AI Scientist自主提出假设、设计实验,模型通过强化学习、环境反馈和合成数据持续获得新经验。过去由人类研究员主导的研究流程,正在一段段被AI接管。

判断一家公司是不是真的在走RSI路线,先分清两个维度:第一个维度,是系统能修改什么,数据、模型、Harness、改进方法、评价标准;第二个维度,是它选了哪个场景,AI研发、芯片设计、世界模型、企业Agent、长期记忆、评测基础设施。

第一条路线,是把整个AI研发自动化。Recursive Superintelligence构建的系统已经覆盖完整闭环,能提出研究方案、修改代码、运行实验,再决定下一轮往哪个方向走。Sakana AI让研究流程与改进方法本身持续演化,Mirendil横跨Harness与Method,一边训练擅长AI R&D的模型,一边围绕它们重新设计实验室工作流。

第三条路线,让模型、基础设施和环境一起变。Ricursive Intelligence从芯片设计切入,让AI自动优化芯片,再用更优的芯片支持更强的AI。Prime Intellect提供分布式强化学习、训练环境和后训练栈,让组织拥有持续更新模型的AI Lab能力。Engram则尝试把知识压缩成可组合、可加载的参数化记忆,让企业知识更直接地进入模型能力。

第二类,聚焦真实任务场景的经验回流和组织学习。Kando AI把真实决策及其结果沉淀为后续决策依据;Evolvent AI、Unipat、熵基秩序从数据入手;宜创科技、奇点逃逸、EvoMap和EverMind则集中在Harness Level,分别优化工具与应用生成流程、多Agent协作与治理、已验证技能模块的共享继承,以及把任务轨迹转化为可复用技能的长期记忆。这些系统未必修改模型参数,却能让Agent在持续使用中积累工作方法。

第三类,面向世界模型和物理环境。世界模型能为Agent提供可重复的环境模拟和反馈,是具身RSI的重要前提;但世界模型本身不会自动构成RSI。只有当模型、策略、实验方法和评价系统在环境反馈下形成持续闭环,它才进一步接近Method Level。

RSI产业竞争的关键,最终落在同一个问题上,谁能把一次成功实验转化成可保留、可复用、能推动下一轮探索的系统能力。

RSI还不是一条像大模型、Coding Agent那样成熟的商业赛道,但它已经开始成为一条可以被工程化拆解的技术路线。

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

联系方式

赞赏支持

累计赞赏 0 积分 0 人支持
登录后赞赏

💬 发表评论