忘记密码?
其他方式登录

解决20年数学难题!微软开源Argus用证据驱动1548小时自动研究

2026年9月7日

详细介绍

从「会执行」到「会掌舵」,长程 Agent 还缺什么?

图 1:Argus 运行时、能力基准与交付结果总览。

过去两年,Agent 工程的主要进展集中在 Harness:借用自动驾驶的 FSD 作比喻,模型像发动机,Harness 像传动系统,但真正决定车辆驶向哪里的,仍是坐在屏幕前的人。短任务中,就像普通的自动泊车,任务本身还能提供明确反馈;一旦任务延伸到数天,研究问题往往既没有稳定的奖励,也没有从一开始就定义清楚的目标。现有 Agent 由此暴露出真正瓶颈:它们已经会执行,却还不会在不确定性中持续判断。

图 2:Argus 通过实现 auto-research 的自主科研,将人类的角色从持续推动的驾驶位变为副驾驶。

Argus 把长期项目组织成持久化的 Campaign,再拆成一系列边界明确的 Mission。它的基本闭环是 Manager → Planner → Engineer ⇄ Reviewer → Manager:

图 3:Argus 的长程运行机制。四类角色围绕持久状态循环,Campaign 可在八个研究阶段间推进或回滚。

真正决定长程 Agent 是否成立的,是时间能否转化为真实的研究成果。Argus 开源后不到一个月,已经在基础设施、材料、芯片、数学和 AI 系统研究中做出卓越贡献,同时我们是首个公布完整端到端数学猜想解决筛选日志的团队,将所有的运行轨迹 session 等均开放,以下为 Argus 开源后各项成果的汇总:

图 4:Argus 代表性研究成果、关键指标与验收依据

图 5:Argus 在全流程论文生产中的交付结果。

长程智能是让 Token 转化为智能,再用智能把一个研究项目持续推进,产生实际价值。Argus 将原本彼此割裂的模型调用组织成一套持续运转的研究系统,让 Evidence-Driven 控制方向,再通过自进化把经验沉淀为能力。

联系方式

赞赏支持

累计赞赏 0 积分 0 人支持
登录后赞赏

💬 发表评论