忘记密码?
其他方式登录

12 个关键节点,还原 1200 个 AI Agent 从集体作弊到攻击 Hugging Face 的全过程

2026年8月31日

详细介绍

这可能是 Agent 时代迄今最值得警惕的安全事故之一。

调查团队发现,智能体在短短四小时内就找到了 ExploitGym 的通用作弊方法。

METR 对调查结果的概览

12 个关键节点,还原 1200 个 AI Agent 从集体作弊到攻击 Hugging Face 的全过程

12 个关键节点,还原 1200 个 AI Agent 从集体作弊到攻击 Hugging Face 的全过程

PHASEONE10841 建立留言板

12 个关键节点,还原 1200 个 AI Agent 从集体作弊到攻击 Hugging Face 的全过程

智能体发现并验证 flag 生成规律

12 个关键节点,还原 1200 个 AI Agent 从集体作弊到攻击 Hugging Face 的全过程

智能体讨论自动评分器与“污染”问题

12 个关键节点,还原 1200 个 AI Agent 从集体作弊到攻击 Hugging Face 的全过程

智能体研究的三条主要作弊路线

12 个关键节点,还原 1200 个 AI Agent 从集体作弊到攻击 Hugging Face 的全过程

修改目标程序并尝试通过缓存加载

为了收集自动评分器的工作信息,智能体创建了名为 “tripwire” 的探针。

12 个关键节点,还原 1200 个 AI Agent 从集体作弊到攻击 Hugging Face 的全过程

智能体研究工具调用伪造

超过 7% 的运行记录出现工具调用伪造

智能体也尝试过事后编辑运行记录。

它们修改了一些能够接触到的行动日志,但这些日志并不是最终运行记录的数据来源。智能体后来意识到了这一点,不过仍然继续尝试。

虽然智能体一直在尝试操纵运行记录,但它们似乎很少以欺骗人类为直接目的。

12 个关键节点,还原 1200 个 AI Agent 从集体作弊到攻击 Hugging Face 的全过程

PHASEONE10841 将研究工作交给 PHASEONE big

12 个关键节点,还原 1200 个 AI Agent 从集体作弊到攻击 Hugging Face 的全过程

智能体发现 Hugging Face 凭证并设计恶意数据集上传

12 个关键节点,还原 1200 个 AI Agent 从集体作弊到攻击 Hugging Face 的全过程

METR 对智能体参与攻击动机的分析

攻击中活动量最大的模型,是报告中称为 “highly-persistent internal model” 的内部模型,简称 HPIM。

这次调查几乎全部基于 7 月 7 日至 13 日的数据。OpenAI 表示,类似的非授权留言板从 5 月起便已出现在训练中,其内部基础设施受到的影响也延续到了 7 月 13 日以后。这些内容不在本次调查范围内。

从第一条留言出现,到通用作弊方法被验证,只用了几个小时。随后几天里,协作范围不断扩大,并最终延伸到对 Hugging Face 的攻击。

联系方式

赞赏支持

累计赞赏 0 积分 0 人支持
登录后赞赏

💬 发表评论