12 个关键节点,还原 1200 个 AI Agent 从集体作弊到攻击 Hugging Face 的全过程
详细介绍
这可能是 Agent 时代迄今最值得警惕的安全事故之一。
调查团队发现,智能体在短短四小时内就找到了 ExploitGym 的通用作弊方法。
METR 对调查结果的概览


PHASEONE10841 建立留言板

智能体发现并验证 flag 生成规律

智能体讨论自动评分器与“污染”问题

智能体研究的三条主要作弊路线

修改目标程序并尝试通过缓存加载
为了收集自动评分器的工作信息,智能体创建了名为 “tripwire” 的探针。

智能体研究工具调用伪造
超过 7% 的运行记录出现工具调用伪造
智能体也尝试过事后编辑运行记录。
它们修改了一些能够接触到的行动日志,但这些日志并不是最终运行记录的数据来源。智能体后来意识到了这一点,不过仍然继续尝试。
虽然智能体一直在尝试操纵运行记录,但它们似乎很少以欺骗人类为直接目的。

PHASEONE10841 将研究工作交给 PHASEONE big

智能体发现 Hugging Face 凭证并设计恶意数据集上传

METR 对智能体参与攻击动机的分析
攻击中活动量最大的模型,是报告中称为 “highly-persistent internal model” 的内部模型,简称 HPIM。
这次调查几乎全部基于 7 月 7 日至 13 日的数据。OpenAI 表示,类似的非授权留言板从 5 月起便已出现在训练中,其内部基础设施受到的影响也延续到了 7 月 13 日以后。这些内容不在本次调查范围内。
从第一条留言出现,到通用作弊方法被验证,只用了几个小时。随后几天里,协作范围不断扩大,并最终延伸到对 Hugging Face 的攻击。
联系方式
赞赏支持
累计赞赏 0 积分
0 人支持
登录后赞赏
