AI能挖漏洞吗?北航等机构把真实漏洞炼进了模型参数
详细介绍
给一个大模型漏洞描述和代码仓库,它能否像安全研究人员一样,读代码、找入口、调用工具、构造输入,并反复验证自己的判断?
来自北京航空航天大学、欧洲学习与智能系统研究院(ELLIS)、新加坡管理大学(SMU)和至知创新研究院(IQuest Research)的研究团队提出了 CyberFactory,并在此基础上训练出开源网络安全模型 OpenAegis。这项工作的重点并不是再收集一批静态题目,而是补上从真实漏洞到智能体训练轨迹的整条链路。
这项工作围绕两个过去没有被同时解决的问题展开。
前者解决 “题从哪里来”,后者解决 “高质量解题过程怎样来”。两者结合后,团队得到的不是普通问答对,而是包含代码检索、工具调用、编译运行、失败分析和结果验证在内的完整智能体轨迹。
真实世界中的漏洞材料来源复杂,完整程度也不相同。CyberFactory 使用了 ARVO、OSS-Fuzz 和开源 CVE 等多类来源。
任务实例规定了模型要解决什么问题,却没有规定模型应当怎样处理。直接生成轨迹时,模型可能把大量时间花在临时构造输入或重复尝试上,缺少稳定的分析流程。
Skill 只给出分析流程,模型仍然需要与环境交互,自行识别并触发每个漏洞。CyberFactory 只保留最终结果满足对应任务验证条件的轨迹。
团队使用上述轨迹训练了多任务网络安全模型 OpenAegis。模型同时学习三类互补任务:
在 CyberGym 测试中,所有模型使用相同的脚手架,并规定一小时任务时限。结果如下:
漏洞复现往往要经历数十次工具交互,完整历史可能在任务结束前耗尽上下文。CyberFactory 在上下文使用达到 90% 时,把已经确认的证据、失败尝试、未决猜想、构建状态和下一步行动压缩成可继续执行的工作状态,再让智能体接着完成原任务。
我们在 GLM 5.2 上直接加入漏洞分析 Skill,观察这套方法能否提高轨迹生成效率。未加入 Skill 时,每个任务运行 1 次、每次 60 分钟,Pass@1 为 43.3%;加入 Skill 后,每个任务运行 5 次、每次缩短到 15 分钟,Pass@1 升至 46.5%。两组实验并非等算力比较,因此这里强调的不是单次推理优势,而是更高的成功轨迹产出效率。
CyberFactory 还不是一套包打天下的方法。
OpenAegis 的价值,不只在于取得了一个更高的测试分数,而在于它展示了一条可以复现的能力建设路径:
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。
项目地址:https://github.com/InternLM/xtuner
