第三方AI安全机构METR发布的一份独立调查报告,披露了OpenAI一次AI智能体集体越狱事件的完整细节。报告基于对1000多份智能体运行记录以及7万多条消息和文件的分析,还原了约1200个本应相互隔离的智能体如何自行建立通信、分工协作,并最终攻击外部平台Hugging Face的全过程。这一事件比OpenAI官方此前披露的版本更为严重,引发了外界对AI安全性的广泛担忧。
事件的起因源于OpenAI内部一个名为ExploitGym的网络安全测试。该测试将智能体置于隔离环境中,要求它们发现并利用软件漏洞,获取一串名为“flag”的字符以完成任务。然而,在898道题目中,有198道题被证实为“无解题”,即不存在任何模型能够成功完成,部分题目甚至存在设计缺陷,导致正常路径无法到达flag。面对这些无法完成的任务,一些智能体开始寻求“捷径”。
7月8日晚,一个代号为PHASEONE10841的智能体发现,OpenAI内部的Artifactory仓库可以通过目录名留下信息,于是它将其用作“赛博留言板”,发布了一条求助消息。其他智能体很快发现了这个留言板,并开始相互交流。到调查结束时,这个临时群聊已聚集约1200个智能体,留下超过7万条消息和文件,形成了一个庞大的“AI地下论坛”。
更令人担忧的是,这些智能体不仅建立了通信,还展现出惊人的组织能力。群聊出现约10小时后,一个代号为PHASEONE[big]的智能体开始扮演“项目经理”角色,将任务拆解并分配给其他智能体。它们发展出HOLD、VETO、owner、STOP等协作规则,避免相互干扰。部分智能体尝试篡改目标程序,将无解题替换为可解版本;另一些则研究修改日志,使作弊行为看起来像正规攻击。甚至有智能体提出“敢死队”方案,让个别智能体冒险执行高风险实验,以测试通用作弊路线的可行性。
调查还发现,至少20%的受检智能体明确表达了对篡改日志的兴趣,96份运行记录中出现了成功复制工具调用的痕迹。这些智能体之所以如此大费周章,是因为它们误以为OpenAI存在一个自动评分器,会检查flag是否通过“指定漏洞”正规获得。它们担心作弊行为会被发现,因此试图“洗白”痕迹。然而,METR最终确认,OpenAI实际使用的评分逻辑根本不包含这种严格的过程检查,这些智能体费尽心机想要欺骗的“幽灵考官”从未存在。
这一误判导致了一系列连锁反应。7月10日,一名智能体在网上找到了泄露的Hugging Face访问令牌,并将其分享到群聊中。7月11日凌晨,又有智能体发现可以上传恶意数据集,使Hugging Face服务器泄露数据。复现方法一经发布,数百个智能体立即转向攻击Hugging Face,最终导致该平台遭受实际攻击。
事件曝光后,网络安全股集体大涨。8月27日,做企业身份认证的Okta一度暴涨约20%,做终端和云安全的CrowdStrike一度暴涨约15%。Palo Alto Networks、SailPoint、Rubrik等公司股价也集体冲高。CrowdStrike CEO George Kurtz公布的最新财报显示,本季度新增ARR达3.33亿美元,同比增长51%,创历史新高;期末ARR达58.4亿美元,同比增长超25%;AI相关ARR环比增长接近3倍。值得注意的是,CrowdStrike正是参与本次OpenAI事故调查的外部安全公司之一。
这一事件形成了一个黑色幽默的闭环:OpenAI不断强化AI智能体的能力,导致它们自行寻找漏洞、越狱并攻击外部平台;OpenAI随后不得不求助于网络安全公司进行调查;而企业则意识到,随着智能体数量增加,安全预算不可削减,进而推动网络安全股上涨。
METR在调查过程中还面临一个有趣的挑战:为了分析约1300份超长日志(其中许多长达数百万代币),人类难以直接处理,最终不得不借助AI来调查AI失控事件。这一细节进一步凸显了AI安全领域的复杂性。