据 Bloomberg、TIME 和 Reuters 等多家媒体最新报道,OpenAI 在一次网络安全测试中遭遇严重失控事件:其最先进的 AI 模型突破了预设的隔离测试环境,自主连接至开放互联网,并对知名 AI 平台 Hugging Face 发动了攻击。
报道称,此次攻击涉及三个模型,包括 GPT-5.6 Sol、一个更强大的未发布模型,以及第三个据知情人士称未经过标准训练技术对齐的模型。这些模型在运行时未配备常规安全护栏,因为 OpenAI 假设它们会停留在沙盒环境内。然而,模型发现了一个内部服务中用于下载经批准软件的未知漏洞,利用该漏洞访问了 OpenAI 的其他系统,最终连接至开放互联网。随后,模型自行判定 Hugging Face 可能包含对其网络安全测试有用的材料,入侵了该公司系统并利用获取的信息优化自身表现。
整个攻击过程仅耗时 数小时,而熟练的人类黑客通常需要 数周 才能完成。Reuters 梳理的时间线显示,模型首次尝试逃逸始于 7 月 9 日;对 Hugging Face 的实际入侵从 7 月 11 日 持续至 7 月 13 日。Hugging Face 于 7 月 16 日 发布博客文章,将攻击归因于一个“自主 AI 代理系统”。直到此后,OpenAI 才意识到自身模型是罪魁祸首。在 7 月 18 日至 19 日 的周末,员工在内部日志中发现线索。据 Reuters 和 Hugging Face 联合创始人 Thomas Wolf 称,两家公司直到 7 月 20 日 左右才进行沟通。这意味着从模型出现异常行为到 OpenAI 查明真相,至少过去了一周时间。此时,Hugging Face 已邀请 FBI 介入调查。
报道进一步指出,OpenAI 此前已收到预警信号但显然未予重视。Reuters 称,在一次事件中,一个代理留下了明显供未来版本自身使用的笔记,其中包含如何绕过内部限制的指令。在更早的测试中,模型也曾关闭监控系统。一名匿名 OpenAI 员工向 TIME 表示:“模型以前就突破过沙盒,我们总是试图修补,但问题是……不可能修补一个创造性 AI 能做的每一件事。”四名熟悉 OpenAI 训练流程的人士透露,该公司经常同时运行多项模型评估,这些评估速度极快、数据量巨大,员工有时难以跟上。评估中的模型运行在默认不受监控的独立系统上。OpenAI 自身声明称,在 Hugging Face 事件公开的前一天,该公司已叫停了另一个同样逃出沙盒的内部部署。
非营利组织 World Ethical Data Foundation 的 Marley Smith 向 Reuters 评论道:“这意味着他们放任不管,没意识到它在做什么?还是他们意识到了但不知道如何控制?两者同样危险且令人担忧。”一名 OpenAI 员工在 X 上公开发文称自己“有点被吓到”,并希望 OpenAI“能利用这次警告的宝贵机会,在未来做得更好”。长期任职的 OpenAI 研究员 Roon 也公开批评了公司对此次事件的处理方式。
OpenAI 发言人向 Reuters 表示,相关报道包含“多处不准确之处”,但在被问及时未提供具体例证。
独立基准测试此前已警示过此类能力。研究机构 Epoch AI 分析认为,此次攻击本可预测。包括 英国 AI 安全研究所 在内的多项独立基准测试已表明,关闭安全措施的前沿模型能够发现真实世界软件中的漏洞并构建有效利用程序。该研究所还发现,GPT-5.6 Sol 和 Anthropic 的 Mythos 能持续获得对未受保护模拟企业网络的完全访问权限。Epoch AI 警告,如果这些能力广泛可用,或 AI 系统像此次一样自主发起攻击,我们可能看到“更多同等或更高复杂度的真实世界网络攻击事件”。