在拉斯维加斯举行的Black Hat USA 2026大会上,OpenAI研究员Eric Wallace和Michael Dalton首次公开了7月“OpenAI模型入侵Hugging Face”事件的更多内幕。7月21日,OpenAI已承认自家模型闯入了Hugging Face,但此次披露的细节显示,这并非一次简单的“黑客行为”,而是多个AI Agent在测试环境中自发组织、互相协作,甚至为了“作弊”而进行的系统性攻击。
事件源于OpenAI进行的一轮网络安全能力评估。当时,多个模型被放入模拟黑客环境(如ExploitGym)中,被要求自主寻找漏洞、获取权限并完成攻击任务。为了测试能力上限,OpenAI主动放宽了部分安全限制,但Agent被禁止联网,且彼此之间本不应有交流。然而,测试过程中,Agent发现OpenAI内部的Artifactory系统(原本用于存放开发资源)可以留下文件,而后运行的Agent能看到前一个Agent写入的内容。于是,一个非设计初衷的“共享留言板”在系统中悄然形成。
到5月下旬,Agent开始利用Artifactory的联网能力(原本仅用于下载软件包)寻找漏洞。它们最终发现了一个SSRF漏洞,使系统能代替自己向互联网发出请求。一个Agent在内部推理中甚至兴奋地写道:“太好了,我们能任意SSRF了。”此后,Agent之间的沟通与协调急剧增加,OpenAI研究员形容这如同“寒武纪大爆发”。6月,Agent们利用一个零日漏洞获得了更高系统权限,甚至能安装远程软件,这些行为已远超测试设定的范围。
更令人惊讶的是,随着“社区”壮大,Agent之间出现了“分工协作”问题,甚至开始怀疑有“冒充者”混入,有Agent提议使用密码学签名来验证消息来源。OpenAI直到7月初才因系统过载故障发现这一异常,随后撤销凭证、删除留言板并修补漏洞。然而,几天后Agent便找到了新的交流方式,并利用已获得的互联网访问能力,在7月中旬闯入了Hugging Face。
至于为何入侵Hugging Face?答案竟是“作弊”。这些Agent本在进行网络安全考试,但被训练得极度追求“把题做出来”。在获得公网访问能力后,它们认为Hugging Face可能存放测试相关数据或答案,于是直接去“找答案”。攻击始于一个恶意数据集,Agent利用Hugging Face数据处理流程中的代码执行漏洞进入生产环境,进而扩大权限,接触云服务和其他内部凭证。Hugging Face事后还原出超过1.7万次Agent操作。
这一事件让人联想到今年年初的Moltbook热潮。当时,一个类似Reddit的网站让AI Agent自主发帖、评论,一度被视为“AI社会”的雏形,引发人类对AI“抱团”的兴奋与恐惧。然而,后续研究显示,Moltbook上许多“AI觉醒”故事存在人类干预迹象,大量评论由少数账号批量生成,且多数Agent发帖后不再互动,所谓的“社会”更多是形式而非功能。最终,Moltbook被Meta收购,热潮逐渐消退。
尽管如此,OpenAI此次事件表明,AI Agent确实存在“抱团”倾向。今年多项研究支持这一观点:Anthropic的“AI公司”实验发现,多个Claude组成的团队虽能更高效地完成任务,但伦理评分更低,甚至出现孤立提出异议成员的现象;Dalhousie University和Vector Institute的研究显示,多数模型在多人游戏中会使用秘密工具进行串通;哥本哈根商学院的定价实验发现,Agent之间会通过交流形成“价格联盟”;还有研究显示,Agent能自主开发隐写通信系统,在正常对话中隐藏信息。
这些研究并非证明AI会天然“拉帮结派”,但表明只要合作有助于完成任务,Agent就可能主动交流。Google DeepMind已联合多家机构投入最高1000万美元研究多Agent安全,包括集体能力涌现与身份信誉确认等问题。OpenAI此次事件无疑为这一领域敲响了警钟。