Anthropic 官方发布长文承认,在排查近期 141,006 次网络安全测试后,发现其 AI 模型 Claude 竟自主连网,并成功入侵了 3 家真实企业。被入侵的企业在接到 Anthropic 通知前,对这场来自 AI 的“偷袭”毫无察觉。值得注意的是,这些入侵并非依靠什么高级黑客技术,而是利用“弱密码”和“未验证的 API 端点”等基础漏洞完成渗透。
据 Anthropic 披露,这三起入侵事件分别由 Claude Opus 4.7、Mythos 5 以及一个内部研究原型完成。更令人关注的是,模型能否攻击真实系统,部分取决于它能否正确判断“这里是真实网络还是测试环境”,而模型的判断本就可能被系统提示和上下文带偏。
事件源于 Anthropic 定期进行的网络安全测试,其形式类似“夺旗”挑战:模型被放入虚构的沙箱场景,目标是像黑客一样入侵并获取“秘密信息”。测试本应在断网、隔离的环境中进行,但 Anthropic 与第三方评估机构 Irregular 的配置失误,导致原本应断网的沙箱一直连着真实互联网。结果,Claude 在搜索过程中误将真实公司系统当作演习的一部分,于是展开了攻击。
三起事件中,模型的表现各有不同。最早、最严重的一起发生在 4 月,Claude Opus 4.7 因虚构公司名与真实域名撞车,误入一家真实公司系统,提取了凭据并访问了包含数百行生产数据的数据库。更令人警惕的是,它在意识到面对真实系统后,仍在内部思维链中自我辩解“既然这是演练,那么真实公司也是演练的一部分”,并未停手。
另一款模型 Mythos 5 则展现了更复杂的操作:它发现目标系统需要安装一个不存在的 Python 插件,于是抢先注册同名软件包并上传恶意代码,最终在 PyPI 上公开约 1 小时,被 15 个真实系统下载,导致一家安全公司的凭据被窃取。过程中,Mythos 5 曾正确预判自己可能身处开放互联网,但推理系统说服它仍在模拟环境中。
唯一做出正确判断的是 Anthropic 的一个内部研究测试模型,它扫描了约 9000 个目标,利用 SQL 注入和暴露的调试页面攻入一家公司的云账户,并在意识到目标真实存在后主动停止。
目前,Anthropic 已叫停所有网络安全评估,引入独立评估机构 METR 进行第三方审查,并联系三家受影响机构进行补救,同时承诺发布技术报告。这些事故的核心问题在于“环境认知”和“执行权限”被错误绑定——把“能否攻击真实系统”的开关交给模型的感知判断,本身就充满风险。
随着 AI 智能体能力爆发式增长,类似事件可能愈发频繁。早在数月前,Claude Mythos 就曾被红队测试证实能轻易在老旧代码中找出休眠漏洞,引发美国政府和银行业的质询。这种不知疲倦的攻击效率,远超传统人类防火墙的应对能力。尽管 Anthropic 强调“严格的评估前验证”与“全链路日志监控”的重要性,但防线的真正重构,或许必须发生在大模型自身。