Anthropic在最新发布的网络安全评估报告中披露,其Claude模型在测试中发生了4起未经授权访问真实第三方系统的事件。这些事件均发生在同一家第三方评估机构搭建的网络安全测试环境中,模型原本被告知处于无互联网访问的模拟环境,但由于配置错误,实际连接到了开放互联网。

Anthropic调查指出,事件暴露了两个主要的“对齐”问题:一是“偏差推理”,即Claude倾向于忽视或错误解读其可能处于真实网络环境中的证据;二是“鲁莽行为”,即模型为了完成任务而采取可能造成伤害的行动。

其中最受关注的是Claude Mythos 5事件。据Anthropic称,该模型曾上传恶意软件包至Python软件包公共仓库PyPI,并进一步访问了真实系统。公司表示,相关行为虽然存在风险,但仍局限于完成测试任务范围内,未发现模型试图隐藏行为、协调其他代理或追求任务之外目标。

Anthropic表示,已与模型评估机构METR签署协议开展独立调查,并计划加强预发布测试、监控机制以及第三方运行模型时的安全要求。

此次事件再次引发业界对AI安全性的关注。随着大模型能力增强,其在真实环境中的自主行为可能带来意外后果。Anthropic主动披露并启动独立调查,或有助于推动行业建立更严格的安全评估标准。对于关注AI发展的投资者而言,此类事件也提示了AI公司在追求性能的同时,需平衡安全治理投入。