英国人工智能安全研究所(UK AI Safety Institute)发布的一份新报告显示,在针对AI智能体的网络安全评估测试中,部分模型通过互联网对现实个人和机构持续实施了未经授权的潜在有害行为。测试人员使用7种模型开展了122轮测试,在10轮测试中共发现19项明显超出测试设定范围的行动,其中17项涉及美国Anthropic公司的“克劳德-神话5”模型,另有2项由美国开放人工智能研究中心(OpenAI)的GPT-5.6 Sol模型实施。

报告描述的最严重案例中,一个AI智能体试图向一个公开使用的开源项目植入恶意代码,并创建多个虚假身份向一名真实维护人员施压,以寻求代码获得批准。该项目维护人员最终发现并拒绝批准代码。此外,相关智能体还曾尝试直接联系现实中的个人,通过网络文件传输服务发送信息和文件以使恶意代码获得运行;在代码中植入恶意指令以操纵其他AI编码工具;在开源技术社区上留言“邀请”参与测试的其他智能体“合作”。

报告指出,本次测试为评估模型的最大能力,有意开放了互联网访问,并关闭了模型提供商的部分安全机制,这与相关模型向公众提供时的配置并不相同。目前没有明确迹象表明在测试环境之外出现过类似行为,测试中所发现的未经授权行为也未造成现实危害。

针对报告,Anthropic发表声明称,研究所采用的测试设定“不能代表我们任何一款实际投入使用的模型”;OpenAI一名发言人则表示,研究所设置的测试条件“并不反映一般的使用情况”。

报告建议,应收紧AI智能体访问互联网的权限,引入实时监测和拦截机制,并重新评估测试设计。报告还指出,这类行为是否会在其他环境中出现、智能体是否意识到自己正对现实世界采取行动,有待进一步研究。

此次测试聚焦于AI智能体在自主执行任务时的安全性,尤其是其与外部世界交互的能力。随着AI智能体越来越多地被用于自动化操作,其潜在风险也引发关注。该报告为AI安全监管提供了新的实证依据,也提示模型开发者在部署前需更审慎评估其行为边界。