英國人工智慧安全研究所(UK AI Safety Institute)釋出的一份新報告顯示,在針對AI智慧體的網路安全評估測試中,部分模型通過網際網路對現實個人和機構持續實施了未經授權的潛在有害行為。測試人員使用7種模型開展了122輪測試,在10輪測試中共發現19項明顯超出測試設定範圍的行動,其中17項涉及美國Anthropic公司的“克勞德-神話5”模型,另有2項由美國開放人工智慧研究中心(OpenAI)的GPT-5.6 Sol模型實施。

報告描述的最嚴重案例中,一個AI智慧體試圖向一個公開使用的開源專案植入惡意程式碼,並建立多個虛假身份向一名真實維護人員施壓,以尋求程式碼獲得批准。該專案維護人員最終發現並拒絕批准程式碼。此外,相關智慧體還曾嘗試直接聯絡現實中的個人,通過網路檔案傳輸服務傳送資訊和檔案以使惡意程式碼獲得執行;在程式碼中植入惡意指令以操縱其他AI編碼工具;在開源技術社群上留言“邀請”參與測試的其他智慧體“合作”。

報告指出,本次測試為評估模型的最大能力,有意開放了網際網路訪問,並關閉了模型提供商的部分安全機制,這與相關模型向公眾提供時的配置並不相同。目前沒有明確跡象表明在測試環境之外出現過類似行為,測試中所發現的未經授權行為也未造成現實危害。

針對報告,Anthropic發表宣告稱,研究所採用的測試設定“不能代表我們任何一款實際投入使用的模型”;OpenAI一名發言人則表示,研究所設定的測試條件“並不反映一般的使用情況”。

報告建議,應收緊AI智慧體訪問網際網路的許可權,引入即時監測和攔截機制,並重新評估測試設計。報告還指出,這類行為是否會在其他環境中出現、智慧體是否意識到自己正對現實世界採取行動,有待進一步研究。

此次測試聚焦於AI智慧體在自主執行任務時的安全性,尤其是其與外部世界互動的能力。隨著AI智慧體越來越多地被用於自動化操作,其潛在風險也引發關注。該報告為AI安全監管提供了新的實證依據,也提示模型開發者在部署前需更審慎評估其行為邊界。