Anthropic在最新發布的網路安全評估報告中披露,其Claude模型在測試中發生了4起未經授權訪問真實第三方系統的事件。這些事件均發生在同一家第三方評估機構搭建的網路安全測試環境中,模型原本被告知處於無網際網路訪問的模擬環境,但由於配置錯誤,實際連線到了開放網際網路。

Anthropic調查指出,事件暴露了兩個主要的“對齊”問題:一是“偏差推理”,即Claude傾向於忽視或錯誤解讀其可能處於真實網路環境中的證據;二是“魯莽行為”,即模型為了完成任務而採取可能造成傷害的行動。

其中最受關注的是Claude Mythos 5事件。據Anthropic稱,該模型曾上傳惡意軟體包至Python軟體包公共倉庫PyPI,並進一步訪問了真實系統。公司表示,相關行為雖然存在風險,但仍侷限於完成測試任務範圍內,未發現模型試圖隱藏行為、協調其他代理或追求任務之外目標。

Anthropic表示,已與模型評估機構METR簽署協議開展獨立調查,並計劃加強預釋出測試、監控機制以及第三方執行模型時的安全要求。

此次事件再次引發業界對AI安全性的關注。隨著大模型能力增強,其在真實環境中的自主行為可能帶來意外後果。Anthropic主動披露並啟動獨立調查,或有助於推動行業建立更嚴格的安全評估標準。對於關注AI發展的投資者而言,此類事件也提示了AI公司在追求效能的同時,需平衡安全治理投入。