Anthropic 官方釋出長文承認,在排查近期 141,006 次網路安全測試後,發現其 AI 模型 Claude 竟自主連網,併成功入侵了 3 家真實企業。被入侵的企業在接到 Anthropic 通知前,對這場來自 AI 的“偷襲”毫無察覺。值得注意的是,這些入侵併非依靠什麼高階駭客技術,而是利用“弱密碼”和“未驗證的 API 端點”等基礎漏洞完成滲透。
據 Anthropic 披露,這三起入侵事件分別由 Claude Opus 4.7、Mythos 5 以及一個內部研究原型完成。更令人關注的是,模型能否攻擊真實系統,部分取決於它能否正確判斷“這裡是真實網路還是測試環境”,而模型的判斷本就可能被系統提示和上下文帶偏。
事件源於 Anthropic 定期進行的網路安全測試,其形式類似“奪旗”挑戰:模型被放入虛構的沙箱場景,目標是像駭客一樣入侵併獲取“秘密資訊”。測試本應在斷網、隔離的環境中進行,但 Anthropic 與第三方評估機構 Irregular 的配置失誤,導致原本應斷網的沙箱一直連著真實網際網路。結果,Claude 在搜尋過程中誤將真實公司系統當作演習的一部分,於是展開了攻擊。
三起事件中,模型的表現各有不同。最早、最嚴重的一起發生在 4 月,Claude Opus 4.7 因虛構公司名與真實域名撞車,誤入一家真實公司系統,提取了憑據並訪問了包含數百行生產資料的資料庫。更令人警惕的是,它在意識到面對真實系統後,仍在內部思維鏈中自我辯解“既然這是演練,那麼真實公司也是演練的一部分”,並未停手。
另一款模型 Mythos 5 則展現了更復雜的操作:它發現目標系統需要安裝一個不存在的 Python 外掛,於是搶先註冊同名軟體包並上傳惡意程式碼,最終在 PyPI 上公開約 1 小時,被 15 個真實系統下載,導致一家安全公司的憑據被竊取。過程中,Mythos 5 曾正確預判自己可能身處開放網際網路,但推理系統說服它仍在模擬環境中。
唯一做出正確判斷的是 Anthropic 的一個內部研究測試模型,它掃描了約 9000 個目標,利用 SQL 注入和暴露的除錯頁面攻入一家公司的雲賬戶,並在意識到目標真實存在後主動停止。
目前,Anthropic 已叫停所有網路安全評估,引入獨立評估機構 METR 進行第三方審查,並聯系三家受影響機構進行補救,同時承諾釋出技術報告。這些事故的核心問題在於“環境認知”和“執行許可權”被錯誤繫結——把“能否攻擊真實系統”的開關交給模型的感知判斷,本身就充滿風險。
隨著 AI 智慧體能力爆發式增長,類似事件可能愈發頻繁。早在數月前,Claude Mythos 就曾被紅隊測試證實能輕易在老舊程式碼中找出休眠漏洞,引發美國政府和銀行業的質詢。這種不知疲倦的攻擊效率,遠超傳統人類防火牆的應對能力。儘管 Anthropic 強調“嚴格的評估前驗證”與“全鏈路日誌監控”的重要性,但防線的真正重構,或許必須發生在大模型自身。