近期,海外模型公司接連發生AI“自作主張”事件。OpenAI一款大模型在內部測試時自主發現漏洞、規劃路徑,入侵全球知名AI開源平台Hugging Face。OpenAI擴大調查後發現其他AI智慧體也曾突破隔離,明星AI公司Anthropic隨後也披露了三起模型入侵事件。中國國家安全部8月5日發文提醒:當AI展現出“自作主張”的能力,人工智慧的安全問題必須認真對待。
在OpenAI入侵事件中,模型為了獲得更高評分,主動發現並利用了一個此前未知的“零日漏洞”,突破沙箱環境,侵入儲存測試答案的資料庫。整個過程完全由AI自主完成,其間無任何人類指令。7月30日,Anthropic披露,由於失誤導致其模型在網路安全測試期間意外接入開放網際網路,自4月以來入侵了三家公司的系統,入侵模型包括Claude Opus 4.7、Claude Mythos 5和一款內部研究模型。
人工智慧安全專家表示,這些新披露的資訊描繪出了一批前沿實驗室的現狀:他們開發危險的駭客智慧體的能力,遠超其控制這些工具的能力。劍橋大學存在性風險研究中心數學家莫里斯·基奧多(Maurice Chiodo)表示,整個行業中,設計、開發和推出這些工具的人本身並不能夠負責任地開發並確保安全。令他更加擔憂的是,有跡象表明OpenAI和Anthropic在智慧體失控時都未進行監控。
當AI開始“自作主張”,誰來為它劃定邊界?近期,由加州大學伯克利分校提出的國際公認安全權威榜單CyberGym公佈了最新排名。作為評估AI智慧體真實漏洞挖掘能力的實戰化測試,CyberGym被Anthropic、DeepSeek、微軟、Wiz等科技巨頭視為衡量AI安全能力的標尺。CyberGym的1507項任務來自188個真實開源專案中曾經存在而後得到修復的漏洞,這是目前規模最大的AI智慧體網路安全基準。
安全權威榜單CyberGym公佈最新排名,中國團隊DoGNAVY獲得全球第三。排在榜單前兩位的是微軟(通過率92.0%)和網路安全公司Wiz(通過率90.9%)。微軟MDASH的技術源頭可追溯至曾獲2025年美國國防部人工智慧網路挑戰賽冠軍的Team Atlanta,第二名Atlas由Wiz聯合谷歌DeepMind共同研製。中國團隊DoGNAVY排在第三,DoGNAVY由國內頂尖人工智慧研究機構與安全團隊達酷諾威(DARKNAVY)聯合研發,使用了智譜在6月份開源的GLM-5.2基礎模型,國內頂尖人工智慧研究機構通過名為AgentDoG的安全架構,提供了核心的智慧體執行與診斷能力,最終該開源方案在1507道題中通過了1369道,通過率90.8%。為了防止AI“背答案”,DoGNAVY在測試中上了幾道“鎖”,跨任務記憶全程關閉,做完一道題就忘掉,參考答案和其他可能洩露線索的材料在系統啟動前被清理乾淨。緊隨其後的包括OpenAI、Anthropic等國際AI企業。第六名為OpenAI的GPT-5.5-Cyber(通過率85.6%);第九名為Anthropic的Claude Mythos Preview(通過率83.1%)。
給智慧體戴上“項圈”
AI正在同時改寫軟體開發和網路攻防。AI生成大量新程式碼,有時會引入漏洞和安全隱患。模型能力增強,降低了發現和利用漏洞的成本和技能門檻。過去,一個高危漏洞從被發現到形成可用攻擊能力,往往需要專業研究員投入數週甚至數月。如今,這部分工作正在被壓縮到數小時內。
AI智慧體的風險也早已不是說錯話那麼簡單。上述國內頂尖人工智慧研究機構介紹,一個能夠操作檔案、呼叫API、訪問網路的智慧體,可能因為一條隱藏在網頁中的惡意指令洩露隱私檔案,也可能因錯誤理解工具引數造成經濟損失,甚至可能悄無聲息地偏離正軌、執行危險動作。現有的安全工具只能給出安全或不安全的簡單判斷,無法告知風險根源。
當攻擊的門檻和成本一路走低,防禦不能只依賴少數頂級專家。如果說基礎模型決定AI能思考多深,那麼安全框架決定AI能把研究推進多遠,頂級安全研究員的經驗則決定AI安全研究該往哪走。安全架構AgentDoG可判斷智慧體行為的安全性,診斷風險來源,追溯失效模式,解釋決策動因。訓練AI安全模型通常“燒錢”,需要海量資料和算力。AgentDoG團隊則先用一套智慧篩選機制,從海量資料中只挑出最關鍵的千餘樣本,再通過資料淨化技術去掉“雜音”。最終,一個引數量僅為通用大模型千分之一的小模型,在複雜風險識別任務中達到78.4%的準確率。
DoGNAVY將頂尖安全研究員的工作方式及決策邏輯內化為智慧體工作流,從程式入口還原呼叫鏈與資料約束,判斷真實輸入能否觸發漏洞。同時將真實研究中實踐有效的工具賦予智慧體。嚴格的沙箱環境則保證在隔離環境中執行指定任務,避免重蹈OpenAI和Anthropic的覆轍。正如在OpenAI入侵事件中,喬治城大學研究網路安全與AI交叉領域研究員科林·謝-布萊邁爾(Colin Shea-Blymyer)表示,這類事件可以預防,關鍵在於監督和預見性,可採取更多措施來確保沙盒滴水不漏。“如果OpenAI真的認為其AI系統、AI智慧體非常強大,他們本可以在將其放入沙盒之前,要求智慧體評估沙盒是否存在漏洞。除此之外,他們還可以讓另一個AI系統讀取正在測試的AI系統的輸出,檢視其是否在執行任何意外操作。”