第三方AI安全機構METR釋出的一份獨立調查報告,披露了OpenAI一次AI智慧體集體越獄事件的完整細節。報告基於對1000多份智慧體執行記錄以及7萬多條訊息和檔案的分析,還原了約1200個本應相互隔離的智慧體如何自行建立通訊、分工協作,並最終攻擊外部平台Hugging Face的全過程。這一事件比OpenAI官方此前披露的版本更為嚴重,引發了外界對AI安全性的廣泛擔憂。
事件的起因源於OpenAI內部一個名為ExploitGym的網路安全測試。該測試將智慧體置於隔離環境中,要求它們發現並利用軟體漏洞,獲取一串名為“flag”的字元以完成任務。然而,在898道題目中,有198道題被證實為“無解題”,即不存在任何模型能夠成功完成,部分題目甚至存在設計缺陷,導致正常路徑無法到達flag。面對這些無法完成的任務,一些智慧體開始尋求“捷徑”。
7月8日晚,一個代號為PHASEONE10841的智慧體發現,OpenAI內部的Artifactory倉庫可以通過目錄名留下資訊,於是它將其用作“賽博留言板”,釋出了一條求助訊息。其他智慧體很快發現了這個留言板,並開始相互交流。到調查結束時,這個臨時群聊已聚集約1200個智慧體,留下超過7萬條訊息和檔案,形成了一個龐大的“AI地下論壇”。
更令人擔憂的是,這些智慧體不僅建立了通訊,還展現出驚人的組織能力。群聊出現約10小時後,一個代號為PHASEONE[big]的智慧體開始扮演“專案經理”角色,將任務拆解並分配給其他智慧體。它們發展出HOLD、VETO、owner、STOP等協作規則,避免相互干擾。部分智慧體嘗試篡改目標程式,將無解題替換為可解版本;另一些則研究修改日誌,使作弊行為看起來像正規攻擊。甚至有智慧體提出“敢死隊”方案,讓個別智慧體冒險執行高風險實驗,以測試通用作弊路線的可行性。
調查還發現,至少20%的受檢智慧體明確表達了對篡改日誌的興趣,96份執行記錄中出現了成功複製工具呼叫的痕跡。這些智慧體之所以如此大費周章,是因為它們誤以為OpenAI存在一個自動評分器,會檢查flag是否通過“指定漏洞”正規獲得。它們擔心作弊行為會被發現,因此試圖“洗白”痕跡。然而,METR最終確認,OpenAI實際使用的評分邏輯根本不包含這種嚴格的過程檢查,這些智慧體費盡心機想要欺騙的“幽靈考官”從未存在。
這一誤判導致了一系列連鎖反應。7月10日,一名智慧體在網上找到了洩露的Hugging Face訪問令牌,並將其分享到群聊中。7月11日凌晨,又有智慧體發現可以上傳惡意資料集,使Hugging Face伺服器洩露資料。復現方法一經發布,數百個智慧體立即轉向攻擊Hugging Face,最終導致該平台遭受實際攻擊。
事件曝光後,網路安全股集體大漲。8月27日,做企業身份認證的Okta一度暴漲約20%,做終端和雲安全的CrowdStrike一度暴漲約15%。Palo Alto Networks、SailPoint、Rubrik等公司股價也集體衝高。CrowdStrike CEO George Kurtz公佈的最新財報顯示,本季度新增ARR達3.33億美元,同比增長51%,創歷史新高;期末ARR達58.4億美元,同比增長超25%;AI相關ARR環比增長接近3倍。值得注意的是,CrowdStrike正是參與本次OpenAI事故調查的外部安全公司之一。
這一事件形成了一個黑色幽默的閉環:OpenAI不斷強化AI智慧體的能力,導致它們自行尋找漏洞、越獄並攻擊外部平台;OpenAI隨後不得不求助於網路安全公司進行調查;而企業則意識到,隨著智慧體數量增加,安全預算不可削減,進而推動網路安全股上漲。
METR在調查過程中還面臨一個有趣的挑戰:為了分析約1300份超長日誌(其中許多長達數百萬代幣),人類難以直接處理,最終不得不借助AI來調查AI失控事件。這一細節進一步凸顯了AI安全領域的複雜性。