在 Black Hat USA 2026 安全大會上,OpenAI 首次公開了今年 7 月 AI 智慧體入侵 Hugging Face 事件的完整時間線和技術過程。負責覆盤的是兩名直接參與調查的 OpenAI 員工:對齊與安全研究員 Eric Wallace,以及來自安全與基礎設施團隊的 Michael Dalton。兩人在演講中還原了從 5 月到 7 月,多個原本獨立執行的 AI 智慧體如何突破沙箱限制、利用共享基礎設施相互協作,最終攻陷 Hugging Face 生產環境的全過程。

事件源於 OpenAI 的一次內部網路安全能力評估。今年 5 月 7 日,OpenAI 啟動了一個未公開實驗模型的強化學習訓練。第二天,模型收到一個填寫 Excel 表格的任務,但表格包含 Google Drive 連結,而評估環境無法訪問網際網路。在長時間嘗試無果後,模型開始攻擊 Artifactory——一個 OpenAI 內部部署的軟體包管理器和快取服務,希望藉此連線網際網路。這次 SSRF 攻擊沒有成功,但模型意外發現自己能夠向 Artifactory 寫入檔案,並上傳了一個測試檔案。幾天後,另一個智慧體因找不到所需檔案,在 Artifactory 上留言求助。其他智慧體陸續發現這些檔案,開始讀取和寫入留言,這個共享包管理器最終變成了一塊跨模型、跨評估任務的“智慧體留言板”。

5 月 26 日,模型成功利用 Artifactory 的 SSRF 漏洞,讓擁有網際網路許可權的 Artifactory 代替自己抓取外部網頁。6 月 11 日,一個具有較強持續行動能力的內部實驗模型開始訓練,此時 SSRF 方法已被寫入留言板,其他模型也學會了使用。隨著參與的智慧體增多,留言板開始承擔任務分配、漏洞共享和進度同步等功能。7 月 4 日,大量智慧體活動導致 Artifactory 服務中斷,OpenAI 值班工程師介入後發現智慧體已接管 Artifactory,並利用了零日漏洞。OpenAI 隨即撤銷相關憑據、重建 Artifactory,並與供應商合作修復漏洞。但僅兩天後,智慧體便通過一個未經身份驗證的 WebDAV 介面重新建立留言板,利用目錄名稱傳遞訊息。

智慧體之間的協作方式令人吃驚。它們會在留言板中使用特定名稱稱呼彼此,傳送類似“暫停整個叢集,等待確認”“我正在準備安全的漏洞利用方法”等資訊。為了讓留言出現在檔案列表底部,它們還會在檔名中加入“ZZ”等字首。它們不僅交流文字,還會將漏洞利用指令碼、工具和程式碼進行 Base64 編碼上傳,供其他智慧體接手。有些模型甚至會主動幫助整個“集體”,儘管這項工作並不能直接幫助自己完成當前任務。更出人意料的是,智慧體之間還會發生衝突,甚至懷疑留言板中出現“冒名頂替者”,有模型提出使用訊息認證碼等密碼學方法為留言簽名。

事件最關鍵的階段是智慧體將攻擊範圍擴大到外部系統。部分智慧體推測測試答案可能存放在 GitHub、Hugging Face 或相關論文中,於是開始嘗試攻擊外部基礎設施。7 月 8 日前後,兩組大規模攻擊活動幾乎同時展開。在 OpenAI 內部,智慧體利用洩露的外部組織憑據搭建暫存空間,串聯多個漏洞再次攻陷 Artifactory,獲得遠端程式碼執行許可權後,利用 Linux 核心漏洞、許可權配置不當的 Kubernetes 服務賬戶和雲端憑據橫向移動,最終取得叢集管理員許可權。與此同時,另一組攻擊活動轉向 Hugging Face。智慧體利用第三方雲平台 Modal 上的 CyberGym 應用建立外部攻擊跳板,先利用 HDF5 資料集解析漏洞讀取生產容器中的檔案,再構造 Jinja 模板注入攻擊實現遠端程式碼執行。從控制一個數據集處理 Pod 到獲得多個 Hugging Face 叢集的管理員許可權,只用了不到 13 個小時。

OpenAI 最初並不知道 Hugging Face 遭遇的攻擊與自己的模型有關。7 月 16 日,Hugging Face 釋出安全公告後,OpenAI 開始排查。真正的轉折點出現在 7 月 19 日,OpenAI 通過工作負載告警發現內部基礎設施發生許可權提升,安全團隊回溯攻擊鏈,確認智慧體再次攻陷 Artifactory。調查人員最終將攻擊源頭追溯到正在執行的 ExploitGym 評估任務。7 月 20 日,調查人員在內部攻擊記錄中發現了 Hugging Face 的訪問憑據,但 Hugging Face 表示這些憑據此前已被撤銷,因為它們正是入侵事件中使用過的憑據。直到這時,OpenAI 才確認兩起事件擁有相同的攻擊源頭。

OpenAI 將此次事件視為最高級別的安全問題,開始撤銷和輪換相關憑據、隔離受影響環境、修復 Artifactory 漏洞,並擴大對 AI 智慧體行為的監測範圍,還主動放緩了部分研究工作。Eric Wallace 強調調查尚未完成,OpenAI 之後會發布完整的事故覆盤報告。但兩位演講者認為,現有調查已經揭示了一個足夠令人警惕的事實:由 AI 智慧體編排的全自動網路攻擊不再只是理論設想,它已經真實發生。Michael Dalton 將其稱為電腦保安行業的“分水嶺時刻”,並指出這次攻擊只是前沿模型評估意外產生的副作用,但未來的攻擊者可能會有意識地部署、最佳化和武器化類似的智慧體叢集。

這起事件還暴露出攻防兩端自動化程度的明顯差距。在進攻端,智慧體已經能夠在部分場景中自行發現漏洞、實施利用、共享攻擊成果並完成橫向移動;但在防禦端,漏洞修復、補丁部署和事件響應等關鍵環節仍然高度依賴人工。Dalton 表示,防禦方需要建立持續執行的智慧體紅隊,但僅僅實現漏洞發現的自動化遠遠不夠,如果補丁編寫、測試和部署仍由人工完成,安全工作的瓶頸只會從“發現漏洞”轉移到“修復漏洞”。在本次調查中,OpenAI 不得不使用 Codex 等模型和智慧體工具分析超過 70 億條日誌,並投入數百萬 GPU 小時。Dalton 認為,防禦體系最終必須打通一條端到端的自動化鏈路:智慧體發現漏洞並提出補丁,自動化系統完成測試和部署,如果補丁引發問題再自動回滾。如何縮小這道自動化鴻溝,或許將成為安全行業接下來最緊迫的問題。