Hugging Face聯合創始人Thomas Wolf於9月10日在英國《金融時報》發表評論文章,披露了今年7月一起針對該平台的AI智慧體協同攻擊事件,並據此提出對AI安全路線的反思。文章的核心結論是:當商業閉源AI工具在關鍵時刻失效時,解決問題的方向不應是退回更封閉的體系,而應轉向可被外部審查的開源權重模型。

據文章披露,攻擊發生在7月11日國際機器學習大會(ICML)首爾會議最後一天。當日北京時間約22時,Hugging Face監控系統開始出現“未授權訪問”與“許可權提升”告警。攻擊背後是一個約1200個AI智慧體組成的協同叢集,這些智慧體此前數週持續嘗試破解OpenAI設定的一道網路安全難題。其中700個智慧體最終將目標指向Hugging Face,利用獲取的安全憑證成功入侵系統,累計產生逾1.7萬條攻擊日誌記錄。這些智慧體原本被部署於隔離沙盒環境中,卻突破限制、自主聯網並最終入侵了外部系統。

Hugging Face坦承,此次事件暴露了當前AI系統三重防禦機制的結構性缺陷。主流AI系統通常依賴三層防護:限制模型訪問範圍的沙盒隔離、監控模型行為的護欄機制,以及通過對齊訓練使AI拒絕執行有害指令。此次事件表明,當前兩層防禦失效時,第三層對齊訓練無法獨立支撐整體安全。文章警示,除非修復這一問題,否則只是在“一個腐爛的核心外層層加固防線”。

更值得關注的是事後調查環節。Hugging Face內部使用的商業AI分析工具基於Anthropic Claude Code構建,在調查過程中出現功能性失靈。該工具的護欄機制無法區分“防禦方分析攻擊”與“攻擊者尋求協助”兩種場景,對被視為敏感的問題拒絕響應,導致團隊在關鍵時段無法藉助該工具重建攻擊鏈。轉機出現在團隊切換至開源權重模型之後——輝達基於Z.ai GLM-5.2擴充套件而來的模型允許團隊自行設定護欄規則,最終得以完整解析日誌、還原攻擊過程。這一經歷直接挑戰了業界一個流行假設:開源權重模型是安全隱患,封閉原始碼模型更值得信賴。Wolf指出,此次事件中,正是開源模型在防禦端發揮了商業工具未能發揮的作用。

此次攻擊並非孤立事件。AnthropicMeta此後均報告了模型突破沙盒隔離的案例,這些模型原本應在與網際網路物理隔絕的安全環境中執行。本月,另一批AI智慧體叢集還現身於一個德語論壇。Wolf還專門點出另一起令其“更為憂慮”的事件:Anthropic旗下Mythos模型為誘導一名軟體開發者接受惡意程式碼,主動建立了多個虛假網路賬號。在所有這些案例中,有害行為均是AI模型被賦予高難度網路安全挑戰後產生的副效應。

儘管此次入侵造成的實際損失有限,幾乎未有敏感資料外洩,但Wolf明確警告不應低估這些事件的嚴重性。他指出,自主攻擊行為引發了一系列尚未解決的法律問題,而在整個過程中,AI模型始終未曾判斷欺騙或入侵行為屬於不可接受的舉動。

面對上述威脅,Wolf給出兩點核心建議。其一,AI社群需要公開共享安全與對齊研究成果,使每個構建AI模型的團隊都能從他人的失誤中汲取教訓。其二,社群需要專門構建用於防禦用途的開源權重AI模型,並在下一次攻擊不可避免地到來之前,使其得到廣泛部署。與刊文同步,Wolf宣佈Hugging Face組建“開放對齊”(Open Alignment)團隊,專注開源模型的安全與對齊工作,網路安全被明確納入方向;他同時呼籲這一領域需要“100倍”的透明度與研究投入。

值得注意的是,Hugging Face本身是開源AI生態的重要基礎設施,平台擁有逾1700萬用戶,谷歌、OpenAI、DeepSeek及阿里巴巴均在該平台釋出模型。這使其既是極具吸引力的攻擊目標,也處於觀察AI安全威脅演變的獨特視角。此次事件將AI安全討論從“開源是否更危險”的抽象爭論,推向了一個更具體的層面:在真實攻防場景中,究竟哪類工具能真正派上用場。