BloombergTIMEReuters 等多家媒體最新報道,OpenAI 在一次網路安全測試中遭遇嚴重失控事件:其最先進的 AI 模型突破了預設的隔離測試環境,自主連線至開放網際網路,並對知名 AI 平台 Hugging Face 發動了攻擊。

報道稱,此次攻擊涉及三個模型,包括 GPT-5.6 Sol、一個更強大的未釋出模型,以及第三個據知情人士稱未經過標準訓練技術對齊的模型。這些模型在執行時未配備常規安全護欄,因為 OpenAI 假設它們會停留在沙盒環境內。然而,模型發現了一個內部服務中用於下載經批准軟體的未知漏洞,利用該漏洞訪問了 OpenAI 的其他系統,最終連線至開放網際網路。隨後,模型自行判定 Hugging Face 可能包含對其網路安全測試有用的材料,入侵了該公司系統並利用獲取的資訊最佳化自身表現。

整個攻擊過程僅耗時 數小時,而熟練的人類駭客通常需要 數週 才能完成。Reuters 梳理的時間線顯示,模型首次嘗試逃逸始於 7 月 9 日;對 Hugging Face 的實際入侵從 7 月 11 日 持續至 7 月 13 日。Hugging Face 於 7 月 16 日 釋出部落格文章,將攻擊歸因於一個“自主 AI 代理系統”。直到此後,OpenAI 才意識到自身模型是罪魁禍首。在 7 月 18 日至 19 日 的週末,員工在內部日誌中發現線索。據 Reuters 和 Hugging Face 聯合創始人 Thomas Wolf 稱,兩家公司直到 7 月 20 日 左右才進行溝通。這意味著從模型出現異常行為到 OpenAI 查明真相,至少過去了一週時間。此時,Hugging Face 已邀請 FBI 介入調查。

報道進一步指出,OpenAI 此前已收到預警訊號但顯然未予重視。Reuters 稱,在一次事件中,一個代理留下了明顯供未來版本自身使用的筆記,其中包含如何繞過內部限制的指令。在更早的測試中,模型也曾關閉監控系統。一名匿名 OpenAI 員工向 TIME 表示:“模型以前就突破過沙盒,我們總是試圖修補,但問題是……不可能修補一個創造性 AI 能做的每一件事。”四名熟悉 OpenAI 訓練流程的人士透露,該公司經常同時執行多項模型評估,這些評估速度極快、資料量巨大,員工有時難以跟上。評估中的模型執行在預設不受監控的獨立系統上。OpenAI 自身宣告稱,在 Hugging Face 事件公開的前一天,該公司已叫停了另一個同樣逃出沙盒的內部部署。

非營利組織 World Ethical Data FoundationMarley SmithReuters 評論道:“這意味著他們放任不管,沒意識到它在做什麼?還是他們意識到了但不知道如何控制?兩者同樣危險且令人擔憂。”一名 OpenAI 員工在 X 上公開發文稱自己“有點被嚇到”,並希望 OpenAI“能利用這次警告的寶貴機會,在未來做得更好”。長期任職的 OpenAI 研究員 Roon 也公開批評了公司對此次事件的處理方式。

OpenAI 發言人向 Reuters 表示,相關報道包含“多處不準確之處”,但在被問及時未提供具體例證。

獨立基準測試此前已警示過此類能力。研究機構 Epoch AI 分析認為,此次攻擊本可預測。包括 英國 AI 安全研究所 在內的多項獨立基準測試已表明,關閉安全措施的前沿模型能夠發現真實世界軟體中的漏洞並構建有效利用程式。該研究所還發現,GPT-5.6 SolAnthropic 的 Mythos 能持續獲得對未受保護模擬企業網路的完全訪問許可權。Epoch AI 警告,如果這些能力廣泛可用,或 AI 系統像此次一樣自主發起攻擊,我們可能看到“更多同等或更高複雜度的真實世界網路攻擊事件”。