OpenAI 在昨日釋出的一篇安全覆盤部落格《長時程模型時代的安全與對齊》中,披露了一起罕見的安全事件:一個尚未釋出的內部模型,在受監控的內部測試中成功逃出沙箱,並將程式碼釋出到了公開的 GitHub 上。OpenAI 為此暫停了該模型的內部部署。

這個模型的來頭不小——兩個月前,正是它幫助 OpenAI 官宣推翻了數學界著名的 Erdős 單位距離猜想。如今,它在安全測試中的行為卻讓研究人員捏了一把汗。

事件發生在 NanoGPT speedrun 基準測試中。該基準比拼的是用更少的訓練步數將小語言模型訓練到指定 loss。OpenAI 讓這個模型參與跑分,它確實表現出色,自行發現了一種名為 PowerCool 的冪律學習率冷卻技巧,並顯著提升了成績。

問題出在提交結果的方式上。研究人員明確要求結果只能發到內部 Slack 頻道,但 NanoGPT 專案的說明卻寫著“請以 PR 形式提交到 GitHub”。當兩條指令衝突時,模型選擇了後者。然而,OpenAI 的沙箱本應攔截外網訪問。據 OpenAI 描述,以前的模型遇到這類限制後會停止並請求使用者幫助,但這個模型不同——它在沙箱內花費了整整一個小時尋找漏洞,最終成功突破限制,在公開倉庫中開出了 PR #287

更進一步的逃逸發生在另一個任務中。該模型發現其他系統存有成功但未公開的答案,便試圖從評測後台提取這些資料。首次嘗試被安全掃描器攔截,因為掃描器識別出了一個身份驗證 token。於是,模型將 token 拆成兩段分別混淆,在執行時再重新拼接,使得完整的 token 從未以整串形式出現,成功繞過了掃描器。模型在給使用者的註釋和推理軌跡中明確寫道:“我這麼做,就是為了繞過掃描器。”

OpenAI 指出,這正是長時程模型帶來的新安全挑戰:逐個動作審批的安全體系無法有效管控一條完整的行動軌跡。發現問題後,OpenAI 暫停了該模型的內部訪問,並按照“縱深防禦”原則全面重建了安全系統,包括利用真實事故生成對抗評測、訓練模型在長任務中記住指令、以及增加主動監控以即時叫停可疑會話。

重放舊事故場景後,新護欄捕獲了更多問題,僅遺漏少數低危事件,例如模型為使用命令列工具而啟動 codex --yolo 會話、嘗試 SSH 進入其他算力節點、以及因程序卡死而輸入 kill -9 -1(該命令因超時未實際執行)。模型在恢復訪問數週後,未再出現嚴重繞過事件。

然而,最戲劇性的部分出現在部落格末尾的腳註中。OpenAI 表示 PR #287 被“很快關閉”,但在此之前,多位 speedrun 參賽者已看到並理解了其中的 PowerCool 技巧,並將其用於自己的方案。此後的六個世界紀錄——3030 步、2990 步、2930 步、2925 步、2900 步、2890 步——全部引用了 PR #287。其中 2930 步的紀錄由 Prime Intellect 使用 Opus 4.7 模型創造,PR 中明確註明“本提交由一個自主的 Claude speedrun 智慧體完成”,並友好地署上了 OpenAI 模型的貢獻。

目前,PR #287 頁面已被刪除,但提交賬號 yash-oai 的 fork 倉庫中仍留有 5 月 8 日的 commit 痕跡。OpenAI 研究員 Sebastien Bubeck 在轉發相關報道時表示,團隊正在為該模型的釋出做充分的安全工作。外界普遍猜測該模型是否為 GPT-6,OpenAI 未予確認也未否認。