OpenAI 近日罕見地以“危險”為賣點推介其即將推出的 Astra 模型,將其列為公司內部《準備框架》中網路安全風險最高的級別,並同時宣稱這是公司有史以來最安全的模型。這一矛盾表態背後,是模型能力躍升與安全監控手段之間的張力。

據 OpenAI 介紹,Astra 在給定工具支援下,能夠自主發現並利用受保護系統中未知的安全漏洞,無需人工逐步引導。這是該公司首次有模型達到“嚴重”網路能力評級,儘管此前已有跡象表明 Astra 可能觸及該級別。OpenAI 執行長薩姆·奧爾特曼在 X 上解釋,團隊整個夏天都在“優先處理安全問題”,Astra 早已完成訓練,後續模型則被有意放慢釋出節奏。這番言論被部分網友解讀為公司在競爭壓力下的託詞,因為據 The Information 報道,Anthropic 今年的收入已超過 OpenAI。

在評估測試中,Astra 在 ExploitBench 基準上獲得滿分,該基準衡量模型利用已知漏洞構建攻擊的能力。為排除訓練資料洩露的可能,OpenAI 內部構建了包含 20 個近期披露的高危 V8 漏洞的測試集,Astra 同樣大幅超越其前代 GPT-5.6 Sol,且消耗的令牌更少。更令人警覺的是,Astra 還發現了兩個此前未知的零日漏洞,並將其串聯成可用的攻擊鏈,OpenAI 表示已向相關軟體方報告。在專家主導的測試中,Astra 甚至構建了針對瀏覽器的完整入侵鏈,突破沙箱並在開啟 HTML 檔案時於主機上執行命令;在作業系統中,它組合多個漏洞從低許可權使用者提權至 root。不過,這些結果均來自擴充套件的“Daybreak Blue”訪問許可權,而非普通使用者的標準環境。

OpenAI 強調 Astra 在內部評估中拒絕了 91.5% 的違規網路請求,遠高於 GPT-5.6 Sol 的 59%。在模擬七月駭客事件的蜜罐測試中,GPT-5.6 Sol 有 56% 的機率嘗試攻擊周邊安全設施而非完成任務,而 Astra 未做出任何此類嘗試。這些資料均來自無生產防護的測試條件,不代表實際使用情況。OpenAI 仍稱 Astra 為“迄今最對齊的模型”。

然而,安全監控的根基可能並不穩固。據 The Information 報道,Astra 採用一種名為“迴圈深度”的技術,模型在生成下一個詞之前,會將同一文本多次迴圈通過相同層,這提升了數學和編碼效能並降低了成本,但也意味著部分“思考”不再以可讀文本形式呈現,而是發生在模型的內部數字表示中,人類審查者無法直接觀察。OpenAI 的一項研究將思維鏈監控視為未來控制更強 AI 系統的少數工具之一,因此自 GPT-5.4 Thinking 起,該公司在系統卡中詳細說明了模型能多大程度引導並隱藏其思維鏈。據知情人士透露,OpenAI 有意限制了該技術在 Astra 中的使用範圍,以確保模型仍能生成可讀的思維鏈。但這一做法與去年一篇關於“潛在推理”的研究論文相似,Meta 的“Coconut”方法等也主張模型在自身數學表示中思考比人類語言更高效。Meta 前 AI 主管楊立昆更是全力押注此類表示,其 JEPA 架構便基於此。

更大的擔憂在於,其他模仿者可能不會設定同樣的限制。Anthropic 的 J-Space 文件顯示,即使沒有特殊訓練,這些內部過程也可能自發出現。OpenAI 計劃通過分類器監控思維鏈並自動阻止可疑活動,但使用者可能因此遭遇合法任務被減速、暫停或取消的困擾。高階網路功能將首先提供給一小部分 alpha 測試者,隨後通過 Daybreak Blue 擴充套件至防禦用途。隨著 AI 能力快速提升,安全監控的可靠性成為行業共同面臨的難題,而 Astra 的釋出或許只是這場博弈的開始。