OpenAI 即將推出的 Astra 模型將採用一種名為“迴圈深度”的推理技術,該技術允許模型在多數推理模型所依賴的順序思考之外執行。據 The Information 週二報道,這一技術也被稱為“不透明迴圈”,可能使模型的思維鏈更難被監控,從而引發 AI 安全專家的擔憂。
思維鏈是推理模型在嘗試解決問題時生成的逐步步驟記錄,儘管其表示並不完美,但仍是監控模型不當行為或失準的重要工具。例如,在 OpenAI 近期出現的“ rogue agent”事件中,思維鏈記錄在分析代理行為原因時發揮了關鍵作用。而“迴圈深度”技術讓模型採用一種非線性方法,多次迴圈處理同一查詢,留下的可讀痕跡更少,從而繞過了傳統的思維鏈記錄。
Redwood Research 執行長 Buck Shlegeris 在訊息傳出後發文表示:“我對 Astra 使用不透明迴圈的報道極為擔憂。”他擔心如果 OpenAI 進一步推動該技術,可能會大幅增加迴圈次數,從而徹底摧毀思維鏈的可監控性。長期關注 AI 安全的 Zvi Mowshowitz 也評論稱,可能需要立法來防止 AI 實驗室之間的“逐底競爭”,他認為該技術“玩火”,可能破壞 OpenAI 和 Anthropic 一直努力建立的思維鏈忠實性與可監控性規範。
值得注意的是,Astra 對該技術的使用似乎有限。OpenAI 表示,模型的思維鏈預計仍可讀,並反駁了其將轉向“神經語”的說法。OpenAI 首席科學家 Jakub Pachocki 在 X 上強調,公司自首個推理模型起就致力於保留和利用思維鏈監控,這是當前研究計劃的核心目標。他承認所有 AI 模型都會進行一定量的不透明推理,且很少有研究者將思維鏈日誌視為模型推理的直接表示,但這些保留意見並未消除外界的擔憂。
The Information 週三上午的後續報道稱,Anthropic 和 Google DeepMind 已在討論這一技術。Redwood Research 首席科學家 Ryan Greenblatt 回應稱,不透明推理可能比傳統思維鏈推理更容易擴充套件,從而將所有推理從可見渠道中移除。他最大的擔憂是,自然的發展路徑可能涉及將不透明推理擴充套件到模型完全或幾乎完全在潛在空間中推理的程度,他希望現在避免最令人擔憂的架構還為時不晚,並希望 OpenAI 能就此止步。
這一事件凸顯了 AI 安全領域在模型可解釋性與效能提升之間的持續張力。隨著推理模型日益複雜,如何在追求能力的同時保持足夠的透明度和可控性,已成為行業和監管者共同面臨的挑戰。