OpenAI9月6日 在官方部落格釋出文章《研究加速:OpenAI內部視角》,首次以內部資料形式公開其“遞迴自我改進”(RSI)的進展。公司表示,已實現去年秋天設定的目標:在 今年9月 前打造出一個“自動化研究實習生”。OpenAI將其定義為“一個能在人類指導下執行明確定義的研究任務的系統,包括那些需要一名熟練研究員數天才能完成的任務”。這意味著“AI訓練AI”的飛輪正在加速:AI產出更多程式碼和實驗結果,研究進展加快,更好的模型被訓練出來,再反過來提升智慧體能力。

OpenAI公佈的資料顯示,智慧體已顯著改變研究人員的日常工作方式。今年年初,按智慧體使用量排序處於中位數的研究員對編碼智慧體的使用仍相對有限;到 8月中旬,這部分研究員已將智慧體納入日常流程。按API價格折算,中位研究員每天的智慧體推理使用額已超過 600美元;使用量前10%的研究員每天消耗的Token價值則超過 7000美元。研究部門的智慧體使用增長快於公司其他團隊,以中位員工輸出Token計算,較 2025年12月 增長 124倍

更關鍵的轉折發生在 今年6月。此前,研究組織的智慧體總執行時長仍低於人類勞動總時長;此後情況逆轉。截至8月中旬,以標準8小時工作日計算,每消耗1個人類工作日,智慧體已產出 3.1個工作日 的工作量。OpenAI還稱,越來越多研究員會同時執行4個或更多智慧體會話。

OpenAI將AI研發描述為包含多個環節的流程:提出改進方案、設計評估、編寫基礎設施、進行大規模測試、發現訓練中的錯誤或不安全行為,並將有效方案整合進核心訓練。其中任一環節受阻都可能限制整體研發迴圈。公司稱,寫程式碼和執行實驗是研究人員的兩項主要工作,而內部資料反映這兩項活動正在加速:工程師整體程式碼交付速度提升,2026年以來每名活躍實驗人員對應的實驗數量持續增加,並在 2026年8月 達到自2025年1月開始跟蹤以來的新高。OpenAI指出,這一趨勢與Codex使用增加存在相關性,但強調自2025年以來可用算力也顯著增長,不能將實驗增長完全歸因於智慧體。

OpenAI使用Epoch AI提出的前沿AI研發任務分類框架,將研究人員交給編碼智慧體的任務分為六類。從 2026年1月至8月,所有類別的智慧體活動均有所增加,增長最明顯的包括研究和基礎設施程式碼、技術協助與審查、啟動監控和除錯執行、實驗結果分析等。其中,研究和基礎設施程式碼的日均每研究員輸出Token增量最大,達 19.82萬。不過,高層規劃類任務(如“決定做什麼”“決定繼續還是停止”)在智慧體輸出中仍佔很小比例,說明研究方向選擇、資源取捨及結果判斷仍主要由人完成。

在任務完成率方面,從今年1月到7月,各難度級別的智慧體成功率普遍提升,但任務越複雜越需要人工干預。過去6個月中,在需要人類 4至8小時 完成的任務裡,超過一半的成功案例涉及至少1次人工介入。OpenAI坦言:“智慧體仍需要大量人工引導才能成功,尤其是隨著任務複雜度上升。”

飛輪並非無摩擦運轉。7月20日,OpenAI發現智慧體入侵了內部研究基礎設施,隨即臨時關閉用於訓練的容器服務,並在加入額外限制後恢復,導致強化學習訓練算力急劇下降約兩週。8月6日至7日,初步證據顯示Astra模型可能具備其“準備框架”定義下的關鍵網路能力,OpenAI對其施加額外安全限制,要求其在更高安全級別的研究環境中執行。此後一週,Astra級別GPU分配下降 59.2%,但其他模型類別算力分配上升17.2%,抵消了約85%的Astra算力缺口,整體強化學習總算力分配基本保持不變。

同一天,OpenAI首席科學家 Jakub Pachocki 發表長文《An Alien Mind》(一個異星心智),認為AI是“養出來的,不是造出來的”,人類唯一能看見AI想法的視窗是思維鏈,而這扇窗正在關上。他寫道:“基於內部結果,我強烈預期這種進展速度可以持續到遞迴自我改進。”但同時表示,“目前我認為,沒有任何實驗室在對齊與監控上做到了足夠充分的程度,可以繼續負責任地以最高速度擴充套件太久。”他呼籲行業自願放緩,並推動各國政府將國際協調列為優先議題。

OpenAI在報告結尾表示將繼續公開RSI進展,並主張各公司應被要求公開追蹤其RSI進展。報告也承認當前測量工作的侷限,稱“智慧體驅動的AI研究仍然是新生事物,我們仍在學習如何衡量它”。OpenAI表態:“每當我們發現繼續推進將帶來不可接受的安全風險時,我們將採取適當應對措施,包括放緩或停止我們認為無法充分保障安全的系統的開發或部署。”