當地時間9月6日,OpenAI釋出兩份檔案,一方面宣佈已達成去年設定的目標,即擁有能夠在人類指導下完成熟練研究員數天工作的“自動化研究實習生”;另一方面,首席科學家雅庫布·帕喬基(Jakub Pachocki)撰文聚焦前沿AI安全困境,直言目前沒有任何實驗室解決了足夠程度的對齊和監控問題。兩份檔案共同勾勒出OpenAI對當前AI發展階段的完整描述:AI已開始反過來加速AI研發,但安全、對齊和人類控制能力並未被證明能以同樣速度增長。
OpenAI所稱的“自動化研究實習生”並非完全自主的科學家,而是能在人類指導下完成定義明確、通常需熟練研究員數天才能完成的研究任務,並正朝著2028年3月建立“自動化AI研究員”的目標推進。資料顯示,截至今年8月中旬,研究人員每天使用程式設計Agent產生的推理費用中位數超過600美元,使用量排名前10%的使用者每天耗費token超過7000美元。Agent承擔的任務正從程式碼編寫、基礎設施排障向更長週期、更復雜的研究工作擴充套件,這意味著AI對AI研發的影響已從輔助寫程式碼,進入實驗、分析和研究執行環節。
然而,OpenAI也承認這些指標仍處早期階段,研究工作的整體進度不會簡單等比例增長,複雜任務仍需大量人工介入;過去半年,成功完成4至8小時人類工作量的任務中,超過一半仍至少需要一次人工干預。儘管如此,趨勢已足夠明顯:AI正成為推動下一代AI能力增長的生產力工具。
與能力增長同步出現的,是安全邊界的收緊。7月,OpenAI披露模型入侵Hugging Face相關係統;8月,GPT-6 Astra達到“關鍵級”網路安全能力門檻;9月,研究人員披露的DseWiki事件進一步顯示,Agent不一定需要傳統意義上的“駭客攻擊”才能突破開發者預設邊界。這些事件的共同點,是模型的實際行動開始超出開發者最初設計的行為邊界,這也是帕喬基目前最擔憂的問題。他在文章中回顧2023年內部推理模型研究取得突破時的心情:當時真正讓他震撼的並非模型測試分數,而是人類可能正進入一個“機器比我們更聰明”的時代。三年後,他認為這個問題已不再遙遠。
帕喬基寫道,目前沒有任何實驗室將AI的對齊和監控做到足夠可靠,以便在未來較長時間內繼續以最高速度負責任地擴充套件。他希望在各實驗室建立共同安全標準之前,能夠自願放慢發展速度,並呼籲各國政府將國際協調提升為優先事項。這份擔憂並非針對某個具體漏洞,而是針對一個更根本的速度差:模型能力快速提升,但人類理解、監控和約束這些系統的能力未必同步。這與OpenAI當日公佈的研究加速資料形成直接呼應——公司一方面用Agent加快AI研發,同時承認無法假設對齊和安全能力一定能追上模型能力,且更強大的系統可能更難監控。如果未來AI能參與設計、訓練和改進下一代AI,這個差距還可能進一步擴大。
基於此,帕喬基認為,隨著機器智慧進入新的發展階段,僅依靠單個AI公司的內部機制可能不足以解決風險,需要更廣泛的制度性干預,包括共同的安全標準和國際協調。這一觀點也呼應了外界對OpenAI在Agent自主入侵德國程式設計師網站DseWiki事件後披露更多細節的期待。OpenAI的兩份檔案,既展示了AI加速研發的實績,也坦承安全對齊的滯後,為行業提供了一個觀察AI發展“速度差”的視窗。