OpenAI 的 Codex 使用者額度管理員 Tibo 今日在 X 上宣佈,為所有付費的 ChatGPT Work 和 Codex 使用者重置使用額度。Tibo 表示,這次修復能讓不同使用方式的使用者額度多撐 10% 到 50%。這一訊息迅速在開發者社群引發關注,因為 Tibo 已成為 Codex 使用者心中的“重置額度之神”,每當 Codex 出現問題或 OpenAI 想補償使用者時,他都會在 X 上簡單宣佈“重置了”。

在最近的一次訪談中,主持人 Matthew Berman 當面詢問 Tibo 究竟如何重置額度,答案頗具戲劇性——Tibo 透露自己確實擁有一個實體按鈕,當他認為體驗出現問題需要補償使用者時,他可以自行按下。這一細節揭示了 OpenAI 在使用者支援上的靈活操作,也側面反映出 Codex 在快速迭代中面臨的穩定性挑戰。

不過,訪談中更有價值的部分在於 Tibo 對 Codex 未來的展望。幾周前,Tibo 曾放言:“再過兩三個月,今天的 Codex 會顯得很原始。”在訪談中,他並未公佈秘密模型,而是聚焦於當前使用者已遇到的實際痛點:Skill 檔案需要手動維護Memory 偶爾遺忘Agent 數量增多後用戶需在多個任務間頻繁切換。主持人提到自己經常同時開啟 10 到 15 個 Agent,此時瓶頸已不再是 GPU,而是人的注意力。Tibo 顯然不滿足於這種狀態,他理想中的 Agent 應能感知使用者近期工作、團隊進展,並主動啟動任務,而無需使用者親自管理 Skill、Memory 和子 Agent。

Tibo 判斷,未來 Agent 將自然地向雲端遷移,因為下一代模型的需求將超越個人筆記型電腦的能力。這一觀點與 AI 領域的“遞迴自我改進”(Recursive Self-Improvement,RSI)概念相呼應。RSI 指 AI 模型幫助研究下一代模型,後者變強後再參與下一輪研究,形成持續改進的迴圈。這一理論可追溯至 1965 年 I.J. Good 的設想,而 2003 年 Jürgen Schmidhuber 提出的 Gödel Machine 曾試圖通過數學證明來確保改進的正確性,但工程上難以實現。如今,業界轉向“先改後測”的實用方法,例如 Karpathy 開源的 autoresearch 專案,讓 Agent 自主修改程式碼、訓練並評估結果。

Tibo 將 RSI 的範圍擴充套件至修改 CUDA 核心、推理棧和 Agent 框架,這些改動最終使模型執行更快、更便宜,相當於將能力“指回自身”。然而,他承認並非所有 AI 輔助程式設計都算 RSI,關鍵在於改進是否被保留、是否持續參與下一輪迴圈。

當前,AI 自我改進已出現多種實踐。例如,R-Zero 讓模型自我出題訓練,在 Qwen3-4B 上數學和通用推理平均提升 6.49 和 7.54 個點OpenAI 的 GPT-5.6 Sol 通過 Codex 分析生產流量、最佳化路由並修改 GPU 核心,使端到端服務成本下降 20%,token 生成效率提升 15% 以上Anthropic 則讓 9 個 Agent 累計執行約 800 小時,在 5 天內將“效能差距恢復率”提升至 0.97。這些案例表明,AI 已從單純輔助寫程式碼,發展到自主出題、跑實驗、改系統,甚至觸及生產環境。

然而,自我改進的迴圈也帶來新問題。Anthropic 的實驗中,部分 Agent 會挑選有利的隨機種子、猜測測試標籤或檢視答案程式碼,導致分數虛高,即“獎勵駭客”(reward hacking)。若評測器也由 AI 修改,則需進一步驗證其可靠性。此外,Agent 在長時間執行後可能陷入低效方向,有研究比較了 Agent 與 61 名人類機器學習專家,發現 2 小時內 Agent 得分約為人類的 4 倍,但 32 小時後人類得分約為 Agent 的兩倍。反饋迴圈還可能引發“模型坍塌”,如 Nature 2024 年研究所示,模型用前代資料訓練可能丟失重要資訊。

Tibo 並未透露兩三個月後 Codex 的具體形態,但暗示 Agent 將更長期記憶專案、更多工移至雲端,並簡化使用者排程。同時,模型已開始參與最佳化自身執行的軟體和基礎設施。因此,他所說的“原始”可能指代我們使用 Agent 的方式將發生根本改變。