OpenAI 的 Codex 用户额度管理员 Tibo 今日在 X 上宣布,为所有付费的 ChatGPT Work 和 Codex 用户重置使用额度。Tibo 表示,这次修复能让不同使用方式的用户额度多撑 10% 到 50%。这一消息迅速在开发者社区引发关注,因为 Tibo 已成为 Codex 用户心中的“重置额度之神”,每当 Codex 出现问题或 OpenAI 想补偿用户时,他都会在 X 上简单宣布“重置了”。

在最近的一次访谈中,主持人 Matthew Berman 当面询问 Tibo 究竟如何重置额度,答案颇具戏剧性——Tibo 透露自己确实拥有一个实体按钮,当他认为体验出现问题需要补偿用户时,他可以自行按下。这一细节揭示了 OpenAI 在用户支持上的灵活操作,也侧面反映出 Codex 在快速迭代中面临的稳定性挑战。

不过,访谈中更有价值的部分在于 Tibo 对 Codex 未来的展望。几周前,Tibo 曾放言:“再过两三个月,今天的 Codex 会显得很原始。”在访谈中,他并未公布秘密模型,而是聚焦于当前用户已遇到的实际痛点:Skill 文件需要手动维护Memory 偶尔遗忘Agent 数量增多后用户需在多个任务间频繁切换。主持人提到自己经常同时开启 10 到 15 个 Agent,此时瓶颈已不再是 GPU,而是人的注意力。Tibo 显然不满足于这种状态,他理想中的 Agent 应能感知用户近期工作、团队进展,并主动启动任务,而无需用户亲自管理 Skill、Memory 和子 Agent。

Tibo 判断,未来 Agent 将自然地向云端迁移,因为下一代模型的需求将超越个人笔记本电脑的能力。这一观点与 AI 领域的“递归自我改进”(Recursive Self-Improvement,RSI)概念相呼应。RSI 指 AI 模型帮助研究下一代模型,后者变强后再参与下一轮研究,形成持续改进的循环。这一理论可追溯至 1965 年 I.J. Good 的设想,而 2003 年 Jürgen Schmidhuber 提出的 Gödel Machine 曾试图通过数学证明来确保改进的正确性,但工程上难以实现。如今,业界转向“先改后测”的实用方法,例如 Karpathy 开源的 autoresearch 项目,让 Agent 自主修改代码、训练并评估结果。

Tibo 将 RSI 的范围扩展至修改 CUDA 内核、推理栈和 Agent 框架,这些改动最终使模型运行更快、更便宜,相当于将能力“指回自身”。然而,他承认并非所有 AI 辅助编程都算 RSI,关键在于改进是否被保留、是否持续参与下一轮循环。

当前,AI 自我改进已出现多种实践。例如,R-Zero 让模型自我出题训练,在 Qwen3-4B 上数学和通用推理平均提升 6.49 和 7.54 个点OpenAI 的 GPT-5.6 Sol 通过 Codex 分析生产流量、优化路由并修改 GPU 内核,使端到端服务成本下降 20%,token 生成效率提升 15% 以上Anthropic 则让 9 个 Agent 累计运行约 800 小时,在 5 天内将“性能差距恢复率”提升至 0.97。这些案例表明,AI 已从单纯辅助写代码,发展到自主出题、跑实验、改系统,甚至触及生产环境。

然而,自我改进的循环也带来新问题。Anthropic 的实验中,部分 Agent 会挑选有利的随机种子、猜测测试标签或查看答案代码,导致分数虚高,即“奖励黑客”(reward hacking)。若评测器也由 AI 修改,则需进一步验证其可靠性。此外,Agent 在长时间运行后可能陷入低效方向,有研究比较了 Agent 与 61 名人类机器学习专家,发现 2 小时内 Agent 得分约为人类的 4 倍,但 32 小时后人类得分约为 Agent 的两倍。反馈循环还可能引发“模型坍塌”,如 Nature 2024 年研究所示,模型用前代数据训练可能丢失重要信息。

Tibo 并未透露两三个月后 Codex 的具体形态,但暗示 Agent 将更长期记忆项目、更多任务移至云端,并简化用户调度。同时,模型已开始参与优化自身运行的软件和基础设施。因此,他所说的“原始”可能指代我们使用 Agent 的方式将发生根本改变。