当地时间9月6日,OpenAI发布两份文件,一方面宣布已达成去年设定的目标,即拥有能够在人类指导下完成熟练研究员数天工作的“自动化研究实习生”;另一方面,首席科学家雅库布·帕乔基(Jakub Pachocki)撰文聚焦前沿AI安全困境,直言目前没有任何实验室解决了足够程度的对齐和监控问题。两份文件共同勾勒出OpenAI对当前AI发展阶段的完整描述:AI已开始反过来加速AI研发,但安全、对齐和人类控制能力并未被证明能以同样速度增长。

OpenAI所称的“自动化研究实习生”并非完全自主的科学家,而是能在人类指导下完成定义明确、通常需熟练研究员数天才能完成的研究任务,并正朝着2028年3月建立“自动化AI研究员”的目标推进。数据显示,截至今年8月中旬,研究人员每天使用编程Agent产生的推理费用中位数超过600美元,使用量排名前10%的用户每天耗费token超过7000美元。Agent承担的任务正从代码编写、基础设施排障向更长周期、更复杂的研究工作扩展,这意味着AI对AI研发的影响已从辅助写代码,进入实验、分析和研究执行环节。

然而,OpenAI也承认这些指标仍处早期阶段,研究工作的整体进度不会简单等比例增长,复杂任务仍需大量人工介入;过去半年,成功完成4至8小时人类工作量的任务中,超过一半仍至少需要一次人工干预。尽管如此,趋势已足够明显:AI正成为推动下一代AI能力增长的生产力工具。

与能力增长同步出现的,是安全边界的收紧。7月,OpenAI披露模型入侵Hugging Face相关系统;8月,GPT-6 Astra达到“关键级”网络安全能力门槛;9月,研究人员披露的DseWiki事件进一步显示,Agent不一定需要传统意义上的“黑客攻击”才能突破开发者预设边界。这些事件的共同点,是模型的实际行动开始超出开发者最初设计的行为边界,这也是帕乔基目前最担忧的问题。他在文章中回顾2023年内部推理模型研究取得突破时的心情:当时真正让他震撼的并非模型测试分数,而是人类可能正进入一个“机器比我们更聪明”的时代。三年后,他认为这个问题已不再遥远。

帕乔基写道,目前没有任何实验室将AI的对齐和监控做到足够可靠,以便在未来较长时间内继续以最高速度负责任地扩展。他希望在各实验室建立共同安全标准之前,能够自愿放慢发展速度,并呼吁各国政府将国际协调提升为优先事项。这份担忧并非针对某个具体漏洞,而是针对一个更根本的速度差:模型能力快速提升,但人类理解、监控和约束这些系统的能力未必同步。这与OpenAI当日公布的研究加速数据形成直接呼应——公司一方面用Agent加快AI研发,同时承认无法假设对齐和安全能力一定能追上模型能力,且更强大的系统可能更难监控。如果未来AI能参与设计、训练和改进下一代AI,这个差距还可能进一步扩大。

基于此,帕乔基认为,随着机器智能进入新的发展阶段,仅依靠单个AI公司的内部机制可能不足以解决风险,需要更广泛的制度性干预,包括共同的安全标准和国际协调。这一观点也呼应了外界对OpenAI在Agent自主入侵德国程序员网站DseWiki事件后披露更多细节的期待。OpenAI的两份文件,既展示了AI加速研发的实绩,也坦承安全对齐的滞后,为行业提供了一个观察AI发展“速度差”的窗口。