OpenAI 的 GPT-6 Astra 在 ulam.ai 的 ErdosBench 数学基准上拿下第一名,但这一成绩并非公司刻意追求的结果。OpenAI 首席科学家 Jakub Pachocki 在一篇题为《An Alien Mind》的文章中明确表示,公司本可以通过额外投入让模型在数学研究上更强,却没有把这一方向列为优先事项,原因在于对递归自我改进(RSI)和自动化对齐研究的紧迫感。
换句话说,当前表现最强的数学模型,是其他优先目标的副产品,而非定向优化的产物。
从数据看,Astra 在 ErdosBench 上得分 3.23,共解出 106 道开放数学问题,其中 43 道完全解决,另有 27 道被证伪。该基准包含 226 道受著名 Erdős 问题启发的开放数学题。相比之下,此前的 GPT-5.6 Sol 在最高推理强度下得分 3.12、解出 78 道。基准开发者 Przemek Chojecki 评价称,Astra 在多项数学研究技能上大约带来 5% 至 10% 的提升,但该基准远未饱和。他还提到,Astra 在科学写作上更强,也更少做出夸大其词的断言,某些情况下甚至低估了自己的结果。
Pachocki 的表态之所以值得关注,是因为它暴露出 AI 发展前沿上正在发生的艰难取舍。一个在数学上占优的模型,未必在其他领域同样领先。这让人联想到剑桥研究者 Adam Hunt 的一张可视化图:一种路径是所谓“主流 AGI”假设,即模型能力逐步、广泛地提升,最终覆盖所有人类任务;另一种路径则描述出越来越“尖刺化”的轨迹——在编程、数学等少数领域极强,却在语言质量、常识或社会推理等方面停滞甚至倒退。若后者成立,得到的将是一个高度专门化的模型,而非多数人理解的通用人工智能。
Pachocki 关于 OpenAI 有意跳过数学优化的说法,正是“尖刺化”论点的证据之一:即便是领先的 AI 实验室,也无法同时在所有方向上推进到极致。能力会朝着被优化的方向生长,而强化数学往往意味着要在别处做出让步。不过,RSI 优先的背后也有一个期待——模型最终能自行完成这些优化,从而在包括数学在内的各领域更快扩展。
无论 Astra 比前代强 5% 还是 50%,对数学界而言,更深层的问题依然存在。数学家 Terence Tao 在 2026 年国际数学家大会上提出:如果 AI 模型产出证明的速度持续快于人类核验的速度,该领域可能从“证明稀缺”转向“证明过载”,届时关键任务将不再是解题,而是判断哪些结果真正重要。Tao 认为数学正面临一场价值观与实践层面的危机,并将其与 20 世纪初的基础性动荡相提并论。
目前,数学中最难的问题仍未解决,这为学科争取了一些时间。但方向似乎已经确定,尽管部分数学家认为语言模型缺乏类人创造力,难以带来真正的突破;出于类似理由,也有人对 AI 实现真正自我改进的潜力存疑。