OpenAI 的 GPT-6 Astra 在 ulam.ai 的 ErdosBench 數學基準上拿下第一名,但這一成績並非公司刻意追求的結果。OpenAI 首席科學家 Jakub Pachocki 在一篇題為《An Alien Mind》的文章中明確表示,公司本可以通過額外投入讓模型在數學研究上更強,卻沒有把這一方向列為優先事項,原因在於對遞迴自我改進(RSI)和自動化對齊研究的緊迫感。

換句話說,當前表現最強的數學模型,是其他優先目標的副產品,而非定向最佳化的產物。

從資料看,Astra 在 ErdosBench 上得分 3.23,共解出 106 道開放數學問題,其中 43 道完全解決,另有 27 道被證偽。該基準包含 226 道受著名 Erdős 問題啟發的開放數學題。相比之下,此前的 GPT-5.6 Sol 在最高推理強度下得分 3.12、解出 78 道。基準開發者 Przemek Chojecki 評價稱,Astra 在多項數學研究技能上大約帶來 5% 至 10% 的提升,但該基準遠未飽和。他還提到,Astra 在科學寫作上更強,也更少做出誇大其詞的斷言,某些情況下甚至低估了自己的結果。

Pachocki 的表態之所以值得關注,是因為它暴露出 AI 發展前沿上正在發生的艱難取捨。一個在數學上佔優的模型,未必在其他領域同樣領先。這讓人聯想到劍橋研究者 Adam Hunt 的一張視覺化圖:一種路徑是所謂“主流 AGI”假設,即模型能力逐步、廣泛地提升,最終覆蓋所有人類任務;另一種路徑則描述出越來越“尖刺化”的軌跡——在程式設計、數學等少數領域極強,卻在語言質量、常識或社會推理等方面停滯甚至倒退。若後者成立,得到的將是一個高度專門化的模型,而非多數人理解的通用人工智慧。

Pachocki 關於 OpenAI 有意跳過數學最佳化的說法,正是“尖刺化”論點的證據之一:即便是領先的 AI 實驗室,也無法同時在所有方向上推進到極致。能力會朝著被最佳化的方向生長,而強化數學往往意味著要在別處做出讓步。不過,RSI 優先的背後也有一個期待——模型最終能自行完成這些最佳化,從而在包括數學在內的各領域更快擴充套件。

無論 Astra 比前代強 5% 還是 50%,對數學界而言,更深層的問題依然存在。數學家 Terence Tao2026 年國際數學家大會上提出:如果 AI 模型產出證明的速度持續快於人類核驗的速度,該領域可能從“證明稀缺”轉向“證明過載”,屆時關鍵任務將不再是解題,而是判斷哪些結果真正重要。Tao 認為數學正面臨一場價值觀與實踐層面的危機,並將其與 20 世紀初的基礎性動盪相提並論。

目前,數學中最難的問題仍未解決,這為學科爭取了一些時間。但方向似乎已經確定,儘管部分數學家認為語言模型缺乏類人創造力,難以帶來真正的突破;出於類似理由,也有人對 AI 實現真正自我改進的潛力存疑。