賓夕法尼亞大學沃頓商學院副教授 Edgar Dobriban 藉助 OpenAI 最新的語言模型 GPT-5.6 Sol Pro,成功推翻了一個困擾統計學界長達 30 年的核心猜想。整個過程僅耗時約 90 分鐘,而人類此前一直未能攻克此難題。
該猜想與統計學中廣泛應用的 Benjamini-Hochberg (BH) 方法有關。該方法由 Yoav Benjamini 和 Yosef Hochberg 於 1995 年提出,旨在控制大規模假設檢驗中的假陽性率,其原始論文已被引用超過 13 萬次。當研究人員同時進行數千次檢驗時,例如掃描人類基因組尋找與疾病相關的基因,檢驗次數越多,出現假陽性的機率就越高。BH 方法通過控制錯誤發現率來解決這一問題。
Benjamini 和 Hochberg 最初證明其方法在資料獨立時有效。然而,現實世界中的資料點往往是相關的。例如,基因組中的某些位置經常被一同遺傳。多年來,專家們普遍假設 BH 方法在相關且呈正態分佈的資料中也能可靠工作,尤其是在進行雙向偏差檢驗時,但始終無人能給出嚴格證明。
Dobriban 的研究正是推翻了這一假設。他使用 GPT-5.6 Sol Pro 構建了一個統計模型,在該模型中,實際的錯誤發現率被證明會超過目標水平。模擬結果也證實了這一發現。Dobriban 指出,雖然超出目標水平的幅度“相對較小(0.104 對比 0.1)”,因此該發現目前主要具有理論意義,但這並不意味著 BH 方法完全不可用。
此次突破最引人注目之處在於 AI 解決問題的速度。Dobriban 表示,GPT-5.6 Sol Pro 在約 90 分鐘內就找到了解決方案,而其前代模型 GPT-5.5 在多個智慧體協作運算超過 20 小時後仍未能成功。他將此形容為“能力提升相當真實”。
加州大學伯克利分校的統計學家 Will Fithian 稱這個被推翻的猜想是“我所在統計學領域最有趣的問題”,並將此結果視為“AI 能力進步的又一個標誌,其影響將遠超數學領域”。他同時也表達了一種複雜情緒,感嘆過去每當有關鍵成果出現,總意味著有一位值得慶祝的同事、一種令人欽佩的人類洞察力,而如今這種體驗正在改變。
值得注意的是,與數學領域的類似案例一樣,AI 的解決方案似乎是將現有方法以一種新穎的方式組合起來,而非創造出全新的知識。Dobriban 本人也認為,這種組合方式雖不尋常,但結果本身“並非特別令人驚訝”。真正的挑戰在於找到連線已知方法的正確路徑,而新模型成功做到了這一點。
這一事件留下了一個更深層次的問題:基於人類資料訓練的模型,究竟能否推理出真正的新知識,還是僅僅能重組其在訓練中學到的內容?即便 AI 的能力僅限於重組,它們作為融入人類工作流程的日常工具,也已證明了自己的巨大價值。Dobriban 的成果為這一日益增長的例證列表增添了新的一筆。但對於構建能夠自我改進和泛化的 AI 等更宏偉的目標而言,可能還需要超越重組的全新能力。深度學習先驅 Richard Sutton 正是持此觀點者之一,他近期已創立了一家初創公司,專門致力於解決這一問題。