8月9日,長期關注OpenAI模型動向的X使用者ChrisGPT爆料稱,OpenAI正在推進一個代號為Doug的新一輪大型預訓練模型。按照他的說法,Doug將是OpenAI迄今規模最大的一次預訓練專案,而且它與GPT-6並不是同一個模型。在後續回覆中,ChrisGPT進一步表示,GPT-6很可能就是昨天OpenAI因安全問題緊急暫緩釋出的自家最強模型Astra。至於Doug,他預計最遲可能會在11月之前推出。

ChrisGPT並不是第一個公開提到Doug的訊息源。8月7日,半導體和AI行業研究機構SemiAnalysis在一篇討論Gemini和Google Cloud的文章中,公開了一段此前傳送給機構客戶的研究備忘錄,這份備忘錄的時間是7月9日。其中有一句很關鍵:OpenAI已經克服了預訓練方面的問題,一個代號為Doug、規模大得多的模型正在積極推進。

如果相關訊息準確,Doug可能意味著,在過去接近兩年主要依賴post-training、強化學習和inference-time compute推動能力增長之後,OpenAI正在重新啟動一次大規模的基礎模型換代。

故事要從GPT-4o說起。2024年5月13日,OpenAI釋出GPT-4o,並將其稱為新的旗艦模型。此後接近兩年,OpenAI雖然訓練併發布了GPT-4.5等新的預訓練模型,卻始終沒有完成一輪能夠被廣泛部署為下一代主力frontier model的全規模預訓練。與此同時,OpenAI的模型能力增長開始越來越多地來自另一條路線。

2024年9月12日,OpenAI釋出o1-preview。相比過去依靠更大規模預訓練推動能力增長,o1展示了另一種scaling方法:通過大規模強化學習,讓模型學會投入更多計算進行推理。此後,post-training、RL和inference-time compute在OpenAI的模型體系中變得越來越重要。2025年4月,o3正式釋出,OpenAI再次強調,o系列的推理能力來自large-scale reinforcement learning。2025年8月,GPT-5釋出,它不再只是一個單一模型,而是一套由快速模型、深度推理模型和路由系統組成的統一架構。

SemiAnalysis認為,o1、o3乃至GPT-5系列背後,並沒有伴隨一次與GPT-4o相當的全新base model世代躍遷,相關模型實際上仍建立在GPT-4o時代的基礎模型體系之上。OpenAI從未確認這一訓練血緣,但如果SemiAnalysis的資訊成立,過去近兩年的路線就很好理解了:底座沒有發生同等級別的世代躍遷,能力增長主要由越來越強的post-training和RL推動。模型scaling也由過去主要依賴pre-training,逐漸擴充套件到了pre-training、RL和inference-time compute三個維度。

問題在於,如果基礎模型長期沒有發生同等級別的換代,僅依靠後訓練和推理計算繼續scaling,遲早會面臨邊際收益下降的問題。而Gemini 3的出現,把這種潛在的訓練路線問題迅速轉化成了現實的競爭壓力。

2025年11月18日,Google釋出Gemini 3。十天後,SemiAnalysis在TPUv7分析中丟擲了一個引發廣泛討論的判斷:自GPT-4o以來,OpenAI沒有完成一輪能夠被廣泛部署為新frontier model的成功全規模預訓練。當Google推出Gemini 3後,這種差異也從訓練路線問題,變成了直接的競爭壓力。12月1日,多家媒體報道稱,Sam Altman在OpenAI內部宣佈「Code Red」,要求團隊優先提升ChatGPT,並重新配置部分資源。

一天之後,更關鍵的訓練資訊浮出水面。2025年12月2日,《The Information》報道稱,OpenAI正在開發一個代號為Garlic的新預訓練模型。報道援引內部訊息稱,Garlic在coding和reasoning評測中表現不錯,同時使用了OpenAI在此前訓練過程中發現的一系列bug fixes。更關鍵的是,OpenAI首席研究官Mark Chen據稱向團隊表示,公司已經解決了此前pre-training中的一些關鍵問題。報道還提到,這些訓練改進能夠讓更小的模型容納過去需要更大模型才能獲得的知識。同一篇報道里,還有一句後來顯得格外重要:OpenAI已經基於Garlic學到的經驗,開始開發一個「even bigger and better model」。

Doug的故事,其實從這裡就已經開始了。2026年1月6日,SemiAnalysis再次談到OpenAI的模型路線,這一次,他們直接寫道:OpenAI已經解決了預訓練方面的問題。也就是說,按照SemiAnalysis掌握的資訊,OpenAI此前困擾全規模預訓練的問題已經得到解決。Garlic很可能承擔了驗證這些修復是否有效的角色,而Doug,則可能是這些訓練方法真正被放大到更大規模之後的結果。

如果上述訊息準確,那麼OpenAI可能正在連續推進至少兩輪重要模型專案:已經進入高階評測階段的Astra,以及規模據稱更大的Doug。而Doug指向的則是另一件事:重新推動底座本身的scaling。過去兩年,OpenAI已經證明,舊底座仍然可以通過RL、reasoning和inference-time compute被不斷向上推。Doug要回答的是另一個問題:當底座本身重新完成一次大幅躍遷之後,這套已經被推到極致的後訓練體系,還能把能力再帶到哪裡。這可能才是OpenAI下一輪模型競爭真正的起點。