8月9日,长期关注OpenAI模型动向的X用户ChrisGPT爆料称,OpenAI正在推进一个代号为Doug的新一轮大型预训练模型。按照他的说法,Doug将是OpenAI迄今规模最大的一次预训练项目,而且它与GPT-6并不是同一个模型。在后续回复中,ChrisGPT进一步表示,GPT-6很可能就是昨天OpenAI因安全问题紧急暂缓发布的自家最强模型Astra。至于Doug,他预计最迟可能会在11月之前推出。
ChrisGPT并不是第一个公开提到Doug的消息源。8月7日,半导体和AI行业研究机构SemiAnalysis在一篇讨论Gemini和Google Cloud的文章中,公开了一段此前发送给机构客户的研究备忘录,这份备忘录的时间是7月9日。其中有一句很关键:OpenAI已经克服了预训练方面的问题,一个代号为Doug、规模大得多的模型正在积极推进。
如果相关消息准确,Doug可能意味着,在过去接近两年主要依赖post-training、强化学习和inference-time compute推动能力增长之后,OpenAI正在重新启动一次大规模的基础模型换代。
故事要从GPT-4o说起。2024年5月13日,OpenAI发布GPT-4o,并将其称为新的旗舰模型。此后接近两年,OpenAI虽然训练并发布了GPT-4.5等新的预训练模型,却始终没有完成一轮能够被广泛部署为下一代主力frontier model的全规模预训练。与此同时,OpenAI的模型能力增长开始越来越多地来自另一条路线。
2024年9月12日,OpenAI发布o1-preview。相比过去依靠更大规模预训练推动能力增长,o1展示了另一种scaling方法:通过大规模强化学习,让模型学会投入更多计算进行推理。此后,post-training、RL和inference-time compute在OpenAI的模型体系中变得越来越重要。2025年4月,o3正式发布,OpenAI再次强调,o系列的推理能力来自large-scale reinforcement learning。2025年8月,GPT-5发布,它不再只是一个单一模型,而是一套由快速模型、深度推理模型和路由系统组成的统一架构。
SemiAnalysis认为,o1、o3乃至GPT-5系列背后,并没有伴随一次与GPT-4o相当的全新base model世代跃迁,相关模型实际上仍建立在GPT-4o时代的基础模型体系之上。OpenAI从未确认这一训练血缘,但如果SemiAnalysis的信息成立,过去近两年的路线就很好理解了:底座没有发生同等级别的世代跃迁,能力增长主要由越来越强的post-training和RL推动。模型scaling也由过去主要依赖pre-training,逐渐扩展到了pre-training、RL和inference-time compute三个维度。
问题在于,如果基础模型长期没有发生同等级别的换代,仅依靠后训练和推理计算继续scaling,迟早会面临边际收益下降的问题。而Gemini 3的出现,把这种潜在的训练路线问题迅速转化成了现实的竞争压力。
2025年11月18日,Google发布Gemini 3。十天后,SemiAnalysis在TPUv7分析中抛出了一个引发广泛讨论的判断:自GPT-4o以来,OpenAI没有完成一轮能够被广泛部署为新frontier model的成功全规模预训练。当Google推出Gemini 3后,这种差异也从训练路线问题,变成了直接的竞争压力。12月1日,多家媒体报道称,Sam Altman在OpenAI内部宣布「Code Red」,要求团队优先提升ChatGPT,并重新配置部分资源。
一天之后,更关键的训练信息浮出水面。2025年12月2日,《The Information》报道称,OpenAI正在开发一个代号为Garlic的新预训练模型。报道援引内部消息称,Garlic在coding和reasoning评测中表现不错,同时使用了OpenAI在此前训练过程中发现的一系列bug fixes。更关键的是,OpenAI首席研究官Mark Chen据称向团队表示,公司已经解决了此前pre-training中的一些关键问题。报道还提到,这些训练改进能够让更小的模型容纳过去需要更大模型才能获得的知识。同一篇报道里,还有一句后来显得格外重要:OpenAI已经基于Garlic学到的经验,开始开发一个「even bigger and better model」。
Doug的故事,其实从这里就已经开始了。2026年1月6日,SemiAnalysis再次谈到OpenAI的模型路线,这一次,他们直接写道:OpenAI已经解决了预训练方面的问题。也就是说,按照SemiAnalysis掌握的信息,OpenAI此前困扰全规模预训练的问题已经得到解决。Garlic很可能承担了验证这些修复是否有效的角色,而Doug,则可能是这些训练方法真正被放大到更大规模之后的结果。
如果上述消息准确,那么OpenAI可能正在连续推进至少两轮重要模型项目:已经进入高级评测阶段的Astra,以及规模据称更大的Doug。而Doug指向的则是另一件事:重新推动底座本身的scaling。过去两年,OpenAI已经证明,旧底座仍然可以通过RL、reasoning和inference-time compute被不断向上推。Doug要回答的是另一个问题:当底座本身重新完成一次大幅跃迁之后,这套已经被推到极致的后训练体系,还能把能力再带到哪里。这可能才是OpenAI下一轮模型竞争真正的起点。