8 月 9 日,长期关注 OpenAI 动态的 X 用户 ChrisGPT 爆料称,OpenAI 正在推进一个代号为“Doug”的新一轮大型预训练模型。据其透露,Doug 将是 OpenAI 迄今规模最大的一次预训练项目,且它与 GPT-6 并非同一款模型。ChrisGPT 在后续回复中进一步指出,GPT-6 很可能就是昨日 OpenAI 因安全问题紧急暂缓发布的自家最强模型 Astra。关于 Doug 的推出时间,他预计最迟不会晚于 11 月。
ChrisGPT 并非唯一提及“Doug”的消息源。8 月 7 日,半导体与 AI 行业研究机构 SemiAnalysis 在一篇讨论 Gemini 和 Google Cloud 的文章中,公开了一份 7 月 9 日发送给客户的研究备忘录。备忘录中有一句关键信息:OpenAI 已克服预训练方面的问题,一个代号为“Doug”、规模更大的模型正在积极推进。
故事要从 GPT-4o 谈起。2024 年 5 月,OpenAI 发布 GPT-4o 并称其为新一代旗舰。此后近两年,尽管公司训练并发布了 GPT-4.5 等模型,却始终未能完成一轮能够广泛部署为下一代主力模型的全新全规模预训练。与此同时,模型能力的增长更多转向了另一条路线:2024 年 9 月发布的 o1-preview 展示了通过大规模强化学习让模型学会投入更多计算进行推理的新 scaling 方法。此后,post-training、RL 和 inference-time compute 在 OpenAI 的模型体系中愈发重要。2025 年 4 月的 o3 和 8 月的 GPT-5 系列均强调了这一路线。
SemiAnalysis 认为,o1、o3 乃至 GPT-5 系列并未伴随像 GPT-4o 那样的基础模型世代跃迁,相关模型实际上仍建立在 GPT-4o 时代的基础之上。如果这一信息属实,OpenAI 过去近两年的路线便不难理解:底座未发生同等级跃迁,能力增长主要靠后训练和 RL 推动。然而,单纯依赖后训练和推理计算继续 scaling,迟早会面临边际收益下降的问题。而 Google 推出的 Gemini 3,将这种潜在的训练路线问题迅速转化为了现实的竞争压力。
2025 年 11 月 18 日,Google 发布了 Gemini 3。十天后,SemiAnalysis 在 TPUv7 分析中抛出了一个引发广泛讨论的观点:自 GPT-4o 以来,OpenAI 尚未完成一轮成功的新前沿模型全规模预训练。Gemini 3 的问世,让这种差距从训练路线问题变成了直接的竞争压力。12 月 1 日,多家媒体报道称,Sam Altman 在内部宣布“Code Red”,要求团队优先提升 ChatGPT 并重新配置资源。一天后,更关键的训练信息浮出水面:12 月 2 日,《The Information》报道 OpenAI 正在开发代号为“Garlic”的新预训练模型。报道称 Garlic 在编码和推理评测中表现优异,并应用了此前训练中发现的一系列 bug 修复。更重要的是,OpenAI 首席研究官 Mark Chen 向团队表示,公司已解决此前预训练中的关键问题。这些改进能让更小的模型容纳过去需要更大模型才能获得的知识。这篇报道还提到,OpenAI 已基于 Garlic 的经验开始开发一个“规模更大且更优的模型”。
Doug 的故事,实际上由此展开。2026 年 1 月 6 日,SemiAnalysis 再次谈到 OpenAI 的模型路线,明确表示 OpenAI 已解决预训练问题。按照其掌握的信息,Garlic 很可能承担了验证这些修复的角色,而 Doug 则是这些训练方法真正放大到更大规模后的产物。如果上述消息准确,OpenAI 可能正在推进至少两轮重要项目:已进入高级评测阶段的 Astra,以及规模更大的 Doug。Doug 指向的则是另一件事:重新推动底座本身的 scaling。过去两年,OpenAI 已证明旧底座仍可通过 RL 和推理计算向上提升。Doug 要回答的是:当底座本身完成大幅跃迁后,这套已被推向极限的后训练体系,还能带来多少增量能力。这可能才是 OpenAI 下一轮模型竞争真正的起点。
