9月4日,OpenAI发布新一代前沿模型GPT-6 Astra,并高调宣称“欢迎来到AGI时代”。这并非孤例——9月仅过去四天,海外四家巨头便轮番上新:Anthropic推出Claude Fable 5.1Mythos 5.1谷歌发布Gemini 3.8 Flash及专攻网络安全的Gemini 3.8 Flash CyberMeta则祭出Muse Spark 1.3。国内节奏同样惊人:上周,阿里千问Qwen3.8-Flash、智谱GLM-5.3-Flash、腾讯混元Hy4 preview相继上线;再往前两周,DeepSeek V4 ProGrok 4.6、谷歌Gemini 3.7 Flash、智谱GLM-5.3在48小时内密集亮相。

在Benchmark排行榜上,最强模型的“保质期”正急剧缩短——从登顶到被超越,如今往往撑不过一周。模型厂商仿佛在执行某种KPI,扎堆发布,“周抛”正成为大模型行业的新常态。

发布加速的两大推手

这一轮发版提速,背后有两大关键因素。其一,RSI(递归式自我改进)机制取得飞跃。OpenAI强调,GPT-6 Astra是第一款由前代模型深度参与训练监督的旗舰产品;谷歌DeepMind的姚顺宇也表示,Gemini 3.8 Flash对RSI而言是一次巨大飞跃。RSI的核心是让AI参与乃至改进自身研发流程,从而持续缩短迭代周期,有望开启更快的发布新周期。

其二,大模型研发正从“造神”式的大工程,转向标准化的“流水线”式训练。过去,新模型发布往往需要巨额投入、漫长周期,被视为“代际升级”。如今,基础训练方法成熟,后训练、强化学习、推理优化、数据处理等环节日益工程化。新模型不必从头训练,而是基于已有底座,通过强化推理、代码、Agent、视觉等特定能力,或优化速度、成本、上下文,快速推出新版本。模型的“代际”概念因此模糊,更像软件的小版本迭代。智谱曾明确表示,GLM-5.3与5.2共用同一基础模型,提升全部来自后训练;阿里通义团队在发布Qwen3.8-Flash-Next开源权重时透露,其新架构将是全新Qwen4系列的雏形。

厂商还越来越频繁地发布“小版本”和“专用版本”,目标从“做出最强模型”转向“瞄准具体需求、马上可用”。今年“Flash”系列密集出现,它们不追求全面击败旗舰,而是把速度、成本、推理或特定场景做到极致。Flash参数规模较小,修改和重训的算力消耗更低,进一步降低了发布门槛和周期。

开源“闪电战”与闭源“低头”

开源模型的密集发布,将竞争拉入更实时的维度。开源阵营不必每次全面超越,只需不断缩短与最强模型的差距,这种持续追赶本身就是压力。过去,开源“卷速度”、闭源“憋大招”的分工清晰,但现在连闭源巨头也开始高频迭代——谷歌从Gemini 3.7 Flash到3.8 Flash仅用了3周

发布周期一旦缩短,整个行业的“时间感”随之改变。以前半年不更新被视为正常,如今几周不更新就会引发“是否掉队”的怀疑。模型的更新速度本身,已成为竞争壁垒。

能力趋同,模型沦为“快消品”

2023年的大模型像“奢侈品”,稀缺昂贵;而2026年的市场正变成“快消品的盛宴”。“绝对领先”已不适用,Benchmark排行榜更像模型的“实时股价”。用户不再追问“谁是第一”,而是关心“今天哪个最好用”——不同任务场景下选择可能不同。

以GPT-6 Astra为例,OpenAI内部测试显示,其在多项基准上以标准版定价获得高于Claude Fable 5.1的得分;但在“人类最后的考试”中,Astra使用工具的得分为57.2%,低于Sol的65.0%和Claude Fable 5.1的63.8%。第三方机构Artificial Analysis的横测中,Astra的Coding Agent Index比Fable 5.1低3分。各家都有自己的“第一”,没有谁一骑绝尘。

价格战同步打响。Anthropic的Fable 5.1缓存读取费用下调75%,每百万token仅0.25美元,常规任务整体成本较Fable 5降低约25%,复杂Agent任务最高可省45%。8月,OpenAI宣布未来三个月GPT-5.6 Sol的API价格与超额信用额度全面下调超20%。数据服务商Silicon Data显示,全球每百万token推理均价已从5月底的2.04美元跌至8月初的1.16美元,创年内新低。

切换成本也在下降。腾讯Hy4 preview支持OpenAI Chat Completions、OpenAI Responses及Anthropic Messages三种API协议;Qwen和智谱GLM-5.3同样提供兼容OpenAI与Anthropic规格的API。上下文长度不再绑定特定模型——Gemini 3.7和3.8 Flash支持约104.8万Token输入上限,Hy4和Qwen3.8-Flash均提供1M Token窗口。用户越来越没有理由对单一模型保持忠诚,“超市货架式”的随取随用取代品牌崇拜。

谁焦虑,谁狂欢?

高频迭代下,模型厂商几乎没有喘息期:一次发布建立的领先优势很快被下一轮追上,它们既要做出更强模型,又须持续证明自己未掉队。相比之下,开发者和普通用户成了受益者——模型越多、越快,越方便“货比三家”,只需关心好不好用、够不够便宜、能否完成任务。

真正棘手的,是把大模型深度嵌入业务流程的企业。模型持续更新,评估与选择成为新工程负担;不同模型在推理、代码、Agent、速度、价格上各有优劣,今天的最优解可能很快被打破。企业难以“说换就换”,因为已围绕原模型搭建了Prompt、知识库、工具调用、Agent工作流和评测体系,更换模型意味着大量流程需重新测试调优。因此,B端竞争的下半场,可能不只是模型厂商争夺用户,而是围绕“谁能更低成本地选择、切换和组合模型”展开,这或将成为新的竞争力。

今天的行业TOP只属于今天——下一代模型可能下周就到。“周抛”改变的不仅是发布频率,更是竞争逻辑:“领先一次”远远不够,真正决定胜负的,是谁能更快进入下一轮。