9月2日至4日,谷歌、Meta与OpenAI在两天内接连发布三款前沿大模型,刷新速度之快令市场侧目。9月2日,谷歌推出Gemini 3.8 Flash,这是其六周内第三款Flash系列模型;同日,Meta发布Muse Spark 1.3,为其五个月内第四款Spark系列。Meta的新模型上线数小时后,即在Artificial Analysis智能指数上反超谷歌同日新品,两场发布仅隔四十八小时。9月4日,OpenAI宣布开始分批次向全部Plus用户发布GPT-6 Astra,官方称发布将“以尽可能谨慎且快速的方式”推进,预计数天内完成。

此次发布潮凸显出大模型竞争的新常态:模型保鲜期被压缩至以小时计。两年前,一款旗舰发布足以占据一周头条,如今前沿模型的领先优势转瞬即逝。分析认为,这并非某一家公司的困境,而是行业整体信号——大模型智能本身正变成可快速复制、快速刷新的商品。“谁先发布、谁更便宜、谁更垂直”正取代“谁最强”,成为更关键的竞争维度。

谷歌与Meta的路线之争

谷歌的Gemini 3.8 Flash延续其“高频小步”策略,定价与三周前的3.7 Flash持平,每百万token输入0.75美元、输出3.75美元。但据TestingCatalog标注,这是12月31日前的入门价,并非永久定价,显示谷歌将低价作为限时换取市场份额的筹码。谷歌官方自测表显示,3.8 Flash在多项基准上全面超越前代:长周期软件工程测试DeepSWE v1.1从65.3%升至73.7%,终端基准Terminal-bench 2.1从85.8%升至89.4%,OSWorld-2.0从50.6%升至59.0%,金融智能体基准Vals Finance Agent v2从59.0%升至61.4%,HLE-Verified从53.6%升至54.9%。

更具冲击力的是与旗舰模型的对比。3.8 Flash在DeepSWE v1.1上得分73.7%,距Claude Opus 5的74.0%仅差0.3个百分点;HLE-Verified的54.9%甚至超过Opus 5的54.4%和GPT-5.6 Sol的54.5%。而Opus 5每百万token输出价高达25美元,是3.8 Flash的近七倍。一款Flash档模型在数个硬核基准上逼近甚至追平售价数倍的旗舰,凸显性价比优势。

Meta则采取“单点爆发”路线。Muse Spark 1.3在Artificial Analysis智能指数上获得62分(max变体),仅次于Claude Fable 5.1的66分和Claude Opus 5的63分,位列全场第三。目前可用的xhigh变体得61分,与GPT-5.6 Sol(max)、Grok 4.6(high)、Claude Opus 5(high)并列。相比一个月前1.2版本的57分上涨4分,相比7月1.1版本的53分上涨8分,Meta将曾被视为“跟跑”的Spark系列推入第一梯队。9月2日,两条路线在同榜撞车,数小时后Meta胜出。

OpenAI的规模路线

OpenAI的GPT-6 Astra发布则主打规模。此次发布不再局限于Pro、Business和Enterprise用户,而是向全部Plus用户铺开,官方称“以尽可能谨慎且快速的方式推进”,需数天滚动完成。OpenAI在发布说明中强调,这次上线的“不是单个模型,而是一整套全新系统首次在真实生产环境中整体运转”,团队正“调集大批计算资源、扩充推理能力”,以确保全部Plus用户顺畅使用。这被解读为一次基础设施的大规模扩容,而非简单的参数微调。

然而,规模路线也面临分数测量的争议。ARC Prize的分析显示,GPT-6 Astra在ARC-AGI-3上以62.7%的Standard框架分数居首,但换用新的Provider Adapter框架后却升至99.9%,并在96%的关卡上超过人类表现。同一模型在两种测量框架下相差37个百分点,引发对“登顶”叙事有效性的质疑。

智能趋同与成本为王

将三场发布放在一起看,一个显著趋势是前沿实验室的智能水平正不可逆地趋同。以HLE-Verified为例,Gemini 3.8 Flash为54.9%,Claude Opus 5为54.4%,GPT-5.6 Sol为54.5%,三家分数紧咬在小数点后一位。DeepSWE v1.1上,73.7%对74.0%,差距不足一个百分点。当模型在“人类最后一场考试”级别的基准上仅差0.5个百分点时,“碾压”“吊打”的叙事已失去依据。

谷歌在发布中承认,3.8 Flash“工作得更努力”,即执行更多推理步骤与工具调用,在高思考档下可能消耗更多token。这意味着分数上涨的代价是更多计算与轮次,而非范式突破。当智能提升从“范式突破”退化为“算力堆叠”,前沿模型的军备竞赛便沦为边际收益递减的内卷。

在此背景下,单位智能成本成为新的度量衡。Artificial Analysis数据显示,Muse Spark 1.3 xhigh的单任务成本为0.55美元,而同处61分档的Grok 4.6为0.94美元,GPT-5.6 Sol为0.95美元,Claude Opus 5为1.23美元。Meta仅以对手45%至59%的成本购得同档智能。Gemini 3.8 Flash单任务成本0.58美元,指数分59,紧贴Meta。整个行业的性价比前沿正被这两家重新刻画。

价格崩塌是全局性的。此前DeepSeek已将V4-Pro价格永久下调75%,输出价降至每百万token约0.87美元,缓存命中输入价低至每百万token约0.0036美元。如今谷歌也开始用限时入门价锁定客户,高价闭源模式的根基受到动摇。

垂直专用与准入壁垒

当通用智能边际收益变薄,前沿实验室开始押注专用领域。谷歌此次随3.8 Flash发布的Gemini 3.8 Flash Cyber,是一款网络安全专用模型,仅通过Fairwind计划向受信政府机构、关键基础设施运营方与软件维护者开放,普通开发者无法使用。谷歌内部基准显示,Cyber在漏洞发现基准上成功率达71.0%,在CWE-Bench补丁修复上的pass@1为47.2%,逼近Claude Fable 5的47.8%;修复Chrome漏洞的正确补丁数量是最大商用模型的2.6倍,在Wiz渗透测试基准上召回率高7.5至9.7个百分点、成本低2.3至5.2倍。

此举将“安全”从宣传口号转化为可收费、可圈地、可设置准入门槛的垂直市场。网络安全是天然的卖方市场,漏洞增长、攻击自动化,而专业人才短缺。谷歌通过门控机制开辟了一块短期难以被攻占的高地。

Meta的闭源转向

值得注意的是,Meta此次登顶的Muse Spark系列是一款闭源模型,这是Meta在2026年4月推出的第一款专有闭源模型,权重始终锁定。这与其长期扮演的“开源旗手”角色形成鲜明对比。分析认为,当智能趋同、价格崩塌,开源策略虽能换来生态,却换不来前沿榜上的座次和精确计算的成本优势。闭源赋予Meta对推理成本与迭代节奏的完全掌控,而这正是当前军备竞赛中比“开放”更硬的货币。

行业格局与启示

两天三场发布,五小时一次反超,四十八小时后新一轮发布启程。当模型发布速度超过人们读完一篇评测的速度,行业竞争的核心已不再是“谁最聪明”。分析指出,榜单时效性已短到失去参考价值,任何基于“某模型登顶”的长期押注都显脆弱;高价闭源的账越来越难算,但旗舰模型在长周期通用智能体与计算机操作上仍有护城河(如Terminal-bench 4.0上Flash仅19.1%对Opus 5的51.8%);垂直专用与准入壁垒将成为下一阶段护城河。对开发者而言,更实际的建议是按单任务成本与任务成功率做采购决策,警惕用“更多推理步骤”换分数却隐性推高token账单的模型。