9月2日至4日,谷歌、Meta與OpenAI在兩天內接連發布三款前沿大模型,重新整理速度之快令市場側目。9月2日,谷歌推出Gemini 3.8 Flash,這是其六週內第三款Flash系列模型;同日,Meta釋出Muse Spark 1.3,為其五個月內第四款Spark系列。Meta的新模型上線數小時後,即在Artificial Analysis智慧指數上反超谷歌同日新品,兩場釋出僅隔四十八小時。9月4日,OpenAI宣佈開始分批次向全部Plus使用者釋出GPT-6 Astra,官方稱釋出將“以儘可能謹慎且快速的方式”推進,預計數天內完成。
此次釋出潮凸顯出大模型競爭的新常態:模型保鮮期被壓縮至以小時計。兩年前,一款旗艦釋出足以佔據一週頭條,如今前沿模型的領先優勢轉瞬即逝。分析認為,這並非某一家公司的困境,而是行業整體訊號——大模型智慧本身正變成可快速複製、快速重新整理的商品。“誰先發布、誰更便宜、誰更垂直”正取代“誰最強”,成為更關鍵的競爭維度。
谷歌與Meta的路線之爭
谷歌的Gemini 3.8 Flash延續其“高頻小步”策略,定價與三週前的3.7 Flash持平,每百萬token輸入0.75美元、輸出3.75美元。但據TestingCatalog標註,這是12月31日前的入門價,並非永久定價,顯示谷歌將低價作為限時換取市場份額的籌碼。谷歌官方自測表顯示,3.8 Flash在多項基準上全面超越前代:長週期軟體工程測試DeepSWE v1.1從65.3%升至73.7%,終端基準Terminal-bench 2.1從85.8%升至89.4%,OSWorld-2.0從50.6%升至59.0%,金融智慧體基準Vals Finance Agent v2從59.0%升至61.4%,HLE-Verified從53.6%升至54.9%。
更具衝擊力的是與旗艦模型的對比。3.8 Flash在DeepSWE v1.1上得分73.7%,距Claude Opus 5的74.0%僅差0.3個百分點;HLE-Verified的54.9%甚至超過Opus 5的54.4%和GPT-5.6 Sol的54.5%。而Opus 5每百萬token輸出價高達25美元,是3.8 Flash的近七倍。一款Flash檔模型在數個硬核基準上逼近甚至追平售價數倍的旗艦,凸顯價效比優勢。
Meta則採取“單點爆發”路線。Muse Spark 1.3在Artificial Analysis智慧指數上獲得62分(max變體),僅次於Claude Fable 5.1的66分和Claude Opus 5的63分,位列全場第三。目前可用的xhigh變體得61分,與GPT-5.6 Sol(max)、Grok 4.6(high)、Claude Opus 5(high)並列。相比一個月前1.2版本的57分上漲4分,相比7月1.1版本的53分上漲8分,Meta將曾被視為“跟跑”的Spark系列推入第一梯隊。9月2日,兩條路線在同榜撞車,數小時後Meta勝出。
OpenAI的規模路線
OpenAI的GPT-6 Astra釋出則主打規模。此次釋出不再侷限於Pro、Business和Enterprise使用者,而是向全部Plus使用者鋪開,官方稱“以儘可能謹慎且快速的方式推進”,需數天滾動完成。OpenAI在釋出說明中強調,這次上線的“不是單個模型,而是一整套全新系統首次在真實生產環境中整體運轉”,團隊正“調集大批計算資源、擴充推理能力”,以確保全部Plus使用者順暢使用。這被解讀為一次基礎設施的大規模擴容,而非簡單的引數微調。
然而,規模路線也面臨分數測量的爭議。ARC Prize的分析顯示,GPT-6 Astra在ARC-AGI-3上以62.7%的Standard框架分數居首,但換用新的Provider Adapter框架後卻升至99.9%,並在96%的關卡上超過人類表現。同一模型在兩種測量框架下相差37個百分點,引發對“登頂”敘事有效性的質疑。
智慧趨同與成本為王
將三場釋出放在一起看,一個顯著趨勢是前沿實驗室的智慧水平正不可逆地趨同。以HLE-Verified為例,Gemini 3.8 Flash為54.9%,Claude Opus 5為54.4%,GPT-5.6 Sol為54.5%,三家分數緊咬在小數點後一位。DeepSWE v1.1上,73.7%對74.0%,差距不足一個百分點。當模型在“人類最後一場考試”級別的基準上僅差0.5個百分點時,“碾壓”“吊打”的敘事已失去依據。
谷歌在釋出中承認,3.8 Flash“工作得更努力”,即執行更多推理步驟與工具呼叫,在高思考檔下可能消耗更多token。這意味著分數上漲的代價是更多計算與輪次,而非範式突破。當智慧提升從“範式突破”退化為“算力堆疊”,前沿模型的軍備競賽便淪為邊際收益遞減的內卷。
在此背景下,單位智慧成本成為新的度量衡。Artificial Analysis資料顯示,Muse Spark 1.3 xhigh的單任務成本為0.55美元,而同處61分檔的Grok 4.6為0.94美元,GPT-5.6 Sol為0.95美元,Claude Opus 5為1.23美元。Meta僅以對手45%至59%的成本購得同檔智慧。Gemini 3.8 Flash單任務成本0.58美元,指數分59,緊貼Meta。整個行業的價效比前沿正被這兩家重新刻畫。
價格崩塌是全域性性的。此前DeepSeek已將V4-Pro價格永久下調75%,輸出價降至每百萬token約0.87美元,快取命中輸入價低至每百萬token約0.0036美元。如今谷歌也開始用限時入門價鎖定客戶,高價閉源模式的根基受到動搖。
垂直專用與准入壁壘
當通用智慧邊際收益變薄,前沿實驗室開始押注專用領域。谷歌此次隨3.8 Flash釋出的Gemini 3.8 Flash Cyber,是一款網路安全專用模型,僅通過Fairwind計劃向受信政府機構、關鍵基礎設施運營方與軟體維護者開放,普通開發者無法使用。谷歌內部基準顯示,Cyber在漏洞發現基準上成功率達71.0%,在CWE-Bench補丁修復上的pass@1為47.2%,逼近Claude Fable 5的47.8%;修復Chrome漏洞的正確補丁數量是最大商用模型的2.6倍,在Wiz滲透測試基準上召回率高7.5至9.7個百分點、成本低2.3至5.2倍。
此舉將“安全”從宣傳口號轉化為可收費、可圈地、可設定准入門檻的垂直市場。網路安全是天然的賣方市場,漏洞增長、攻擊自動化,而專業人才短缺。谷歌通過門控機制開闢了一塊短期難以被攻佔的高地。
Meta的閉源轉向
值得注意的是,Meta此次登頂的Muse Spark系列是一款閉源模型,這是Meta在2026年4月推出的第一款專有閉源模型,權重始終鎖定。這與其長期扮演的“開源旗手”角色形成鮮明對比。分析認為,當智慧趨同、價格崩塌,開源策略雖能換來生態,卻換不來前沿榜上的座次和精確計算的成本優勢。閉源賦予Meta對推理成本與迭代節奏的完全掌控,而這正是當前軍備競賽中比“開放”更硬的貨幣。
行業格局與啟示
兩天三場釋出,五小時一次反超,四十八小時後新一輪發布啟程。當模型釋出速度超過人們讀完一篇評測的速度,行業競爭的核心已不再是“誰最聰明”。分析指出,榜單時效性已短到失去參考價值,任何基於“某模型登頂”的長期押注都顯脆弱;高價閉源的賬越來越難算,但旗艦模型在長週期通用智慧體與計算機操作上仍有護城河(如Terminal-bench 4.0上Flash僅19.1%對Opus 5的51.8%);垂直專用與准入壁壘將成為下一階段護城河。對開發者而言,更實際的建議是按單任務成本與任務成功率做採購決策,警惕用“更多推理步驟”換分數卻隱性推高token賬單的模型。