9月4日,OpenAI釋出新一代前沿模型GPT-6 Astra,並高調宣稱“歡迎來到AGI時代”。這並非孤例——9月僅過去四天,海外四家巨頭便輪番上新:Anthropic推出Claude Fable 5.1和Mythos 5.1,谷歌釋出Gemini 3.8 Flash及專攻網路安全的Gemini 3.8 Flash Cyber,Meta則祭出Muse Spark 1.3。國內節奏同樣驚人:上週,阿里千問Qwen3.8-Flash、智譜GLM-5.3-Flash、騰訊混元Hy4 preview相繼上線;再往前兩週,DeepSeek V4 Pro、Grok 4.6、谷歌Gemini 3.7 Flash、智譜GLM-5.3在48小時內密集亮相。
在Benchmark排行榜上,最強模型的“保質期”正急劇縮短——從登頂到被超越,如今往往撐不過一週。模型廠商彷彿在執行某種KPI,扎堆釋出,“周拋”正成為大模型行業的新常態。
釋出加速的兩大推手
這一輪發版提速,背後有兩大關鍵因素。其一,RSI(遞迴式自我改進)機制取得飛躍。OpenAI強調,GPT-6 Astra是第一款由前代模型深度參與訓練監督的旗艦產品;谷歌DeepMind的姚順宇也表示,Gemini 3.8 Flash對RSI而言是一次巨大飛躍。RSI的核心是讓AI參與乃至改進自身研發流程,從而持續縮短迭代週期,有望開啟更快的釋出新週期。
其二,大模型研發正從“造神”式的大工程,轉向標準化的“流水線”式訓練。過去,新模型釋出往往需要鉅額投入、漫長週期,被視為“代際升級”。如今,基礎訓練方法成熟,後訓練、強化學習、推理最佳化、資料處理等環節日益工程化。新模型不必從頭訓練,而是基於已有底座,通過強化推理、程式碼、Agent、視覺等特定能力,或最佳化速度、成本、上下文,快速推出新版本。模型的“代際”概念因此模糊,更像軟體的小版本迭代。智譜曾明確表示,GLM-5.3與5.2共用同一基礎模型,提升全部來自後訓練;阿里通義團隊在釋出Qwen3.8-Flash-Next開源權重時透露,其新架構將是全新Qwen4系列的雛形。
廠商還越來越頻繁地釋出“小版本”和“專用版本”,目標從“做出最強模型”轉向“瞄準具體需求、馬上可用”。今年“Flash”系列密集出現,它們不追求全面擊敗旗艦,而是把速度、成本、推理或特定場景做到極致。Flash引數規模較小,修改和重訓的算力消耗更低,進一步降低了釋出門檻和週期。
開源“閃電戰”與閉源“低頭”
開源模型的密集釋出,將競爭拉入更即時的維度。開源陣營不必每次全面超越,只需不斷縮短與最強模型的差距,這種持續追趕本身就是壓力。過去,開源“卷速度”、閉源“憋大招”的分工清晰,但現在連閉源巨頭也開始高頻迭代——谷歌從Gemini 3.7 Flash到3.8 Flash僅用了3周。
釋出週期一旦縮短,整個行業的“時間感”隨之改變。以前半年不更新被視為正常,如今幾周不更新就會引發“是否掉隊”的懷疑。模型的更新速度本身,已成為競爭壁壘。
能力趨同,模型淪為“快消品”
2023年的大模型像“奢侈品”,稀缺昂貴;而2026年的市場正變成“快消品的盛宴”。“絕對領先”已不適用,Benchmark排行榜更像模型的“即時股價”。使用者不再追問“誰是第一”,而是關心“今天哪個最好用”——不同任務場景下選擇可能不同。
以GPT-6 Astra為例,OpenAI內部測試顯示,其在多項基準上以標準版定價獲得高於Claude Fable 5.1的得分;但在“人類最後的考試”中,Astra使用工具的得分為57.2%,低於Sol的65.0%和Claude Fable 5.1的63.8%。第三方機構Artificial Analysis的橫測中,Astra的Coding Agent Index比Fable 5.1低3分。各家都有自己的“第一”,沒有誰一騎絕塵。
價格戰同步打響。Anthropic的Fable 5.1快取讀取費用下調75%,每百萬token僅0.25美元,常規任務整體成本較Fable 5降低約25%,複雜Agent任務最高可省45%。8月,OpenAI宣佈未來三個月GPT-5.6 Sol的API價格與超額信用額度全面下調超20%。資料服務商Silicon Data顯示,全球每百萬token推理均價已從5月底的2.04美元跌至8月初的1.16美元,創年內新低。
切換成本也在下降。騰訊Hy4 preview支援OpenAI Chat Completions、OpenAI Responses及Anthropic Messages三種API協議;Qwen和智譜GLM-5.3同樣提供相容OpenAI與Anthropic規格的API。上下文長度不再繫結特定模型——Gemini 3.7和3.8 Flash支援約104.8萬Token輸入上限,Hy4和Qwen3.8-Flash均提供1M Token視窗。使用者越來越沒有理由對單一模型保持忠誠,“超市貨架式”的隨取隨用取代品牌崇拜。
誰焦慮,誰狂歡?
高頻迭代下,模型廠商幾乎沒有喘息期:一次釋出建立的領先優勢很快被下一輪追上,它們既要做出更強模型,又須持續證明自己未掉隊。相比之下,開發者和普通使用者成了受益者——模型越多、越快,越方便“貨比三家”,只需關心好不好用、夠不夠便宜、能否完成任務。
真正棘手的,是把大模型深度嵌入業務流程的企業。模型持續更新,評估與選擇成為新工程負擔;不同模型在推理、程式碼、Agent、速度、價格上各有優劣,今天的最優解可能很快被打破。企業難以“說換就換”,因為已圍繞原模型搭建了Prompt、知識庫、工具呼叫、Agent工作流和評測體系,更換模型意味著大量流程需重新測試調優。因此,B端競爭的下半場,可能不只是模型廠商爭奪使用者,而是圍繞“誰能更低成本地選擇、切換和組合模型”展開,這或將成為新的競爭力。
今天的行業TOP只屬於今天——下一代模型可能下週就到。“周拋”改變的不僅是釋出頻率,更是競爭邏輯:“領先一次”遠遠不夠,真正決定勝負的,是誰能更快進入下一輪。