智譜近日釋出輕量級旗艦模型 GLM-5.3 Flash,直接對標 DeepSeek V4 Flash,並呼叫超過 10 萬張國產晶片叢集用於推理服務。據《晚點 LatePost》瞭解,其算力供應商或來自 華為摩爾線程海光,但智譜官方未對此評論。

GLM-5.3 Flash 擁有 300B 引數規模,約為 GLM-5.3 的 40%,與 DeepSeek V4 Flash 幾乎持平。與同代小尺寸模型通常蒸餾自大模型不同,GLM-5.3 Flash 採用與 GLM-5.3 不同的架構設計,具備原生多模態能力,支援影像和影片輸入,這也是智譜戰略聚焦 coding 以來首次推出具有多模態能力的新模型。

在定價方面,GLM-5.3 Flash 每百萬 token 輸入 0.8 元、輸出 2.8 元、快取命中 0.23 元,正好為 GLM-5.3 的十分之一。橫向對比調價後的 DeepSeek V4 Flash(谷時價格分別為 1.5 元、4.5 元和 0.05 元),綜合輸入輸出成本,GLM-5.3 Flash 在絕大多數常規呼叫場景下更便宜。智譜還宣佈,上線前兩週將實行 半價

根據《晚點 LatePost》看到的智譜內部評測,GLM-5.3 Flash 的 Artificial Analysis Intelligence 分數為 57 分,超過上一代旗艦 GLM-5.2,與 Claude Opus 4.8 持平,也高於 DeepSeek 旗艦模型 V4 Pro 正式版的 53 分。

正式釋出前,智譜已在包括 OpenRouter 在內的第三方開放平台以 Ox Alpha 名義測試,5 天流量累積據悉超過 50 T,由於完全免費,重新整理了 OpenRouter 與 OpenCode 的流量增長紀錄。這並非智譜首次匿名釋出新模型——今年春節前夕,OpenRouter 上出現的 Pony Alpha 模型(呼應農曆馬年)後來被證實是智譜的 GLM-5。

智譜在技術文件中表示,其國產晶片叢集的“硬體效率及單位 token 成本已經達到了與主流輝達 GPU 相當的水平”,但未明確具體型號。

市場背景與競爭格局

6 月以來,中國公司爭相釋出能力接近美國次等級閉源模型的產品。6 月 13 日智譜釋出 GLM-5.2,7 月中 Kimi 的 K3 模型釋出,8 月 DeepSeek V4 Pro 正式版釋出,智譜則在 8 月 14 日釋出 GLM-5.3,其引數與結構同 GLM-5.2 完全一致,但效能大幅提升,官方宣稱完全基於後訓練強化學習。

效能提升的同時,漲價一度成為敘事主流。Kimi K3 的輸出價格高達 100 元,超過 K2.6 三倍多;智譜上半年提價後輸出價格也達 28 元。然而,8 月 DeepSeek 全面提價——V4 Pro 從 6 元漲到 13.5 元、高峰 27 元,V4 Flash 輸出從 2 元漲到 4.5 元、高峰 9 元——官方理由是算力稀缺、長期低價侵蝕現金流。但事實證明,智慧需求同樣有彈性,尤其是輕量級旗艦模型:漲價後,OpenCode 上 DeepSeek V4 Flash 呼叫量掉了一半,這部分需求成為國產模型廠商的新增長空間。

在美國,被歸類為第二梯隊的 MetaSpaceXAI(原 xAI) 等正瞄準 OpenAI 和 Anthropic 的最先進模型,而後者的價格往往是中國模型的數十倍。以 Claude Opus 4.8 為例,官方輸出價 25 美元,而 GLM-5.3 Flash 海外輸出價僅 0.5 美元

在中國,模型選擇多、能力差距小,廠商不僅要與同行競爭,還要面對開源部署、雲廠商贈送額度等,模型難以作為稀缺品定價,更接近標準雲服務價格。因此,中國廠商不斷將接近旗艦的能力推入低價區間,用價格、開源和相容性爭奪呼叫量。

不考慮算力採購與研發成本,模型推理是一門毛利很高的生意,前提是有足夠需求與效能。隨著 DeepSeek 漲價,輕量旗艦模型覆蓋的市場區間或將迎來更多競爭者。