高盛亞太網際網路團隊分析師Ronald Keung在8月3日釋出的最新研報中,將中國大模型廠商2026年末合計ARR(年度經常性收入)預期從100億美元上調至130億美元,並預測2030年將攀升至1250億美元,五年增長25倍。同日,Jefferies研報顯示,OpenRouter平台上中國模型已連續14周包攬呼叫量前五,DeepSeek V4 Flash單週消耗7.22萬億token登頂全球。兩條資料線交匯,標誌著中國大模型從“價效比敘事”邁入“收入兌現敘事”的拐點,而驅動這一拐點的核心力量是Agent與編碼場景對token消費模式的根本性重塑。

高盛預測,中國大模型的API及訂閱收入將從2026年估算的350億元人民幣增長至2030年的8790億元,對應每日token消耗量從350萬億增至4600萬億,五年間收入與token消耗量同增約25倍,且增速仍在加速。收入結構出現分化,高盛對智譜和MiniMax的收入估計分別上調了35%和22%—64%,反映市場對中國頭部模型公司商業化能力的重新定價。高盛將中國AI模型市場描述為正在形成的“雙層結構”:高階市場以智譜GLM5.2和阿里Qwen3.7 Max為代表,定價約每百萬token 1美元;低端市場面向Agent任務的模型定價低至每百萬token 0.06至0.2美元。兩層市場均在快速擴張,但驅動因素不同——高階靠智慧溢價,低端靠規模效應。

不過,高盛也指出現實約束:2026年行業訓練總成本40億美元、推理總成本70億美元,合計高於當期ARR,板塊整體仍處於負EBIT狀態。API業務毛利率當前僅20%—30%,盈利拐點要到2030年才會出現,屆時板塊EBIT利潤率可達18%,對應總利潤230億美元。這是一條“先燒錢、後兌現”的路徑,但終點已被清晰標定。

價效比的價差量級令人矚目。高盛測算,一名Agent開發者每日約消耗709萬token,在美國頂尖模型上執行,單日算力成本為52至104美元;切換至中國頭部模型後,成本驟降至13美元,4到8倍的價差使得“不使用中國模型”變成一項需要向CFO解釋的商業決策。價差的底層是架構紅利:中國模型普遍採用MoE(混合專家)架構,通過極低的引數啟用比壓低推理成本。以DeepSeek V4 Flash為例,輸入價格僅為每百萬token 0.14美元,輸出0.28美元,而OpenAI GPT-5.5的報價是5美元,差距在35倍以上。DeepSeek的快取命中折扣機制更將命中快取按標價2%計費,遠超業內普遍的90%折扣水平,對於Agent場景中大量重複性上下文讀取,實際成本還能再降一個數量級。

但價格只是硬幣的一面。高盛將中國大模型的發展劃分為兩個階段:2025年是“DeepSeek時刻”,行業依託MoE架構大幅壓低推理成本;2026年是“智譜時刻”,GLM 5.2躋身程式碼、智慧體等高價值賽道全球第一梯隊,證明國產模型效能具備全球競爭力。三個月內,中國大模型躋身全球文本賽道前50%的模型新增13款;程式碼賽道全球前30%新增5款;智慧體賽道實現從零到一的突破,GLM-5.2穩居全球前7。在Artificial Analysis影片模型榜單中,MiniMax H3的影片編輯能力排名全球第一,位元組Seedance在多模態生成領域同樣處於領先梯隊。斯坦福AI Index資料顯示,中美頂尖模型效能差距已縮小至約2.7%,一年前還是兩位數。

能力超越的核心在於,中國模型的架構創新並非以犧牲效能為代價換取低成本。MoE架構的稀疏啟用機制在壓低推理成本的同時,通過更大的總引數量實現了更高的模型容量。MiniMax在M3模型中推出的全新注意力架構MSA(混合稀疏注意力),將1M超長上下文的處理成本降至傳統架構的極低水平,同時在Coding和Agent基準測試中躋身全球前列。美團LongCat 2.0基於5萬張國產算力卡完成1.6萬億引數全量訓練,證明國產軟硬體協同棧不僅能跑通,還能跑出競爭力。高盛評估顯示,在基礎文本模型領域,智譜和DeepSeek表現最突出;在Agent工具呼叫和Coding場景中,阿里Qwen3-Max處於全球第一梯隊。當中國模型不再只有在“價效比賽道”上領先,同時在智慧體、編碼、多模態生成等最考驗模型深度理解與長程規劃能力的賽道上與全球頂尖模型正面競爭時,“便宜”就不再是唯一的故事——“更好”正在成為新的敘事。

OpenRouter最新週報(7月27日—8月2日)顯示,全球大模型呼叫量前五全部由中國模型包攬:DeepSeek V4 Flash(7.22萬億)、小米MiMo-V2.5(6.3萬億)、騰訊混元Hy3(4.82萬億)、DeepSeek V4 Pro(3.28萬億)、智譜GLM5.2(2.89萬億)。中國模型在全球平台的token份額已達63.5%,美國跌至35.5%。消費結構發生質變:同一份編碼任務,AI Agent自動化工作流平均消耗417萬token,普通程式碼問答僅消耗3390token,相差超過1000倍。OpenCode平台披露,DeepSeek V4 Flash單日處理量已達8萬億token,其中5萬億來自免費試用額度,3萬億來自付費套餐。以Hermes為代表的Agent應用已經超過人類聊天,成為OpenRouter上最大的token消耗App。

這種轉變催生了“多模型呼叫”的新範式。微軟已證實正在探索將DeepSeek V4部署在Azure上,用作Copilot的低成本模型選項;Airbnb CEO公開表示公司依賴阿里Qwen模型用於大規模生產場景。企業客戶正在從“繫結單一模型”轉向“便宜的和高階的搭配著來”,這種混用正在從個別企業的權宜之計變成預設配置。

競爭前沿也在遷移。7月31日,MiniMax釋出新一代多模態生成模型H3,並宣佈近期開源,支援文本、圖片、音訊和影片等多種輸入,可直出2K解析度畫面,最長生成15秒音畫內容。在Artificial Analysis影片模型榜單中,H3的影片編輯能力排名全球第一。定價方面,H3影片生成價格為0.8元/秒(2K解析度),僅為業內同類旗艦模型的三分之一。MiniMax股價當日大漲超14%,市場對“極致價效比+開源”的商業突圍路徑投下了贊成票。在Agent應用層,字節跳動釋出面向Agent與Coding場景的Seed 2.1 Pro,騰訊WorkBuddy在企業Agent應用市場佔據34%的份額,智譜GLM Coding Plan同步開放訂閱。高盛注意到,AI消耗token最多的兩大應用——智慧代理和程式設計——已大規模遷移至中國模型上執行,因為其極低的單價使得規模化部署在經濟上變得可行。

模型層的繁榮正在向雲收入層傳導。阿里雲最新季度收入達398.24億元,同比增長34%,增速創三年新高。AI相關產品收入連續第九個季度實現三位數增長,AI相關服務貢獻了雲業務對外收入的約20%。高盛預計,阿里雲AI收入佔比將從30%向50%邁進。過去四個季度,阿里在AI+雲基礎設施的資本開支約1200億元,阿里巴巴CEO吳泳銘在財報電話會上表示:“三年規劃3800億的投資目前看說少了。”Jefferies前瞻即將到來的CSP財報季:阿里雲收入預計加速至45% YoY,騰訊雲AI收入佔比持續提升,百度智慧雲受益於文心繫列模型迭代。

中國大模型正在經歷雙重轉型:從“價效比”到“收入兌現”,以及從“Chat”到“Work”。高盛將ARR預期從100億上調至130億美元,不是因為它突然變得樂觀,而是因為token消費的資料已經跑出來了——7.22萬億的周呼叫量不是預測,而是正在發生的現實。當中國模型連續14周包攬OpenRouter前五,當Agent開發者每天燒掉8萬億token,收入預期的上調只是對既有趨勢的滯後確認。token消費的主人正在從人變成Agent,這不僅是量的爆發,更是質的轉變。Agent任務的token消耗是普通問答的1000倍,而中國模型4到8倍的價格優勢在這種量級下被放大成不可逾越的成本壁壘。微軟在Azure上部署DeepSeek、Airbnb依賴Qwen——企業用腳投票的結果,比任何benchmark都更有說服力。中國大模型的競爭態勢正在被改寫,競爭的核心不僅僅是誰的引數更大、誰的benchmark分數更高,而是誰能把推理成本壓到最低、誰能在Agent和編碼場景中捕獲最多的token消費、誰能將模型能力最快地轉化為雲收入。這是一場關於成本、場景和生態的綜合博弈,而中國模型正在從“跟跑者”變為“規則制定者”。