高盛亚太互联网团队分析师Ronald Keung在8月3日发布的最新研报中,将中国大模型厂商2026年末合计ARR(年度经常性收入)预期从100亿美元上调至130亿美元,并预测2030年将攀升至1250亿美元,五年增长25倍。同日,Jefferies研报显示,OpenRouter平台上中国模型已连续14周包揽调用量前五,DeepSeek V4 Flash单周消耗7.22万亿token登顶全球。两条数据线交汇,标志着中国大模型从“性价比叙事”迈入“收入兑现叙事”的拐点,而驱动这一拐点的核心力量是Agent与编码场景对token消费模式的根本性重塑。
高盛预测,中国大模型的API及订阅收入将从2026年估算的350亿元人民币增长至2030年的8790亿元,对应每日token消耗量从350万亿增至4600万亿,五年间收入与token消耗量同增约25倍,且增速仍在加速。收入结构出现分化,高盛对智谱和MiniMax的收入估计分别上调了35%和22%—64%,反映市场对中国头部模型公司商业化能力的重新定价。高盛将中国AI模型市场描述为正在形成的“双层结构”:高端市场以智谱GLM5.2和阿里Qwen3.7 Max为代表,定价约每百万token 1美元;低端市场面向Agent任务的模型定价低至每百万token 0.06至0.2美元。两层市场均在快速扩张,但驱动因素不同——高端靠智能溢价,低端靠规模效应。
不过,高盛也指出现实约束:2026年行业训练总成本40亿美元、推理总成本70亿美元,合计高于当期ARR,板块整体仍处于负EBIT状态。API业务毛利率当前仅20%—30%,盈利拐点要到2030年才会出现,届时板块EBIT利润率可达18%,对应总利润230亿美元。这是一条“先烧钱、后兑现”的路径,但终点已被清晰标定。
性价比的价差量级令人瞩目。高盛测算,一名Agent开发者每日约消耗709万token,在美国顶尖模型上运行,单日算力成本为52至104美元;切换至中国头部模型后,成本骤降至13美元,4到8倍的价差使得“不使用中国模型”变成一项需要向CFO解释的商业决策。价差的底层是架构红利:中国模型普遍采用MoE(混合专家)架构,通过极低的参数激活比压低推理成本。以DeepSeek V4 Flash为例,输入价格仅为每百万token 0.14美元,输出0.28美元,而OpenAI GPT-5.5的报价是5美元,差距在35倍以上。DeepSeek的缓存命中折扣机制更将命中缓存按标价2%计费,远超业内普遍的90%折扣水平,对于Agent场景中大量重复性上下文读取,实际成本还能再降一个数量级。
但价格只是硬币的一面。高盛将中国大模型的发展划分为两个阶段:2025年是“DeepSeek时刻”,行业依托MoE架构大幅压低推理成本;2026年是“智谱时刻”,GLM 5.2跻身代码、智能体等高价值赛道全球第一梯队,证明国产模型性能具备全球竞争力。三个月内,中国大模型跻身全球文本赛道前50%的模型新增13款;代码赛道全球前30%新增5款;智能体赛道实现从零到一的突破,GLM-5.2稳居全球前7。在Artificial Analysis视频模型榜单中,MiniMax H3的视频编辑能力排名全球第一,字节Seedance在多模态生成领域同样处于领先梯队。斯坦福AI Index数据显示,中美顶尖模型性能差距已缩小至约2.7%,一年前还是两位数。
能力超越的核心在于,中国模型的架构创新并非以牺牲性能为代价换取低成本。MoE架构的稀疏激活机制在压低推理成本的同时,通过更大的总参数量实现了更高的模型容量。MiniMax在M3模型中推出的全新注意力架构MSA(混合稀疏注意力),将1M超长上下文的处理成本降至传统架构的极低水平,同时在Coding和Agent基准测试中跻身全球前列。美团LongCat 2.0基于5万张国产算力卡完成1.6万亿参数全量训练,证明国产软硬件协同栈不仅能跑通,还能跑出竞争力。高盛评估显示,在基础文本模型领域,智谱和DeepSeek表现最突出;在Agent工具调用和Coding场景中,阿里Qwen3-Max处于全球第一梯队。当中国模型不再只有在“性价比赛道”上领先,同时在智能体、编码、多模态生成等最考验模型深度理解与长程规划能力的赛道上与全球顶尖模型正面竞争时,“便宜”就不再是唯一的故事——“更好”正在成为新的叙事。
OpenRouter最新周报(7月27日—8月2日)显示,全球大模型调用量前五全部由中国模型包揽:DeepSeek V4 Flash(7.22万亿)、小米MiMo-V2.5(6.3万亿)、腾讯混元Hy3(4.82万亿)、DeepSeek V4 Pro(3.28万亿)、智谱GLM5.2(2.89万亿)。中国模型在全球平台的token份额已达63.5%,美国跌至35.5%。消费结构发生质变:同一份编码任务,AI Agent自动化工作流平均消耗417万token,普通代码问答仅消耗3390token,相差超过1000倍。OpenCode平台披露,DeepSeek V4 Flash单日处理量已达8万亿token,其中5万亿来自免费试用额度,3万亿来自付费套餐。以Hermes为代表的Agent应用已经超过人类聊天,成为OpenRouter上最大的token消耗App。
这种转变催生了“多模型调用”的新范式。微软已证实正在探索将DeepSeek V4部署在Azure上,用作Copilot的低成本模型选项;Airbnb CEO公开表示公司依赖阿里Qwen模型用于大规模生产场景。企业客户正在从“绑定单一模型”转向“便宜的和高级的搭配着来”,这种混用正在从个别企业的权宜之计变成默认配置。
竞争前沿也在迁移。7月31日,MiniMax发布新一代多模态生成模型H3,并宣布近期开源,支持文本、图片、音频和视频等多种输入,可直出2K分辨率画面,最长生成15秒音画内容。在Artificial Analysis视频模型榜单中,H3的视频编辑能力排名全球第一。定价方面,H3视频生成价格为0.8元/秒(2K分辨率),仅为业内同类旗舰模型的三分之一。MiniMax股价当日大涨超14%,市场对“极致性价比+开源”的商业突围路径投下了赞成票。在Agent应用层,字节跳动发布面向Agent与Coding场景的Seed 2.1 Pro,腾讯WorkBuddy在企业Agent应用市场占据34%的份额,智谱GLM Coding Plan同步开放订阅。高盛注意到,AI消耗token最多的两大应用——智能代理和编程——已大规模迁移至中国模型上运行,因为其极低的单价使得规模化部署在经济上变得可行。
模型层的繁荣正在向云收入层传导。阿里云最新季度收入达398.24亿元,同比增长34%,增速创三年新高。AI相关产品收入连续第九个季度实现三位数增长,AI相关服务贡献了云业务对外收入的约20%。高盛预计,阿里云AI收入占比将从30%向50%迈进。过去四个季度,阿里在AI+云基础设施的资本开支约1200亿元,阿里巴巴CEO吴泳铭在财报电话会上表示:“三年规划3800亿的投资目前看说少了。”Jefferies前瞻即将到来的CSP财报季:阿里云收入预计加速至45% YoY,腾讯云AI收入占比持续提升,百度智能云受益于文心系列模型迭代。
中国大模型正在经历双重转型:从“性价比”到“收入兑现”,以及从“Chat”到“Work”。高盛将ARR预期从100亿上调至130亿美元,不是因为它突然变得乐观,而是因为token消费的数据已经跑出来了——7.22万亿的周调用量不是预测,而是正在发生的现实。当中国模型连续14周包揽OpenRouter前五,当Agent开发者每天烧掉8万亿token,收入预期的上调只是对既有趋势的滞后确认。token消费的主人正在从人变成Agent,这不仅是量的爆发,更是质的转变。Agent任务的token消耗是普通问答的1000倍,而中国模型4到8倍的价格优势在这种量级下被放大成不可逾越的成本壁垒。微软在Azure上部署DeepSeek、Airbnb依赖Qwen——企业用脚投票的结果,比任何benchmark都更有说服力。中国大模型的竞争态势正在被改写,竞争的核心不仅仅是谁的参数更大、谁的benchmark分数更高,而是谁能把推理成本压到最低、谁能在Agent和编码场景中捕获最多的token消费、谁能将模型能力最快地转化为云收入。这是一场关于成本、场景和生态的综合博弈,而中国模型正在从“跟跑者”变为“规则制定者”。