智谱AI(Z.ai)的MaaS开放平台注册用户(即API用户)已接近700万,相比7月初增长约200万,其中包括2.3万家企业客户。其开发者产品ZCode(对标OpenAI Codex)上线仅1个月,用户数便突破百万。今年以来,智谱的年度经常性收入(ARR)增长了15倍,据《晚点LatePost》了解,在Kimi和阿里新模型发布后,智谱的ARR增速并未受到明显影响。有投资人透露,目前智谱ARR已达到20亿美元,但智谱官方已否认这一数字,接近公司的人士则表示实际数字应该更高。若按20亿美元口径计算,注册用户当月平均在智谱开放平台花费约160元人民币。
在算力方面,7月21日市场传出智谱已建成规模达1GW的国产AI算力基础设施。据《晚点LatePost》了解,已有超过5万块国产算力芯片启用,以缓解日益增长的推理需求。7月31日,智谱长期限售的Coding Plan在大幅涨价后已开放购买。
智谱ARR的迅猛增长,受益于编程场景需求的快速攀升和前沿模型的强大吸引力。作为对比,智谱在2026年2月初GLM-5模型发布前,ARR约为1亿美元左右;据《晚点LatePost》了解,GLM-5发布后,智谱ARR在短期内即实现翻倍。根据Artificial Analysis的评测,GLM-5发布时位居全球第四,仅次于Claude当时最先进的两款模型以及OpenAI的GPT-5.2。
通过先进模型发布牵引收入抬升的剧本,在中美两国都已跑通。Anthropic年化收入在2025年底为90亿美元,半年后已迅猛增长到500亿美元(根据SemiAnalysis测算,7月已超过600亿美元)。除了编程场景需求跑通之外,Anthropic连续推出超过OpenAI的领先模型被认为起到重要作用。智谱是第一个在中国复制这一剧本的公司,类似的故事月之暗面和阿里随后都经历了一遍。7月16日Kimi发布K3,次日API就因过载中断近六个小时,Kimi甚至停止了新用户注册。8月3日阿里发布2.4万亿参数的Qwen3.8-Max,港股当天涨7%,市值重回2.4万亿港元,从6月低点算起反弹超过四成。
然而,在Anthropic走通coding这条路之前,几乎没有人对算力供应瓶颈有充分估计,甚至Anthropic自己也是如此。对中国大模型公司而言,算力紧缺更加严峻。在物理硬件无法快速扩展的情况下,工程师们转而聚焦于通过算法提升已有模型的推理效率,特别是针对长程任务的处理——这是编程需求的痛点。
过去智谱被认为在Infra上缺乏经验,但随着GLM-5带来的先发优势,智谱在过去半年飞速弥补Infra效率上的短板。智谱在7月已完成对中科加禾的收购,在此之前双方已联合办公数月。在技术博客中,智谱表示一个Agent干活时平均要往模型里塞7万多token的上下文,远超日常聊天内容,而通过分拆KV缓存,智谱和中科加禾的研究成果可以将单个推理服务吞吐随长程任务增长而最高提升达132%。在另一项名为ZCube的大模型推理网络架构方案中,智谱宣称其研究成果可以提升整个生产集群的吞吐量高达15%,同时降低AI基建中交换机与光模块需求多达三分之一。
5月下旬,智谱推出了高速版API,每秒生成token数达到400,相比常规API服务速度提升约8倍,官方称其“刷新当前全球大模型厂商API的速度上限”。这项研究成果来自与TileRT团队的合作,后者与TileLang来自同一团队——就是那份广为流传的梁文锋讲话里,被认为有潜力瓦解英伟达CUDA护城河的编程语言。不少研究员都同意,Infra上值得优化的东西实在太多。6月9日,TileRT团队又公布了与小米合作的成果,把MiMo-V2.5-Pro这个拥有1万亿参数的模型的速度推到了1000 token/s。
随着编程需求的爆发,智谱新模型训练也越来越朝着长程任务的方向进行,同时在模型架构上尽可能照顾推理需求。TileRT在介绍与智谱合作的那篇博客上,把它列为下一阶段的任务:模型、编译器与硬件开始重新耦合。GLM-5.2的几项核心架构改动,几乎都在围绕推理成本设计。技术报告公开的包括IndexShare——通过复用稀疏注意力层的索引器把百万token场景下单位token的计算量降低2.9倍;以及改进后的MTP草稿层,接受长度提升20%,生成速度随之快约两成。后训练阶段,智谱重新采用了PPO(近端策略优化),并配套了名为SAO(单轨迹异步优化)的异步方法,让每条任务跑完立刻进入学习——行业方法通常在约一百六十步就崩溃的地方,它稳定训练了一千步;自研框架slime则能在约两天里把十几个专家模型合并成一个。
技术报告中没有公开的是推理引擎层面的配套改造,所有这些优化的最终结果是一张归一化图:如果把GLM-5.1处理3.2万token上下文时的吞吐看作基准的话,20万上下文长度时,GLM-5.2的吞吐能力为4.7倍,而GLM-5.1则为2.77倍,几乎高了70%。这也是目前模型公司共同的优化方向。Kimi的K3在模型架构上更激进,它把四分之三的注意力层改成了所谓“线性注意力”,相比于智谱的方法,这是一种“有损”的改动,带来的好处也是立竿见影:缓存体积大幅减少,吞吐能力同步提高。
一位投资人对《晚点LatePost》表示,Infra层优化将是未来一两年AI投资的重要主题:模型能力趋同之后,谁能把同样的卡跑出更多token,谁的账就更好看。这让Infra人才的薪资增长飞快,1%的效率提升放在大规模部署的算力设备中,节省下来的钱也是天文数字。
API毛利率持续改善,让卖token变成一门好生意。一道简单的计算题可以侧面说明大模型规模化部署效率提升的空间:即使是高速版API的400 tokens/s,按照8卡H200服务器的内存带宽计算,也只用到硬件理论能力上限的四成。一位行业人士对《晚点LatePost》估算,大模型Infra每轮优化仍有15%到30%的效率提升,而对智谱来说就更是如此,它本来就不以Infra优化见长。这件事的商业价值比技术意义更大,让卖token这件事更像一个好生意:成本端推理效率有持续的优化空间,收入端用户需求持续增长。同时,编程的规模越来越大,项目越来越复杂,消耗的tokens越来越多。
智谱比别人更早看出来这是一门好生意,它是中国最早喊出“模型即服务”的公司,MaaS开放平台的域名bigmodel.cn早在2022年ChatGPT发布之前就已经注册,但它失误的地方在于没有在更早以更合适的价格锁定更多算力——哪怕拿不出最先进的模型,仅仅有能立刻使用的算力,转租出去也同样是门好生意,马斯克就是这么做的。目前,AI在生产力场景的扩散程度还不够高,因此token是一个纯粹的增量市场。根据《晚点LatePost》了解到的情况,7月中旬Kimi发布K3时,智谱API用户增长情况几乎没有受到影响,ARR增速也没有放缓。当下的时间点,每一个模型厂商的增长都不是以别家的萎缩为代价。这给了各家提价的底气。
智谱在7月31号放开了Coding Plan的购买限制,除了引入积分制的计算规则之外,最引人注目的是价格上涨:推出时的入门价格每月20元,而现在Lite版已经来到118元一个月。Coding Plan本来是早期为了吸引用户而制定的策略,当时谁都没有料到token需求会井喷爆发。现在,智谱需要优先保供API,只能对个人用户提价。即便如此,按照输入、缓存命中、输出大约7:2:1的价格计算,GLM-5.2的混合价格大约是8.8元/百万token,这显著低于美国同性能的模型。
不同的分析机构给出了各个模型厂商API毛利率的估算,SemiAnalysis估计Anthropic API毛利率超过80%,The Information的独家报道中指出DeepSeek的API毛利率大约在70%到80%之间。据《晚点LatePost》了解,智谱API毛利率在理想状况下,于自有算力设施上运转时可达50%到60%。这些毛利率的计算方式不涉及API服务的前期投入,而在大模型领域,前期投入恰恰是大头——海量的算力采购,加上庞大的人员成本。
7月智谱宣布新一轮港股配售,这发生在基石投资人港股解禁的第二天,智谱股价不降反升。据一位接近智谱的人士说,整个配售认购的时间一下午就完成,最后募资超过300亿港元。根据智谱的公告,55%用于研发,既包括算力采买,也包括人才队伍扩充。
API静态毛利率得以维持的另一个前提是模型厂商提供的智能是有区别的,模型领先才有定价权。但许多人认为,开源会直接影响先进模型的定价权,从而影响厂商收入。因此,不少厂商正在给开源上锁。智谱在GLM-5.2上仍沿用最宽松的MIT协议,而不止一家厂商正在酝酿或推行把开源授权变成一份商业合同,条款包括:开源版本是“残血”的,满血版只在官方API提供;年收入超过2000万美元的企业需单独申请授权;为模型提供托管服务的第三方,定价不得低于官方API,部分方案还要求分成,比例最高可超过30%。另一些人则不这么认为。开放权重模型是免费的,理论上任何人买几台服务器就能部署,但第三方的价格无法把模型厂商的毛利打穿,原因如前所述:模型的结构、训练过程和推理效率日益紧密地结合在一起,第三方只能在模型之外做优化,而模型厂商则掌握最深的推理效能know-how。以DeepSeek为例,一个公开信息是,许多第三方提供的DeepSeek模型其效率无法达到官方宣称的程度,而DeepSeek已经是相对来说对技术最开放的模型厂商了。
独立模型厂商的短暂窗口期。大模型的机会看上去正在重新回到创业公司手里,半年多前这一切还难以想象。Kimi的估值徘徊在30亿美元左右,智谱和MiniMax的招股书则难以论述自身商业模式的合理性:一家85%的收入来自项目制的本地化部署交付;一家收入依赖C端订阅、二十多亿元收入对应十几亿元亏损。C端的战场看上去更是早已与独立模型厂商无关:豆包砸出了国民级的用户量,但字节每天都在以千万计地亏钱——免费换规模的移动互联网打法,找不到盈利闭环。窗口期来自编程。Coding浪潮把按token计费的需求真正引爆,算账的方式彻底改变了。根据智谱2025年的年报,定价提高一倍,调用量反而涨了八倍,与海外前沿模型的价差也在逐渐缩小。Kimi比智谱更激进,K3模型API输出价为每百万token 15美元,与Claude Sonnet 5的标准定价一模一样。
窗口期的另一面是大厂的缺位:在长达半年的时间里BAT拿不出一个第一梯队的coding模型——2月时,人们津津乐道的叙事甚至还是春节红包大战,而智谱在2025年春天就已经决定把研究方向聚焦到编程上来。从这个角度讲,窗口期甚至还在拉长,字节已宣布不做蒸馏,等于亲手放弃了短期内快速追赶前沿模型的机会。但窗口期不会一直敞开,对没有历史包袱的独立模型公司来说,更容易跟上新技术是它的优势,但这是一场关于速度的一遍遍重复的竞赛,大厂只要赢一次,整个叙事就可能重新改写,而字节在视频模型上已经拿出了SOTA的成果。如今它们对Coding的投入已肉眼可见地坚定。更不用说大厂在算力采购与人力成本上的优势。今年5月的财报电话会上,阿里巴巴的吴泳铭表示对算力中心的投入规模将远超之前承诺的三年3800亿;腾讯2026年第一季度经营性资本支出同比增长了18%,环比增长了84%,“加快了对服务器基础设施的投资”。与之相对照的是,独立模型厂商至今还囿于算力瓶颈,有时甚至向潜在的对手租用算力来应付庞大的训练和推理需求。模型要保持在第一梯队,这样的投入没有一天能停。
更重要的是,coding的商业模式本身也在发生快速变化。越来越多的公司开始搭建所谓“内部路由”,按照任务的复杂程度把不同价位、不同性能的模型组合起来使用。Palantir们则在教育每一个企业客户只用API而不要使用模型厂商提供的更多工具——这些工具本来是增强用户粘性的重要环节。Palantir的逻辑是,模型最终会大宗商品化,而数据和工作流是企业最珍贵的资产,企业不应该把珍贵的业务数据源源不断喂给模型厂商,等于出资供养一个终将替代自己的智能系统,因此更好的方式是把数据、业务逻辑和工作流留在公司内部,模型只是个随时可以插拔更换的零件。这是toB生意的逻辑决定的:一切为效率让位。想在企业服务领域守住溢价,除了控制技术标准与格式、控制客户关系,就只能提供独一无二的服务——而大模型API的商业模式,看上去一条都不满足:领先模型守住位置的时间越来越短,用户在多个平台之间自由迁移,几乎没有壁垒。
假如Scaling Law的提升真的没有尽头,那意味着超级人工智能的实现,届时值得讨论的就不再是谁的毛利率高几个点了。但在ASI到来之前,眼下可以确定的似乎只有一件事,那就是以越来越快速度不断刷新的顶尖模型排行榜,这似乎是大模型玩家们目前能做的唯一应对策略。窗口还开着,算力依旧紧缺,人们依然渴望新的顶尖模型出现——最好能赶上乃至超过美国前沿的闭源模型,而下一次发布,已经排上了日程。智谱和DeepSeek预计都将在8月发布新模型,战况会更加激烈。