智谱近日发布轻量级旗舰模型 GLM-5.3 Flash,直接对标 DeepSeek V4 Flash,并调用超过 10 万张国产芯片集群用于推理服务。据《晚点 LatePost》了解,其算力供应商或来自 华为、摩尔线程与 海光,但智谱官方未对此评论。
GLM-5.3 Flash 拥有 300B 参数规模,约为 GLM-5.3 的 40%,与 DeepSeek V4 Flash 几乎持平。与同代小尺寸模型通常蒸馏自大模型不同,GLM-5.3 Flash 采用与 GLM-5.3 不同的架构设计,具备原生多模态能力,支持图像和视频输入,这也是智谱战略聚焦 coding 以来首次推出具有多模态能力的新模型。
在定价方面,GLM-5.3 Flash 每百万 token 输入 0.8 元、输出 2.8 元、缓存命中 0.23 元,正好为 GLM-5.3 的十分之一。横向对比调价后的 DeepSeek V4 Flash(谷时价格分别为 1.5 元、4.5 元和 0.05 元),综合输入输出成本,GLM-5.3 Flash 在绝大多数常规调用场景下更便宜。智谱还宣布,上线前两周将实行 半价。
根据《晚点 LatePost》看到的智谱内部评测,GLM-5.3 Flash 的 Artificial Analysis Intelligence 分数为 57 分,超过上一代旗舰 GLM-5.2,与 Claude Opus 4.8 持平,也高于 DeepSeek 旗舰模型 V4 Pro 正式版的 53 分。
正式发布前,智谱已在包括 OpenRouter 在内的第三方开放平台以 Ox Alpha 名义测试,5 天流量累积据悉超过 50 T,由于完全免费,刷新了 OpenRouter 与 OpenCode 的流量增长纪录。这并非智谱首次匿名发布新模型——今年春节前夕,OpenRouter 上出现的 Pony Alpha 模型(呼应农历马年)后来被证实是智谱的 GLM-5。
智谱在技术文档中表示,其国产芯片集群的“硬件效率及单位 token 成本已经达到了与主流英伟达 GPU 相当的水平”,但未明确具体型号。
市场背景与竞争格局
6 月以来,中国公司争相发布能力接近美国次等级闭源模型的产品。6 月 13 日智谱发布 GLM-5.2,7 月中 Kimi 的 K3 模型发布,8 月 DeepSeek V4 Pro 正式版发布,智谱则在 8 月 14 日发布 GLM-5.3,其参数与结构同 GLM-5.2 完全一致,但性能大幅提升,官方宣称完全基于后训练强化学习。
性能提升的同时,涨价一度成为叙事主流。Kimi K3 的输出价格高达 100 元,超过 K2.6 三倍多;智谱上半年提价后输出价格也达 28 元。然而,8 月 DeepSeek 全面提价——V4 Pro 从 6 元涨到 13.5 元、高峰 27 元,V4 Flash 输出从 2 元涨到 4.5 元、高峰 9 元——官方理由是算力稀缺、长期低价侵蚀现金流。但事实证明,智能需求同样有弹性,尤其是轻量级旗舰模型:涨价后,OpenCode 上 DeepSeek V4 Flash 调用量掉了一半,这部分需求成为国产模型厂商的新增长空间。
在美国,被归类为第二梯队的 Meta 和 SpaceXAI(原 xAI) 等正瞄准 OpenAI 和 Anthropic 的最先进模型,而后者的价格往往是中国模型的数十倍。以 Claude Opus 4.8 为例,官方输出价 25 美元,而 GLM-5.3 Flash 海外输出价仅 0.5 美元。
在中国,模型选择多、能力差距小,厂商不仅要与同行竞争,还要面对开源部署、云厂商赠送额度等,模型难以作为稀缺品定价,更接近标准云服务价格。因此,中国厂商不断将接近旗舰的能力推入低价区间,用价格、开源和兼容性争夺调用量。
不考虑算力采购与研发成本,模型推理是一门毛利很高的生意,前提是有足够需求与性能。随着 DeepSeek 涨价,轻量旗舰模型覆盖的市场区间或将迎来更多竞争者。