今年年初以来,国产大模型的竞争格局每隔1-2个月就会发生一次根本性变化。据作者观察,1-2月,Qwen最领先;3月中下旬,Kimi一度领先,但市场在等待DeepSeek;4月下旬,DeepSeek V4成为最受关注者;6月下旬,GLM-5.2凭借编程能力上位,约一个月后又被Kimi K3抢去风头。最近发布的Qwen 3.7同样优秀,阿里始终处于第一集团。

国产大模型数量多、更新快,且几乎都有开源版本,它们对如日中天的Claude系列构成多大冲击?自Claude Code和Claude Opus 4.6发布以来,Anthropic成为全球先进大模型商业化的典范,华尔街甚至考虑其2027年底ARR可能达4000亿美元。即便打八折或五折,也是千亿美元量级的数字。

Claude很贵,Anthropic采取完全闭源路线,许多人期盼国产大模型能“上一课”,提供“Claude杀手”。最近一个月,这种观点似乎得到佐证:Anthropic自5月以来未披露ARR,第三方估算增速下滑;OpenRouter等平台显示国产大模型Token占比很高。但作者认为,事实没那么简单,商业化与Token市场份额是两回事。

在收入层面,Anthropic 5月中旬公布的ARR为470亿美元,此后未披露,原因可能是6月秘密交表,准备在纳斯达克上市,上市前减少披露是合规且必要的。TickerTrends在7月中旬估算其ARR为741亿美元,两个月环比增长58%,相比2025年第四季度的90亿美元暴增4倍多,增速确实放缓,但若维持每月10.5%的环比增速,2026年底ARR可达4000亿美元,作者认为过于乐观,8%已属不易。

Anthropic的“减速”除了基数变大,还有OpenAI追赶的因素。2月底OpenAI宣布ARR达250亿美元,当时远高于Anthropic的140亿美元,但此后被甩开。GPT-5.6发布及Codex、GPT Work更新后,企业端API收入大幅上升,TickerTrends估算其ARR为413亿美元,约为Anthropic的60%。7月29日OpenAI CFO称7月ARR“超过整个二季度之和”,可能意味着实际ARR被低估。作者估计,本轮更新前OpenAI与Anthropic的ARR比约为0.6比1.0,现在可能拉近至0.7或0.8比1.0,这离不开Anthropic的“神助攻”:Fable 5延期并单独计价、大规模封号、Claude Code更新不及Codex等。不过Opus 5.0发布后可能又有变化。SemiAnalysis的对谈也提到,OpenAI在编程和Agent任务上与Anthropic重回“双雄”格局,最近一个月ARR增量甚至可能超过Anthropic。

在Token市场份额层面,国产开源大模型备受青睐。7月13-19日那一周,OpenRouter平台美国用户消耗的Token有64%来自中国开源大模型;自2026年2月以来,中国大模型占OpenRouter总体Token消耗比例从未低于30%;2026年6月,DeepSeek一个模型贡献了16.3%。Claude、GPT、Gemini在OpenRouter的份额从一年前的70%降至30%左右。但作者提醒,不能据此断言国产大模型Token份额已达60-70%,因为OpenRouter主要面向独立开发者、创业公司和爱好者,不包括订阅方案、云平台打包方案及大企业直接签约订单。国产模型可能也有低估,开源模型可本地部署、被政企微调,这些不计入统计,但创造的收入有限。

国产大模型能处理日常任务和不太复杂的开发任务,一位创业者70%的Token消耗来自某个国产模型,一位AI爱好者认为翻译、资料整理可完全平替。在这些任务上,烧Claude或GPT Token是浪费。但Claude为何还能维持高定价?过去三个月至少有四五个国产“Claude杀手”上线,提供1/5乃至1/10的API价格,Anthropic虽让步但有限,仍是全市场最贵。答案在于:复杂高要求的任务非Claude不可,客户愿付高溢价;企业真正成本是“每次解决任务的价格”,而非“每个Token的价格”。Kilo Code的测试显示,开源模型每次平均成本0.22美元,成功率46.7%;Claude Opus 4.8、Sonnet 4.6、GPT-5.5每次平均成本0.79美元,成功率65.6%。加上人工干预成本,价格差异缩小。

作者总结,国产大模型给Anthropic和OpenAI制造了危机感,但商业端收入冲击有限。真正的功劳是以低价高性价比加速了Agentic Coding Workflow进程,否则AI替代人类白领的速度可能放慢好几年。