7月,大模型行业迎来罕见的发布潮,一个月内共有9款旗舰模型扎堆亮相,从月初腾讯混元Hy3正式版发布并开源,到月末Anthropic发布Claude Opus 5,其间Kimi K3、Qwen3.8-Max预览版、Grok 4.5等模型陆续登场,成为近一年少见的发布高峰。

这轮发布不仅数量多,更反映出两个显著变化:一是模型之间的能力差距正在缩小,头部模型在综合智能指数上的分差明显收窄,“最强模型”的宝座越来越难长期占据;二是开源模型开始进入第一梯队,腾讯混元Hy3、Kimi K3等选择开放权重,其中Kimi K3在Code Arena前端编程榜单中排名第一,超过GPT-5.6 Sol和Claude Fable 5,标志着开源模型在部分开发场景已能与闭源模型直接竞争。

竞争维度已从单纯比拼通用能力,扩展到代码、智能体、参数效率和价格等多个方面。代码能力成为最明显的争夺方向:OpenAI强化编程和复杂推理,扩展Codex生态;Anthropic押注代码理解和安全审计;Grok 4.5强调速度和低成本,并与AI编程工具Cursor绑定。Agent(智能体)是另一争夺焦点,GPT-5.6 Sol配合Codex探索自动化编程,Opus 5强调长程任务执行,Kimi K3展示连续运行能力,腾讯混元Hy3则试图结合微信生态探索智能体应用。不过,Agent在实际工作中仍不成熟,独立开发者反映,部分智能体产品的短板在于任务调度能力,而非工具调用本身,例如Codex的Ultra模式开启多个子代理重复读取文件,导致Token消耗增加但有效工作并未增加。

参数规模与推理效率的竞争成为另一主线。7月发布的多款模型进入万亿甚至数万亿参数区间,但参数规模已不能简单等同于能力高低,MoE架构让模型拥有更大参数容量同时只激活一小部分完成推理,降低计算成本。行业由此形成两条路线:一是继续扩大规模,二是强调效率,用更小激活参数实现接近旗舰效果。价格成为最直接的竞争变量:海外厂商多采取差异化定价,OpenAI拆分GPT-5.6版本,Anthropic维持高性能旗舰路线,Grok 4.5则采取低价策略,输出价格仅为Opus系列的四分之一;国内厂商则持续下调API价格,以低成本扩大用户规模。

从具体模型表现看,Kimi K3、Grok 4.5、混元Hy3超出预期。Kimi K3采用MoE架构,总参数达万亿级别,发布当天以1679分登顶Code Arena前端编程榜,较前代提升17个位次,一周后进入Arena综合榜全球Top 10,但其幻觉率从Kimi K2.6的39%升至51%,输出速度约33 Token/s,远低于同类模型,开发者反馈其在复杂工程任务上表现不够稳定。Grok 4.5于7月9日发布,进入Artificial Analysis智能指数前列,在工具调用测试中表现突出,被开发者视为性价比之选,其编程能力经过专门优化,搭配Cursor使用体验良好。混元Hy3总参数295B、激活参数仅21B,以不到旗舰五分之一参数规模在多个基准中接近更大模型,但在SWE-Bench Pro中57.9分与Claude Opus 4.8的69.2分仍有差距。

GPT-5.6 Sol和Claude Opus 5稳定在第一梯队但惊喜有限。GPT-5.6 Sol在Terminal-Bench 2.1测试中达88.8%,Ultra模式提升至91.9%;Claude Opus 5性能接近Fable 5,价格仅为后者一半。开发者表示,GPT-5.6已覆盖大部分日常开发需求,复杂问题则调用Opus 5。Gemini 3.6 Flash和Qwen3.8-Max预览版反馈分化,前者智能指数得分与前代持平,被指提升有限,但多模态理解出色;后者效果不稳定,思考深度高但有时陷入长时间推理,实际能力与宣传存在差距。

模型迭代加速的背后,是后训练技术的成熟。行业已掌握更高效的强化学习、后训练方法,模型升级不再依赖重新训练,竞争周期缩短,领先窗口可能只有几周。7月成为发布高峰,与国内世界人工智能大会(WAIC)举行、海外厂商集中更新有关。开源与闭源之争再度升温:支持方认为开放权重降低技术门槛、推动生态发展,反对方如Anthropic担忧安全风险。这场争论背后是不同公司的利益诉求,英伟达等基础设施企业受益于部署需求扩大,OpenAI、Anthropic等则依赖API和订阅收入。对国内厂商而言,开放权重是争取开发者生态和商业化入口的策略。

开发者社区预计,8月将有DeepSeek V4正式版、Fable 5.1、GPT-6等新模型发布。模型能力差距缩小,单靠发布更强模型难以建立长期优势,接下来需观察开源模型能力上限、API价格走势、智能体付费场景以及开源模型在企业私有化部署中的进展。