7月,大模型行業迎來罕見的釋出潮,一個月內共有9款旗艦模型扎堆亮相,從月初騰訊混元Hy3正式版釋出並開源,到月末Anthropic釋出Claude Opus 5,其間Kimi K3、Qwen3.8-Max預覽版、Grok 4.5等模型陸續登場,成為近一年少見的釋出高峰。

這輪發布不僅數量多,更反映出兩個顯著變化:一是模型之間的能力差距正在縮小,頭部模型在綜合智慧指數上的分差明顯收窄,“最強模型”的寶座越來越難長期佔據;二是開源模型開始進入第一梯隊,騰訊混元Hy3、Kimi K3等選擇開放權重,其中Kimi K3在Code Arena前端程式設計榜單中排名第一,超過GPT-5.6 Sol和Claude Fable 5,標誌著開源模型在部分開發場景已能與閉源模型直接競爭。

競爭維度已從單純比拼通用能力,擴充套件到程式碼、智慧體、引數效率和價格等多個方面。程式碼能力成為最明顯的爭奪方向:OpenAI強化程式設計和複雜推理,擴充套件Codex生態;Anthropic押注程式碼理解和安全審計;Grok 4.5強調速度和低成本,並與AI程式設計工具Cursor繫結。Agent(智慧體)是另一爭奪焦點,GPT-5.6 Sol配合Codex探索自動化程式設計,Opus 5強調長程任務執行,Kimi K3展示連續執行能力,騰訊混元Hy3則試圖結合微信生態探索智慧體應用。不過,Agent在實際工作中仍不成熟,獨立開發者反映,部分智慧體產品的短板在於任務排程能力,而非工具呼叫本身,例如Codex的Ultra模式開啟多個子代理重複讀取檔案,導致Token消耗增加但有效工作並未增加。

引數規模與推理效率的競爭成為另一主線。7月釋出的多款模型進入萬億甚至數萬億引數區間,但引數規模已不能簡單等同於能力高低,MoE架構讓模型擁有更大引數容量同時只啟用一小部分完成推理,降低計算成本。行業由此形成兩條路線:一是繼續擴大規模,二是強調效率,用更小啟用引數實現接近旗艦效果。價格成為最直接的競爭變數:海外廠商多采取差異化定價,OpenAI拆分GPT-5.6版本,Anthropic維持高效能旗艦路線,Grok 4.5則採取低價策略,輸出價格僅為Opus系列的四分之一;國內廠商則持續下調API價格,以低成本擴大使用者規模。

從具體模型表現看,Kimi K3、Grok 4.5、混元Hy3超出預期。Kimi K3採用MoE架構,總引數達萬億級別,釋出當天以1679分登頂Code Arena前端程式設計榜,較前代提升17個位次,一週後進入Arena綜合榜全球Top 10,但其幻覺率從Kimi K2.6的39%升至51%,輸出速度約33 Token/s,遠低於同類模型,開發者反饋其在複雜工程任務上表現不夠穩定。Grok 4.5於7月9日釋出,進入Artificial Analysis智慧指數前列,在工具呼叫測試中表現突出,被開發者視為價效比之選,其程式設計能力經過專門最佳化,搭配Cursor使用體驗良好。混元Hy3總引數295B、啟用引數僅21B,以不到旗艦五分之一引數規模在多個基準中接近更大模型,但在SWE-Bench Pro中57.9分與Claude Opus 4.8的69.2分仍有差距。

GPT-5.6 Sol和Claude Opus 5穩定在第一梯隊但驚喜有限。GPT-5.6 Sol在Terminal-Bench 2.1測試中達88.8%,Ultra模式提升至91.9%;Claude Opus 5效能接近Fable 5,價格僅為後者一半。開發者表示,GPT-5.6已覆蓋大部分日常開發需求,複雜問題則呼叫Opus 5。Gemini 3.6 Flash和Qwen3.8-Max預覽版反饋分化,前者智慧指數得分與前代持平,被指提升有限,但多模態理解出色;後者效果不穩定,思考深度高但有時陷入長時間推理,實際能力與宣傳存在差距。

模型迭代加速的背後,是後訓練技術的成熟。行業已掌握更高效的強化學習、後訓練方法,模型升級不再依賴重新訓練,競爭週期縮短,領先視窗可能只有幾周。7月成為釋出高峰,與國內世界人工智慧大會(WAIC)舉行、海外廠商集中更新有關。開源與閉源之爭再度升溫:支援方認為開放權重降低技術門檻、推動生態發展,反對方如Anthropic擔憂安全風險。這場爭論背後是不同公司的利益訴求,輝達等基礎設施企業受益於部署需求擴大,OpenAI、Anthropic等則依賴API和訂閱收入。對國內廠商而言,開放權重是爭取開發者生態和商業化入口的策略。

開發者社群預計,8月將有DeepSeek V4正式版、Fable 5.1、GPT-6等新模型釋出。模型能力差距縮小,單靠釋出更強模型難以建立長期優勢,接下來需觀察開源模型能力上限、API價格走勢、智慧體付費場景以及開源模型在企業私有化部署中的進展。