7月31日,DeepSeek-V4-Flash正式版上線,成為DeepSeek-V4系列的重大升級。據官方訊息,該正式版在模型架構、大小上與預覽版保持一致,採用MoE(混合專家)架構、2840億總引數、130億啟用引數、1M上下文,僅通過重新進行後訓練,便使Agent能力大幅增強,基準測試得分遠超V4-Pro-Preview。
官方將效能對標國產程式設計代表GLM-5.2及美國的Opus 4.8。DeepSeek-V4-Flash正式版的整體效能超過了GLM-5.2,逼近Opus 4.8。值得注意的是,V4-Flash只是個小引數模型,GLM-5.2總引數高達7440億,啟用引數為400億,均遠高於V4-Flash,凸顯其引數效率。
在官方公佈的9項Agent基準測試中,DeepSeek-V4-Flash正式版表現亮眼:在考察終端操作能力的Terminal Bench2.1上,得分從61.8升至82.7;在程式碼倉庫理解與修改任務NL2Repo、DeepSWE上,分別得分54.2和54.4,而其前身Flash Preview在DeepSWE專案上的得分僅為7.3。此外,網路安全任務Cybergym得分為76.7,工具呼叫能力Toolathlon-Verified達到70.3。在更綜合的智慧體評測中,正式版在Agent Last Exam和Automation Bench Public上分別得分25.2和25.1,這兩個專案均為2026年新推出、面向AI智慧體的現實任務評測基準,用於檢驗大模型Agent能否真正完成真實工作,區別於MMLU、Humanity's Last Exam等純問答測試。在內部全棧開發測試DSBench-FullStack與高難度編碼測試DSBench-Hard上,得分則達到68.7和59.6。多項指標遠超今年4月上線的V4-Pro預覽版。
新版本上線後,Artificial Analysis和Arena.ai兩大AI評測平台同步更新了基準測試結果。Artificial Analysis智慧指數顯示,DeepSeek-V4-Flash獲得50分,比4月釋出的Flash版本高出10分,僅比OpenAI的GPT-5.6 Luna(51分)低1分。該平台發文稱,即使OpenAI將GPT-5.6 Luna的價格下調了80%,DeepSeek-V4-Flash正式版在其自有API上的單任務成本仍然比GPT-5.6 Luna低約60%。Arena.ai的報告稱,DeepSeek-V4-Flash正式版以1586分的成績重塑了Frontend Code Arena跑分榜單,每MToken的價格為0.14美元/0.28美元,是同類產品中價效比最高的。
券商方面,申萬宏源證券最新研報稱,DeepSeek-V4-Flash繼續展現國產模型超高性價比;國聯民生證券稱,DeepSeek-V4-Flash輕量模型追平旗艦效能,利好AI應用產業鏈。
此次升級表明,DeepSeek在保持模型輕量化的同時,通過後訓練大幅提升Agent能力,以較低成本實現接近頂級旗艦的效能,進一步加劇了大模型市場的競爭。對於AI應用開發者而言,高性價比的模型有望降低應用落地成本,推動更多創新場景出現。