7月31日,DeepSeek-V4-Flash正式版上线,成为DeepSeek-V4系列的重大升级。据官方消息,该正式版在模型架构、大小上与预览版保持一致,采用MoE(混合专家)架构2840亿总参数130亿激活参数1M上下文,仅通过重新进行后训练,便使Agent能力大幅增强,基准测试得分远超V4-Pro-Preview。

官方将性能对标国产编程代表GLM-5.2及美国的Opus 4.8。DeepSeek-V4-Flash正式版的整体性能超过了GLM-5.2,逼近Opus 4.8。值得注意的是,V4-Flash只是个小参数模型,GLM-5.2总参数高达7440亿,激活参数为400亿,均远高于V4-Flash,凸显其参数效率。

在官方公布的9项Agent基准测试中,DeepSeek-V4-Flash正式版表现亮眼:在考察终端操作能力的Terminal Bench2.1上,得分从61.8升至82.7;在代码仓库理解与修改任务NL2RepoDeepSWE上,分别得分54.254.4,而其前身Flash Preview在DeepSWE项目上的得分仅为7.3。此外,网络安全任务Cybergym得分为76.7,工具调用能力Toolathlon-Verified达到70.3。在更综合的智能体评测中,正式版在Agent Last ExamAutomation Bench Public上分别得分25.225.1,这两个项目均为2026年新推出、面向AI智能体的现实任务评测基准,用于检验大模型Agent能否真正完成真实工作,区别于MMLU、Humanity's Last Exam等纯问答测试。在内部全栈开发测试DSBench-FullStack与高难度编码测试DSBench-Hard上,得分则达到68.759.6。多项指标远超今年4月上线的V4-Pro预览版。

新版本上线后,Artificial AnalysisArena.ai两大AI评测平台同步更新了基准测试结果。Artificial Analysis智能指数显示,DeepSeek-V4-Flash获得50分,比4月发布的Flash版本高出10分,仅比OpenAI的GPT-5.6 Luna(51分)低1分。该平台发文称,即使OpenAI将GPT-5.6 Luna的价格下调了80%,DeepSeek-V4-Flash正式版在其自有API上的单任务成本仍然比GPT-5.6 Luna低约60%。Arena.ai的报告称,DeepSeek-V4-Flash正式版以1586分的成绩重塑了Frontend Code Arena跑分榜单,每MToken的价格为0.14美元/0.28美元,是同类产品中性价比最高的。

券商方面,申万宏源证券最新研报称,DeepSeek-V4-Flash继续展现国产模型超高性价比;国联民生证券称,DeepSeek-V4-Flash轻量模型追平旗舰性能,利好AI应用产业链。

此次升级表明,DeepSeek在保持模型轻量化的同时,通过后训练大幅提升Agent能力,以较低成本实现接近顶级旗舰的性能,进一步加剧了大模型市场的竞争。对于AI应用开发者而言,高性价比的模型有望降低应用落地成本,推动更多创新场景出现。