8月21日,DeepSeek 悄然上线了多模态视觉理解模型 DeepSeek V4 Flash Vision Exp。与 V4 Flash 和 V4 Pro 不同,这款模型没有附带技术报告,也未开源,官方仅提供了一张性能表和几个演示案例。这一举动与其创始人梁文锋此前“多模态不是主线”的表态形成鲜明对比,引发业界关注。

梁文锋曾在一次投资人交流会上明确表示,多模态对产品很重要,但对智能上限而言只是一个组件,并非主线本身。他当时承诺,V4 的后续版本将支持原生多模态。如今,V4 Flash Vision Exp 的发布,似乎正是这一承诺的兑现,但模型本身却更像一个“主线”产品,而非简单的组件。

V4 Flash Vision Exp 的定位:从官方公布的基准测试来看,该模型并未采用传统视觉模型常用的 MMMU、MathVista 等“看图答题”测试,而是聚焦于 Agent 基准,如 Terminal Bench 2.1 得分 83.9、DeepSWE 得分 59.3。这表明 DeepSeek 意在强化模型在 Agent 和推理任务上的能力,而非单纯提升视觉理解。梁文锋始终认为多模态是手段而非目的,V4 Flash Vision Exp 正是这一理念的产物——它服务于 Agent 和推理主线,让模型能够看懂网页截图、图表数据、UI 布局,并据此执行任务。

技术渊源:该模型并非凭空出现。4月29日,DeepSeek 多模态负责人陈小康在 X 平台预告了多模态识图功能的灰度测试。次日,DeepSeek 在 GitHub 发布技术报告《Thinking with Visual Primitives》,提出将点坐标和边界框作为“思维的最小单元”嵌入推理链,让模型“边推理边指向”,从而在计数、空间推理等任务上实现更精确的锚定。该论文在5月1日被删除,但社区保留了拷贝。6月,DeepSeek 在客户端和网页端上线的 Vision 模式即基于此技术。V4 Flash Vision Exp 则将同一技术嫁接到 V4-Flash 的 API 基座上,强化多模态 Agent 能力。

产品策略转变:过去,梁文锋对产品有“不完美不发布”的偏执,导致 V3.2 到 V4 预览版间隔长达 4 个半月,V3 正式版到 V4 更是用了 1 年 4 个月。如今,DeepSeek 不仅更新加快,还愿意将实验性质的模型开放给公众,这被解读为梁文锋“放低姿态”,更注重与用户和市场的互动。这种转变的背景是,DeepSeek 在发布节奏上明显落后于同行:OpenAI 在 2025 年 8 月发布 GPT-5,Anthropic 在 11 月发布 Opus 4.5,而国内阿里、Kimi、智谱等也密集发布新模型。相比之下,DeepSeek 在 2025 年仅发布了 V3.1 和 V3.2 等迭代版本。

社区反馈与挑战:V4 Flash Vision Exp 上线后,社区实测发现其存在明显短板:无法识别梁文锋本人的代表性照片,理解复杂图表时易漏掉关键信息,中文场景处理偏弱,甚至影响上下文缓存。有用户评价其“效果好像也就那样”。这或许反映了 DeepSeek 在压力下的仓促发布。

竞争压力:DeepSeek 的 DSH 产品对标 Anthropic 的 Claude Code 和 OpenAI 的 Codex。8月20日,OpenAI 开源了 Codex Harness,将多模态置于 Agent 运行时的核心位置,让模型直接接收截图等视觉输入并纳入任务链。相比之下,DSH 在多模态上此前依赖外部视觉模型,存在信息损耗。V4 Flash Vision Exp 的发布,可视为 DeepSeek 对 OpenAI 开源的回应,意在告诉用户“别人有的我们也有”。

社区补足:DSH 开源后,社区已开始弥补其与普通用户的距离。例如,大二学生 Benson Wang 开发的 DSH Desktop 项目,提供“一键安装”功能,降低了使用门槛。这或有助于 DeepSeek 生态的扩展。

总体而言,V4 Flash Vision Exp 的发布标志着 DeepSeek 在多模态与 Agent 赛道上的加速追赶,但其实际效果与社区预期尚有差距。梁文锋的产品哲学正在调整,但能否在激烈的竞争中保持领先,仍需观察。