8月21日,DeepSeek 悄然上線了多模態視覺理解模型 DeepSeek V4 Flash Vision Exp。與 V4 Flash 和 V4 Pro 不同,這款模型沒有附帶技術報告,也未開源,官方僅提供了一張效能表和幾個演示案例。這一舉動與其創始人梁文鋒此前“多模態不是主線”的表態形成鮮明對比,引發業界關注。
梁文鋒曾在一次投資人交流會上明確表示,多模態對產品很重要,但對智慧上限而言只是一個元件,並非主線本身。他當時承諾,V4 的後續版本將支援原生多模態。如今,V4 Flash Vision Exp 的釋出,似乎正是這一承諾的兌現,但模型本身卻更像一個“主線”產品,而非簡單的元件。
V4 Flash Vision Exp 的定位:從官方公佈的基準測試來看,該模型並未採用傳統視覺模型常用的 MMMU、MathVista 等“看圖答題”測試,而是聚焦於 Agent 基準,如 Terminal Bench 2.1 得分 83.9、DeepSWE 得分 59.3。這表明 DeepSeek 意在強化模型在 Agent 和推理任務上的能力,而非單純提升視覺理解。梁文鋒始終認為多模態是手段而非目的,V4 Flash Vision Exp 正是這一理念的產物——它服務於 Agent 和推理主線,讓模型能夠看懂網頁截圖、圖表資料、UI 佈局,並據此執行任務。
技術淵源:該模型並非憑空出現。4月29日,DeepSeek 多模態負責人陳小康在 X 平台預告了多模態識圖功能的灰度測試。次日,DeepSeek 在 GitHub 釋出技術報告《Thinking with Visual Primitives》,提出將點座標和邊界框作為“思維的最小單元”嵌入推理鏈,讓模型“邊推理邊指向”,從而在計數、空間推理等任務上實現更精確的錨定。該論文在5月1日被刪除,但社群保留了複製。6月,DeepSeek 在客戶端和網頁端上線的 Vision 模式即基於此技術。V4 Flash Vision Exp 則將同一技術嫁接到 V4-Flash 的 API 基座上,強化多模態 Agent 能力。
產品策略轉變:過去,梁文鋒對產品有“不完美不釋出”的偏執,導致 V3.2 到 V4 預覽版間隔長達 4 個半月,V3 正式版到 V4 更是用了 1 年 4 個月。如今,DeepSeek 不僅更新加快,還願意將實驗性質的模型開放給公眾,這被解讀為梁文鋒“放低姿態”,更注重與使用者和市場的互動。這種轉變的背景是,DeepSeek 在釋出節奏上明顯落後於同行:OpenAI 在 2025 年 8 月釋出 GPT-5,Anthropic 在 11 月釋出 Opus 4.5,而國內阿里、Kimi、智譜等也密集釋出新模型。相比之下,DeepSeek 在 2025 年僅釋出了 V3.1 和 V3.2 等迭代版本。
社群反饋與挑戰:V4 Flash Vision Exp 上線後,社群實測發現其存在明顯短板:無法識別梁文鋒本人的代表性照片,理解複雜圖表時易漏掉關鍵資訊,中文場景處理偏弱,甚至影響上下文快取。有使用者評價其“效果好像也就那樣”。這或許反映了 DeepSeek 在壓力下的倉促發布。
競爭壓力:DeepSeek 的 DSH 產品對標 Anthropic 的 Claude Code 和 OpenAI 的 Codex。8月20日,OpenAI 開源了 Codex Harness,將多模態置於 Agent 執行時的核心位置,讓模型直接接收截圖等視覺輸入並納入任務鏈。相比之下,DSH 在多模態上此前依賴外部視覺模型,存在資訊損耗。V4 Flash Vision Exp 的釋出,可視為 DeepSeek 對 OpenAI 開源的回應,意在告訴使用者“別人有的我們也有”。
社群補足:DSH 開源後,社群已開始彌補其與普通使用者的距離。例如,大二學生 Benson Wang 開發的 DSH Desktop 專案,提供“一鍵安裝”功能,降低了使用門檻。這或有助於 DeepSeek 生態的擴充套件。
總體而言,V4 Flash Vision Exp 的釋出標誌著 DeepSeek 在多模態與 Agent 賽道上的加速追趕,但其實際效果與社群預期尚有差距。梁文鋒的產品哲學正在調整,但能否在激烈的競爭中保持領先,仍需觀察。