DeepSeek 於 8 月 17 日 調整了其 V4 Pro API 的價格,其中最引人注目的是快取命中價格在高峰時段上漲了 11 倍,從 0.025 元/百萬 Token 漲至 0.3 元/百萬 Token,空閒時段也上漲了 5 倍。這一調整背後,是長上下文需求爆發帶來的儲存與資料搬運成本壓力,也標誌著大模型成本結構正在發生歷史性變化。
快取命中可以理解為大模型的“草稿紙”:AI 回答問題時,不必每次都重新計算全部上下文,只要之前計算過一次,這段長文本就會以“KV 單元”的形式儲存在儲存叢集中,後續呼叫可直接提取。DeepSeek 憑藉極致的 KV 壓縮技術和冷熱記憶分層搬運架構,將長文本的呼叫成本壓到極低,這也是其長期以來“價效比殺器”的核心。
然而,過低的定價吸引了大量開發者將整個程式碼庫、Agent 多輪反思日誌、全量行業文件等超長上下文塞入請求,導致後端伺服器在高峰期出現嚴重的“快取顛簸”。當海量百萬 Token 級請求同時湧入,GPU 視訊記憶體被迅速佔滿,排程系統不得不將部分快取塊從視訊記憶體“踢”到速度更慢的 NVMe 磁碟,頻繁的搬運消耗大量 IO 資源和排程算力,甚至可能讓整個叢集的有效處理能力下降。
DeepSeek 的漲價,相當於向開發者徵收“儲存稅”。儘管其壓縮技術已做到行業極致——相比 V3,V4 的 KV 快取體積砍掉 90%,相比傳統 GQA 架構僅剩約 2%——但長上下文需求的指數級增長,終究受限於 GPU 晶片總數、HBM 容量和匯流排頻寬的物理上限。當儲存、IO、排程三類成本累積到一定程度,漲價成為必然。
類似的挑戰,OpenAI 和 Anthropic 同樣無法迴避。Anthropic 採用顯式快取斷點機制,讓開發者手動標記快取位置,並對首次寫入快取收取 1.25 倍或 2 倍的溢價,以倒逼開發者最佳化架構、只快取高頻複用的字首。OpenAI 則憑藉較高的基礎輸入價格,配置更充裕的 HBM 視訊記憶體來擴大快取空間,緩解後端壓力。相比之下,DeepSeek 因定價過低,不得不直接提價。
儘管漲價,DeepSeek 仍是全球價效比最高的選擇之一,成本僅為 Claude 的幾分之一甚至更低。而且,大多數公司已在 DeepSeek 的 KV Cache 層形成穩定且高命中的快取池,輕易切換廠商並不划算。因此,開發者更應吃透 DeepSeek 的快取規則,將命中率拉到極致,以抵消漲價帶來的成本增加。
DeepSeek 快取的核心邏輯是字首完全匹配,差一個字元都無法命中。許多開發者容易踩坑,例如將當前時間、使用者 ID、隨機引數放在 Prompt 最開頭,或在前端拼接時多一個空格、換行符格式變化,都會導致快取失效。此外,Agent 框架將工具返回結果插入上下文中間,也會打斷快取邊界,使長字首快取報廢。
這波漲價也在倒逼前端開發者角色轉變。過去呼叫大模型 API 只需寫好 Prompt 發請求,後端視訊記憶體分配、快取排程無需操心。如今推理系統底層已演變為一個巨大的分散式儲存系統,開發者必須學會當“資料管理員”:將全公司共用的核心熱資料放在 Prompt 最前面以保證穩定命中,低頻冷資料按需新增,並管理快取生命週期,避免高峰期被系統輕易“踢”出視訊記憶體。大模型應用已進入精耕細作時代,快取命中率成為一道重要的分水嶺。