DeepSeek 于 8 月 17 日 调整了其 V4 Pro API 的价格,其中最引人注目的是缓存命中价格在高峰时段上涨了 11 倍,从 0.025 元/百万 Token 涨至 0.3 元/百万 Token,空闲时段也上涨了 5 倍。这一调整背后,是长上下文需求爆发带来的存储与数据搬运成本压力,也标志着大模型成本结构正在发生历史性变化。
缓存命中可以理解为大模型的“草稿纸”:AI 回答问题时,不必每次都重新计算全部上下文,只要之前计算过一次,这段长文本就会以“KV 单元”的形式存储在存储集群中,后续调用可直接提取。DeepSeek 凭借极致的 KV 压缩技术和冷热记忆分层搬运架构,将长文本的调用成本压到极低,这也是其长期以来“性价比杀器”的核心。
然而,过低的定价吸引了大量开发者将整个代码库、Agent 多轮反思日志、全量行业文档等超长上下文塞入请求,导致后端服务器在高峰期出现严重的“缓存颠簸”。当海量百万 Token 级请求同时涌入,GPU 显存被迅速占满,调度系统不得不将部分缓存块从显存“踢”到速度更慢的 NVMe 磁盘,频繁的搬运消耗大量 IO 资源和调度算力,甚至可能让整个集群的有效处理能力下降。
DeepSeek 的涨价,相当于向开发者征收“存储税”。尽管其压缩技术已做到行业极致——相比 V3,V4 的 KV 缓存体积砍掉 90%,相比传统 GQA 架构仅剩约 2%——但长上下文需求的指数级增长,终究受限于 GPU 芯片总数、HBM 容量和总线带宽的物理上限。当存储、IO、调度三类成本累积到一定程度,涨价成为必然。
类似的挑战,OpenAI 和 Anthropic 同样无法回避。Anthropic 采用显式缓存断点机制,让开发者手动标记缓存位置,并对首次写入缓存收取 1.25 倍或 2 倍的溢价,以倒逼开发者优化架构、只缓存高频复用的前缀。OpenAI 则凭借较高的基础输入价格,配置更充裕的 HBM 显存来扩大缓存空间,缓解后端压力。相比之下,DeepSeek 因定价过低,不得不直接提价。
尽管涨价,DeepSeek 仍是全球性价比最高的选择之一,成本仅为 Claude 的几分之一甚至更低。而且,大多数公司已在 DeepSeek 的 KV Cache 层形成稳定且高命中的缓存池,轻易切换厂商并不划算。因此,开发者更应吃透 DeepSeek 的缓存规则,将命中率拉到极致,以抵消涨价带来的成本增加。
DeepSeek 缓存的核心逻辑是前缀完全匹配,差一个字符都无法命中。许多开发者容易踩坑,例如将当前时间、用户 ID、随机参数放在 Prompt 最开头,或在前端拼接时多一个空格、换行符格式变化,都会导致缓存失效。此外,Agent 框架将工具返回结果插入上下文中间,也会打断缓存边界,使长前缀缓存报废。
这波涨价也在倒逼前端开发者角色转变。过去调用大模型 API 只需写好 Prompt 发请求,后端显存分配、缓存调度无需操心。如今推理系统底层已演变为一个巨大的分布式存储系统,开发者必须学会当“数据管理员”:将全公司共用的核心热数据放在 Prompt 最前面以保证稳定命中,低频冷数据按需添加,并管理缓存生命周期,避免高峰期被系统轻易“踢”出显存。大模型应用已进入精耕细作时代,缓存命中率成为一道重要的分水岭。