据雷峰网报道,8月17日,DeepSeek V4 Pro API的输入和输出价格进行调整,其中缓存命中价格在空闲时段上涨5倍,高峰时段从0.025元/百万Token涨至0.3元/百万Token,涨幅达11倍。

缓存命中是大模型的一种“草稿纸”机制。AI回答问题时,无需每次重新阅读全部信息,只要之前计算过一次,长文本就会以“KV单元”形式存储在集群中,后续调用可直接提取。凭借极致的KV压缩技术和冷热记忆分层搬运架构,DeepSeek此前将缓存命中率做到极高水平,大幅降低了长文本调用成本,也因此吸引了大量代码助手、知识库Agent等超长上下文类产品。

然而,过大的需求量让原本低廉的缓存命中变成了厂商不堪重负的刚性开销。大模型的成本结构正在发生变化:算力日益廉价,而“状态”的保存、带宽和数据搬运正成为最昂贵的成本。以DeepSeek V4 Pro搭建代码库智能Agent为例,50万Token的代码库,在没有缓存的情况下,50轮对话的累计输入成本超过75元;而在90%缓存命中率下,成本可直降90%以上。

DeepSeek采用的CSA+HCA混合压缩技术,能将100万Token的KV记忆状态压缩至约10GB,单份缓存硬件分摊成本仅几分钱,这也是此前定价极低的底气。但高峰期大量百万Token级请求同时涌入,GPU显存被迅速占满,调度系统被迫将缓存块从显存转存至NVMe磁盘,导致缓存颠簸,频繁搬运数据消耗大量IO资源,甚至让GPU集群有效处理能力下降。涨价相当于对超出承载能力的缓存使用征收“存储税”。

同样的存储难题也困扰着OpenAI和Anthropic。Anthropic通过显式缓存断点机制和首次写入溢价,引导开发者只缓存高频前缀;OpenAI则以更高的基础输入价格配置更充裕的显存。DeepSeek因价格低廉,不得不通过涨价调节需求。

即便如此,DeepSeek涨价后仍是全球性价比最高的选择之一,且许多公司已在其缓存层形成高命中率的缓存池,迁移成本较高。要应对涨价,开发者需提高缓存命中率。DeepSeek缓存要求前缀完全匹配,差一个字符即失效。将当前时间、用户ID等动态参数放在Prompt开头,或工具结果插入上下文中间,都会使缓存作废。开发者需要像管理数据一样管理缓存,把高频共用的热数据前置,低频冷数据按需加入,并合理规划缓存生命周期。