据雷峰网报道,字节团队9月底发表的论文《Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression》点名DeepSeek V4系列模型存在“周期性失忆”:同一个问题问两次,只因多敲几个空格或加入装饰字符,答案可能由正确变为错误。论文将原因指向DeepSeek用于降低长上下文显存压力的分块KV Cache压缩技术。

字节团队最初让DeepSeek-V4-Flash-Base补全一段FP8量化函数的最后一个Token。按代码逻辑正确结果应为8,但在代码最前面加入装饰用等号后,模型输出了32。错误与等号数量直接挂钩:等号数量除以4,余数为0或1时错误率高达71.3%,余数为2或3时正确率高达91.5%。

论文解释,分块KV Cache压缩把连续Token按固定长度切割,每段Token通过可学习门控层压缩成“小摘要”,以减轻显存压力。这引入“相位”:不同位置Token获得不同槽位增益因子,排到强势槽位的Token被加权保留,排到盲点槽位的Token几乎被忽略。模型注意力头也出现分工,有的处理段内靠前位置,有的处理靠后位置,部分排位成为薄弱环节。

为验证并非偶然,研究人员构造128K Token上下文,包含约1.6万个键值对,在键值关系、问题和上下文总长度不变时改变其中一个键值对的位置。DeepSeek-V4-Flash-Base在不同位置间准确率最大差距为40.2%,DeepSeek-V4-Pro-Base为34.8%;经后训练优化,差距仍有19.1%和14.8%。

DeepSeek随后在DeepSeek-V4.1-Flash上把压缩步长减半。步长为4时每轮压缩划分4个槽位,边缘Token容易在连续两轮窗口压缩中丢失;步长降到2后,每次只合并2个Token,准确率差距降至6.1%,但问题未被完全消除。字节团队还用Qwen3-0.6B架构从头训练一批模型,其他配置一致,只改压缩机制。所有采用分块压缩的模型都出现周期性准确率波动,没有压缩的全注意力基线模型没有;波动周期严格等于压缩步长;去掉RoPE位置编码后波动依然存在;把可学习门控权重换成平均分配也照样波动。论文认为,这是固定长度分块压缩方案的结构缺陷,不是调参、换位置编码或后训练能根除的。

有网友提出,彻底解决需让切块“活”起来,根据内容重要程度动态决定边界,即“动态分块”。相关研究正从“语义连续性”和“稀疏计算”推进:香港科技大学(广州)团队提出的ChunkKV以连续语义块为压缩单位,整块保留或整块丢弃;在NIAH基准测试中,KV缓存限制在128时,基于LLaMA-3的ChunkKV准确率为73.8%,传统方法SnapKV为58.9%。Jina AI肖涵博士团队提出延迟分块,先让模型完整读完整篇文本,输出前再按语义自然分界切分。微软亚洲研究院的MInference框架利用注意力矩阵的固定稀疏规律,为不同注意力头匹配稀疏计算方式,在不降低检索准确率前提下,百万字长上下文prefill阶段最高实现10倍加速。