据量子位报道,字节Seed团队发现,DeepSeek-V4系列模型的长上下文检索能力会随目标信息在输入中的位置发生周期性波动,波动周期与其分块KV Cache压缩步长对应。在128K长上下文检索测试中,同一条信息仅改变位置,DeepSeek-V4-Flash-Base的检索准确率最大差距达到40.2个百分点,DeepSeek-V4-Pro-Base达到34.8个百分点。团队将这一现象称为相位敏感性。
最初,研究人员用DeepSeek-V4-Flash-Base做代码补全实验。他们从官方推理代码中截取一段FP8量化函数,要求模型补全最后一个Token,正确答案是8。随后在代码前加入由重复等号组成的装饰性文档字符串,并改变等号数量。代码、补全位置和正确答案均未改变,但模型答案在8和32之间反复变化。测试的16种填充长度中,长度模4余数为0或1时,模型倾向错误答案32;余数为2或3时,倾向正确答案8。一组位置上错误答案32平均概率为71.3%,正确答案8为26.4%;换到另一组,正确答案8平均概率升至91.5%,错误答案32降至7.2%。
团队随后转向“大海捞针”任务。他们构造128K Token上下文,包含约1.6万个键值对,键值关系、问题和总长度保持不变,只调整目标信息相对压缩窗口边界的位置。结果,DeepSeek-V4系列的准确率曲线出现周期性起伏。经过后训练,差距有所缩小:DeepSeek-V4-Flash-0731为19.1个百分点,DeepSeek-V4-Pro-0813为14.8个百分点,更新模型DeepSeek-V4.1-Flash-0910降至6.1个百分点,但周期性差异仍然存在。DeepSeek-V4的波动周期为4个Token,DeepSeek-V4.1变为2个Token,与两代模型各自的KV Cache压缩步长对应。
研究者认为,问题可能出在分块KV Cache压缩。该技术将连续Token分成窗口,再把窗口内信息压缩成更少缓存条目,以降低长上下文推理的内存和计算开销。但同一条信息出现在压缩窗口第1、第2、第3或第4个位置时,压缩条件不同,模型对不同相位信息的检索能力出现系统性差异。即使Key和Value落在同一个压缩窗口内,不同位置的检索准确率也能相差很大,说明问题还涉及信息如何写入和读取压缩缓存。
为验证机制,团队基于Qwen3-0.6B架构从头训练多种KV Cache压缩模型,并设置无分块压缩的全注意力模型作对照,只改变压缩机制。所有分块压缩模型都出现与压缩步长对应的周期性变化,全注意力基线没有同等程度周期性。调整窗口大小和压缩步长后,周期主要跟随步长变化:步长为4时约4个Token,步长为6时约6个Token,步长为8时同样如此。不使用RoPE位置编码,或把可学习压缩权重换成简单平均,现象依然存在。团队还发现不同注意力头对不同相位贡献不同,并将其称为相位专门化。通过简化理论模型,他们认为梯度流可能推动压缩模块形成稳定位置偏好。
论文提出,评估采用分块KV Cache压缩的模型时,不能只看整体检索准确率,还应把同一条信息放到不同压缩相位分别测试。论文地址:https://arxiv.org/pdf/2609.36322。