同样问题答案忽对忽错?字节发现DeepSeek性能波动根源:信息位置决定成败
字节跳动Seed团队近日在预印本平台arXiv发布论文《Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression》,首次系统揭示了DeepSeek-V4系列模型在长上下文场景下表现不稳定的技术根源——分块KV Cache压缩引发的“相位敏感性”(Phase Sensitivity)。
字节跳动Seed团队近日在预印本平台arXiv发布论文《Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression》,首次系统揭示了DeepSeek-V4系列模型在长上下文场景下表现不稳定的技术根源——分块KV Cache压缩引发的“相位敏感性”(Phase Sensitivity)。

研究团队在测试中发现,DeepSeek-V4-Flash-Base模型的输出会随输入前缀长度的变化呈现周期性波动。在一个FP8量化函数代码补全实验中,仅通过在代码前添加不同数量的装饰性等号字符,模型的正确答案概率便在71.3%与91.5%之间反复翻转,波动周期恰好为4个Token,与模型压缩稀疏注意力(CSA)的步长完全吻合。
进一步的大规模“大海捞针”测试证实了这一现象的普遍性。在128K Token的长上下文检索任务中,DeepSeek-V4-Flash-Base不同位置的检索准确率最大差距达40.2个百分点,V4-Pro-Base也达到34.8个百分点。经过后训练优化后,V4.1-Flash版本的差距已收窄至6.1个百分点,但周期性差异仍未完全消除。
论文指出,问题的核心在于分块KV Cache压缩技术本身。该技术以固定步幅将连续Token窗口压缩为更少的缓存条目,在大幅降低内存和计算成本的同时,引入了一个新的位置坐标——Token的“相位”,即其相对于压缩窗口边界的位置。模型对不同相位的信息检索能力存在系统性差异,部分注意力头甚至形成了针对特定相位的“相位专门化”。
为排除特定实现缺陷的可能,研究团队以Qwen3-0.6B架构为底座从头训练了多组对照模型。结果显示,所有采用分块压缩方案的模型均出现了与压缩步长对应的周期性波动,而全注意力基线模型则无此现象,证实这是分块压缩设计本身可能引入的结构性弱点。
研究团队建议,未来评估采用分块KV Cache压缩的模型时,应将同一信息置于不同压缩相位上分别测试,而不能仅依赖整体平均准确率。一个漂亮的平均分,可能掩盖模型在特定位置上的系统性失效。