字节Seed揭示DeepSeek长上下文的“位置敏感”弱点
Seed研究发现,同一信息仅因在长文本中的位置变化,DeepSeek V4检索准确率最高可相差40.2个百分点。
字节跳动Seed团队发现,DeepSeek在处理超长文本时存在一个容易被平均分掩盖的问题:同一条信息放在上下文的不同位置,模型能否准确找回它可能大不相同。
研究人员对DeepSeek V4 Flash、V4 Pro和V4.1 Flash进行了测试,保持问题与目标信息不变,只改变目标信息在约12.8万词元上下文中的位置。基础版V4 Flash的检索准确率最高相差40.2个百分点;经过后训练后,差距缩小至19.1个百分点;V4.1 Flash则进一步降至6.1个百分点。
Seed将这一现象归因于DeepSeek采用的分块式KV缓存压缩技术。该方法把连续的一段内容压缩成更少的缓存记录,从而降低长上下文推理所需的显存、带宽和计算开销。但信息落在压缩块中的哪个位置,会影响模型之后恢复和读取它的效果。研究团队将这种按固定间隔重复出现的表现波动称为“相位敏感性”。
这项发现的影响并不局限于DeepSeek。长上下文基准通常只在少数固定位置放置目标信息,平均分因此可能掩盖模型周期性的“盲区”。在真实应用中,文档内容并未改变,哪怕只是格式调整导致关键信息前后移动,也可能改变模型的回答结果。
研究同时显示,后训练能够缓解问题,却不能自动消除它。今后的长上下文评测需要系统地扫描信息位置,并重复测试同一条信息,而不是只看单一摆放位置的成绩。对产业而言,这说明节省推理成本的底层优化,也可能带来结构化的可靠性风险。
Uncle Cat 观点
真正值得关注的是40.2个百分点的波动,而不是“模型抽风”的说法:缓存压缩已成为可靠性变量,长文档采购必须加入位置敏感性测试。