字节Seed团队研究发现,DeepSeek-V4系列模型在相同问题下表现时好时坏,根源在于其分块KV Cache压缩技术引发的“相位敏感性”。测试显示,仅调整输入中无关字符的数量,模型答案便以每4个Token为周期反复横跳;在128K长上下文检索任务中,同一信息因位置不同,准确率最大差距达40.2个百分点。研究进一步验证,该周期性波动与压缩步长严格对应,且在所有采用分块压缩的模型中普遍存在,而全注意力基线模型无此现象。这一发现揭示了长上下文优化技术可能引入的系统性缺陷,为理解大模型能力不稳定的底层机制提供了新视角。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅