本文指出现有 KV 缓存压缩方法存在结构性缺陷:无论是基于评分的淘汰、摘要补偿还是卸载召回,都只依据内容相关性决定保留或召回哪些 token,仅实现了按内容关联查找这一种访问模式,而忽略了按位置顺序遍历的第二种模式。这一缺失在检索增强生成、代码补全和结构化数据抽取等需要逐字复现标识符、字段值或代码 token 的任务中尤为致命,会导致序列在压缩中途被截断,作者称之为“序列遗忘”,且该问题无法通过改进评分、扩大预算或动态重评分解决。为此,作者提出 KVFetch,一种无需训练、即插即用的框架,为任意基于评分的压缩器开辟时间召回通道:将被淘汰的候选降级到量化冷层,通过单调读指针检测复制行为,并将位置后继预取到固定大小的热层槽位,且不增加注意力开销。在 RULER-16K 的等预算对照下,KVFetch 将逐字复制得分从 0.8 提升至 78.4,13 项任务平均提升 8.4;而在无需顺序访问的 LongBench 上,该通道保持休眠、不产生额外成本。
| KV Cache Compression | 键值缓存压缩,通过减少推理时存储的键值对数量来降低显存占用和计算开销的技术。 |
| Sequential Forgetting | 顺序遗忘,指基于内容的淘汰策略保留序列头部却丢弃后续部分,导致逐字复制中途不可逆中断的失败模式。 |
| KVFetch | 一种无需训练、即插即用的框架,通过时间召回通道为基于分数的压缩器恢复顺序访问能力。 |
| Cold Tier / Hot Tier | 冷层与热层,分别指量化存储被淘汰候选的低成本区域和固定大小、用于预取位置后继的高速缓存区域。 |
| RULER-16K | 一个用于评估长上下文语言模型能力的基准测试,包含 16K 上下文长度下的多种任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅