这篇论文研究大语言模型推理中KV缓存压缩的一个被忽视的问题:现有方法通常在离线或预填充阶段一次性判定注意力头的读写属性,并在整个生成过程中保持不变。作者在1.5B至8B三种模型、针检索、长思维链和多轮回忆三种场景下测量头部行为,发现大多数注意力头在生成过程中至少会改变一次读写模式,说明固定分类并不符合实际。为此提出WakeKV,一种反应式驻留策略,将暂时冷却的头部状态转移到可恢复的CPU储备区,而非冻结或永久驱逐。在相同内存或预算下,WakeKV在五个模型-场景组合上的未命中率均优于固定分类和破坏性驱逐,并与SnapKV、uniform R-KV、ReasonAlloc三个基线对比取得优势。基于FlexiCache/vLLM在Mistral-7B上的实现验证了真实硬件上的收益,在保持LongBench质量的同时提升了吞吐量。该工作表明KV缓存管理应具备可逆性和动态响应能力。
| KV 缓存 | 键值缓存,用于存储自注意力机制中的键和值向量,以加速自回归生成。 |
| 注意力头 | 多头注意力机制中的单个注意力计算单元,每个头独立学习关注不同的表示子空间。 |
| 反应式驻留策略 | 一种根据运行时状态动态调整缓存驻留位置的策略,而非静态固定。 |
| CPU 储备池 | 将不活跃的缓存状态转移到 CPU 内存中暂存,以便后续需要时恢复。 |
| 未命中率 | 在缓存中未能找到所需数据的比例,用于衡量缓存效果。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅