解码时KV压缩新发现:EMA聚合让近似排序评分器差异消失,InertiaKV提速1.34-1.46倍!
What Matters for Aggressive Decoding-Time KV Eviction? Temporal Aggregation and Ranking Preservation
arXiv AI (cs.AI) 重要 推理优化论文方法 🕐 09-04 12:00

📖 AI 总结

该研究探讨了解码时KV缓存压缩中一个常被忽视的设计因素:跨解码步骤聚合分数的时间规则。研究发现,在激进压缩条件下,指数移动平均(EMA)聚合使多数评分函数的修改在淘汰集层面几乎无差异——值范数和熵变体与注意力高度相关,保留集几乎不变,而KeyDiff、键范数、近期性和学习型评分器则显著改变排序并导致性能下降。基于此,作者提出EMA驱动的解码时淘汰方法InertiaKV及其周期刷新变体InertiaKV-Lazy,后者相比全量刷新实现1.34至1.46倍解码吞吐提升。此外,Score-Free解码在首个解码步骤一次性评分全上下文并冻结排序,平均质量变化仅+0.03且省去后续所有评分。在六个开源模型及LongBench等基准上的实验表明,时间聚合与排序保持是独立且关键的设计因素,但并非否定评分质量本身的普遍重要性。

🔑 关键词速览

KV cache compression键值缓存压缩,一种减少Transformer推理时内存占用的技术。
EMA (Exponential Moving Average)指数移动平均,一种对时间序列数据进行平滑加权聚合的方法。
Eviction-set驱逐集,指在缓存压缩中被移除的键值对集合。
InertiaKV一种基于EMA的解码时KV驱逐方法,用于提高推理效率。
Score-Free decoding无评分解码,一种仅在初始步骤评分并冻结排序的解码策略。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅