这篇论文提出AttSVD,一种面向自回归Transformer的免训练KV缓存压缩方法。针对KV缓存随上下文长度线性增长、成为长上下文内存瓶颈的问题,作者不再沿序列轴不可逆地淘汰低重要性token,而是保留全部token,转而在特征轴上进行低秩压缩。其核心是对每个prompt在线执行截断SVD,压缩基由该prompt自身的注意力几何决定,只保留注意力实际读取的方向,从而按保留秩成比例降低每头KV的持久内存。方法包含累积与流式两种解码期缓存策略,并引入逐矩阵能量规则和注意力感知基截断两项自适应优化,在压缩logit空间与注意力质量的同时保持注意力输出。实验在多个模型、智能体基准和完整LongBench上验证,AttSVD在仅使用最高50% KV缓存内存的情况下,性能与稠密缓存相当。
| KV Cache | 键值缓存,自回归Transformer在生成过程中存储的中间状态,用于避免重复计算,但随上下文长度线性增长。 |
| Low-Rank Compression | 低秩压缩,通过将矩阵分解为低秩形式来减少存储和计算量,这里用于压缩KV缓存。 |
| SVD | 奇异值分解,一种矩阵分解方法,用于提取数据的主要方向,这里用于构建低秩基。 |
| Attention Geometry | 注意力几何,指注意力机制中查询和键向量所构成的空间结构,决定了注意力读取的方向。 |
| LongBench | 一个用于评估长上下文语言模型能力的基准测试套件,包含多种长文本任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅