🔥 今日值得一读 仅用50%的KV缓存,AttSVD让长上下文性能不降反平!
AttSVD:Prompt-Adaptive Low-Rank KV Cache Compression via Attention-Guided SVD
arXiv LG (cs.LG) 🔥 重点 #KV缓存压缩#低秩分解#推理优化#Transformer 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
长上下文推理显存不够时,用注意力几何做低秩压缩KV缓存,无需丢弃token即可省显存。

📖 AI 总结

这篇论文提出AttSVD,一种面向自回归Transformer的免训练KV缓存压缩方法。针对KV缓存随上下文长度线性增长、成为长上下文内存瓶颈的问题,作者不再沿序列轴不可逆地淘汰低重要性token,而是保留全部token,转而在特征轴上进行低秩压缩。其核心是对每个prompt在线执行截断SVD,压缩基由该prompt自身的注意力几何决定,只保留注意力实际读取的方向,从而按保留秩成比例降低每头KV的持久内存。方法包含累积与流式两种解码期缓存策略,并引入逐矩阵能量规则和注意力感知基截断两项自适应优化,在压缩logit空间与注意力质量的同时保持注意力输出。实验在多个模型、智能体基准和完整LongBench上验证,AttSVD在仅使用最高50% KV缓存内存的情况下,性能与稠密缓存相当。

🔑 关键词速览

KV Cache键值缓存,自回归Transformer在生成过程中存储的中间状态,用于避免重复计算,但随上下文长度线性增长。
Low-Rank Compression低秩压缩,通过将矩阵分解为低秩形式来减少存储和计算量,这里用于压缩KV缓存。
SVD奇异值分解,一种矩阵分解方法,用于提取数据的主要方向,这里用于构建低秩基。
Attention Geometry注意力几何,指注意力机制中查询和键向量所构成的空间结构,决定了注意力读取的方向。
LongBench一个用于评估长上下文语言模型能力的基准测试套件,包含多种长文本任务。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅