🔥 今日值得一读 1.45B模型仅用38%活跃解码密度,长上下文性能不输稠密注意力
Elastic Threshold Attention: Learned Contextual Sparsity for Long-Context Decoding
arXiv LG (cs.LG) 🔥 重点 #稀疏注意力#长上下文#推理优化 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
可训练的动态稀疏注意力,大幅降低长上下文KV缓存带宽瓶颈,适合部署长文本推理。

📖 AI 总结

本文提出弹性阈值注意力(ETA),一种端到端可训练架构,旨在解决长上下文解码中KV缓存带来的内存带宽瓶颈。针对稀疏注意力刚性启发式规则丢弃必要上下文、导致质量下降的问题,ETA从查询表示中预测动态上下文阈值,在困难检索或推理步骤分配类稠密上下文,同时剪枝常规token。训练中采用乘法抑制而非删除低于阈值的logits,避免表示坍塌,并形成分布式概率储层,使初始token上的局部注意力汇消失。实验表明,1.45B预训练ETA模型在约85%训练稀疏度和约38%活跃解码密度下,语言建模、常识推理和长上下文检索性能媲美稠密注意力。推理时通过Triton自定义解码内核,以O(1)时间筛选KV块,在512K序列上实现最高2.5倍于FlashAttention-2的墙钟加速;离线校准算法可冻结每头常量阈值,额外减少27%注意力计算。

🔑 关键词速览

Elastic Threshold Attention (ETA)一种端到端可训练的稀疏注意力架构,通过从查询表示中预测动态上下文阈值,在长上下文解码中兼顾速度与稠密模型质量。
KV Cache键值缓存,自回归解码中缓存历史 token 的键和值向量以避免重复计算,但长上下文下会占用大量内存带宽。
Sparse Attention稀疏注意力,通过只选择加载部分 KV 块来降低注意力计算和内存开销的方法,但可能因启发式规则丢弃必要上下文。
Attention Sink注意力汇,指模型在初始 token 上集中分配大量注意力权重的现象,ETA 的训练方式可使其消失。
FlashAttention-2一种广泛使用的硬件高效注意力实现,通过分块和重计算优化 GPU 内存访问,常作为解码速度的对比基线。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅