本文提出弹性阈值注意力(ETA),一种端到端可训练架构,旨在解决长上下文解码中KV缓存带来的内存带宽瓶颈。针对稀疏注意力刚性启发式规则丢弃必要上下文、导致质量下降的问题,ETA从查询表示中预测动态上下文阈值,在困难检索或推理步骤分配类稠密上下文,同时剪枝常规token。训练中采用乘法抑制而非删除低于阈值的logits,避免表示坍塌,并形成分布式概率储层,使初始token上的局部注意力汇消失。实验表明,1.45B预训练ETA模型在约85%训练稀疏度和约38%活跃解码密度下,语言建模、常识推理和长上下文检索性能媲美稠密注意力。推理时通过Triton自定义解码内核,以O(1)时间筛选KV块,在512K序列上实现最高2.5倍于FlashAttention-2的墙钟加速;离线校准算法可冻结每头常量阈值,额外减少27%注意力计算。
| Elastic Threshold Attention (ETA) | 一种端到端可训练的稀疏注意力架构,通过从查询表示中预测动态上下文阈值,在长上下文解码中兼顾速度与稠密模型质量。 |
| KV Cache | 键值缓存,自回归解码中缓存历史 token 的键和值向量以避免重复计算,但长上下文下会占用大量内存带宽。 |
| Sparse Attention | 稀疏注意力,通过只选择加载部分 KV 块来降低注意力计算和内存开销的方法,但可能因启发式规则丢弃必要上下文。 |
| Attention Sink | 注意力汇,指模型在初始 token 上集中分配大量注意力权重的现象,ETA 的训练方式可使其消失。 |
| FlashAttention-2 | 一种广泛使用的硬件高效注意力实现,通过分块和重计算优化 GPU 内存访问,常作为解码速度的对比基线。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅