🔥 今日值得一读 稀疏注意力错了几十年!MASA即插即用,准确率持续飙升!
Sparse Attention Is Matrix Approximation, Not Choosing from a Bag of Values
arXiv CL (cs.CL) 🔥 重点 #稀疏注意力#Transformer#推理优化 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
重新理解稀疏注意力的数学本质,帮助开发者设计更准确的注意力近似,降低长文本推理成本。

📖 AI 总结

大型语言模型的注意力机制随提示长度呈二次方增长,稀疏注意力通过保留少量查询-键交互来近似完整注意力矩阵以降低成本。但现有方法存在一个数学上的根本误区:它们仅保留注意力矩阵中数值较大的元素或高权重区域,将注意力矩阵视为一堆可挑选的数值,而忽略了它作为结构化矩阵通过与值向量相乘共同决定输出的本质。该论文提出,稀疏注意力应被建模为矩阵近似问题,而非从数值集合中盲目选取最大值。基于这一视角,作者提出矩阵近似稀疏注意力(MASA),用闭式评分替代原始注意力权重排序,衡量每个稀疏单元对降低矩阵乘积近似误差的贡献。MASA可作为理论驱动的插件式修正,在不改变现有稀疏核与预算的前提下嵌入各类稀疏注意力框架。在多种稀疏注意力方法、基准测试和模型骨干上的实验均显示出一致的精度提升,验证了MASA及矩阵近似视角的有效性。

🔑 关键词速览

稀疏注意力一种通过仅计算部分查询-键交互来降低注意力计算成本的方法。
矩阵近似将稀疏注意力视为对完整注意力矩阵进行低秩或结构化近似,而非简单选择大数值条目。
MASA本文提出的矩阵近似稀疏注意力方法,使用闭式评分衡量每个稀疏单元对矩阵乘积近似误差的贡献。
闭式评分一种具有解析表达式的评分函数,用于评估稀疏单元的重要性,无需迭代优化。
LLM骨干网络指大型语言模型的基础架构,如Transformer,用于验证稀疏注意力方法的通用性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅