揭秘LLM“注意力汇聚”真凶:不是RoPE,是自集中和值非混合!量化难题有解了
It's Not RoPE that Creates Sinks: The Role of Self-Concentration and Value-Non-Mixing in Attention
arXiv CL (cs.CL) 重要 #Transformer#注意力机制#可解释性 🕐 09-08 12:00

📖 摘要

揭示注意力汇聚与值非混合是注意力汇和巨激活的成因,而非RoPE。

🔑 关键词速览

Attention Sink (AS)注意力汇聚,指模型在序列初始位置分配异常高注意力分数的现象。
Massive Activations (MAs)大规模激活,指在特定位置(如初始位置)出现极大数值的激活值,影响量化。
Self-Concentration自集中,指注意力权重因因果掩码而集中于自身位置的现象。
Value-Non-Mixing值非混合,指注意力输出中值向量未被充分混合,导致特定位置激活异常。
Causal Mask因果掩码,一种确保模型只能关注当前位置及之前位置的机制,用于自回归生成。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅