该研究探讨了现代Transformer架构中全注意力与线性注意力的混合分配问题,指出当前分配方式多依赖经验启发,缺乏理论依据。作者提出两种干预指标——RFIS和RPD,用于分析基于RoPE的Transformer头部功能组织,并在Qwen3和Llama3.1模型上验证了检索型与位置型头部的完整分类,二者之间存在一个显著的中低频分界带,称为全局位置带。研究发现该分界带与训练长度相关,并可能解释零样本长度外推失败的原因。基于此,作者提出两条设计原则:位置建模应仅限局部操作,全局访问需通过位置无关的检索实现;两类功能应在头部粒度上按层分配。据此构建的HwH架构以少于1:3的全注意力与线性注意力比例,在保持语言建模和常识推理能力的同时,显著提升了检索性能和零样本长上下文外推能力。
| Full Attention (FA) | 全注意力机制,计算序列中所有位置间的注意力权重,具有全局建模能力但计算复杂度高。 |
| Linear Attention (LA) | 线性注意力机制,通过核函数近似降低计算复杂度,实现高效的局部建模。 |
| RoPE Frequency Importance Score (RFIS) | 一种干预指标,用于衡量旋转位置编码中每个频率对注意力分布的影响程度。 |
| RoPE Positional Dependence (RPD) | 一种干预指标,用于隔离注意力头对旋转位置调制的依赖程度。 |
| Global Positional Band (GPBand) | 全局位置带,指训练长度决定的位置频率边界,区分检索头和位置头的功能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅