本文提出了一种名为注意力感知路由(AAR)的新方法,用于改进混合专家(MoE)语言模型中的路由机制。传统路由仅依据token的隐藏状态选择专家,上下文信息有限。AAR则从注意力权重的滑动窗口中提取时间与频谱特征,作为模型上下文状态的摘要,并将其与隐藏状态解耦后注入路由器。在保持基础Transformer完全冻结的前提下,仅训练路由参数,从而将路由作为唯一变量进行隔离研究。实验表明,在OLMoE上,AAR相比仅路由的SFT基线在GSM8K上提升3.37个百分点。研究进一步揭示,路由与注意力构成耦合回路:第l层的路由变化会通过残差流传播,放大第l+1层的注意力汇,从而在未直接更新注意力机制的情况下重塑注意力。此外,AAR能减少长发散生成,使错误答案变短而正确答案长度不变。该方法对深度高度敏感:不加区分地应用于各层可能损害事实检索,而数学推理的增益在更深层引入时得以保持,这揭示了检索与推理在不同深度上的张力,也使层选择性AAR成为探测各层注意力所携带路由相关信息的受控工具。
| Mixture-of-Experts (MoE) | 混合专家模型,一种通过多个专家网络和路由机制来提升模型容量和效率的架构。 |
| Attention-Aware Routing (AAR) | 注意力感知路由,本文提出的方法,利用注意力权重特征增强路由决策。 |
| Attention Sinks | 注意力汇,指注意力机制中某些令牌持续获得高注意力权重的现象。 |
| Residual Stream | 残差流,Transformer中信息通过残差连接逐层传递的路径。 |
| GSM8K | 一个小学数学应用题数据集,常用于评估模型的数学推理能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅