仅训路由冻结模型,GSM8K暴涨3.37%!
Attention-Aware Routing: Coupling Routing and Attention in MoEs
arXiv AI (cs.AI) 重要 大模型论文方法MoE 🕐 今天 12:00

📖 AI 总结

本文提出了一种名为注意力感知路由(AAR)的新方法,用于改进混合专家(MoE)语言模型中的路由机制。传统路由仅依据token的隐藏状态选择专家,上下文信息有限。AAR则从注意力权重的滑动窗口中提取时间与频谱特征,作为模型上下文状态的摘要,并将其与隐藏状态解耦后注入路由器。在保持基础Transformer完全冻结的前提下,仅训练路由参数,从而将路由作为唯一变量进行隔离研究。实验表明,在OLMoE上,AAR相比仅路由的SFT基线在GSM8K上提升3.37个百分点。研究进一步揭示,路由与注意力构成耦合回路:第l层的路由变化会通过残差流传播,放大第l+1层的注意力汇,从而在未直接更新注意力机制的情况下重塑注意力。此外,AAR能减少长发散生成,使错误答案变短而正确答案长度不变。该方法对深度高度敏感:不加区分地应用于各层可能损害事实检索,而数学推理的增益在更深层引入时得以保持,这揭示了检索与推理在不同深度上的张力,也使层选择性AAR成为探测各层注意力所携带路由相关信息的受控工具。

🔑 关键词速览

Mixture-of-Experts (MoE)混合专家模型,一种通过多个专家网络和路由机制来提升模型容量和效率的架构。
Attention-Aware Routing (AAR)注意力感知路由,本文提出的方法,利用注意力权重特征增强路由决策。
Attention Sinks注意力汇,指注意力机制中某些令牌持续获得高注意力权重的现象。
Residual Stream残差流,Transformer中信息通过残差连接逐层传递的路径。
GSM8K一个小学数学应用题数据集,常用于评估模型的数学推理能力。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅