该论文从统计视角系统研究了混合专家(MoE)架构的理论基础,将其视为一种输入依赖的局部化聚合方法。作者推导了密集路由和稀疏路由下专家学习的风险上界,将误差分解为近似误差、专家学习误差和路由估计误差三部分,并揭示了稀疏Top-K路由如何在保持局部聚合优势的同时控制单输入计算成本。论文还通过输入空间的几何结构解释门控机制,将路由性能与专家局部优势区域联系起来,并分析了DeepSeekMoE等架构中共享专家的作用——提取共性预测结构,使路由专家专注于残差局部变化。研究为理解MoE中专家专业化与计算效率的权衡提供了统一统计框架,弥补了现有理论多局限于参数化或正确设定模型的不足。
| Mixture-of-Experts (MoE) | 一种通过输入相关路由组合多个专家模型的架构,旨在增加模型容量。 |
| Routing | 决定每个输入分配给哪些专家的机制,是MoE的核心设计选择。 |
| Sparse activation | 每个输入仅激活少量专家,以降低计算成本。 |
| Shared experts | 被所有输入共享的专家,用于提取共同特征,如DeepSeekMoE中的设计。 |
| Oracle risk bounds | 在理想化条件下(如已知最优参数)推导的误差上界,用于理论分析。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅