这篇论文关注混合专家(MoE)模型在推理阶段的动态稀疏路由问题。作者指出,现有MoE模型通常采用固定的top-k专家选择策略,为每个token分配相同的专家预算,而推理时动态降低top-k虽能减少计算且无需重训练,却会引入偏离训练配置所导致的分布偏移。研究发现,减少激活专家数量会持续增大SMoE输出的RMS尺度和方差,造成表示不匹配,进而加剧下游性能下降。为此,作者提出逐层分布对齐(LDA),一种轻量级的推理时校正方法,利用逐层校准统计量将降路由表示对齐到默认配置。在多个SMoE大模型、基准和路由策略上,LDA以可忽略的开销挽回了大部分因分布偏移而损失的性能,同时保持稀疏推理效率。该工作为动态稀疏推理提供了一种可纠正分布偏移的实用方案。
| Mixture-of-Experts (MoE) | 一种模型架构,由多个专家子网络和一个门控网络组成,每个输入仅激活部分专家,以在扩大模型容量的同时保持计算效率。 |
| top-k expert selection | MoE中常用的路由策略,为每个token选择得分最高的k个专家进行计算,k通常固定。 |
| dynamic top-k routing | 推理时根据输入动态调整每个token激活的专家数量,以减少计算量,而非使用固定的k值。 |
| distributional shift | 指推理时路由配置与训练时不一致,导致模型内部表示分布发生变化,从而影响性能。 |
| Layer-wise Distribution Alignment (LDA) | 本文提出的轻量级推理时校正方法,利用逐层校准统计量对齐减少路由后的表示与默认配置,以恢复性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅