本文提出 OMP-MoE,一种面向混合专家(MoE)大语言模型的免训练压缩框架,旨在缓解其部署时内存占用过大的问题。针对现有剪枝方法搜索成本高、忽视专家间动态依赖的不足,作者将专家剪枝重新建模为稀疏信号重建任务,利用正交匹配追踪以线性复杂度贪心选择专家,并通过注水策略优化跨层专家分配,兼顾重建质量与路由稳定性。此外,作者提出自适应推理机制 OMP-MoE†,依据能量预测动态调整专家激活。在 Qwen、DeepSeek-V2、GPT-OSS 和 Mixtral 等模型上,该方法在 25% 至 50% 剪枝率下均优于现有方法;以 Qwen3-30B-A3B 为例,压缩 50% 后仍保留 93.3% 的原始性能,搜索速度提升 33 倍,推理加速 1.55 倍。该工作为 MoE 模型的高效部署提供了低开销、可泛化的剪枝思路。
| Mixture-of-Experts (MoE) | 混合专家模型,一种通过多个专家子网络和路由机制来扩展模型容量并降低计算成本的架构。 |
| Orthogonal Matching Pursuit (OMP) | 正交匹配追踪,一种用于稀疏信号重建的贪心算法,通过迭代选择与残差最相关的原子来逼近目标信号。 |
| Expert Pruning | 专家剪枝,指在混合专家模型中移除冗余专家以减少模型大小和计算开销的技术。 |
| Water-filling Strategy | 注水策略,一种资源分配优化方法,根据各维度的质量或容量动态分配资源以最大化整体效益。 |
| Routing Stability | 路由稳定性,指混合专家模型中路由网络将输入分配给专家的决策在不同输入或训练阶段保持一致的程度。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅