惊了!通道专家混合MoCE让ResNet提速16.7%,成本从平方级暴跌到线性级!
Mixture of Channel Experts: Static Sparse Supports with Input-Adaptive Mixing for Pointwise Projections
arXiv LG (cs.LG) 重要 论文方法模型架构 🕐 08-26 12:00

📖 AI 总结

该研究提出了一种名为Mixture of Channel Experts(MoCE)的新型通道混合层,旨在解决将Mixture-of-Experts(MoE)设计直接迁移到卷积网络时出现的结构性问题——并行卷积专家因读取相同输入通道而学习到近乎相同的滤波器。MoCE将专家轴从算子复制转向通道选择,每个专家对应一个输出通道,仅学习k个输入通道的稀疏支持集,并通过输入自适应温度参数的softmax实现均值与最大值聚合之间的动态切换。该方法以k/C的相对计算成本替代了原本随通道数二次增长的密集投影开销。实验表明,在ImageNet-1K、CIFAR-100、迁移学习及EfficientViT等多种设置下,MoCE在匹配或超越密集基线与既有通道选择方法的同时,将MACs降低16.7%并缩短端到端延迟,验证了其作为高效点投影替代方案的有效性。

🔑 关键词速览

Mixture-of-Experts (MoE)一种模型架构,通过路由机制将输入分配给多个专家网络,以扩展模型容量。
Mixture of Channel Experts (MoCE)本文提出的方法,将专家概念应用于通道选择,实现稀疏通道混合。
Pointwise Projection逐点投影,即1x1卷积,用于通道维度的变换。
Sparse Support稀疏支持,指每个专家仅选择少量输入通道的子集。
Load-Balancing Loss负载均衡损失,用于确保所有通道被均匀覆盖,避免某些通道过载或闲置。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅