该研究提出了一种名为Mixture of Channel Experts(MoCE)的新型通道混合层,旨在解决将Mixture-of-Experts(MoE)设计直接迁移到卷积网络时出现的结构性问题——并行卷积专家因读取相同输入通道而学习到近乎相同的滤波器。MoCE将专家轴从算子复制转向通道选择,每个专家对应一个输出通道,仅学习k个输入通道的稀疏支持集,并通过输入自适应温度参数的softmax实现均值与最大值聚合之间的动态切换。该方法以k/C的相对计算成本替代了原本随通道数二次增长的密集投影开销。实验表明,在ImageNet-1K、CIFAR-100、迁移学习及EfficientViT等多种设置下,MoCE在匹配或超越密集基线与既有通道选择方法的同时,将MACs降低16.7%并缩短端到端延迟,验证了其作为高效点投影替代方案的有效性。
| Mixture-of-Experts (MoE) | 一种模型架构,通过路由机制将输入分配给多个专家网络,以扩展模型容量。 |
| Mixture of Channel Experts (MoCE) | 本文提出的方法,将专家概念应用于通道选择,实现稀疏通道混合。 |
| Pointwise Projection | 逐点投影,即1x1卷积,用于通道维度的变换。 |
| Sparse Support | 稀疏支持,指每个专家仅选择少量输入通道的子集。 |
| Load-Balancing Loss | 负载均衡损失,用于确保所有通道被均匀覆盖,避免某些通道过载或闲置。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅