🔥 今日值得一读 MoE模型DP微调有坑?RAPTOR三招破解,专家更新效率翻倍!
RAPTOR: Role-Aware Private Training for Mixture-of-Experts
arXiv LG (cs.LG) 🔥 重点 #差分隐私#MoE#训练方法 🕐 09-09 12:00
👨‍💼 主理人解读 · 为什么值得关注
改善MoE模型在DP微调中的梯度抑制和噪声问题,提升隐私保护下的性能。

📖 AI 总结

RAPTOR提出了一种面向混合专家模型(MoE)的角色感知私有训练框架。论文指出,现有差分隐私(DP)微调方法将MoE视为单一稠密模块,忽略了共享层与专家层的数据可见性差异,由此产生三类失效模式:全局梯度裁剪抑制专家更新、批级归一化稀释稀疏专家梯度、固定隐私噪声降低低负载专家的信噪比。RAPTOR通过交替优化共享层与专家层,并针对性地采用专家专属裁剪与噪声、基于公开数据的期望归属分母以及不依赖私有真实专家计数的更新调度,逐一解决上述问题。理论证明该机制满足(ε,δ)-DP,且因每条记录仅归属一个专家,各专家机制在层内并行组合,更新所有专家的隐私成本与更新单个专家相同。实验在Switch Transformer、OLMoE及DeepSeek-VL2-Tiny上验证,RAPTOR在多个隐私预算下均优于标准DP基线,尤其在严格隐私约束下优势最明显。

🔑 关键词速览

Differentially Private (DP)差分隐私,一种通过添加噪声来保护数据隐私的数学框架。
Mixture-of-Experts (MoE)混合专家模型,一种稀疏激活的神经网络架构,其中每个输入只路由到部分专家。
RAPTOR角色感知的私有训练框架,针对MoE模型中的共享层和专家层分别进行优化。
Clipping裁剪,在DP中限制梯度范数以控制敏感度的技术。
Routing Entropy路由熵,衡量数据在专家间分布的不确定性或不平衡性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅