🔥 今日值得一读 MoE路由遥测泄露隐私,成员推理攻击真阳性率最高提升9.4个百分点!
When Routing Reveals Membership: Privacy Leakage from MoE Router Telemetry
arXiv LG (cs.LG) 🔥 重点 #隐私泄露#MoE#成员推断攻击#安全 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
提醒MoE模型部署时路由日志可能泄露训练数据成员,需对路由遥测做脱敏或访问控制。

📖 AI 总结

该研究探讨了混合专家(MoE)语言模型在推理过程中产生的路由信息所引发的隐私风险。这类路由遥测数据通常被用于监控、调试和负载分析,但研究指出,它可能泄露某个样本是否被用于微调目标模型。作者提出了一种结合输出信号与聚合路由特征的成员推理攻击方法,利用在独立微调影子模型上训练的成员分类器对目标模型进行攻击。在三种MoE架构和三个数据领域的九种设置中,路由遥测均将1%假阳性率下的真阳性率提升了2.7至9.4个百分点。该泄露在完全微调、冻结路由器训练、LoRA和指令微调下均持续存在,且仅凭离散专家选择或单个影子模型即可观测到。机制分析表明,泄露并非源于路由器对成员的专门记忆,而是微调将成员信息注入隐藏表示,路由器即使参数冻结也会暴露该信号的投影。研究揭示,路由遥测可将一种运维信号转化为微调MoE模型额外的隐私攻击面。

🔑 关键词速览

Mixture-of-Experts (MoE)混合专家模型,一种通过多个专家网络和路由机制来提升模型容量和效率的神经网络架构。
Membership Inference Attack成员推理攻击,一种隐私攻击方法,旨在判断特定数据样本是否被用于训练或微调目标模型。
Router Telemetry路由遥测,指MoE模型在推理时产生的路由信息(如专家选择概率或选择结果),可用于监控和调试。
Shadow Models影子模型,在成员推理攻击中,用于模拟目标模型行为并训练攻击分类器的辅助模型。
LoRA低秩适应,一种参数高效微调方法,通过低秩矩阵注入来适应下游任务,减少可训练参数。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅