🔥 今日值得一读 黑盒也能防后门!TRIM精准揪出恶意触发器,攻击成功率直降,无需内部数据照样净化模型!
Beyond Small Patches: Black-Box Detection and Purification of Diverse Backdoor Triggers
arXiv CV (cs.CV) 🔥 重点 #安全对齐#后门防御#黑盒 🕐 09-04 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可集成TRIM到部署的视觉模型中,无需内部访问即可检测并净化后门触发,提升模型安全性。

📖 AI 总结

该研究提出了一种名为TRIM的新型黑盒防御方法,用于检测和清除深度神经网络中的多种后门攻击触发器。与现有依赖模型内部结构、训练数据或干净样本的防御手段不同,TRIM仅需黑盒访问即可在推理阶段识别并选择性净化被操纵的图像区域。其核心机制包括三个部分:基于深度特征表示的图像区域分割、通过修复和扩散重建实现的自适应触发器发现,以及选择性区域净化。实验覆盖混合、稀疏、不同尺寸及多重触发器等多种攻击类型,结果显示TRIM将攻击成功率最低降至1.16%,同时保持高达87.87%的干净准确率,性能优于现有黑盒防御方法。该研究证明了在无任何辅助数据条件下,推理阶段有效缓解后门攻击的可行性,为实际部署中的模型安全提供了新思路。

🔑 关键词速览

Backdoor attacks一种针对深度神经网络的攻击方式,通过植入恶意触发器使模型在特定输入下产生错误预测,同时保持正常输入的准确率。
Black-box defense一种防御方法,仅通过模型的输入输出接口进行检测和防御,不依赖模型内部结构或训练数据。
TRIM本文提出的方法,通过识别和净化被操纵的图像区域来移除后门触发器,无需辅助数据。
Attack success rate (ASR)衡量后门攻击有效性的指标,表示带触发器输入被错误分类为目标标签的比例。
Diffusion-based reconstruction一种基于扩散模型的图像重建技术,用于生成或修复图像区域,帮助识别触发器。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅