🔥 今日值得一读 少步扩散模型遗忘难题破解:新框架直接移除有害概念,效率不减!
Enabling Preference-driven Unlearning in Few-step Distilled Text-to-Image Diffusion Models
arXiv CV (cs.CV) 🔥 重点 #扩散模型#机器遗忘#安全对齐 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
让快速少步文生图模型也能有效遗忘有害内容,适合部署前的安全合规处理。

📖 AI 总结

本文针对少步蒸馏文本到图像扩散模型中的概念遗忘问题提出了一种偏好驱动的遗忘框架。这类模型通过蒸馏实现快速推理,但可能生成有害或不当内容,而现有数据驱动的遗忘方法依赖多步去噪动态,在少步蒸馏模型上失效;若先在基础模型上遗忘再重新蒸馏,则计算与时间开销过大。作者重新审视扩散模型中的直接偏好优化,发现标准DPO及其遗忘变体因噪声预测误差的建模方式与少步生成动态不匹配而迁移效果差,因此提出与少步生成特性显式对齐的改进偏好优化公式,实现直接在少步蒸馏模型中移除目标概念,同时保持推理效率和无关能力的留存。实验主要在身份移除和NSFW内容移除任务上验证,并扩展至物体级遗忘,结果表明该方法能实现一致有效的遗忘并保持较强的能力留存,为少步蒸馏模型提供了一种实用且有原则的遗忘方案。

🔑 关键词速览

Few-step Distilled (FSD) Models通过蒸馏技术将多步扩散模型压缩为只需少数几步即可生成图像的模型,显著提升推理速度。
Unlearning在机器学习中,指从已训练模型中移除特定概念或知识(如有害内容)的过程,同时尽量保持其他能力。
Direct Preference Optimization (DPO)一种直接优化模型以符合人类偏好的方法,无需显式奖励模型,常用于对齐生成模型。
Noise-prediction Error扩散模型中,预测添加噪声的误差,是训练和优化扩散模型的核心目标之一。
NSFW (Nudity) Removal从不适宜工作场所(Not Safe For Work)内容中移除裸体等敏感内容的任务,是模型安全性的重要方面。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅