该研究针对文本到图像生成中无需训练的安全防护方法展开分析,指出此类方法普遍依赖可复用的全局安全信号(如统一的不安全方向或全局有害子空间)来过滤提示词,但这一假设存在根本性局限。作者通过受控的几何分析发现,紧凑的不安全子空间无法覆盖多样化的不安全语义,而扩大聚合范围又会逐渐扭曲与安全相邻的良性提示,形成一种稳定的“覆盖度—选择性”权衡。基于此,作者提出CALM方法,用提示词局部的反事实校正替代统一的全局移除:借助匹配的不安全—良性锚点,将每个提示路由至实际激活的不安全类别,仅对违规词元的表示做最小化编辑,并抑制正向对齐的不安全残差成分。广泛评估表明,CALM在显著提升不安全内容抑制效果的同时保持了良性提示的可用性,证明局部反事实校正比全局信号移除更具选择性。
| CALM (Counterfactual Adaptive Local Modulation) | 一种免训练的安全防护方法,通过提示局部的反事实校正来替代全局不安全信号移除。 |
| Text-to-Image Generation | 文本到图像生成,指根据文本提示生成对应图像的技术。 |
| Training-free Safeguard | 免训练安全防护,指无需额外训练即可应用于生成模型的安全机制。 |
| Global Unsafety Assumption | 全局不安全假设,认为存在一个可广泛应用的全局不安全信号(如方向或子空间)来检测不安全内容。 |
| Coverage-Selectivity Trade-off | 覆盖-选择性权衡,指安全信号在覆盖多种不安全语义与保持对良性提示的选择性之间的平衡问题。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅