这篇论文研究了对齐后的大语言模型在少样本微调下安全机制失效的问题。作者在四个模型家族的六个检查点上验证发现,遭受有害样本攻击后,有害与良性提示在表征空间中仍保持线性可分,且将干净的隐藏状态注入受损模型可在可复现的过渡深度恢复拒答行为。然而,基于这一局部化特征设计的防御并不稳健:冻结过渡深度以下所有层后,用一百条有害样本攻击仍使全部六个检查点的拒答率降至接近零,恢复位置出现在冻结边界之上;移除更新中前两个奇异方向虽能在四个检查点的短程注意力微调后恢复拒答,但该修复在Llama-3.1-8B上会被常规训练削弱,也能被分散更新的攻击者绕过,且在良性微调上校准的谱检测器漏检了该检查点上的多数修复失败。研究表明,攻击者可以绕过由恢复实验识别出的安全区域,并击败跨检查点有效的修复手段,提示防御评估需纳入自适应攻击视角。
| 拒绝行为(Refusal) | 对齐后的大语言模型对有害请求予以拒绝的安全行为。 |
| 少样本微调(Few-Sample Fine-Tuning) | 仅使用少量(如数十个)示例对模型进行微调,可能破坏其安全对齐。 |
| 层冻结(Layer Freezing) | 在微调过程中固定某些层的参数不更新,以保护安全相关行为。 |
| 奇异方向(Singular Directions) | 通过奇异值分解得到的更新矩阵中最重要的方向,移除它们可修复安全行为。 |
| 谱检测器(Spectral Detector) | 基于权重更新谱特性来检测微调是否破坏安全对齐的方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅