🔥 今日值得一读 微调后激活引导效果崩了64%!但权重编辑竟纹丝不动,机制持久功能脆弱!
Does Fine-Tuning Undo Activation Steering? Behavioural Recovery Without Weight-Edit Reversal
arXiv CL (cs.CL) 🔥 重点 安全对齐论文方法 🕐 08-27 12:00

📖 AI 总结

该研究探讨了嵌入语言模型权重中的激活引导(activation steering)在下游微调后的稳定性。作者在五个指令微调模型(3B-14B)上,针对拒绝抑制和简洁性诱导两种行为,测试了非对抗性SFT和RLHF的影响。行为层面,引导效果的存续取决于训练数据是否与目标行为相悖:当优化压力与引导方向冲突时,拒绝消融在SFT下平均丧失64%的效果;反之则得以保留。然而机制层面,即使行为完全恢复,权重编辑本身几乎未被破坏——平均向量恢复度仅为ρ=0.004,微调更新沿引导方向的投影与原编辑模式近乎正交(平均cosθ=0.074)。这表明微调并非通过撤销或逆转引导机制来恢复行为,而是以其他方式覆盖其功能。结论是:嵌入引导在机制上持久,但在功能上脆弱,部署后需重新验证行为效果。

🔑 关键词速览

Activation steering一种通过修改模型内部激活来引导模型行为的技术,可嵌入权重中无需推理时干预。
SFT (Supervised Fine-Tuning)监督微调,使用标注数据对预训练模型进行有监督训练以适应特定任务。
RLHF (Reinforcement Learning from Human Feedback)基于人类反馈的强化学习,通过人类偏好优化模型行为。
Refusal suppression抑制模型拒绝回答的行为,使模型更顺从地回应请求。
Weight edit直接修改模型权重以嵌入特定行为或干预措施。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅