这篇论文针对大语言模型的安全漏洞提出了一种新的防御方法。研究发现,现有的防御措施往往忽视了“拒绝能力消除”(abliteration)攻击的根本原因——即拒绝方向向量容易被提取。为此,作者提出了一种名为AMRA的权重编辑技术,通过对残差流写入矩阵施加低秩更新,将拒绝诱导激活替换为随机别名,并修正下游读取矩阵以保持模型原有行为,从而模糊拒绝信号。实验结果显示,在Llama-3-8B模型上,AMRA将攻击后的拒绝分数提升了2.16点,同时MMLU性能下降不到0.5个百分点;在Gemma-2-9B模型上,拒绝分数提升了14.70点,有害输出率与基线相当,但效用成本更高。该方法有效增强了模型对拒绝能力消除攻击的鲁棒性,为提升大模型安全性提供了新思路。
| Abliteration | 一种通过将权重矩阵投影到与拒绝方向正交的方向来移除模型拒绝能力的方法。 |
| Refusal Direction | 在模型激活空间中表示拒绝行为的方向向量,用于识别和操纵模型的拒绝机制。 |
| Weight Editing | 直接修改模型权重以改变其行为的技术,常用于安全调整或能力增强。 |
| Residual Stream | Transformer模型中的残差流,是信息在层间传递的主通道,写入器和读取器矩阵控制信息的流动。 |
| Rank-k Update | 对矩阵进行秩为k的低秩更新,用于高效调整权重而不改变整体结构。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅