该研究从机械可解释性角度解析了大语言模型的安全行为机制,提出一个多阶段“安全回路”模型,包含有害检测头、安全神经元和拒绝头三个组成部分。通过针对注意力头和神经元的干预实验,研究者提供了因果证据,表明上游有害检测头被抑制会破坏下游拒绝行为,而安全神经元在其中起中介作用。该回路结构在多种模型架构和对抗攻击场景下均稳定存在。基于此发现,研究者采用保持架构的权重缩放方法作为机制探针,在六个大语言模型上将攻击下的安全率平均提升26.5%,同时仅在四个标准基准上造成1.7%的准确率下降。这项工作为理解对齐行为背后的稳定可迁移机制提供了新视角,也展示了机械可解释性在提升模型安全性方面的实际应用价值。
| 安全电路 (Safety Circuit) | 一种多阶段神经机制,由有害检测头、安全神经元和拒绝头组成,共同实现LLM的拒绝行为。 |
| 有害检测头 (Harmful Detection Heads) | 注意力头,专门识别有害输入并触发安全响应。 |
| 安全神经元 (Safety Neurons) | 在残差流中介导和稳定安全信号的神经元,连接检测与拒绝阶段。 |
| 拒绝头 (Refusal Heads) | 注意力头,将安全信号转化为生成拒绝或安全内容的输出。 |
| 机械可解释性 (Mechanistic Interpretability) | 通过逆向工程神经网络的内部计算来理解其行为的研究方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅