🔥 今日值得一读 破解大模型安全黑箱!电路级干预让攻击下安全率暴涨26.5%,性能仅降1.7%
From Detection to Refusal: Safer LLMs via Circuit-Guided Weight Scaling
arXiv CL (cs.CL) 🔥 重点 安全对齐论文方法 🕐 09-02 12:00

📖 AI 总结

该研究从机械可解释性角度解析了大语言模型的安全行为机制,提出一个多阶段“安全回路”模型,包含有害检测头、安全神经元和拒绝头三个组成部分。通过针对注意力头和神经元的干预实验,研究者提供了因果证据,表明上游有害检测头被抑制会破坏下游拒绝行为,而安全神经元在其中起中介作用。该回路结构在多种模型架构和对抗攻击场景下均稳定存在。基于此发现,研究者采用保持架构的权重缩放方法作为机制探针,在六个大语言模型上将攻击下的安全率平均提升26.5%,同时仅在四个标准基准上造成1.7%的准确率下降。这项工作为理解对齐行为背后的稳定可迁移机制提供了新视角,也展示了机械可解释性在提升模型安全性方面的实际应用价值。

🔑 关键词速览

安全电路 (Safety Circuit)一种多阶段神经机制,由有害检测头、安全神经元和拒绝头组成,共同实现LLM的拒绝行为。
有害检测头 (Harmful Detection Heads)注意力头,专门识别有害输入并触发安全响应。
安全神经元 (Safety Neurons)在残差流中介导和稳定安全信号的神经元,连接检测与拒绝阶段。
拒绝头 (Refusal Heads)注意力头,将安全信号转化为生成拒绝或安全内容的输出。
机械可解释性 (Mechanistic Interpretability)通过逆向工程神经网络的内部计算来理解其行为的研究方法。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅