该研究针对安全对齐后大语言模型普遍存在的“过度拒绝”问题展开机制性分析,指出以往研究多归因于静态表征重叠,而忽视了其动态成因。作者从Transformer注意力内部的路由冲突切入,发现一小组“超敏感安全头”在“难安全提示”上误触发,产生异常的注意力纠缠,将无害目标实体强行绑定到拒绝语义上,进而引发高熵路由冲突,使目标实体无法获得必要注意力。为此,作者提出语义路由校准(SRC),一种轻量、免训练的推理框架,能在推理阶段精准定位并动态抑制这些超敏感安全头,并结合双分支logits融合作为解码期的安全正则。实验表明,SRC在缓解过度拒绝的同时,尽可能保留了模型的内在安全性能。该工作为理解并改善安全对齐的副作用提供了新的机制视角与实用方案。
| 过度拒绝 (Over-Refusal) | 指安全对齐后的大语言模型错误地拒绝良性但涉及安全主题的指令的现象。 |
| 超敏感安全头 (Hypersensitive Safety Heads) | Transformer注意力中一个稀疏的注意力头子集,对安全相关提示异常敏感,容易误触发拒绝行为。 |
| 硬安全提示 (Hard-Safe Prompts) | 指那些表面涉及安全主题但实际无害的提示,容易引发模型的过度拒绝。 |
| 语义路由校准 (Semantic Routing Calibration, SRC) | 一种轻量级、无需训练的推理框架,通过动态抑制超敏感安全头并融合双分支logits来缓解过度拒绝。 |
| 双分支logits融合 (Dual-Branch Logits Fusion) | 在解码阶段将两个分支的输出logits进行融合,起到安全正则化作用,以平衡安全性和有用性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅