🔥 今日值得一读 仅28%到48%的组件就保住88%以上拒绝引导效果!
Component and Dimension Sparsity in Transformer Refusal Mechanisms
arXiv CL (cs.CL) 🔥 重点 #激活引导#机制可解释性#安全对齐 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
可据此只干预少量组件实现拒答控制,降低激活引导成本并提升安全对齐效率。

📖 AI 总结

该研究将大语言模型的拒绝行为拆解为组件级别的激活干预,在四个开放权重模型上识别出足以复现完整行为效果的稀疏注意力与MLP组件子集。研究发现,拒绝方向集中于仅占上游组件28%至48%的稀疏机制中,仍能保留88%至101%的引导效果;在这些机制内部,有效引导进一步集中于约50%的残差流维度,保留组件机制基线的85%至98%,与特权基结构相符。这表明稀疏性在两个层面同时起作用:被引导的组件以及承载信号的维度。整体而言,拒绝行为并非弥散地编码于Transformer中,而是由结构化、可识别的机制组装而成,为理解拒绝行为的表征与引导提供了机理基础。

🔑 关键词速览

激活引导 (Activation Steering)一种通过干预模型内部激活值来操控大语言模型行为的技术。
组件级干预 (Component-level Intervention)在Transformer的注意力或MLP等组件层面进行的干预操作。
残差流维度 (Residual Stream Dimensions)Transformer中残差流向量所包含的各个维度,承载着模型内部信息。
特权基结构 (Privileged Basis Structure)指某些维度在表示特定信息时具有优先或特权地位的结构特性。
拒绝机制 (Refusal Mechanism)大语言模型拒绝执行某些请求(如有害指令)时所依赖的内部机制。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅