该研究将大语言模型的拒绝行为拆解为组件级别的激活干预,在四个开放权重模型上识别出足以复现完整行为效果的稀疏注意力与MLP组件子集。研究发现,拒绝方向集中于仅占上游组件28%至48%的稀疏机制中,仍能保留88%至101%的引导效果;在这些机制内部,有效引导进一步集中于约50%的残差流维度,保留组件机制基线的85%至98%,与特权基结构相符。这表明稀疏性在两个层面同时起作用:被引导的组件以及承载信号的维度。整体而言,拒绝行为并非弥散地编码于Transformer中,而是由结构化、可识别的机制组装而成,为理解拒绝行为的表征与引导提供了机理基础。
| 激活引导 (Activation Steering) | 一种通过干预模型内部激活值来操控大语言模型行为的技术。 |
| 组件级干预 (Component-level Intervention) | 在Transformer的注意力或MLP等组件层面进行的干预操作。 |
| 残差流维度 (Residual Stream Dimensions) | Transformer中残差流向量所包含的各个维度,承载着模型内部信息。 |
| 特权基结构 (Privileged Basis Structure) | 指某些维度在表示特定信息时具有优先或特权地位的结构特性。 |
| 拒绝机制 (Refusal Mechanism) | 大语言模型拒绝执行某些请求(如有害指令)时所依赖的内部机制。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅