本文提出了一种名为GAPS(Gated Activation steering via Posterior and Separability)的新方法,用于改进语言模型中的激活引导技术。现有条件激活方法(如CAST和DSAS)虽能决定何时干预,但一旦激活便对所有隐藏维度施加完整稠密向量,忽略了不同神经元的功能差异。GAPS引入维度级条件化,通过两个无需训练的“门”实现选择性干预:静态可分性门基于AUROC筛选出携带可靠概念信息的神经元,动态后验门则依据高斯模型判断当前激活是否更符合不良概念,从而决定是否干预。该方法仅增加O(D)的每令牌计算开销,可无缝集成到现有条件方法中。在毒性缓解(RealToxicityPrompts)和概念移除(OneSeC)任务上,使用Gemma-3(4B)和Qwen-3(1.7B)模型测试,GAPS一致匹配或改善了帕累托前沿。在固定能力预算下,DSAS+GAPS将Gemma-3的毒性率从6.52%降至0.48%,而DSAS单独仅降至3.52%。消融实验表明,性能提升主要归功于后验门。
| Activation steering | 一种通过修改模型内部激活向量来控制生成行为的技术。 |
| GAPS (Gated Activation steering via Posterior and Separability) | 本文提出的方法,通过两个门(可分性门和后验门)实现维度级选择性激活引导。 |
| AUROC | 接收者操作特征曲线下面积,用于衡量神经元区分概念信息的统计可靠性。 |
| Pareto front | 帕累托前沿,表示在多个目标(如行为改善和能力保持)之间最优权衡的集合。 |
| Toxicity mitigation | 减少语言模型生成有害或冒犯性内容的任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅