🔥 今日值得一读 毒性率暴降13倍!新方法GAPS让AI安全干预精准到神经元,零训练成本
GAPS: Dimension-Level Gates for Conditional Activation Steering
arXiv CL (cs.CL) 🔥 重点 #激活引导#模型控制#可解释性 🕐 09-03 12:00
👨‍💼 主理人解读 · 为什么值得关注
用于更精准地控制LLM行为,开发者可选择性干预特定维度,减少对模型能力的负面影响,提升安全性和可控性。

📖 AI 总结

本文提出了一种名为GAPS(Gated Activation steering via Posterior and Separability)的新方法,用于改进语言模型中的激活引导技术。现有条件激活方法(如CAST和DSAS)虽能决定何时干预,但一旦激活便对所有隐藏维度施加完整稠密向量,忽略了不同神经元的功能差异。GAPS引入维度级条件化,通过两个无需训练的“门”实现选择性干预:静态可分性门基于AUROC筛选出携带可靠概念信息的神经元,动态后验门则依据高斯模型判断当前激活是否更符合不良概念,从而决定是否干预。该方法仅增加O(D)的每令牌计算开销,可无缝集成到现有条件方法中。在毒性缓解(RealToxicityPrompts)和概念移除(OneSeC)任务上,使用Gemma-3(4B)和Qwen-3(1.7B)模型测试,GAPS一致匹配或改善了帕累托前沿。在固定能力预算下,DSAS+GAPS将Gemma-3的毒性率从6.52%降至0.48%,而DSAS单独仅降至3.52%。消融实验表明,性能提升主要归功于后验门。

🔑 关键词速览

Activation steering一种通过修改模型内部激活向量来控制生成行为的技术。
GAPS (Gated Activation steering via Posterior and Separability)本文提出的方法,通过两个门(可分性门和后验门)实现维度级选择性激活引导。
AUROC接收者操作特征曲线下面积,用于衡量神经元区分概念信息的统计可靠性。
Pareto front帕累托前沿,表示在多个目标(如行为改善和能力保持)之间最优权衡的集合。
Toxicity mitigation减少语言模型生成有害或冒犯性内容的任务。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅