本研究探讨了道德推理强化学习训练能否帮助语言模型智能体抵御对抗性人格攻击。作者对经道德奖励强化学习训练的Gemma-2-27B/9B和Llama-3.1-8B智能体实施五种人格攻击,并通过噪声奖励对照、对抗性PPO、表征分析、激活引导和注意力头消融等手段检验其因果机制。结果显示,在27B模型上,道德强化学习将平均对抗退化降低5.2倍,但代价是ETHICS准确率下降约11个百分点;在205个场景和5个随机种子下,推理层面的道德奖励带来5.8倍鲁棒性提升,而匹配的随机奖励则毫无效果。训练还重塑了表征几何结构,使攻击处理峰值提前8层,并暴露出一个秩为1的L21方向,可恢复完整PPO平均鲁棒性的83%。然而,面对虚构角色扮演攻击,L21引导仅能弥补29%的差距,注意力头消融发现38个顺从头与25个对齐头相互竞争。研究表明,道德强化学习构建的鲁棒性部分呈线性、部分分布于回路之中,可通过激活引导迁移,但仍无法抵御具名角色的角色扮演攻击。
| Red-Teaming | 红队测试,指通过模拟对抗性攻击来评估AI系统安全性和鲁棒性的方法。 |
| Moral-Reward RL | 道德奖励强化学习,使用道德相关奖励信号训练语言模型智能体以增强其合作行为。 |
| Persona Attacks | 人格攻击,通过注入角色指令(如虚构角色扮演)来诱导智能体偏离其道德目标。 |
| CKA | 中心化核对齐,一种用于比较神经网络表征相似性的度量方法。 |
| Head Ablation | 头部消融,通过移除或抑制注意力头来研究其对模型行为影响的因果分析方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅