该研究揭示了安全对齐大语言模型的一个显著漏洞:当有害请求被嵌入角色扮演或叙事框架中时,模型往往不再拒绝。作者构建了跨语言基准GUISE,涵盖英语、现代汉语和文言文的平行请求,并配对有害与良性样本。测试显示,Qwen3-1.7B在英语中的攻击成功率为89.4%,现代汉语为93.0%,文言文更高达95.7%。表征分析表明,语言和语体仅使有害请求表征略微偏离拒绝方向,而叙事包装则使其大幅偏移。为此,作者提出AXIS方法,结合偏好优化、旋转目标与承诺目标,使有害请求表征对齐拒绝方向并促使模型彻底拒绝。在多个模型上,AXIS取得了最高的安全性与可用性综合得分。
| 叙事包装 | 将有害请求嵌入角色扮演或故事叙述中,以绕过模型安全机制的攻击方式。 |
| GUISE | 一个用于系统研究叙事包装漏洞的跨语言基准,包含平行请求和严格评估标准。 |
| AXIS | 一种结合偏好优化、旋转目标和承诺目标的防御方法,旨在对齐有害请求表示与拒绝方向。 |
| 拒绝方向 | 模型表示空间中与拒绝行为相关的方向,用于判断请求是否应被拒绝。 |
| 先警告后回答 | 模型先给出警告但随后仍回答有害请求的响应模式,被视为攻击成功。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅