该研究揭示了大型语言模型安全对齐机制的深层缺陷:现有防护仅作用于生成末端,无法消除预训练阶段习得的危险概念知识。作者提出“语义伪装”攻击概念,即通过将恶意意图嵌入看似无害的叙事语境(如创意写作)来绕过输入输出双重防护。通过对Phi-3、Qwen2.5和Gemma-2b三个小型语言模型家族的对抗性压力测试,研究发现了一个普遍存在的“意图视界”现象——在模型总层数的15%至20%深度处,预训练形成的危险表征会因上下文安全化处理而崩塌。关键发现是:虽然后期层中伪装攻击与安全查询在数学上难以区分(检测率低于20%),但早期层仍保留可辨识的“危害签名”。基于此,论文提出轻量级探测防御方法LIV(潜在意图验证),在PKU-SafeRLHF数据集上测试显示,该方法在所有架构上比标准防护性能提升20%至50%,且无需重新训练模型即可有效应对零日语义攻击。
| Semantic Camouflage | 一种对抗性攻击,将有害意图隐藏在良性叙事中,以绕过模型的安全防护。 |
| Intent Horizon | 模型深层中一个关键深度,在此处有害意图的表征坍缩为安全叙事,导致检测困难。 |
| Latent Intent Verification (LIV) | 一种轻量级探测防御方法,通过分析早期层表征来检测伪装的有害意图。 |
| Small Language Model (SLM) | 小型语言模型,参数量较小,但在此研究中用于分析安全对齐的漏洞。 |
| PKU-SafeRLHF | 一个用于评估安全对齐和对抗性攻击的数据集,包含安全和不安全的提示。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅