🔥 今日值得一读 模型深层藏不住!15-20%层数就能揪出有害意图,伪装攻击检测率飙到80%+
Truth Lies Deep: Countering Semantic Camouflage via Latent Intent Verification
arXiv AI (cs.AI) 🔥 重点 安全对齐论文方法大模型 🕐 08-24 12:00

📖 AI 总结

该研究揭示了大型语言模型安全对齐机制的深层缺陷:现有防护仅作用于生成末端,无法消除预训练阶段习得的危险概念知识。作者提出“语义伪装”攻击概念,即通过将恶意意图嵌入看似无害的叙事语境(如创意写作)来绕过输入输出双重防护。通过对Phi-3、Qwen2.5和Gemma-2b三个小型语言模型家族的对抗性压力测试,研究发现了一个普遍存在的“意图视界”现象——在模型总层数的15%至20%深度处,预训练形成的危险表征会因上下文安全化处理而崩塌。关键发现是:虽然后期层中伪装攻击与安全查询在数学上难以区分(检测率低于20%),但早期层仍保留可辨识的“危害签名”。基于此,论文提出轻量级探测防御方法LIV(潜在意图验证),在PKU-SafeRLHF数据集上测试显示,该方法在所有架构上比标准防护性能提升20%至50%,且无需重新训练模型即可有效应对零日语义攻击。

🔑 关键词速览

Semantic Camouflage一种对抗性攻击,将有害意图隐藏在良性叙事中,以绕过模型的安全防护。
Intent Horizon模型深层中一个关键深度,在此处有害意图的表征坍缩为安全叙事,导致检测困难。
Latent Intent Verification (LIV)一种轻量级探测防御方法,通过分析早期层表征来检测伪装的有害意图。
Small Language Model (SLM)小型语言模型,参数量较小,但在此研究中用于分析安全对齐的漏洞。
PKU-SafeRLHF一个用于评估安全对齐和对抗性攻击的数据集,包含安全和不安全的提示。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅