该研究针对大语言模型安全防护中外部护栏模型延迟高、算力开销大且无法洞察模型内部状态的问题,提出一种基于潜在状态的危害检测方法。作者从LLaMA-3.1-8B中提取激活值,训练仅含1260万参数的轻量级MLP分类探针来识别有害提示。在WildJailbreak、Beavertails和AEGIS 2.0三个基准上,探针的F1分数分别达到99%、83%和84%,性能与参数量大1000倍的护栏模型相当,同时显著降低延迟与计算成本。该工作表明模型内部激活已隐含危害信息,为资源受限、时间敏感场景下的自主系统安全提供了更高效的内生检测路径,弥补了外部护栏与模型内部机制之间的保障缺口。
| LLaMA-3.1-8B | Meta发布的开源大语言模型,参数量为80亿,是本文提取内部激活值的基座模型。 |
| MLP分类器探针 | 一种轻量级多层感知机分类器,用于从模型激活值中探测有害内容,参数量仅1260万。 |
| WildJailbreak | 一个用于评估语言模型越狱攻击安全性的基准数据集,包含大量有害提示。 |
| Beavertails | 一个评估语言模型安全性的基准数据集,专注于有害内容检测和安全性对齐。 |
| AEGIS 2.0 | 一个用于评估语言模型安全护栏性能的基准数据集,涵盖多种有害内容类别。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅