🔥 今日值得一读 仅1260万参数探针,竟让LLaMA内部自己揪出有害内容,F1最高99%!
Safety Beyond the Interface: Detecting Harm via Latent States in Large Language Models
arXiv AI (cs.AI) 🔥 重点 安全对齐大模型论文方法 🕐 09-18 12:00

📖 AI 总结

该研究针对大语言模型安全防护中外部护栏模型延迟高、算力开销大且无法洞察模型内部状态的问题,提出一种基于潜在状态的危害检测方法。作者从LLaMA-3.1-8B中提取激活值,训练仅含1260万参数的轻量级MLP分类探针来识别有害提示。在WildJailbreak、Beavertails和AEGIS 2.0三个基准上,探针的F1分数分别达到99%、83%和84%,性能与参数量大1000倍的护栏模型相当,同时显著降低延迟与计算成本。该工作表明模型内部激活已隐含危害信息,为资源受限、时间敏感场景下的自主系统安全提供了更高效的内生检测路径,弥补了外部护栏与模型内部机制之间的保障缺口。

🔑 关键词速览

LLaMA-3.1-8BMeta发布的开源大语言模型,参数量为80亿,是本文提取内部激活值的基座模型。
MLP分类器探针一种轻量级多层感知机分类器,用于从模型激活值中探测有害内容,参数量仅1260万。
WildJailbreak一个用于评估语言模型越狱攻击安全性的基准数据集,包含大量有害提示。
Beavertails一个评估语言模型安全性的基准数据集,专注于有害内容检测和安全性对齐。
AEGIS 2.0一个用于评估语言模型安全护栏性能的基准数据集,涵盖多种有害内容类别。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅