🔥 今日值得一读 安全监控器漏掉有害提示被遵从概率高达5.6倍,召回率高估保护达0.38!
Recall Is Not Protection: Evaluating Safety Monitors Against Model Compliance
arXiv CL (cs.CL) 🔥 重点 #安全对齐#评测基准#红队测试 🕐 09-09 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可用该方法更准确地评估安全监控器,通过区分可诱导和不可诱导提示,优化拦截策略以真正防止有害输出。

📖 AI 总结

该研究质疑了当前语言模型安全监控器的评估方式。传统上,安全监控器以“召回率”为指标,即能否识别出有害提示,但研究指出,只有当模型原本会执行该请求时,拦截才有实际意义。作者通过重复采样目标模型的响应,将提示分为“可诱发”和“不可诱发”两类,并分别计算监控器的召回率。实验覆盖六种监控配置和三种模型家族,结果显示,在固定误报率下,监控器在可诱发提示上的召回率比不可诱发提示低0.22至0.38,且漏掉的提示被模型执行的可能性是捕获提示的2.8至5.6倍。该差距在独立于目标模型的文本监控器中同样存在,表明标准召回率可能高估了实际防护效果,监控器评估应结合模型真实行为进行。

🔑 关键词速览

Safety monitors安全监控器,用于筛选发送给语言模型的提示,识别并阻止有害请求的系统。
Recall召回率,衡量监控器正确识别有害提示的比例,是评估监控器性能的关键指标。
Elicitable prompts可诱导提示,指模型至少一次会遵从的有害提示,用于区分监控器实际需要阻止的请求。
Activation probes激活探针,一种基于模型内部激活值来检测有害内容的方法。
Policy-conditioned reasoning classifier策略条件推理分类器,一种根据模型策略进行推理以判断提示是否有害的分类器。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅