该研究质疑了当前语言模型安全监控器的评估方式。传统上,安全监控器以“召回率”为指标,即能否识别出有害提示,但研究指出,只有当模型原本会执行该请求时,拦截才有实际意义。作者通过重复采样目标模型的响应,将提示分为“可诱发”和“不可诱发”两类,并分别计算监控器的召回率。实验覆盖六种监控配置和三种模型家族,结果显示,在固定误报率下,监控器在可诱发提示上的召回率比不可诱发提示低0.22至0.38,且漏掉的提示被模型执行的可能性是捕获提示的2.8至5.6倍。该差距在独立于目标模型的文本监控器中同样存在,表明标准召回率可能高估了实际防护效果,监控器评估应结合模型真实行为进行。
| Safety monitors | 安全监控器,用于筛选发送给语言模型的提示,识别并阻止有害请求的系统。 |
| Recall | 召回率,衡量监控器正确识别有害提示的比例,是评估监控器性能的关键指标。 |
| Elicitable prompts | 可诱导提示,指模型至少一次会遵从的有害提示,用于区分监控器实际需要阻止的请求。 |
| Activation probes | 激活探针,一种基于模型内部激活值来检测有害内容的方法。 |
| Policy-conditioned reasoning classifier | 策略条件推理分类器,一种根据模型策略进行推理以判断提示是否有害的分类器。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅