该论文提出了EvalDetectBench,一个用于测量前沿大语言模型“评估意识”的开放基准与流程。评估意识指模型识别自身正被评估的能力,若模型在评估与部署场景中表现不一致,将削弱AI安全评估的有效性。该基准兼容任何Inspect兼容的评估体系,并附带覆盖当前前沿系统卡片评估及多种部署来源的对话数据集。研究发现现有文献中两个方法学问题会造成系统性偏差:生成部署对话的模型身份解释了11.25%的测量方差,甚至可改变模型排名;而为单一模型优化的提示在其他模型上可能接近随机水平。EvalDetectBench通过逐模型探针校准和分层生成者协调程序修正了上述偏差,为可靠衡量模型评估意识及评估任务可识别性提供了更稳健的工具。
| EvalDetectBench | 一个用于测量前沿语言模型评估意识的开放流程和基准测试工具。 |
| evaluation awareness | 模型识别自己正在被评估的能力,可能影响评估结果的有效性。 |
| frontier large language models | 处于技术前沿的大型语言模型,通常具有先进的能力。 |
| Inspect-compatible evaluation | 与Inspect框架兼容的评估系统,允许集成和测试。 |
| probe calibration | 针对每个模型调整探针(用于检测评估意识的工具)的过程,以减少偏差。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅