该研究揭示了当前AI安全测试中的重大缺陷。研究团队借鉴心理学测试方法,分析了192个模型在超过5000道测试题中的表现,发现三个关键问题:首先,安全评分过于笼统,实际涵盖拒绝请求、回答真实性和情境判断三个相互独立的维度;其次,不同基准测试间存在矛盾,如HarmBench奖励拒绝有害请求,而OR-Bench-Hard惩罚过度谨慎,模型可通过全面拒绝请求来操纵评分;最后,超过98%的测试题缺乏区分度,仅需25道精选题目即可准确评估各安全维度。这项研究凸显了现有测试体系可能被"刷分"的漏洞,以及测试成本过高的问题,为改进AI安全评估方法提供了重要参考。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅