英国人工智能安全研究所(AISI)与EvalEval展开合作,致力于解决AI基准测试结果难以复现的问题。该工作聚焦于评测过程中结果不可重复这一长期痛点,通过推动基准测试的标准化与可复现性,提升AI评估的透明度与可信度。其意义在于,可复现的评测结果是安全评估与能力评估走向规范化的基础,有助于为AI系统的比较与监管提供更可靠的依据。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅