托管LLM评估大翻车:换个工具,结论直接反转!
Replication Without Persistence in Hosted LLMs: Measurement Sensitivity in Action-Time Belief Evaluation
arXiv AI (cs.AI) 重要 大模型论文方法安全对齐 🕐 09-22 12:00

📖 AI 总结

本文研究托管式大语言模型行为评估中的可复现性问题,区分了三个验证层次:复制(历史配置下新数据能否重现旧结论)、测量敏感性(同一标识符下重建评估与推理配置后结果是否变化)以及持续性(结论能否在后续测试的标识符上延续)。作者在Regent Chess序列环境中开展实验,该环境可精确记录隐藏的可变状态,从而在行动时刻将模型陈述的信念与真实状态比对评分。结果显示,此前报告的Gemini 3.1 Flash-Lite性能缺陷在新对局中确实重现;但在同日背靠背对比中,重建配置使端点值降低0.0429,且六个配置组件同时变化,无法归因于单一因素。在重建配置下,Gemini 3.1与3.7之间的对比出现方向反转,附加实验也呈现相同模式。研究意义在于表明复制、测量敏感性与持续性可在同一评估中得出不同结论,因此托管模型的行为主张应明确标注所测试的标识符、服务时段、测量工具与推理配置。

🔑 关键词速览

Replication可重复性,指在历史配置下用新数据重新验证先前发现是否重现。
Measurement Sensitivity测量敏感性,指评估与推理配置在相同标识符下重建时端点值的变化程度。
Persistence持续性,指发现是否在共同测量工具下于后续测试的模型标识符上依然成立。
Regent Chess一种顺序环境,其中隐藏的可变状态被精确记录,用于在行动时评估模型陈述的信念。
Hosted LLMs托管大型语言模型,指通过云服务提供的、可能随服务期和配置变化的语言模型。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅