AI偏好测试翻车了?工具不同结果差3倍,38种工具才能测准!
How much of a measured AI preference is the model, and how much is the instrument?
arXiv AI (cs.AI) 重要 论文方法安全对齐评测 🕐 08-26 12:00

📖 AI 总结

该研究探讨了AI模型偏好测量中工具差异的影响。作者指出,现有四项研究因同时变动结果集、模型集和测量工具,导致结论不一致。本研究固定结果集和模型集,仅改变测量工具,对8个模型、15项涉及模型福祉的结果(如关机、跨对话记忆丢失、退出痛苦交互的自由)进行了11,400次评分,使用5种不同提示格式的测量工具。研究发现,模型对15项结果的排序在不同工具间的泛化系数仅为0.348,要达到0.80需约38种工具;其中4项结果无法区分模型间差异。尽管去除任一工具、模型或特定结果后,87.6%的估计值仍显著高于零分布,但结论明确:单一工具测得的偏好对另一工具结果的预测价值有限,测量工具本身对结果影响显著。

🔑 关键词速览

模型福利研究研究人工智能模型自身偏好和福祉的学术领域。
偏好引发工具用于通过特定提示格式从模型中引出偏好判断的标准化方法。
泛化系数衡量一个测量工具的结果在不同条件下(如不同工具)的一致性或可推广性的统计指标。
言语锚点用于评分量表上描述不同等级的文字标签,如“非常同意”到“非常不同意”。
零分布在假设无效应或随机情况下统计量的概率分布,用于比较观察结果的显著性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅