该研究探讨了AI模型偏好测量中工具差异的影响。作者指出,现有四项研究因同时变动结果集、模型集和测量工具,导致结论不一致。本研究固定结果集和模型集,仅改变测量工具,对8个模型、15项涉及模型福祉的结果(如关机、跨对话记忆丢失、退出痛苦交互的自由)进行了11,400次评分,使用5种不同提示格式的测量工具。研究发现,模型对15项结果的排序在不同工具间的泛化系数仅为0.348,要达到0.80需约38种工具;其中4项结果无法区分模型间差异。尽管去除任一工具、模型或特定结果后,87.6%的估计值仍显著高于零分布,但结论明确:单一工具测得的偏好对另一工具结果的预测价值有限,测量工具本身对结果影响显著。
| 模型福利研究 | 研究人工智能模型自身偏好和福祉的学术领域。 |
| 偏好引发工具 | 用于通过特定提示格式从模型中引出偏好判断的标准化方法。 |
| 泛化系数 | 衡量一个测量工具的结果在不同条件下(如不同工具)的一致性或可推广性的统计指标。 |
| 言语锚点 | 用于评分量表上描述不同等级的文字标签,如“非常同意”到“非常不同意”。 |
| 零分布 | 在假设无效应或随机情况下统计量的概率分布,用于比较观察结果的显著性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅