该研究针对大语言模型作为评判者时存在的自我偏好问题展开,发现传统研究因混淆文本风格与内容质量而无法准确测量该偏差。作者创新性地将评估对象从生成文本改为叙事约束选择,这类任务无模型特有风格但保留可识别的模型签名。实验涉及十个大语言模型,在盲评条件下,控制选择质量与评判者严格度后,自我偏好在四个评分维度中三个消失,第四个维度甚至出现反向偏差——模型认为自己的选择原创性更低。然而在质量匹配条件下,仅通过自我或他人标签(不提及具体模型名)就能双向影响评分:模型对标记为自身的选择提高分数,对标记为他人的选择降低分数,与实际来源无关。研究贡献在于证明作者归属是评估偏差的独立驱动因素,并展示开放式无标准答案任务可作为研究评判者行为的受控工具。
| LLM-as-a-judge | 一种使用大型语言模型作为评估者来评判其他模型输出质量的方法。 |
| self-preference | 模型倾向于偏好自己生成的内容的现象。 |
| narrative constraint selections | 叙事约束选择,指在给定约束条件下选择叙事元素的任务,用于评估模型行为。 |
| authorship attribution | 作者归属,指识别文本或选择来源的过程,这里指模型识别选择是否由自己生成。 |
| ground-truth-free tasks | 无真实答案的任务,指没有唯一正确答案的开放式任务,用于研究模型行为。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅