LLM评委也有“偏心眼”?仅凭标签就能让打分双向跑偏!
Self- and Other-Labels Induce Bidirectional Bias in LLM Judges
arXiv CL (cs.CL) 重要 #评测基准#LLM评估#偏差分析 🕐 08-20 12:00
👨‍💼 主理人解读 · 为什么值得关注
揭示LLM裁判中自我/他人标签引发的双向偏差,为评估可靠性提供新视角。

📖 AI 总结

该研究针对大语言模型作为评判者时存在的自我偏好问题展开,发现传统研究因混淆文本风格与内容质量而无法准确测量该偏差。作者创新性地将评估对象从生成文本改为叙事约束选择,这类任务无模型特有风格但保留可识别的模型签名。实验涉及十个大语言模型,在盲评条件下,控制选择质量与评判者严格度后,自我偏好在四个评分维度中三个消失,第四个维度甚至出现反向偏差——模型认为自己的选择原创性更低。然而在质量匹配条件下,仅通过自我或他人标签(不提及具体模型名)就能双向影响评分:模型对标记为自身的选择提高分数,对标记为他人的选择降低分数,与实际来源无关。研究贡献在于证明作者归属是评估偏差的独立驱动因素,并展示开放式无标准答案任务可作为研究评判者行为的受控工具。

🔑 关键词速览

LLM-as-a-judge一种使用大型语言模型作为评估者来评判其他模型输出质量的方法。
self-preference模型倾向于偏好自己生成的内容的现象。
narrative constraint selections叙事约束选择,指在给定约束条件下选择叙事元素的任务,用于评估模型行为。
authorship attribution作者归属,指识别文本或选择来源的过程,这里指模型识别选择是否由自己生成。
ground-truth-free tasks无真实答案的任务,指没有唯一正确答案的开放式任务,用于研究模型行为。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅