该研究探讨了大语言模型作为自动评判者时的可靠性问题,聚焦于绝对评分任务而非以往常见的成对比较场景。作者在四个基准、六种模型构成的36组“评判者—被评者”组合中发现,模型的任务准确率与其评判准确率高度正相关(多数模型皮尔逊相关系数不低于0.90),与方向性偏差则呈显著负相关(不高于-0.83);但准确率本身并不能保证评判公平,能力更强的被评模型会系统性地获得所有评判者更宽松的评分(相关系数不低于0.83)。为此,作者提出校准加权多数投票(WMV)集成方法,依据在线估计的假阳性与假阴性率对多个评判者加权,并设计了一种仅依赖评判者间一致性模式、无需真实标签或任务元数据的误差率估计器。在任务分布变化的模拟实验中,该无标签方法平均仅落后于掌握完美误差率的理想基准0.5个百分点,优于单一评判者和未加权多数投票。这表明有原则的多评判者校准可在无标注数据条件下同时提升准确率并纠正系统性宽松偏差,为模型能力不断增强背景下的可靠自动评估提供了可扩展路径。
| LLM-as-a-judge | 使用大语言模型作为自动评判者来评估其他模型输出的方法。 |
| 绝对评分任务 | 评判者直接为单个回答或输出分配一个绝对分数(如1-5分),而非比较两个回答的相对优劣。 |
| 方向性偏差 | 评判者系统性地倾向于给出过高(宽松)或过低(严格)评分的偏差。 |
| 加权多数投票(WMV) | 一种集成方法,根据每个评判者的可靠性(如错误率)对其投票进行加权,而非简单多数投票。 |
| 无标签校准 | 在不使用真实标签的情况下,通过评判者间的一致性模式估计错误率并校准评判结果。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅