本文研究如何验证作为评判者的LLM与人类标注的一致性,指出标注预算有限导致同一项目很少被多人重复标注,这种重叠稀疏性会直接影响部署决策的正确性。作者证明,当两两重叠率仅为5%时,错误决策率可达25%,在十个候选评判者中选错最佳者的概率高达65%。研究提出两个可操作方向:重叠数量与重叠分配。在数量上,推导出最小重叠公式,表明非边界评判者只需重叠率不低于0.25即可,而边界情形本质上难以解决;在分配上,提出一种零成本分层方案,当分层具有信息量时可将错误拒绝率相对随机采样减半。作者在视觉评估、因果推理和摘要等四类评测矩阵、十个LLM评判者上验证了上述结论。该工作将重叠稀疏性确立为评判者验证中的首要因素,并为标注预算的分配提供了可落地的设计准则。
| LLM-as-a-judge | 使用大型语言模型作为自动评判者来评估其他模型输出的方法。 |
| overlap sparsity | 指在标注数据中,同一项目被多个标注者重复标注的比例很低的现象。 |
| wrong-decision rate | 在模型选择或部署决策中做出错误判断的概率。 |
| stratified scheme | 一种按特征分层进行抽样的方法,旨在提高样本代表性和效率。 |
| false-rejection rate | 错误地拒绝一个实际上合格的模型或评判者的概率。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅