🔥 今日值得一读 5%重叠就选错最佳LLM评判者概率高达65%!
LLM Judge Validation Under Sparse Overlap: From Inference to Design
arXiv AI (cs.AI) 🔥 重点 大模型论文方法安全对齐 🕐 今天 12:00

📖 AI 总结

本文研究如何验证作为评判者的LLM与人类标注的一致性,指出标注预算有限导致同一项目很少被多人重复标注,这种重叠稀疏性会直接影响部署决策的正确性。作者证明,当两两重叠率仅为5%时,错误决策率可达25%,在十个候选评判者中选错最佳者的概率高达65%。研究提出两个可操作方向:重叠数量与重叠分配。在数量上,推导出最小重叠公式,表明非边界评判者只需重叠率不低于0.25即可,而边界情形本质上难以解决;在分配上,提出一种零成本分层方案,当分层具有信息量时可将错误拒绝率相对随机采样减半。作者在视觉评估、因果推理和摘要等四类评测矩阵、十个LLM评判者上验证了上述结论。该工作将重叠稀疏性确立为评判者验证中的首要因素,并为标注预算的分配提供了可落地的设计准则。

🔑 关键词速览

LLM-as-a-judge使用大型语言模型作为自动评判者来评估其他模型输出的方法。
overlap sparsity指在标注数据中,同一项目被多个标注者重复标注的比例很低的现象。
wrong-decision rate在模型选择或部署决策中做出错误判断的概率。
stratified scheme一种按特征分层进行抽样的方法,旨在提高样本代表性和效率。
false-rejection rate错误地拒绝一个实际上合格的模型或评判者的概率。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅