这篇论文研究了大语言模型评审之间的一致性是否真的能作为判断正确的可靠证据。作者指出,共识机制通常假设各评审独立犯错,但实际中模型往往以相似方式训练和评估,因而可能犯相同的错误。研究在多个开源和前沿模型评审中发现显著的错误相关性:在十个评审组成的测试组中,两两错误平均相关系数为0.21,使得这十个评审提供的信息量仅相当于约3.5个独立评审;在准确率更高的前沿模型之间,这种依赖关系更强。研究还发现,忽略共享错误会导致高达28%的对比中错误地判定某系统显著更优。此外,错误的分布模式(多数共享还是集中于少数)会影响共识结果并偏好不同的投票方法,仅测量相关性总量并不充分。作者建议利用一小部分可信样本估计评审准确率并识别共享错误,在分析结果时加以考虑,并在应用新数据前先用可信样本选择投票方法。
| LLM Judge | 使用大型语言模型作为评判者来评估其他系统或模型输出的方法。 |
| Error Correlation | 不同评判者犯错误之间的统计相关性,表明错误并非独立发生。 |
| Consensus | 多个评判者达成一致意见,常被用作决策正确的证据。 |
| Voting Method | 聚合多个评判者意见以做出最终决策的规则或算法。 |
| Frontier Judges | 指当前最先进、性能最佳的大型语言模型评判者。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅