该研究针对生产环境中text-to-SQL流水线普遍采用LLM作为评判者却从未验证其与人工标注一致性的问题,对已部署的gpt-4o-mini评判模型进行了审计。结果显示,在分歧富集集上其与双作者金标准的一致性仅为Cohen's kappa=0.04,均匀随机抽查为0.42,并将77.1%人工判定为忠实的结果错误标记,主要归因于一种称为“评分幻觉”的机制。研究提出以自托管Qwen3.6-27B替代,kappa达0.72,与Claude Opus 4.7的0.71相当,而单次调用成本约为后者的三百分之一。实验还发现简单集成无益:弱强搭配反而降低一致性,而三个强评判者在一致路由下可达kappa=0.79、自动覆盖率89.7%。该审计方法在域外应用时,将BIRD金融数据集专家编写的25.5%金标准SQL标记为潜在问题。
| LLM-as-judge | 使用大型语言模型作为自动评判者来评估其他模型输出的方法。 |
| Cohen's kappa | 衡量两名标注者之间一致性的统计指标,考虑了随机一致的可能性。 |
| GRADE-HALLUCINATION | 本文提出的术语,指LLM评判者因评分等级幻觉而错误标记忠实案例的机制。 |
| text-to-SQL | 将自然语言问题自动转换为SQL查询的任务。 |
| BIRD-financial | 一个包含金融领域专家编写SQL查询的文本到SQL基准数据集。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅