🔥 今日值得一读 生产LLM评判者与人类一致性仅0.04,77%误标!换Qwen成本降300倍,kappa飙至0.72
Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline
arXiv CL (cs.CL) 🔥 重点 大模型评测基准工程实践 🕐 今天 12:00

📖 AI 总结

该研究针对生产环境中text-to-SQL流水线普遍采用LLM作为评判者却从未验证其与人工标注一致性的问题,对已部署的gpt-4o-mini评判模型进行了审计。结果显示,在分歧富集集上其与双作者金标准的一致性仅为Cohen's kappa=0.04,均匀随机抽查为0.42,并将77.1%人工判定为忠实的结果错误标记,主要归因于一种称为“评分幻觉”的机制。研究提出以自托管Qwen3.6-27B替代,kappa达0.72,与Claude Opus 4.7的0.71相当,而单次调用成本约为后者的三百分之一。实验还发现简单集成无益:弱强搭配反而降低一致性,而三个强评判者在一致路由下可达kappa=0.79、自动覆盖率89.7%。该审计方法在域外应用时,将BIRD金融数据集专家编写的25.5%金标准SQL标记为潜在问题。

🔑 关键词速览

LLM-as-judge使用大型语言模型作为自动评判者来评估其他模型输出的方法。
Cohen's kappa衡量两名标注者之间一致性的统计指标,考虑了随机一致的可能性。
GRADE-HALLUCINATION本文提出的术语,指LLM评判者因评分等级幻觉而错误标记忠实案例的机制。
text-to-SQL将自然语言问题自动转换为SQL查询的任务。
BIRD-financial一个包含金融领域专家编写SQL查询的文本到SQL基准数据集。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅