该研究对基于LLM的自动文本评估系统(LLM-as-a-Judge)的可靠性提出质疑。作者通过三类实验揭示潜在问题:仅使用评分标准文本训练的分类器,在不接触任何待评内容的情况下,即可对裁判输出做出非平凡的预测,说明评分标准本身编码了可恢复的评估信号,分数可部分脱离模型输出被预判;此外,反事实扰动实验表明,当候选回答或评分标准被反转时,裁判往往无法可靠地更新其决策。这些发现表明,基于评分标准的LLM评估可能受“评分标准伪影”影响,其判断过程并非完全基于对回答内容的推理,从而对评估方法的有效性构成挑战。研究呼吁对LLM自动化评估方法进行更深入的审视与方法论改进。
| LLM-as-a-Judge | 一种使用大语言模型作为评审者来评估其他AI生成文本质量的方法。 |
| Rubric Artifacts | 评分标准文本中隐含的、与具体回答无关的评估偏差或信号,可能导致评分不公正。 |
| Counterfactual Perturbations | 通过反转或修改输入(如候选回答或评分标准)来测试模型决策是否合理改变的实验方法。 |
| Automated Text Generation Evaluation | 使用自动化方法(如LLM)对机器生成的文本进行质量评估的过程。 |
| Evaluative Signals | 评分标准中携带的、能影响最终评分但与被评内容无关的线索或信息。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅