大型语言模型作为评判者(LLM judge)为模型与智能体输出的评估提供了灵活且可扩展的方案,但其判定结果容易受到被评回复、评判指令和评分标准中细微变化的影响。现有系统虽能覆盖部分失效模式,却难以对已配置的评判器进行全面审计。为此,作者提出MAWILE——一个面向开发者的工作台,从评判提示、评判标准、目标系统输入和目标系统输出四个维度审计评判器的敏感性。给定用户提供的评判器和代表性评估样本,MAWILE会构造并验证受控扰动,重新执行评判,并定位由此产生的敏感性。每个扰动都预先声明判定应保持不变还是朝特定方向变化,从而使同一系统既能衡量对无关变化的鲁棒性,也能衡量对有意义变化的敏感性。该工具支持二元、序数和成对评判,且无需金标准标签,为LLM评估器的可靠性审查提供了系统化手段。
| LLM judge | 使用大型语言模型对模型或智能体输出进行自动评估的评判器。 |
| MAWILE | 本文提出的面向开发者的工作台,用于在多个层面审计 LLM 评判器的敏感性。 |
| controlled perturbation | 在保持语义或按预期方向改变的前提下,对输入、提示、标准或输出进行的有控制的修改。 |
| judge sensitivity | 评判器判定结果对无关变化或有意义变化的敏感程度。 |
| gold labels | 人工标注的、作为评估基准的标准答案标签。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅