LLM评判器审计神器MAWILE:四层敏感性检测,无需黄金标签!
MAWILE: Multi-Axis Workbench for Inspecting LLM Evaluators
arXiv AI (cs.AI) 重要 大模型安全对齐论文方法 🕐 09-22 12:00

📖 AI 总结

大型语言模型作为评判者(LLM judge)为模型与智能体输出的评估提供了灵活且可扩展的方案,但其判定结果容易受到被评回复、评判指令和评分标准中细微变化的影响。现有系统虽能覆盖部分失效模式,却难以对已配置的评判器进行全面审计。为此,作者提出MAWILE——一个面向开发者的工作台,从评判提示、评判标准、目标系统输入和目标系统输出四个维度审计评判器的敏感性。给定用户提供的评判器和代表性评估样本,MAWILE会构造并验证受控扰动,重新执行评判,并定位由此产生的敏感性。每个扰动都预先声明判定应保持不变还是朝特定方向变化,从而使同一系统既能衡量对无关变化的鲁棒性,也能衡量对有意义变化的敏感性。该工具支持二元、序数和成对评判,且无需金标准标签,为LLM评估器的可靠性审查提供了系统化手段。

🔑 关键词速览

LLM judge使用大型语言模型对模型或智能体输出进行自动评估的评判器。
MAWILE本文提出的面向开发者的工作台,用于在多个层面审计 LLM 评判器的敏感性。
controlled perturbation在保持语义或按预期方向改变的前提下,对输入、提示、标准或输出进行的有控制的修改。
judge sensitivity评判器判定结果对无关变化或有意义变化的敏感程度。
gold labels人工标注的、作为评估基准的标准答案标签。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅