🔥 今日值得一读 标准评判者罚光100%正确答案!CARGO将判别指数从0拉到0.58,错误惩罚清零
CARGO: Context-Aware Retrieval-Gated Evaluation of Agentic AI in Production
arXiv CL (cs.CL) 🔥 重点 #Agent#评测基准#LLM-as-Judge 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
部署Agent系统的团队可用它做更公平的自动评测,避免因实体ID、日期不同而误判为幻觉。

📖 AI 总结

本文提出CARGO框架,用于评估生产环境中部署的智能体AI系统。作者指出,传统基于参考答案的LLM评判方式存在"参考实例偏差"问题:在动态实体(如工单、资产、账户)场景下,最接近的参考往往针对不同实体,导致字面比对将正确的标识符、日期和状态误判为错误或幻觉。CARGO将检索到的参考视为流程范例,把事实判断建立在当前实例的实时上下文之上,为每条断言赋予支持、矛盾、不可验证三种状态,仅惩罚矛盾项,并依据检索置信度对评估进行门控。在包含246个条目、两种评判模型、7872次判断的CARGO-Bench上,标准评判器对全部正确实体替换答案均判为错误,区分度指数接近于零;CARGO将误判降至零,同时保持近乎完整的矛盾召回率,区分度提升至0.58。研究还揭示了该设计的局限:保护实体值的宽松性会削弱对流程性错误的识别,事后修正与人工标注研究均显示同样的盲点。

🔑 关键词速览

Reference-Instance Divergence (RID)参考实例分歧,指参考示例与当前实例实体不同导致字面评判误判的失败模式。
LLM-as-a-judge使用大语言模型作为评判者来评估其他模型输出的方法。
CARGO上下文感知检索门控评估框架,将检索参考作为流程范例并基于实时上下文进行事实判断。
Selective Prediction选择性预测,模型在置信度低时拒绝预测,以提高整体可靠性。
Discrimination Index (DI)判别指数,衡量评估方法区分正确与错误答案能力的指标。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅