本文提出CARGO框架,用于评估生产环境中部署的智能体AI系统。作者指出,传统基于参考答案的LLM评判方式存在"参考实例偏差"问题:在动态实体(如工单、资产、账户)场景下,最接近的参考往往针对不同实体,导致字面比对将正确的标识符、日期和状态误判为错误或幻觉。CARGO将检索到的参考视为流程范例,把事实判断建立在当前实例的实时上下文之上,为每条断言赋予支持、矛盾、不可验证三种状态,仅惩罚矛盾项,并依据检索置信度对评估进行门控。在包含246个条目、两种评判模型、7872次判断的CARGO-Bench上,标准评判器对全部正确实体替换答案均判为错误,区分度指数接近于零;CARGO将误判降至零,同时保持近乎完整的矛盾召回率,区分度提升至0.58。研究还揭示了该设计的局限:保护实体值的宽松性会削弱对流程性错误的识别,事后修正与人工标注研究均显示同样的盲点。
| Reference-Instance Divergence (RID) | 参考实例分歧,指参考示例与当前实例实体不同导致字面评判误判的失败模式。 |
| LLM-as-a-judge | 使用大语言模型作为评判者来评估其他模型输出的方法。 |
| CARGO | 上下文感知检索门控评估框架,将检索参考作为流程范例并基于实时上下文进行事实判断。 |
| Selective Prediction | 选择性预测,模型在置信度低时拒绝预测,以提高整体可靠性。 |
| Discrimination Index (DI) | 判别指数,衡量评估方法区分正确与错误答案能力的指标。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅