LLM流程漏检全失灵?ContractEval精准揪出所有隐藏失败!
ContractEval: Query-Conditioned Execution Matching for Procedural Instruction Conformance
arXiv AI (cs.AI) 重要 Agent评测基准论文方法 🕐 09-10 12:00

📖 AI 总结

本文提出 ContractEval,一个面向程序性指令遵循的诊断框架,旨在解决 LLM 智能体执行流程时“结果看似合理、过程却已违规”的隐性失败问题。作者将程序性指令建模为随查询激活的“义务”,再与响应或执行轨迹证据进行匹配,从而把遗漏步骤、分支错误、顺序错误、多余动作、不变量违背和输出契约违规等区分为不同类型的合规失败。在受控审计测试集上,仅看输出和看轨迹的 LLM 评判器会漏掉大量注入的结构性失败,而在给定标准期望图与观测图时,ContractEval 能全部检出并定位。基于 LLM 的抽取虽能保留大部分信号,但对校准较为敏感。该工作使程序合规性变得可审计,而非隐含于最终答案质量之中,但作者强调它并非合规性保证。

🔑 关键词速览

ContractEval一个诊断框架,用于将程序性指令表示为查询活跃义务,并与响应或轨迹证据匹配以检测符合性失败。
查询活跃义务针对特定查询,程序性指令中需要被满足的活跃条件或要求。
程序性符合性系统执行过程与给定程序性指令要求的一致程度。
轨迹感知评判一种评估方法,通过分析系统执行轨迹(而不仅仅是最终输出)来评判其行为。
输出契约违反系统输出不符合预定义输出契约(如格式、内容约束)的情况。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅