本文提出 ContractEval,一个面向程序性指令遵循的诊断框架,旨在解决 LLM 智能体执行流程时“结果看似合理、过程却已违规”的隐性失败问题。作者将程序性指令建模为随查询激活的“义务”,再与响应或执行轨迹证据进行匹配,从而把遗漏步骤、分支错误、顺序错误、多余动作、不变量违背和输出契约违规等区分为不同类型的合规失败。在受控审计测试集上,仅看输出和看轨迹的 LLM 评判器会漏掉大量注入的结构性失败,而在给定标准期望图与观测图时,ContractEval 能全部检出并定位。基于 LLM 的抽取虽能保留大部分信号,但对校准较为敏感。该工作使程序合规性变得可审计,而非隐含于最终答案质量之中,但作者强调它并非合规性保证。
| ContractEval | 一个诊断框架,用于将程序性指令表示为查询活跃义务,并与响应或轨迹证据匹配以检测符合性失败。 |
| 查询活跃义务 | 针对特定查询,程序性指令中需要被满足的活跃条件或要求。 |
| 程序性符合性 | 系统执行过程与给定程序性指令要求的一致程度。 |
| 轨迹感知评判 | 一种评估方法,通过分析系统执行轨迹(而不仅仅是最终输出)来评判其行为。 |
| 输出契约违反 | 系统输出不符合预定义输出契约(如格式、内容约束)的情况。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅