本研究考察了“起草—验证—修订”这一常见大模型编排流程中一个被忽视的风险:当上下文在多个阶段间传递时,像“previous”这类依赖语境的指示性表达,可能在不同阶段被模型赋予不同指代,即发生指示性漂移。作者构建了包含10个基础样例、每个样例三种条件的合成数据集,控制共享成分不变,仅改变起草阶段与验证阶段模型是否解析正确,以及修订阶段模型需要多少独立推理才能判断正误。研究测试了来自三家提供商的六款模型、共21种推理强度配置,并采用e值进行序贯检验,同时设置消融实验去除验证反馈中的错误分类标签,另用独立模型分析修订阶段的错误理由。结果显示,平衡准确率跨度极大,从低于随机的0.156到接近完美;GPT-5.2在无推理时为0.156,最高推理强度下升至0.942,而Gemini 3 Pro在所有强度下均保持0.94以上,且其低推理强度即以约5%的单次成本超过GPT-5.2的最高强度。当修订模型出错时,往往依赖表面线索而非可操作的推理。研究提示,构建此类流水线的工程师需警惕指示性漂移,并在每个阶段明确预期指代对象。
| Draft-Verify-Revise Pipeline | 一种LLM编排模式,由起草、验证和修订三个阶段组成,通过多模型协作提升输出质量。 |
| Deictic Shift | 指示性转移,指上下文依赖表达(如“previous”)在不同阶段所指对象发生变化的现象。 |
| Balanced Accuracy | 平衡准确率,灵敏度和特异度的未加权平均值,用于评估分类器在不平衡数据上的性能。 |
| E-values | e值,一种用于序贯检验的统计量,允许在数据累积过程中进行假设检验。 |
| Meta-evaluator | 元评估者,在草稿-验证-修订流水线中负责修订阶段并判断哪种解读正确的LLM。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅