本文对面向LLM智能体框架的System-1决策模型进行了配对且自我审计的评估。研究选取开源模型Laya与托管模型Jev,在由18个公开来源构建的11个智能体决策点上测试,包含7283个基础案例和6640个鲁棒性变体,采用字节级相同输入、配对检验及跨硬件跨日期复现验证。结果显示,Jev在11个决策点中的9个上显著更准确,领先10.8至46.0个百分点;两模型在零样本模型路由上均未超过随机水平,在RAG相关性门控上持平。Laya在选项顺序反转时改变30%的答案,且随候选数量增多或相似度提高而急剧退化。作者还审计了自身流程,发现三处分析错误和一处设计混淆导致部署收益被高估,例如预筛选成本遗漏使实际节省从23.9%降至4.3%。该研究强调,System-1模型虽具成本与延迟优势,但其可靠性证据仍需更严谨的评估支撑。
| System-1 决策模型 | 指通过单次前向传播快速输出类别概率的轻量模型,用于替代 LLM 调用以节省成本和延迟。 |
| Agent Harness | 指围绕 LLM 构建的代理框架,负责任务分解、工具调用、模型选择等决策流程。 |
| 配对评估 | 一种实验设计,对同一输入比较两个模型或方法的输出,以控制变量并提高统计效力。 |
| RAG 相关性门控 | 在检索增强生成中,判断检索到的文本是否与当前查询相关的决策步骤。 |
| 注入假阳性 | 指错误地将正常输入判定为提示注入攻击的情况。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅