🔥 今日值得一读 System-1决策模型实测:9/11任务碾压LLM,成本直降!
Fast Models, Slow Evidence: A Paired and Self-Audited Evaluation of System-1 Decision Models for LLM Agent Harnesses
arXiv AI (cs.AI) 🔥 重点 #Agent#评测基准#推理优化 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
帮你判断能否用小模型替代LLM调用做Agent决策,附11个决策点的可靠性数据,降低延迟成本。

📖 AI 总结

本文对面向LLM智能体框架的System-1决策模型进行了配对且自我审计的评估。研究选取开源模型Laya与托管模型Jev,在由18个公开来源构建的11个智能体决策点上测试,包含7283个基础案例和6640个鲁棒性变体,采用字节级相同输入、配对检验及跨硬件跨日期复现验证。结果显示,Jev在11个决策点中的9个上显著更准确,领先10.8至46.0个百分点;两模型在零样本模型路由上均未超过随机水平,在RAG相关性门控上持平。Laya在选项顺序反转时改变30%的答案,且随候选数量增多或相似度提高而急剧退化。作者还审计了自身流程,发现三处分析错误和一处设计混淆导致部署收益被高估,例如预筛选成本遗漏使实际节省从23.9%降至4.3%。该研究强调,System-1模型虽具成本与延迟优势,但其可靠性证据仍需更严谨的评估支撑。

🔑 关键词速览

System-1 决策模型指通过单次前向传播快速输出类别概率的轻量模型,用于替代 LLM 调用以节省成本和延迟。
Agent Harness指围绕 LLM 构建的代理框架,负责任务分解、工具调用、模型选择等决策流程。
配对评估一种实验设计,对同一输入比较两个模型或方法的输出,以控制变量并提高统计效力。
RAG 相关性门控在检索增强生成中,判断检索到的文本是否与当前查询相关的决策步骤。
注入假阳性指错误地将正常输入判定为提示注入攻击的情况。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅