🔥 今日值得一读 42个任务跑三遍,38%到74%答案不一致!智能体靠“习惯养成”实现456次全复现,省14%到56%令牌
Making Agents More Consistent: Skills Should Form Habits for Repeat Tasks
arXiv AI (cs.AI) 🔥 重点 Agent论文方法评估 🕐 今天 12:00

📖 AI 总结

这篇论文关注AI智能体在重复性任务中输出不一致的问题。作者对42项任务各执行三次,发现不同模型有38%至74%的结果彼此不一致,且95.3%至97.2%的生成内容被用于重复推导系统已知的计划,造成严重浪费。为此,作者提出“技能习惯形成”方法:智能体从自身执行历史中挖掘候选技能,以确定性脚本形式与原有推理路径竞争而非替换,并通过四级递进成本的门控机制筛选,核心门控以保留的参考轨迹为基准、按参考自身波动设定容差进行比对。在文本到SQL任务上,习惯化变体在全部456次重复调度中均能复现输出,且不劣于被替换的各推理分支(p<0.0001),token用量减少14%至56%,在7至53次复用后转为净收益。研究同时量化了代价:门控在2.6%的自然改写和26%的边界输入上错误放行,且多数失败无法被轨迹一致性门控识别;确定性错误会精确重复,坏习惯与好习惯同样可靠,这正是系统可审计性的代价。将路由与参数抽取分离后,端到端准确率从0.888提升至0.952,成本仅为原来的43%。

🔑 关键词速览

技能习惯形成 (Skill Habit Formation)一种让智能体从自身执行历史中挖掘确定性技能变体,并通过门控机制将其固化为可重复使用习惯的方法。
文本到SQL (Text-to-SQL)将自然语言问题转换为SQL查询语句的任务,常用于数据库交互和数据分析。
轨迹一致性门控 (Trace-Conformance Gate)一种验证候选技能执行轨迹是否与参考轨迹在容差范围内一致的机制,用于确保技能的正确性。
确定性变体 (Deterministic Variant)指智能体生成的、在相同输入下总是产生相同输出的技能版本,与依赖推理的随机性输出相对。
路由与参数提取分离 (Separating Routing from Parameter Extraction)将决定使用哪个技能(路由)与从输入中提取具体参数(参数提取)两个步骤分开处理,以提高准确性和效率。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅