该论文提出了一种名为“投机宏提交”(SMC)的运行时机制,旨在加速工具使用型大语言模型(LLM)代理的执行速度。传统代理在每次工具调用后需等待环境反馈,导致大量串行延迟。SMC采用双层代理架构:权威大模型负责生成官方轨迹,而快速的推测性小模型则在隔离环境中预执行未来动作链。系统通过从训练数据中挖掘重复的多步动作模式,建立宏库,并在运行时匹配预测动作。当权威模型的动作与预测一致时,SMC即可将预执行步骤及其观察结果直接提交至官方轨迹,从而跳过等待时间。实验表明,在τ²-Bench电信子集上,SMC相较顺序执行降低延迟18.59%,在AppWorld上降低44.9%,同时基本保持任务准确率。该方法为复用多步推测执行、减少代理延迟提供了实用方案。
| Speculative Macro Commit (SMC) | 一种运行时机制,通过重用多步动作链的推测执行结果来减少智能体延迟。 |
| two-tier agent system | 由大型权威模型和快速推测模型组成的双层智能体系统,分别负责生成官方轨迹和预测未来动作。 |
| macro library | 存储从训练轨迹中挖掘的重复多动作骨架的库,用于匹配和提交推测动作。 |
| speculative drafter model | 一个更快的模型,用于预测并预执行未来的动作链,以加速整体执行。 |
| wall-clock time | 实际经过的物理时间,包括推理、工具调用和观察等待等所有耗时。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅