本文提出 TomasuLLM,一种面向 LLM 智能体的乱序推测执行运行时,旨在解决长耗时工具调用(如编译器、测试套件、仓库命令)导致的智能体空转与延迟问题。其核心思路借鉴乱序处理器:在保持任务执行正确性的前提下,提前推测并执行未来动作,将其放入隔离的写时复制沙箱中运行,追踪依赖与副作用,仅在通过已提交状态验证后,才按轨迹顺序提交结果。在三个覆盖亚秒级到分钟级工具调用的基准上,TomasuLLM 均提升了报告均值,且收益随工具延迟增长:SWE-bench Verified 100 项任务提速 1.31 倍,Terminal-Bench 2.0 的 28 项任务提速 1.35 倍,SWE-Marathon 的 18 个会话在匹配进度下提速 1.27 倍。在 4010 条审计的提交验证记录中,未出现任何误接受。该工作表明,推测执行与严格验证相结合,可在不牺牲正确性的前提下显著缓解智能体因工具等待造成的效率损失。
| TomasuLLM | 一种面向 LLM 智能体的运行时系统,通过乱序推测执行工具调用来降低延迟。 |
| Out-of-Order Speculative Execution | 借鉴处理器乱序执行思想,提前推测并执行未来工具调用,再按原顺序验证提交。 |
| Copy-on-Write Sandbox | 一种隔离执行环境,利用写时复制机制安全地运行推测性工具调用而不影响已提交状态。 |
| Commit Validation | 在按轨迹顺序提交推测结果前,对照已提交状态进行验证以确保正确性的过程。 |
| SWE-bench Verified | 一个用于评估编码智能体在真实软件工程任务上表现的基准测试集。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅