针对大规模异构API生态中LLM智能体工具检索的效率与精度权衡问题,本文提出Lookahead-R框架,将工具检索重构为资源受限的序贯决策问题。其核心是引入轻量级执行感知代理世界模型,在不调用真实API的前提下联合预测工具执行成功率、延迟成本与语义效用,并驱动成本敏感、不确定性引导的蒙特卡洛树搜索,在严格预算约束下完成工具空间导航。在ToolBench基准测试中,该方法在所有场景下均取得更优的精度-效率权衡;在最难的I3划分上,NDCG@5达91.40%,较当前最优的ToolGen(90.16%)提升1.24%。消融实验表明,显式延迟建模是资源约束下识别高质量工具的关键判别信号。该工作为预算受限条件下的工具检索提供了新的规划式解决思路。
| Lookahead-R | 一种基于规划的预算感知工具检索框架,将检索建模为资源受限的序列决策问题。 |
| 语义-功能鸿沟 | 指工具的自然语言描述与其实际执行功能之间的不一致,导致语义检索不准确。 |
| 代理世界模型 | 一种轻量级模型,无需调用真实API即可预测工具执行的成功率、延迟和语义效用。 |
| 蒙特卡洛树搜索 | 一种启发式搜索算法,通过随机模拟评估决策路径,用于在预算约束下探索工具空间。 |
| NDCG@5 | 归一化折损累计增益,评估前5个检索结果排序质量的指标,值越高表示排序越优。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅