本文针对大语言模型在长程工具调用任务中的信用分配难题展开研究。作者指出,最终结果奖励难以为长交互轨迹提供有效反馈,而步骤级奖励通常依赖人工或模型判断、或额外推演来估计中间决策的下游影响,成本较高。为此,论文提出工具使用智能体的比较推理方法CITA,其核心是训练一个比较推理模型CIM,通过融合观测到的工具行为、基于贝叶斯工具图模拟器的可扩展监督信号以及大语言模型的语义比较判断,学习在当前上下文下评估候选下一步工具调用支持最终任务成功的可能性。在三个工具使用基准和多个基座模型上,CITA均稳定提升了工具F1与任务成功率,分析进一步表明CIM能够学到准确的步骤级价值估计。该工作为长程工具使用智能体在执行前进行候选动作比较评估提供了可行路径。
| 长时程工具使用 | 指智能体通过多步工具调用序列完成复杂任务,每一步都可能改变状态并影响后续决策。 |
| 信用分配 | 在强化学习中,将最终结果奖励归因到序列中各个中间动作的过程。 |
| 步骤级奖励 | 针对序列中每个中间步骤提供的反馈信号,比最终结果奖励更细粒度。 |
| 比较推理模型(CIM) | CITA 中训练的模型,用于估计同一上下文下不同下一步工具调用的相对价值。 |
| 贝叶斯工具图模拟器 | 一种基于贝叶斯网络和工具调用图结构的模拟器,用于生成可扩展的监督信号。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅