本文提出了一种名为信念校准优化(BCO)的方法,旨在提升大型语言模型智能体的性能。该方法的核心创新在于将智能体优化过程中隐含的“信念”——即对环境如何响应编辑的假设——显式地记录为一份持续更新的上下文文档,并以此构建一个可用的世界模型。在标准优化循环中加入该文档后,BCO在五个基准测试(涵盖记忆问答、工具使用、代码执行应用智能体和终端智能体)中均取得了比对照组更高的训练通过率,且在未用于候选选择的保留集上优势依然存在。此外,在替换目标模型后,BCO脚手架在多数任务上仍表现领先,但受限于上下文窗口溢出。离线消融实验进一步证实,文档内容本身携带可复用的预测信息,而非仅凭形式起作用,表明显式信念记录能有效提升智能体优化的泛化能力与鲁棒性。
| Belief-Calibrated Optimization (BCO) | 一种优化方法,将代理对环境响应的信念显式写为持久文档并持续修订,形成世界模型。 |
| world model | 对环境如何响应编辑的当前描述,用于指导代理的决策。 |
| scaffold | 围绕冻结模型构建的外部框架,如提示、工具或循环逻辑,用于提升代理性能。 |
| coding agent | 一种能够读取代码、执行编辑并生成新候选的LLM代理,常用于优化任务。 |
| train passrate | 在训练或开发集上,代理成功完成任务的比例,用于衡量优化效果。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅