🔥 今日值得一读 BCO把Agent隐性直觉写成世界模型,5大基准训练通过率全面碾压对照组!
Belief-Calibrated Optimization: An Explicit World Model for Agentic Optimization
arXiv AI (cs.AI) 🔥 重点 #Agent#世界模型#优化方法 🕐 09-03 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可用此方法显式建模环境响应信念,提升LLM代理在复杂任务中的迭代优化效率。

📖 AI 总结

本文提出了一种名为信念校准优化(BCO)的方法,旨在提升大型语言模型智能体的性能。该方法的核心创新在于将智能体优化过程中隐含的“信念”——即对环境如何响应编辑的假设——显式地记录为一份持续更新的上下文文档,并以此构建一个可用的世界模型。在标准优化循环中加入该文档后,BCO在五个基准测试(涵盖记忆问答、工具使用、代码执行应用智能体和终端智能体)中均取得了比对照组更高的训练通过率,且在未用于候选选择的保留集上优势依然存在。此外,在替换目标模型后,BCO脚手架在多数任务上仍表现领先,但受限于上下文窗口溢出。离线消融实验进一步证实,文档内容本身携带可复用的预测信息,而非仅凭形式起作用,表明显式信念记录能有效提升智能体优化的泛化能力与鲁棒性。

🔑 关键词速览

Belief-Calibrated Optimization (BCO)一种优化方法,将代理对环境响应的信念显式写为持久文档并持续修订,形成世界模型。
world model对环境如何响应编辑的当前描述,用于指导代理的决策。
scaffold围绕冻结模型构建的外部框架,如提示、工具或循环逻辑,用于提升代理性能。
coding agent一种能够读取代码、执行编辑并生成新候选的LLM代理,常用于优化任务。
train passrate在训练或开发集上,代理成功完成任务的比例,用于衡量优化效果。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅