这篇论文提出了一种极简的智能体框架 JAZ,核心思想是将“智能体循环”本身视为一种语言原语。研究团队从第一性原理出发,设计了单一基于大模型的调用原语 invoke,其关键特性有两点:大模型可以编写包含递归 invoke 的任意可执行代码,且大模型可见的一切信息都是代码环境中的变量。为验证该设计的有效性,作者仅依靠提示、不使用任何手工设计的工具、外部记忆或文件系统,在传统上需要专门外部框架支持的工作流上进行了评测。结果显示,在需要超出上下文窗口记忆的长程任务中,JAZ invoke 在 StuLife 的记忆密集部分比 Letta(MemGPT)性能高 8%,成本仅为其一半;在持续自我改进任务上,JAZ invoke 在 AppWorld 上比 ACE 高 4% 且成本更低。该工作表明,一个几乎等同于智能体循环本身的最小化框架,即可在记忆与自我改进等场景中达到甚至超越专用系统的表现,为智能体框架的极简设计提供了新的理论视角与实证支持。
| agent loop | 智能体循环,指LLM在环境中交替进行工具调用与观察输出的基本工作流程。 |
| invoke | JAZ框架中的核心语言原语,表示一个由LLM在运行时提供实现的函数调用。 |
| harness | 执行框架,指围绕智能体循环构建的额外工程系统,如记忆或自我改进机制。 |
| code-mode agent loop | 代码模式智能体循环,一种让LLM编写并执行代码来完成任务的智能体循环变体。 |
| long-horizon workflows | 长时程工作流,指需要跨越较长交互历史、超出上下文窗口进行回忆的复杂任务流程。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅