🔥 今日值得一读 仅一个invoke原语,JAZ让LLM自己写代码实现记忆和自我改进!
Harness as a Language: A Minimalist Agent Framework With Maximal Expressivity
arXiv AI (cs.AI) 🔥 重点 Agent论文方法 🕐 09-24 12:00

📖 AI 总结

这篇论文提出了一种极简的智能体框架 JAZ,核心思想是将“智能体循环”本身视为一种语言原语。研究团队从第一性原理出发,设计了单一基于大模型的调用原语 invoke,其关键特性有两点:大模型可以编写包含递归 invoke 的任意可执行代码,且大模型可见的一切信息都是代码环境中的变量。为验证该设计的有效性,作者仅依靠提示、不使用任何手工设计的工具、外部记忆或文件系统,在传统上需要专门外部框架支持的工作流上进行了评测。结果显示,在需要超出上下文窗口记忆的长程任务中,JAZ invoke 在 StuLife 的记忆密集部分比 Letta(MemGPT)性能高 8%,成本仅为其一半;在持续自我改进任务上,JAZ invoke 在 AppWorld 上比 ACE 高 4% 且成本更低。该工作表明,一个几乎等同于智能体循环本身的最小化框架,即可在记忆与自我改进等场景中达到甚至超越专用系统的表现,为智能体框架的极简设计提供了新的理论视角与实证支持。

🔑 关键词速览

agent loop智能体循环,指LLM在环境中交替进行工具调用与观察输出的基本工作流程。
invokeJAZ框架中的核心语言原语,表示一个由LLM在运行时提供实现的函数调用。
harness执行框架,指围绕智能体循环构建的额外工程系统,如记忆或自我改进机制。
code-mode agent loop代码模式智能体循环,一种让LLM编写并执行代码来完成任务的智能体循环变体。
long-horizon workflows长时程工作流,指需要跨越较长交互历史、超出上下文窗口进行回忆的复杂任务流程。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅