🔥 今日值得一读 gpt-oss-120b用196次工具调用算完MD5,全程零错位!
Long-Horizon State Tracking in LLMs: Executing MD5 through a Deep Sequence of Dependent Tool Calls
arXiv AI (cs.AI) 🔥 重点 大模型Agent论文方法 🕐 09-02 12:00

📖 AI 总结

该研究针对大语言模型在长时程任务中状态追踪能力的评估空白,设计了一个纯净的测试环境:让模型逐步执行MD5哈希计算,涉及196次依赖工具调用和64轮状态传递。实验发现,gpt-oss-120b模型在温度为零且使用简短固定提示的条件下,能够在多数完整运行中准确携带全部状态并输出正确摘要。研究进一步将工具替换为另一个LLM,实现完全无精确算术预言机的多智能体协作计算。关键成功因素包括保留模型自身推理上下文,以及对具备思考能力的工人模型进行投票以消除模运算错误。该工作通过分离状态保持、算术计算和服务层面的失败来源,为理解LLM在长序列依赖任务中的能力边界提供了方法论贡献。

🔑 关键词速览

Long-horizon tasks长视野任务,指需要多步依赖操作且步骤间存在长期依赖的复杂任务。
State tracking状态跟踪,指在任务执行过程中持续维护和更新中间状态的能力。
MD5一种广泛使用的密码学哈希函数,产生128位摘要,此处用于测试精确状态跟踪。
Mixture-of-experts (MoE)混合专家模型,一种通过稀疏激活部分参数来提升效率的模型架构。
Tool calls工具调用,指模型在推理过程中调用外部函数或API的操作。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅