长周期任务中,智能体常因上下文溢出和目标丢失而失效,扩大上下文窗口并非有效解法。Chroma对18个大模型的评测显示,输入越长性能越不稳定;Manus的数据表明典型任务约需50次工具调用,输入输出token比接近100:1,原始指令逐渐漂移到召回率下降的窗口中部,目标丢失成为必然结果。文章指出,真正的修复层是管理模型之外一切的harness,并剖析了四种机制:上下文预算与卸载、压缩、记忆策略和待办状态。通过对比LangChain Deep Agents、Claude Code、Manus、OpenAI Codex和Amazon Bedrock AgentCore的具体实现与阈值,说明这些机制如何将浅层循环转化为深层智能体,为长周期任务提供可落地的工程路径。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅