🔥 今日值得一读 上下文压缩省钱是假象!实测6轮后成本反超固定过滤
An Empirical Cost Attribution of Context-Compression Gateways in Multi-Turn Coding Agents
arXiv CL (cs.CL) 🔥 重点 Agent推理加速商业化 🕐 今天 12:00

📖 AI 总结

本文在多轮编程智能体的真实生产环境中,对上下文压缩网关(Paritok)进行了成本归因分析,将token开销拆解为工具模式过滤、文件读取与工具输出的内容压缩、历史摘要三个独立杠杆,并在受控A/B实验中分别测量其效果。研究发现三者的节省机制截然不同:工具模式过滤每轮移除固定token块(约21K至57K),随轮数线性增长,是唯一稳定可靠的节省来源;内容压缩每轮仅节省约2%的缓存计价前缀,但压缩后的读取内容会累积进历史并在后续每轮重复发送,因此其累计节省呈二次增长(实测约3350×N²),约6轮后即超过工具过滤的固定节省,直至受上下文窗口上限约束。非破坏性网关允许智能体按需取回原始内容,每次召回仅重发刚被压缩的那一段,成本固定且有界,不会成倍放大。作者强调,单次压缩基准的高分(如25.7%压缩率下保留86.5%的SWE-bench质量)与多轮智能体成本无关,不能作为节省成本的论据。

🔑 关键词速览

上下文压缩减少输入LLM的token数量以降低计算成本的技术,通常通过摘要或过滤实现。
多轮编码代理在多次交互中协助编程任务的AI代理,如Claude Code和Codex,能读写文件并执行命令。
工具模式过滤每轮移除固定工具定义块以节省token的方法,节省量随轮数线性增长。
内容压缩压缩文件读取和工具输出内容以减少token,但压缩内容会累积在历史中导致二次增长。
非破坏性网关允许代理按需召回原始未压缩数据的压缩网关,召回成本固定且有界。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅