实测500个编码任务:第一块响应没黄金项,AI照样能搞定!
Agents Don't Paginate: First-Chunk Selection for LLM Tool Responses
arXiv CL (cs.CL) 重要 Agent工具使用论文方法 🕐 08-28 12:00

📖 AI 总结

这篇论文研究了大语言模型编程代理(如 Claude Code、Cursor 等)在处理超长工具响应时的行为。作者发现,尽管所有协议都支持分页,但在公开的 MCP 中间件会话日志中,没有任何代理主动请求第二页内容——代理只读取首个数据块。研究将首块选择视为 0/1 背包问题,在 500 个 SWE-bench 任务上比较了六种价值函数,并通过 4,800 次 LLM 调用进行单轮文件定位测试。核心发现是两项预注册假设均不成立:第一,提高首块中目标项的排名(precision-at-1)并不会系统性地提升下游准确率,各模型差异不超过 3 个百分点且方向不一致;第二,向关键词评分器添加文件元数据反而使 p₁ 下降 4.8 个百分点。虽然无参数关键词评分器能将 p₁ 从 24.2% 提升至 35.0%,但这一排名提升并未转化为实际任务准确率的改善,因为代理能从首块任意位置恢复所需信息。

🔑 关键词速览

第一块选择 (First-Chunk Selection)从工具响应中仅选择第一块内容作为代理输入的过程,而非使用分页获取后续块。
精度@1 (Precision-at-1, $p_1$)衡量黄金项(代理所需项)被放在第一块中的频率的指标。
0/1背包问题 (0/1 Knapsack)一种组合优化问题,用于在给定容量限制下选择物品以最大化价值,此处用于模拟第一块选择。
SWE-bench Verified一个用于评估编码代理在真实软件工程任务上性能的基准数据集。
模型上下文协议 (Model Context Protocol, MCP)一种标准化协议,用于在LLM代理和外部工具之间传递上下文信息。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅