实测AI编程代理翻车实录:5个隐藏缺陷全曝光,检索召回率最高竟差31%!
When Agents Implement Systems: A Case Study in Defects, Detection, and Evaluation Rigor
arXiv AI (cs.AI) 重要 #Agent#代码生成#评测 🕐 09-03 12:00

📖 AI 总结

这篇论文通过案例研究考察了LLM编码智能体在端到端系统实现中的表现,聚焦于其处理系统级需求(如模式设计、异步编排、配置正确性及检索过滤权衡)的能力。研究固定了存储技术、模式、实体解析算法等前提,仅赋予智能体实现自主权,并在单次会话中记录了五类缺陷及其检测方式。在HotpotQA基准上的评估显示,将候选集限制在实体集合内的过滤式检索在预算为3时即达上限,而不过滤的搜索在预算为10时仅恢复69%的必要证据,差距显著(符号检验p<0.0001)。文章还讨论了智能体自主性的成功与需人工纠正之处,包括一次性能修复未在回归测试中复测的情况,凸显了评估严谨性的重要性。

🔑 关键词速览

LLM coding agents基于大型语言模型的编码代理,能自主执行编程任务。
entity-resolution algorithm实体解析算法,用于识别不同数据源中指向同一实体的记录。
retrieval-filtering strategy检索过滤策略,决定在信息检索中如何限制候选集以提高效率或准确性。
HotpotQA benchmark一个公开的问答基准数据集,用于评估多跳推理和信息检索性能。
gold evidence labels黄金证据标签,指数据集中人工标注的正确答案或支持证据。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅