🔥 今日值得一读 同模型实测256个私有任务,原生框架竟无优势,差距仅1个百分点!
Harness or Model? Isolating the Harness Effect in Agentic Coding with a Contamination-Controlled Private Suite
arXiv AI (cs.AI) 🔥 重点 #Agent#评测基准#代码生成 🕐 09-14 12:00
👨‍💼 主理人解读 · 为什么值得关注
帮开发者判断编码Agent提升来自模型还是harness,指导选型与自建工具链。

📖 AI 总结

这项研究探讨了一个被广泛假设但缺乏验证的问题:厂商原生搭配的智能体编程框架(harness)是否真的比中立框架更能解决任务。作者在一个包含256个仓库任务和后训练截止期竞赛任务的私有、抗污染测试集上,对同一模型搭配不同框架进行了配对对比。结果显示,无论是Claude Opus 4.8还是GPT-5.5,原生框架与中立框架之间都没有显著的平均优势,差异分别仅为-1.25和+1.25个百分点。但Opus的平均值掩盖了分层间的相反表现:原生框架在仓库任务上落后9.0个百分点,却在竞赛任务上领先23.7个百分点。研究还发现正确性与完成度可以分离,部分在时限内被取消的运行实际上已产出可通过的补丁。成本方面,中立框架在Opus上每解决一个任务的费用是原生框架的1.3至1.6倍,但计费顺序因用量记录缺失而无法确定。作者发布了编排器、评分预言机及分析代码,任务集保持私有。

🔑 关键词速览

Harness执行框架,指将语言模型转化为自主智能体的工具、提示和控制流集合。
Agentic Coding智能体编码,指利用自主智能体系统完成软件工程任务(如代码生成、调试)的范式。
Contamination-Controlled污染控制,指确保评估任务未出现在模型训练数据中,以避免数据泄露影响结果。
Task-Bootstrap CI任务自举置信区间,一种通过重采样任务估计统计不确定性的方法。
Label-Permutation p-value标签置换p值,通过随机置换标签计算得到的显著性检验值,用于评估分层差异是否偶然。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅