这项研究探讨了一个被广泛假设但缺乏验证的问题:厂商原生搭配的智能体编程框架(harness)是否真的比中立框架更能解决任务。作者在一个包含256个仓库任务和后训练截止期竞赛任务的私有、抗污染测试集上,对同一模型搭配不同框架进行了配对对比。结果显示,无论是Claude Opus 4.8还是GPT-5.5,原生框架与中立框架之间都没有显著的平均优势,差异分别仅为-1.25和+1.25个百分点。但Opus的平均值掩盖了分层间的相反表现:原生框架在仓库任务上落后9.0个百分点,却在竞赛任务上领先23.7个百分点。研究还发现正确性与完成度可以分离,部分在时限内被取消的运行实际上已产出可通过的补丁。成本方面,中立框架在Opus上每解决一个任务的费用是原生框架的1.3至1.6倍,但计费顺序因用量记录缺失而无法确定。作者发布了编排器、评分预言机及分析代码,任务集保持私有。
| Harness | 执行框架,指将语言模型转化为自主智能体的工具、提示和控制流集合。 |
| Agentic Coding | 智能体编码,指利用自主智能体系统完成软件工程任务(如代码生成、调试)的范式。 |
| Contamination-Controlled | 污染控制,指确保评估任务未出现在模型训练数据中,以避免数据泄露影响结果。 |
| Task-Bootstrap CI | 任务自举置信区间,一种通过重采样任务估计统计不确定性的方法。 |
| Label-Permutation p-value | 标签置换p值,通过随机置换标签计算得到的显著性检验值,用于评估分层差异是否偶然。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅