重复执行竟贡献2.16%假性提升!386任务揭穿LLM框架特化幻觉
More Programs or More Rolls? Separating Coverage from Specialization in LLM Harnesses
arXiv AI (cs.AI) 重要 论文方法Agent大模型 🕐 今天 12:00

📖 AI 总结

这篇论文研究如何区分大语言模型执行框架(harness)带来的真实任务专精化收益与单纯重复执行带来的答案覆盖率提升。作者在386个MATH-500任务上,对比八个自动生成的框架与九个字节完全相同的基线副本,每个成员执行三次。结果显示,完全相同的程序本身就能带来2.16个百分点的重复平均oracle余量;生成程序虽表现出更强的可重复得分模式,但这些模式主要反映持续存在的弱点——在100个任务上相对基线的劣势在三次重复中始终存在,而持续获胜仅出现在一个任务上且对答案抽取方式敏感。冻结选择器带来的增益为0.00个百分点,两类程序在27次执行时均达到98.70%的oracle覆盖率。研究表明,仅凭覆盖率和可重复性无法支撑“有用专精化”的结论,并据此提出框架多样性的评估标准:任务优势应跨执行持续存在、能指导可用决策,并在匹配推理预算下优于额外的固定程序执行。

🔑 关键词速览

LLM harness为大型语言模型设计的执行框架或包装器,用于组织推理步骤、调用工具或管理输出,以实现任务特化。
answer coverage指在多次执行中,系统能够正确回答的任务比例或范围,反映答案的覆盖程度。
oracle headroom在理想选择(如事后选择最佳执行结果)下,系统性能相对于当前平均性能的提升空间。
repeatable task advantages指在多次重复执行中,某个程序或方法相对于基线持续表现出的任务性能优势。
BIRD traces一种用于调试和分析程序执行过程的轨迹记录,此处指用于定位失败原因的执行日志。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅