字节跳动Seed联合新加坡科技设计大学、佐治亚理工等机构提出HarnessDev,将评估对象从模型给出的答案转向模型自行编写的可运行智能体框架(harness)。研究设置Creation与Evolution两个阶段:前者让模型从仅含基础文件、搜索、进程原语的弱种子出发,为四个领域、五个基准共2207个实例构建完整框架;后者基于100个SWE-bench Pro任务和89个Terminal-Bench 2.1任务的执行反馈迭代改进,并在630个从未见过的SWE-Pro实例上检验泛化。测试涵盖Opus 4.8、GPT-5.5、Gemini 3.1 Pro等六款模型,按任务成功率与执行器token效率双重评分。核心发现是64项改动中仅34项能泛化到隐藏任务,说明模型虽能生成可用框架,但多数优化依赖特定任务,难以稳定迁移,凸显当前LLM自主工程能力的泛化瓶颈。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅