本文提出 AIBuildAI-2.5,一个通过 LLM 智能体执行树搜索、自动构建 AI 模型的自主系统,旨在解决现有同类智能体在效率上的三个短板:候选程序执行预算有限导致奖励评分稀疏且噪声大、缺乏资源感知的训练任务调度、以及所有智能体调用依赖单一强模型造成推理成本过高。针对这些问题,系统引入 LLM 引导的树搜索机制,由评判模型从预期改进、依据充分性和可行性三个维度为候选程序打分,再由选择器结合搜索状态对候选池排序;同时配备感知硬件资源状态的调度器,以及将低成本模型分配给简单子任务、把最强模型保留给高难度环节的路由器。实验结果显示,AIBuildAI-2.5 在 MLE-Bench 上以 73.3% 的奖牌率位列第一,并在 AIRS-Bench 的六项自主 AI 研究任务上优于强基线,表明其在降低推理与训练成本的同时提升了自主模型开发的整体效率。
| LLM-guided tree search | 利用大语言模型对候选程序进行评分与排序,从而引导树搜索方向的方法。 |
| MLE-Bench | 一个用于评估自主智能体在真实机器学习工程任务上能力的基准测试集。 |
| AIRS-Bench | 一个包含多个自主AI研究任务的基准测试集,用于衡量智能体的科研自动化能力。 |
| medal rate | 在MLE-Bench中,智能体达到人类竞赛奖牌水平任务所占的百分比。 |
| resource-aware scheduler | 根据当前硬件资源状态来调度训练任务,以提高硬件利用率和训练效率的策略。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅