本文提出 AdaEva,一种面向大语言模型驱动算法设计(LLM4AD)的自适应部分评估框架,旨在解决候选算法评估成本过高的问题。其核心思路是:既然候选算法通常在一组共享训练实例上聚合性能来评判,就不必对每个候选都跑完全部实例,而可逐步扩大评估子集并及早淘汰表现不佳者。AdaEva 作为即插即用模块,不改变原有 LLM4AD 流程与单实例评估器,也无需预先了解实例难度,并具体实现了逐次减半(AdaEva-S)与统计竞赛(AdaEva-R)两种机制。作者在三个代表性 LLM4AD 框架、多种 LLM 主干及组合与连续黑箱优化任务上验证,结果显示在相同评估预算下,AdaEva 比固定部分评估策略更可靠地分配评估资源,带来更强的搜索效率、随时性能与留出泛化能力。
| LLM4AD | LLM驱动的自动化算法设计,指利用大型语言模型自动生成和优化算法。 |
| AdaEva | 一种自适应部分评估框架,通过逐步扩大评估子集并淘汰劣质候选来降低计算成本。 |
| Successive Halving | 逐次减半策略,一种通过多轮评估逐步淘汰表现较差的候选,将资源集中在有潜力的候选上的方法。 |
| Statistical Racing | 统计竞赛方法,利用统计检验在评估过程中提前终止明显较差的候选,以节省计算资源。 |
| Black-box Optimization | 黑盒优化,指在无法获得目标函数梯度或解析形式的情况下,仅通过函数评估来寻找最优解的优化问题。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅