当前对已部署AI系统的优化,越来越多地转向提示词、技能、工具链与代码等外部构件的调整,而非修改模型权重。这类优化通常采用“提议—评估—筛选”流程,只保留满足接受标准的候选方案,但被淘汰的候选往往蕴含对后续优化至关重要的信息,直接丢弃会导致后续提议重复陷入相同失败模式。为此,作者提出Mara Chain,将被拒绝的候选保留下来,并利用此前尝试积累的证据对其进行迭代精炼,同时通过固定精炼链深度和帕累托过滤的Top-N选择来控制候选池规模。在AppWorld技能优化、TerminalBench 2.1工具链优化和MuSiQue检索流水线优化三项任务中,该方法以更少的 rollout 取得更大性能提升,相对表现最高超出GEPA、ACE和SkillOpt-Lite达20.5%,并以比GEPA少65.5%的rollout达到目标分数;在TerminalBench 2.1上通过率分别比AHE和Meta-Harness提升20.2和22.5个百分点,在MuSiQue上nDCG@10和Recall@10分别提升0.104和0.131。该工作表明,失败候选并非噪声,而是可被系统性再利用的优化资源。
| Mara Chain | 本文提出的优化流程,将每次被拒绝的候选配置保留并迭代改进,作为后续优化的垫脚石。 |
| propose-evaluate-select | 一种常见的优化范式:生成候选配置、评估其表现、仅选择满足接受标准的配置。 |
| rollout | 在优化过程中,对候选配置进行一次完整评估或执行所消耗的尝试次数。 |
| Pareto-filtered Top-N selection | 一种候选池筛选策略:先基于帕累托最优性过滤,再保留表现最好的N个候选,以控制候选池规模。 |
| nDCG@10 | 归一化折损累计增益,评估检索系统前10个结果的排序质量,值越高表示排序越合理。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅