本文提出MILO(元进化岛屿编排)框架,用于自动发现智能体系统中的"执行框架"(harness)。现代智能体系统由AI模型与负责控制执行和环境交互的框架共同构成,框架设计对长时程任务性能影响显著,但其组合搜索空间庞大,且随模型更新需反复人工调整。现有自动化方法搜索范围狭窄,仅优化提示词或技能等单一组件,或受限于固定的利用型搜索策略。MILO的核心创新在于让框架与发现策略协同进化,融合三层机制:基于岛屿树的分层谱系记忆,将失败的变异作为负面证据;各岛屿的变异智能体依据全局搜索历史与父代反馈重写完整框架;编排器通过谱系嫁接、物种分化、变异体重新分配和课程修订来动态调整搜索。在Terminal-Bench 2.1、PaperBench和DeepSWE三个基准上,MILO发现的框架在Opus 4.8和gpt-oss-120b模型下均优于八种先进框架和六种搜索方法,相较初始框架分别提升12.0%、28.3%和10.3%,而此前最佳搜索方法的增益仅为4.5%、18.3%和0%。在Terminal-Bench 2.1上达到86.1±2.0%,超过官方排行榜首位,且token消耗减少26%。在EinsteinArena开放问题上,MILO还改进了Erdős最小重叠问题及第一、第三自相关不等式的最佳已知上界。该工作表明,自动化框架发现可显著提升智能体性能并降低人工成本。
| Harness | 智能体系统中控制模型执行流程与环境交互的外层框架,决定工具调用、上下文管理等行为。 |
| MILO (Meta-evolutionary Island Orchestration) | 本文提出的元演化岛屿编排框架,让智能体 harness 与其搜索策略协同演化。 |
| Island-based trees | 将搜索空间划分为多个岛屿、每个岛屿维护独立演化树并共享谱系信息的结构。 |
| Lineage grafting and speciation | 编排器用于调整搜索的两种机制:谱系嫁接跨岛屿迁移优秀分支,物种形成则分化出新的搜索方向。 |
| Terminal-Bench 2.1 | 评估智能体在终端环境中执行长时程任务的基准测试,以解决率作为主要指标。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅