本文介绍了Iris-mini和Iris-pro两个搜索智能体的开发,规模分别为35B-A3B和397B-A17B参数。研究团队创新性地从网页超链接结构反向构建训练任务:基于实体图生成多跳问题,将非答案实体改写为描述性引用以防止字符串匹配,并仅保留参考模型无法闭卷回答但提供证据后可解决的问题。训练采用两阶段交替的“SFT-RL爬升”方法,先进行监督微调,再通过实时搜索强化学习优化,并将每轮中最难解决的轨迹回传至下一轮监督训练。在BrowseComp、BrowseComp-ZH、DeepSearchQA和HLE基准测试中,两个模型分别取得82.2/84.8/86.9/52.3和88.6/85.1/92.9/56.4的成绩,是各自参数范围内开源搜索智能体的最强结果。研究还发现推理时上下文管理对性能影响显著,所有测试均使用单一ReAct代理完成,无子代理或测试时验证。
| Iris-mini | 一个35B-A3B规模的搜索代理模型,用于多跳问答任务。 |
| Iris-pro | 一个397B-A17B规模的搜索代理模型,性能更强,用于复杂搜索任务。 |
| SFT-RL climbing | 一种交替进行监督微调和强化学习的训练方法,逐步提升模型性能。 |
| ReAct agent | 一种结合推理和行动的代理框架,用于交互式搜索和决策。 |
| BrowseComp | 一个用于评估搜索代理能力的基准测试,包含复杂浏览任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅