小红书 AllSpark 团队开源了 Search Agent 模型 Iris,参数规模仅 35B,却在 BrowseComp 基准上取得 82.2 分,逼近 Kimi-K2.6 等万亿参数模型的表现。Search Agent 需要在真实网络环境中边搜索、边阅读、边推理,并自主判断证据是否充分、何时停止作答,是训练与评测难度最高的一类模型。团队将这一任务的难点归纳为三道坎,并据此设计了 Iris 的训练配方。该成果的意义在于,它以远小于主流模型的体量实现了接近顶尖水平的搜索推理能力,说明通过针对性的训练方法,中小规模模型也能在复杂 Agent 任务上取得突破,为开源社区提供了可参考的实践路径。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅