该研究针对大语言模型搜索智能体训练中合成问题难度仅由证据图规模、跳数和轨迹长度等全局属性间接反映、与搜索所需的局部检索能力不匹配的问题,提出潜在锚点推理这一基本检索单元,将深度搜索分解为锚点解析与关系迁移的耦合操作链。基于此构建了能力导向的PrimeSeeker框架,生成网络锚点结构并同步推导问题与参考证据骨架,骨架在监督微调时移除,随后用于审计强化学习奖励中的参考步骤覆盖。研究构建了9221条专家轨迹并训练了一个30B搜索智能体,在五个深度搜索基准上表现优异,参考步骤优化进一步提升了监督策略,生成轨迹检索冗余低,固定预算评估下以显著更少的工具调用实现了较强的解覆盖能力。
| 潜在锚点推理 | 一种将深度搜索分解为解析未命名检索锚点并转移至后续信息需求的原始检索单元。 |
| PrimeSeeker | 一个面向能力的搜索智能体训练框架,通过构建锚点结构和参考证据骨架来生成问题和监督信号。 |
| 参考证据骨架 | 在问题构建过程中保留支持证据的结构,用于指导专家生成和强化学习奖励审计。 |
| 深度搜索智能体 | 能够进行多步检索和推理以回答复杂问题的大型语言模型智能体。 |
| 监督微调 | 在专家轨迹上对预训练模型进行微调,以提升其特定任务性能的训练过程。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅