Google Research 提出 Retrieve-for-Train(R4T)框架,旨在解决搜索与推荐系统中查询扇出(query fan-out)的两个核心问题:一是通用大模型在推理时生成子查询易出现“释义坍缩”,产出大量近义结果导致检索集合同质化;二是自回归生成加反复检索调用带来高延迟。R4T 采用三步流程:先用强化学习离线训练扇出语言模型,以集合级奖励评估整体检索结果而非单条;再以该模型采样生成无人工标注的训练对;最后将行为蒸馏进一个 5390 万参数的扩散 Transformer,使其在单次非自回归前向中生成全部检索方向嵌入,再经最近邻搜索映射到数据库条目。该方法在开放与组合式检索任务上实现 12 至 20 倍的查询扇出加速,同时通过奖励设计抑制奖励黑客问题,为高效多样化检索提供了新思路。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅