检索增强生成(RAG)虽能借助外部知识提升大语言模型表现,但在多跳推理中易因早期检索错误而引发级联失败。现有方法或仅奖励最终答案,或虽引入步骤级信号却仍以最终答案为准,导致对“错误检索却碰巧答对”的虚假成功给予错误奖励。为此,研究者提出PRO-STEP框架:训练一个生成式过程奖励模型(PRM),同时评估每一步的逻辑有效性与证据支撑;利用PRM引导的值树搜索构建对比偏好对,区分有效与缺陷步骤;并通过步骤级直接偏好优化(DPO)来优化策略。在单跳与多跳问答的五个基准上,PRO-STEP取得了最优的平均EM与F1分数,验证了其步骤级监督在提升RAG推理可靠性上的有效性。
| Retrieval-Augmented Generation (RAG) | 检索增强生成,一种通过外部知识检索来增强大语言模型回答的技术。 |
| Process Reward Model (PRM) | 过程奖励模型,用于评估推理过程中每一步的质量,而非仅评估最终结果。 |
| Direct Preference Optimization (DPO) | 直接偏好优化,一种通过偏好对直接优化策略的方法,无需显式奖励模型。 |
| Value Tree Search | 值树搜索,一种利用价值模型引导的搜索策略,用于探索和评估推理路径。 |
| Multi-hop QA | 多跳问答,需要多个推理步骤和多次检索才能回答的问题。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅