本文提出 RECAP(基于传播的冗余感知信用分配)方法,旨在解决大型推理模型生成正确但冗长推理链的问题。现有方法多依赖轨迹级目标或局部词元、步骤信号,较少建模步骤间的语义依赖,因而难以区分冗余步骤与支撑后续推导的必要步骤。RECAP 引入两个信号:一是结构责任,通过从最终答案节点沿语义依赖图反向传播信用,衡量后续推理对该步骤的依赖程度;二是步骤效能,通过金答案对数似然的变化衡量该步骤对正确解的推进作用。二者共同将 GRPO 的轨迹级优势重塑为步骤级更新,且无需单独训练过程奖励模型或预构造简洁轨迹。在两个 7B 模型和四个数学推理基准上,RECAP 改善了准确率与效率的权衡:在 Qwen2.5-Math-7B 上,pass@1 提升 2.0 至 3.7 个百分点,同时推理词元减少 8% 至 31%。分析表明,节省来自更少的推理操作和死胡同推理,而非表达更紧凑。
| RECAP | 一种冗余感知的信用分配方法,通过传播机制为推理步骤分配信用,以提升推理效率。 |
| 结构责任 | 衡量一个推理步骤对后续推理的下游影响程度的指标,反映其在推理结构中的重要性。 |
| 步骤效力 | 通过金标准答案对数似然的变化来衡量一个推理步骤对正确解题的贡献。 |
| GRPO | 一种用于强化学习的策略优化方法,通常用于语言模型的推理训练。 |
| 语义依赖图 | 由LLM标注的、表示推理步骤之间语义依赖关系的有向图,用于传播信用。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅