该研究提出ERR+框架,用于优化大语言模型在复杂推理任务中的思维链质量。作者通过实证分析发现,正确推理轨迹在思考阶段表现出更频繁且幅度更大的token级熵降,基于此设计了两阶段强化学习方案。第一阶段采用熵释放奖励,按响应长度对数归一化累积熵降,鼓励模型解决不确定性而非简单抑制熵值;第二阶段引入鲁棒相对效率奖励,通过组内z-score的tanh变换评估响应简洁性。研究证明两目标联合优化在早期会引发梯度冲突,因此采用顺序训练策略。在五个数据集上的实验显示,该方法在多个模型骨干上同时提升了推理准确率和响应简洁性,为推理过程的结构化优化提供了新思路。
| RLVR | 基于可验证奖励的强化学习,一种利用可验证的奖励信号来训练推理模型的方法。 |
| Chain-of-Thought (CoT) | 思维链,模型在推理过程中生成的一系列中间思考步骤。 |
| Entropy Relief Reward (ERR) | 熵缓解奖励,一种根据思考阶段词元级熵降累积量计算的奖励信号。 |
| Robust Relative Efficiency Reward | 鲁棒相对效率奖励,一种通过比较响应长度与同行来评估效率的奖励机制。 |
| Token-level entropy drop | 词元级熵降,指在推理过程中每个词元位置的不确定性减少程度。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅