本文提出了一种名为“分解子任务强化学习”(RLDS)的新方法,旨在解决现有策略梯度方法(如GRPO)在多轮语言模型智能体训练中的信息损失问题。传统方法将整个轨迹奖励压缩为单一标量,当任务由多种技能构成且反馈稀疏、延迟时,优化器难以判断究竟是哪项能力影响了结果。RLDS的核心是“子任务分解优势估计”(SDAE),它按固定分类体系将轨迹奖励拆分为各子任务份额,分别计算组相对优势,并依据重要性将信用分配到标记该子任务执行关键性的反思步骤附近。研究在FrozenLake、HotpotQA、ScienceWorld和DeepResearch四个智能体基准上评估,结果显示分解带来的增益随子任务异质性提高而增大:在异质性最高的ScienceWorld上提升11.5分,FrozenLake提升9.8分,而在异质性较低的HotpotQA和DeepResearch上增益在噪声范围内。此外,RLDS在ScienceWorld上比标量GRPO每步墙钟时间减少10.9%,表明分解方法在长程任务中兼具效果与计算效率优势。
| Group Relative Policy Optimization (GRPO) | 一种用于训练语言模型智能体的策略梯度方法,通过组内相对比较计算优势,但将多轮轨迹压缩为单一标量奖励。 |
| Subtask-Decomposed Advantage Estimation (SDAE) | RLDS的核心机制,将轨迹奖励按固定分类体系拆分为子任务份额,计算每个子任务的组相对优势,并按重要性加权分配token级信用。 |
| Reinforcement Learning with Decomposed Subtasks (RLDS) | 本文提出的方法,在策略更新前将轨迹奖励沿子任务分解,以解决标量奖励压缩导致的信息损失问题。 |
| Sparse and delayed environmental feedback | 指智能体在环境中仅在少数步骤或延迟后才能获得奖励信号,使得信用分配困难。 |
| Heterogeneity diagnostics | 训练期间输出的诊断指标,用于衡量子任务之间的异质性,预测分解方法在哪些任务上能带来收益。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅