该研究探讨了语言模型在强化学习后训练阶段的组合推理能力。作者提出依赖图框架,将组合推理形式化为三个复杂度递增的层级,并以数据结构任务进行实证验证,因其具备确定性奖励和清晰的组合结构。核心发现是一种稳定的“分解到组合不对称性”:针对分解技能的强化训练难以迁移至组合任务,而组合任务的训练却能较好地反向迁移至分解任务。研究还从理论上解释了这一不对称现象,并评估了长度外推、结构分布偏移及未见技能迁移等场景下的组合泛化表现。在真实工具调用基准上的初步实验表明,该不对称性可能延伸至实际应用。这一工作揭示了当前强化学习后训练在组合泛化上的局限,对理解模型推理能力的边界具有参考意义。
| 组合推理 (Compositional Reasoning) | 模型将已学会的多个技能或知识片段以新方式组合起来,以解决训练中未见过的问题的能力。 |
| 强化学习后训练 (Reinforcement Learning Post-Training) | 在预训练语言模型基础上,使用强化学习(如基于人类反馈的强化学习)进一步微调,以提升其推理和任务执行能力的方法。 |
| 依赖图框架 (Dependency-Graph Framework) | 一种用有向图表示任务中技能或子任务之间依赖关系的理论工具,用于形式化定义组合推理的层级。 |
| 分解到组合不对称性 (Decomposed-to-Composed Asymmetry) | 指模型在分解技能上训练后难以迁移到组合任务,而在组合任务上训练后却能较好迁移到分解任务的不对称现象。 |
| 组合泛化 (Compositional Generalization) | 模型在训练分布之外,通过组合已知元素来正确处理新组合或新结构的能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅