RL后训练大模型竟有“分解到组合”不对称性,组合推理泛化难题迎新解!
Compositional Reasoning in Language Models under Reinforcement Learning Post-Training
arXiv AI (cs.AI) 重要 大模型论文方法 🕐 09-18 12:00

📖 AI 总结

该研究探讨了语言模型在强化学习后训练阶段的组合推理能力。作者提出依赖图框架,将组合推理形式化为三个复杂度递增的层级,并以数据结构任务进行实证验证,因其具备确定性奖励和清晰的组合结构。核心发现是一种稳定的“分解到组合不对称性”:针对分解技能的强化训练难以迁移至组合任务,而组合任务的训练却能较好地反向迁移至分解任务。研究还从理论上解释了这一不对称现象,并评估了长度外推、结构分布偏移及未见技能迁移等场景下的组合泛化表现。在真实工具调用基准上的初步实验表明,该不对称性可能延伸至实际应用。这一工作揭示了当前强化学习后训练在组合泛化上的局限,对理解模型推理能力的边界具有参考意义。

🔑 关键词速览

组合推理 (Compositional Reasoning)模型将已学会的多个技能或知识片段以新方式组合起来,以解决训练中未见过的问题的能力。
强化学习后训练 (Reinforcement Learning Post-Training)在预训练语言模型基础上,使用强化学习(如基于人类反馈的强化学习)进一步微调,以提升其推理和任务执行能力的方法。
依赖图框架 (Dependency-Graph Framework)一种用有向图表示任务中技能或子任务之间依赖关系的理论工具,用于形式化定义组合推理的层级。
分解到组合不对称性 (Decomposed-to-Composed Asymmetry)指模型在分解技能上训练后难以迁移到组合任务,而在组合任务上训练后却能较好迁移到分解任务的不对称现象。
组合泛化 (Compositional Generalization)模型在训练分布之外,通过组合已知元素来正确处理新组合或新结构的能力。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅