本文提出“热带强化学习”(Tropical Reinforcement Learning),针对大语言模型在组合式推理中的局限,对强化学习的代数结构进行根本性改造。传统方法通过求和聚合所有成功轨迹的概率,只能反映策略成功的频率,却无法指明哪条具体路径有效,且因概率归一化,强化某一解法可能导致模型遗忘其他未被证伪的方案。作者转而采用取最大值的“热带半环”运算,使状态价值对应最可能被验证解的对数概率,并保留可重放、可复用的显式路径,从而允许来自不同轨迹的最佳前缀与最佳后缀在共享状态处拼接,实现真正的组合。基于此提出的训练算法TROPIC面向确定性、可重置且结果可验证的环境,在Sokoban、Countdown、FrozenLake和WebShop四项智能体任务上,较最强的同策略基线最高提升16个百分点。该工作表明,改变强化学习的代数基础而非仅改进估计器,可显著提升语言模型的组合推理能力。
| 热带强化学习 | 一种基于热带半环(取最大值代替求和)的强化学习框架,用于提升组合推理能力。 |
| 热带半环 | 一种代数结构,其中加法定义为取最大值,乘法定义为普通加法,用于替代传统概率求和。 |
| TROPIC | 一种针对确定性、可重置且结果可验证环境的训练算法,基于热带强化学习。 |
| 组合推理 | 通过组合多个推理步骤来构建解决方案的推理方式,步骤可能来自不同的尝试。 |
| 期望回报 | 强化学习中策略成功轨迹概率的加权和,传统目标函数。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅