🔥 今日值得一读 改个代数,性能暴涨16个点!热带强化学习让大模型真正学会组合推理
Tropical Reinforcement Learning
arXiv AI (cs.AI) 🔥 重点 #强化学习#LLM推理#组合推理 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
解决LLM强化学习中期望回报无法区分具体解法的问题,适合需要组合多步推理的任务训练。

📖 AI 总结

本文提出“热带强化学习”(Tropical Reinforcement Learning),针对大语言模型在组合式推理中的局限,对强化学习的代数结构进行根本性改造。传统方法通过求和聚合所有成功轨迹的概率,只能反映策略成功的频率,却无法指明哪条具体路径有效,且因概率归一化,强化某一解法可能导致模型遗忘其他未被证伪的方案。作者转而采用取最大值的“热带半环”运算,使状态价值对应最可能被验证解的对数概率,并保留可重放、可复用的显式路径,从而允许来自不同轨迹的最佳前缀与最佳后缀在共享状态处拼接,实现真正的组合。基于此提出的训练算法TROPIC面向确定性、可重置且结果可验证的环境,在Sokoban、Countdown、FrozenLake和WebShop四项智能体任务上,较最强的同策略基线最高提升16个百分点。该工作表明,改变强化学习的代数基础而非仅改进估计器,可显著提升语言模型的组合推理能力。

🔑 关键词速览

热带强化学习一种基于热带半环(取最大值代替求和)的强化学习框架,用于提升组合推理能力。
热带半环一种代数结构,其中加法定义为取最大值,乘法定义为普通加法,用于替代传统概率求和。
TROPIC一种针对确定性、可重置且结果可验证环境的训练算法,基于热带强化学习。
组合推理通过组合多个推理步骤来构建解决方案的推理方式,步骤可能来自不同的尝试。
期望回报强化学习中策略成功轨迹概率的加权和,传统目标函数。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅