苹果研究团队提出RLTL;DR方法,旨在解决可验证奖励强化学习在极难任务中因成功率过低而无法有效训练的问题。该方法在每次失败尝试后,让策略模型读取验证器输出并自行撰写一条TL;DR式反馈洞见,后续尝试以累积洞见为条件,同时对上下文中的洞见进行反向传播,从而内化任务到洞见的直接映射。在工具调用和编程数据集上,标准GRPO训练使Qwen 3.5 9B Thinking策略的Pass@1停留在0%至1%,而RLTL;DR突破这一瓶颈,训练时上下文含洞见可达14%至31%,评估时无洞见仍保持12%至13%。研究进一步发现,仅用4k条任务与洞见元组进行监督微调即可恢复几乎全部性能,表明关键机制在于任务到洞见的内化,为“面对此类任务,记住此类要点”的紧凑训练范式提供了新思路。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅