上海交通大学副教授杜冬冬在QCon上海站分享了基于RhymeRL的强化学习系统优化实践。他指出,在大模型强化学习后训练中,Rollout阶段占训练耗时的84%至91%,且批内长尾效应导致最早完成的GPU约有76%的时间处于空闲状态。研究团队通过分析真实轨迹发现,相邻epoch的Rollout响应存在大量可精确匹配的token,且响应长度排序稳定。基于这一发现,他们提出RhymeRL系统,采用离线后缀树索引、奖励感知选枝、动态草稿窗口、奇偶步互补调度及尾部迁移等机制,在不依赖额外小模型的前提下复用历史响应,实现端到端吞吐最高2.6倍的提升。该工作为强化学习基础设施的效率优化提供了新思路,尤其适用于数学和代码等场景。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅