本文提出了一种面向视频多模态大语言模型(MLLMs)的高效强化学习后训练方法OraRL,旨在解决现有方法在采样效率和可扩展性上的瓶颈。核心创新在于重新定义标注数据的角色:不仅用于评分,还可作为“预言机”轨迹直接纳入策略组,作为正向优化目标。然而,直接集成会引发“优势反转”问题,即高奖励预言机抬高基线,导致策略优势失效。为此,OraRL设计了解耦优势估计器,分别计算无预言机基线和预言机-策略差距,并通过符号平衡剪枝保留关键样本,将训练时间降至SFT的2.2倍,远低于GRPO的4.9倍。实验表明,OraRL在0.8B至9B模型规模及10万提示词下均优于基线,无需思维链即可实现130毫秒推理,并在时间mIoU、跟踪、分割及空间智能基准上显著提升,超越GPT-5和Gemini-3-Pro。该方法为视频MLLMs的RL后训练提供了高效、可扩展的新范式。
| OraRL | 一种用于视频多模态大语言模型的高效强化学习后训练方法,利用注释作为预言机轨迹。 |
| advantage inversion | 优势反转,指高奖励预言机提升组基线,导致原本为正的策略优势变为负值的失败现象。 |
| decoupled advantage estimator | 解耦优势估计器,OraRL的核心组件,分别计算无预言机基线和预言机-策略差距,避免优势反转。 |
| sign-balanced pruning | 符号平衡剪枝,一种提高训练效率的策略,仅保留预言机和每个符号的最强轨迹。 |
| chain-of-thought (CoT) | 思维链,一种生成详细推理步骤的方法,在强化学习中成本高昂。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅