🔥 今日值得一读 视频MLLM训练提速2.2倍!OraRL让注释当预言机,9B模型解码快37倍!
Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs
arXiv CV (cs.CV) 🔥 重点 #强化学习#多模态#视频理解 🕐 08-24 12:00
👨‍💼 主理人解读 · 为什么值得关注
将现有注释转化为训练数据,降低RL成本,加速视频MLLM的后训练。

📖 AI 总结

本文提出了一种面向视频多模态大语言模型(MLLMs)的高效强化学习后训练方法OraRL,旨在解决现有方法在采样效率和可扩展性上的瓶颈。核心创新在于重新定义标注数据的角色:不仅用于评分,还可作为“预言机”轨迹直接纳入策略组,作为正向优化目标。然而,直接集成会引发“优势反转”问题,即高奖励预言机抬高基线,导致策略优势失效。为此,OraRL设计了解耦优势估计器,分别计算无预言机基线和预言机-策略差距,并通过符号平衡剪枝保留关键样本,将训练时间降至SFT的2.2倍,远低于GRPO的4.9倍。实验表明,OraRL在0.8B至9B模型规模及10万提示词下均优于基线,无需思维链即可实现130毫秒推理,并在时间mIoU、跟踪、分割及空间智能基准上显著提升,超越GPT-5和Gemini-3-Pro。该方法为视频MLLMs的RL后训练提供了高效、可扩展的新范式。

🔑 关键词速览

OraRL一种用于视频多模态大语言模型的高效强化学习后训练方法,利用注释作为预言机轨迹。
advantage inversion优势反转,指高奖励预言机提升组基线,导致原本为正的策略优势变为负值的失败现象。
decoupled advantage estimator解耦优势估计器,OraRL的核心组件,分别计算无预言机基线和预言机-策略差距,避免优势反转。
sign-balanced pruning符号平衡剪枝,一种提高训练效率的策略,仅保留预言机和每个符号的最强轨迹。
chain-of-thought (CoT)思维链,一种生成详细推理步骤的方法,在强化学习中成本高昂。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅