这项研究系统考察了可验证奖励强化学习(RLVR)对视频语言模型时间理解能力的影响。作者用分组相对策略优化微调四个开源模型,采用三种数据配方:合成CLEVRER验证数据、真实网络视频自监督任务、以及两者一比一混合,并额外加入真实视频验证问题。结果显示,验证训练在域内带来显著提升,但模型规模越大增益越小;更关键的是,相当部分提升并非来自视觉信息,因为无帧输入的准确率几乎同样上升。仅用合成验证数据训练会严重损害域外真实视频表现,最强模型在两个真实视频集上分别下降26.7和25.2分,而混合真实视频后不再出现显著退化。此外,尽管设置了事件顺序奖励,41项评估中39项的顺序与打乱帧差距几乎为零,说明可验证奖励提升了基准准确率,却未真正教会模型时间顺序理解。作者据此建议报告无帧对照,并混入真实视频以防止域外性能下降。
| RLVR (Reinforcement Learning from Verifiable Rewards) | 基于可验证奖励的强化学习,利用可自动验证的答案或规则作为奖励信号来训练模型。 |
| GRPO (Group Relative Policy Optimization) | 组相对策略优化,一种强化学习算法,通过比较一组响应的相对质量来优化策略。 |
| CLEVRER | 一个合成视频数据集,包含物体交互和因果-时序问题,用于评估视频推理能力。 |
| NExT-QA | 一个真实视频问答基准,专注于因果、时序和描述性问题,用于评估视频理解。 |
| Temporal-order grounding | 时序顺序接地,指模型理解并利用视频中事件发生的先后顺序进行推理的能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅