🔥 今日值得一读 可验证奖励训练让视频模型时序推理最高涨19分,但大部分提升竟与画面无关!
What Do Verifiable Rewards Teach Video-Language Models About Time? A Controlled Multi-Model Study
arXiv CV (cs.CV) 🔥 重点 #RLVR#视频理解#时序推理 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
做视频时序问答时,可参考其数据配方设计奖励,避免模型只学表面模式而非真正时间推理。

📖 AI 总结

这项研究系统考察了可验证奖励强化学习(RLVR)对视频语言模型时间理解能力的影响。作者用分组相对策略优化微调四个开源模型,采用三种数据配方:合成CLEVRER验证数据、真实网络视频自监督任务、以及两者一比一混合,并额外加入真实视频验证问题。结果显示,验证训练在域内带来显著提升,但模型规模越大增益越小;更关键的是,相当部分提升并非来自视觉信息,因为无帧输入的准确率几乎同样上升。仅用合成验证数据训练会严重损害域外真实视频表现,最强模型在两个真实视频集上分别下降26.7和25.2分,而混合真实视频后不再出现显著退化。此外,尽管设置了事件顺序奖励,41项评估中39项的顺序与打乱帧差距几乎为零,说明可验证奖励提升了基准准确率,却未真正教会模型时间顺序理解。作者据此建议报告无帧对照,并混入真实视频以防止域外性能下降。

🔑 关键词速览

RLVR (Reinforcement Learning from Verifiable Rewards)基于可验证奖励的强化学习,利用可自动验证的答案或规则作为奖励信号来训练模型。
GRPO (Group Relative Policy Optimization)组相对策略优化,一种强化学习算法,通过比较一组响应的相对质量来优化策略。
CLEVRER一个合成视频数据集,包含物体交互和因果-时序问题,用于评估视频推理能力。
NExT-QA一个真实视频问答基准,专注于因果、时序和描述性问题,用于评估视频理解。
Temporal-order grounding时序顺序接地,指模型理解并利用视频中事件发生的先后顺序进行推理的能力。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅