🔥 今日值得一读 仅用1250样本、零视频问答标注,SAVER让稀疏帧推理反超密集帧基线!
Less from More: Reinforcing Sparse Video Reasoning from Dense References
arXiv CV (cs.CV) 🔥 重点 #视频推理#强化学习#多模态 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
让视频模型在只看少量帧时也能可靠推理,可用于降低视频理解推理成本。

📖 AI 总结

该研究挑战了视频语言模型中“时间观测越多推理越可靠”的常见假设,提出真正的挑战在于如何在有限时间证据下进行可靠推理。作者提出SAVER框架,一种从密集到稀疏的后训练方法,利用密集视频视图作为训练时的参考,通过 grounding 奖励和可靠性门控参考奖励优化配对视图,促使稀疏视图预测保留任务相关的时间证据。值得注意的是,SAVER仅使用1250个随机采样的时间定位样本训练,未使用任何视频问答标注。在三个时间定位基准和六个视频问答基准上,SAVER在不同帧预算下均持续提升性能,甚至能以显著更少的帧数匹配或超越密集帧的Qwen3.5基线。这表明时间定位可作为学习稀疏视频推理的有效证据定位代理,并能迁移至更广泛的视频理解任务。

🔑 关键词速览

SAVER一种从密集到稀疏的后训练框架,利用密集视频视图作为训练参考,提升稀疏帧推理的可靠性。
时间定位(Temporal Grounding)在视频中定位与任务相关的时间片段或证据,是视频理解中的一项关键任务。
强化后训练(Reinforcement Post-training)在预训练模型基础上,使用强化学习进一步优化模型行为,以适应特定任务或约束。
可靠性门控参考奖励(Reliability-gated Reference Reward)一种奖励机制,根据参考视图的可靠性动态调整奖励信号,引导稀疏视图学习保留关键证据。
帧预算(Frame Budget)模型推理时可使用的视频帧数量限制,用于衡量计算效率与性能的权衡。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅