本文提出 Video-MOPD-8B,一个面向视频理解任务的开源权重模型。针对视频理解需同时兼顾感知、时序理解与复杂推理、单一模型难以联合优化的问题,作者先围绕视频时序定位、通用视频理解和视频 STEM 推理三个核心领域进行针对性强化学习优化,再通过多教师在线策略蒸馏(MOPD)将各领域专家能力整合,利用路由式教师反馈监督学生模型自生成的轨迹。同时引入可靠性感知信息采样(RAIS),筛选教师监督稳定且师生性能差距较大的样本。在通用视频理解、时序定位、视频推理和视频 STEM 等多项基准上,该模型在同规模模型中达到当前最优性能,模型权重已公开。
| Video-MOPD-8B | 一个专为视频理解任务设计的开放权重模型,通过多教师在线策略蒸馏整合多种能力。 |
| Multi-Teacher On-Policy Distillation (MOPD) | 一种蒸馏方法,利用多个教师模型的反馈来监督学生模型生成的轨迹,以整合不同领域的专家知识。 |
| Reliability-Aware Informative Sampling (RAIS) | 一种采样策略,选择教师监督可靠且师生性能差距大的样本,以提高蒸馏效率。 |
| Video Temporal Grounding (VTG) | 视频时序定位,指在视频中定位与给定文本查询相关的时间片段的任务。 |
| Video STEM Reasoning | 视频 STEM 推理,涉及科学、技术、工程和数学领域的视频内容推理任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅