该研究提出了一种多智能体自改进强化学习框架,用于视频推理任务中的时间证据选择。框架包含一个可训练的Grounder和一个冻结的Verifier,前者采样候选轨迹与证据片段,后者提供查询条件下的片段评分,并通过组相对策略梯度目标与自举校准损失引导训练。在源任务上训练后,模型无需目标数据集微调即可零样本迁移至接地视频问答、时间定位和长视频问答等任务。一个20亿参数实例在接地问答基准上达到28.7%的IoU和25.4%的答案接地准确率,时间定位基准上IoU为46.1%,长视频问答准确率为54.1%。与同规模强基线相比,提升幅度温和但一致,尤其在IoU等相关性指标上改善明显,而严格的边界精度仍相对较弱。结果表明,冻结验证器可作为有效的训练信号,但边界定位精度仍有提升空间。
| Multi-Agent Self-Improving Reinforcement Learning | 一种多智能体强化学习框架,通过智能体间的协作与自我改进来优化策略。 |
| Grounded Video Question Answering | 一种视频问答任务,要求模型在视频中定位并利用相关证据来回答查询。 |
| Temporal Grounding | 时间定位任务,旨在从视频中识别与查询描述对应的时间片段。 |
| Group-Relative Policy Gradient | 一种策略梯度方法,通过比较组内样本的相对表现来更新策略,以鼓励优于同行的行为。 |
| Frozen Verifier | 一个在训练过程中保持参数不变的验证器,用于提供评分信号以指导其他模块的训练。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅