该研究针对长视频问答中证据稀疏且难以区分选项的问题,提出因子引导的渐进式证据获取框架PACE。通过对MMR-V数据集的诊断分析发现,现有智能体系统虽能提升线索检索能力,但答案准确率提升有限,瓶颈在于缺乏选项判别性证据。PACE采用两阶段策略:先基于问题因子索引片段描述,再结合候选答案生成对比线索进行验证。在MMR-V数据集上,PACE配合Qwen3-VL骨干网络达到42.6%的准确率,优于直接推理和Deep Video Discovery等基线方法;在诊断子集上恢复了66.9%的标注线索,证明性能提升源于证据恢复能力的增强。该方法在LVBench、Video-MME等多个基准上均取得一致性改进,表明选项感知的证据获取策略具有良好的跨数据集泛化能力。
| LVLMs | 大型视频语言模型,结合视觉和语言处理以理解视频内容。 |
| PACE | 关键证据的渐进获取,一种因子引导的两阶段框架,用于长视频中的证据获取。 |
| MMR-V | 一个长视频问答基准数据集,用于评估多模态推理能力。 |
| DVD | 深度视频发现,一种先前的智能体基线方法,用于视频证据检索。 |
| Qwen3-VL | 一个开源的大型视觉语言模型,用作PACE框架的骨干网络。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅