🔥 今日值得一读 长视频问答准确率暴涨42.6%!PACE新框架让AI秒抓关键证据
Finding the Right Evidence: Factor-Guided Coarse-to-Fine Reasoning for Long Videos
arXiv CV (cs.CV) 🔥 重点 #视频理解#推理优化#长视频 🕐 08-28 12:00
👨‍💼 主理人解读 · 为什么值得关注
通过因子引导逐步聚焦关键证据,解决长视频问答中选项判别难的问题。

📖 AI 总结

该研究针对长视频问答中证据稀疏且难以区分选项的问题,提出因子引导的渐进式证据获取框架PACE。通过对MMR-V数据集的诊断分析发现,现有智能体系统虽能提升线索检索能力,但答案准确率提升有限,瓶颈在于缺乏选项判别性证据。PACE采用两阶段策略:先基于问题因子索引片段描述,再结合候选答案生成对比线索进行验证。在MMR-V数据集上,PACE配合Qwen3-VL骨干网络达到42.6%的准确率,优于直接推理和Deep Video Discovery等基线方法;在诊断子集上恢复了66.9%的标注线索,证明性能提升源于证据恢复能力的增强。该方法在LVBench、Video-MME等多个基准上均取得一致性改进,表明选项感知的证据获取策略具有良好的跨数据集泛化能力。

🔑 关键词速览

LVLMs大型视频语言模型,结合视觉和语言处理以理解视频内容。
PACE关键证据的渐进获取,一种因子引导的两阶段框架,用于长视频中的证据获取。
MMR-V一个长视频问答基准数据集,用于评估多模态推理能力。
DVD深度视频发现,一种先前的智能体基线方法,用于视频证据检索。
Qwen3-VL一个开源的大型视觉语言模型,用作PACE框架的骨干网络。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅