该论文针对长视频理解中的关键帧选择问题展开研究。作者从任务分解视角分析了现有主流方法的两大局限:基于相似度的方法存在查询理解鸿沟,基于判断的方法存在解释与选择之间的鸿沟。为此,论文提出RACER框架,一种无需训练的反思路智能体方法,将长视频帧选择分解为两个环节:由轻量级视频大语言模型负责查询解读,将复杂查询改写为显式子查询;由嵌入模型充当检索工具,依据子查询定位相关证据帧。检索结果再反馈给视频大语言模型以精炼子查询,形成迭代反思循环。多基准实验表明,RACER能持续提升长视频理解性能,且即便使用能力有限的组件也能实现有效帧选择,说明智能体式集成可让弱组件辅助更强的视频大语言模型。
| Vid-LLM | 视频大语言模型,能够处理视频和语言任务的大型多模态模型。 |
| Frame Selection | 帧选择,从视频中挑选出与查询最相关的帧的过程。 |
| Query Comprehension Gap | 查询理解鸿沟,指基于相似度的方法中,模型对复杂查询的理解不足导致检索偏差。 |
| Interpretation-Selection Gap | 解释-选择鸿沟,指基于判断的方法中,模型对查询的解释与最终帧选择之间的不一致。 |
| Reflective Agent | 反思维理体,一种能够通过反馈循环迭代改进自身决策的智能体框架。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅