🔥 今日值得一读 无需训练也能让长视频理解飙升!RACER反思维理体框架破解帧选择难题
RACER: Reflective Agent Coupling Query Interpretation and Tool-Based Retrieval for Frame Selection in Long Video Understanding
arXiv CV (cs.CV) 🔥 重点 #Agent#视频理解#检索增强 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
用Agent自动理解复杂查询并检索关键帧,提升长视频问答的准确率。

📖 AI 总结

该论文针对长视频理解中的关键帧选择问题展开研究。作者从任务分解视角分析了现有主流方法的两大局限:基于相似度的方法存在查询理解鸿沟,基于判断的方法存在解释与选择之间的鸿沟。为此,论文提出RACER框架,一种无需训练的反思路智能体方法,将长视频帧选择分解为两个环节:由轻量级视频大语言模型负责查询解读,将复杂查询改写为显式子查询;由嵌入模型充当检索工具,依据子查询定位相关证据帧。检索结果再反馈给视频大语言模型以精炼子查询,形成迭代反思循环。多基准实验表明,RACER能持续提升长视频理解性能,且即便使用能力有限的组件也能实现有效帧选择,说明智能体式集成可让弱组件辅助更强的视频大语言模型。

🔑 关键词速览

Vid-LLM视频大语言模型,能够处理视频和语言任务的大型多模态模型。
Frame Selection帧选择,从视频中挑选出与查询最相关的帧的过程。
Query Comprehension Gap查询理解鸿沟,指基于相似度的方法中,模型对复杂查询的理解不足导致检索偏差。
Interpretation-Selection Gap解释-选择鸿沟,指基于判断的方法中,模型对查询的解释与最终帧选择之间的不一致。
Reflective Agent反思维理体,一种能够通过反馈循环迭代改进自身决策的智能体框架。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅