🔥 今日值得一读 视频智能体自动进化,长视频理解性能飙升11.2分,帧数减半!
VidHarness: Evolving Agent Harnesses for Cost-Efficient Long Video Understanding
arXiv CV (cs.CV) 🔥 重点 #Agent#长视频理解#自动化搜索 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
自动为长视频问答设计高效Agent框架,大幅降低逐帧处理的算力成本。

📖 AI 总结

VidHarness 是一套面向长视频理解任务的自动化智能体框架,旨在解决视觉语言模型逐帧处理长视频成本过高的问题。其核心思路是让"harness 提议器"依据执行反馈迭代演化出包裹冻结视觉语言模型的智能体程序,从而实现对视频的选择性观察。为摆脱贪心式改进易陷入局部最优的困境,该框架将演化过程组织为蒙特卡洛树搜索,并引入不确定性感知的多保真度验证,先在少量问题上筛选新方案、仅保留有潜力的候选,以降低评估开销。考虑到最优 harness 会随帧预算变化,作者进一步提出混合 harness 机制,按预算将每个问题路由至相应专用 harness。实验显示,该方法在 LongVideoBench、Video-MME 和 Video-Holmes 上取得新的最优结果,较最强人工设计视频智能体最高提升 11.2 分,并在 Video-MMMU 与 MMVU 等知识密集型基准上以不足均匀采样一半的帧数实现泛化。

🔑 关键词速览

VLM视觉语言模型,一种能同时处理图像/视频和文本的多模态人工智能模型。
Harness执行框架,包裹在冻结模型周围、控制其如何观察和推理视频的程序。
MCTS蒙特卡洛树搜索,一种通过随机模拟来平衡探索与利用的启发式搜索算法。
Mixture-of-Harness执行框架混合,根据每个问题的帧预算将其路由到专门化执行框架的机制。
Multi-Fidelity Validation多保真度验证,先用少量问题低成本筛选候选方案,再对优胜者进行完整评估的策略。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅