VidHarness 是一套面向长视频理解任务的自动化智能体框架,旨在解决视觉语言模型逐帧处理长视频成本过高的问题。其核心思路是让"harness 提议器"依据执行反馈迭代演化出包裹冻结视觉语言模型的智能体程序,从而实现对视频的选择性观察。为摆脱贪心式改进易陷入局部最优的困境,该框架将演化过程组织为蒙特卡洛树搜索,并引入不确定性感知的多保真度验证,先在少量问题上筛选新方案、仅保留有潜力的候选,以降低评估开销。考虑到最优 harness 会随帧预算变化,作者进一步提出混合 harness 机制,按预算将每个问题路由至相应专用 harness。实验显示,该方法在 LongVideoBench、Video-MME 和 Video-Holmes 上取得新的最优结果,较最强人工设计视频智能体最高提升 11.2 分,并在 Video-MMMU 与 MMVU 等知识密集型基准上以不足均匀采样一半的帧数实现泛化。
| VLM | 视觉语言模型,一种能同时处理图像/视频和文本的多模态人工智能模型。 |
| Harness | 执行框架,包裹在冻结模型周围、控制其如何观察和推理视频的程序。 |
| MCTS | 蒙特卡洛树搜索,一种通过随机模拟来平衡探索与利用的启发式搜索算法。 |
| Mixture-of-Harness | 执行框架混合,根据每个问题的帧预算将其路由到专门化执行框架的机制。 |
| Multi-Fidelity Validation | 多保真度验证,先用少量问题低成本筛选候选方案,再对优胜者进行完整评估的策略。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅