该论文提出了一种名为“时间思维树”(T³)的训练无关框架,用于解决多模态大语言模型在长视频理解中因上下文长度受限而面临的挑战。现有方法如均匀采样可能遗漏关键时刻,而基于智能体的方法往往独立评估帧,忽略了视频的时间结构。T³通过递归时间约束聚类构建一个与问题无关的层次化时间树,每个节点代表一个连续片段及其关键帧。推理时,T³执行“回答-检索-探索”循环:先在粗粒度代表帧上推理,证据不足时生成搜索语句,并扩展相关分支以获取更细粒度的证据,从而自适应地将搜索从时间区域转向具体对象和视觉细节。在VideoMME、LongVideoBench和LVBench基准上,T³在相同帧预算下分别将Qwen2.5-VL-7B的性能提升了0.5%、4.6%和4.4%,验证了结构化时间推理的有效性。该工作已被EMNLP 2026接收。
| Temporal Tree of Thought (T^3) | 一种无需训练的长视频理解框架,通过构建层次时间树并执行推理引导的搜索来逐步细化证据。 |
| Multimodal Large Language Models (MLLMs) | 多模态大语言模型,能够处理文本和视觉等多种模态信息。 |
| recursive temporally constrained clustering | 递归时间约束聚类,一种将视频帧按时间连续性分组并递归构建层次结构的方法。 |
| answer-retrieve-explore loop | 回答-检索-探索循环,T^3的推理过程,先基于粗帧回答,不足时生成搜索语句并扩展相关分支。 |
| frame budget | 帧预算,指在视频理解中允许使用的最大帧数,用于控制计算成本。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅