🔥 今日值得一读 长视频理解新突破!T^3框架用“思维树”分层找关键帧,零训练让Qwen2.5-VL性能飙升4.6%
Temporal Tree of Thought: Reasoning-Guided Visual Cue Search for Long-Video Understanding
arXiv CV (cs.CV) 🔥 重点 #长视频#思维树#多模态 🕐 08-31 12:00
👨‍💼 主理人解读 · 为什么值得关注
通过分层搜索关键片段,解决长视频理解中的上下文限制,适用于视频问答。

📖 AI 总结

该论文提出了一种名为“时间思维树”(T³)的训练无关框架,用于解决多模态大语言模型在长视频理解中因上下文长度受限而面临的挑战。现有方法如均匀采样可能遗漏关键时刻,而基于智能体的方法往往独立评估帧,忽略了视频的时间结构。T³通过递归时间约束聚类构建一个与问题无关的层次化时间树,每个节点代表一个连续片段及其关键帧。推理时,T³执行“回答-检索-探索”循环:先在粗粒度代表帧上推理,证据不足时生成搜索语句,并扩展相关分支以获取更细粒度的证据,从而自适应地将搜索从时间区域转向具体对象和视觉细节。在VideoMME、LongVideoBench和LVBench基准上,T³在相同帧预算下分别将Qwen2.5-VL-7B的性能提升了0.5%、4.6%和4.4%,验证了结构化时间推理的有效性。该工作已被EMNLP 2026接收。

🔑 关键词速览

Temporal Tree of Thought (T^3)一种无需训练的长视频理解框架,通过构建层次时间树并执行推理引导的搜索来逐步细化证据。
Multimodal Large Language Models (MLLMs)多模态大语言模型,能够处理文本和视觉等多种模态信息。
recursive temporally constrained clustering递归时间约束聚类,一种将视频帧按时间连续性分组并递归构建层次结构的方法。
answer-retrieve-explore loop回答-检索-探索循环,T^3的推理过程,先基于粗帧回答,不足时生成搜索语句并扩展相关分支。
frame budget帧预算,指在视频理解中允许使用的最大帧数,用于控制计算成本。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅