语言加持动作预测:六大范式全景审计,LLM增益真相待验证!
Language-Augmented Video Action Anticipation: Design Fundamentals, Benchmarks, and Open Challenges
arXiv CV (cs.CV) 重要 #视频理解#动作预判#多模态#综述 🕐 今天 12:00

📖 AI 总结

这篇综述聚焦语言增强的视频动作预判,即从部分视频中预测未来人类动作的任务。作者指出,近期研究虽引入大语言模型、视觉语言模型或语言语义,但由于任务设定、视觉预训练、监督方式、解码器设计与评测代码常同时变动,所报告的增益难以解读。为此,文章提出一张证据感知的设计图谱,将任务范式与语言信息介入的环节交叉对应:任务沿六个维度划分为单动作、序列、物体交互、跨视角和规划导向五类,语言介入则分为上下文构建、目标与意图建模、未来解码三类,并将基础定位与可执行性视为新兴延伸。配套贡献包括对Ego4D-LTA和EPIC-KITCHENS-100的协议级审计、多维证据画像及骨干感知对比与消融协议。作者强调,关于大语言模型收益、目标歧义和时间跨度效应的结论应作为需匹配验证的可检验假设,而非因果定论。

🔑 关键词速览

Action Anticipation从部分视频中预测未来人类动作的任务,需处理不完整上下文和时间不确定性。
Large Language Models (LLMs)大规模预训练语言模型,在动作预测中用于引入语言知识或语义推理。
Vision-Language Models (VLMs)联合视觉和语言模态的预训练模型,用于跨模态理解和生成。
Ego4D-LTAEgo4D数据集中的长期动作预测基准,用于评估长时程动作预测性能。
Backbone-Aware Comparison and Ablation Protocol (BCAP)一种考虑骨干网络差异的比较与消融协议,旨在实现公平的模型评估。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅