这篇综述聚焦语言增强的视频动作预判,即从部分视频中预测未来人类动作的任务。作者指出,近期研究虽引入大语言模型、视觉语言模型或语言语义,但由于任务设定、视觉预训练、监督方式、解码器设计与评测代码常同时变动,所报告的增益难以解读。为此,文章提出一张证据感知的设计图谱,将任务范式与语言信息介入的环节交叉对应:任务沿六个维度划分为单动作、序列、物体交互、跨视角和规划导向五类,语言介入则分为上下文构建、目标与意图建模、未来解码三类,并将基础定位与可执行性视为新兴延伸。配套贡献包括对Ego4D-LTA和EPIC-KITCHENS-100的协议级审计、多维证据画像及骨干感知对比与消融协议。作者强调,关于大语言模型收益、目标歧义和时间跨度效应的结论应作为需匹配验证的可检验假设,而非因果定论。
| Action Anticipation | 从部分视频中预测未来人类动作的任务,需处理不完整上下文和时间不确定性。 |
| Large Language Models (LLMs) | 大规模预训练语言模型,在动作预测中用于引入语言知识或语义推理。 |
| Vision-Language Models (VLMs) | 联合视觉和语言模态的预训练模型,用于跨模态理解和生成。 |
| Ego4D-LTA | Ego4D数据集中的长期动作预测基准,用于评估长时程动作预测性能。 |
| Backbone-Aware Comparison and Ablation Protocol (BCAP) | 一种考虑骨干网络差异的比较与消融协议,旨在实现公平的模型评估。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅