该研究提出了一种名为“结构化视频提示”的推理时方法,旨在提升视频语言模型在时空推理任务中的表现。该方法无需重新训练模型或改变解码方式,仅通过在输入视频中注入轻量级的空间与时间结构信息,为模型提供显式的证据组织锚点。研究在两个视频基准测试和两个开源视频语言模型上进行了评估,结果显示结构化输入在多个任务中带来了性能提升,但增益因模型和任务而异。这一发现表明,视频语言模型的某些失败不仅源于推理能力的局限,也与视频证据在推理阶段的呈现方式密切相关。该研究为改善视频理解提供了一种简单实用的新方向,强调输入组织方式对模型性能的重要影响。
| Video-language models (VLMs) | 视频-语言模型,能够处理视频和文本输入并生成文本输出的模型。 |
| structured video prompting | 结构化视频提示,一种无需训练的推理时方法,通过添加空间和时间结构来增强视频输入。 |
| inference-time method | 推理时方法,在模型推理阶段应用的技术,不改变模型权重。 |
| spatial structure | 空间结构,指视频帧中物体或区域的布局信息,用于提供空间锚点。 |
| temporal structure | 时间结构,指视频帧之间的时间顺序或事件演变信息,用于提供时间锚点。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅