本文针对多模态大语言模型在长视频理解中因帧数庞大而只能处理少量采样帧、且通常采用与问题无关的均匀采样这一局限,提出了一种面向多项选择题的免训练、模型无关的帧选择方法。该方法首次将答案选项作为推理阶段的语义线索,将其附加到查询文本中以扩展查询,并通过直接计算查询与帧之间的对齐分数来筛选帧。具体流程为:先以固定速率对视频帧进行子采样构建紧凑候选池,再依据每帧在所有问答对上的最大余弦相似度打分,从而选出与问题最相关的帧,在保持固定token预算的同时提升视觉证据的相关性。研究在MLVU、Video-MME和LongVideoBench三个基准上,使用LLaVA-Mini、Qwen2-VL和LLaVA-Video三种模型进行评估,结果表明在相同帧预算下,答案感知的帧选择方法总体优于均匀采样及现有免训练帧选择方法。
| MLLMs | 多模态大语言模型,能够同时处理文本、图像和视频等多种模态输入的大型语言模型。 |
| Query-frame alignment | 查询-帧对齐,一种通过计算查询文本与视频帧之间的相似度来评估帧相关性的机制。 |
| Training-free | 无需训练,指方法在应用时不需要额外的模型训练或微调过程。 |
| Token budget | 令牌预算,指模型在单次推理中能够处理的最大令牌数量限制。 |
| Multiple-choice questions | 多项选择题,一种问题形式,要求从多个给定选项中选择正确答案。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅