视频语言模型将视频表示为密集的视觉令牌序列,存在大量表征冗余,压缩这些序列对降低语言模型解码负担至关重要,核心挑战在于压缩过程中保留分散在各帧中的视觉信息。为此,研究者提出基于最优传输的视觉信息聚合方法(AVIOT),将视频令牌压缩视为将帧观测的密集经验度量传输到紧凑目标度量上,通过源到目标的耦合直接指定压缩视频表示的构建方式。该方法沿任务和空间两个维度进行适配:问题条件调制传输成本并影响各时间段的支撑分配,将表征能力导向与问题相关的内容;在多个空间粒度上,AVIOT计算区域特定的时间传输计划并自适应融合其表示,使同一紧凑表示中的不同区域可从不同时刻提取信息。实验表明,在不同压缩比下,AVIOT在多个视频理解基准上达到或超过未压缩基线,并在高压缩比下保持较强性能。
| Optimal Transport | 最优传输,一种数学框架,用于在概率分布之间找到最小代价的映射或耦合,常用于度量分布间的差异或进行数据变换。 |
| Video Language Models (VideoLM) | 视频语言模型,一种多模态模型,能够处理视频和文本输入,并生成文本输出,用于视频理解等任务。 |
| Token Compression | 标记压缩,指减少视觉标记序列的长度,以降低计算成本,同时尽量保留关键信息。 |
| Empirical Measure | 经验度量,基于观测样本构建的概率分布,用于表示数据点的分布情况。 |
| Question Conditioning | 问题条件化,一种机制,根据输入问题调整模型的处理方式,使表示更关注与问题相关的内容。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅