🔥 今日值得一读 视频压缩新突破!AVIOT用最优传输聚合视觉信息,高压缩比下性能不降反升,多个基准测试媲美未压缩!
Aggregating Visual Information with Optimal Transport for VideoLM Token Compression
arXiv CV (cs.CV) 🔥 重点 #视频理解#最优传输#推理优化 🕐 08-24 12:00
👨‍💼 主理人解读 · 为什么值得关注
高效压缩视频令牌,减少计算负担,同时保留关键视觉信息,提升视频模型推理速度。

📖 AI 总结

视频语言模型将视频表示为密集的视觉令牌序列,存在大量表征冗余,压缩这些序列对降低语言模型解码负担至关重要,核心挑战在于压缩过程中保留分散在各帧中的视觉信息。为此,研究者提出基于最优传输的视觉信息聚合方法(AVIOT),将视频令牌压缩视为将帧观测的密集经验度量传输到紧凑目标度量上,通过源到目标的耦合直接指定压缩视频表示的构建方式。该方法沿任务和空间两个维度进行适配:问题条件调制传输成本并影响各时间段的支撑分配,将表征能力导向与问题相关的内容;在多个空间粒度上,AVIOT计算区域特定的时间传输计划并自适应融合其表示,使同一紧凑表示中的不同区域可从不同时刻提取信息。实验表明,在不同压缩比下,AVIOT在多个视频理解基准上达到或超过未压缩基线,并在高压缩比下保持较强性能。

🔑 关键词速览

Optimal Transport最优传输,一种数学框架,用于在概率分布之间找到最小代价的映射或耦合,常用于度量分布间的差异或进行数据变换。
Video Language Models (VideoLM)视频语言模型,一种多模态模型,能够处理视频和文本输入,并生成文本输出,用于视频理解等任务。
Token Compression标记压缩,指减少视觉标记序列的长度,以降低计算成本,同时尽量保留关键信息。
Empirical Measure经验度量,基于观测样本构建的概率分布,用于表示数据点的分布情况。
Question Conditioning问题条件化,一种机制,根据输入问题调整模型的处理方式,使表示更关注与问题相关的内容。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅