该研究针对大规模视频检索中嵌入模型在视觉输入和推理预算受限下的效率问题,提出了一种名为AllocEmbed的自适应分配框架。作者通过实证分析发现,在固定视觉输入预算下,增加时间覆盖范围比保持原始分辨率更能提升检索性能,且两者具有互补作用。AllocEmbed采用“先分配后嵌入”的策略,利用轻量级分配器基于低成本预览为各帧分配不同分辨率,在关键帧保留更多细节,同时降低其他帧的视觉成本。此外,研究还提出了检索驱动策略优化方法,通过排序验证的相似度差距和置信度引导的效率激励,直接从检索反馈中学习分配策略。实验表明,该方法在MMEB-V2和LongRet基准上取得了最优的预算匹配检索性能,且无需修改嵌入模型即可跨骨干网络迁移,为视频检索系统提供了实用的效率优化方案。
| AllocEmbed | 一种先分配后嵌入的框架,通过重新分配视觉输入预算到更多帧来提高视频检索性能。 |
| Retrieval-Driven Policy Optimization (RDPO) | 一种直接从检索反馈中学习分配器的优化方法,利用排名验证的相似性差距和置信度引导的效率激励。 |
| visual-input budget | 视觉输入预算,指在视频嵌入过程中允许使用的总视觉数据量(如像素或帧数)的限制。 |
| temporal coverage | 时间覆盖范围,指从视频中采样的帧所覆盖的时间跨度或帧数,影响对视频内容的全面理解。 |
| spatial fidelity | 空间保真度,指每帧图像的分辨率或细节保留程度,影响对帧内内容的识别精度。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅