🔥 今日值得一读 不重训模型,MAGIC用最优传输压缩视觉文档检索,激进压缩下性能反超强基线!
MAGIC: Marginal-Guided Compression with Optimal Transport for Efficient Visual Document Retrieval
arXiv CV (cs.CV) 🔥 重点 #视觉文档检索#多向量压缩#最优传输#检索优化 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
若你在做ColPali类多向量检索,可用它压缩patch向量索引,显著降低存储与打分成本且无需重训。

📖 AI 总结

本文提出MAGIC,一种面向视觉文档检索(VDR)的无训练后处理压缩方法。现有ColPali等系统采用多向量页面嵌入,patch级向量支持细粒度匹配,但带来大量索引存储和MaxSim评分开销。已有后处理合并方法采用均匀重建目标,与晚期交互检索中稀疏且非均匀的patch使用模式不匹配,激进压缩下会保留低频patch、使检索集中于过少代表向量。MAGIC据此构建MaxSim诱导的压缩代理目标,并用双边际熵最优传输求解:检索需求源边际优先保留高使用patch,均衡目标边际规范保留facet的使用。在ViDoRe基准、多种保留率和检索骨干上,MAGIC均优于强后处理压缩器,激进压缩下提升尤为显著,消融实验验证了两个边际的互补作用。

🔑 关键词速览

视觉文档检索 (VDR)一种基于文档页面视觉表示(如图像块嵌入)进行检索的任务,常用于处理扫描文档或 PDF。
多向量页面嵌入将每个文档页面表示为多个块级向量的集合,以支持细粒度的证据匹配。
MaxSim后期交互检索中常用的相似度评分函数,对查询与文档块向量之间的最大相似度进行求和。
事后压缩在检索器训练完成后,对已生成的嵌入进行压缩以减少存储和计算开销,无需重新训练模型。
最优传输一种在概率分布之间寻找最小成本传输方案的数学框架,此处用于优化压缩过程中的块分配。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅