本文提出MAGIC,一种面向视觉文档检索(VDR)的无训练后处理压缩方法。现有ColPali等系统采用多向量页面嵌入,patch级向量支持细粒度匹配,但带来大量索引存储和MaxSim评分开销。已有后处理合并方法采用均匀重建目标,与晚期交互检索中稀疏且非均匀的patch使用模式不匹配,激进压缩下会保留低频patch、使检索集中于过少代表向量。MAGIC据此构建MaxSim诱导的压缩代理目标,并用双边际熵最优传输求解:检索需求源边际优先保留高使用patch,均衡目标边际规范保留facet的使用。在ViDoRe基准、多种保留率和检索骨干上,MAGIC均优于强后处理压缩器,激进压缩下提升尤为显著,消融实验验证了两个边际的互补作用。
| 视觉文档检索 (VDR) | 一种基于文档页面视觉表示(如图像块嵌入)进行检索的任务,常用于处理扫描文档或 PDF。 |
| 多向量页面嵌入 | 将每个文档页面表示为多个块级向量的集合,以支持细粒度的证据匹配。 |
| MaxSim | 后期交互检索中常用的相似度评分函数,对查询与文档块向量之间的最大相似度进行求和。 |
| 事后压缩 | 在检索器训练完成后,对已生成的嵌入进行压缩以减少存储和计算开销,无需重新训练模型。 |
| 最优传输 | 一种在概率分布之间寻找最小成本传输方案的数学框架,此处用于优化压缩过程中的块分配。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅