Ovis-Embedding 是一种新型全模态嵌入模型,旨在统一处理文本、图像、视频和音频四种模态。与以往为每种模态单独构建编码器的做法不同,该模型采用共享的多模态骨干网络,将不同模态映射到同一表示空间。其核心贡献包括三方面:一是以预训练的 Qwen-omni 模型为骨干,通过低秩初始化和对比学习进行原生全模态初始化;二是构建覆盖多模态及交错数据的高质量语料,并提出同源采样策略以提升批内负样本的信息量;三是引入焦点损失和基于相似度的嵌入蒸馏,并在推理阶段利用低秩特征分解实现紧凑且维度灵活的嵌入。实验表明,该模型在 MMEB-v3、MMEB-v2、MVEB、MAEB 和 RTEB 等基准上均取得最优性能,验证了统一全模态训练在克服模态割裂、推动任意模态间检索方面的有效性。
| Ovis-Embedding | 一种基于共享多模态骨干网络的全模态嵌入模型系列,支持文本、图像、视频和音频的统一表示。 |
| Qwen-omni | 预训练的全模态模型,被用作 Ovis-Embedding 的嵌入骨干网络。 |
| 同源采样 (homogeneous-source sampling) | 一种数据采样策略,将来自同一来源的样本组成批次,以形成任务一致的批次并获取信息丰富的批内负样本。 |
| 嵌入蒸馏 (Embedding Distillation) | 一种基于相似度的知识蒸馏方法,从互补专家模型中迁移细粒度相似性结构以优化嵌入。 |
| MMEB-v3 | 一个多模态嵌入基准测试,用于评估模型在多种模态任务上的性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅