🔥 今日值得一读 全模态嵌入新突破!Ovis-Embedding在五大基准上全面达到SOTA
Ovis-Embedding: Pushing the Frontiers of Universal Omni-Modal Embeddings
arXiv AI (cs.AI) 🔥 重点 多模态大模型论文方法 🕐 今天 12:00

📖 AI 总结

Ovis-Embedding 是一种新型全模态嵌入模型,旨在统一处理文本、图像、视频和音频四种模态。与以往为每种模态单独构建编码器的做法不同,该模型采用共享的多模态骨干网络,将不同模态映射到同一表示空间。其核心贡献包括三方面:一是以预训练的 Qwen-omni 模型为骨干,通过低秩初始化和对比学习进行原生全模态初始化;二是构建覆盖多模态及交错数据的高质量语料,并提出同源采样策略以提升批内负样本的信息量;三是引入焦点损失和基于相似度的嵌入蒸馏,并在推理阶段利用低秩特征分解实现紧凑且维度灵活的嵌入。实验表明,该模型在 MMEB-v3、MMEB-v2、MVEB、MAEB 和 RTEB 等基准上均取得最优性能,验证了统一全模态训练在克服模态割裂、推动任意模态间检索方面的有效性。

🔑 关键词速览

Ovis-Embedding一种基于共享多模态骨干网络的全模态嵌入模型系列,支持文本、图像、视频和音频的统一表示。
Qwen-omni预训练的全模态模型,被用作 Ovis-Embedding 的嵌入骨干网络。
同源采样 (homogeneous-source sampling)一种数据采样策略,将来自同一来源的样本组成批次,以形成任务一致的批次并获取信息丰富的批内负样本。
嵌入蒸馏 (Embedding Distillation)一种基于相似度的知识蒸馏方法,从互补专家模型中迁移细粒度相似性结构以优化嵌入。
MMEB-v3一个多模态嵌入基准测试,用于评估模型在多种模态任务上的性能。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅