🔥 今日值得一读 砍掉视觉塔和因果解码器!NeoMME单塔多模态编码器,260M模型索引压缩255倍,每秒处理51.3页!
H Company Releases NeoMME: A Family of 260M and 800M Single-Tower Multimodal Encoders That Drop the Vision Tower and Causal Decoder
MarkTechPost 🔥 重点 多模态检索论文方法 🕐 09-07 05:06

📖 AI 总结

H Company发布了NeoMME,这是一系列参数规模为260M和800M的单塔多模态编码器,摒弃了传统视觉检索模型中常见的视觉塔和因果解码器组件。该模型采用单一Transformer架构,通过相同层处理多语言文本和32×32原始图像块,从随机初始化开始训练。NeoMME-Retriever在ViDoRe v3基准上达到0.523的nDCG@10分数,260M版本在单张NVIDIA L40S上每秒可索引51.3页,CPU上查询编码仅需78.3毫秒。模型支持16,384 token上下文,采用ALBERT风格因子化嵌入和从零训练的BPE分词器,在FLORES-200测试中比ModernBERT减少44.4%的token输出。所有检查点以Apache 2.0协议开源,并获Hugging Face Transformers即时支持。该设计通过消除冗余组件,为文档检索任务提供了更高效、可部署的解决方案。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅