🔥 今日值得一读 谷歌甩出7.4亿参数开源多模态嵌入模型,5种输入统一768维空间!
Google DeepMind Releases EmbeddingGemma 2, a 740M Open Multimodal Embedding Model Built on Gemma 4
MarkTechPost 🔥 重点 多模态开源论文方法 🕐 今天 02:36

📖 AI 总结

Google DeepMind 发布了 EmbeddingGemma 2,一个基于 Gemma 4 架构的 740M 参数开源多模态嵌入模型,采用 Apache 2.0 许可。该模型的核心突破在于将文本、代码、图像、视频和音频统一映射到同一个 768 维向量空间,支持跨模态检索,例如用文字查询检索照片,或用语音备忘录检索视频片段。模型采用模块化设计,包含 270M 的文本与代码骨干、170M 的视觉编码器和 300M 的音频编码器,开发者可按需加载,从纯文本的 270M 到全模态的 740M 灵活配置,且所有配置共享同一向量空间。其 8K token 上下文窗口较前代扩大四倍,可容纳约 29 张图像或 5.5 分钟音频。模型权重已在 Hugging Face 和 Kaggle 上线,并支持 Ollama、llama.cpp 等本地部署方案,主要面向端侧搜索、分类和隐私优先的 RAG 应用。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅