🔥 今日值得一读 谷歌新模型小到塞进手机,却把文本图像音频视频全塞进一个空间!
Google expands EmbeddingGemma beyond text to images, audio and video
SiliconANGLE 🔥 重点 多模态开源大模型 🕐 今天 06:18

📖 AI 总结

Google发布EmbeddingGemma 2,一款可在智能手机上运行的开源多模态嵌入模型,将初代仅支持文本的能力扩展至图像、音频和视频,并统一映射到同一嵌入空间。该模型基于Gemma 4架构,参数量达7.4亿,其中文本核心为2.7亿参数,量化后在Pixel 11 Pro上仅占用约191MB内存。借助Matryoshka表示学习,嵌入向量可从768维压缩至128维,存储空间最多减少六倍,256维时仍保留约95%的检索质量。在MTEB代码基准上得分78.68,较初代提升近10分。由于与Gemma 4共享文本分词器和音频编码器,端侧RAG部署更省内存。模型以Apache 2.0许可开放,支持商用。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅