EmbeddingGemma 2:开源轻量级多模态嵌入模型
2 天前 4 阅读来源:Google DeepMind Blog
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
谷歌DeepMind本周发布EmbeddingGemma 2,一款可在本地设备上运行的多模态嵌入模型。这是继去年EmbeddingGemma之后的第二代产品,最大的变化是从纯文本扩展到文本、图像、音频、视频的统一嵌入空间——简单说,就是让手机、笔记本这类终端设备能直接理解并检索多种类型的内容,不需要把数据传到云端。模型基于Gemma 4架构,参数规模7.4亿,采用Apache 2.0商业友好许可,开发者可以免费商用。
对跨境卖家和AI应用开发者来说,这个模型有几个值得关注的点。首先是隐私和成本:嵌入计算完全在本地完成,数据不出设备,既规避了跨境数据传输的合规风险,也省去了调用云端API的费用。其次是存储优化:通过Matryoshka表示学习技术,输出向量可以从768维动态截断到512、256甚至128维,本地向量数据库的存储占用最多能压缩6倍。在谷歌Pixel 11 Pro上,纯文本权重仅需约191MB运行内存,完整多模态版本约567MB。性能方面,代码检索能力比上一代提升了9.92分(MTEB Code基准从68.76升至78.68),8K token的上下文窗口可以一次处理约5.5分钟音频、29张图片或58帧视频。开发者社区此前对第一代的反馈超出谷歌预期,下载量已超过2000万次,主要用于设备端搜索和隐私优先的RAG(检索增强生成)流程。EmbeddingGemma 2把这种能力从文本扩展到了全模态,意味着做多语言商品检索、以图搜图、语音搜索商品等场景的团队,现在有了一个可以完全离线运行的轻量方案。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
