AI评分 头条 (68)AI 中文改写

EmbeddingGemma 2:开放轻量级多模态嵌入模型

2 天前 3 阅读来源:blog.google

AI 中文改写

原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接

谷歌在10月6日正式发布EmbeddingGemma 2,这是一款面向端侧设备的多模态嵌入模型,首次将文本、图像、音频、视频和代码统一映射到同一个嵌入空间。距离初代EmbeddingGemma发布仅一年,谷歌就完成了从纯文本到全模态的跨越,背后是开发者社区用超过2000万次下载投出的信任票。 初代EmbeddingGemma的定位很明确:为消费级硬件提供一个轻量级的文本嵌入方案,让应用能在本地完成信息整理、搜索和关联,而不必把数据传到云端。这个思路踩中了两个趋势——一是端侧AI算力的快速提升,二是用户和监管对数据隐私的日益重视。开发者用它搭建了本地搜索工具和隐私优先的RAG(检索增强生成)管线,下载量远远超出谷歌预期。正是这个反馈让谷歌决定把能力从文本扩展到更多模态。 EmbeddingGemma 2基于Gemma 4架构,参数规模7.4亿,采用Apache 2.0商业友好许可。它的核心卖点可以概括为三个层面。第一是模态覆盖:过去你要从一段语音备忘录里找某个视频片段,或者用文字搜索几小时的录音,需要多个专用模型配合,现在一个模型就能搞定。第二是灵活性:模型采用模块化设计,纯文本任务最低只需2.7亿参数,视觉编码器1.7亿、音频编码器3亿按需加载。同时借助Matryoshka表示学习技术,输出向量可以从768维动态截断到512、256甚至128维,本地向量数据库的存储和内存占用最多可降低6倍。第三是端侧性能:量化后在Pixel 11 Pro上,纯文本权重仅需约191MB运行内存,全模态模型约567MB。8K token的上下文窗口比上一代扩大了4倍,可处理约5.5分钟音频、29张图片、58帧视频或它们的交错组合。 对跨境电商卖家和出海开发者来说,这款模型的实际意义在于几个具体场景。商品图片和视频的本地语义搜索不再依赖云端API,意味着更低的延迟和更好的隐私合规性;多语言文本嵌入能力配合代码性能的大幅提升(MTEB Code基准从68.76分升至78.68分,提升9.92分),让本地代码库索引和编程Agent的检索变得更实用;而对于需要处理大量商品素材的团队,端侧RAG管线可以在离线环境下运行,不必担心数据出境问题。在1B参数以下的同类模型中,EmbeddingGemma 2在文本、视觉和音频任务上已经达到领先水平,部分指标甚至超过参数量两倍以上的专用模型。

以上为 AI 中文改写版本,如需查看英文原文请访问

英文原文 · blog.google

内容版权归原作者及 blog.google 所有

这篇文章对你有帮助吗?
觉得有用?分享给更多人

留言 · 0 条

暂无留言,来说两句吧

留言经合规过滤后展示,禁止违法内容