谷歌于周一推出 EmbeddingGemma 2,这是其面向设备端部署的多模态嵌入模型新一代产品,可在本地硬件上统一处理文本、图像、音频与视频,主打数据隐私保护与离线推理能力,对移动端 AI 应用开发者具有直接吸引力。
新模型拥有 7.4 亿参数,基于 Gemma 4 架构构建,采用 Apache 2.0 商业友好型许可证开源发布。
谷歌表示,该模型在 MTEB 代码评测中较上一代提升 9.92 分,并在 sub-1B 规模多模态嵌入模型中取得领先基准成绩,部分指标甚至超越体量两倍以上的专项模型。

EmbeddingGemma 2 将直接影响以本地搜索、隐私优先 RAG(检索增强生成)流水线为核心场景的应用开发格局。
上一代产品 EmbeddingGemma 自发布以来已累计超过 2000 万次下载,此次升级将嵌入能力从纯文本扩展至多模态,有望进一步扩大谷歌在端侧 AI 基础设施领域的开发者生态优势。
参数精简,端侧推理成本可控
EmbeddingGemma 2 的核心设计逻辑是在有限硬件资源下实现高质量多模态推理。模型采用模块化架构,纯文本工作负载仅需约 2.7 亿参数,视觉编码器(1.7 亿参数)与音频编码器(3 亿参数)可按需加载,全模态版本总参数量为 7.4 亿。
谷歌公布的测试数据显示,在经过量化处理后,该模型在 Google Pixel 11 Pro 上运行时,纯文本权重仅需约 191MB 活跃内存,全多模态模式所需内存约为 567MB。对于内存受限的消费级设备而言,这一指标具有实际部署意义。
在存储效率层面,模型引入 Matryoshka 表示学习(MRL)技术,允许开发者将输出向量从 768 维动态截断至 512、256 或 128 维,最高可实现本地向量数据库 6 倍的存储压缩比。
上下文窗口扩大四倍,多模态处理能力提升
EmbeddingGemma 2 将上下文窗口扩展至 8K token,是上一代 4 倍,可在本地硬件上直接处理最长约 5.5 分钟的音频、29 张图像、58 帧视频,或上述模态的交错组合输入。
这一能力使跨模态语义检索场景在端侧变得可行,例如通过语音备忘录定位特定视频片段,或基于文本查询检索多小时音频录音。
在代码检索能力上,模型在 MTEB Code 基准测试中从 68.76 分提升至 78.68 分,升幅达 9.92 分,适用于本地代码库索引、语义代码搜索及编程智能体检索等场景。
谷歌表示,该模型与上一代保持相当的多语言文本嵌入性能,同时在图像、视频、文档和音频维度均有质量提升。
与 Gemma 4 协同,支持全离线 RAG 流水线
EmbeddingGemma 2 与谷歌生成式模型 Gemma 4 共享文本分词器与音频编码器,二者可组合运行于同一推理流水线,并实现更低的综合内存占用。
这一设计为开发者提供了一条在设备本地构建完整 RAG 流水线的路径,全程无需连接云端服务器,数据不离开终端设备。
谷歌指出,本地生成嵌入有助于确保数据隐私、降低流水线延迟,并使跨模态搜索与检索功能在完全离线状态下运行。这一定位与当前部分企业和开发者对数据主权和隐私合规的关注相契合。
模型已开源,相关评测指标及模型信息可通过 EmbeddingGemma 2 model card 查阅。


登录后才可以发布评论哦
打开小程序可以发布评论哦