谷歌开源EmbeddingGemma 2嵌入模型
IT时代网10月7日消息,谷歌发布新一代端侧多模态嵌入模型 EmbeddingGemma 2,首次把文本、代码、图像、视频与音频统一映射到同一个嵌入空间。
EmbeddingGemma 2 基于 Gemma 4 架构构建,采用商用友好的 Apache 2.0 许可,参数量为 7.4 亿,针对端侧推理做了优化。谷歌介绍,上一代 EmbeddingGemma 去年发布后下载量已超过 2000 万次,被开发者用于构建端侧搜索工具和隐私优先的检索增强生成(RAG)流程。
新模型在保持多语言文本能力的同时,代码表现明显提升,MTEB Code 基准从此前的 68.76 提高到 78.68,提升 9.92 分,适合本地代码库索引、语义代码检索以及编程智能体检索等场景。在图像、视频、文档与音频任务上,谷歌称其以不到 10 亿的参数量树立了新的“每参数质量”水准,部分指标甚至超过参数量两倍以上的专用模型。
由于嵌入在本地生成,开发者可以降低流水线时延,并在完全离线的情况下完成跨模态搜索与检索。EmbeddingGemma 2 与 Gemma 4 共享文本分词器和音频编码器,两者能够在同一流水线中协同运行,合并后的内存占用更低。
谷歌同时给出多个落地方向:用文字或图片在本地媒体库中做语义搜索、按文本或音频定位视频中的具体片段、把 EmbeddingGemma 2 与 Gemma 4 组合实现本地文件检索与上下文推理等。相关模型卡、评估指标与开发文档已同步开放。

编辑:林一舟