Google DeepMind 发布了 EmbeddingGemma 2,这是一个拥有 7.4 亿参数的开源多模态嵌入模型,基于 Gemma 4 架构构建,采用 Apache 2.0 许可证发布。该模型的前代 EmbeddingGemma 1 已有超过 2000 万次下载。
EmbeddingGemma 2 的核心设计特点是模块化和参数效率。纯文本工作负载仅需 2.7 亿参数,用户可根据需求选配视觉编码器(1.7 亿参数)和音频编码器(3 亿参数)。在 Google Pixel 11 Pro 设备上,纯文本模式仅需约 191MB 活跃内存,完整多模态配置需要约 567MB 内存。
该模型支持 8K 令牌的上下文窗口,是 EmbeddingGemma 1 的 4 倍。在多模态输入方面,单次可处理最多 5.5 分钟的音频、29 张图像或 58 个视频帧。
EmbeddingGemma 2 引入了可截断输出机制:输出向量默认为 768 维,可根据应用场景截断到 512、256 或 128 维,存储空间最多可减少 6 倍。官方博客未说明截断后对检索准确率的影响。
在代码嵌入任务上,EmbeddingGemma 2 在 MTEB Code 基准测试中的表现从 68.76 分提升到 78.68 分,提升幅度为 9.92 分。官方博客未公布其他基准测试的对比数据,也未说明与同类开源模型在多模态检索任务中的性能差异。