Google DeepMind 于 2026 年 10 月 6 日正式发布 EmbeddingGemma 2,这是继去年 EmbeddingGemma 之后的新一代开放嵌入模型。官方数据显示,初代 EmbeddingGemma 下载量已超过 2000 万次,被广泛用于端侧搜索与隐私优先的 RAG 流水线。EmbeddingGemma 2 在此基础上将能力从纯文本扩展到代码、图像、视频和音频,并采用 Apache 2.0 商业友好许可。
架构与多模态对齐机制
EmbeddingGemma 2 基于 Gemma 4 架构构建,总参数量 740M。其核心设计是模块化:文本工作负载最低只需 270M 参数,视觉编码器可选增加 170M,音频编码器可选增加 300M。这种设计意味着开发者可以按需组合,而非强制加载完整多模态权重。
模型原生将文本、图像、音频、视频的组合映射到统一嵌入空间。官方描述其与 Gemini Embedding 系列共享底层技术,并复用 Gemma 4 的文本 tokenizer 和音频编码器。这一共享机制带来一个关键工程收益:当 EmbeddingGemma 2 与 Gemma 4 生成模型配合部署时,两者可在统一流水线中运行,降低合计内存占用。
轻量化与存储优化
EmbeddingGemma 2 采用 Matryoshka Representation Learning(MRL),输出向量可从 768 维动态截断至 512、256 或 128 维。官方称此举可为本地向量数据库和内存使用带来最高 6 倍的存储缩减。对于端侧向量检索场景,这意味着开发者可以在召回率与存储成本之间做连续调节,而不必更换模型。
端侧性能方面,官方给出 Google Pixel 11 Pro 上的量化数据:纯文本权重活跃内存约 191MB,完整多模态模型约 567MB。上下文窗口为 8K token,是初代的 4 倍,可处理约 5.5 分钟音频、29 张图像、58 个视频帧,或它们的交错组合。
基准表现
官方公布的评测结果显示,EmbeddingGemma 2 在 sub-1B 多模态嵌入模型中处于领先位置。文本方面延续了初代的多语言能力;代码方面在 MTEB Code 上从 68.76 提升至 78.68,提升 9.92 分,官方定位其适用于本地代码库索引、语义代码搜索和编码 agent 检索。在图像、视频、文档和音频任务上,官方称其质量-参数比优于同规模模型,甚至超过部分参数量两倍以上的专用模型。完整评测指标见官方 model card。
端侧 RAG 与隐私部署
EmbeddingGemma 2 的定位是让语义搜索、路由和检索完全在边缘硬件上运行。本地生成嵌入可减少数据外传、降低流水线延迟,并支持完全离线的跨模态搜索。官方给出的典型场景包括:从语音备忘录中定位特定视频片段,或基于文本查询检索数小时音频记录。
部署路径方面,官方与多方合作提供了较完整的工具链:模型权重发布于 Hugging Face 和 Kaggle,Gemini Enterprise Agent Platform Model Garden 即将上线;端侧可通过 Google AI Edge 的 MediaPipe 或 LiteRT 集成,浏览器端支持 transformers.js 与 WebGPU;服务端可用 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama 和 LMStudio;向量存储方面官方提及 Qdrant。微调可参考 Unsloth 的指南。
选型建议与边界
从工程视角看,EmbeddingGemma 2 的差异化在于三点:一是原生多模态统一嵌入空间,避免为不同模态维护多套检索索引;二是模块化参数设计,文本场景可只加载 270M 部分;三是 MRL 带来的向量维度弹性。
但需注意,官方资料未披露各模态编码器的具体对齐训练细节、量化方案的具体类型,以及不同维度截断下的召回率衰减曲线。实际选型时,建议在目标硬件上以真实业务数据验证 128/256/512 维截断后的检索质量,并确认所选推理框架对多模态输入的支持程度。对于纯文本 RAG,初代 EmbeddingGemma 或更小模型可能仍是更经济的选项;当业务涉及音频、视频或代码混合检索时,EmbeddingGemma 2 的统一嵌入空间才体现出结构性优势。