据 SiliconANGLE 报道,谷歌 10 月 6 日发布开源多模态嵌入模型 EmbeddingGemma 2,将图像、音频和视频与文本放进同一个嵌入空间,模型规模小到可以在智能手机上运行。权重已在 Hugging Face 和 Kaggle 上线,采用允许商用的 Apache 2.0 许可。
嵌入模型把内容转换成数字向量,供检索和比对使用。2025 年 9 月谷歌推出第一代 EmbeddingGemma 时,该系列只能处理文本。谷歌 DeepMind 研究工程师萨希尔·杜阿和恩里克·谢克特·维拉在公告中写道,开发者对初代的反应“远超我们的预期”,按他们的统计,下载量已超过 2000 万次。
新版基于谷歌今年 4 月发布的 Gemma 4 架构,参数量为 7.4 亿,是第一代的两倍多。增加的部分主要集中在视觉和音频编码器上,只处理文本的应用可以不加载这两部分。谷歌在一台 Pixel 11 Pro 上用经过量化的版本测试时,2.7 亿参数的文本核心占用约 191 兆字节内存。
应用还需要存储模型输出的结果。每个嵌入是一组 768 个数字,它索引的每张照片、每段视频或每份文档都会在本地向量数据库中增加一条记录。一项名为 Matryoshka 表示学习的训练技术允许开发者把这组数字压缩到最少 128 个,占用空间最多缩小到六分之一。谷歌的开发者指南称,压缩到 256 个数字时,图像、视频和语音检索仍能保留约 95% 的完整质量。
在 Massive Text Embedding Benchmark 的代码部分,EmbeddingGemma 2 得分 78.68,比第一代高出近 10 分,是各项测试中提升最大的一项。谷歌把这一结果推介给为编程智能体构建检索功能的开发者。多语言文本得分几乎没有变化。
谷歌还称,该模型在参数量 10 亿以下的多模态嵌入模型中取得领先结果,并在图像、视频和音频任务上超过了一些参数量是其两倍以上的专用模型。
由于 EmbeddingGemma 2 与 Gemma 4 共用文本分词器和音频编码器,二者同时运行端侧检索增强生成方案时,所需内存少于运行两个互不相关的模型。谷歌面向 Mac 的 AI Edge Foresight 会议应用已经同时运行这两个模型。在谷歌的 AI Edge Gallery 演示应用中,名为 Video Moments Finder 的功能可以依据输入或口述的查询在视频中定位某一场景。
谷歌表示,该模型很快会进入 Gemini Enterprise Agent Platform 的 Model Garden,权重已经可以与 vLLM、llama.cpp 和 Ollama 等开源服务工具配合使用。