Google 开源 EmbeddingGemma 2:270M 到 740M 的多模态向量模型,代码检索比上一代高 14%,Apache 2.0
一个基于 Gemma 4 的小型向量模型,把文本、代码、图片、视频和音频映射到同一个 768 维空间,可以在端侧跑多模态语义搜索。
// 要点
- 模块化加载:只要文本和代码是 270M,加视觉 440M,加音频 570M,全模态 740M;文本与代码的上下文窗口 8,192 token。
- 输出 768 维向量,借助 Matryoshka 表示学习可截断到 512、256 或 128 维;MTEB (Code) 比 EmbeddingGemma 1 高 14%,多语言文本精度保持不变。
- 端侧:纯文本权重运行约占 191 MB 内存,全模态在 Pixel 11 Pro 上约 567 MB;经量化感知训练压到 INT4 与 INT8。
- 以 Apache 2.0 发布,权重在 Hugging Face,可通过 Ollama、vLLM、Transformers、sentence-transformers、MLX、LiteRT 等使用。
开发者视角这条和 AI 云盘最直接相关:图片、视频、录音和文档进同一个向量空间,就能用一句话跨类型搜文件,不用再为每种格式各接一套模型。我会先拿 270M 的文本版替换现有向量模型做对比,再按需加载视觉模块;128 维截断能把索引存储压下来,但要先在自己的检索集上测召回掉多少。