谷歌开源EmbeddingGemma 2,手机本地就能搜索图片视频和音频
谷歌 DeepMind 开源了 EmbeddingGemma 2。它基于 Gemma 4 的架构改进而来,总参数 7.4 亿。官方定位是给手机和笔记本这类消费级硬件做低延迟的语义表示。计算在本地做,不用为了生成嵌入把内容传到云端。
嵌入模型是 AI 应用里做查找和匹配的那一层。它把一段内容压成坐标,坐标越近,内容越相似。搜索、分类、聚类这些功能,底层都是这个逻辑。EmbeddingGemma 2 把文本、代码、图片、视频、音频一起放进同一个 768 维空间,还支持组合输入。
一个空间是关键。EmbeddingGemma 2 从起点统一映射,四种输入一开始就进入共享向量空间。检索范围因此能同时包含图片、视频、音频和代码。RAG 系统也能在混合内容的资料库里工作。模型支持 100 多种语言,代码任务比前代提升约 14%。代码片段和自然语言描述可以在同一个空间里互检。
模块化参数是它贴近设备端的设计。模型由三部分组成:文本模型 270M,视觉编码器 170M,音频编码器 300M。文本模型内部又拆成 130M 的 transformer 和 140M 的 embedder。只做文本时可以不加载视觉和音频编码器,处理图片或声音时再按需加载。这样的规模加取舍空间,消费级设备就能跑。
官方给的上下文窗口是 8K token,能容纳几分钟的音频或视频。超过这个长度的内容放不进去,长音视频不在这个模型的能力范围里。
嵌入向量存多了,存储费用会涨。EmbeddingGemma 2 原生支持 Matryoshka 表示学习(MRL)。向量可以从 768 维截短到 512、256 或 128 维。维度越低越省,官方说最多能把向量存储费用降到原来的约六分之一,质量影响很小。
任务调优也轻量。输入前加一个指令前缀,比如“搜索”“分类”“聚类”,嵌入就按对应任务生成。不加前缀,输出的就是通用嵌入。模型文件已经有 GGUF 格式,llama.cpp 的合并请求也通过了,本地推理工具链已齐。许可证是 Apache 2.0,商用和修改都开放。
社区讨论集中在一个问题上:它能做什么。有人做 AI DJ,想用语义理解自己的音乐库,问它能否替代音频模型 CLAP。有人拿它和阿里 Qwen 团队的 Qwen3-VL-Embedding-2B 比,更完整的结果要等其他人跑出来。也有评论者说自己早就在用 Google 的嵌入模型,自定义记忆栈靠 Google 端点和 MRL 做向量存储。还有一条评论把矛头指向 Unsloth:Google 发布新模型时把下载链接指向 Unsloth。在评论者看来,Google 做了所有辛苦工作,却没有得到充分认可。链接指向第三方下载页,官方的工作在传播中退到背景。
模型本体、工具链和许可证都到位了。实际性能、截断损失、API 端点,这些还要等更多测评才有答案。