谷歌开源了能本地跑的多模态AI嵌入模型
有人想在自己电脑上搜硬盘里的照片,又不想把照片上传到云端搜图工具泄露隐私,这个需求现在有了新的解决方案。
谷歌DeepMind发布了EmbeddingGemma 2,这是全球首个原生多模态开源端侧嵌入(把不同类型信息转成AI能理解的统一向量格式)模型。它一共有7.4亿参数,能把文本、代码、图像、音频、视频都映射到同一个共享空间里,所有计算都在你自己的设备上完成。
它的前代产品EmbeddingGemma发布至今下载量已经超过2000万次,这次新版本已经上线了Ollama平台,普通用户只需要一行命令就能拉取使用。已经有开发者用它在本地设备上搭建了图片搜索demo,给30个分类共300张照片做索引,还能用额外的20张测试图做搜索。
@GoogleDeepMind 认为:EmbeddingGemma 2拓展了文本之外的能力,能统一处理多种格式的内容。@ollama 认为:它专为消费级设备设计,开箱就能用,不需要复杂配置。
对于普通人来说,这意味着以后想要做本地私人搜索,不用再依赖大公司的云端服务了。比如你存在电脑里的私人照片、工作文档,想要做内容搜索或者整理,全程数据都不用出本地,隐私能得到严格保护。
对于开发者来说,想要做隐私优先的本地搜索、检索增强生成(让AI调用本地数据生成内容)应用,也有了现成的开源方案,不需要自己从零训练模型。它还支持针对特定领域做微调,适配不同的使用场景。
这个模型会改变本地AI应用的开发门槛,以后越来越多的AI工具能不用联网就跑在你自己的手机、电脑上。这会让更多人愿意用AI整理自己的私人数据吗?