### [740M小模型把AI搜索装进手机:EmbeddingGemma 2离线搜照片、视频和录音,完整模型约567MB](https://www.zuoshipin.com/article/47829) **Published:** 2026-10-08T06:35:10 **Author:** 天才交易员 **Excerpt:** Google开源EmbeddingGemma 2:740M参数、统一768维多模态向量空间、8K上下文,量化后… **文字、代码、图片、视频与音频进入同一个768维空间;支持100多种语言、8K上下文和按需加载,隐私优先的本地搜索终于更容易落地。** **先说预测:**EmbeddingGemma 2不会让手机立刻变成万能AI,但它很可能成为下一代相册、录音、视频和代码搜索的底层零件。真正有吸引力的不是740M参数,而是**敏感文件可以留在本地,断网仍能按“意思”查找**。 Google正式开放EmbeddingGemma 2。这是Gemma系列首个原生多模态嵌入模型,可把文字、代码、图片、视频、音频及其组合映射到同一个768维向量空间。 [![EmbeddingGemma 2支持文字、代码、图像、视频与音频统一检索](https://admin.zuoshipin.com/wp-content/uploads/2026/10/embeddinggemma-2-image01.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/10/embeddinggemma-2-image01.webp) EmbeddingGemma 2支持文字、代码、图像、视频与音频统一检索。图片已压缩为WebP,点击查看大图。 ## 01 / 嵌入模型不是聊天机器人,它负责“找到相关内容” 嵌入模型会把内容转换成一串数字,也就是向量。语义相近的内容在向量空间里距离更近,因此“鸟在唱歌”可以找到鸟的照片、鸟叫录音和相关视频,而不必要求文件名里出现完全相同的关键词。 [![开发者在浏览器本地运行EmbeddingGemma 2的搜索演示](https://admin.zuoshipin.com/wp-content/uploads/2026/10/embeddinggemma-2-image02.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/10/embeddinggemma-2-image02.webp) 开发者在浏览器本地运行EmbeddingGemma 2的搜索演示。图片已压缩为WebP,点击查看大图。 [![用文字查询同时找到相关图片与鸟叫录音](https://admin.zuoshipin.com/wp-content/uploads/2026/10/embeddinggemma-2-image03.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/10/embeddinggemma-2-image03.webp) 用文字查询同时找到相关图片与鸟叫录音。图片已压缩为动画WebP,点击查看大图。 [![不同模态内容映射到同一768维向量空间](https://admin.zuoshipin.com/wp-content/uploads/2026/10/embeddinggemma-2-image04.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/10/embeddinggemma-2-image04.webp) 不同模态内容映射到同一768维向量空间。图片已压缩为动画WebP,点击查看大图。 它不会自己组织最终答案。做完整RAG时,EmbeddingGemma 2负责检索,向量索引负责保存和排序,Gemma 4或其他生成模型再根据找到的内容回答。 ## 02 / 740M参数为什么能塞进手机? 模型由三个可按需加载的部分组成:270M文本模型、170M视觉编码器和300M音频编码器。只做文字或代码搜索时无需加载视觉与音频部分,文字加图片则可关闭音频编码器。 | 使用模式 | 有效参数 | 适合场景 | | --- | --- | --- | | 仅文字/代码 | 270M | 笔记、文档、代码库搜索 | | 文字+图片 | 440M | 相册、商品和视觉资料检索 | | 文字+音频 | 570M | 会议、录音与声音搜索 | | 完整多模态 | 740M | 图片、视频、音频和文字统一索引 | 在Google Pixel 11 Pro的量化测试中,纯文本权重最低约占191MB活动内存,完整多模态模型约567MB。**这不是所有设备的固定占用**,实际数字还取决于运行框架、精度、缓存和输入长度。 ## 03 / 8K上下文能装多少多媒体? 全部模态共享8192 Token上下文。按官方默认预算,单一模态最多约可容纳8192文字Token、29张图片、58帧视频,或327秒音频。图片、视频和文字混合时会共同消耗预算。 视频默认每秒采样一帧,音频建议使用16kHz单声道。开发者还可以调节视觉Token预算,在速度、上下文容量和细节质量之间取舍。 ## 04 / 官方成绩亮眼,但基准不等于你的素材库 官方模型卡显示,EmbeddingGemma 2在代码MTEB上由上一代68.76提升到78.68;多模态评测中,图像MMEB v2为57.28、视频为50.67、音频检索MSEB为69.54。 [![Google Gemma团队介绍EmbeddingGemma 2的代码检索与多模态能力](https://admin.zuoshipin.com/wp-content/uploads/2026/10/embeddinggemma-2-image05.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/10/embeddinggemma-2-image05.webp) Google Gemma团队介绍EmbeddingGemma 2的代码检索与多模态能力。图片已压缩为WebP,点击查看大图。 [![EmbeddingGemma 2与同量级模型的官方多模态检索成绩](https://admin.zuoshipin.com/wp-content/uploads/2026/10/embeddinggemma-2-image06.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/10/embeddinggemma-2-image06.webp) EmbeddingGemma 2与同量级模型的官方多模态检索成绩。图片已压缩为WebP,点击查看大图。 **评测提醒:**这些是Google公布的全精度检查点成绩。手机量化、特定语言、长视频、嘈杂录音和私有代码库可能出现不同结果,上线前应使用自己的数据计算Recall@K和误检率。 ## 05 / 快速部署:先从文字和代码搜索开始 ``` pip install -U sentence-transformers transformers from sentence_transformers import SentenceTransformer model = SentenceTransformer("google/embeddinggemma-2") query = model.encode( "task: code retrieval | query: 找到处理视频时间轴的函数", normalize_embeddings=True, ) document = model.encode( "title: timeline.py | text: def seek_to_frame(...)", normalize_embeddings=True, ) score = query @ document ``` 1. 先用官方任务前缀区分搜索、问答、代码检索和相似度任务。 2. 给文档附上标题;没有标题时使用`title: none`。 3. 如果截断到256或128维,必须重新归一化,并保证查询与索引维度一致。 4. 批量建立索引时保存模型版本、维度和预处理参数,升级后重新评估。 5. 私密内容即使留在本地,也要考虑设备加密、应用权限和索引删除机制。 ## 06 / 和上一代、云端Gemini Embedding 2有什么不同? | 产品 | 主要能力 | 部署方式 | 适合场景 | | --- | --- | --- | --- | | **EmbeddingGemma 2** | 文字、代码、图片、视频、音频 | 开放权重,本地或边缘设备 | 隐私、离线、低延迟 | | EmbeddingGemma 1 | 以多语言文字为主 | 本地部署 | 轻量文字搜索 | | Gemini Embedding 2 | 云端多模态嵌入,含PDF | Gemini API | 大规模托管与弹性调用 | ## 07 / 第三方实测怎么看? 早期开发者展示了浏览器本地查询、Apple M5 Max量化速度、跨语言笔记搜索和开发板实验。它们证明了模型有较强工程可行性,但22毫秒、817条每秒或97%命中率都是特定硬件与数据集上的个案。 [![开发者测试EmbeddingGemma 2量化版的向量相似度与速度](https://admin.zuoshipin.com/wp-content/uploads/2026/10/embeddinggemma-2-image07.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/10/embeddinggemma-2-image07.webp) 开发者测试EmbeddingGemma 2量化版的向量相似度与速度。图片已压缩为WebP,点击查看大图。 [![EmbeddingGemma 2在开发板与ESP32-S3设备上的边缘搜索实验](https://admin.zuoshipin.com/wp-content/uploads/2026/10/embeddinggemma-2-image08.webp)](https://admin.zuoshipin.com/wp-content/uploads/2026/10/embeddinggemma-2-image08.webp) EmbeddingGemma 2在开发板与ESP32-S3设备上的边缘搜索实验。图片已压缩为WebP,点击查看大图。 可靠评测应固定量化版本、输入长度、索引规模和候选数量,并分别记录建库时间、查询P50/P95延迟、Recall@5/10、内存峰值与电量消耗。 ## 08 / 做视频网观点:本地多媒体资产终于有了更轻的“语义目录” 对视频团队来说,EmbeddingGemma 2最现实的价值不是聊天,而是给素材建立语义索引:用“雨夜街道反光”“人物回头”“鸟叫和风声”这类自然语言,找到原本散落在硬盘里的镜头与录音。 它不会替代专业媒体资产管理系统,但可以成为检索层。先从小规模素材库验证召回率,再决定是否扩展到全部项目;涉及客户素材时,本地部署和可删除索引会比炫目的Demo更重要。 ## 相关站内内容 **EmbeddingGemma 2站内导航:**[https://www.zuoshipin.com/link/47828.html](https://www.zuoshipin.com/link/47828.html) **Gemini站内导航:**[https://www.zuoshipin.com/link/864.html](https://www.zuoshipin.com/link/864.html) **Codex站内导航:**[https://www.zuoshipin.com/link/1474.html](https://www.zuoshipin.com/link/1474.html) **Google Co-Scientist站内导航:**[https://www.zuoshipin.com/link/30603.html](https://www.zuoshipin.com/link/30603.html) ## 官方资料 [Google:EmbeddingGemma 2官方发布说明](https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/) [EmbeddingGemma 2官方模型卡](https://ai.google.dev/gemma/docs/embeddinggemma/model_card_2) [EmbeddingGemma 2官方模型与权重](https://huggingface.co/google/embeddinggemma-2) **Tags:** EmbeddingGemma 2, Google Gemma, 多模态搜索, 嵌入模型, 端侧AI **Categories:** AI资讯 ---