文字、代码、图片、视频与音频进入同一个768维空间;支持100多种语言、8K上下文和按需加载,隐私优先的本地搜索终于更容易落地。
先说预测:EmbeddingGemma 2不会让手机立刻变成万能AI,但它很可能成为下一代相册、录音、视频和代码搜索的底层零件。真正有吸引力的不是740M参数,而是敏感文件可以留在本地,断网仍能按“意思”查找。
Google正式开放EmbeddingGemma 2。这是Gemma系列首个原生多模态嵌入模型,可把文字、代码、图片、视频、音频及其组合映射到同一个768维向量空间。

01 / 嵌入模型不是聊天机器人,它负责“找到相关内容”
嵌入模型会把内容转换成一串数字,也就是向量。语义相近的内容在向量空间里距离更近,因此“鸟在唱歌”可以找到鸟的照片、鸟叫录音和相关视频,而不必要求文件名里出现完全相同的关键词。



它不会自己组织最终答案。做完整RAG时,EmbeddingGemma 2负责检索,向量索引负责保存和排序,Gemma 4或其他生成模型再根据找到的内容回答。
02 / 740M参数为什么能塞进手机?
模型由三个可按需加载的部分组成:270M文本模型、170M视觉编码器和300M音频编码器。只做文字或代码搜索时无需加载视觉与音频部分,文字加图片则可关闭音频编码器。
| 使用模式 | 有效参数 | 适合场景 |
|---|---|---|
| 仅文字/代码 | 270M | 笔记、文档、代码库搜索 |
| 文字+图片 | 440M | 相册、商品和视觉资料检索 |
| 文字+音频 | 570M | 会议、录音与声音搜索 |
| 完整多模态 | 740M | 图片、视频、音频和文字统一索引 |
在Google Pixel 11 Pro的量化测试中,纯文本权重最低约占191MB活动内存,完整多模态模型约567MB。这不是所有设备的固定占用,实际数字还取决于运行框架、精度、缓存和输入长度。
03 / 8K上下文能装多少多媒体?
全部模态共享8192 Token上下文。按官方默认预算,单一模态最多约可容纳8192文字Token、29张图片、58帧视频,或327秒音频。图片、视频和文字混合时会共同消耗预算。
视频默认每秒采样一帧,音频建议使用16kHz单声道。开发者还可以调节视觉Token预算,在速度、上下文容量和细节质量之间取舍。
04 / 官方成绩亮眼,但基准不等于你的素材库
官方模型卡显示,EmbeddingGemma 2在代码MTEB上由上一代68.76提升到78.68;多模态评测中,图像MMEB v2为57.28、视频为50.67、音频检索MSEB为69.54。


评测提醒:这些是Google公布的全精度检查点成绩。手机量化、特定语言、长视频、嘈杂录音和私有代码库可能出现不同结果,上线前应使用自己的数据计算Recall@K和误检率。
05 / 快速部署:先从文字和代码搜索开始
pip install -U sentence-transformers transformers
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("google/embeddinggemma-2")
query = model.encode(
"task: code retrieval | query: 找到处理视频时间轴的函数",
normalize_embeddings=True,
)
document = model.encode(
"title: timeline.py | text: def seek_to_frame(...)",
normalize_embeddings=True,
)
score = query @ document
- 先用官方任务前缀区分搜索、问答、代码检索和相似度任务。
- 给文档附上标题;没有标题时使用
title: none。 - 如果截断到256或128维,必须重新归一化,并保证查询与索引维度一致。
- 批量建立索引时保存模型版本、维度和预处理参数,升级后重新评估。
- 私密内容即使留在本地,也要考虑设备加密、应用权限和索引删除机制。
06 / 和上一代、云端Gemini Embedding 2有什么不同?
| 产品 | 主要能力 | 部署方式 | 适合场景 |
|---|---|---|---|
| EmbeddingGemma 2 | 文字、代码、图片、视频、音频 | 开放权重,本地或边缘设备 | 隐私、离线、低延迟 |
| EmbeddingGemma 1 | 以多语言文字为主 | 本地部署 | 轻量文字搜索 |
| Gemini Embedding 2 | 云端多模态嵌入,含PDF | Gemini API | 大规模托管与弹性调用 |
07 / 第三方实测怎么看?
早期开发者展示了浏览器本地查询、Apple M5 Max量化速度、跨语言笔记搜索和开发板实验。它们证明了模型有较强工程可行性,但22毫秒、817条每秒或97%命中率都是特定硬件与数据集上的个案。


可靠评测应固定量化版本、输入长度、索引规模和候选数量,并分别记录建库时间、查询P50/P95延迟、Recall@5/10、内存峰值与电量消耗。
08 / 做视频网观点:本地多媒体资产终于有了更轻的“语义目录”
对视频团队来说,EmbeddingGemma 2最现实的价值不是聊天,而是给素材建立语义索引:用“雨夜街道反光”“人物回头”“鸟叫和风声”这类自然语言,找到原本散落在硬盘里的镜头与录音。
它不会替代专业媒体资产管理系统,但可以成为检索层。先从小规模素材库验证召回率,再决定是否扩展到全部项目;涉及客户素材时,本地部署和可删除索引会比炫目的Demo更重要。
相关站内内容
EmbeddingGemma 2站内导航:https://www.zuoshipin.com/link/47828.html
Gemini站内导航:https://www.zuoshipin.com/link/864.html
Codex站内导航:https://www.zuoshipin.com/link/1474.html
Google Co-Scientist站内导航:https://www.zuoshipin.com/link/30603.html






