暂无菜单项

740M小模型把AI搜索装进手机:EmbeddingGemma 2离线搜照片、视频和录音,完整模型约567MB

发布于
14

文字、代码、图片、视频与音频进入同一个768维空间;支持100多种语言、8K上下文和按需加载,隐私优先的本地搜索终于更容易落地。

先说预测:EmbeddingGemma 2不会让手机立刻变成万能AI,但它很可能成为下一代相册、录音、视频和代码搜索的底层零件。真正有吸引力的不是740M参数,而是敏感文件可以留在本地,断网仍能按“意思”查找。

Google正式开放EmbeddingGemma 2。这是Gemma系列首个原生多模态嵌入模型,可把文字、代码、图片、视频、音频及其组合映射到同一个768维向量空间。

EmbeddingGemma 2支持文字、代码、图像、视频与音频统一检索
EmbeddingGemma 2支持文字、代码、图像、视频与音频统一检索。图片已压缩为WebP,点击查看大图。

01 / 嵌入模型不是聊天机器人,它负责“找到相关内容”

嵌入模型会把内容转换成一串数字,也就是向量。语义相近的内容在向量空间里距离更近,因此“鸟在唱歌”可以找到鸟的照片、鸟叫录音和相关视频,而不必要求文件名里出现完全相同的关键词。

开发者在浏览器本地运行EmbeddingGemma 2的搜索演示
开发者在浏览器本地运行EmbeddingGemma 2的搜索演示。图片已压缩为WebP,点击查看大图。
用文字查询同时找到相关图片与鸟叫录音
用文字查询同时找到相关图片与鸟叫录音。图片已压缩为动画WebP,点击查看大图。
不同模态内容映射到同一768维向量空间
不同模态内容映射到同一768维向量空间。图片已压缩为动画WebP,点击查看大图。

它不会自己组织最终答案。做完整RAG时,EmbeddingGemma 2负责检索,向量索引负责保存和排序,Gemma 4或其他生成模型再根据找到的内容回答。

02 / 740M参数为什么能塞进手机?

模型由三个可按需加载的部分组成:270M文本模型、170M视觉编码器和300M音频编码器。只做文字或代码搜索时无需加载视觉与音频部分,文字加图片则可关闭音频编码器。

使用模式 有效参数 适合场景
仅文字/代码 270M 笔记、文档、代码库搜索
文字+图片 440M 相册、商品和视觉资料检索
文字+音频 570M 会议、录音与声音搜索
完整多模态 740M 图片、视频、音频和文字统一索引

在Google Pixel 11 Pro的量化测试中,纯文本权重最低约占191MB活动内存,完整多模态模型约567MB。这不是所有设备的固定占用,实际数字还取决于运行框架、精度、缓存和输入长度。

03 / 8K上下文能装多少多媒体?

全部模态共享8192 Token上下文。按官方默认预算,单一模态最多约可容纳8192文字Token、29张图片、58帧视频,或327秒音频。图片、视频和文字混合时会共同消耗预算。

视频默认每秒采样一帧,音频建议使用16kHz单声道。开发者还可以调节视觉Token预算,在速度、上下文容量和细节质量之间取舍。

04 / 官方成绩亮眼,但基准不等于你的素材库

官方模型卡显示,EmbeddingGemma 2在代码MTEB上由上一代68.76提升到78.68;多模态评测中,图像MMEB v2为57.28、视频为50.67、音频检索MSEB为69.54。

Google Gemma团队介绍EmbeddingGemma 2的代码检索与多模态能力
Google Gemma团队介绍EmbeddingGemma 2的代码检索与多模态能力。图片已压缩为WebP,点击查看大图。
EmbeddingGemma 2与同量级模型的官方多模态检索成绩
EmbeddingGemma 2与同量级模型的官方多模态检索成绩。图片已压缩为WebP,点击查看大图。

评测提醒:这些是Google公布的全精度检查点成绩。手机量化、特定语言、长视频、嘈杂录音和私有代码库可能出现不同结果,上线前应使用自己的数据计算Recall@K和误检率。

05 / 快速部署:先从文字和代码搜索开始

pip install -U sentence-transformers transformers

from sentence_transformers import SentenceTransformer

model = SentenceTransformer("google/embeddinggemma-2")
query = model.encode(
    "task: code retrieval | query: 找到处理视频时间轴的函数",
    normalize_embeddings=True,
)
document = model.encode(
    "title: timeline.py | text: def seek_to_frame(...)",
    normalize_embeddings=True,
)
score = query @ document
  1. 先用官方任务前缀区分搜索、问答、代码检索和相似度任务。
  2. 给文档附上标题;没有标题时使用title: none。
  3. 如果截断到256或128维,必须重新归一化,并保证查询与索引维度一致。
  4. 批量建立索引时保存模型版本、维度和预处理参数,升级后重新评估。
  5. 私密内容即使留在本地,也要考虑设备加密、应用权限和索引删除机制。

06 / 和上一代、云端Gemini Embedding 2有什么不同?

产品 主要能力 部署方式 适合场景
EmbeddingGemma 2 文字、代码、图片、视频、音频 开放权重,本地或边缘设备 隐私、离线、低延迟
EmbeddingGemma 1 以多语言文字为主 本地部署 轻量文字搜索
Gemini Embedding 2 云端多模态嵌入,含PDF Gemini API 大规模托管与弹性调用

07 / 第三方实测怎么看?

早期开发者展示了浏览器本地查询、Apple M5 Max量化速度、跨语言笔记搜索和开发板实验。它们证明了模型有较强工程可行性,但22毫秒、817条每秒或97%命中率都是特定硬件与数据集上的个案。

开发者测试EmbeddingGemma 2量化版的向量相似度与速度
开发者测试EmbeddingGemma 2量化版的向量相似度与速度。图片已压缩为WebP,点击查看大图。
EmbeddingGemma 2在开发板与ESP32-S3设备上的边缘搜索实验
EmbeddingGemma 2在开发板与ESP32-S3设备上的边缘搜索实验。图片已压缩为WebP,点击查看大图。

可靠评测应固定量化版本、输入长度、索引规模和候选数量,并分别记录建库时间、查询P50/P95延迟、Recall@5/10、内存峰值与电量消耗。

08 / 做视频网观点:本地多媒体资产终于有了更轻的“语义目录”

对视频团队来说,EmbeddingGemma 2最现实的价值不是聊天,而是给素材建立语义索引:用“雨夜街道反光”“人物回头”“鸟叫和风声”这类自然语言,找到原本散落在硬盘里的镜头与录音。

它不会替代专业媒体资产管理系统,但可以成为检索层。先从小规模素材库验证召回率,再决定是否扩展到全部项目;涉及客户素材时,本地部署和可删除索引会比炫目的Demo更重要。

相关站内内容

EmbeddingGemma 2站内导航:https://www.zuoshipin.com/link/47828.html

Gemini站内导航:https://www.zuoshipin.com/link/864.html

Codex站内导航:https://www.zuoshipin.com/link/1474.html

Google Co-Scientist站内导航:https://www.zuoshipin.com/link/30603.html

官方资料

Google:EmbeddingGemma 2官方发布说明

EmbeddingGemma 2官方模型卡

EmbeddingGemma 2官方模型与权重

常见问题(FAQ)

EmbeddingGemma 2是什么模型?
它是Google DeepMind推出的740M开放权重多模态嵌入模型,用于把文字、代码、图片、视频和音频转换成统一向量。
EmbeddingGemma 2可以在手机离线运行吗?
可以面向手机和笔记本本地运行。Google在Pixel 11 Pro的量化测试中,完整多模态模型约占567MB活动内存,实际设备表现会不同。
EmbeddingGemma 2能搜索视频和录音吗?
可以。它原生支持图片、视频和音频,可用文字查询相关媒体,也可构建跨模态检索。
EmbeddingGemma 2和Gemini Embedding 2有什么区别?
EmbeddingGemma 2提供开放权重,强调本地与离线部署;Gemini Embedding 2通过云端API提供更托管化的大规模服务。
EmbeddingGemma 2适合做本地RAG吗?
适合负责检索和向量生成,但完整RAG还需要向量索引、数据切分流程以及Gemma 4等生成模型。
0 点赞
0 收藏
分享
0 讨论
反馈
热门资讯
相关素材

暂无数据