EmbeddingGemma 2是什么?
EmbeddingGemma 2是Google DeepMind推出的740M原生多模态嵌入模型。它把文字、代码、图片、视频、音频及其组合映射到统一的768维向量空间,可在手机、笔记本与边缘设备上构建离线语义搜索、RAG、分类和聚类。

核心规格
- 参数:740M,包括270M文本模型、170M视觉编码器和300M音频编码器。
- 上下文:8192 Token,支持100多种语言。
- 模态:文字、代码、图片、视频、音频与交错组合输入。
- 输出:原生768维,可截断为512、256或128维并重新归一化。
- 内存:Google Pixel 11 Pro量化测试中,纯文本约191MB,完整多模态约567MB。
- 许可证:Apache 2.0开放权重。
适合哪些场景?
适合本地相册和录音搜索、视频片段定位、离线知识库、代码仓库语义检索、跨语言笔记搜索、推荐系统以及隐私优先的RAG。它只负责生成向量,不会直接回答问题;要构建完整RAG,还需向量索引和生成模型。


快速开始
pip install -U sentence-transformers transformers pillow soundfile torchcodec
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("google/embeddinggemma-2")
query = model.encode("task: search result | query: 鸟在唱歌")
用于搜索时应使用官方任务前缀,文档可按“title: 标题 | text: 内容”格式编码。图片、视频和音频无需文字前缀。
