做视频AI导航网
做视频AI导航网
AI导航
  • 热门工具
  • Agent智能体
  • Skills技能
  • AI大模型
  • AI创作
  • AI工具集
视频Video
  • 素材下载
  • 创作灵感
Github神器
  • 导航
  • 资讯
  • 视频素材
  • 视频模版
  • 音乐音效
  • Luts调色预设
  • 整合包
首页/
打开 MD 链接

EmbeddingGemma 2 - 740M端侧多模态嵌入与离线搜索模型

19
把文字、代码、图片、视频和音频统一装进本地搜索
评分
参数规模:740M向量维度:768 / 512 / 256 / 128上下文:8192 Token语言:100+完整量化内存:约567MB(Pixel 11 Pro测试)许可证:Apache 2.0
Google开放的740M多模态嵌入模型,统一检索文字、代码、图片、视频和音频,支持手机离线搜索、RAG与代码…
大模型|EmbeddingGemma 2·嵌入模型·端侧AI

EmbeddingGemma 2是什么?

EmbeddingGemma 2是Google DeepMind推出的740M原生多模态嵌入模型。它把文字、代码、图片、视频、音频及其组合映射到统一的768维向量空间,可在手机、笔记本与边缘设备上构建离线语义搜索、RAG、分类和聚类。

不同模态内容映射到同一768维向量空间
不同模态内容映射到同一768维向量空间。图片已压缩为动画WebP,点击查看大图。

核心规格

  • 参数:740M,包括270M文本模型、170M视觉编码器和300M音频编码器。
  • 上下文:8192 Token,支持100多种语言。
  • 模态:文字、代码、图片、视频、音频与交错组合输入。
  • 输出:原生768维,可截断为512、256或128维并重新归一化。
  • 内存:Google Pixel 11 Pro量化测试中,纯文本约191MB,完整多模态约567MB。
  • 许可证:Apache 2.0开放权重。

适合哪些场景?

适合本地相册和录音搜索、视频片段定位、离线知识库、代码仓库语义检索、跨语言笔记搜索、推荐系统以及隐私优先的RAG。它只负责生成向量,不会直接回答问题;要构建完整RAG,还需向量索引和生成模型。

用文字查询同时找到相关图片与鸟叫录音
用文字查询同时找到相关图片与鸟叫录音。图片已压缩为动画WebP,点击查看大图。
EmbeddingGemma 2与同量级模型的官方多模态检索成绩
EmbeddingGemma 2与同量级模型的官方多模态检索成绩。图片已压缩为WebP,点击查看大图。

快速开始

pip install -U sentence-transformers transformers pillow soundfile torchcodec

from sentence_transformers import SentenceTransformer
model = SentenceTransformer("google/embeddinggemma-2")
query = model.encode("task: search result | query: 鸟在唱歌")

用于搜索时应使用官方任务前缀,文档可按“title: 标题 | text: 内容”格式编码。图片、视频和音频无需文字前缀。

官方入口

打开EmbeddingGemma 2官方模型与下载页面

查看Google官方模型卡与完整参数

常见问题(FAQ)

EmbeddingGemma 2能直接回答问题吗?
不能。它负责把内容转换成向量,用于搜索和RAG检索;完整问答还需要向量数据库或索引,以及Gemma等生成模型。
EmbeddingGemma 2支持哪些内容?
支持文字、代码、图片、视频和音频,也能把多种模态组合成一个统一向量。
EmbeddingGemma 2需要多少内存?
Google在Pixel 11 Pro的量化测试中,纯文本权重约191MB活动内存,完整多模态模型约567MB;实际占用受框架、量化和设备影响。
EmbeddingGemma 2可以商用吗?
模型采用Apache 2.0许可证开放权重,但部署仍需遵守Gemma禁止用途政策和适用法律。
EmbeddingGemma 2的向量维度是多少?
原生输出768维,并支持512、256和128维截断;截断后必须重新归一化,查询与索引维度也必须一致。
0 / 600
细中粗
0 讨论
热门最新
总结
暂无总结

相关网站

热门最新
暂无链接数据;请在后台添加链接或调整分类筛选。
所有的成功,都源自一个勇敢的开始
不辜负每一个勇敢的开始
做视频AI导航网 © 2026闽ICP备16009488号-1