ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
EmbeddingGemma 2 发布:740M 参数,把多模态检索搬进手机本地

EmbeddingGemma 2 发布:740M 参数,把多模态检索搬进手机本地

AI资讯 • Admin • • 7 次浏览

EmbeddingGemma 2 是 Google DeepMind 在 2026 年 10 月 6 日通过 Google 开发者博客发布的开放权重多模态嵌入模型,基于 Gemma 4 构建,只有 7.4 亿参数。它能把文本、图像、视频帧和音频原生映射到同一个向量空间里,让手机在本地直接做跨模态检索,不必再把图片转成文字描述、把语音转成字幕,然后分别喂给不同的模型。

小身材靠的是可拆的编码器

它能在端侧跑起来,靠的是模块化设计:文本、视觉、音频编码器可以按需加载,只做照片搜索就不用背上音频那部分。在 Google Pixel 11 Pro 上,只加载文本权重大约占 191MB 内存,完整多模态版约 567MB。权重经过量化感知训练压到 INT4 和 INT8,输出向量是 768 维,还能用 Matryoshka 表示学习当场截断到 128 至 512 维,本地索引的存储占用最多可降到原来的八分之一,精度损失有限。

不联网也能搜照片、找视频片段

官方演示直接落在 Google AI Edge Gallery 应用里:一个是输字即搜的 Instant Media Search,打字过程中结果实时重排,用一张照片也能搜出语义相近的图片;另一个 Video Moments Finder 给本地视频建索引,输入「孩子在笑」这样的描述就能定位到对应时间点,不需要先转写音频或生成字幕。它还能当零样本决策引擎,不用任何微调就把输入和候选标签直接匹配,毫秒级完成意图路由。性能上,MacBook M5 Pro 的 GPU 上单张图像的视觉嵌入约 37.3 毫秒。

开发者有三条接入路径

图省事的走 MediaPipe Tasks,Embedder 和 Semantic Retriever 把预处理和端侧向量检索都包好了,iOS、macOS、Windows、Linux 和 Web 一套代码;要精细控制的走 LiteRT,一个 .litertlm 文件就能跨 CPU、GPU 和 NPU 运行。Android 开发者还可以等几周后的 ML Kit 接入,届时会有 NPU 加速和自动更新。同日上线的 Mac 应用 AI Edge Foresight 也用它做本地会议记录的检索。这类模型的价值不在榜单,而在于个人相册、会议记录这类最敏感的数据,终于可以不离开设备就被搜到。

推荐工具

更多