EmbeddingGemma 2 は、Google DeepMind が2026年10月6日に Google Developers Blogを通じて公開したオープンウェイトのマルチモーダル埋め込みモデルで、Gemma 4 を基盤に構築され、パラメータ数はわずか7億4,000万である。テキスト、画像、動画フレーム、音声を一つのベクトル空間にネイティブに対応づけるため、画像を文章に変換したり音声を文字起こししたりして別々のモデルに通す必要がなく、スマートフォンのローカルでそのままクロスモーダル検索ができる。
小ささの秘密は取り外せるエンコーダ
オンデバイスで動く理由はモジュール設計にある。テキスト、視覚、音声の各エンコーダは必要なものだけを読み込むため、写真検索の機能が音声側の負担を背負うことはない。Google Pixel 11 Pro では、テキスト専用ウェイトで約191MB、フルマルチモーダル版でも約567MBのメモリで収まる。ウェイトは量子化認識学習で INT4 と INT8 に圧縮され、出力ベクトルは768次元。さらに Matryoshka 表現学習でその場で128〜512次元に切り詰められ、精度の低下を抑えながらローカルインデックスの容量を最大で8分の1まで減らせる。
オフラインで写真を探し、動画の場面を当てる
公式デモは Google AI Edge Gallery アプリに収められた。Instant Media Search は入力するそばから結果を並べ替え、画像そのものを手がかりにした検索もできる。Video Moments Finder は端末内の動画にインデックスを作り、「子どもが笑っている場面」と入力すれば、音声の文字起こしや字幕生成を経ずに対応する時刻へ飛べる。微調整なしで入力と候補ラベルを直接照合するゼロショットの意思決定エンジンとしても使え、意図の振り分けをミリ秒単位でこなす。性能面では、MacBook M5 Pro の GPU で画像1枚の視覚埋め込みが約37.3ミリ秒だ。
開発者向けの接続経路は三つ
手軽に済ませたいなら MediaPipe Tasks がよい。Embedder と Semantic Retriever が前処理とオンデバイスのベクトル検索をまとめて担い、iOS、macOS、Windows、Linux、Web でコードを共通化できる。細かく制御したい場合は LiteRT を使い、単一の .litertlm ファイルで CPU、GPU、NPU を横断できる。Android 開発者は今後数週間で提供される ML Kit 連携を待つ手もあり、NPU アクセラレーションと自動更新が付く。同日公開の Mac アプリ AI Edge Foresight も、ローカルの会議記録検索にこのモデルを使っている。こうしたモデルの価値はベンチマークの順位ではなく、写真ライブラリや会議メモという最も機微なデータを、端末の外に出さずに検索できる点にある。