EmbeddingGemma 2는 Google DeepMind가 2026년 10월 6일 Google 개발자 블로그를 통해 공개한 오픈 웨이트 멀티모달 임베딩 모델로, Gemma 4를 기반으로 하며 파라미터는 7억 4천만 개에 불과하다. 텍스트, 이미지, 영상 프레임, 오디오를 하나의 벡터 공간에 네이티브로 대응시키기 때문에, 이미지를 문장으로 바꾸거나 음성을 자막으로 바꾼 뒤 모델마다 따로 넣을 필요 없이 스마트폰 로컬에서 바로 교차 모달 검색을 할 수 있다.
작은 몸집의 비결은 떼어 낼 수 있는 인코더
온디바이스에서 돌아가는 이유는 모듈형 설계다. 텍스트, 비전, 오디오 인코더는 필요한 것만 불러오므로 사진 검색 기능이 오디오 쪽 부담까지 짊어지지 않는다. Google Pixel 11 Pro 기준으로 텍스트 전용 가중치는 약 191MB, 전체 멀티모달 버전도 약 567MB 메모리면 된다. 가중치는 양자화 인식 학습으로 INT4와 INT8까지 압축됐고, 출력 벡터는 768차원이다. 여기에 Matryoshka 표현 학습으로 그 자리에서 128~512차원으로 잘라 쓸 수 있어, 정확도 손실을 억제하면서 로컬 인덱스 용량을 최대 8분의 1로 줄일 수 있다.
인터넷 없이 사진 검색과 영상 장면 찾기
공식 데모는 Google AI Edge Gallery 앱에 담겼다. Instant Media Search는 입력하는 동안 결과가 실시간으로 재정렬되고, 이미지를 예시로 한 검색도 된다. Video Moments Finder는 로컬 영상에 인덱스를 만들어 "아이들이 웃는 장면"이라고 묘사하면 음성 전사나 자막 생성 없이 해당 시간 지점으로 이동한다. 파인튜닝 없이 입력과 후보 라벨을 직접 대조하는 제로샷 의사결정 엔진으로도 쓸 수 있어 의도 분류를 밀리초 단위로 해낸다. 성능 면에서는 MacBook M5 Pro GPU에서 이미지 한 장의 비전 임베딩이 약 37.3밀리초다.
개발자를 위한 세 가지 접속 경로
간편하게 가려면 MediaPipe Tasks가 좋다. Embedder와 Semantic Retriever가 전처리와 온디바이스 벡터 검색을 함께 맡고 iOS, macOS, Windows, Linux, Web에서 코드를 공유할 수 있다. 세밀한 제어가 필요하면 LiteRT로 .litertlm 파일 하나로 CPU, GPU, NPU를 넘나들 수 있다. Android 개발자는 앞으로 몇 주 안에 제공될 ML Kit 연동을 기다리는 방법도 있으며, NPU 가속과 자동 업데이트가 따라온다. 같은 날 나온 Mac 앱 AI Edge Foresight도 로컬 회의 기록 검색에 이 모델을 쓴다. 이런 모델의 가치는 순위표가 아니라, 사진 보관함과 회의 메모 같은 가장 민감한 데이터를 기기 밖으로 내보내지 않고 검색할 수 있다는 데 있다.