ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
EmbeddingGemma 2 veröffentlicht: 740 Mio. Parameter bringen multimodale Suche lokal aufs Telefon

EmbeddingGemma 2 veröffentlicht: 740 Mio. Parameter bringen multimodale Suche lokal aufs Telefon

KI-Informationen • Admin • • 6 Aufrufe

EmbeddingGemma 2 ist ein offenes, multimodales Embedding-Modell, das Google DeepMind am 6. Oktober 2026 über den Google Developers Blog veröffentlicht hat. Es baut auf Gemma 4 auf und kommt mit nur 740 Millionen Parametern aus, bildet aber Text, Bilder, Videoframes und Audio nativ in einem gemeinsamen Vektorraum ab. So kann ein Telefon lokal modalitätsübergreifend suchen, statt Bilder erst zu beschreiben, Sprache zu transkribieren und für jeden Schritt ein eigenes Modell zu füttern.

Klein bleibt es durch abnehmbare Encoder

Möglich wird der Betrieb auf dem Gerät durch den modularen Aufbau: Text-, Vision- und Audio-Encoder werden nur bei Bedarf geladen, eine Fotosuche schleppt also den Audio-Teil nicht mit. Auf einem Google Pixel 11 Pro belegt die Nur-Text-Variante rund 191 MB Speicher, das vollständige multimodale Modell etwa 567 MB. Die Gewichte sind per quantisierungsbewusstem Training auf INT4 und INT8 komprimiert, die Ausgabevektoren sind 768-dimensional und lassen sich per Matryoshka Representation Learning spontan auf 128 bis 512 Dimensionen kürzen — der lokale Index schrumpft so auf bis zu ein Achtel, bei begrenztem Genauigkeitsverlust.

Fotos suchen und Videoszenen finden — ganz offline

Die offiziellen Demos stecken in der App Google AI Edge Gallery. Instant Media Search sortiert die Treffer schon während des Tippens neu und kann auch per Beispielbild suchen; der Video Moments Finder indexiert lokale Videos, sodass eine Beschreibung wie „lachende Kinder" direkt zur passenden Stelle springt, ohne Audio erst zu transkribieren oder Untertitel zu erzeugen. Das Modell arbeitet außerdem als Zero-Shot-Entscheidungsmaschine, die Eingaben ohne jedes Fine-Tuning direkt mit Kandidaten-Labels abgleicht und Absichten in Millisekunden weiterleitet. Bei der Leistung liegt ein einzelnes Bild bei der Vision-Einbettung auf der GPU eines MacBook M5 Pro bei etwa 37,3 Millisekunden.

Drei Zugangswege für Entwickler

Wer es einfach will, nimmt MediaPipe Tasks: Embedder und Semantic Retriever übernehmen Vorverarbeitung und die Vektorsuche auf dem Gerät, mit einer Codebasis für iOS, macOS, Windows, Linux und Web. Wer feiner steuern will, nutzt LiteRT und lässt eine einzige .litertlm-Datei über CPUs, GPUs und NPUs laufen. Android-Entwickler können auch auf die ML-Kit-Anbindung warten, die in den kommenden Wochen mit NPU-Beschleunigung und automatischen Updates folgt. Die am selben Tag erschienene Mac-App AI Edge Foresight nutzt das Modell, um lokale Besprechungsaufzeichnungen zu durchsuchen. Der Wert solcher Modelle misst sich nicht an Ranglisten: Fotobibliotheken und Meeting-Notizen gehören zu den sensibelsten Daten überhaupt — und lassen sich endlich durchsuchen, ohne das Gerät zu verlassen.

Empfohlene Tools

Mehr