ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
EmbeddingGemma 2 publié : 740 M de paramètres et la recherche multimodale en local sur le téléphone

EmbeddingGemma 2 publié : 740 M de paramètres et la recherche multimodale en local sur le téléphone

Informations sur l’IA • Admin • • 6 vues

EmbeddingGemma 2 est un modèle d'embedding multimodal à poids ouverts publié par Google DeepMind le 6 octobre 2026 via le blog des développeurs Google. Construit sur Gemma 4, il ne compte que 740 millions de paramètres, mais projette nativement le texte, les images, les images vidéo et l'audio dans un même espace vectoriel : un téléphone peut ainsi effectuer des recherches intermodales en local, sans décrire les images en texte, sans transcrire la parole et sans enchaîner plusieurs modèles.

Sa compacité tient à ses encodeurs détachables

Il tourne sur l'appareil grâce à sa conception modulaire : les encodeurs de texte, de vision et d'audio ne se chargent qu'à la demande, si bien qu'une recherche de photos n'embarque pas la partie audio. Sur un Google Pixel 11 Pro, les seuls poids texte occupent environ 191 Mo de mémoire, et le modèle multimodal complet environ 567 Mo. Les poids sont compressés en INT4 et INT8 par un entraînement sensible à la quantification, les vecteurs de sortie comptent 768 dimensions et peuvent être tronqués à la volée entre 128 et 512 dimensions grâce à l'apprentissage par représentation Matryoshka, ce qui réduit le stockage de l'index local jusqu'à huit fois, avec une perte de précision limitée.

Chercher des photos et retrouver une scène vidéo hors ligne

Les démonstrations officielles vivent dans l'application Google AI Edge Gallery. Instant Media Search réorganise les résultats au fil de la frappe et accepte aussi une image comme exemple ; Video Moments Finder indexe les vidéos locales, si bien qu'une description comme « des enfants qui rient » mène au bon timecode sans transcrire l'audio ni générer de sous-titres. Le modèle sert également de moteur de décision zéro-shot, en appariant directement les entrées à des étiquettes candidates en quelques millisecondes, sans aucun affinage. Côté performances, l'embedding visuel d'une image prend environ 37,3 millisecondes sur le GPU d'un MacBook M5 Pro.

Trois voies d'accès pour les développeurs

La voie simple passe par MediaPipe Tasks : l'Embedder et le Semantic Retriever prennent en charge le prétraitement et la recherche vectorielle sur l'appareil, avec un code commun pour iOS, macOS, Windows, Linux et le Web. Pour un contrôle plus fin, LiteRT fait tourner un unique fichier .litertlm sur CPU, GPU et NPU. Les développeurs Android peuvent aussi attendre l'intégration à ML Kit, prévue dans les prochaines semaines avec accélération NPU et mises à jour automatiques. L'application Mac AI Edge Foresight, lancée le même jour, l'utilise pour interroger les enregistrements de réunions en local. La valeur de ce type de modèle ne se mesure pas aux classements : photothèques et notes de réunion figurent parmi les données les plus sensibles, et elles deviennent enfin interrogeables sans quitter l'appareil.

Outils Recommandés

Plus