Retour à Informations sur l’IA
Sortie de Gemini Robotics ER 2 : Le robot a commencé à corriger les erreurs au fur et à mesure de son travail

Sortie de Gemini Robotics ER 2 : Le robot a commencé à corriger les erreurs au fur et à mesure de son travail

Informations sur l’IA Admin 9 vues

Le 30 juillet 2026, Google DeepMind a publié Gemini Robotics ER 2, le positionnant comme le « cerveau » de haut niveau des robots : le modèle est responsable de la compréhension de la vidéo continue, de la planification des tâches en plusieurs étapes et de l’invocation des outils, tandis que les actions spécifiques restent gérées par le modèle visuel-langage-action sous-jacent ou l’interface de contrôle robotique. Son importance réside dans le fait que les systèmes robotiques commencent à intégrer la vision, la réflexion, l’action et la revérification dans la même chaîne en temps réel.

Cette amélioration se concentre sur trois domaines

  1. Continuez à juger pendant l’exécution. ER 2 regarde en continu les flux vidéo, évaluant les progrès pendant l’action plutôt que de s’arrêter pour réanalyser chaque étape. Google l’a intégré à l’API Gemini Live, qui supporte un flux bidirectionnel à faible latence, espérant réduire la sensation fragmentée des bots « s’arrêtant pour réfléchir ».
  2. Des erreurs sont trouvées et des ajustements sont effectués. Le modèle identifie des anomalies telles que les déversements, les glissades et les déviations de position, et décide de réessayer, de corriger ou de passer à l’étape suivante. La précision officielle de la classification de progrès est de 57,4 %, indiquant un progrès clair dans les capacités, mais il reste encore une marge de manœuvre pour lâcher prise totale.
  3. Laissez différents robots se relayer pour les relayers. La collaboration multi-robots permet aux plateformes à roues, aux bras robotiques ou aux robots humanoïdes de partager la sémantique des tâches puis de réaliser des transferts basés sur leurs points forts. Plutôt que de nécessiter un seul robot pour tout gérer, cette approche d’arrangement est plus proche de la véritable combinaison d’équipements d’entrepôt, de laboratoire et d’usine.

« Quand finir » est devenu un indicateur clé

La difficulté pour les robots n’est souvent pas de comprendre une commande, mais de savoir si l’action est réellement accomplie. L’évaluation de mesure de moment de ER 2 sert à identifier le moment exact d’un événement critique, comme lorsque le liquide a été versé au bon endroit. Google a rapporté des résultats de 91,3 % de précision, une erreur temporelle absolue moyenne de 0,96 seconde, et a affirmé que les vitesses d’exécution étaient quatre fois supérieures au plan de comparaison.

Ces chiffres ne peuvent pas directement correspondre aux taux de réussite des vraies usines. Les changements d’éclairage, l’occlusion, l’usure mécanique et les délais de contrôle affectent tous les résultats, et les modèles de haut niveau reposent toujours sur des modèles d’actions sous-jacents et des interfaces matérielles. L’équipe de déploiement doit définir des conditions d’achèvement vérifiables, des annulations de défaillance et des mécanismes manuels de prise de contrôle pour chaque action.

Comment doit-on comprendre la capacité de sécurité ?

Google a déclaré que ER 2 peut arrêter les robots humanoïdes lorsque des personnes approchent, et continuer à travailler une fois la zone sécurisée, tout en introduisant des repères pour évaluer les contraintes de sécurité, la surveillance environnementale et la faisabilité physique. Cette approche est plus importante que simplement améliorer les scores des tâches, mais les performances en benchmarking ne peuvent remplacer la certification de sécurité sur site, les installations d’isolement et les dispositifs d’arrêt d’urgence.

Actuellement, les développeurs peuvent utiliser ER 2 via Gemini API et Google AI Studio, tandis que Gemini Enterprise Agent Platform est en aperçu privé. Pour les équipes robotiques, la première étape la plus réaliste n’est pas de laisser le modèle prendre directement le contrôle de la chaîne de production, mais de commencer à tester avec des résultats à faible risque et vérifiables, pouvant être terminés manuellement à tout moment.

Outils Recommandés

Plus