Google dévoile son modèle de robot humanoïde Gemini Robotics 2
2026-07-31 14:24
Favoris

fr.wedoany.com Rapport : Le laboratoire de recherche en intelligence artificielle DeepMind d'Alphabet Inc. (Google DeepMind) a lancé aujourd'hui la série de modèles Gemini Robotics 2. Conçue pour les robots humanoïdes, cette série permet à plusieurs robots autonomes de collaborer sur une même tâche et d'exécuter automatiquement des corvées comportant des centaines d'étapes.

Les robots humanoïdes grand public actuels adoptent une architecture d'IA à double système : le modèle de raisonnement incarné élabore le plan de haut niveau pour l'exécution des tâches, tandis que le modèle VLA convertit ce plan en instructions de bas niveau pour les moteurs du robot. Le cœur de la série Gemini Robotics 2 est un modèle de raisonnement incarné nommé Gemini Robotics ER 2, qui permet aux utilisateurs de décrire en langage naturel les tâches que le robot doit effectuer. Selon Google, ER 2 peut prendre en charge des tâches comportant des centaines d'étapes et durant plusieurs minutes.

ER 2 peut répartir de longues tâches entre plusieurs robots différents pour les accélérer, et sa fonction d'appel d'outils permet au modèle d'accéder à des services cloud externes, par exemple en utilisant la recherche Google pour clarifier les parties incompréhensibles d'une invite.

Pour répondre au besoin des robots humanoïdes de réessayer des tâches ayant échoué, les ingénieurs ont doté ER 2 de deux fonctionnalités. Premièrement, le modèle peut utiliser les images capturées par la caméra du robot pour suivre la progression de la tâche ; en cas d'erreur, il identifie la dernière étape correctement accomplie et reprend à partir de là, évitant ainsi de tout recommencer depuis le début. Deuxièmement, ER 2 est plus performant que les modèles précédents pour déterminer le moment où une tâche est terminée : plus un robot confirme rapidement la fin d'une tâche, plus il peut passer vite à la suivante. Cette fonction contribue également à simplifier des étapes telles que l'identification et la correction des erreurs.

Les ingénieurs de Google, Steven Hansen et Peng Xu, expliquent dans un article de blog de l'entreprise que le robot, en visionnant des flux vidéo continus, peut suivre sa propre progression, s'ajuster en cas de problème et déterminer clairement quand passer à l'étape suivante.

Une fois le plan d'action élaboré par ER 2, les instructions peuvent être envoyées à l'un des deux autres modèles VLA de la série Gemini Robotics 2. Le premier modèle, nommé Gemini Robotics 2, contrôle toutes les parties du corps du robot humanoïde, et pas seulement les mains ; il optimise le centre de gravité de la machine hôte pour réduire le risque de chute, tout en prenant en charge une plus grande variété de mains mécaniques que les logiciels antérieurs de DeepMind.

Le deuxième modèle VLA, nommé Gemini Robotics On-Device 2, est conçu pour fonctionner directement sur l'ordinateur embarqué du robot humanoïde et peut être adapté à un nouveau robot en quelques heures d'entraînement seulement. Les développeurs peuvent accéder à ER 2 via Google Cloud, l'API Gemini et Google AI Studio.

Parallèlement au lancement du modèle, Google a également présenté un nouveau benchmark de sécurité pour l'IA incarnée, l'ASIMOV-Agentic Benchmark, destiné à évaluer la capacité des robots humanoïdes à éviter les risques tels que les collisions.

Ce texte est rédigé, traduit et republié à partir des informations de l'Internet mondial et de partenaires stratégiques, uniquement pour la communication entre lecteurs. En cas d'infraction au droit d'auteur ou d'autres problèmes, veuillez nous en informer à temps pour la modification ou la suppression. La reproduction de cet article est strictement interdite sans autorisation formelle. Mail : news@wedoany.com