Gemini Robotics 2 rapproche un peu plus les robots polyvalents de la réalité. Avec cette nouvelle génération, Google introduit une couche d’intelligence capable de comprendre son environnement, de mobiliser l’ensemble du corps du robot, de manipuler des objets avec précision et de collaborer avec d’autres machines pour accomplir des tâches complexes.

La plateforme repose sur trois modèles complémentaires. Gemini Robotics 2 est un modèle vision-langage-action (VLA) qui transforme des instructions visuelles ou vocales en mouvements. Il ne se limite plus aux manipulations sur une table : il permet aussi de marcher, s’accroupir, atteindre des objets ou les ranger. Gemini Robotics ER 2 joue le rôle d’agent intelligent. Il interprète les demandes humaines, analyse la scène, planifie des séquences d’actions pouvant durer plusieurs minutes et supervise leur exécution. Enfin, Gemini Robotics On-Device 2 embarque directement ces capacités dans le robot, sans dépendre d’une connexion réseau, ce qui facilite une adaptation rapide à de nouveaux modèles de robots à partir de petits jeux de données.
Les premières démonstrations montrent qu’un même modèle peut piloter des robots très différents, comme l’humanoïde Apollo 2 d’Apptronik équipé de nouvelles mains multifonctions ou un robot Franka Duo doté d’une pince parallèle. Les robots sont capables de saisir des objets sur une table, au sol ou sur une étagère, d’assembler des pièces avec une précision millimétrique ou encore d’effectuer des opérations de montage. Si les déplacements et les manipulations avec une pince offrent déjà de très bons résultats, la dextérité des mains à plusieurs doigts reste l’un des principaux défis de la recherche.
L’une des avancées majeures réside dans la coordination du corps entier. Par exemple, lorsqu’on demande au robot de ranger un arrosoir dans un bac situé sur une étagère inférieure, il est capable de repérer l’objet, le saisir, se déplacer jusqu’à la zone de rangement puis le déposer avec précision. Même si cette exécution demeure plus lente que celle d’un humain, elle constitue une étape importante vers des robots capables d’évoluer dans des environnements conçus pour les personnes.
La précision des manipulations progresse également. Gemini Robotics 2 contrôle aussi bien des mains à cinq doigts et 22 degrés de liberté, capables d’effectuer des gestes délicats comme nouer, fermer ou tourner un objet, que des pinces à deux doigts, désormais suffisamment performantes pour réaliser des opérations de conditionnement ou d’assemblage avec un haut niveau de fiabilité. Cette approche semble pouvoir s’adapter à différents types d’effecteurs sans nécessiter de programmation spécifique.
Le modèle de raisonnement embarqué apporte davantage d’autonomie. Il décompose un objectif en plusieurs étapes, coordonne les mouvements du robot, corrige les erreurs lorsqu’une action échoue et s’adapte à de nouveaux environnements ou à des consignes inédites. Google met également l’accent sur la coopération entre robots : plusieurs machines peuvent désormais se répartir les tâches et travailler ensemble sur un même processus, ce qu’un seul robot ne pourrait pas accomplir efficacement.
L’exécution locale représente un autre atout majeur. En fonctionnant directement sur le robot, le modèle réduit la latence liée au réseau et améliore la réactivité. Grâce à des techniques de transfert d’apprentissage, il peut être adapté à un nouveau robot à deux bras en quelques heures seulement avec moins de 200 exemples d’entraînement. Les essais ont été réalisés sur des plateformes très différentes, ce qui laisse entrevoir un déploiement à grande échelle dans des flottes de robots hétérogènes.
La sécurité reste au cœur du projet. Google présente ASIMOV-Agentic, un nouveau protocole d’évaluation destiné à vérifier que le système refuse les actions dangereuses, détecte les situations irréalisables et sollicite l’intervention d’un humain lorsque cela est nécessaire. Gemini Robotics ER 2 renforce également le respect des règles de sécurité et des distances avec les personnes. Si un individu s’approche trop près, le robot peut ralentir, déclencher des mesures de protection ou s’arrêter de manière contrôlée, conformément aux normes de la robotique collaborative.
Le déploiement de la plateforme est déjà en cours. Gemini Robotics ER 2 est disponible dans Google AI Studio ainsi qu’en aperçu privé sur la plateforme Gemini Enterprise Agent Platform. Les modèles VLA et On-Device sont progressivement mis à disposition de partenaires spécialisés dans la robotique, tandis que les développeurs peuvent accéder à la documentation nécessaire pour intégrer cette technologie à leurs propres robots.
En réunissant perception visuelle, compréhension du langage, contrôle moteur et planification, Gemini Robotics 2 marque une nouvelle étape vers une intelligence artificielle physique plus générale. L’objectif n’est plus de programmer un robot pour une seule tâche, mais de lui donner la capacité d’apprendre, de s’adapter et de coopérer avec d’autres machines afin d’assister les humains dans des environnements réels, en toute sécurité.