Dossier 003Physical AI · Modèles de fondation

Gemini Robotics 2 : le cerveau des robots apprend enfin à utiliser tout le corps

Google DeepMind annonce un modèle capable de faire marcher, saisir et coopérer plusieurs robots. Les démonstrations sont fortes ; les taux de réussite publiés racontent une histoire plus nuancée.

Londres · Austin · Monde20 min + 6 vidéos
Apollo 2 d'Apptronik vu de face
Apptronik, vidéo officielle · source

Les faits vérifiés

Gemini Robotics 2, en mesures

  1. 68,4 %prise sur table

    Taux publié sur Apollo avec mains Inspire.

  2. 45,7 %prise au sol

    Le changement de posture fait chuter le taux de réussite.

  3. 76,3 %prise sur étagère

    Meilleur des trois scénarios de manipulation publiés.

  4. quelques heuresadaptation à un nouveau corps

    Durée annoncée avec une petite quantité de données propres au robot.

  5. 3 modèlespile Gemini Robotics 2

    Action, raisonnement incarné et version locale sur l'appareil.

La thèse NXUS IRL

Ce qu'il faut retenir

Le progrès décisif n'est pas qu'un humanoïde sache exécuter une nouvelle tâche, mais qu'un même modèle puisse être adapté à plusieurs corps avec peu de données. La généralisation reste cependant loin de la fiabilité humaine.

01 · Le saut technique

De la table au corps entier

Les premiers modèles vision-langage-action excellaient surtout devant une table : la base restait fixe et les bras manipulaient des objets proches. Gemini Robotics 2 ajoute la marche, l'accroupissement, l'extension du corps et la manipulation dans une même politique.

Sur Apollo 2, le robot peut recevoir une consigne, rejoindre un objet, le prendre puis l'apporter à une étagère. Le passage est important parce que chaque mouvement modifie l'équilibre et la perception des suivants.

02 · Les scores

45,7 % au sol : la difficulté est encore très visible

Le graphique publié par Google est plus instructif que le montage vidéo. La prise sur table réussit environ deux fois sur trois ; au sol, moins d'une fois sur deux. L'étagère atteint un peu plus de trois essais sur quatre.

Ces scores peuvent suffire à accélérer la recherche. Ils sont trop faibles pour un poste autonome sans stratégie de reprise, validation du résultat et intervention humaine.

03 · La généralisation

Le même cerveau sur plusieurs corps devient le vrai enjeu

Gemini Robotics On-Device 2 est présenté comme adaptable à une nouvelle morphologie en quelques heures de données. Si cette promesse se confirme, un fabricant n'aurait plus à reconstruire toute sa pile d'IA pour chaque main ou base mobile.

La généralisation a toutefois un coût caché : calibration, jeux de données propres au site et validation de sécurité. Une adaptation rapide en laboratoire ne garantit pas une qualification rapide en usine ou à domicile.

04 · La sécurité

Savoir refuser devient une capacité physique

Le modèle de raisonnement doit détecter une proximité humaine, appeler un arrêt sûr et refuser une action impossible ou dangereuse. Google introduit le benchmark ASIMOV-Agentic pour mesurer ce type d'orchestration.

Ces couches s'ajoutent aux contrôleurs traditionnels de couple, de collision et de stabilité. La sécurité d'un robot généraliste ne peut pas dépendre d'une seule réponse probabiliste.

Comparer sans tricher

Les pourcentages empêchent la magie de tout recouvrir.

Les scores publiés sur Apollo 2 montrent des progrès réels, mais aussi des échecs fréquents dès que la prise se fait au sol.

ÉpreuveMesure du modèleCe que l'on voudrait en usageLecture NXUS IRLLa limite à garder en tête
Prise sur tablefaible68,4 %Apollo 2 + mains Inspiresource robot ↗Succès quasi systématiqueAttente d'un poste simplesource humaine ↗Environ 1 échec sur 3Le protocole, le nombre d'essais et la diversité des objets conditionnent le score.
Prise au solfaible45,7 %Flexion et saisiesource robot ↗Récupération naturelleAttente d'un opérateur validesource humaine ↗Échec majoritaireLa comparaison humaine est qualitative et ne constitue pas le même benchmark.
Étagèrefaible76,3 %Prise en hauteursource robot ↗Cadence répétableAttente industriellesource humaine ↗Presque 1 échec sur 4Le score moyen ne dit pas si les erreurs abîment l'objet ou arrêtent la cellule.
Nouveau corpsnon comparableQuelques heuresAdaptation annoncéesource robot ↗Validation du siteSécurité et recette métiersource humaine ↗Apprentissage rapide, qualification lenteAdapter un modèle et autoriser son exploitation sont deux processus distincts.

Retour au catalogue

Les plateformes concernées par la course au modèle généraliste.

Apollo 2 est explicitement utilisé. Les autres passeports servent de repères pour comprendre où les modèles de fondation devront se transférer.

  1. Modèle documentéApptronik

    Apollo 2

    Plateforme partenaire principaleApollo 2 sert aux démonstrations de contrôle du corps entier et de dextérité de Gemini Robotics 2.

    Google cite explicitement Apollo 2 et les mains SharpaWave dans ses résultats.

  2. Modèle documentéBoston Dynamics

    Atlas

    Partenaire de raisonnement incarnéBoston Dynamics collabore avec Google sur la perception, le raisonnement et les modèles de fondation d'Atlas.

    Atlas n'est pas annoncé comme contrôlé par la même politique VLA qu'Apollo dans ces tests.

  3. Modèle documentéFigure

    Figure 03

    Modèle propriétaire HelixFigure entraîne sa propre pile vision-langage-action sur les données collectées en usine et à la maison.

    Ce passeport sert de contrepoint propriétaire à l'écosystème Gemini.

  4. Modèle documentéAgility Robotics

    Digit

    Robot spécialisé orchestréDigit rappelle qu'une autonomie étroite peut déjà créer de la valeur sans modèle généraliste complet.

    Son exploitation documentée porte surtout sur le déplacement de bacs.

  5. Modèle documentéTesla

    Optimus

    Apprentissage vidéo propriétaireOptimus mise sur les données et l'infrastructure IA de Tesla pour apprendre des tâches physiques.

    Les détails de performance comparables à Gemini Robotics 2 ne sont pas publics.

  6. Modèle documentéBoston Dynamics

    Spot

    Raisonnement sur inspectionSpot reçoit des couches Gemini Robotics-ER pour interpréter des instruments et des scènes industrielles.

    L'usage porte sur le raisonnement et la perception, pas sur une locomotion apprise de bout en bout.

Regarder avant de conclure

6 vidéos, 6 choses à observer.

Chaque séquence est accompagnée d'une grille de lecture. Le but n'est pas de collectionner les exploits, mais de voir ce qui tient et ce qui casse.

01
Vidéo hébergée par YouTube

Aucun contenu YouTube n’est chargé avant votre accord.

Ouvrir directement sur YouTube ↗

Images de terrain · Apptronik

Apollo 2 · Apollo 2 au Robot Park

À regarder
La marche entre deux zones, la prise à différentes hauteurs et les reprises après hésitation.
Lecture NXUS IRL
Les séquences établissent l'étendue des tâches ; les scores mesurent encore une fiabilité incomplète.
Voir sur YouTube
02
Vidéo hébergée par YouTube

Aucun contenu YouTube n’est chargé avant votre accord.

Ouvrir directement sur YouTube ↗

Images de terrain · Boston Dynamics

Atlas · Fonctions du nouvel Atlas

À regarder
La perception des pièces et la correction quand un objet glisse ou change de position.
Lecture NXUS IRL
Le raisonnement haut niveau et le contrôle moteur restent deux couches qu'il faut distinguer.
Voir sur YouTube
03
Vidéo hébergée par YouTube

Aucun contenu YouTube n’est chargé avant votre accord.

Ouvrir directement sur YouTube ↗

Images de terrain · Figure

Figure 03 · Présentation de Figure 03

À regarder
La continuité entre compréhension de la consigne et mouvement des deux mains.
Lecture NXUS IRL
Une vidéo fluide ne révèle ni la taille du jeu d'entraînement ni le taux de reprise.
Voir sur YouTube
04
Vidéo hébergée par YouTube

Aucun contenu YouTube n’est chargé avant votre accord.

Ouvrir directement sur YouTube ↗

Images de terrain · Agility Robotics

Digit · Première journée de Digit chez GXO

À regarder
La régularité du trajet et les interfaces avec le système logistique.
Lecture NXUS IRL
Le modèle généraliste doit battre une solution spécialisée sur le coût total, pas seulement sur la variété.
Voir sur YouTube
05
Vidéo hébergée par YouTube

Aucun contenu YouTube n’est chargé avant votre accord.

Ouvrir directement sur YouTube ↗

Images de terrain · Tesla

Optimus · Optimus se déplace en usine

À regarder
Les transitions, les plans coupés et l'éventuelle assistance distante.
Lecture NXUS IRL
L'absence de protocole public empêche de comparer les modèles sur leurs montages promotionnels.
Voir sur YouTube
06
Vidéo hébergée par YouTube

Aucun contenu YouTube n’est chargé avant votre accord.

Ouvrir directement sur YouTube ↗

Images de terrain · Boston Dynamics

Spot · Spot au travail

À regarder
La lecture d'un cadran et la séparation entre décision IA et déplacement contrôlé.
Lecture NXUS IRL
Les modèles de fondation peuvent augmenter un robot existant sans remplacer toute sa pile de contrôle.
Voir sur YouTube

Registre de preuves

17 sources consultées

Les sources officielles établissent le format et les résultats. La presse et les vidéos servent à confronter le récit aux images.

  1. 01
    Gemini Robotics 2 et le contrôle du corps entierGoogle DeepMind · 30 juillet 2026
    Officiel
  2. 02
    Carte du modèle Gemini Robotics On-Device 2Google DeepMind · 30 juillet 2026
    Officiel
  3. 03
    Gemini Robotics-ER 1.6Google DeepMind · 14 avril 2026
    Officiel
  4. 04Officiel
  5. 05
    Écosystème Isaac GR00TNVIDIA · 29 août 2026
    Officiel
  6. 06
    Fiche officielle Apollo 2Apptronik · 29 août 2026
    Officiel
  7. 07
    Fiche officielle AtlasBoston Dynamics · 29 août 2026
    Officiel
  8. 08
    Fiche officielle Figure 03Figure · 29 août 2026
    Officiel
  9. 09
    Fiche officielle DigitAgility Robotics · 29 août 2026
    Officiel
  10. 10
    Fiche officielle OptimusTesla · 29 août 2026
    Officiel
  11. 11
    Fiche officielle SpotBoston Dynamics · 29 août 2026
    Officiel
  12. 12
    Apollo 2 · Apollo 2 au Robot ParkApptronik · 29 août 2026
    Vidéo
  13. 13
    Atlas · Fonctions du nouvel AtlasBoston Dynamics · 29 août 2026
    Vidéo
  14. 14Vidéo
  15. 15
    Digit · Première journée de Digit chez GXOAgility Robotics · 29 août 2026
    Vidéo
  16. 16Vidéo
  17. 17
    Spot · Spot au travailBoston Dynamics · 29 août 2026
    Vidéo

Le dossier en bref

Questions fréquentes

De quoi parle le dossier « Gemini Robotics 2 prend le corps entier » ?

Google DeepMind annonce un modèle capable de faire marcher, saisir et coopérer plusieurs robots. Les démonstrations sont fortes ; les taux de réussite publiés racontent une histoire plus nuancée.

Quels sont les chiffres essentiels à retenir ?

Les principaux repères publiés sont : 68,4 % prise sur table, 45,7 % prise au sol, 76,3 % prise sur étagère. Chaque valeur renvoie à sa source dans le dossier.

Quels robots ou produits sont cités ?

Le dossier relie notamment Apollo 2, Atlas, Figure 03, Digit, Optimus, Spot à leur passeport NXUS IRL lorsque la référence exacte est documentée.

Peut-on voir les démonstrations en vidéo ?

6 vidéos accompagnées d’une grille de lecture figurent dans ce dossier. YouTube ne se charge qu’après accord.

Pourquoi ce sujet est-il important ?

Le progrès décisif n'est pas qu'un humanoïde sache exécuter une nouvelle tâche, mais qu'un même modèle puisse être adapté à plusieurs corps avec peu de données. La généralisation reste cependant loin de la fiabilité humaine.

Journal du dossier

  1. Publication du dossier, des comparaisons et des passeports associés.

  2. Vérification des sources primaires et ajout de six vidéos à décortiquer.