Physical Artificial Intelligence newsPAI news
← Retour aux actualités
1 Août 2026Niveau : EssentielX X — Robotique & IA

HumanCLAW : Les modèles VLM peuvent-ils agir à travers un corps ?

📑 Sommaire
💡 En 3 points clés
  • Perte de repères : Le modèle ne sait pas si son bras est tendu, si sa main touche un obstacle, ou si son mouvement a déplacé un objet.
  • Absence de feedback physique : Contrairement à un humain, qui sent ses muscles se contracter ou ses pieds toucher le sol, le robot dépend uniquement de ses capteurs visuels… qui ne lui donnent pas une conscience incarnée de son état.
  • Tâches trop complexes : Même une action simple comme « ramasser un verre » nécessite une séquence de mouvements coordonnés (approche, préhension, soulèvement), que les VLM ne peuvent pas planifier de manière fiable.

Le problème : voir ≠ agir

Imaginez un robot humanoïde équipé d’un modèle de vision-langage (VLM) comme ceux utilisés dans les chatbots. Vous lui demandez : « Assieds-toi sur le canapé ». Le modèle comprend la phrase, reconnaît le canapé sur l’image, mais… échoue lamentablement à accomplir la tâche. Pourquoi ? Parce qu’il ne sait pas où se trouve son propre corps, ni comment ses mouvements vont interagir avec l’environnement.

C’est le constat alarmant d’une étude récente, HumanCLAW, qui teste la capacité des modèles VLM à agir dans le monde physique. Résultat : le meilleur modèle ne réussit que 16,8 % des tâches testées, malgré des performances quasi parfaites en reconnaissance d’objets.

L’échec des modèles « généralistes »

Les VLM modernes (comme ceux de Google DeepMind ou Meta) excellent dans la description d’images ou la génération de texte. Mais dès qu’il s’agit de contrôler un corps physique, ils montrent leurs limites :

  • Perte de repères : Le modèle ne sait pas si son bras est tendu, si sa main touche un obstacle, ou si son mouvement a déplacé un objet.
  • Absence de feedback physique : Contrairement à un humain, qui sent ses muscles se contracter ou ses pieds toucher le sol, le robot dépend uniquement de ses capteurs visuels… qui ne lui donnent pas une conscience incarnée de son état.
  • Tâches trop complexes : Même une action simple comme « ramasser un verre » nécessite une séquence de mouvements coordonnés (approche, préhension, soulèvement), que les VLM ne peuvent pas planifier de manière fiable.
  • Une solution partielle : découpler raisonnement et exécution

    Pour contourner ce problème, les chercheurs ont conçu HumanCLAW, un cadre d’évaluation qui sépare la prise de décision (le VLM) de l’exécution motrice (un générateur de mouvements).

    Comment ça marche ?

    1. Le VLM décide : À chaque étape, il reçoit une vue égocentrique (ce que « voit » le robot) et une consigne textuelle. Il doit choisir une action atomique (ex : « marcher de 50 cm vers l’avant »).

    2. Le corps exécute : Un générateur de mouvements transforme cette instruction en mouvement continu (en tenant compte de la gravité, des collisions, etc.).

    3. Feedback physique : Le résultat est renvoyé au VLM pour la prochaine décision.

    Résultats : un gouffre entre théorie et pratique

    Même avec cette séparation, les modèles échouent massivement :

  • Meilleur score : 16,8 % de réussite sur des tâches de type « trouver → naviguer → interagir » (ex : s’asseoir sur un objet cible).
  • Problème identifié : Les VLM ne maintiennent pas de modèle mental de leur corps. Ils perdent la trace de leur position, de leur état (ex : « suis-je déjà assis ? »), ou des conséquences de leurs actions (ex : « ai-je heurté la table ? »).
  • Les chercheurs appellent cette capacité manquante *l’embodied self-awareness*** (conscience incarnée de soi). Sans elle, un robot reste un « aveugle » qui agit sans comprendre les effets de ses mouvements.

    Et les avancées récentes ?

    Google DeepMind a récemment présenté Gemini Robotics 2, un modèle VLA (Vision-Language-Action) capable de contrôler des robots humanoïdes de la tête aux pieds. Cependant, même ce système montre des limites :

  • Succès partiels : Il gère bien les tâches de manipulation basiques (ex : ramasser un objet), mais échoue sur des mouvements complexes (ex : s’asseoir sur un canapé en évitant les obstacles).
  • Dépendance au contexte : Les performances chutent dès que l’environnement change (ex : un canapé déplacé).
  • Que nous réserve l’avenir ?

    Les chercheurs explorent plusieurs pistes pour combler le fossé entre perception et action :

    ✅ Intégrer des capteurs proprioceptifs : Comme les humains, les robots pourraient recevoir des retours en temps réel sur la position de leurs articulations (ex : « ton coude est à 90° »).

    ✅ Entraîner sur des données physiques : Les modèles actuels apprennent surtout à partir d’images et de texte. Les futurs VLM devront être exposés à des milliers d’heures de mouvements réels pour développer une intuition du corps.

    ✅ Architectures hybrides : Combiner un VLM pour le raisonnement haut niveau avec un modèle de contrôle moteur spécialisé (ex : un réseau de neurones pour la marche).

    En résumé : un défi de taille pour la robotique

    Les modèles VLM sont puissants, mais ils restent des « esprits désincarnés » : ils voient le monde, mais ne le comprennent pas à travers un corps. Pour que les robots deviennent vraiment autonomes, il faudra leur donner cette conscience incarnée.

    > 🔍 Hype-mètre : 3,5/5 (Une avancée scientifique majeure, mais les applications pratiques restent limitées aux environnements contrôlés).

    Pour aller plus loin

  • L’étude complète sur arXiv (HumanCLAW)
  • Blog de Google DeepMind sur Gemini Robotics 2
  • Analyse par AI Weekly