HumanCLAW : Les modèles VLM peuvent-ils agir à travers un corps ?


Imaginez un robot humanoïde équipé d’un modèle de vision-langage (VLM) comme ceux utilisés dans les chatbots. Vous lui demandez : « Assieds-toi sur le canapé ». Le modèle comprend la phrase, reconnaît le canapé sur l’image, mais… échoue lamentablement à accomplir la tâche. Pourquoi ? Parce qu’il ne sait pas où se trouve son propre corps, ni comment ses mouvements vont interagir avec l’environnement.
C’est le constat alarmant d’une étude récente, HumanCLAW, qui teste la capacité des modèles VLM à agir dans le monde physique. Résultat : le meilleur modèle ne réussit que 16,8 % des tâches testées, malgré des performances quasi parfaites en reconnaissance d’objets.
Les VLM modernes (comme ceux de Google DeepMind ou Meta) excellent dans la description d’images ou la génération de texte. Mais dès qu’il s’agit de contrôler un corps physique, ils montrent leurs limites :
Pour contourner ce problème, les chercheurs ont conçu HumanCLAW, un cadre d’évaluation qui sépare la prise de décision (le VLM) de l’exécution motrice (un générateur de mouvements).
1. Le VLM décide : À chaque étape, il reçoit une vue égocentrique (ce que « voit » le robot) et une consigne textuelle. Il doit choisir une action atomique (ex : « marcher de 50 cm vers l’avant »).
2. Le corps exécute : Un générateur de mouvements transforme cette instruction en mouvement continu (en tenant compte de la gravité, des collisions, etc.).
3. Feedback physique : Le résultat est renvoyé au VLM pour la prochaine décision.
Même avec cette séparation, les modèles échouent massivement :
Les chercheurs appellent cette capacité manquante *l’embodied self-awareness*** (conscience incarnée de soi). Sans elle, un robot reste un « aveugle » qui agit sans comprendre les effets de ses mouvements.
Google DeepMind a récemment présenté Gemini Robotics 2, un modèle VLA (Vision-Language-Action) capable de contrôler des robots humanoïdes de la tête aux pieds. Cependant, même ce système montre des limites :
Les chercheurs explorent plusieurs pistes pour combler le fossé entre perception et action :
✅ Intégrer des capteurs proprioceptifs : Comme les humains, les robots pourraient recevoir des retours en temps réel sur la position de leurs articulations (ex : « ton coude est à 90° »).
✅ Entraîner sur des données physiques : Les modèles actuels apprennent surtout à partir d’images et de texte. Les futurs VLM devront être exposés à des milliers d’heures de mouvements réels pour développer une intuition du corps.
✅ Architectures hybrides : Combiner un VLM pour le raisonnement haut niveau avec un modèle de contrôle moteur spécialisé (ex : un réseau de neurones pour la marche).
Les modèles VLM sont puissants, mais ils restent des « esprits désincarnés » : ils voient le monde, mais ne le comprennent pas à travers un corps. Pour que les robots deviennent vraiment autonomes, il faudra leur donner cette conscience incarnée.
> 🔍 Hype-mètre : 3,5/5 (Une avancée scientifique majeure, mais les applications pratiques restent limitées aux environnements contrôlés).