Physical Artificial Intelligence newsPAI news
← Retour aux actualités
28 Septembre 2026Niveau : Essentiel

CLUE : comment un robot résout seul l’ambiguïté des consignes floues

📑 Sommaire
💡 En 3 points clés
  • Sémantique : quel objet est visé par « dossier rouge » parmi plusieurs candidats ?
  • Métrique : où se trouve cet objet dans l’environnement ?
  • Fonctionnelle : comment interagir avec lui (le saisir, l’ouvrir, le déplacer) ?

Un robot qui comprend… mais pas toujours du premier coup

Quand un humain entend « Apporte-moi le dossier rouge sur le bureau », il identifie sans effort le bon objet, même si plusieurs dossiers rouges sont présents dans la pièce. Un robot, lui, doit d’abord résoudre trois types d’incertitudes pour agir correctement :

  • Sémantique : quel objet est visé par « dossier rouge » parmi plusieurs candidats ?
  • Métrique : où se trouve cet objet dans l’environnement ?
  • Fonctionnelle : comment interagir avec lui (le saisir, l’ouvrir, le déplacer) ?
  • Jusqu’ici, les systèmes robotiques exigeaient des consignes parfaitement précises ou une carte préétablie de l’environnement. Mais dans un entrepôt inconnu ou un chantier extérieur, ces hypothèses tombent à l’eau. C’est là que CLUE (Closed-Loop contextual Uncertainty rEsolution) intervient, comme le démontre une équipe de chercheurs dans un article publié sur arxiv.org.

    CLUE : un cerveau qui doute et s’adapte en permanence

    CLUE repose sur une architecture en boucle fermée où un modèle de langage (LLM) et une carte enrichie en langage (un language-embedded map) travaillent en tandem pour :

    1. Générer des hypothèses :

    Le LLM interprète la consigne vague (ex: « quelque chose pour transporter mon matériel ») et propose des candidats plausibles (un chariot, une caisse, un sac à dos).

    2. Valider ces hypothèses par l’action :

    Le robot navigue vers les zones candidates, inspecte les objets via une caméra, et vérifie leur adéquation avec la tâche. Par exemple, s’il repère un chariot mais que son plateau est trop petit, il élimine cette option et en teste une autre.

    3. Replanifier en temps réel :

    À chaque nouvelle observation, le système met à jour sa carte sémantique et ajuste son plan. Si un objet est caché derrière un autre, le robot le déplace ou change de point de vue pour affiner sa perception.

    Pourquoi la boucle fermée est-elle cruciale ?

    Les approches statiques — comme celles qui construisent d’abord une carte complète puis la consultent — échouent dans 80 % des cas sur des tâches complexes. CLUE, lui, atteint 86,7 % de succès sur 15 tâches réelles (9 en laboratoire, 3 en bureau, 3 en extérieur), soit seulement 7 points de moins qu’un oracle parfait (93,3 %).

    Ses performances sont encore plus frappantes face à des alternatives :

  • Un planificateur LLM sans boucle fermée : 20 % de succès, avec 4 fois moins d’efficacité.
  • Une méthode de cartographie passive (carte construite puis interrogée) : 22 % de succès, mais avec une consommation de tokens (unités de calcul pour les modèles de langage) 12 fois supérieure à CLUE.
  • Trois défis concrets, une solution unifiée

    CLUE a été testé sur des scénarios variés, reflétant des situations réelles où l’ambiguïté est inévitable :

    Type de tâcheExemple de consigneDéfi résolu par CLUE
    Désambiguïsation d’objets« Trouve le sac Jansport » (plusieurs sacs similaires)Le robot inspecte chaque candidat et élimine les faux positifs.
    Inférence fonctionnelle« J’ai besoin de transporter mon équipement de terrain »Le robot identifie un chariot et une surface plane pour poser un ordinateur.
    Résolution d’occlusions« Ramasse le livre sous la boîte »Le robot déplace la boîte ou change d’angle de vue pour accéder à l’objet.

    Chiffres clés : l’efficacité de la boucle fermée

  • Temps moyen par tâche : CLUE met 1,3 fois plus de temps qu’un oracle, mais avec une marge d’erreur bien moindre.
  • Nombre d’actions : 2 fois plus que l’oracle, mais nécessaire pour explorer et valider les hypothèses.
  • Consommation de ressources : CLUE utilise 2,3 fois plus de tokens VLM (modèles de vision-langage) qu’un oracle, mais 10 fois moins qu’une méthode passive — preuve que l’interaction active réduit le gaspillage de calcul.
  • Ce que CLUE change pour la robotique du futur

    CLUE n’est pas qu’un démonstrateur technique : il pose les bases d’une robotique capable de gérer l’imprévu. Ses implications sont multiples :

  • Déploiement en environnement non contrôlé : chantiers, entrepôts, espaces publics où les cartes préétablies n’existent pas.
  • Réduction des coûts de développement : plus besoin de spécifier chaque détail des tâches, le robot apprend à interpréter et à s’adapter.
  • Robustesse face aux ambiguïtés : un système qui doute et corrige ses erreurs en temps réel est bien plus fiable qu’un système qui suppose tout connu à l’avance.
  • Limites et prochaines étapes

    CLUE n’est pas parfait : ses échecs proviennent principalement d’erreurs de reconstruction 3D dans la carte, qui empêchent le robot de localiser précisément un objet. Les chercheurs explorent des solutions pour améliorer la précision des capteurs et la robustesse des modèles de perception.

    En résumé : un pas vers des robots vraiment autonomes

    CLUE illustre une tendance forte en robotique : l’autonomie ne se décrète pas, elle se construit par l’interaction. En combinant LLM, cartes sémantiques et action active, ce framework montre qu’un robot peut gérer des consignes floues sans dépendre d’une supervision humaine constante. La prochaine étape ? Étendre ces mécanismes à des environnements encore plus dynamiques, comme des espaces partagés avec des humains.

    Pour explorer le code et les données de CLUE, rendez-vous sur zacravichandran.github.io/CLUE.