CLUE : comment un robot résout seul l’ambiguïté des consignes floues


Quand un humain entend « Apporte-moi le dossier rouge sur le bureau », il identifie sans effort le bon objet, même si plusieurs dossiers rouges sont présents dans la pièce. Un robot, lui, doit d’abord résoudre trois types d’incertitudes pour agir correctement :
Jusqu’ici, les systèmes robotiques exigeaient des consignes parfaitement précises ou une carte préétablie de l’environnement. Mais dans un entrepôt inconnu ou un chantier extérieur, ces hypothèses tombent à l’eau. C’est là que CLUE (Closed-Loop contextual Uncertainty rEsolution) intervient, comme le démontre une équipe de chercheurs dans un article publié sur arxiv.org.
CLUE repose sur une architecture en boucle fermée où un modèle de langage (LLM) et une carte enrichie en langage (un language-embedded map) travaillent en tandem pour :
1. Générer des hypothèses :
Le LLM interprète la consigne vague (ex: « quelque chose pour transporter mon matériel ») et propose des candidats plausibles (un chariot, une caisse, un sac à dos).
2. Valider ces hypothèses par l’action :
Le robot navigue vers les zones candidates, inspecte les objets via une caméra, et vérifie leur adéquation avec la tâche. Par exemple, s’il repère un chariot mais que son plateau est trop petit, il élimine cette option et en teste une autre.
3. Replanifier en temps réel :
À chaque nouvelle observation, le système met à jour sa carte sémantique et ajuste son plan. Si un objet est caché derrière un autre, le robot le déplace ou change de point de vue pour affiner sa perception.
Les approches statiques — comme celles qui construisent d’abord une carte complète puis la consultent — échouent dans 80 % des cas sur des tâches complexes. CLUE, lui, atteint 86,7 % de succès sur 15 tâches réelles (9 en laboratoire, 3 en bureau, 3 en extérieur), soit seulement 7 points de moins qu’un oracle parfait (93,3 %).
Ses performances sont encore plus frappantes face à des alternatives :
CLUE a été testé sur des scénarios variés, reflétant des situations réelles où l’ambiguïté est inévitable :
| Type de tâche | Exemple de consigne | Défi résolu par CLUE |
|---|---|---|
| Désambiguïsation d’objets | « Trouve le sac Jansport » (plusieurs sacs similaires) | Le robot inspecte chaque candidat et élimine les faux positifs. |
| Inférence fonctionnelle | « J’ai besoin de transporter mon équipement de terrain » | Le robot identifie un chariot et une surface plane pour poser un ordinateur. |
| Résolution d’occlusions | « Ramasse le livre sous la boîte » | Le robot déplace la boîte ou change d’angle de vue pour accéder à l’objet. |
CLUE n’est pas qu’un démonstrateur technique : il pose les bases d’une robotique capable de gérer l’imprévu. Ses implications sont multiples :
CLUE n’est pas parfait : ses échecs proviennent principalement d’erreurs de reconstruction 3D dans la carte, qui empêchent le robot de localiser précisément un objet. Les chercheurs explorent des solutions pour améliorer la précision des capteurs et la robustesse des modèles de perception.
CLUE illustre une tendance forte en robotique : l’autonomie ne se décrète pas, elle se construit par l’interaction. En combinant LLM, cartes sémantiques et action active, ce framework montre qu’un robot peut gérer des consignes floues sans dépendre d’une supervision humaine constante. La prochaine étape ? Étendre ces mécanismes à des environnements encore plus dynamiques, comme des espaces partagés avec des humains.
Pour explorer le code et les données de CLUE, rendez-vous sur zacravichandran.github.io/CLUE.