Physical Artificial Intelligence newsPAI news
← Retour aux actualités
22 Août 2026Niveau : Essentiel

Les robots apprennent enfin à justifier leurs décisions : quand l’IA devient transparente

📑 Sommaire
💡 En 3 points clés
  • Les modèles de type VLA (Vision-Language-Action), comme ceux de NVIDIA ou Physical Intelligence, qui excellent dans des tâches variées. Ils analysent des images, comprennent des instructions en langage naturel, et génèrent des actions. Problème ? Leur fonctionnement ressemble à une recette de cuisine transmise oralement : personne ne peut expliquer pourquoi une étape a été choisie plutôt qu’une autre.
  • Les modèles de contrôle réactif, qui suivent des règles strictes (ex : « ne pas heurter d’obstacles »). Ils sont sûrs, mais rigides : un seul changement dans l’environnement (un colis mal placé, un collègue qui bouge) et le robot s’arrête net, incapable de s’adapter.
  • Un Contrôleur (le « cerveau »), qui gère la perception et le raisonnement sur la tâche. Il peut utiliser des modèles VLA existants pour comprendre une commande ou planifier une trajectoire.

Imaginez un bras robotisé dans une usine. Il doit saisir une pièce fragile, la déplacer sans la briser, éviter un collègue qui passe, et tout cela en temps réel. Jusqu’à présent, ces robots fonctionnaient comme des experts en cuisine : ils exécutaient des recettes parfaites… mais personne ne savait pourquoi ils choisissaient telle ou telle action. Aujourd’hui, une nouvelle génération de modèles, les foundation world models, change la donne. Ils ne se contentent plus d’agir : ils justifient leurs décisions, comme un humain expliquerait à son patron pourquoi il a pris cette trajectoire plutôt qu’une autre.

Le problème des robots d’hier : des génies… mais des boîtes noires

Les robots modernes s’appuient sur deux grandes familles de modèles :

  • Les modèles de type VLA (Vision-Language-Action), comme ceux de NVIDIA ou Physical Intelligence, qui excellent dans des tâches variées. Ils analysent des images, comprennent des instructions en langage naturel, et génèrent des actions. Problème ? Leur fonctionnement ressemble à une recette de cuisine transmise oralement : personne ne peut expliquer pourquoi une étape a été choisie plutôt qu’une autre.
  • Les modèles de contrôle réactif, qui suivent des règles strictes (ex : « ne pas heurter d’obstacles »). Ils sont sûrs, mais rigides : un seul changement dans l’environnement (un colis mal placé, un collègue qui bouge) et le robot s’arrête net, incapable de s’adapter.
  • Résultat ? Les industriels se retrouvent face à un dilemme : soit des robots trop dangereux (optimisant une récompense au mépris des contraintes), soit des robots trop rigides (échouant dès qu’un détail change).

    La solution : des robots qui vérifient leurs propres décisions

    C’est là que les foundation world models entrent en scène. Prenons l’exemple de FEARL, développé par une équipe française. Ce système sépare le robot en deux parties :

  • Un Contrôleur (le « cerveau »), qui gère la perception et le raisonnement sur la tâche. Il peut utiliser des modèles VLA existants pour comprendre une commande ou planifier une trajectoire.
  • Un module de Sécurité (le « juge »), qui vérifie en temps réel si l’action proposée respecte les contraintes (éviter les collisions, ne pas dépasser une vitesse limite, etc.).
  • Le module de Sécurité est conçu pour être vérifiable formellement : ses règles peuvent s’écrire sous forme de formules mathématiques, comme celles utilisées dans l’aéronautique ou l’automobile pour certifier des systèmes critiques. En d’autres termes, le robot ne se contente plus d’agir : il prouve que son action est sûre avant de l’exécuter.

    > « FEARL agit comme un juge interne. Si le Contrôleur propose une trajectoire dangereuse, le module de Sécurité la rejette et demande une alternative. C’est comme si le robot avait un code de la route intégré dans son logiciel. »

    > — Florent Delgrange, lauréat du prix Blue Sky à AAMAS 2026

    Une autre approche : comprendre le monde comme un humain

    Si FEARL se concentre sur la vérification, d’autres modèles comme WALL-WM (X Square Robot) misent sur la compréhension. Au lieu de prédire des images frame par frame (comme le ferait une caméra de surveillance), WALL-WM décompose les tâches en événements sémantiques : « tendre le bras », « saisir la tasse », « déplacer l’objet ». Pour chaque événement, il simule d’abord comment le monde va changer (ex : « si je saisis la tasse mal, elle va glisser »), puis adapte sa trajectoire en conséquence.

    Cette méthode permet au robot de comprendre l’intention derrière une action, plutôt que de simplement suivre une séquence de positions. Résultat ? Une meilleure généralisation : un robot entraîné avec WALL-WM peut accomplir une tâche même si l’objet ou l’environnement diffère légèrement de ceux vus pendant l’entraînement.

    > « WALL-WM ne prédit pas des millimètres, mais des intentions. C’est comme passer d’un GPS qui vous dit « tournez à gauche dans 50 mètres » à un GPS qui comprend que vous voulez éviter un embouteillage. »

    > — Équipe de X Square Robot

    Des robots qui apprennent… et s’améliorent en temps réel

    Ces avancées ne restent pas dans les laboratoires. Lors du WRC 2026 (World Robotics Challenge), deux bras robotisés équipés de modèles comme WALL-WM ont traité 3 908 colis en deux heures dans un entrepôt logistique. Pas de trajectoires préétablies, pas de scénarios figés : les robots ont réagi à l’imprévu, comme un humain le ferait.

    Mais le plus impressionnant ? Leur capacité à s’améliorer en continu. X Square Robot a déployé ses robots dans des foyers ordinaires, où ils génèrent des données 24h/24. Ces données sont utilisées pour affiner les modèles, réduisant les erreurs au fil du temps. Par exemple, un robot a appris à mieux saisir des objets fragiles après avoir répété l’opération des dizaines de fois.

    Pourquoi c’est une révolution ?

    1. Pour l’industrie : Plus besoin de tout reconfigurer à chaque changement d’environnement. Les foundation world models permettent aux robots de s’adapter sans sacrifier la sécurité.

    2. Pour la confiance : Les robots peuvent désormais expliquer leurs décisions. Un opérateur peut demander : « Pourquoi as-tu évité cet obstacle ? » et obtenir une réponse claire, basée sur des preuves formelles.

    3. Pour le grand public : Des robots domestiques capables de gérer des tâches complexes (préparer un repas, ranger une pièce) tout en justifiant leurs actions. Plus de boîtes noires, mais des partenaires fiables.

    Les défis restants

    Malgré ces progrès, des obstacles persistent :

  • La vérification en temps réel : Analyser une action en quelques millisecondes pour s’assurer qu’elle est sûre reste un défi computationnel.
  • L’adaptation aux environnements humains : Les foyers, les hôpitaux ou les usines sont des lieux où les règles changent constamment. Les robots doivent apprendre à naviguer dans ce flou.
  • La standardisation : Les outils de certification (comme l’ISO 13482 pour les robots collaboratifs) doivent évoluer pour intégrer ces nouvelles architectures.
  • Et demain ?

    Les prochaines étapes sont claires :

  • Pour FEARL : Valider le système sur des benchmarks de sécurité formels, comme ceux utilisés dans l’aéronautique.
  • Pour WALL-WM : Réduire la latence de décision pour des applications en temps réel.
  • Pour les modèles comme WSA₁ (Variable Robot) : Améliorer la modélisation 3D pour une meilleure généralisation.
  • Une chose est sûre : ces travaux marquent un tournant. Après des années où la robotique s’est heurtée au mur de l’opacité des modèles, les chercheurs ont trouvé une issue. En combinant généralisation et vérification, ils rendent enfin possible l’autonomie robotique fiable et auto-explicable — une condition indispensable pour que les robots quittent les laboratoires pour investir notre quotidien.

    Pour aller plus loin :

  • Lire le papier de Florent Delgrange sur les foundation world models : arxiv.org/2602.23997
  • Découvrir FEARL : aihub.org/2026/08/17/aamas2026-blue-sky-award-winner-foundation-world-models-for-agents-in-changing-environments/
  • Explorer WALL-WM : prnewswire.com/news-releases/x-square-robot-devoile-un-nouveau-modele-dia-incarnee-et-annonce-que-les-robots-arriveront-dans-les-foyers-dans-35-jours-302752016.html