Physical Artificial Intelligence newsPAI news
← Retour aux actualités
28 Juillet 2026Niveau : Essentiel

LEACL : Quand les LLM écrivent le programme d’entraînement des robots pour accomplir des tâches complexes

📑 Sommaire
💡 En 3 points clés
  • Plutôt que de bombarder le robot de données aléatoires, ACL lui fait d’abord réaliser des sous-tâches simples, puis complexifie progressivement l’entraînement.
  • Exemple : Avant de lui demander de remplir une tasse, il commence par lui apprendre à saisir une cuillère. Avant cela, à repérer la cuillère sur une table.
  • Problème : Créer manuellement ces séquences est fastidieux et peu généralisable. Il faut définir des "paramètres de difficulté" pour chaque sous-tâche, une tâche herculéenne pour des centaines de scénarios différents.

Des robots perdus dans des tâches à 10 étapes

Imaginez un robot cuisinier qui doit mettre une bouilloire sur le feu, puis appuyer sur l’interrupteur, avant de verser de l’eau dans un bol. Une simple erreur d’ordre, comme appuyer sur l’interrupteur avant de poser la bouilloire, peut rendre la tâche impossible. Ce type de tâches à long horizon (plusieurs actions enchaînées) est un casse-tête pour les algorithmes d’apprentissage par renforcement (RL). Pourquoi ? Parce qu’ils sont pénalisés par des récompenses rares et peu informatives : le robot ne reçoit un feedback positif que s’il accomplit toutes les étapes sans erreur. Entre-temps, il tâtonne dans le noir, guidé par un signal aussi vague qu’un "Bravo !" après 10 essais.

Dans ces conditions, entraîner un robot à manipuler des objets revient souvent à… lui faire perdre son temps.

LEACL : Le cerveau des robots écrit lui-même ses exercices

C’est là que LEACL (LLM-Enhanced Automatic Curriculum Learning) intervient, une méthode développée par des chercheurs qui fusionne deux idées révolutionnaires :

1. *Le Curriculum Learning automatique* (ACL) :

  • Plutôt que de bombarder le robot de données aléatoires, ACL lui fait d’abord réaliser des sous-tâches simples, puis complexifie progressivement l’entraînement.
  • Exemple : Avant de lui demander de remplir une tasse, il commence par lui apprendre à saisir une cuillère. Avant cela, à repérer la cuillère sur une table.
  • Problème : Créer manuellement ces séquences est fastidieux et peu généralisable. Il faut définir des "paramètres de difficulté" pour chaque sous-tâche, une tâche herculéenne pour des centaines de scénarios différents.
  • 2. L’intervention des LLM pour automatiser le brouillon :

  • Les Large Language Models (comme GPT-4o-mini, utilisé ici) décomposent les tâches complexes en étapes logiques grâce à leur connaissance vaste du "bon sens" général.
  • Pour chaque sous-tâche, LEACL génère une spécification PDDL (un langage formel utilisé en planification automatique) qui décrit l’action attendue (ex : `ouvrir le tiroir du bas` → `terminal:drawer_open(drawer_bottom)`).
  • --
  • Résultats : Jusqu’à 100% de succès là où les robots échouaient avant

    Les chercheurs ont testé LEACL sur 5 tâches de manipulation long-horizon issues de la suite de benchmarks LIBERO+ (une version étendue de LIBERO[^1] conçue pour évaluer l’ACL). Comparaisons avec :

    MéthodeTâche 1*Tâche 2**Tâche 3Tâche 4Tâche 5
    Récompense clairsemée0%0%0%0%0%
    LEACL (sans ACL)0%11,8%0%8,2%0%
    LEAGUE[^2]99,4%71,0%29,8%21,1%0%
    Humain (currriculum manuel)99,8%96,0%86,3%79,7%89,0%
    LEACL (notre méthode)99,8%90,7%89,4%60,6%75,9%

    Tâche 1 : Ouvrir le tiroir du bas d’un meuble

    **Tâche 2 : Poser un bol blanc sur une assiette

    Performance clé : LEACL dépasse systématiquement les méthodes basées sur des récompenses denses conçues à la main, avec une marge parfois spectaculaire (+18% par rapport au meilleur humain sur la tâche 3).

    Le secret ? Un mélange gagnant : LLM + ACL

    LEACL fonctionne en 3 étapes clés :

    1. Décomposition de la tâche par le LLM

  • Le robot reçoit une instruction en langage naturel : « Mets la bouilloire sur le feu et appuie sur l’interrupteur ».
  • Le LLM la découpe en sous-tâches : `saisir la bouilloire` → `approcher la bouilloire de la cuisinière` → `ouvrir le robinet` → `mettre en marche l’interrupteur`.
  • 2. Génération de spécifications PDDL

  • Chaque sous-tâche est traduite en un format compréhensible par un planificateur automatique :
  •      (:action ouvrir-robinet
           :parameters (?f - faucet)
           :precondition (closed ?f)
           :effect (not (closed ?f)))
  • Le LLM utilise des mécanismes de réflexion (reflection mechanisms) pour valider la syntaxe et corriger les erreurs.
  • 3. Entrâinement progressif par ACL

  • Le système présente au robot des variantes de chaque sous-tâche, allant du plus simple (ex : saisir un objet léger) au plus complexe (saisir un objet lourd en présence d’obstacles).
  • L’ACL utilise des métriques de difficulté calculées par le LLM (ex : « Ce rouge à lèvre est plus difficile à placer qu’un bol car il est petit et glissant »).
  • Pourquoi c’est une révolution ?

    ✅ Moins d’ingénierie humaine : Finis les mois à écrire des récompenses pour chaque scénario.

    ✅ Généralisation : LEACL reproduit des performances proches d’un curriculum conçu par des experts humains, sans aucune adaptation manuelle.

    ✅ Réduction des coûts : Un seul LLM peut générer des centaines de curriculums pour différents robots ou environnements.

  • --
  • Notes de l’équipe RoboNews :

  • Hype-mètre : ⭐⭐⭐⭐/5 (Un bond scientifique majeur, mais encore en phase de tests labo sur benchmarks contrôlés).
  • Prochaine étape : Tester LEACL sur des robots réels (pas seulement en simulation) et étendre à des tâches encore plus complexes (ex : démontage de machines).
  • [^1]: LIBERO Benchmark sur GitHub

    [^2]: LEAGUE : Méthode de l’état de l’art en ACL (mais basée sur des récompenses denses partiellement conçues par l’humain).