LEACL : Quand les LLM écrivent le programme d’entraînement des robots pour accomplir des tâches complexes


Imaginez un robot cuisinier qui doit mettre une bouilloire sur le feu, puis appuyer sur l’interrupteur, avant de verser de l’eau dans un bol. Une simple erreur d’ordre, comme appuyer sur l’interrupteur avant de poser la bouilloire, peut rendre la tâche impossible. Ce type de tâches à long horizon (plusieurs actions enchaînées) est un casse-tête pour les algorithmes d’apprentissage par renforcement (RL). Pourquoi ? Parce qu’ils sont pénalisés par des récompenses rares et peu informatives : le robot ne reçoit un feedback positif que s’il accomplit toutes les étapes sans erreur. Entre-temps, il tâtonne dans le noir, guidé par un signal aussi vague qu’un "Bravo !" après 10 essais.
Dans ces conditions, entraîner un robot à manipuler des objets revient souvent à… lui faire perdre son temps.
C’est là que LEACL (LLM-Enhanced Automatic Curriculum Learning) intervient, une méthode développée par des chercheurs qui fusionne deux idées révolutionnaires :
1. *Le Curriculum Learning automatique* (ACL) :
2. L’intervention des LLM pour automatiser le brouillon :
Les chercheurs ont testé LEACL sur 5 tâches de manipulation long-horizon issues de la suite de benchmarks LIBERO+ (une version étendue de LIBERO[^1] conçue pour évaluer l’ACL). Comparaisons avec :
| Méthode | Tâche 1* | Tâche 2** | Tâche 3 | Tâche 4 | Tâche 5 |
|---|---|---|---|---|---|
| Récompense clairsemée | 0% | 0% | 0% | 0% | 0% |
| LEACL (sans ACL) | 0% | 11,8% | 0% | 8,2% | 0% |
| LEAGUE[^2] | 99,4% | 71,0% | 29,8% | 21,1% | 0% |
| Humain (currriculum manuel) | 99,8% | 96,0% | 86,3% | 79,7% | 89,0% |
| LEACL (notre méthode) | 99,8% | 90,7% | 89,4% | 60,6% | 75,9% |
Tâche 1 : Ouvrir le tiroir du bas d’un meuble
**Tâche 2 : Poser un bol blanc sur une assiette
Performance clé : LEACL dépasse systématiquement les méthodes basées sur des récompenses denses conçues à la main, avec une marge parfois spectaculaire (+18% par rapport au meilleur humain sur la tâche 3).
LEACL fonctionne en 3 étapes clés :
1. Décomposition de la tâche par le LLM
2. Génération de spécifications PDDL
(:action ouvrir-robinet
:parameters (?f - faucet)
:precondition (closed ?f)
:effect (not (closed ?f)))3. Entrâinement progressif par ACL
✅ Moins d’ingénierie humaine : Finis les mois à écrire des récompenses pour chaque scénario.
✅ Généralisation : LEACL reproduit des performances proches d’un curriculum conçu par des experts humains, sans aucune adaptation manuelle.
✅ Réduction des coûts : Un seul LLM peut générer des centaines de curriculums pour différents robots ou environnements.
Notes de l’équipe RoboNews :
[^1]: LIBERO Benchmark sur GitHub
[^2]: LEAGUE : Méthode de l’état de l’art en ACL (mais basée sur des récompenses denses partiellement conçues par l’humain).