Comment les robots peuvent-ils s’adapter en un seul tour pour vous aider ?


Imaginez un robot à qui vous dites : « Construit-moi une tour rouge. » Sans autre information, il doit deviner ce que vous attendez exactement : une tour en blocs rouges, une tour rouge et haute, ou une structure avec un sommet rouge ?
Dans la robotique classique, cette ambiguïté bloque tout : le robot doit soit poser des questions (perte de temps), soit essayer une solution au hasard (risque d’échec). Mais que se passerait-il s’il pouvait deviner votre intention en une seule interaction ? C’est l’ambition de la recherche sur les « Assistance Games » (jeux d’assistance), où un humain et un robot collaborent pour atteindre un but… sans que le robot sache à l’avance ce qu’il doit faire.
Dans un jeu d’assistance, l’humain connaît l’objectif, mais le robot ne le découvre qu’à travers vos actions. Jusqu’ici, cela nécessitait des algorithmes complexes planifiant sur le long terme (comme des POMDP, Partially Observable Markov Decision Process), souvent trop lents pour un usage réel.
Notre researches identifient une classe de jeux où le robot peut résoudre ce problème en un seul tour grâce à ce qu’on appelle la raison pragmatique-pédagogique. Concrètement :
Prenons deux scénarios où vous demandez une « tour rouge » :
1. Vous empilez des blocs rouges → Le robot en déduit que vous voulez une tour complètement rouge.
2. Vous empilez des blocs rouges et bleus, mais vous ajustez soigneusement la hauteur pour que seul le sommet soit rouge → Le robot interprète cela comme une demande de tour avec un sommet rouge distinct (et non une tour entièrement rouge).
Dans le second cas, vos mouvements aident le robot à comprendre que le système compte plus que le résultat immédiat. C’est la pédagogie : vous agissez de façon à ce que le robot apprenne votre intention.
> « En un seul tour, le robot bascule du mode ‘interprétation’ au mode ‘aide’. C’est comme si votre co-pilote automobile devinait instantanément que vous voulez prendre la sortie 42… sans que vous ayez à répéter 3 fois. »
> — Pr. Stuart Russell (UC Berkeley), co-auteur de l’étude.
Les chercheurs ont testé cette méthode sur une tâche simple de construction de tours avec des blocs, où le robot doit différencier :
Résultat : Leur algorithme (AssistanceZero) a résolu le problème à 100 % en un tour sur des dizaines de scénarios, là où les méthodes classiques échouaient ou nécessitaient plusieurs essais.
Hype-mètre : 4,5/5 (Résultat académique solide, mais à valider à grande échelle en robotique industrielle).
Imaginez un chat qui vous observe cuisiner. Vous
placez toujours la poêle à gauche du four pour gagner du temps. Un jour, vous la posez à droite : le chat comprend que vous avez un nouvel objectif (cuisiner quelque chose de différent). Le robot, lui, fait la même chose… mais en mathématiques.
Les algorithmes reposent sur :
1. Un modèle de l’humain : Comment un humain optimise-t-il ses actions pour signaler un but ?
2. Un traitement des ambiguïtés : Si deux objectifs semblent plausibles (tour rouge vs sommet rouge), le robot regarde comment vous bougez pour trancher.
3. Un "meilleur réponse" instantané : Une fois l’objectif déduit, il agit immédiatement.
> Analogie grand public : C’est comme un GPS qui, après votre premier virage, comprend que vous voulez éviter les bouchons… sans que vous ayez à taper votre destination une seconde fois.
Pour aller plus loin : Les auteurs publient aussi des travaux sur l’alignement de valeurs et les algorithmes d’assistance optimaux.
Code disponible : GitHub AssistanceZero (bientôt open source).