Physical Artificial Intelligence newsPAI news
← Retour aux actualités
28 Septembre 2026Niveau : EssentielX X — Robotique & IA

EmbodiedSWE : quand les agents codeurs deviennent les professeurs des robots

📑 Sommaire
💡 En 3 points clés
  • Horizon temporel long : jusqu’à 30 minutes de manipulation continue.
  • Interactions physiques complexes : contacts multiples, déformations, liquides.
  • Généralisation limitée : un robot entraîné sur une tâche ne sait pas adapter ses mouvements à une variante légèrement différente.

Le problème : des robots limités par des tâches trop longues ou trop précises

Jusqu’ici, les robots industriels ou de recherche excellaient dans des environnements contrôlés : saisie d’objets simples, déplacement en ligne droite, ou assemblage de pièces bien définies. Mais dès qu’une tâche dépasse quelques minutes — comme assembler un meuble IKEA, découper un aliment avec précision, ou manipuler des objets déformables — les approches classiques s’effondrent.

Pourquoi ? Parce que ces tâches combinent plusieurs contraintes :

  • Horizon temporel long : jusqu’à 30 minutes de manipulation continue.
  • Interactions physiques complexes : contacts multiples, déformations, liquides.
  • Généralisation limitée : un robot entraîné sur une tâche ne sait pas adapter ses mouvements à une variante légèrement différente.
  • Résultat : les solutions existantes reposent sur des primitives prédéfinies (mouvements préprogrammés) ou des interfaces humaines (comme des requêtes de pose d’objets), ce qui réduit leur flexibilité.

    La solution EmbodiedSWE : des agents qui écrivent du code pour les robots

    L’équipe derrière EmbodiedSWE propose une approche radicalement différente : faire écrire du code aux agents pour contrôler les robots. Concrètement, un agent IA (comme un modèle de type coding agent) reçoit une description textuelle de la tâche — par exemple, « Assemble les quatre pieds de la table IKEA » — et génère un programme de contrôle en temps réel.

    Ce programme est ensuite exécuté, testé et optimisé dans un simulateur physique (Isaac Sim de NVIDIA), où l’agent peut ajuster les paramètres (vitesse, force, trajectoire) jusqu’à ce que la tâche soit accomplie. Le processus s’inspire du travail d’un ingénieur humain, mais à une vitesse et une précision inégalées.

    EmbodiedSWE-Bench : un benchmark pour évaluer les agents sur des tâches du quotidien

    Pour mesurer les capacités de ces agents, les chercheurs ont créé EmbodiedSWE-Bench, un benchmark composé de 28 tâches couvrant des scénarios réalistes :

  • Assemblage : monter une table IKEA, fixer une carte mère avec 7 vis.
  • Manipulation d’objets déformables : nouer un lacet, plier un tissu.
  • Interactions avec des liquides : verser du café sans renverser.
  • Découpe : couper un aliment en suivant une forme précise.
  • Locomotion + manipulation : marcher tout en tenant un objet fragile.
  • Ces tâches sont exécutées sur 17 plateformes robotiques différentes, allant de bras manipulateurs simples (Franka, xArm7) à des humanoïdes (Unitree G1).

    Les résultats sont sans appel : les agents les plus avancés (comme GPT-6 Astra) atteignent un taux de réussite de 82 % sur certaines tâches, contre seulement 11 % pour des modèles moins performants (GPT-5.6 Terra).

    De la solution ponctuelle à l’apprentissage généralisé : EmbodiedSWE-Gen

    Mais générer une solution pour une tâche spécifique ne suffit pas. L’enjeu est de réutiliser ces solutions pour entraîner des politiques robotiques plus générales, comme les modèles Vision-Langage-Action (VLA).

    C’est là qu’intervient EmbodiedSWE-Gen : un pipeline qui prend une solution écrite par un agent, la diversifie en générant des milliers de variantes (changements de position des objets, variations de forme, etc.), puis utilise ces données pour affiner un VLA.

    Les résultats montrent que :

  • Plus le nombre de démonstrations générées est élevé, meilleure est la performance du VLA.
  • La généralisation s’améliore : le robot réussit mieux des variantes de tâches qu’il n’a jamais vues.
  • Transfert sim-to-real : un VLA affiné uniquement sur des démonstrations simulées par EmbodiedSWE-Gen a réussi à accomplir une tâche complexe de démontage de lampe sur un robot réel.
  • Pourquoi cette approche change la donne ?

    1. Scalabilité : Un seul agent peut générer des milliers de démonstrations, là où un humain en créerait quelques dizaines.

    2. Flexibilité : Les tâches sont décrites en langage naturel, sans besoin de primitives prédéfinies.

    3. Autonomie : L’agent explore le simulateur sans contraintes, ce qui permet de découvrir des solutions inattendues.

    Limites et prochaines étapes

    Malgré ces avancées, deux défis persistent :

  • Coût computationnel : L’exécution itérative dans le simulateur reste gourmande en ressources.
  • Spécialisation : Les solutions générées sont souvent trop adaptées à une tâche précise et peinent à généraliser à des scénarios radicalement différents.
  • Les chercheurs explorent désormais des méthodes pour améliorer le transfert vers le monde réel et réduire la dépendance aux simulateurs.

    En résumé

    EmbodiedSWE démontre que les agents codeurs peuvent devenir des professeurs pour les robots, en générant des démonstrations scalables pour entraîner des politiques générales. Une avancée majeure pour la robotique de demain, où les machines pourraient enfin maîtriser des tâches aussi complexes que celles d’un humain — mais en bien moins de temps.

    Source : [arxiv.org](https://arxiv.org/html/2609.27308v1) | [embodiedswe.github.io](https://embodiedswe.github.io/) | [paperswithcode.com](https://paperswithcode.co/paper/2609.27308)