EmbodiedSWE : quand les agents codeurs deviennent les professeurs des robots


Jusqu’ici, les robots industriels ou de recherche excellaient dans des environnements contrôlés : saisie d’objets simples, déplacement en ligne droite, ou assemblage de pièces bien définies. Mais dès qu’une tâche dépasse quelques minutes — comme assembler un meuble IKEA, découper un aliment avec précision, ou manipuler des objets déformables — les approches classiques s’effondrent.
Pourquoi ? Parce que ces tâches combinent plusieurs contraintes :
Résultat : les solutions existantes reposent sur des primitives prédéfinies (mouvements préprogrammés) ou des interfaces humaines (comme des requêtes de pose d’objets), ce qui réduit leur flexibilité.
L’équipe derrière EmbodiedSWE propose une approche radicalement différente : faire écrire du code aux agents pour contrôler les robots. Concrètement, un agent IA (comme un modèle de type coding agent) reçoit une description textuelle de la tâche — par exemple, « Assemble les quatre pieds de la table IKEA » — et génère un programme de contrôle en temps réel.
Ce programme est ensuite exécuté, testé et optimisé dans un simulateur physique (Isaac Sim de NVIDIA), où l’agent peut ajuster les paramètres (vitesse, force, trajectoire) jusqu’à ce que la tâche soit accomplie. Le processus s’inspire du travail d’un ingénieur humain, mais à une vitesse et une précision inégalées.
Pour mesurer les capacités de ces agents, les chercheurs ont créé EmbodiedSWE-Bench, un benchmark composé de 28 tâches couvrant des scénarios réalistes :
Ces tâches sont exécutées sur 17 plateformes robotiques différentes, allant de bras manipulateurs simples (Franka, xArm7) à des humanoïdes (Unitree G1).
Les résultats sont sans appel : les agents les plus avancés (comme GPT-6 Astra) atteignent un taux de réussite de 82 % sur certaines tâches, contre seulement 11 % pour des modèles moins performants (GPT-5.6 Terra).
Mais générer une solution pour une tâche spécifique ne suffit pas. L’enjeu est de réutiliser ces solutions pour entraîner des politiques robotiques plus générales, comme les modèles Vision-Langage-Action (VLA).
C’est là qu’intervient EmbodiedSWE-Gen : un pipeline qui prend une solution écrite par un agent, la diversifie en générant des milliers de variantes (changements de position des objets, variations de forme, etc.), puis utilise ces données pour affiner un VLA.
Les résultats montrent que :
1. Scalabilité : Un seul agent peut générer des milliers de démonstrations, là où un humain en créerait quelques dizaines.
2. Flexibilité : Les tâches sont décrites en langage naturel, sans besoin de primitives prédéfinies.
3. Autonomie : L’agent explore le simulateur sans contraintes, ce qui permet de découvrir des solutions inattendues.
Malgré ces avancées, deux défis persistent :
Les chercheurs explorent désormais des méthodes pour améliorer le transfert vers le monde réel et réduire la dépendance aux simulateurs.
EmbodiedSWE démontre que les agents codeurs peuvent devenir des professeurs pour les robots, en générant des démonstrations scalables pour entraîner des politiques générales. Une avancée majeure pour la robotique de demain, où les machines pourraient enfin maîtriser des tâches aussi complexes que celles d’un humain — mais en bien moins de temps.
Source : [arxiv.org](https://arxiv.org/html/2609.27308v1) | [embodiedswe.github.io](https://embodiedswe.github.io/) | [paperswithcode.com](https://paperswithcode.co/paper/2609.27308)