Rho : un modèle VLA conçu pour s’adapter avec peu de données et corriger ses erreurs en temps réel


Les modèles Vision-Langage-Action (VLA) visent à unifier trois capacités clés pour un robot : comprendre une instruction en langage naturel, analyser une scène visuelle, et générer des actions précises pour manipuler son environnement. Rho, développé par une équipe de chercheurs, se distingue par son approche modulaire et data-efficace, conçue pour s’adapter rapidement à de nouveaux robots ou tâches avec un minimum de données.
Contrairement aux modèles monolithiques qui nécessitent des jeux de données massifs et coûteux pour chaque nouvelle configuration, Rho repose sur une architecture hybride :
Cette séparation permet de figer les compétences de base (comme la saisie d’objets ou la trajectoire de bras) tout en laissant un espace pour une adaptation fine sans réentraînement complet du modèle.
Rho est conçu pour fonctionner sur trois plateformes représentatives de robots à deux bras, couramment utilisées en recherche et en industrie :
Le modèle est d’abord pré-entraîné sur des tâches génériques de manipulation, puis spécialisé pour chaque plateforme via un processus appelé "embodiment midtraining". Cette étape intermédiaire, entre le pré-entraînement et l’adaptation finale, améliore significativement les performances sur les tâches spécifiques à chaque robot.
Dans des expériences contrôlées, Rho a été évalué sur des tâches de manipulation bimanuelle, comme l’assemblage d’objets ou la manipulation d’outils. Les résultats montrent que :
L’un des apports majeurs de Rho réside dans sa capacité à apprendre en ligne à partir de feedbacks humains. Plutôt que de reposer uniquement sur des démonstrations pré-enregistrées, Rho intègre un module latent qui apprend à ajuster les actions de l’expert figé en fonction des corrections fournies par un opérateur. Par exemple :
Cette approche réduit considérablement le temps et les ressources nécessaires pour adapter un robot à une nouvelle tâche, tout en améliorant sa robustesse face à des situations imprévues.
Rho se positionne comme une alternative pragmatique aux modèles VLA monolithiques, souvent gourmands en données et en calcul. Ses atouts clés incluent :
Ces caractéristiques en font un outil idéal pour la recherche (où les ressources sont limitées) et pour l’industrie (où les tâches évoluent rapidement).
Les modèles de la famille Rho, y compris les versions de base et les checkpoints spécifiques aux plateformes, sont open-weights et disponibles pour la communauté. Cette ouverture vise à accélérer l’innovation en robotique, en permettant aux chercheurs et aux industriels de tester et d’adapter Rho à leurs propres cas d’usage.
Rho démontre qu’il est possible de concilier généralité et efficacité dans les modèles VLA, en combinant une architecture modulaire, une adaptation data-efficace et une capacité de correction en ligne. Avec des performances compétitives et une approche pragmatique, Rho ouvre la voie à des robots plus autonomes et plus faciles à déployer dans des environnements réels.