Physical Artificial Intelligence newsPAI news
← Retour aux actualités
1 Octobre 2026Niveau : Essentiel

Rho : un modèle VLA conçu pour s’adapter avec peu de données et corriger ses erreurs en temps réel

📑 Sommaire
💡 En 3 points clés
  • Un expert d’action figé (flow-matching), pré-entraîné sur des tâches de manipulation génériques.
  • Un module latent léger (latent policy), entraîné pour apprendre à corriger les erreurs de l’expert en temps réel, via un feedback humain minimal.
  • YAM Box : une plateforme modulaire pour la manipulation bimanuelle.

Une architecture conçue pour l’efficacité

Les modèles Vision-Langage-Action (VLA) visent à unifier trois capacités clés pour un robot : comprendre une instruction en langage naturel, analyser une scène visuelle, et générer des actions précises pour manipuler son environnement. Rho, développé par une équipe de chercheurs, se distingue par son approche modulaire et data-efficace, conçue pour s’adapter rapidement à de nouveaux robots ou tâches avec un minimum de données.

Contrairement aux modèles monolithiques qui nécessitent des jeux de données massifs et coûteux pour chaque nouvelle configuration, Rho repose sur une architecture hybride :

  • Un expert d’action figé (flow-matching), pré-entraîné sur des tâches de manipulation génériques.
  • Un module latent léger (latent policy), entraîné pour apprendre à corriger les erreurs de l’expert en temps réel, via un feedback humain minimal.
  • Cette séparation permet de figer les compétences de base (comme la saisie d’objets ou la trajectoire de bras) tout en laissant un espace pour une adaptation fine sans réentraînement complet du modèle.

    Une adaptation en deux temps : pré-entraînement puis spécialisation

    Rho est conçu pour fonctionner sur trois plateformes représentatives de robots à deux bras, couramment utilisées en recherche et en industrie :

  • YAM Box : une plateforme modulaire pour la manipulation bimanuelle.
  • UR AI Trainer : un robot collaboratif de Universal Robots.
  • FR3 Duo : une configuration double bras de Franka Emika.
  • Le modèle est d’abord pré-entraîné sur des tâches génériques de manipulation, puis spécialisé pour chaque plateforme via un processus appelé "embodiment midtraining". Cette étape intermédiaire, entre le pré-entraînement et l’adaptation finale, améliore significativement les performances sur les tâches spécifiques à chaque robot.

    Des résultats concrets : moins de données, plus de précision

    Dans des expériences contrôlées, Rho a été évalué sur des tâches de manipulation bimanuelle, comme l’assemblage d’objets ou la manipulation d’outils. Les résultats montrent que :

  • Rho surpasse ou égale les performances des modèles VLA open-weights existants, tout en utilisant moins de données pour l’adaptation.
  • Avec seulement 15 épisodes corrigés (soit quelques minutes d’interaction humaine), le module latent de Rho permet d’adapter le modèle à des situations en dehors de sa distribution d’entraînement initiale.
  • Le modèle atteint des taux de réussite supérieurs à 80 % sur des tâches complexes, comme la manipulation d’objets fragiles ou l’utilisation d’outils en bimanuelle.
  • Correction en ligne : un pas vers l’autonomie interactive

    L’un des apports majeurs de Rho réside dans sa capacité à apprendre en ligne à partir de feedbacks humains. Plutôt que de reposer uniquement sur des démonstrations pré-enregistrées, Rho intègre un module latent qui apprend à ajuster les actions de l’expert figé en fonction des corrections fournies par un opérateur. Par exemple :

  • Si le robot échoue à saisir un objet dans une position inhabituelle, l’opérateur peut corriger sa trajectoire.
  • Rho intègre cette correction et ajuste son comportement pour les prochaines tentatives, sans avoir à réentraîner le modèle complet.
  • Cette approche réduit considérablement le temps et les ressources nécessaires pour adapter un robot à une nouvelle tâche, tout en améliorant sa robustesse face à des situations imprévues.

    Pourquoi Rho est-il un modèle prometteur ?

    Rho se positionne comme une alternative pragmatique aux modèles VLA monolithiques, souvent gourmands en données et en calcul. Ses atouts clés incluent :

  • Une modularité qui permet de séparer les compétences de base des adaptations spécifiques.
  • Une data-efficacité grâce à l’embodiment midtraining et au module latent.
  • Une capacité d’adaptation en ligne, réduisant le besoin de jeux de données massifs.
  • Ces caractéristiques en font un outil idéal pour la recherche (où les ressources sont limitées) et pour l’industrie (où les tâches évoluent rapidement).

    Disponibilité et perspectives

    Les modèles de la famille Rho, y compris les versions de base et les checkpoints spécifiques aux plateformes, sont open-weights et disponibles pour la communauté. Cette ouverture vise à accélérer l’innovation en robotique, en permettant aux chercheurs et aux industriels de tester et d’adapter Rho à leurs propres cas d’usage.

    En résumé

    Rho démontre qu’il est possible de concilier généralité et efficacité dans les modèles VLA, en combinant une architecture modulaire, une adaptation data-efficace et une capacité de correction en ligne. Avec des performances compétitives et une approche pragmatique, Rho ouvre la voie à des robots plus autonomes et plus faciles à déployer dans des environnements réels.