💡 En 3 points clés
- MolmoAct2 (AI2) a affiché un taux de réussite de 97 % sur les tâches de rangement dans l’environnement de benchmark LIBERO Goal, mais seulement 30 % dans le cadre de l’essai physique de ROBOTIS. Une différence qui interroge : les modèles VLA, entraînés en simulation, peinent-ils à transposer leurs compétences dans le monde réel ?
- VLA-JEPA (Hugging Face) a obtenu 96 % de réussite sur LIBERO-10, mais n’a pas dépassé 20 % dans l’expérience de ROBOTIS. Son approche, basée sur la prédiction de frames latents, semble moins robuste face aux aléas du monde physique.
- FastWAM, enfin, n’a même pas pu être évalué correctement : son modèle n’a pas pu être chargé, et les tests ont révélé un défaut en amont, rendant les résultats non reproductibles.
Une expérience qui interroge la maturité des VLA
ROBOTIS, spécialiste coréen des actionneurs et manipulateurs robotiques, a récemment mené une série d’essais sur son bras OMY-F3M en y intégrant quatre politiques issues de l’écosystème LeRobot (Hugging Face). L’objectif ? Évaluer leur capacité à accomplir une tâche physique simple : ranger des objets dans un panier. Un test qui, en apparence anodin, révèle en réalité les forces et les limites des modèles Vision-Language-Action (VLA) actuels.
Parmi les quatre modèles testés — GR00T N1.7 (NVIDIA), MolmoAct2 (Allen Institute for AI), VLA-JEPA (Hugging Face) et FastWAM (open source) — seul le premier a réussi à terminer régulièrement la séquence complète, avec un taux de réussite de 60 % lorsque le lissage temporel était activé. Les autres modèles ont plafonné entre 20 % et 30 %, voire moins pour FastWAM, qui n’a même pas pu charger correctement son modèle dans l’environnement de test.
GR00T N1.7 : le favori, mais pas sans failles
GR00T N1.7, développé par NVIDIA, s’est distingué par sa capacité à enchaîner les sous-tâches (saisir, déplacer, lâcher) avec une certaine cohérence. Pourtant, même ce modèle n’a pas atteint des performances parfaites. Les résultats détaillés montrent que certaines tâches, comme le rangement de la sauce tomate ou du jus d’orange, ont été réussies dans 90 % des cas, tandis que d’autres, comme le placement de la sauce barbecue, ont chuté à 70 %. Une variabilité qui souligne que les VLA restent sensibles aux variations de contexte, même minimes.
Les autres modèles : des promesses à confirmer
MolmoAct2 (AI2) a affiché un taux de réussite de 97 % sur les tâches de rangement dans l’environnement de benchmark LIBERO Goal, mais seulement 30 % dans le cadre de l’essai physique de ROBOTIS. Une différence qui interroge : les modèles VLA, entraînés en simulation, peinent-ils à transposer leurs compétences dans le monde réel ?VLA-JEPA (Hugging Face) a obtenu 96 % de réussite sur LIBERO-10, mais n’a pas dépassé 20 % dans l’expérience de ROBOTIS. Son approche, basée sur la prédiction de frames latents, semble moins robuste face aux aléas du monde physique.FastWAM, enfin, n’a même pas pu être évalué correctement : son modèle n’a pas pu être chargé, et les tests ont révélé un défaut en amont, rendant les résultats non reproductibles.Une avancée, mais des questions persistent
Ces essais confirment que les VLA commencent à quitter le stade de la recherche pour s’aventurer dans des applications concrètes. Pourtant, plusieurs obstacles restent à surmonter avant une adoption massive :
La robustesse : Les modèles restent sensibles aux variations d’éclairage, de texture ou de position des objets. Un simple changement de couleur ou d’angle peut faire chuter les performances.La généralisation : Les politiques entraînées en simulation (comme sur LIBERO) peinent à s’adapter à des environnements réels, même légèrement différents.L’infrastructure : Certains modèles nécessitent des ressources matérielles importantes (GPU haut de gamme, mémoire dédiée), ce qui limite leur déploiement sur des systèmes embarqués ou des robots grand public.Et maintenant ?
ROBOTIS a choisi de publier ses résultats en open source, via son dépôt robotis_lab, pour encourager la communauté à reproduire et améliorer ces politiques. Une démarche qui rappelle celle de Hugging Face avec LeRobot : la transparence comme levier de progrès. Mais pour l’instant, les VLA restent des outils de laboratoire, prometteurs mais encore loin d’être prêts pour une industrialisation à grande échelle.
En bref
GR00T N1.7 est le seul modèle à avoir terminé régulièrement la tâche de rangement, avec 60 % de réussite (lissage temporel activé).MolmoAct2 et VLA-JEPA affichent des résultats excellents en simulation, mais décevants en conditions réelles.FastWAM n’a même pas pu être testé correctement, révélant des problèmes de reproductibilité.Les VLA progressent, mais leur maturité pour des applications industrielles reste limitée.Note de Hype-mètre : 3/5 (Avancée technique réelle, mais loin d’être mature pour une adoption industrielle à grande échelle).