ST-WAM : quand la robotique apprend à voir au-delà des apparences


Imaginez un robot en usine chargé de saisir une bouteille d’eau. Soudain, la lumière change, l’arrière-plan devient plus sombre, ou la bouteille est légèrement différente de celles vues à l’entraînement. Dans 74 % des cas, un robot classique échouera. Pourquoi ? Parce qu’il se fie à des pixels plutôt qu’à la sémantique de la scène.
C’est le phénomène que les chercheurs appellent la "Training-Distribution Hallucination" : le robot, confronté à une situation légèrement différente de son entraînement, hallucine des éléments de son environnement d’apprentissage plutôt que de s’adapter à la réalité. Résultat ? Il saisit une bouteille imaginaire ou rate sa trajectoire.
Plutôt que de se fier uniquement à des vidéos générées pour prédire les actions futures (comme le faisaient les modèles précédents), ST-WAM (Semantic-Temporal World Action Model) utilise deux innovations clés :
1. Une représentation sémantique stable :
2. Un système hybride pour l’action :
ST-WAM a été testé sur 5 tâches réelles et 4 benchmarks académiques, avec des gains impressionnants :
| Métrique | Avant (Fast-WAM) | Après (ST-WAM) | Amélioration |
|---|---|---|---|
| Succès en conditions nominales | 51,5 % | 72,8 % | +21,3 pts |
| Succès sous perturbations visuelles | 25,8 % | 61,5 % | +35,7 pts |
| Performance zero-shot (LIBERO-Plus) | 51,5 % | 72,8 % | +21,3 pts |
Exemple concret : Sur une tâche de saisie de fruits, ST-WAM passe de 46,7 % à 86,7 % de succès, même avec des changements d’éclairage ou d’arrière-plan.
Note de Hype-mètre : 4,5/5 (Avancée scientifique majeure, mais déploiement industriel encore limité par la complexité).
ST-WAM marque un tournant dans la robotique en détachant l’action de la perception brute. En combinant vision sémantique et mémoire temporelle, il ouvre la voie à des robots capables de s’adapter à des environnements réels, imprévisibles et changeants.
Pour aller plus loin : Consultez le papier complet sur arXiv ou explorez le code et les démos.