WALT : quand les modèles de monde latent apprennent à parler le langage des trajectoires


Un modèle de monde latent pour la conduite autonome, comme ceux basés sur des architectures JEPA (Joint-Embedding Predictive Architecture), excelle à prédire l’évolution future d’une scène à partir d’images : où iront les autres véhicules, comment la route va se déformer, ou quels obstacles émergeront. Pourtant, cette richesse prédictive ne se traduit pas automatiquement en trajectoires exécutables. La raison ? Le modèle encode des états visuels riches, mais le planificateur doit travailler avec des waypoints bruts (coordonnées 2D ou 3D), une représentation géométrique pauvre en sémantique actionnable.
C’est ce décalage que WALT (World-Model Alignment for Latent Trajectories) cherche à combler. Plutôt que de modifier le modèle de monde latent lui-même, WALT traduit ses prédictions en un espace latent compact et sémantiquement riche, directement exploitable par un planificateur de trajectoires.
WALT repose sur deux idées clés :
1. Un autoencodeur de trajectoire à double branche
2. Un alignement par prédiction conjointe (JEPA)
Sur les benchmarks NAVSIM v1 et v2, WALT améliore les scores de planification tout en réduisant la charge de calcul :
| Métrique | NAVSIM v1 (PDMS) | NAVSIM v2 (EPDMS) | Réduction FLOPs |
|---|---|---|---|
| Baseline (waypoints bruts) | 89.4 | 87.3 | — |
| WALT | 89.8 | 87.9 | 30,5 % |
Ces gains proviennent de deux facteurs :
WALT illustre une tendance forte en robotique autonome : séparer la prédiction de la planification, mais en créant des interfaces efficaces entre les deux. Plutôt que de tout faire dans un seul modèle (ce qui alourdit les calculs et complique l’entraînement), on optimise chaque module pour sa tâche :
Cette approche rejoint d’autres travaux récents comme Auto-JEPA ou ForeDrive, qui explorent aussi des latents de trajectoire alignés avec des modèles de monde. La différence ? WALT ne modifie pas le modèle de monde et se concentre sur l’interface entre prédiction et planification.
Les auteurs soulignent que WALT ouvre la voie à des architectures où :
Reste à valider ces gains en conditions réelles, mais les résultats sur NAVSIM montrent que l’efficacité calculatoire et la pertinence sémantique peuvent aller de pair.