Physical Artificial Intelligence newsPAI news
← Retour aux actualités
28 Septembre 2026Niveau : Essentiel

WALT : quand les modèles de monde latent apprennent à parler le langage des trajectoires

📑 Sommaire
💡 En 3 points clés
  • Une branche encode les waypoints bruts (coordonnées x,y,vitesse) en un espace latent compact.
  • L’autre branche transfère la sémantique du modèle de monde latent dans ce même espace, en alignant les latents des trajectoires prédites avec ceux des états visuels futurs.
  • Résultat : le latent de trajectoire hérite des indices de scène pertinents pour la planification (ex : présence d’un piéton, d’une intersection complexe), sans avoir à reconstruire l’image.

Un problème de traduction entre vision et action

Un modèle de monde latent pour la conduite autonome, comme ceux basés sur des architectures JEPA (Joint-Embedding Predictive Architecture), excelle à prédire l’évolution future d’une scène à partir d’images : où iront les autres véhicules, comment la route va se déformer, ou quels obstacles émergeront. Pourtant, cette richesse prédictive ne se traduit pas automatiquement en trajectoires exécutables. La raison ? Le modèle encode des états visuels riches, mais le planificateur doit travailler avec des waypoints bruts (coordonnées 2D ou 3D), une représentation géométrique pauvre en sémantique actionnable.

C’est ce décalage que WALT (World-Model Alignment for Latent Trajectories) cherche à combler. Plutôt que de modifier le modèle de monde latent lui-même, WALT traduit ses prédictions en un espace latent compact et sémantiquement riche, directement exploitable par un planificateur de trajectoires.

Comment WALT fonctionne : un pont entre deux mondes

WALT repose sur deux idées clés :

1. Un autoencodeur de trajectoire à double branche

  • Une branche encode les waypoints bruts (coordonnées x,y,vitesse) en un espace latent compact.
  • L’autre branche transfère la sémantique du modèle de monde latent dans ce même espace, en alignant les latents des trajectoires prédites avec ceux des états visuels futurs.
  • Résultat : le latent de trajectoire hérite des indices de scène pertinents pour la planification (ex : présence d’un piéton, d’une intersection complexe), sans avoir à reconstruire l’image.
  • 2. Un alignement par prédiction conjointe (JEPA)

  • Le modèle de monde latent (ici, un V-JEPA ou I-JEPA adapté à la conduite) reste figé pendant l’entraînement de WALT.
  • Un prédicteur latent apprend à générer le latent de trajectoire futur à partir des observations courantes (image, historique de mouvement, commande de navigation), en alignant ce latent avec la cible définie par l’autoencodeur.
  • L’objectif n’est pas de prédire des pixels, mais des représentations actionnables.
  • Résultats : moins de calculs, plus de pertinence

    Sur les benchmarks NAVSIM v1 et v2, WALT améliore les scores de planification tout en réduisant la charge de calcul :

    MétriqueNAVSIM v1 (PDMS)NAVSIM v2 (EPDMS)Réduction FLOPs
    Baseline (waypoints bruts)89.487.3—
    WALT89.887.930,5 %

    Ces gains proviennent de deux facteurs :

  • Une représentation plus compacte : l’autoencodeur réduit la dimensionnalité des waypoints, ce qui allège le travail du planificateur.
  • Une sémantique enrichie : le latent de trajectoire intègre des informations comme la drivabilité ou les zones de conflit, absentes des waypoints bruts.
  • Pourquoi c’est important ?

    WALT illustre une tendance forte en robotique autonome : séparer la prédiction de la planification, mais en créant des interfaces efficaces entre les deux. Plutôt que de tout faire dans un seul modèle (ce qui alourdit les calculs et complique l’entraînement), on optimise chaque module pour sa tâche :

  • Le modèle de monde latent comprend la scène (vision + prédiction).
  • WALT traduit cette compréhension en actions (trajectoires sémantiques).
  • Le planificateur choisit la meilleure trajectoire parmi celles proposées.
  • Cette approche rejoint d’autres travaux récents comme Auto-JEPA ou ForeDrive, qui explorent aussi des latents de trajectoire alignés avec des modèles de monde. La différence ? WALT ne modifie pas le modèle de monde et se concentre sur l’interface entre prédiction et planification.

    Perspectives : vers des modèles plus légers et plus généralisables

    Les auteurs soulignent que WALT ouvre la voie à des architectures où :

  • Les modèles de monde latent pourraient être réutilisés pour plusieurs tâches (planification, contrôle, simulation), sans réentraînement.
  • Les planificateurs pourraient fonctionner avec des latents plutôt que des waypoints, réduisant la dépendance aux capteurs haute résolution.
  • Reste à valider ces gains en conditions réelles, mais les résultats sur NAVSIM montrent que l’efficacité calculatoire et la pertinence sémantique peuvent aller de pair.