Auto-JEPA : quand l’IA de conduite autonome se concentre sur l’essentiel (et ignore le reste)


Imaginez un conducteur humain qui, en regardant la route, ne se préoccupe que des éléments pertinents pour sa trajectoire : une voiture qui ralentit devant lui, un piéton qui s’apprête à traverser, ou un panneau indiquant un virage. Tout le reste – les arbres, les bâtiments, ou même une publicité géante – est ignoré, car sans impact sur sa conduite.
C’est exactement le principe d’Auto-JEPA, un modèle de world model (modèle du monde) conçu pour les véhicules autonomes. Contrairement aux approches classiques qui tentent de prédire tout ce qui pourrait se passer sur la route (vidéos futures, positions des autres véhicules, occupation des espaces, etc.), Auto-JEPA se concentre uniquement sur ce qui influence directement la trajectoire du véhicule autonome.
La plupart des modèles de planification pour véhicules autonomes fonctionnent comme des caméras à 360° : ils enregistrent tout, analysent tout, et en déduisent une trajectoire. Problème ? Cela demande une puissance de calcul colossale et une quantité astronomique de données annotées.
Auto-JEPA change la donne en adoptant une approche minimaliste et ciblée :
Sur les benchmarks NAVSIM v1 et NAVSIM v2 (des tests standardisés pour l’évaluation des véhicules autonomes), Auto-JEPA a obtenu des scores records :
Mieux encore, des expériences d’occlusion sémantique (où certains éléments de la scène sont masqués) montrent que le modèle réagit uniquement aux éléments pertinents :
Auto-JEPA prouve qu’un véhicule autonome n’a pas besoin de tout voir pour bien conduire. En se concentrant sur l’essentiel, il gagne en efficacité, en rapidité, et en généralisation.
Note de Hype-mètre : 4,5/5 (Innovation majeure, mais encore en phase de prototype avancé).
Sources : [arxiv.org](https://arxiv.org/abs/2607.29031)