Physical Artificial Intelligence newsPAI news
← Retour aux actualités
24 Août 2026Niveau : Essentiel

EndoLIFT : comment un modèle VLA résout l’ambiguïté directionnelle en endoscopie robotisée

📑 Sommaire
💡 En 3 points clés
  • Précision directionnelle : +11,1 points de pourcentage par rapport à un modèle VLA sans latents de trajectoire.
  • Réduction des erreurs d’avancée : -83 % de commandes dans la mauvaise direction.
  • Robustesse aux variantes linguistiques : Le modèle maintient une précision d’intention de 82,8 % sur 44 variantes linguistiques différentes, prouvant sa capacité à généraliser au-delà des formulations standard.

Le problème : quand l’endoscope ne sait plus où aller

Imaginez un endoscope robotisé recevant l’instruction : « Avance jusqu’à la zone suspecte ». La scène visuelle est identique à celle d’un « Reviens en arrière pour inspecter » quelques secondes plus tard. Pourtant, les deux commandes nécessitent des actions opposées (avancer vs reculer). Ce phénomène, que les auteurs nomment intent aliasing, est une source majeure d’erreurs en endoscopie robotisée : une même image peut correspondre à deux intentions contradictoires, rendant le système incapable de distinguer le sens de la manœuvre.

Les modèles classiques de contrôle visuo-moteur, même équipés de Vision-Language-Action (VLA), échouent à résoudre cette ambiguïté. Leur architecture repose sur une mapping direct entre l’observation visuelle, l’instruction linguistique et l’action, sans mécanisme explicite pour dissocier l’intention du contexte spatial. Résultat : des erreurs de direction fréquentes, surtout lorsque l’instruction change avant que la scène ne se modifie.

EndoLIFT : une architecture qui sépare l’intention du mouvement

Pour contourner ce problème, les chercheurs proposent EndoLIFT (Endoscopic Language-Instruction Flow with Trajectory Latents), un modèle VLA qui introduit deux innovations clés :

1. Désambiguïsation par langage :

Le modèle intègre une condition explicite de l’intention via le langage. L’instruction textuelle est utilisée non seulement pour guider l’action, mais aussi pour sélectionner le mode directionnel (avancer ou reculer). Cette séparation permet au système de distinguer clairement l’intention de la trajectoire, même lorsque les observations visuelles sont identiques.

2. Latents de trajectoire stochastiques :

Un variational trajectory latent (un vecteur latent de 32 dimensions) conditionne la génération des actions en continu. Ce latent encode des informations sur la trajectoire passée et future, permettant au modèle de générer des chunks d’actions cohérents avec l’intention linguistique. Contrairement aux approches classiques qui génèrent des actions à chaque pas de temps de manière indépendante, EndoLIFT utilise ces latents pour lisser la trajectoire et éviter les changements brusques de direction.

Résultats : une précision directionnelle boostée

Les performances d’EndoLIFT ont été évaluées sur plusieurs scénarios, avec des gains significatifs par rapport aux modèles de référence :

  • Précision directionnelle : +11,1 points de pourcentage par rapport à un modèle VLA sans latents de trajectoire.
  • Réduction des erreurs d’avancée : -83 % de commandes dans la mauvaise direction.
  • Robustesse aux variantes linguistiques : Le modèle maintient une précision d’intention de 82,8 % sur 44 variantes linguistiques différentes, prouvant sa capacité à généraliser au-delà des formulations standard.
  • Succès en conditions réelles : Sur des phantoms coliques (modèles anatomiques artificiels) et des phantoms pulmonaires/gastriques non vus pendant l’entraînement, EndoLIFT améliore le taux de succès global de 30 points de pourcentage par rapport à une version sans latents de trajectoire. Enfin, il a réussi 10 essais sur 10 sur des trachées porcines ex-vivo, validant sa fiabilité en conditions proches du réel.
  • Comment ça marche ?

    L’architecture d’EndoLIFT repose sur trois composants principaux :

    1. Encodage visuel et linguistique :

  • Une image RGB de l’endoscope est encodée via un encodeur visuel gelé (par exemple, un modèle de type ViT ou ConvNeXt).
  • L’instruction textuelle est tokenisée et encodée par un encodeur de langage (par exemple, un modèle de type BERT ou Qwen2-VL).
  • 2. Conditionnement par latents de trajectoire :

    Un autoencodeur variationnel génère un latent de 32 dimensions à partir de l’état précédent et de l’instruction. Ce latent est ensuite utilisé pour conditionner un modèle de flux rectifié (rectified flow), qui génère des actions en continu.

    3. Génération d’actions :

    Le modèle produit des chunks d’actions (séquences de mouvements) plutôt que des actions isolées. Ces chunks sont générés de manière stochastique, ce qui permet d’explorer plusieurs trajectoires possibles et de sélectionner la plus cohérente avec l’intention linguistique.

    Pourquoi c’est une avancée ?

    Les modèles VLA classiques, comme ceux présentés dans EndoVLA ou BiliVLA, se concentrent sur l’alignement perception-action via des instructions linguistiques. Cependant, ils négligent souvent l’ambiguïté intrinsèque des tâches bidirectionnelles, où une même observation peut correspondre à des intentions opposées. EndoLIFT comble cette lacune en découplant explicitement l’intention du mouvement, grâce à :

  • Une condition linguistique explicite pour sélectionner le mode directionnel.
  • Un mécanisme de latents de trajectoire pour générer des actions cohérentes et lissées.
  • Cette approche ouvre la voie à des systèmes endoscopiques plus robustes et généralisables, capables de gérer des scénarios complexes où l’intention évolue rapidement.

    Note de Hype-mètre : 3/5 (Innovation technique majeure, mais validation encore limitée à des phantoms et essais ex-vivo. Prochaine étape : déploiement clinique.)