EndoLIFT : comment un modèle VLA résout l’ambiguïté directionnelle en endoscopie robotisée


Imaginez un endoscope robotisé recevant l’instruction : « Avance jusqu’à la zone suspecte ». La scène visuelle est identique à celle d’un « Reviens en arrière pour inspecter » quelques secondes plus tard. Pourtant, les deux commandes nécessitent des actions opposées (avancer vs reculer). Ce phénomène, que les auteurs nomment intent aliasing, est une source majeure d’erreurs en endoscopie robotisée : une même image peut correspondre à deux intentions contradictoires, rendant le système incapable de distinguer le sens de la manœuvre.
Les modèles classiques de contrôle visuo-moteur, même équipés de Vision-Language-Action (VLA), échouent à résoudre cette ambiguïté. Leur architecture repose sur une mapping direct entre l’observation visuelle, l’instruction linguistique et l’action, sans mécanisme explicite pour dissocier l’intention du contexte spatial. Résultat : des erreurs de direction fréquentes, surtout lorsque l’instruction change avant que la scène ne se modifie.
Pour contourner ce problème, les chercheurs proposent EndoLIFT (Endoscopic Language-Instruction Flow with Trajectory Latents), un modèle VLA qui introduit deux innovations clés :
1. Désambiguïsation par langage :
Le modèle intègre une condition explicite de l’intention via le langage. L’instruction textuelle est utilisée non seulement pour guider l’action, mais aussi pour sélectionner le mode directionnel (avancer ou reculer). Cette séparation permet au système de distinguer clairement l’intention de la trajectoire, même lorsque les observations visuelles sont identiques.
2. Latents de trajectoire stochastiques :
Un variational trajectory latent (un vecteur latent de 32 dimensions) conditionne la génération des actions en continu. Ce latent encode des informations sur la trajectoire passée et future, permettant au modèle de générer des chunks d’actions cohérents avec l’intention linguistique. Contrairement aux approches classiques qui génèrent des actions à chaque pas de temps de manière indépendante, EndoLIFT utilise ces latents pour lisser la trajectoire et éviter les changements brusques de direction.
Les performances d’EndoLIFT ont été évaluées sur plusieurs scénarios, avec des gains significatifs par rapport aux modèles de référence :
L’architecture d’EndoLIFT repose sur trois composants principaux :
1. Encodage visuel et linguistique :
2. Conditionnement par latents de trajectoire :
Un autoencodeur variationnel génère un latent de 32 dimensions à partir de l’état précédent et de l’instruction. Ce latent est ensuite utilisé pour conditionner un modèle de flux rectifié (rectified flow), qui génère des actions en continu.
3. Génération d’actions :
Le modèle produit des chunks d’actions (séquences de mouvements) plutôt que des actions isolées. Ces chunks sont générés de manière stochastique, ce qui permet d’explorer plusieurs trajectoires possibles et de sélectionner la plus cohérente avec l’intention linguistique.
Les modèles VLA classiques, comme ceux présentés dans EndoVLA ou BiliVLA, se concentrent sur l’alignement perception-action via des instructions linguistiques. Cependant, ils négligent souvent l’ambiguïté intrinsèque des tâches bidirectionnelles, où une même observation peut correspondre à des intentions opposées. EndoLIFT comble cette lacune en découplant explicitement l’intention du mouvement, grâce à :
Cette approche ouvre la voie à des systèmes endoscopiques plus robustes et généralisables, capables de gérer des scénarios complexes où l’intention évolue rapidement.
Note de Hype-mètre : 3/5 (Innovation technique majeure, mais validation encore limitée à des phantoms et essais ex-vivo. Prochaine étape : déploiement clinique.)