Flex-π : quand un seul modèle de 6 milliards de paramètres gère la vision, la géométrie 3D et l’action robotique


Imaginez un robot capable de comprendre une scène en 3D, d’identifier les objets par leur sémantique, et d’agir avec précision — le tout avec un seul modèle de 6 milliards de paramètres. C’est exactement ce que propose Flex-π, un World-Action Model (WAM) développé par l’Université de Washington et l’Allen Institute for AI. Contrairement aux approches classiques qui séparent vision, compréhension et contrôle, Flex-π fusionne ces trois dimensions dans un espace latent partagé, où chaque modalité (RGB, géométrie 3D, sémantique d’objets) est projetée et traitée de manière unifiée.
Le cœur de Flex-π repose sur un VAE (Variational Autoencoder) gelé, issu d’un modèle de génération vidéo pré-entraîné. Ce VAE encode non seulement les images RGB, mais aussi les pointmaps 3D — des représentations géométriques des scènes — sans aucun entraînement spécifique pour ces dernières. Autrement dit, le même VAE qui reconstruit des pixels peut aussi reconstruire des nuages de points, avec une perte quasi nulle. Une astuce qui évite d’ajouter des capteurs dédiés ou de réentraîner des priors visuels.
Pour enrichir la compréhension de la scène, Flex-π utilise DINOv3 (un modèle de segmentation sémantique) pour extraire des tokens d’objets à partir des images RGB. Ces tokens sont ensuite fusionnés avec les autres modalités dans le même espace latent. Résultat : le robot ne se contente pas de voir des pixels, il comprend ce qu’il manipule (ex. : "bouteille", "pinceau", "câble").
Les données visuelles (RGB, pointmaps, tokens DINO) et les actions sont traitées par un Mixture-of-Transformers (MoT), une architecture qui combine plusieurs flux de données en un seul modèle. Ce backbone, initialisé à partir du même modèle vidéo que le VAE, permet de générer à la fois les futures observations visuelles et les actions du robot. Une approche qui exploite les priors visuels à grande échelle (issus de l’entraînement sur des vidéos internet) pour améliorer la qualité des prédictions.
L’innovation majeure de Flex-π réside dans sa capacité à ajuster son niveau de calcul en fonction des besoins. Grâce à une technique appelée *per-stream dropout avec cross-modality forcing***, le modèle peut fonctionner dans plusieurs modes à l’inférence :
Cette flexibilité permet aux utilisateurs de choisir leur compromis vitesse/performance sans avoir à réentraîner le modèle. Par exemple :
Flex-π a été évalué sur trois benchmarks majeurs : RoboTwin, LIBERO et des tâches réelles de manipulation bimanuelle (ex. : zipper un sac mou, réparer un gripper). Les résultats sont impressionnants :
| Modèle | Taux de succès (LIBERO) | Latence (ms) |
|---|---|---|
| π₀.₅ | ~80 % | 70 |
| ManiFlow | ~85 % | 85 |
| Flex-π (action-only) | ~92 % | 60 |
| Flex-π (joint gen.) | ~99,2 % | 120 |
Note : Les latences sont mesurées sur un matériel standard (NVIDIA RTX 4090).
Flex-π est pré-entraîné sur ~500 heures de données issues de 100 tâches de manipulation bimanuelle, capturées à 30 Hz depuis des caméras embarquées. Les pointmaps 3D sont générés via Depth Anything 3 (un modèle de profondeur monocular), et les tokens DINO via DINOv3. Aucune nouvelle modalité de capteur n’est nécessaire.
Après pré-entraînement, Flex-π peut être affiné sur des jeux de données ciblés (ex. : DROID) pour améliorer ses performances sur des tâches particulières. Les checkpoints sont disponibles en open source, avec des exemples d’utilisation prêts à l’emploi.
À l’inférence, l’utilisateur choisit le mode d’entrée/sortie (ex. : RGB seul, ou RGB + pointmaps + DINO). Le modèle génère alors les actions (et éventuellement les futures observations) en K étapes d’Euler d’un flow-matching ODE. La latence dépend du mode sélectionné, mais reste compétitive face aux modèles existants.
Malgré ses performances, Flex-π n’est pas parfait :
Les auteurs soulignent que des améliorations sont possibles, notamment en intégrant des capacités de raisonnement sémantique plus poussées ou en augmentant la quantité de données d’entraînement. Flex-π est conçu comme une base modulaire : la communauté est invitée à l’étendre ou à l’adapter à de nouvelles tâches.
1. Unification des modalités : Plus besoin de pipelines séparés pour la vision, la géométrie et l’action. Tout est traité dans un seul espace latent.
2. Efficacité calculatoire : Le modèle s’adapte aux ressources disponibles, sans compromis sur la performance.
3. Généralisation : Flex-π excelle même sur des tâches hors distribution, un défi majeur en robotique.
4. Open source : Les checkpoints, le code et les données sont accessibles, permettant à quiconque de reproduire ou d’étendre les résultats.
Flex-π marque une étape importante dans la robotique générale, où les modèles doivent combiner vision, compréhension et action de manière unifiée. Son approche multi-stream et calcul-flexible ouvre la voie à des robots capables de s’adapter à des environnements dynamiques et imprévisibles, avec une efficacité inégalée.
Pour aller plus loin :
Hype-mètre : 4,5/5 (Prototype révolutionnaire avec déploiement potentiel imminent en industrie et recherche).