Physical Artificial Intelligence newsPAI news
← Retour aux actualités
20 Août 2026Niveau : Essentiel

Flex-π : quand un seul modèle de 6 milliards de paramètres gère la vision, la géométrie 3D et l’action robotique

📑 Sommaire
💡 En 3 points clés
  • Mode "action-only" : Seules les actions sont générées (latence minimale, ~60 ms par appel).
  • Mode "joint generation" : RGB, pointmaps 3D et tokens DINO sont prédits en plus des actions (meilleure précision, mais latence accrue).
  • Un robot en usine peut privilégier la vitesse pour des tâches répétitives.

Un modèle qui voit, comprend et agit — en une seule passe

Imaginez un robot capable de comprendre une scène en 3D, d’identifier les objets par leur sémantique, et d’agir avec précision — le tout avec un seul modèle de 6 milliards de paramètres. C’est exactement ce que propose Flex-π, un World-Action Model (WAM) développé par l’Université de Washington et l’Allen Institute for AI. Contrairement aux approches classiques qui séparent vision, compréhension et contrôle, Flex-π fusionne ces trois dimensions dans un espace latent partagé, où chaque modalité (RGB, géométrie 3D, sémantique d’objets) est projetée et traitée de manière unifiée.

Une architecture qui joue sur plusieurs tableaux

1. Un VAE qui fait double (voire triple) emploi

Le cœur de Flex-π repose sur un VAE (Variational Autoencoder) gelé, issu d’un modèle de génération vidéo pré-entraîné. Ce VAE encode non seulement les images RGB, mais aussi les pointmaps 3D — des représentations géométriques des scènes — sans aucun entraînement spécifique pour ces dernières. Autrement dit, le même VAE qui reconstruit des pixels peut aussi reconstruire des nuages de points, avec une perte quasi nulle. Une astuce qui évite d’ajouter des capteurs dédiés ou de réentraîner des priors visuels.

2. Des sémantiques d’objets intégrées via DINOv3

Pour enrichir la compréhension de la scène, Flex-π utilise DINOv3 (un modèle de segmentation sémantique) pour extraire des tokens d’objets à partir des images RGB. Ces tokens sont ensuite fusionnés avec les autres modalités dans le même espace latent. Résultat : le robot ne se contente pas de voir des pixels, il comprend ce qu’il manipule (ex. : "bouteille", "pinceau", "câble").

3. Un backbone Mixture-of-Transformers pour l’action

Les données visuelles (RGB, pointmaps, tokens DINO) et les actions sont traitées par un Mixture-of-Transformers (MoT), une architecture qui combine plusieurs flux de données en un seul modèle. Ce backbone, initialisé à partir du même modèle vidéo que le VAE, permet de générer à la fois les futures observations visuelles et les actions du robot. Une approche qui exploite les priors visuels à grande échelle (issus de l’entraînement sur des vidéos internet) pour améliorer la qualité des prédictions.

Flexibilité calculatoire : le robot s’adapte à votre budget

L’innovation majeure de Flex-π réside dans sa capacité à ajuster son niveau de calcul en fonction des besoins. Grâce à une technique appelée *per-stream dropout avec cross-modality forcing***, le modèle peut fonctionner dans plusieurs modes à l’inférence :

  • Mode "action-only" : Seules les actions sont générées (latence minimale, ~60 ms par appel).
  • Mode "joint generation" : RGB, pointmaps 3D et tokens DINO sont prédits en plus des actions (meilleure précision, mais latence accrue).
  • Cette flexibilité permet aux utilisateurs de choisir leur compromis vitesse/performance sans avoir à réentraîner le modèle. Par exemple :

  • Un robot en usine peut privilégier la vitesse pour des tâches répétitives.
  • Un robot de recherche peut activer la génération complète pour des manipulations complexes.
  • Des performances qui parlent d’elles-mêmes

    Flex-π a été évalué sur trois benchmarks majeurs : RoboTwin, LIBERO et des tâches réelles de manipulation bimanuelle (ex. : zipper un sac mou, réparer un gripper). Les résultats sont impressionnants :

  • RoboTwin : Flex-π dépasse les meilleurs modèles de référence de 1,9× avec peu de démonstrations, et maintient son avantage avec un jeu de données complet.
  • LIBERO : Un seul checkpoint de Flex-π atteint 99,2 % de taux de succès, généralisant même à des variantes plus difficiles (LIBERO-Plus).
  • Manipulation bimanuelle réelle : Flex-π surpasse les baselines (π₀.₅, ManiFlow, Fast-WAM) de 2 à 6× en taux de succès, même hors distribution (objets ou configurations jamais vus pendant l’entraînement).
  • Benchmark LIBERO : Flex-π en tête

    ModèleTaux de succès (LIBERO)Latence (ms)
    π₀.₅~80 %70
    ManiFlow~85 %85
    Flex-π (action-only)~92 %60
    Flex-π (joint gen.)~99,2 %120

    Note : Les latences sont mesurées sur un matériel standard (NVIDIA RTX 4090).

    Comment ça marche en pratique ?

    1. Pré-entraînement sur AGIBOT World

    Flex-π est pré-entraîné sur ~500 heures de données issues de 100 tâches de manipulation bimanuelle, capturées à 30 Hz depuis des caméras embarquées. Les pointmaps 3D sont générés via Depth Anything 3 (un modèle de profondeur monocular), et les tokens DINO via DINOv3. Aucune nouvelle modalité de capteur n’est nécessaire.

    2. Fine-tuning pour des tâches spécifiques

    Après pré-entraînement, Flex-π peut être affiné sur des jeux de données ciblés (ex. : DROID) pour améliorer ses performances sur des tâches particulières. Les checkpoints sont disponibles en open source, avec des exemples d’utilisation prêts à l’emploi.

    3. Déploiement flexible

    À l’inférence, l’utilisateur choisit le mode d’entrée/sortie (ex. : RGB seul, ou RGB + pointmaps + DINO). Le modèle génère alors les actions (et éventuellement les futures observations) en K étapes d’Euler d’un flow-matching ODE. La latence dépend du mode sélectionné, mais reste compétitive face aux modèles existants.

    Limites et perspectives

    Malgré ses performances, Flex-π n’est pas parfait :

  • Convergence lente : Le modèle nécessite au moins 10 epochs de fine-tuning pour atteindre son plein potentiel sur des tâches réelles.
  • Latence en mode joint generation : Bien que plus rapide que des VLA comparables, la génération complète de toutes les modalités reste plus lente que le mode action-only.
  • Dépendance aux données : Sur des benchmarks comme LIBERO-Plus, des modèles avec plus de données pré-entraînées (ex. : π₀.₅-DROID) peuvent légèrement surpasser Flex-π.
  • Les auteurs soulignent que des améliorations sont possibles, notamment en intégrant des capacités de raisonnement sémantique plus poussées ou en augmentant la quantité de données d’entraînement. Flex-π est conçu comme une base modulaire : la communauté est invitée à l’étendre ou à l’adapter à de nouvelles tâches.

    Pourquoi Flex-π est une avancée majeure ?

    1. Unification des modalités : Plus besoin de pipelines séparés pour la vision, la géométrie et l’action. Tout est traité dans un seul espace latent.

    2. Efficacité calculatoire : Le modèle s’adapte aux ressources disponibles, sans compromis sur la performance.

    3. Généralisation : Flex-π excelle même sur des tâches hors distribution, un défi majeur en robotique.

    4. Open source : Les checkpoints, le code et les données sont accessibles, permettant à quiconque de reproduire ou d’étendre les résultats.

    En résumé : un pas vers des robots plus autonomes et adaptables

    Flex-π marque une étape importante dans la robotique générale, où les modèles doivent combiner vision, compréhension et action de manière unifiée. Son approche multi-stream et calcul-flexible ouvre la voie à des robots capables de s’adapter à des environnements dynamiques et imprévisibles, avec une efficacité inégalée.

    Pour aller plus loin :

  • Lire le papier sur arXiv arxiv.org
  • Explorer les checkpoints et le code sur GitHub github.com
  • Découvrir OpenPI, la bibliothèque de modèles VLA openpi.net
  • Hype-mètre : 4,5/5 (Prototype révolutionnaire avec déploiement potentiel imminent en industrie et recherche).