Physical Artificial Intelligence newsPAI news
← Retour aux actualités
26 Septembre 2026Niveau : Essentiel

General Robotics mise sur l’intelligence modulaire plutôt qu’un cerveau robotique unique

📑 Sommaire
💡 En 3 points clés
  • Interprétables : leur comportement et leurs limites sont explicites, ce qui facilite le débogage et la validation.
  • Réutilisables : une skill développée pour un bras manipulateur peut être adaptée à un drone ou un robot humanoïde avec peu de modifications.
  • Testables : chaque skill peut être évaluée individuellement en simulation ou sur le terrain, réduisant les risques de défaillance en production.

Une rupture avec les modèles monolithiques

Depuis quelques années, les modèles de type Vision-Language-Action (VLA) dominent la recherche en robotique. Ces systèmes, souvent entraînés sur des jeux de données massifs, promettent de gérer simultanément la perception, la compréhension du langage et l’action. Pourtant, leur déploiement se heurte à des limites pratiques : des comportements imprévisibles, des difficultés de débogage, et une rigidité face à des changements de contexte ou de matériel.

General Robotics, une startup fondée par d’anciens chercheurs de Microsoft Research, propose une approche radicalement différente. Plutôt que de s’appuyer sur un seul modèle tentaculaire, l’entreprise mise sur une architecture modulaire, où chaque compétence robotique est conçue comme une unité autonome, interprétable et testable. Cette méthode s’inspire des mécanismes humains d’apprentissage : comme un pilote qui maîtrise d’abord les bases du vol avant de combiner ces compétences pour atterrir, un robot doit d’abord maîtriser des tâches élémentaires avant de les enchaîner pour résoudre des problèmes complexes.

Des compétences robotiques atomiques et composables

Chez General Robotics, ces unités de base sont appelées robot AI skills. Chaque skill est une capacité bien définie, comme la perception d’un objet, la planification d’un trajet, ou l’exécution d’une prise. Contrairement aux modèles monolithiques, ces compétences sont :

  • Interprétables : leur comportement et leurs limites sont explicites, ce qui facilite le débogage et la validation.
  • Réutilisables : une skill développée pour un bras manipulateur peut être adaptée à un drone ou un robot humanoïde avec peu de modifications.
  • Testables : chaque skill peut être évaluée individuellement en simulation ou sur le terrain, réduisant les risques de défaillance en production.
  • Par exemple, entraîner un robot à positionner précisément un chariot élévateur est une tâche bien plus abordable que de lui faire comprendre une instruction vague comme « range ce colis dans l’entrepôt ». Avec une skill dédiée à la manipulation, le robot peut d’abord maîtriser cette tâche avant de l’intégrer dans un workflow plus large.

    Deux stratégies pour composer les compétences

    L’assemblage de ces compétences ne se fait pas au hasard. General Robotics distingue deux approches pour combiner les skills en des comportements plus complexes :

    1. Composition raisonnée :

    Ici, les compétences sont enchaînées de manière explicite, souvent via des règles logiques ou des modèles de langage. Par exemple, un robot pourrait enchaîner une skill de détection d’objets, suivie d’une skill de planification de trajectoire, puis d’une skill de préhension. Cette méthode est interprétable par conception et s’intègre naturellement avec les systèmes robotiques classiques. Elle permet de déployer des solutions robustes aujourd’hui, sans attendre des percées en apprentissage automatique.

    2. Composition apprise :

    Dans cette approche, les compétences servent de briques de base à un réseau de neurones plus large, qui apprend à les combiner. C’est la méthode privilégiée par de nombreux modèles fondateurs en robotique, comme ceux de Google ou Tesla. Cependant, elle sacrifie souvent l’interprétabilité au profit d’une expressivité accrue. Par exemple, un modèle pourrait apprendre à adapter une skill de préhension en fonction du contexte, mais il serait difficile de comprendre pourquoi il a choisi une stratégie plutôt qu’une autre.

    Chez General Robotics, les deux approches sont considérées comme complémentaires. La composition raisonnée est privilégiée pour les tâches critiques, tandis que la composition apprise est explorée pour des comportements plus flexibles, mais toujours dans un cadre contrôlé.

    GRID : la plateforme qui rend tout cela possible

    Au cœur de cette approche se trouve GRID, une plateforme cloud-native conçue pour déployer, tester et composer des compétences robotiques à grande échelle. GRID offre plusieurs fonctionnalités clés :

  • Une bibliothèque de skills pré-entraînées : General Robotics propose déjà des compétences pour la perception, la planification, le contrôle et le langage, prêtes à être intégrées dans de nouveaux robots.
  • Un environnement de simulation intégré : avant de toucher un matériel réel, les compétences et leurs compositions peuvent être testées dans des environnements virtuels réalistes. Cela permet de valider des scénarios complexes, comme l’atterrissage d’un drone sur une plateforme mouvante, sans risque.
  • Une API unifiée : les développeurs peuvent accéder aux compétences via une interface standardisée, accélérant l’intégration dans des systèmes existants.
  • La plateforme est conçue pour être agnostique au matériel : une skill développée pour un robot industriel peut être réutilisée sur un humanoïde ou un drone, à condition que les capteurs et actionneurs soient compatibles. Cette flexibilité réduit considérablement les coûts de développement et accélère l’innovation.

    Sécurité : le nerf de la guerre

    Pour General Robotics, la sécurité n’est pas une option, mais une condition sine qua non. Les modèles monolithiques, comme les VLA, posent un défi de taille : si un robot interprète mal une instruction ou échoue dans une tâche, il est souvent impossible de déterminer pourquoi cela s’est produit. Par exemple, si un drone doit atterrir sur une plateforme bleue et atterrit dans une piscine à proximité, est-ce dû à une confusion visuelle, une mauvaise interprétation du langage, ou une erreur de planification ?

    Avec une approche modulaire, chaque skill peut être testée individuellement pour identifier la source du problème. De plus, GRID permet de simuler des scénarios extrêmes (comme des conditions météorologiques difficiles) pour valider la robustesse des compétences avant tout déploiement réel. Cette rigueur est essentielle pour des applications critiques, comme la manipulation de produits dangereux ou la collaboration homme-robot dans des environnements industriels.

    Un écosystème en construction

    General Robotics ne travaille pas en vase clos. La startup s’appuie sur un écosystème croissant de compétences robotiques, développées par des chercheurs et des industriels du monde entier. Ces compétences, qu’elles proviennent de publications académiques ou de solutions commerciales, peuvent être intégrées dans GRID et combinées pour créer des robots adaptés à des tâches spécifiques.

    Par exemple, une entreprise spécialisée dans la logistique pourrait combiner une skill de détection de colis avec une skill de planification de trajet pour automatiser le tri dans un entrepôt. Une autre pourrait utiliser une skill de langage pour permettre à un robot de suivre des instructions vocales complexes, comme « charge cette palette et place-la sur le quai 3 ».

    Perspectives : vers une robotique généraliste et sûre

    L’approche de General Robotics s’inscrit dans une tendance plus large de la robotique moderne : passer d’une logique de spécialisation étroite à une généralisation contrôlée. Plutôt que de chercher à entraîner un seul modèle pour tout faire, l’industrie explore des architectures où l’intelligence émerge de la composition de briques élémentaires, maîtrisables et sécurisées.

    Cette vision rejoint les travaux d’autres acteurs comme Normal Robotics (fondée par d’anciens chercheurs de Tesla et NVIDIA), qui développent également des plateformes modulaires pour la robotique physique. Cependant, General Robotics se distingue par son emphase sur la sécurité par conception et son outil GRID, déjà utilisé pour prototyper des solutions dans des secteurs comme la logistique, la maintenance industrielle et la robotique humanoïde.

    En résumé : pourquoi cette approche compte ?

  • Adaptabilité : Un même ensemble de compétences peut être déployé sur des robots aux morphologies très différentes, réduisant les coûts de développement.
  • Robustesse : Chaque compétence est testable et validable, limitant les risques de défaillances imprévisibles.
  • Interprétabilité : Les échecs peuvent être diagnostiqués précisément, facilitant les améliorations continues.
  • Scalabilité : L’écosystème de compétences permet d’accélérer l’innovation sans repartir de zéro à chaque nouveau projet.
  • Pour les industriels, cette approche ouvre la voie à des robots plus flexibles, plus sûrs et plus rapides à déployer. Pour les chercheurs, elle offre un cadre pour explorer des comportements robotiques complexes, sans sacrifier la rigueur scientifique. Et pour les utilisateurs finaux, elle promet des robots capables de s’adapter à leurs besoins, plutôt que l’inverse.

    generalrobotics.company | therobotreport.com | aimarkettrends.com | robottoday.com