General Robotics mise sur l’intelligence modulaire plutôt qu’un cerveau robotique unique


Depuis quelques années, les modèles de type Vision-Language-Action (VLA) dominent la recherche en robotique. Ces systèmes, souvent entraînés sur des jeux de données massifs, promettent de gérer simultanément la perception, la compréhension du langage et l’action. Pourtant, leur déploiement se heurte à des limites pratiques : des comportements imprévisibles, des difficultés de débogage, et une rigidité face à des changements de contexte ou de matériel.
General Robotics, une startup fondée par d’anciens chercheurs de Microsoft Research, propose une approche radicalement différente. Plutôt que de s’appuyer sur un seul modèle tentaculaire, l’entreprise mise sur une architecture modulaire, où chaque compétence robotique est conçue comme une unité autonome, interprétable et testable. Cette méthode s’inspire des mécanismes humains d’apprentissage : comme un pilote qui maîtrise d’abord les bases du vol avant de combiner ces compétences pour atterrir, un robot doit d’abord maîtriser des tâches élémentaires avant de les enchaîner pour résoudre des problèmes complexes.
Chez General Robotics, ces unités de base sont appelées robot AI skills. Chaque skill est une capacité bien définie, comme la perception d’un objet, la planification d’un trajet, ou l’exécution d’une prise. Contrairement aux modèles monolithiques, ces compétences sont :
Par exemple, entraîner un robot à positionner précisément un chariot élévateur est une tâche bien plus abordable que de lui faire comprendre une instruction vague comme « range ce colis dans l’entrepôt ». Avec une skill dédiée à la manipulation, le robot peut d’abord maîtriser cette tâche avant de l’intégrer dans un workflow plus large.
L’assemblage de ces compétences ne se fait pas au hasard. General Robotics distingue deux approches pour combiner les skills en des comportements plus complexes :
1. Composition raisonnée :
Ici, les compétences sont enchaînées de manière explicite, souvent via des règles logiques ou des modèles de langage. Par exemple, un robot pourrait enchaîner une skill de détection d’objets, suivie d’une skill de planification de trajectoire, puis d’une skill de préhension. Cette méthode est interprétable par conception et s’intègre naturellement avec les systèmes robotiques classiques. Elle permet de déployer des solutions robustes aujourd’hui, sans attendre des percées en apprentissage automatique.
2. Composition apprise :
Dans cette approche, les compétences servent de briques de base à un réseau de neurones plus large, qui apprend à les combiner. C’est la méthode privilégiée par de nombreux modèles fondateurs en robotique, comme ceux de Google ou Tesla. Cependant, elle sacrifie souvent l’interprétabilité au profit d’une expressivité accrue. Par exemple, un modèle pourrait apprendre à adapter une skill de préhension en fonction du contexte, mais il serait difficile de comprendre pourquoi il a choisi une stratégie plutôt qu’une autre.
Chez General Robotics, les deux approches sont considérées comme complémentaires. La composition raisonnée est privilégiée pour les tâches critiques, tandis que la composition apprise est explorée pour des comportements plus flexibles, mais toujours dans un cadre contrôlé.
Au cœur de cette approche se trouve GRID, une plateforme cloud-native conçue pour déployer, tester et composer des compétences robotiques à grande échelle. GRID offre plusieurs fonctionnalités clés :
La plateforme est conçue pour être agnostique au matériel : une skill développée pour un robot industriel peut être réutilisée sur un humanoïde ou un drone, à condition que les capteurs et actionneurs soient compatibles. Cette flexibilité réduit considérablement les coûts de développement et accélère l’innovation.
Pour General Robotics, la sécurité n’est pas une option, mais une condition sine qua non. Les modèles monolithiques, comme les VLA, posent un défi de taille : si un robot interprète mal une instruction ou échoue dans une tâche, il est souvent impossible de déterminer pourquoi cela s’est produit. Par exemple, si un drone doit atterrir sur une plateforme bleue et atterrit dans une piscine à proximité, est-ce dû à une confusion visuelle, une mauvaise interprétation du langage, ou une erreur de planification ?
Avec une approche modulaire, chaque skill peut être testée individuellement pour identifier la source du problème. De plus, GRID permet de simuler des scénarios extrêmes (comme des conditions météorologiques difficiles) pour valider la robustesse des compétences avant tout déploiement réel. Cette rigueur est essentielle pour des applications critiques, comme la manipulation de produits dangereux ou la collaboration homme-robot dans des environnements industriels.
General Robotics ne travaille pas en vase clos. La startup s’appuie sur un écosystème croissant de compétences robotiques, développées par des chercheurs et des industriels du monde entier. Ces compétences, qu’elles proviennent de publications académiques ou de solutions commerciales, peuvent être intégrées dans GRID et combinées pour créer des robots adaptés à des tâches spécifiques.
Par exemple, une entreprise spécialisée dans la logistique pourrait combiner une skill de détection de colis avec une skill de planification de trajet pour automatiser le tri dans un entrepôt. Une autre pourrait utiliser une skill de langage pour permettre à un robot de suivre des instructions vocales complexes, comme « charge cette palette et place-la sur le quai 3 ».
L’approche de General Robotics s’inscrit dans une tendance plus large de la robotique moderne : passer d’une logique de spécialisation étroite à une généralisation contrôlée. Plutôt que de chercher à entraîner un seul modèle pour tout faire, l’industrie explore des architectures où l’intelligence émerge de la composition de briques élémentaires, maîtrisables et sécurisées.
Cette vision rejoint les travaux d’autres acteurs comme Normal Robotics (fondée par d’anciens chercheurs de Tesla et NVIDIA), qui développent également des plateformes modulaires pour la robotique physique. Cependant, General Robotics se distingue par son emphase sur la sécurité par conception et son outil GRID, déjà utilisé pour prototyper des solutions dans des secteurs comme la logistique, la maintenance industrielle et la robotique humanoïde.
Pour les industriels, cette approche ouvre la voie à des robots plus flexibles, plus sûrs et plus rapides à déployer. Pour les chercheurs, elle offre un cadre pour explorer des comportements robotiques complexes, sans sacrifier la rigueur scientifique. Et pour les utilisateurs finaux, elle promet des robots capables de s’adapter à leurs besoins, plutôt que l’inverse.
generalrobotics.company | therobotreport.com | aimarkettrends.com | robottoday.com