NVIDIA invente le robot qui raisonne seul… et des data centers qui explosent les records


Le 16 septembre 2026, NVIDIA a fait deux annonces qui, prises ensemble, pourraient bien changer la donne pour les robots et les data centers. D’un côté, un module de la taille d’une carte de crédit, le Jetson AGX Thor, exécute un agent IA complexe en local en 24 minutes et 36 secondes — là où une implémentation classique mettait plus de deux heures et demie. De l’autre, la Vera Rubin NVL72, une plateforme de data center, pulvérise les records de performance en multipliant par jusqu’à 3,7 fois la puissance de son prédécesseur, le GB300 NVL72.
Ces deux innovations ne sont pas de simples mises à jour techniques. Elles illustrent une mutation profonde : les robots peuvent désormais prendre des décisions complexes sans dépendre d’un serveur distant, et les data centers deviennent assez puissants pour entraîner et déployer des modèles d’IA générative à une échelle inédite. Une révolution qui touche aussi bien les usines que les entrepôts, les chantiers ou les hôpitaux.
Imaginez un bras robotisé dans une usine. Jusqu’ici, pour qu’il saisisse une pièce, il devait envoyer en temps réel des images et des données vers un serveur distant, où un modèle d’IA calculait la trajectoire optimale avant de renvoyer les instructions. Un processus lent, coûteux, et surtout… dépendant. Avec le Jetson AGX Thor, NVIDIA inverse la logique : le robot raisonne et agit sur place, comme un humain qui déciderait de ses mouvements sans consulter un supercalculateur.
Sur le benchmark MLPerf Edge Agentic v6.1, qui teste la capacité d’un agent IA à enchaîner des raisonnements complexes, des appels d’outils et des prises de décision sans latence ni connexion internet, le module a traité 1 007 échanges successifs, totalisant plus de 23 500 tokens, en un temps record. Pour y parvenir, NVIDIA a optimisé trois aspects clés de son modèle Qwen3.6-27B :
Ces optimisations permettent au système de générer 52,33 tokens par seconde, contre quelques tokens par seconde pour une implémentation non optimisée. Pour les robots industriels ou les véhicules autonomes, cela signifie qu’ils peuvent désormais prendre des décisions complexes en local, sans dépendre d’un serveur distant. Une avancée majeure pour les usines, les entrepôts ou les chantiers où le réseau est instable, coûteux ou tout simplement absent.
Pendant ce temps, NVIDIA frappe fort avec sa Vera Rubin NVL72, une plateforme conçue pour l’économie de l’inférence IA. Présentée lors du benchmark MLPerf Inference v6.1, elle affiche des gains de performance jusqu’à 3,7 fois supérieurs à ceux du GB300 NVL72 sur des modèles comme Qwen3-VL, et jusqu’à 2,5 fois sur DeepSeek-R1.
Les améliorations portent sur trois leviers clés :
Pour les entreprises qui misent sur l’IA générative, la NVL72 promet des économies concrètes. NVIDIA avance un coût par million de tokens jusqu’à 35 fois inférieur à celui du GB300 NVL72, une donnée cruciale pour les AI factories où chaque watt compte. Dans un contexte où les coûts énergétiques représentent une part croissante des budgets IT, cette plateforme permet de générer 30 fois plus de travail agentique pour le même footprint énergétique.
La stratégie de NVIDIA ne s’arrête pas au matériel. La NVL72 s’appuie sur un écosystème logiciel propriétaire (vLLM, Dynamo, TensorRT-LLM) et des technologies comme le DSX MaxLPS, qui permet de provisionner jusqu’à 40 % de GPU supplémentaires dans un même budget énergétique. Une approche full-stack qui rend les clients dépendants de l’écosystème NVIDIA, de la puce au data center.
Pour les acteurs de la robotique et de l’automatisation industrielle, ces performances ouvrent des perspectives. Les modèles de langage multimodaux (comme Qwen3-VL) et les agents IA capables de raisonnement multi-étapes (agentic inference) deviennent accessibles à plus grande échelle. Une aubaine pour les usines automatisées ou les robots collaboratifs, où la latence et le coût par requête sont des critères critiques.
NVIDIA ne s’arrête pas là. La société a aussi lancé un défi open source pour convertir des vidéos de démonstrations humaines en compétences robotiques. L’idée ? Automatiser l’apprentissage par l’exemple, en utilisant des vidéos grand public plutôt que des données capturées en laboratoire. Un pipeline en trois étapes permet de :
Les participants au défi devront utiliser ces outils pour entraîner des politiques de contrôle, puis soumettre leurs résultats pour évaluation. Les gagnants seront annoncés le 21 septembre 2026.