Physical Artificial Intelligence newsPAI news
← Retour aux actualités
13 Août 2026Niveau : Essentiel

NVIDIA invente le robot qui raisonne seul… et des data centers qui explosent les records

📑 Sommaire
💡 En 3 points clés
  • Une mémoire allégée : Le modèle est compressé en NVFP4, un format où chaque nombre ne pèse que 4 bits au lieu de 16 ou 32. Résultat, le modèle tient dans 128 Go de mémoire unifiée, laissant de la place pour stocker les longs contextes.
  • Des notes mentales réutilisées : Au lieu de recalculer à chaque tour les vecteurs d’attention qui suivent le fil de la conversation, le système les réutilise. Une optimisation qui économise du temps et de l’énergie.
  • Plusieurs mots à la fois : Le modèle prédit plusieurs tokens en parallèle, comme si vous écriviez plusieurs lettres d’un mot d’un coup. Une technique qui accélère la génération de texte.

Le 16 septembre 2026, NVIDIA a fait deux annonces qui, prises ensemble, pourraient bien changer la donne pour les robots et les data centers. D’un côté, un module de la taille d’une carte de crédit, le Jetson AGX Thor, exécute un agent IA complexe en local en 24 minutes et 36 secondes — là où une implémentation classique mettait plus de deux heures et demie. De l’autre, la Vera Rubin NVL72, une plateforme de data center, pulvérise les records de performance en multipliant par jusqu’à 3,7 fois la puissance de son prédécesseur, le GB300 NVL72.

Ces deux innovations ne sont pas de simples mises à jour techniques. Elles illustrent une mutation profonde : les robots peuvent désormais prendre des décisions complexes sans dépendre d’un serveur distant, et les data centers deviennent assez puissants pour entraîner et déployer des modèles d’IA générative à une échelle inédite. Une révolution qui touche aussi bien les usines que les entrepôts, les chantiers ou les hôpitaux.

Un robot qui raisonne seul, sans internet ni cloud

Imaginez un bras robotisé dans une usine. Jusqu’ici, pour qu’il saisisse une pièce, il devait envoyer en temps réel des images et des données vers un serveur distant, où un modèle d’IA calculait la trajectoire optimale avant de renvoyer les instructions. Un processus lent, coûteux, et surtout… dépendant. Avec le Jetson AGX Thor, NVIDIA inverse la logique : le robot raisonne et agit sur place, comme un humain qui déciderait de ses mouvements sans consulter un supercalculateur.

Sur le benchmark MLPerf Edge Agentic v6.1, qui teste la capacité d’un agent IA à enchaîner des raisonnements complexes, des appels d’outils et des prises de décision sans latence ni connexion internet, le module a traité 1 007 échanges successifs, totalisant plus de 23 500 tokens, en un temps record. Pour y parvenir, NVIDIA a optimisé trois aspects clés de son modèle Qwen3.6-27B :

  • Une mémoire allégée : Le modèle est compressé en NVFP4, un format où chaque nombre ne pèse que 4 bits au lieu de 16 ou 32. Résultat, le modèle tient dans 128 Go de mémoire unifiée, laissant de la place pour stocker les longs contextes.
  • Des notes mentales réutilisées : Au lieu de recalculer à chaque tour les vecteurs d’attention qui suivent le fil de la conversation, le système les réutilise. Une optimisation qui économise du temps et de l’énergie.
  • Plusieurs mots à la fois : Le modèle prédit plusieurs tokens en parallèle, comme si vous écriviez plusieurs lettres d’un mot d’un coup. Une technique qui accélère la génération de texte.
  • Ces optimisations permettent au système de générer 52,33 tokens par seconde, contre quelques tokens par seconde pour une implémentation non optimisée. Pour les robots industriels ou les véhicules autonomes, cela signifie qu’ils peuvent désormais prendre des décisions complexes en local, sans dépendre d’un serveur distant. Une avancée majeure pour les usines, les entrepôts ou les chantiers où le réseau est instable, coûteux ou tout simplement absent.

    Des data centers qui explosent les records

    Pendant ce temps, NVIDIA frappe fort avec sa Vera Rubin NVL72, une plateforme conçue pour l’économie de l’inférence IA. Présentée lors du benchmark MLPerf Inference v6.1, elle affiche des gains de performance jusqu’à 3,7 fois supérieurs à ceux du GB300 NVL72 sur des modèles comme Qwen3-VL, et jusqu’à 2,5 fois sur DeepSeek-R1.

    Les améliorations portent sur trois leviers clés :

  • La performance brute : Grâce à des Tensor Cores de sixième génération et un Transformer Engine optimisé, la plateforme accélère à la fois les phases de prefill et de decode des modèles.
  • L’efficacité du scaling : Avec un système de scale-up basé sur le NVLink de sixième génération, la NVL72 atteint une efficacité de scaling de 99% sur des configurations allant jusqu’à 288 GPU, contre une croissance quasi linéaire des performances.
  • L’optimisation logicielle continue : Les gains ne viennent pas seulement du matériel. NVIDIA a amélioré de 1,6 fois les performances du GB300 NVL72 sur Qwen3-VL entre les versions v6.0 et v6.1 de MLPerf, grâce à des optimisations du KV cache, du kernel fusion et du disaggregated serving.
  • Pour les entreprises qui misent sur l’IA générative, la NVL72 promet des économies concrètes. NVIDIA avance un coût par million de tokens jusqu’à 35 fois inférieur à celui du GB300 NVL72, une donnée cruciale pour les AI factories où chaque watt compte. Dans un contexte où les coûts énergétiques représentent une part croissante des budgets IT, cette plateforme permet de générer 30 fois plus de travail agentique pour le même footprint énergétique.

    Un écosystème verrouillé pour verrouiller le marché

    La stratégie de NVIDIA ne s’arrête pas au matériel. La NVL72 s’appuie sur un écosystème logiciel propriétaire (vLLM, Dynamo, TensorRT-LLM) et des technologies comme le DSX MaxLPS, qui permet de provisionner jusqu’à 40 % de GPU supplémentaires dans un même budget énergétique. Une approche full-stack qui rend les clients dépendants de l’écosystème NVIDIA, de la puce au data center.

    Pour les acteurs de la robotique et de l’automatisation industrielle, ces performances ouvrent des perspectives. Les modèles de langage multimodaux (comme Qwen3-VL) et les agents IA capables de raisonnement multi-étapes (agentic inference) deviennent accessibles à plus grande échelle. Une aubaine pour les usines automatisées ou les robots collaboratifs, où la latence et le coût par requête sont des critères critiques.

    Et demain ?

    NVIDIA ne s’arrête pas là. La société a aussi lancé un défi open source pour convertir des vidéos de démonstrations humaines en compétences robotiques. L’idée ? Automatiser l’apprentissage par l’exemple, en utilisant des vidéos grand public plutôt que des données capturées en laboratoire. Un pipeline en trois étapes permet de :

  • segmenter les vidéos en actions,
  • reconstruire la scène en 3D,
  • retargeter les mouvements humains sur un robot.
  • Les participants au défi devront utiliser ces outils pour entraîner des politiques de contrôle, puis soumettre leurs résultats pour évaluation. Les gagnants seront annoncés le 21 septembre 2026.

    Ce qu’il faut retenir

  • Le Jetson AGX Thor exécute un agent IA complexe en local en 24 minutes et 36 secondes, contre 2 heures et 37 minutes pour une implémentation classique.
  • La Vera Rubin NVL72 surpasse le GB300 NVL72 de 2,5 à 3,7 fois en throughput, selon les benchmarks MLPerf v6.1.
  • La plateforme atteint une efficacité de scaling de 99% sur des configurations multi-racks, un record dans l’industrie.
  • NVIDIA réduit le coût par million de tokens jusqu’à 35 fois, un argument clé pour les AI factories.
  • Les gains proviennent d’une combinaison de matériel (Tensor Cores 6e gen), de logiciel (optimisations continues) et d’architecture (NVLink 6e gen, disaggregated serving).