Physical Artificial Intelligence newsPAI news
← Retour aux actualités
7 Octobre 2026Niveau : Essentiel

HiPHI : un jeu de données de 600 heures pour entraîner les humanoïdes à bouger comme des humains

📑 Sommaire
💡 En 3 points clés
  • Les vidéos internet offrent une grande diversité de comportements, mais ne capturent pas les états physiques précis nécessaires pour contrôler un robot.
  • Les systèmes de capture de mouvement (MoCap) en laboratoire enregistrent des mouvements avec une haute fidélité, mais se limitent généralement à un ensemble restreint d’actions prédéfinies.
  • la direction et la vitesse du mouvement,

Un jeu de données conçu pour combler un vide critique

Les humanoïdes doivent apprendre à se déplacer, à maintenir leur équilibre et à interagir avec leur environnement dans des situations extrêmement variées. Pourtant, les sources de données disponibles pour leur entraînement présentent des limites majeures :

  • Les vidéos internet offrent une grande diversité de comportements, mais ne capturent pas les états physiques précis nécessaires pour contrôler un robot.
  • Les systèmes de capture de mouvement (MoCap) en laboratoire enregistrent des mouvements avec une haute fidélité, mais se limitent généralement à un ensemble restreint d’actions prédéfinies.
  • HiPHI (High-Precision Human Motion and Object Interaction) comble ce fossé en fournissant 617,5 heures de données de mouvement humain capturées avec un système optique MoCap offrant une précision sub-millimétrique. Parmi ces données, 245,7 heures sont dédiées à des interactions humain-objet, avec des trajectoires et des maillages d’objets synchronisés, essentiels pour enseigner aux robots des tâches comme porter, pousser ou tirer.

    FrameNet : un cadre linguistique pour structurer la diversité des mouvements

    Plutôt que de s’appuyer sur des scripts manuels pour guider la capture des mouvements, HiPHI utilise FrameNet, un cadre linguistique qui organise les actions humaines en frames (cadres) et lexical units (unités lexicales). Chaque frame représente un type d’événement (par exemple, mouvement de transport ou interaction avec un objet), et les unités lexicales précisent les nuances de l’action.

    Pour HiPHI, les chercheurs ont sélectionné 214 paires Frame–LU couvrant 22 frames différentes, comme Transport ou Contact. Chaque paire a servi de point de départ pour générer des scripts de capture systématiquement étendus selon plusieurs dimensions :

  • la direction et la vitesse du mouvement,
  • l’amplitude et la posture du corps,
  • les conditions de contact et les objets impliqués.
  • Cette approche transforme un processus manuel et limité en une méthode scalable et reproductible pour couvrir l’espace des mouvements humains de manière exhaustive.

    Des données physiques pour des politiques de contrôle robustes

    Contrairement à d’autres jeux de données qui utilisent des pantomimes ou des objets simulés, HiPHI capture des interactions avec des objets réels (40 objets distincts répartis en 12 catégories). Cette caractéristique est cruciale, car les propriétés physiques des objets — charge, frottement, inertie ou résistance — influencent directement les stratégies de contrôle des robots.

    Par exemple, soulever une boîte légère ne nécessite pas la même coordination que tirer une valise lourde. En intégrant ces contraintes physiques dans les données d’entraînement, HiPHI permet aux politiques de contrôle d’apprendre des comportements plus réalistes et généralisables.

    Des politiques qui s’améliorent avec l’échelle et transfèrent en conditions réelles

    Les résultats montrent que les politiques entraînées sur HiPHI bénéficient d’un effet d’échelle marqué :

  • En augmentant la quantité de données d’entraînement de 3 à 300 heures, les erreurs de suivi de mouvement (mesurées par le MPJPE, Mean Per Joint Position Error) diminuent de manière continue sur des benchmarks comme AMASS ou Motion-X++.
  • Les politiques entraînées sur HiPHI atteignent des taux de succès plus élevés et une convergence plus rapide que celles entraînées sur d’autres jeux de données, même avec un budget de données équivalent.
  • Le transfert vers du matériel réel a été validé sur un Unitree G1, un humanoïde commercial. Malgré les limites d’actionnement, les bruits de capteurs et les écarts entre simulation et réalité, le robot a réussi à exécuter une variété de comportements :

  • locomotion (course, marche),
  • transitions posturales (s’asseoir, ramper),
  • interactions avec des objets (porter une boîte, retourner un objet, tirer une valise).
  • Ces démonstrations confirment que HiPHI fournit des références de mouvement exécutables pour des tâches embodied, ouvrant la voie à des humanoïdes capables d’évoluer dans des environnements non structurés.

    Ce que HiPHI change pour la robotique humanoïde

    HiPHI n’est pas seulement un jeu de données : c’est une méthodologie pour concevoir des jeux de données adaptés à l’apprentissage de politiques humanoïdes. Ses contributions clés incluent :

    1. Une pipeline de construction de l’espace des mouvements guidé par FrameNet, permettant une couverture systématique et scalable.

    2. Un jeu de données de 617,5 heures avec des interactions humain-objet synchronisées, des trajectoires d’objets et des maillages, ainsi que des descriptions en langage naturel.

    3. Un protocole d’évaluation complet pour mesurer la diversité des mouvements, la qualité des données, la cohérence des interactions et les performances des politiques, y compris le transfert en conditions réelles.

    En combinant précision physique, diversité des mouvements et synchronisation des objets, HiPHI établit une nouvelle référence pour l’entraînement des humanoïdes, réduisant le fossé entre les données de laboratoire et les exigences du monde réel.