HiPHI : un jeu de données de 600 heures pour entraîner les humanoïdes à bouger comme des humains


Les humanoïdes doivent apprendre à se déplacer, à maintenir leur équilibre et à interagir avec leur environnement dans des situations extrêmement variées. Pourtant, les sources de données disponibles pour leur entraînement présentent des limites majeures :
HiPHI (High-Precision Human Motion and Object Interaction) comble ce fossé en fournissant 617,5 heures de données de mouvement humain capturées avec un système optique MoCap offrant une précision sub-millimétrique. Parmi ces données, 245,7 heures sont dédiées à des interactions humain-objet, avec des trajectoires et des maillages d’objets synchronisés, essentiels pour enseigner aux robots des tâches comme porter, pousser ou tirer.
Plutôt que de s’appuyer sur des scripts manuels pour guider la capture des mouvements, HiPHI utilise FrameNet, un cadre linguistique qui organise les actions humaines en frames (cadres) et lexical units (unités lexicales). Chaque frame représente un type d’événement (par exemple, mouvement de transport ou interaction avec un objet), et les unités lexicales précisent les nuances de l’action.
Pour HiPHI, les chercheurs ont sélectionné 214 paires Frame–LU couvrant 22 frames différentes, comme Transport ou Contact. Chaque paire a servi de point de départ pour générer des scripts de capture systématiquement étendus selon plusieurs dimensions :
Cette approche transforme un processus manuel et limité en une méthode scalable et reproductible pour couvrir l’espace des mouvements humains de manière exhaustive.
Contrairement à d’autres jeux de données qui utilisent des pantomimes ou des objets simulés, HiPHI capture des interactions avec des objets réels (40 objets distincts répartis en 12 catégories). Cette caractéristique est cruciale, car les propriétés physiques des objets — charge, frottement, inertie ou résistance — influencent directement les stratégies de contrôle des robots.
Par exemple, soulever une boîte légère ne nécessite pas la même coordination que tirer une valise lourde. En intégrant ces contraintes physiques dans les données d’entraînement, HiPHI permet aux politiques de contrôle d’apprendre des comportements plus réalistes et généralisables.
Les résultats montrent que les politiques entraînées sur HiPHI bénéficient d’un effet d’échelle marqué :
Le transfert vers du matériel réel a été validé sur un Unitree G1, un humanoïde commercial. Malgré les limites d’actionnement, les bruits de capteurs et les écarts entre simulation et réalité, le robot a réussi à exécuter une variété de comportements :
Ces démonstrations confirment que HiPHI fournit des références de mouvement exécutables pour des tâches embodied, ouvrant la voie à des humanoïdes capables d’évoluer dans des environnements non structurés.
HiPHI n’est pas seulement un jeu de données : c’est une méthodologie pour concevoir des jeux de données adaptés à l’apprentissage de politiques humanoïdes. Ses contributions clés incluent :
1. Une pipeline de construction de l’espace des mouvements guidé par FrameNet, permettant une couverture systématique et scalable.
2. Un jeu de données de 617,5 heures avec des interactions humain-objet synchronisées, des trajectoires d’objets et des maillages, ainsi que des descriptions en langage naturel.
3. Un protocole d’évaluation complet pour mesurer la diversité des mouvements, la qualité des données, la cohérence des interactions et les performances des politiques, y compris le transfert en conditions réelles.
En combinant précision physique, diversité des mouvements et synchronisation des objets, HiPHI établit une nouvelle référence pour l’entraînement des humanoïdes, réduisant le fossé entre les données de laboratoire et les exigences du monde réel.