PP-ProPS : quand les LLMs optimisent des politiques robotiques sans exposer vos secrets


Quand un robot apprend à marcher ou à saisir un objet, ses algorithmes d’apprentissage par renforcement (RL) ajustent des milliers de paramètres pour maximiser une récompense. Traditionnellement, ces paramètres et les historiques de récompenses sont envoyés vers des API de LLMs hébergés dans le cloud, comme ceux d’OpenAI ou d’Anthropic. Problème : ces données décrivent intégralement la stratégie de contrôle du robot, propriété intellectuelle souvent sensible pour les industriels ou les laboratoires.
Les méthodes existantes comme ProPS (Prompted Policy Search) ou Vanilla ProPS pallient partiellement ce risque en guidant l’optimisation via des prompts textuels, mais elles exigent toujours de transmettre les paramètres bruts et les récompenses absolues. Une faille critique pour des applications en robotique industrielle ou médicale, où la propriété des algorithmes est un enjeu stratégique.
Le cadre PP-ProPS (Privacy-Preserving Prompted Policy Search), présenté dans arxiv.org/2609.30554, résout ce dilemme avec trois mécanismes clés, tous exécutés côté client avant toute communication avec le LLM :
1. Transformation secrète des paramètres
Avant chaque requête API, les paramètres de la politique (par exemple, les poids d’un réseau de neurones) sont encodés via une transformation linéaire secrète appliquée côté client. Le LLM ne reçoit que des valeurs chiffrées, sans moyen de les décoder. Seule la partie cliente, qui exécute aussi la politique et interagit avec l’environnement, peut inverser la transformation pour appliquer les paramètres réels.
2. Récompenses scalées et désagrégées
Au lieu d’envoyer la récompense totale (un scalaire), PP-ProPS transmet des composantes de récompense individuelles (par exemple, "avancement", "effort de contrôle", "évitement de collision"). Ces composantes sont aussi mises à l’échelle par une transformation secrète, préservant leur ordre relatif sans révéler leur magnitude absolue. Cela permet au LLM de comprendre pourquoi une politique fonctionne, sans connaître les valeurs numériques exactes.
3. Historique borné pour éviter la surcharge
Les méthodes existantes comme Vanilla ProPS incluent l’intégralité de l’historique d’optimisation dans le prompt, ce qui fait exploser la taille du contexte pour des politiques à haute dimension. PP-ProPS limite le prompt aux K meilleures candidatures (par défaut, K=10), réduisant la taille du prompt final de 80,2 % (de 114 000 à 22 000 caractères) et le temps de réponse du LLM de 74,9 %.
PP-ProPS a été évalué sur 10 environnements couvrant la locomotion (MuJoCo), des tâches de contrôle classique, la conduite autonome et la manipulation robotique. Les résultats sont comparés à Vanilla ProPS, à des algorithmes RL classiques (PPO, SAC, TRPO) et à d’autres variantes de ProPS. Voici les points marquants :
Le secret réside dans la conservation des informations pertinentes pour l’optimisation, tout en supprimant les données sensibles :
Malgré ses avantages, PP-ProPS présente deux défis majeurs :
1. Dépendance à la transformation secrète : Si le client est compromis (par exemple, via un malware), la confidentialité est compromise. Une solution serait d’utiliser des schémas de chiffrement homomorphe pour externaliser même l’encodage, mais cela reste coûteux en calcul.
2. Scalabilité aux politiques non linéaires : Les transformations actuelles sont linéaires, adaptées aux réseaux de neurones standards. Pour des politiques plus complexes (par exemple, des transformers), une approche différente serait nécessaire.
Les auteurs suggèrent d’explorer des transformations non linéaires et des schémas de chiffrement avancés pour étendre le cadre à des politiques plus sophistiquées. Une autre piste est l’intégration de retours humains en langage naturel pour guider l’optimisation, combinant ainsi apprentissage automatique et expertise humaine.
PP-ProPS ouvre la voie à des collaborations sécurisées entre laboratoires, industriels et fournisseurs de LLMs. Par exemple :
Ce cadre illustre comment l’IA générative peut démocratiser l’optimisation robotique sans sacrifier la sécurité des données, un équilibre crucial pour l’adoption industrielle de ces technologies.
Pour aller plus loin :