Spatial Memory Agent (SMA) : quand un robot apprend à raisonner dans l’espace… sans toucher à son cerveau


Imaginez un robot industriel chargé d’assembler des pièces dans un atelier. Pour accomplir sa tâche, il doit comprendre la géométrie des objets, planifier un chemin pour ses bras, et éviter les collisions. Traditionnellement, cela nécessitait soit un réentraînement coûteux du modèle, soit l’ajout d’outils externes (comme des capteurs de profondeur ou des algorithmes de reconstruction 3D).
Mais que se passerait-il si le robot pouvait apprendre de ses erreurs sans modifier son code ? C’est exactement ce que propose le Spatial Memory Agent (SMA), un framework développé par des chercheurs de Tsinghua AI. SMA permet à un modèle de vision-langage (VLM) figé (c’est-à-dire dont les poids ne sont pas modifiés) d’améliorer ses performances en spatial intelligence en capitalisant sur des expériences passées, comme un humain qui retient une leçon après avoir trébuché.
SMA fonctionne en 4 étapes clés, illustrées dans le schéma ci-dessous :
1. Expérience : Le robot (ou le VLM) résout un problème spatial (ex : "saisir une boîte rouge sur une étagère") dans un environnement vérifiable. Il reçoit une récompense (ou un feedback) selon la qualité de sa réponse.
2. Réflexion guidée par un vérificateur : SMA analyse les résultats et distille les enseignements sous forme de leçons réutilisables (ex : "Si la boîte est à gauche, privilégier l’approche par le haut").
3. Notation de fiabilité : Chaque leçon se voit attribuer un Transfer Reliability Score (TRS), une note qui estime sa pertinence future. Cette note est ajustée en fonction des retours obtenus lors des utilisations ultérieures.
4. Déploiement en lecture seule : Pendant l’exécution, SMA recherche les leçons les plus pertinentes (via une combinaison de similarité sémantique et de TRS) et les injecte dans le prompt du VLM pour guider ses décisions sans modifier ses poids.
Schéma du workflow SMA (source : arXiv:2608.12743v1)
[Figure 3 : System methodology and workflow of the Spatial Memory Agent (SMA).]Pour évaluer SMA, les chercheurs ont testé 5 benchmarks spatiaux (RoboSpatial, Omni3D, EmbSpatial, etc.) sur 4 modèles VLM différents (dont Qwen3.5-122B et Qwen3.6-27B). Résultat :
Note de Hype-mètre : 4,5/5 (Prototype académique prometteur, mais déploiement industriel encore à valider).