Tous les articles

Comment vous touchez compte : affordance tactile conditionnée par l’action en robotique

Enfoncez lentement le pouce dans une éponge de cuisine : elle cède en douceur, puis reprend sa forme. Faites glisser rapidement le même pouce sur elle et il se passe autre chose : la surface accroche, cisaille, se déchire peut-être un peu. Faites la même chose sur une table : appuyer ou glisser donne presque la même sensation, ferme et constante. L’endroit est le même et la main aussi. Seule l’action diffère, et pourtant vous sentez autre chose.

Nous faisons cela en permanence sans y penser. Nous testons une marche en y portant une partie de notre poids avant de lui faire confiance, ou nous faisons glisser un doigt sur une surface pour savoir si une boîte y glissera. La plupart des robots ne raisonnent pas ainsi. Cet article porte sur FRACTAL, le modèle au cœur de mon doctorat, qui cherche à leur donner cette capacité. L’article scientifique est en cours d’évaluation à l’ICRA 2027 : je décris donc ici l’idée et le système, et je réserve les chiffres pour après l’évaluation.

Le problème : des cartes qui répondent à « où », pas à « comment »

Les robots utilisent généralement le toucher de façon réactive et locale : détecter un glissement, classer une texture, vérifier qu’une prise tient. Des systèmes plus ambitieux construisent des cartes tactiles. Le SLAM tactile, par exemple, peut retrouver la géométrie et la pose d’objets avec une bonne précision. Cela dit au robot où sont les choses et ce qu’elles sont.

Lorsque les robots raisonnent sur ce qu’ils peuvent faire d’une surface, la réponse est le plus souvent stockée sur une carte statique : une étiquette, un score d’adéquation ou une région délimitée par un modèle de vision. Chaque emplacement reçoit une seule affordance, quoi que le robot prévoie d’y faire.

L’éponge montre pourquoi cela ne tient pas. Une surface souple peut céder élastiquement sous un appui normal lent, et glisser ou céder plastiquement sous une sonde tangentielle plus rapide au même endroit. Une seule étiquette par emplacement ne peut pas rendre compte de cela, car le résultat appartient au couple (emplacement, action), et non à l’emplacement.

L’idée : séparer ce qui dure de ce qui se produit

FRACTAL est l’acronyme de a Generative Factorized model of Action-Conditioned Tactile Affordance (modèle génératif factorisé d’affordance tactile conditionnée par l’action). Le principe central consiste à scinder le monde en deux parties.

La première est un champ d’état physique, qui ne change pas lorsqu’on le touche : où se trouve la surface, et ses constantes matérielles telles que la raideur effective, la pression d’écoulement et le frottement. Le robot n’observe jamais directement ce champ ; il en tient donc une croyance, un processus gaussien qui enregistre aussi les zones encore incertaines.

La seconde est le régime d’interaction : le caractère d’un contact particulier pendant qu’il se produit. Absence de contact, chargement élastique, écoulement plastique, glissement cinétique, ou combinaisons comme glisser tout en cédant. Le régime est transitoire et dépend de l’action. Il possède aussi sa propre dynamique. Au cours d’un même contact prolongé, le frottement statique précède par exemple le glissement.

Les mesures des capteurs sont alors traitées comme une émanation, une trace bruitée, propre au capteur, du régime. Le modèle ne cherche pas à expliquer chaque valeur de taxel. Il se demande quel événement physique a le plus probablement produit ces valeurs. Comme le modèle d’observation est génératif, le robot peut aussi l’exécuter en avant et imaginer ce qu’un toucher ferait ressentir avant de l’effectuer.

L’affordance devient une prédiction

Avec cette structure, une affordance n’est plus quelque chose que l’on consulte. C’est une question que l’on pose : si j’effectue cette action ici, quel régime vais-je probablement provoquer, et ce régime sert-il mon but ?

FRACTAL y répond en simulant l’observation que l’action produirait, en mettant à jour sa croyance sur le régime à partir de cette preuve imaginée, puis en évaluant le résultat par rapport à la tâche. J’ai étudié deux buts. Le support recherche une surface plane et non déformable sur laquelle on peut poser quelque chose. Le transport recherche une pente régulière sur laquelle le glissement est facile à provoquer. Une zone semblable à une éponge peut obtenir un mauvais score pour le support sous un appui ferme, et un bon score pour le transport sous un glissement, ce qui est précisément la distinction qu’une étiquette fixe ne peut pas faire.

Choisir le prochain toucher : récompense ou information

Un robot qui explore par le toucher dispose d’un budget limité. Chaque sonde coûte du temps et de l’effort ; le choix de la sonde suivante compte donc.

La prédiction ci-dessus fournit deux choses à la fois. Elle donne la récompense attendue d’une action, c’est-à-dire son utilité pour le but. Elle donne aussi, gratuitement, le gain d’information attendu : de combien l’action affinerait la croyance du robot sur le régime. FRACTAL combine les deux en un unique objectif d’énergie libre attendue (Expected Free Energy), ajoute une petite pénalité sur l’effort, et retient l’action au meilleur score.

Cela produit un comportement naturel. Au début, tous les candidats paraissent également (peu) prometteurs ; le terme d’information domine donc et le robot explore, en sondant là où il est le plus incertain. À mesure que la croyance s’affine, le terme de récompense prend le relais et le robot exploite. Le passage de l’exploration à l’exploitation ne demande ni calendrier distinct ni second poids à régler. Il découle de l’objectif lui-même.

En simulation, j’ai comparé FRACTAL à une référence conditionnée par l’action qui prédit les résultats à partir de l’emplacement et de l’action, mais sans inférence de régime, sans incertitude sur le régime et sans mémoire d’un contact à l’autre. L’inférence explicite du régime a amélioré le taux de réussite des tâches et réduit le regret pour les deux buts. Les chiffres suivront une fois l’évaluation terminée.

Fermeture de boucle : reconnaître un lieu à son toucher

L’exploration tactile pose un problème de cartographie bien connu. De petites erreurs sur l’estimation de pose du robot s’accumulent en dérive. Le SLAM visuel corrige la dérive en reconnaissant des lieux déjà vus. Le toucher peut faire de même, à condition de disposer d’une « empreinte » suffisamment bonne d’un lieu.

L’empreinte de FRACTAL combine la géométrie, les propriétés du matériau et l’incertitude complète sur le régime d’interaction, et non seulement sa valeur la plus probable. Deux emplacements ne correspondent que s’ils ont la même forme, le même matériau et la même ambiguïté quant à leur réaction. Dans une expérience de graphe de poses en simulation, ce descripteur informé par la physique a nettement amélioré la correction de dérive. Pour l’instant, cette expérience prend la pose relative d’un lieu reconnu dans le simulateur, et la construction de l’étape de recalage tactile qui la fournirait reste ouverte.

Le matériel : deux manières de sentir le même contact

Un bras Franka Panda sondant une carte de terrain blanche texturée, et un gros plan de l’effecteur terminal avec son doigt souple à quatre barres Le Franka Panda au-dessus de l’une des cartes de terrain (à gauche) et l’effecteur terminal tactile à double canal (à droite).

Sur le robot réel, un Franka Emika Panda à 7 DDL porte un effecteur terminal sur mesure doté de deux canaux tactiles. La surface principale est une matrice PaXini GEN3 Omega L5321 de 239 taxels à trois axes sur 53,38 × 25,10 mm. À côté se trouve un doigt souple : un mécanisme à quatre barres entraîné par un petit moteur, avec un capteur de bout de doigt PaXini GEN3 S1813 Elite de 31 taxels. Les deux canaux voient le même contact par des chemins mécaniques différents, ce qui permet le contrôle de cohérence intermodale de FRACTAL.

MoveIt 2 ne planifie que le mouvement en espace libre. Près de la surface, un contrôleur en impédance dans l’espace articulaire prend le relais et exécute une sonde en quatre phases : approche, acquisition du contact, interaction (appui, glissement ou tapotement) et retrait. J’ai mené des études de cas qualitatives sur deux cartes de terrain, l’une en mousse et l’autre imprimée en 3D, pour montrer que la boucle complète fonctionne sur des données réelles, bruitées et multicanales.

Limites et suite

Je tiens à être clair sur la portée. Le simulateur est une réduction délibérée en 2D à canal unique ; le facteur intermodal et le graphe complet de sous-cartes 3D n’y ont donc pas été testés. Les essais sur matériel sont des études de cas, et non une comparaison dotée d’une puissance statistique. L’article nomme les prochaines étapes : un système multimodal 3D complet, des ablations sur matériel de la contribution du régime, des comparaisons sur essais répétés sur le robot, et l’isolement du facteur intermodal sur des données réelles.

Le propos général est simple. Pour le toucher, « où » n’est que la moitié de la question. Un robot qui sait comment une surface réagira à la manière dont on la touche peut choisir ses actions, et sa prochaine sonde, avec bien plus d’intelligence.

Pour aller plus loin