Cette page a été traduite automatiquement de l'anglais. Consultez l'original en anglais.

Robots, ingénieurs de contrôle et chercheurs en inférence active évaluant si des architectures unifiées perception-action-apprentissage peuvent surpasser ou compléter le contrôle et l'apprentissage par renforcement classiques.

L'inférence active et la robotique

Robots comme percepteurs et acteurs incarnés, limités par l'incertitude – un terrain de jeu naturel pour la minimisation d'énergie attendue.

Meilleures prochaines étapes

Piste d'inférence active et robotique

Commencez par les liens publics les plus signalés pour cette page, puis poursuivez à travers les vues de ressources et de répertoires connexes.

Les robots perçoivent, agissent et apprennent continuellement dans des conditions d’incertitude en utilisant des capteurs bruyants et multimodaux et des actionneurs imparfaits — précisément les conditions que le principe d'énergie libre était destiné à décrire. Une littérature croissante mais encore hétérogène a exploré l'inférence active comme un moyen d'unifier l'estimation de l'état, le contrôle, la planification et l'apprentissage du modèle dans les systèmes robotiques, couvrant des articles théoriques, des preuves de concept simulées et des expériences sur des humanoïdes et des manipulateurs physiques. Cette page synthétise les schémas d’application de cette littérature, les outils et laboratoires nommés et les problèmes ouverts qui séparent des démonstrations convaincantes d'une méthodologie d'ingénierie courante.

Pourquoi le domaine correspond

L’robotiique classique sépare l’estimation de l’état (filtres de Kalman/particules), le contrôle (LQR, MPC, PID) et, croissante, l’apprentissage par renforcement, chacun étant résolu comme un module distinct. L’inférence active pose quant à elle les trois en tant qu’inférence bayésienne approximative sous un modèle génératif unique, minimisant l’énergie variationnelle pour la perception et l’apprentissage ainsi que l’énergie attendue — qui échange une valeur épistémique (gain d’information) et pragmatique (satisfaction de l’objectif) pour la sélection des actions. Lanillos et ses collègues soutiennent que cette unification conceptuelle est exactement ce qui fait des robots des bancs d’essai idéaux : ils doivent maintenir des croyances sur les variables cachées (configuration du corps, états des objets, dynamique) à partir de flux de capteurs ambigus et agir pour maintenir leurs observations dans la plage attendue de leur modèle. L'analyse de Millidge et al. de la littérature sur le contrôle comme inférence montre également que, sous certaines hypothèses, les politiques d’inférence active se réduisent aux solutions de contrôle optimales ou d’apprentissage par renforcement standard, ce qui clarifie comment les contrôleurs existants peuvent être considérés comme des cas particuliers de minimisation d'énergie libre.

Patterns d'applications dans la littérature

Les modèles génératifs dans les implémentations robotiques sont généralement structurés autour de la physique et de la cinématique connues plutôt que d'un apprentissage fin à l'extrême : le travail sur la perception du corps humain comprend la cinématique avant et des modèles d'observation multimodaux (visuel/proprioceptif), tandis que les contrôleurs de manipulateurs codent la dynamique des articulations, l'inertie et les forces de contact. L'énergie libre attendue entraîne ensuite la sélection de la politique — le contrôleur adaptatif du manipulateur publié par Pezzato, Ferrari et Hernández (dans IEEE Robotics and Automation Letters) s'adapte en ligne à l'incertitude dynamique et aux défauts des capteurs, et l'agent d'équilibrage de balle de Baioumy et al. montre une énergie libre attendue induisant un comportement véritablement exploratoire, semblable à la curiosité. Le pesage précis — ajuster la confiance dans les canaux sensoriels ou les a priori en fonction de leur fiabilité inférée — se retrouve dans ce travail, notamment dans le schéma des résidus bêta du groupe de Ferrari pour détecter et compenser les capteurs défectueux. Des architectures multi-niveaux hiérarchiques sont discutées conceptuellement (par exemple, les préférences d'espace de tâche par rapport aux actions dans l'espace articulaire) mais des implémentations hiérarchiques concrètes restent rares et largement confinées à la simulation.

Projets et outils clés

pymdp est la bibliothèque logicielle générale à usage unique du rapport, un paquet Python open source pour l’inférence active à états discrets (POMDP) introduite via un tutoriel étape par étape indexé PubMed. Le groupe de Riccardo Ferrari à l'Université technique de Delft a produit le corps de travail le plus soutenu sur le contrôle manipulateur — le contrôleur adaptatif, l’estimation d’état/contrôle/apprentissage intégrés (ICRA 2021), l’inférence active non biaisée pour le contrôle classique (IROS 2022) et la tolérance aux défauts résiduels bêta — avec du code référencé sur son site de recherche. Pablo Lanillos et ses collaborateurs (TU Munich et partenaires basés au Japon) dirigent la ligne des humanoïdes : perception corporelle et préhension sur un humanoïde physique, et distinction miroir soi/autre combinant l’inférence active avec des modèles en réseau neuronal récurrents. Bristol Robotics Lab et le Laboratoire de toucher actif contribuent à des systèmes d'exploration tactile par capteurs bayésiens (matrices de doigts, vibrisses) qui incarnent les principes de l’inférence active sans toujours les formaliser comme tels, et un article de blog de Verses AI signale un intérêt industriel précoce, bien qu’il ne soit pas explicitement évalué par les pairs.

Problèmes non résolus

Le rapport identifie cinq domaines non résolus nécessitant davantage de preuves : la scalabilité de l'évaluation de l'énergie libre attendue vers des robots à haute dimension et en temps réel (résolue uniquement en simulation par le preprint « Scaling active inference ») ; une spécification de modèle génératif cohérente qui équilibre la physique conçue manuellement avec les composants appris ; un benchmarking tête-à-tête systématique contre les contrôleurs classiques et l'apprentissage par renforcement profond, pour lequel aucune suite de benchmarks standardisée (analogue aux suites d'apprentissage par renforcement de style MuJoCo) n'existe encore ; la sécurité et la robustesse face au décalage des distributions, où le cadre DR-FREE de Zorzi et al. (optimisation robuste de l'énergie libre sur un ensemble d'ambiguïté de modèles) est proposé mais pas encore appliqué aux robots physiques ; et l'adoption institutionnelle, étant donné que les outils d'inférence active sont beaucoup moins matures que les piles ROS ou les piles d'apprentissage profond.

Squelette de référence

Christopher L. Buckley, Chang Sub Kim, Simon McGregor, Anil K. Seth (2017). The free energy principle for action and perception: A mathematical review. Journal of Mathematical Psychology. DOI: 10.1016/j.jmp.2017.09.004. Thomas Parr, Giovanni Pezzulo, Karl J. Friston (2022). Active Inference: The Free Energy Principle in Mind, Brain, and Behavior. MIT Press. Giovanni Pezzulo, Francesco Rigoli, Karl J. Friston (2017). Active Inference, homeostatic regulation and adaptive behavioural control. Progress in Neurobiology. DOI: 10.1016/j.pneurobio.2017.08.001. Pablo Lanillos, Cristian Meo, Corrado Pezzato, et al. (2021). Active Inference in Robotics and Artificial Agents: Survey and Challenges. arXiv. DOI: 10.48550/arXiv.2112.01871. Lancelot Da Costa, Thomas Parr, Noor Sajid, Sebastijan Veselic, Victorita Neacsu, Karl J. Friston (2020). Active inference on discrete state-spaces: A synthesis. Journal of Mathematical Psychology. DOI: 10.1016/j.jmp.2020.102447.

Surfaces clés

L'inférence active et la robotique en un clin d’œil

Boucle d'inférence unifiée

L'inférence active recast l’estimation d’état, le contrôle et l’apprentissage en tant que minimisation unifiée de l’énergie libre variationnelle sous un seul modèle génératif, plutôt que des modules patchés séparément.

Tolérance aux pannes pondérée par la précision

L'apprentissage de la précision résiduelle bêta permet aux contrôleurs de manipulateurs de minimiser les canaux de capteurs peu fiables en temps réel, tout en maintenant les performances en cas de défauts de capteurs.

Preuves de qualité mixtes

Les résultats s'étendent aux travaux publiés dans des revues à comité de lecture (IEEE RAL, tutoriels indexés dans PubMed) et aux prépublications ou articles de blogs d’entreprises non examinés (Verses AI), sans suite de référence standard pour comparer l’inférence active à la commande ou au RL classiques.

Ressources associées

Liens publics pour cette page

Les liens externes sont résolus à partir du registre partagé, de sorte que les destinations visibles pour les visiteurs restent centralisées et vérifiables.

Repository / Projects

GitHub organization

Audience: Developer

Public GitHub organization for Institute repositories and open-source work.

projectsgithub-org