¿Por qué el dominio encaja?
El robótica clásica separa la estimación del estado (filtros de Kalman/partículas), el control (LQR, MPC, PID) y, cada vez más, el aprendizaje por refuerzo, cada uno resuelto como un módulo independiente. La inferencia activa en cambio plantea que los tres se consideran aproximaciones de inferencia bayesiana bajo un modelo generativo único, minimizando la energía variacional libre para la percepción y el aprendizaje y la energía libre esperada —que equilibra el valor epistémico (ganancia de información) y pragmático (satisfacción del objetivo)— para la selección de acciones. Los autores argumentan que esta unificación conceptual es exactamente lo que hace que los robots sean plataformas ideales de prueba: deben mantener creencias sobre variables ocultas (configuración corporal, estados de los objetos, dinámica) a partir de flujos de sensores ambiguos y actuar para mantener las observaciones dentro del rango esperado de su modelo. El análisis de Millidge et al. sobre la literatura del control como inferencia muestra que, bajo ciertas suposiciones, las políticas de inferencia activa reducen a soluciones de control óptimo estándar o RL, aclarando cómo los controladores existentes pueden leerse como casos especiales de minimización de energía libre.
Patrones de aplicación en la literatura
Los modelos generativos en las implementaciones robóticas suelen estar estructurados alrededor de la física y la cinemática conocidas, más que aprendidos de extremo a extremo: el trabajo de percepción del cuerpo humanoide codifica la cinemática directa y los modelos de observación multimodales (visual/propioceptivos), mientras que los controladores de manipuladores codifican la dinámica de las articulaciones, la inercia y las fuerzas de contacto. Luego, la energía libre esperada impulsa la selección de políticas: el controlador adaptativo del manipulador de Pezzato, Ferrari y Hernández (publicado en IEEE Robotics and Automation Letters) se adapta en línea a la incertidumbre dinámica y los fallos de los sensores, y el agente de equilibrio de bola de Baioumy et al. muestra una energía libre esperada que induce un comportamiento genuinamente exploratorio, como si fuera curiosidad. El ajuste de peso preciso —ajustar la confianza en los canales sensoriales o las previas basándose en la fiabilidad inferida— se repite en este trabajo, particularmente en el esquema de residuos beta del grupo de Ferrari para detectar y compensar sensores defectuosos. Se discuten arquitecturas jerárquicas de múltiples niveles (por ejemplo, preferencias en el espacio de tareas sobre acciones en el espacio de articulaciones) pero las implementaciones jerárquicas concretas siguen siendo raras y en gran medida confinadas a la simulación.
Proyectos y herramientas clave
pymdp es la biblioteca de software general de propósito con un nombre, una aplicación de Python de código abierto para la inferencia activa en estados discretos (POMDP) introducida a través de un tutorial paso a paso indexado en PubMed. El grupo de Riccardo Ferrari en la Universidad Técnica de Delft ha producido el cuerpo de trabajo más sostenido de control manipulador — el controlador adaptativo, estimación/control/aprendizaje de estado integrado (ICRA 2021), inferencia activa sin sesgos para el control clásico (IROS 2022) y tolerancia a fallas residuales beta — con código referenciado en su sitio de investigación. Pablo Lanillos y colaboradores (TU Múnich y socios con sede en Japón) lideran la línea humanaide: percepción corporal y alcance en un humanoide físico, y distinción espejo auto/otro combinando la inferencia activa con modelos predictivos de redes neuronales. El Laboratorio de Robótica de Bristol y el Laboratorio de Tacto Activo contribuyen a sistemas de exploración táctil bayesiana con sensores (matrices de puntas de contacto, bigotes) que encarnan los principios de la inferencia activa sin formalizarlos siempre como tales, y la publicación del blog de Verses AI indica un temprano interés industrial, aunque no está explícitamente revisada por pares.
Problemas abiertos
El informe identifica cinco áreas sin resolver que requieren más evidencia: la escalabilidad de la evaluación de energía libre esperada a robots de alta dimensión y tiempo real (abordada hasta ahora solo en simulación por el preimpreso "Escalando la inferencia activa"); la especificación de modelos generativos que equilibra la física elaborada con componentes aprendidos; las pruebas comparativas cabeza contra cabeza sistemáticas frente a controladores clásicos y aprendizaje profundo, para las cuales aún no existe un conjunto de referencia estándar (análogo a los suites de RL de MuJoCo); la seguridad y la robustez bajo cambios en la distribución, donde el marco DR-FREE de Zorzi et al. (robustecimiento de la minimización de la energía libre sobre un conjunto de ambigüedad de modelos) se propone pero aún no se ha aplicado a robots físicos; y la adopción institucional, ya que las cadenas de herramientas de inferencia activa son mucho menos maduras que los stacks de ROS o aprendizaje profundo. El informe advierte explícitamente que muchas afirmaciones se basan en resultados cualitativos o de prueba de concepto más que en comparaciones sistemáticas.
Eje de Referencia
Christopher L. Buckley, Chang Sub Kim, Simon McGregor, Anil K. Seth (2017). The free energy principle for action and perception: A mathematical review. Journal of Mathematical Psychology. DOI: 10.1016/j.jmp.2017.09.004. Thomas Parr, Giovanni Pezzulo, Karl J. Friston (2022). Active Inference: The Free Energy Principle in Mind, Brain, and Behavior. MIT Press. Giovanni Pezzulo, Francesco Rigoli, Karl J. Friston (2017). Active Inference, homeostatic regulation and adaptive behavioural control. Progress in Neurobiology. DOI: 10.1016/j.pneurobio.2017.08.001. Pablo Lanillos, Cristian Meo, Corrado Pezzato, et al. (2021). Active Inference in Robotics and Artificial Agents: Survey and Challenges. arXiv. DOI: 10.48550/arXiv.2112.01871. Lancelot Da Costa, Thomas Parr, Noor Sajid, Sebastijan Veselic, Victorita Neacsu, Karl J. Friston (2020). Active inference on discrete state-spaces: A synthesis. Journal of Mathematical Psychology. DOI: 10.1016/j.jmp.2020.102447.