Esta página fue traducida automáticamente desde el inglés. Ver el original en inglés.

Robots, ingenieros de control y investigadores de inferencia activa evaluando si las arquitecturas unificadas percepción-acción-aprendizaje pueden superar o complementar el control y el aprendizaje por refuerzo clásicos.

Inferencia Activa y Robótica

Robots como perceptores y actores corporizados, limitados por la incertidumbre — una plataforma natural para la minimización de energía esperada.

Mejores acciones siguientes

Ruta de Active Inference y Robótica

Comience con los enlaces públicos de mayor señal para esta página, luego continúe a través de las vistas de recursos y directorios relacionados.

Los robots perciben, actúan y aprenden continuamente bajo la incertidumbre utilizando sensores ruidosos y multimodales y actuadores imperfectos — precisamente las condiciones que el principio de energía libre fue formulado para describir. Una literatura creciente pero aún heterogénea ha explorado la inferencia activa como una forma de unificar la estimación del estado, el control, la planificación y el aprendizaje del modelo en los sistemas robóticos, abarcando artículos teóricos, pruebas de concepto simuladas y experimentos en humanoides y manipuladores físicos. Esta página sintetiza los patrones de aplicación de esa literatura, las herramientas y laboratorios nombrados y los problemas abiertos que separan demostraciones convincentes de una metodología de ingeniería implementada de forma rutinaria.

¿Por qué el dominio encaja?

El robótica clásica separa la estimación del estado (filtros de Kalman/partículas), el control (LQR, MPC, PID) y, cada vez más, el aprendizaje por refuerzo, cada uno resuelto como un módulo independiente. La inferencia activa en cambio plantea que los tres se consideran aproximaciones de inferencia bayesiana bajo un modelo generativo único, minimizando la energía variacional libre para la percepción y el aprendizaje y la energía libre esperada —que equilibra el valor epistémico (ganancia de información) y pragmático (satisfacción del objetivo)— para la selección de acciones. Los autores argumentan que esta unificación conceptual es exactamente lo que hace que los robots sean plataformas ideales de prueba: deben mantener creencias sobre variables ocultas (configuración corporal, estados de los objetos, dinámica) a partir de flujos de sensores ambiguos y actuar para mantener las observaciones dentro del rango esperado de su modelo. El análisis de Millidge et al. sobre la literatura del control como inferencia muestra que, bajo ciertas suposiciones, las políticas de inferencia activa reducen a soluciones de control óptimo estándar o RL, aclarando cómo los controladores existentes pueden leerse como casos especiales de minimización de energía libre.

Patrones de aplicación en la literatura

Los modelos generativos en las implementaciones robóticas suelen estar estructurados alrededor de la física y la cinemática conocidas, más que aprendidos de extremo a extremo: el trabajo de percepción del cuerpo humanoide codifica la cinemática directa y los modelos de observación multimodales (visual/propioceptivos), mientras que los controladores de manipuladores codifican la dinámica de las articulaciones, la inercia y las fuerzas de contacto. Luego, la energía libre esperada impulsa la selección de políticas: el controlador adaptativo del manipulador de Pezzato, Ferrari y Hernández (publicado en IEEE Robotics and Automation Letters) se adapta en línea a la incertidumbre dinámica y los fallos de los sensores, y el agente de equilibrio de bola de Baioumy et al. muestra una energía libre esperada que induce un comportamiento genuinamente exploratorio, como si fuera curiosidad. El ajuste de peso preciso —ajustar la confianza en los canales sensoriales o las previas basándose en la fiabilidad inferida— se repite en este trabajo, particularmente en el esquema de residuos beta del grupo de Ferrari para detectar y compensar sensores defectuosos. Se discuten arquitecturas jerárquicas de múltiples niveles (por ejemplo, preferencias en el espacio de tareas sobre acciones en el espacio de articulaciones) pero las implementaciones jerárquicas concretas siguen siendo raras y en gran medida confinadas a la simulación.

Proyectos y herramientas clave

pymdp es la biblioteca de software general de propósito con un nombre, una aplicación de Python de código abierto para la inferencia activa en estados discretos (POMDP) introducida a través de un tutorial paso a paso indexado en PubMed. El grupo de Riccardo Ferrari en la Universidad Técnica de Delft ha producido el cuerpo de trabajo más sostenido de control manipulador — el controlador adaptativo, estimación/control/aprendizaje de estado integrado (ICRA 2021), inferencia activa sin sesgos para el control clásico (IROS 2022) y tolerancia a fallas residuales beta — con código referenciado en su sitio de investigación. Pablo Lanillos y colaboradores (TU Múnich y socios con sede en Japón) lideran la línea humanaide: percepción corporal y alcance en un humanoide físico, y distinción espejo auto/otro combinando la inferencia activa con modelos predictivos de redes neuronales. El Laboratorio de Robótica de Bristol y el Laboratorio de Tacto Activo contribuyen a sistemas de exploración táctil bayesiana con sensores (matrices de puntas de contacto, bigotes) que encarnan los principios de la inferencia activa sin formalizarlos siempre como tales, y la publicación del blog de Verses AI indica un temprano interés industrial, aunque no está explícitamente revisada por pares.

Problemas abiertos

El informe identifica cinco áreas sin resolver que requieren más evidencia: la escalabilidad de la evaluación de energía libre esperada a robots de alta dimensión y tiempo real (abordada hasta ahora solo en simulación por el preimpreso "Escalando la inferencia activa"); la especificación de modelos generativos que equilibra la física elaborada con componentes aprendidos; las pruebas comparativas cabeza contra cabeza sistemáticas frente a controladores clásicos y aprendizaje profundo, para las cuales aún no existe un conjunto de referencia estándar (análogo a los suites de RL de MuJoCo); la seguridad y la robustez bajo cambios en la distribución, donde el marco DR-FREE de Zorzi et al. (robustecimiento de la minimización de la energía libre sobre un conjunto de ambigüedad de modelos) se propone pero aún no se ha aplicado a robots físicos; y la adopción institucional, ya que las cadenas de herramientas de inferencia activa son mucho menos maduras que los stacks de ROS o aprendizaje profundo. El informe advierte explícitamente que muchas afirmaciones se basan en resultados cualitativos o de prueba de concepto más que en comparaciones sistemáticas.

Eje de Referencia

Christopher L. Buckley, Chang Sub Kim, Simon McGregor, Anil K. Seth (2017). The free energy principle for action and perception: A mathematical review. Journal of Mathematical Psychology. DOI: 10.1016/j.jmp.2017.09.004. Thomas Parr, Giovanni Pezzulo, Karl J. Friston (2022). Active Inference: The Free Energy Principle in Mind, Brain, and Behavior. MIT Press. Giovanni Pezzulo, Francesco Rigoli, Karl J. Friston (2017). Active Inference, homeostatic regulation and adaptive behavioural control. Progress in Neurobiology. DOI: 10.1016/j.pneurobio.2017.08.001. Pablo Lanillos, Cristian Meo, Corrado Pezzato, et al. (2021). Active Inference in Robotics and Artificial Agents: Survey and Challenges. arXiv. DOI: 10.48550/arXiv.2112.01871. Lancelot Da Costa, Thomas Parr, Noor Sajid, Sebastijan Veselic, Victorita Neacsu, Karl J. Friston (2020). Active inference on discrete state-spaces: A synthesis. Journal of Mathematical Psychology. DOI: 10.1016/j.jmp.2020.102447.

Superficies clave

Active Inference y robótica de un vistazo

Bucle de inferencia unificado

La inferencia activa reformula la estimación del estado, el control y el aprendizaje como una única minimización de la energía libre variacional bajo un modelo generativo único, en lugar de módulos separados y parcheados manualmente.

Tolerancia a fallas ponderada en precisión

El aprendizaje de precisión residual beta permite que los controladores de manipuladores desvíen canales de sensores poco fiables en tiempo real, manteniendo el rendimiento bajo fallas de sensores.

Evidencia de calidad mixta

Los hallazgos abarcan trabajos publicados en revistas revisadas por pares (IEEE RAL, tutoriales indexados en PubMed) y preimpresos o publicaciones de blogs de la industria sin revisión (Verses AI), sin que exista aún un conjunto de pruebas estándar para comparar la inferencia activa con el control clásico o RL.

Recursos relacionados

Enlaces públicos para esta página

Los enlaces externos se resuelven desde el registro compartido, por lo que los destinos orientados al visitante permanecen centralizados y verificables.

Repository / Projects

GitHub organization

Audience: Developer

Public GitHub organization for Institute repositories and open-source work.

projectsgithub-org