Почему домен подходит
Классические робототехники разделяют оценку состояния (фильтры Калмана/частицы), управление (LQR, MPC, PID) и, все чаще, обучение с подкреплением, каждый из которых решается как отдельный модуль. Вместо этого активное инференция рассматривает все три как приблизительный байесовский инференцию в рамках единой генеративной модели, минимизируя вариационный свободный энергетический потенциал для восприятия и обучения, а также ожидаемый свободный энергетический потенциал — который обменивается эпистемическим (информационным приобретением) и прагматическим (соответствием цели) ценностью для выбора действия. Ланильо и его коллеги утверждают, что это концептуальное единство делает роботов идеальными тестовыми площадками: они должны поддерживать убеждения о скрытых переменных (конфигурация тела, состояния объектов, динамика) из неоднозначных сенсорных потоков и действовать, чтобы наблюдения оставались в пределах ожидаемого диапазона их модели. Анализ Милдиджем и др. литературы об управлении как инференции показывает, что при определенных предположениях политики активного инференция сводятся к стандартным оптимальным решениям управления или RL, что позволяет понять, как существующие контроллеры можно рассматривать как частные случаи минимизации свободного энергетического потенциала.
Приложения в литературе
Генеративные модели в робототехнических реализациях обычно структурированы вокруг известных физики и кинематики, а не на основе обучения end-to-end: работа по восприятию человекоподобного тела кодирует прямое положение и мультимодальные (визуальные/проприоцептивные) модели наблюдения, в то время как контроллеры манипуляторов кодируют динамику суставов, инерцию и силы контакта. Ожидаемая свободная энергия определяет выбор политики — адаптивный контроллер манипулятора группы Пеццато, Феррари и Эрнандес (опубликованный в IEEE Robotics and Automation Letters) адаптируется онлайн к динамической неопределенности и отказам датчиков, а агент балансирования шарика группы Байуми и др. демонстрирует ожидаемую свободную энергию, вызывающую по-настоящему исследовательское, любопытство-подобное поведение. Точная взвешивание — корректировка доверия к сенсорным каналам или прецедентам на основе выведенной надежности — повторяется в этом труде, особенно в схеме бета-остатков группы Феррари для обнаружения и компенсации неисправных датчиков. Рассматриваются концептуальные многоуровневые архитектуры (например, предпочтения в пространстве задач по сравнению с действиями в суставах), но конкретные многоуровневые реализации редки и в основном ограничены симуляцией.
Ключевые проекты и инструменты
pymdp — это одна общедоступная многоцелевая программная библиотека, открытый Python пакет для дискретного состояния (POMDP) активного вывода, представленный посредством пошаговой инструкции, индексированной в PubMed. Группа Рикардо Феррари при Делфтском университете Технологий создала наиболее продолжительную линию исследований по манипулированию и управлению телом — адаптивный контроллер, интегрированная оценка состояния/управление/обучение (ICRA 2021), непредвзятый активный вывод для классического управления (IROS 2022) и устойчивость к ошибкам бета-остатка — с кодом, указанным на его сайте исследований. Пабло Ланильос и его коллеги (TUM и японские партнеры) возглавляют линию человероидов: восприятие тела и захват в физическом человероиде, а также различие между зеркальным собой и другим, объединяя активный вывод с нейронными сетями-моделями вперед. Bristol Robotics Lab и Active Touch Laboratory вносят вклад в системы байесовского активного сенсорного тактильного исследования (массивы кончиков пальцев, усики), которые воплощают принципы активного вывода без обязательной формализации их таковыми. Статья Verses AI's блога сигнализирует о раннем промышленном интересе, хотя она явно не рецензируема.
Открытые проблемы
Отчет выявляет пять нерешенных областей, требующих дополнительных доказательств: масштабируемость оценки свободной энергии для высокоразмерных, реального времени роботов (до сих пор рассматривалась только в симуляции посредством preprint "Масштабирование активного инференса"); принципиальное определение генеративной модели, балансирующее между ручными физическими моделями и обученными компонентами; систематическое сравнение с классическими контроллерами и глубоким обучением, для которого еще не существует стандартизированного набора тестов (аналогичного MuJoCo-стилю RL); безопасность и устойчивость при распределенном смещении, где фреймворк DR-FREE Zorzi et al. (усиление минимизации свободной энергии над неопределенной множеством моделей) предлагается, но еще не применяется к физическим роботам; и институциональное принятие, поскольку цепочки инструментов активного инференса значительно менее зрелые, чем ROS или стеки глубокого обучения. Отчет явно предупреждает, что многие утверждения основаны на качественных или доказательствах концепции, а не на систематических сравнениях.
Опорный каркас
Christopher L. Buckley, Chang Sub Kim, Simon McGregor, Anil K. Seth (2017). The free energy principle for action and perception: A mathematical review. Journal of Mathematical Psychology. DOI: 10.1016/j.jmp.2017.09.004. Thomas Parr, Giovanni Pezzulo, Karl J. Friston (2022). Active Inference: The Free Energy Principle in Mind, Brain, and Behavior. MIT Press. Giovanni Pezzulo, Francesco Rigoli, Karl J. Friston (2017). Active Inference, homeostatic regulation and adaptive behavioural control. Progress in Neurobiology. DOI: 10.1016/j.pneurobio.2017.08.001. Pablo Lanillos, Cristian Meo, Corrado Pezzato, et al. (2021). Active Inference in Robotics and Artificial Agents: Survey and Challenges. arXiv. DOI: 10.48550/arXiv.2112.01871. Lancelot Da Costa, Thomas Parr, Noor Sajid, Sebastijan Veselic, Victorita Neacsu, Karl J. Friston (2020). Active inference on discrete state-spaces: A synthesis. Journal of Mathematical Psychology. DOI: 10.1016/j.jmp.2020.102447.