Эта страница была автоматически переведена с английского языка. Посмотреть оригинал на английском.

Робототехники, инженеры по управлению и исследователи активного вывода оценочно проверяют, могут ли унифицированные архитектуры восприятия-действия-обучения превзойти или дополнить классическое управление и обучение с подкреплением.

Активная инференция и робототехника

Роботы как воплощенные, ограниченные неопределенностью восприниматели и действующие лица — естественная площадка для минимизации ожидаемой свободной энергии.

Роботы непрерывно воспринимают, действуют и учатся в условиях неопределенности с использованием шумных, мультимодальных сенсоров и несовершенных актуаторов — именно те условия, которые описывал принцип свободной энергии. Растущая, но все еще неоднородная литература исследовала активное инференцию как способ объединить оценку состояния, управление, планирование и обучение моделированию в робототехнических системах, охватывая теоретические статьи, смоделированные доказательства концепции и эксперименты на физических гуманоидах и манипуляторах. На этой странице синтезируется применение этих паттернов в литературе, названные инструменты и лаборатории, а также открытые проблемы, разделяющие убедительные демонстрации от стандартной инженерной методологии.

Почему домен подходит

Классические робототехники разделяют оценку состояния (фильтры Калмана/частицы), управление (LQR, MPC, PID) и, все чаще, обучение с подкреплением, каждый из которых решается как отдельный модуль. Вместо этого активное инференция рассматривает все три как приблизительный байесовский инференцию в рамках единой генеративной модели, минимизируя вариационный свободный энергетический потенциал для восприятия и обучения, а также ожидаемый свободный энергетический потенциал — который обменивается эпистемическим (информационным приобретением) и прагматическим (соответствием цели) ценностью для выбора действия. Ланильо и его коллеги утверждают, что это концептуальное единство делает роботов идеальными тестовыми площадками: они должны поддерживать убеждения о скрытых переменных (конфигурация тела, состояния объектов, динамика) из неоднозначных сенсорных потоков и действовать, чтобы наблюдения оставались в пределах ожидаемого диапазона их модели. Анализ Милдиджем и др. литературы об управлении как инференции показывает, что при определенных предположениях политики активного инференция сводятся к стандартным оптимальным решениям управления или RL, что позволяет понять, как существующие контроллеры можно рассматривать как частные случаи минимизации свободного энергетического потенциала.

Приложения в литературе

Генеративные модели в робототехнических реализациях обычно структурированы вокруг известных физики и кинематики, а не на основе обучения end-to-end: работа по восприятию человекоподобного тела кодирует прямое положение и мультимодальные (визуальные/проприоцептивные) модели наблюдения, в то время как контроллеры манипуляторов кодируют динамику суставов, инерцию и силы контакта. Ожидаемая свободная энергия определяет выбор политики — адаптивный контроллер манипулятора группы Пеццато, Феррари и Эрнандес (опубликованный в IEEE Robotics and Automation Letters) адаптируется онлайн к динамической неопределенности и отказам датчиков, а агент балансирования шарика группы Байуми и др. демонстрирует ожидаемую свободную энергию, вызывающую по-настоящему исследовательское, любопытство-подобное поведение. Точная взвешивание — корректировка доверия к сенсорным каналам или прецедентам на основе выведенной надежности — повторяется в этом труде, особенно в схеме бета-остатков группы Феррари для обнаружения и компенсации неисправных датчиков. Рассматриваются концептуальные многоуровневые архитектуры (например, предпочтения в пространстве задач по сравнению с действиями в суставах), но конкретные многоуровневые реализации редки и в основном ограничены симуляцией.

Ключевые проекты и инструменты

pymdp — это одна общедоступная многоцелевая программная библиотека, открытый Python пакет для дискретного состояния (POMDP) активного вывода, представленный посредством пошаговой инструкции, индексированной в PubMed. Группа Рикардо Феррари при Делфтском университете Технологий создала наиболее продолжительную линию исследований по манипулированию и управлению телом — адаптивный контроллер, интегрированная оценка состояния/управление/обучение (ICRA 2021), непредвзятый активный вывод для классического управления (IROS 2022) и устойчивость к ошибкам бета-остатка — с кодом, указанным на его сайте исследований. Пабло Ланильос и его коллеги (TUM и японские партнеры) возглавляют линию человероидов: восприятие тела и захват в физическом человероиде, а также различие между зеркальным собой и другим, объединяя активный вывод с нейронными сетями-моделями вперед. Bristol Robotics Lab и Active Touch Laboratory вносят вклад в системы байесовского активного сенсорного тактильного исследования (массивы кончиков пальцев, усики), которые воплощают принципы активного вывода без обязательной формализации их таковыми. Статья Verses AI's блога сигнализирует о раннем промышленном интересе, хотя она явно не рецензируема.

Открытые проблемы

В отчете определены пять нерешенных областей, требующих дальнейших доказательств: масштабируемость оценки ожидаемой свободной энергии для высокоразмерных роботов, работающих в реальном времени (до сих пор рассматривалась только в симуляции в препринте "Scaling active inference"); принципиальная спецификация генеративной модели, которая уравновешивает созданную вручную физику с изученными компонентами; систематическое прямое сравнение с классическими контроллерами и глубоким RL, для которых еще не существует стандартизированного набора тестов (аналогичного наборам RL в стиле MuJoCo); безопасность и надежность при изменении распределения, где предлагается, но еще не применяется к физическим роботам, фреймворк DR-FREE от Zorzi et al. (повышение устойчивости минимизации свободной энергии по набору неоднозначных моделей); и институциональное внедрение, поскольку инструментарии активного вывода остаются гораздо менее зрелыми, чем ROS или стеки глубокого обучения. В отчете явно предостерегается, что многие утверждения основаны на качественных или принципиальных результатах, а не на систематическом сравнении.

Опорный каркас

Christopher L. Buckley, Chang Sub Kim, Simon McGregor, Anil K. Seth (2017). The free energy principle for action and perception: A mathematical review. Journal of Mathematical Psychology. DOI: 10.1016/j.jmp.2017.09.004. Thomas Parr, Giovanni Pezzulo, Karl J. Friston (2022). Active Inference: The Free Energy Principle in Mind, Brain, and Behavior. MIT Press. Giovanni Pezzulo, Francesco Rigoli, Karl J. Friston (2017). Active Inference, homeostatic regulation and adaptive behavioural control. Progress in Neurobiology. DOI: 10.1016/j.pneurobio.2017.08.001. Pablo Lanillos, Cristian Meo, Corrado Pezzato, et al. (2021). Active Inference in Robotics and Artificial Agents: Survey and Challenges. arXiv. DOI: 10.48550/arXiv.2112.01871. Lancelot Da Costa, Thomas Parr, Noor Sajid, Sebastijan Veselic, Victorita Neacsu, Karl J. Friston (2020). Active inference on discrete state-spaces: A synthesis. Journal of Mathematical Psychology. DOI: 10.1016/j.jmp.2020.102447.

Ключевые поверхности

Active Inference и робототехника с первого взгляда

Объединенный цикл инференса

Активная инференция переосмысливает оценку состояния, управление и обучение как одно вариационное минимизация свободной энергии под единой генеративной моделью, а не отдельные ручной сборкой модули.

Точность-весовленная отказоустойчивость

Бета-резидуальное обучение точности позволяет манипуляторам понижать вес ненадежных каналов датчиков в реальном времени, сохраняя производительность при отказах датчиков.

Смешанная оценка качества доказательств

Результаты охватывают рецензируемые журнальные работы (IEEE RAL, учебные пособия, индексируемые PubMed) и нерецензируемые препринты или посты в отраслевых блогах (Verses AI), при этом стандартизированный набор тестов для сравнения Active Inference с классическим управлением или RL еще не создан.

Связанные ресурсы

Публичные ссылки для этой страницы

Repository / Projects

GitHub organization

Audience: Developer

Public GitHub organization for Institute repositories and open-source work.

projectsgithub-org