Эта страница была автоматически переведена с английского языка. Посмотреть оригинал на английском.

Робототехники, инженеры по управлению и исследователи активного вывода оценочно проверяют, могут ли унифицированные архитектуры восприятия-действия-обучения превзойти или дополнить классическое управление и обучение с подкреплением.

Активная инференция и робототехника

Роботы как воплощенные, ограниченные неопределенностью восприниматели и действующие лица — естественная площадка для минимизации ожидаемой свободной энергии.

Лучшие следующие шаги

Активный вывод и роботизированный путь

Начните с самых важных публичных ссылок на этой странице, затем продолжите изучение связанных ресурсов и каталогов.

Роботы непрерывно воспринимают, действуют и учатся в условиях неопределенности с использованием шумных, мультимодальных сенсоров и несовершенных актуаторов — именно те условия, которые описывал принцип свободной энергии. Растущая, но все еще неоднородная литература исследовала активное инференцию как способ объединить оценку состояния, управление, планирование и обучение моделированию в робототехнических системах, охватывая теоретические статьи, смоделированные доказательства концепции и эксперименты на физических гуманоидах и манипуляторах. На этой странице синтезируется применение этих паттернов в литературе, названные инструменты и лаборатории, а также открытые проблемы, разделяющие убедительные демонстрации от стандартной инженерной методологии.

Почему домен подходит

Классические робототехники разделяют оценку состояния (фильтры Калмана/частицы), управление (LQR, MPC, PID) и, все чаще, обучение с подкреплением, каждый из которых решается как отдельный модуль. Вместо этого активное инференция рассматривает все три как приблизительный байесовский инференцию в рамках единой генеративной модели, минимизируя вариационный свободный энергетический потенциал для восприятия и обучения, а также ожидаемый свободный энергетический потенциал — который обменивается эпистемическим (информационным приобретением) и прагматическим (соответствием цели) ценностью для выбора действия. Ланильо и его коллеги утверждают, что это концептуальное единство делает роботов идеальными тестовыми площадками: они должны поддерживать убеждения о скрытых переменных (конфигурация тела, состояния объектов, динамика) из неоднозначных сенсорных потоков и действовать, чтобы наблюдения оставались в пределах ожидаемого диапазона их модели. Анализ Милдиджем и др. литературы об управлении как инференции показывает, что при определенных предположениях политики активного инференция сводятся к стандартным оптимальным решениям управления или RL, что позволяет понять, как существующие контроллеры можно рассматривать как частные случаи минимизации свободного энергетического потенциала.

Приложения в литературе

Генеративные модели в робототехнических реализациях обычно структурированы вокруг известных физики и кинематики, а не на основе обучения end-to-end: работа по восприятию человекоподобного тела кодирует прямое положение и мультимодальные (визуальные/проприоцептивные) модели наблюдения, в то время как контроллеры манипуляторов кодируют динамику суставов, инерцию и силы контакта. Ожидаемая свободная энергия определяет выбор политики — адаптивный контроллер манипулятора группы Пеццато, Феррари и Эрнандес (опубликованный в IEEE Robotics and Automation Letters) адаптируется онлайн к динамической неопределенности и отказам датчиков, а агент балансирования шарика группы Байуми и др. демонстрирует ожидаемую свободную энергию, вызывающую по-настоящему исследовательское, любопытство-подобное поведение. Точная взвешивание — корректировка доверия к сенсорным каналам или прецедентам на основе выведенной надежности — повторяется в этом труде, особенно в схеме бета-остатков группы Феррари для обнаружения и компенсации неисправных датчиков. Рассматриваются концептуальные многоуровневые архитектуры (например, предпочтения в пространстве задач по сравнению с действиями в суставах), но конкретные многоуровневые реализации редки и в основном ограничены симуляцией.

Ключевые проекты и инструменты

pymdp — это одна общедоступная многоцелевая программная библиотека, открытый Python пакет для дискретного состояния (POMDP) активного вывода, представленный посредством пошаговой инструкции, индексированной в PubMed. Группа Рикардо Феррари при Делфтском университете Технологий создала наиболее продолжительную линию исследований по манипулированию и управлению телом — адаптивный контроллер, интегрированная оценка состояния/управление/обучение (ICRA 2021), непредвзятый активный вывод для классического управления (IROS 2022) и устойчивость к ошибкам бета-остатка — с кодом, указанным на его сайте исследований. Пабло Ланильос и его коллеги (TUM и японские партнеры) возглавляют линию человероидов: восприятие тела и захват в физическом человероиде, а также различие между зеркальным собой и другим, объединяя активный вывод с нейронными сетями-моделями вперед. Bristol Robotics Lab и Active Touch Laboratory вносят вклад в системы байесовского активного сенсорного тактильного исследования (массивы кончиков пальцев, усики), которые воплощают принципы активного вывода без обязательной формализации их таковыми. Статья Verses AI's блога сигнализирует о раннем промышленном интересе, хотя она явно не рецензируема.

Открытые проблемы

Отчет выявляет пять нерешенных областей, требующих дополнительных доказательств: масштабируемость оценки свободной энергии для высокоразмерных, реального времени роботов (до сих пор рассматривалась только в симуляции посредством preprint "Масштабирование активного инференса"); принципиальное определение генеративной модели, балансирующее между ручными физическими моделями и обученными компонентами; систематическое сравнение с классическими контроллерами и глубоким обучением, для которого еще не существует стандартизированного набора тестов (аналогичного MuJoCo-стилю RL); безопасность и устойчивость при распределенном смещении, где фреймворк DR-FREE Zorzi et al. (усиление минимизации свободной энергии над неопределенной множеством моделей) предлагается, но еще не применяется к физическим роботам; и институциональное принятие, поскольку цепочки инструментов активного инференса значительно менее зрелые, чем ROS или стеки глубокого обучения. Отчет явно предупреждает, что многие утверждения основаны на качественных или доказательствах концепции, а не на систематических сравнениях.

Опорный каркас

Christopher L. Buckley, Chang Sub Kim, Simon McGregor, Anil K. Seth (2017). The free energy principle for action and perception: A mathematical review. Journal of Mathematical Psychology. DOI: 10.1016/j.jmp.2017.09.004. Thomas Parr, Giovanni Pezzulo, Karl J. Friston (2022). Active Inference: The Free Energy Principle in Mind, Brain, and Behavior. MIT Press. Giovanni Pezzulo, Francesco Rigoli, Karl J. Friston (2017). Active Inference, homeostatic regulation and adaptive behavioural control. Progress in Neurobiology. DOI: 10.1016/j.pneurobio.2017.08.001. Pablo Lanillos, Cristian Meo, Corrado Pezzato, et al. (2021). Active Inference in Robotics and Artificial Agents: Survey and Challenges. arXiv. DOI: 10.48550/arXiv.2112.01871. Lancelot Da Costa, Thomas Parr, Noor Sajid, Sebastijan Veselic, Victorita Neacsu, Karl J. Friston (2020). Active inference on discrete state-spaces: A synthesis. Journal of Mathematical Psychology. DOI: 10.1016/j.jmp.2020.102447.

Ключевые поверхности

Активное рассуждение и робототехника в общих чертах

Объединенный цикл инференса

Активная инференция переосмысливает оценку состояния, управление и обучение как одно вариационное минимизация свободной энергии под единой генеративной моделью, а не отдельные ручной сборкой модули.

Точность-весовленная отказоустойчивость

Бета-резидуальное обучение точности позволяет манипуляторам понижать вес ненадежных каналов датчиков в реальном времени, сохраняя производительность при отказах датчиков.

Смешанная оценка качества доказательств

Результаты охватывают работы, опубликованные в рецензируемых журналах (IEEE RAL, учебные пособия, индексированные в PubMed) и неопубликованные препринты или статьи в блогах индустрии (Verses AI), при этом еще не существует стандартного набора тестов для сравнения активного инференса с классическим управлением или обучением с подкреплением.

Связанные ресурсы

Публичные ссылки для этой страницы

Внешние ссылки разрешаются из общего реестра, поэтому ориентированные на посетителей назначения остаются централизованными и проверяемыми.

Repository / Projects

GitHub organization

Audience: Developer

Public GitHub organization for Institute repositories and open-source work.

projectsgithub-org