此页面由机器翻译成中文。 查看英文原版。

机器人学家,控制工程师和主动推理研究者评估统一感知行动学习架构是否能超越或补充经典控制和强化学习。

{Active Inference和机器人学}

机器人作为 embodied 、不确定性受限的感知者和行动者 —— 一种期望自由能最小化的自然试验床

最佳下一步行动

{Active Inference和机器人路径}

从本页最高信号的公开链接开始,然后继续浏览相关资源和目录视图。

机器人在不确定条件下使用噪声和多模态传感器以及不完美的执行器持续感知、行动和学习——这正是自由能原则被 formulated 来描述的条件。一个正在增长但仍然多样化的文献库已经探讨了主动推理作为一种统一状态估计、控制、规划和模型学习的方法,涵盖了理论论文、模拟概念证明以及物理人形机器人和操纵器上的实验。此页面综合了该文献的应用模式、命名工具和实验室,以及将有说服力的演示与工程方法常规部署之间的开放问题。

为什么这个域名合适

Active inference将状态估计(卡尔曼/蒙特卡洛滤波器)、控制(LQR、MPC、PID)和日益增多的强化学习视为一个单一生成模型下的近似贝叶斯推理,最小化感知和学习的变分自由能,并通过权衡先验信息获取价值与实用目标满足价值来最小化预期自由能以进行动作选择。Lanillos等人认为这种概念上的统一正是使机器人成为理想测试平台的原因:他们必须从模糊的传感器流中维持关于隐藏变量(身体配置、物体状态、动力学)的信念,并采取行动以保持观察结果在模型期望范围内。Millidge等人对控制作为推理文献的分析进一步表明,在某些假设下,主动推理策略可以简化为标准最优控制或强化学习解决方案,从而澄清现有控制器如何可被视为自由能最小化的一般情况。

文献中的应用模式

生成模型在机器人实施中通常围绕已知的物理和动力学结构,而不是端到端学习: humanoid身体感知工作编码前向动力学和多模态(视觉/本体感觉)观察模型,而操纵器控制器则编码关节动力学、惯性和接触力。期望自由能则驱动策略选择——Pezzato, Ferrari和Hernández的自适应操纵器控制器(在IEEE Robotics and Automation Letters上发表)在线上适应动态不确定性与传感器故障,并且Baioumy等人在球平衡代理中的表现展示了期望自由能诱导真正的好奇心类似的行为。精度加权——根据推断的可靠性调整对感官通道或先验的信任度——在这项工作中反复出现,尤其是在Ferrari小组的β-残差方案中用于检测和补偿故障传感器。层次多级架构在概念上进行了讨论(例如任务空间偏好与关节空间动作),但具体的层次化实现仍然稀少且主要局限于模拟。

关键项目和工具

pymdp 是报告中唯一命名的一般用途软件库,是一个开源的 Python 包,用于离散状态(POMDP)主动推理,通过一篇发表在 PubMed 的逐步教程介绍。Delft 工程技术大学 Riccardo Ferrari 小组产生了最持久的手动控制工作——自适应控制器、集成状态估计/控制/学习(ICRA 2021)、基于偏置的主动推理用于经典控制(IROS 2022)以及 beta 偏残故障容忍——代码可以在他的研究网站上找到。TU 慕尼黑和日本合作伙伴领导人形线:物理人形的身体感知与抓取,以及结合主动推理与神经网络前向模型的镜像自我/他者区分。布里斯托机器人实验室和主动触觉实验室贡献了贝叶斯主动感测触觉探索系统(指尖阵列、胡须),这些系统体现了主动推理的原则,但并不总是正式化为这种形式。Verses AI 的博客文章表明了早期工业兴趣,尽管它明确不是经过同行评审的。

未解之题

《报告》识别出五个有待进一步证据解决的领域:高维实时机器人上期望自由能评估的可扩展性(目前只在模拟中解决了,由“Scaling active inference”预印本所关注);平衡手工制作物理模型与学习组件的原理生成模型规范;与经典控制器和深度RL进行系统头对头基准测试,尚无标准化的基准套件(类似于MuJoCo风格的RL套件)存在;分布转移下的安全性和鲁棒性方面,Zorzi等人提出的DR-FREE框架(用于加固基于模糊集模型的自由能最小化)被提出但尚未应用于物理机器人;以及机构采纳问题,因为主动推理工具链目前仍远不如ROS或深度学习堆栈成熟。《报告》明确警告许多声明都建立在定性结果或证明原理的结果之上,而非系统比较。

参考主干

克里斯托弗·L. 布克韦尔,chang sub 金,西蒙麥克格雷戈,阿尼尔·K. 肯特(2017)。自由能量原则對於行動和感知:一個數學評論。心理學家雜誌。doi: 10.1016/j.jmp.2017.09.004. 汤馬斯·帕拉,喬維尼奧·佩佐盧,卡爾·J·弗里森(2022)。主動推理:自由能量原則在心智、大腦和行為中的行為。麻省理工學院出版社。喬維尼奧·佩佐盧,弗朗西斯科·里哥洛,卡爾·J·弗里森(2017)。 主動推理,家園調節和適應性行為控制。神經生化學報。doi: 10.1016/j.pneurobio.2017.08.001. 巴羅拉尼洛斯,克里斯蒂安·莫奥,科隆多多·佩佐托等人(2021)。 主動推理在機器人和人工代理人中的調查與挑戰。arXiv。doi: 10.48550/arXiv.2112.01871. 拉爾科特·達薩,湯馬斯·帕拉,諾爾·沙吉德,塞巴斯坦雅斯·維利希克,維多莉塔·內卡蘇,卡爾·J·弗里森(2020)。 主動推理在離散狀態空間中的應用:一種綜合。心理學雜誌。doi: 10.1016/j.jmp.2020.102447.

关键表面

{Active Inference和机器人学简介}

统一推断环

主动推理将状态估计、控制和学习重新构造成在一个生成模型下的单个变分自由能最小化,而不是分开的手工拼接模块。

精度加权故障容忍性

贝塔残差精度学习让操纵控制器在实时下权重不可靠的传感器通道,保持性能在传感器故障下。

混合证据质量

发现涵盖了同行评审的期刊工作(IEEE RAL,PubMed索引教程)和未经同行评审的预印本或行业博客文章(Verses AI),尚未有标准化的基准套件比较主动推理与经典控制或RL。

相关资源

此页的公共链接

外部链接从共享注册表解析,这样面向访问者的目的地保持集中和可检查。

Repository / Projects

GitHub organization

Audience: Developer

Public GitHub organization for Institute repositories and open-source work.

projectsgithub-org