为什么这个域名合适
Active inference将状态估计(卡尔曼/蒙特卡洛滤波器)、控制(LQR、MPC、PID)和日益增多的强化学习视为一个单一生成模型下的近似贝叶斯推理,最小化感知和学习的变分自由能,并通过权衡先验信息获取价值与实用目标满足价值来最小化预期自由能以进行动作选择。Lanillos等人认为这种概念上的统一正是使机器人成为理想测试平台的原因:他们必须从模糊的传感器流中维持关于隐藏变量(身体配置、物体状态、动力学)的信念,并采取行动以保持观察结果在模型期望范围内。Millidge等人对控制作为推理文献的分析进一步表明,在某些假设下,主动推理策略可以简化为标准最优控制或强化学习解决方案,从而澄清现有控制器如何可被视为自由能最小化的一般情况。
文献中的应用模式
生成模型在机器人实施中通常围绕已知的物理和动力学结构,而不是端到端学习: humanoid身体感知工作编码前向动力学和多模态(视觉/本体感觉)观察模型,而操纵器控制器则编码关节动力学、惯性和接触力。期望自由能则驱动策略选择——Pezzato, Ferrari和Hernández的自适应操纵器控制器(在IEEE Robotics and Automation Letters上发表)在线上适应动态不确定性与传感器故障,并且Baioumy等人在球平衡代理中的表现展示了期望自由能诱导真正的好奇心类似的行为。精度加权——根据推断的可靠性调整对感官通道或先验的信任度——在这项工作中反复出现,尤其是在Ferrari小组的β-残差方案中用于检测和补偿故障传感器。层次多级架构在概念上进行了讨论(例如任务空间偏好与关节空间动作),但具体的层次化实现仍然稀少且主要局限于模拟。
未解之题
《报告》识别出五个有待进一步证据解决的领域:高维实时机器人上期望自由能评估的可扩展性(目前只在模拟中解决了,由“Scaling active inference”预印本所关注);平衡手工制作物理模型与学习组件的原理生成模型规范;与经典控制器和深度RL进行系统头对头基准测试,尚无标准化的基准套件(类似于MuJoCo风格的RL套件)存在;分布转移下的安全性和鲁棒性方面,Zorzi等人提出的DR-FREE框架(用于加固基于模糊集模型的自由能最小化)被提出但尚未应用于物理机器人;以及机构采纳问题,因为主动推理工具链目前仍远不如ROS或深度学习堆栈成熟。《报告》明确警告许多声明都建立在定性结果或证明原理的结果之上,而非系统比较。
参考主干
克里斯托弗·L. 布克韦尔,chang sub 金,西蒙麥克格雷戈,阿尼尔·K. 肯特(2017)。自由能量原则對於行動和感知:一個數學評論。心理學家雜誌。doi: 10.1016/j.jmp.2017.09.004. 汤馬斯·帕拉,喬維尼奧·佩佐盧,卡爾·J·弗里森(2022)。主動推理:自由能量原則在心智、大腦和行為中的行為。麻省理工學院出版社。喬維尼奧·佩佐盧,弗朗西斯科·里哥洛,卡爾·J·弗里森(2017)。 主動推理,家園調節和適應性行為控制。神經生化學報。doi: 10.1016/j.pneurobio.2017.08.001. 巴羅拉尼洛斯,克里斯蒂安·莫奥,科隆多多·佩佐托等人(2021)。 主動推理在機器人和人工代理人中的調查與挑戰。arXiv。doi: 10.48550/arXiv.2112.01871. 拉爾科特·達薩,湯馬斯·帕拉,諾爾·沙吉德,塞巴斯坦雅斯·維利希克,維多莉塔·內卡蘇,卡爾·J·弗里森(2020)。 主動推理在離散狀態空間中的應用:一種綜合。心理學雜誌。doi: 10.1016/j.jmp.2020.102447.