网易首页 > 网易号 > 正文 申请入驻

自由能、价值与吸引子 Free Energy, Value, and Attractors

0
分享至

自由能、价值与吸引子

Free Energy, Value, and Attractors

https://onlinelibrary.wiley.com/doi/pdf/10.1155/2012/937860



最近有人提出,行动和知觉可以被理解为最小化感官样本的自由能。这确保了智能体对环境进行采样,以最大化其世界模型的证据,从而使得与环境的交换是可预测的和适应性的。然而,自由能解释并没有从强化学习和最优控制理论中引入奖励或成本函数。因此,我们要问,奖励是否是解释适应性行为所必需的。自由能表述使用统计物理学的思想,通过最小化感官惊奇来解释行动。相反,强化学习根植于行为主义和工程学,并假设智能体优化一个策略以最大化未来奖励。本文试图连接这两种表述,并得出结论:最优策略对应于关于隐藏环境状态轨迹的经验先验,这迫使智能体去寻找它们预期会遇到的(有价值的)状态。

1. 引言

本文讨论的是沉浸于多变环境中的智能体或表型其适应性行为的涌现。我们将比较和对照两种视角:一种基于自由能原理[1],另一种基于最优控制和强化学习[2–5]。这些视角之间的关键差异在于智能体优化的是什么。自由能原理假设智能体的行动和内部状态都最小化感官状态的惊奇(负对数似然)。这种惊奇不必被学习,因为它定义了智能体。简言之,作为一个特定的智能体,会在其能够占据的状态上诱导出一个概率密度(例如,水中的鱼),并且隐含地,对令人惊奇的状态(例如,离开水的鱼)也是如此。相反,在强化学习中,智能体试图优化一个策略以最大化期望奖励。我们要问的是,自由能和策略如何相关,以及它们如何规定适应性行为。我们的主要结论是,策略可以被设定为关于决定自由能的状态转移的信念。这对于理解大脑在适应性响应感觉中枢变化时必须表征的量具有一些重要含义。

我们最近已经表明,适应性行为可以由关于感官输入的先验期望来规定,而行动试图满足这些期望[6]。这被称为主动推理,并且可以在监督学习的背景下,通过将智能体暴露于一个强制其通过状态空间进行期望运动的环境来实现[7]。这些轨迹被学习,并在没有监督的情况下被重现。由此产生的行为对意外或随机扰动具有鲁棒性,并且可以用于解决强化学习和最优控制中的基准问题:参见[7]中对山地车问题的处理。本质上,主动推理用知觉学习取代了价值学习,知觉学习优化智能体关于其世界的内部模型中的经验(习得)先验。这些先验规定了与感官信号相关的自由能,并引导行动以确保感觉符合先验信念。在本文中,我们考虑强化学习和其他半监督方案所处理的更难的问题。这些方案试图仅给定一个将状态标记为有吸引力或有代价的函数,来解释适应性行为。这意味着智能体必须在环境所提供的近端约束及其允许行动库的限制下,到达远端吸引子。我们将对此问题采取一种动力学的视角,该视角突显了主动推理与强化学习之间的关系,以及经验先验与策略之间的联系。

本文包括五个部分。第一部分从平衡态和随机吸引子的角度考虑适应性行为,我们试图稍后将其与行为经济学以及最优决策或博弈论中的概念联系起来[8, 9]。这一部分考虑自创生(自我创造)吸引子,它产生于通过行动最小化智能体状态的条件熵(平均惊奇)。然而,智能体只能根据其感官状态推断环境的隐藏状态,这意味着智能体必须最小化与感觉相关的惊奇。第二部分展示智能体如何能够利用感官惊奇的一个上界(自由能)来做到这一点。这导致了对基于世界生成模型的著名推断和学习方案[10–13]的自由能表述。简言之,当行动和推断最小化自由能时,第一部分中确立的命令就得到了满足。然而,最小化自由能的原理也适用于智能体所蕴含的生成模型的形式(其形式先验)。这些编码了关于隐藏状态的转移或运动以及随之而来的吸引子的先验信念,而行动试图满足这些信念。这些先验或策略将在剩余部分中从动力学的角度加以考虑。第三部分考虑一些普遍策略,从亥姆霍兹分解开始,并引入价值、细致平衡和无散度流的概念。最后两个部分分别考察不动点策略和游走策略。不动点策略将轨迹吸引到状态空间中的(低代价)点。这些策略在强化学习和最优控制理论中得到了考虑[2, 4, 14]。它们基于规定策略的李雅普诺夫(价值)函数。然而,在亥姆霍兹分解下,价值函数是对策略的不完整规定。这说明存在更一般形式的(游走)策略,它们依赖于有代价吸引子的自访问(自我毁灭)以及通过状态空间的游走(漫游或搜索)运动。我们使用先前在监督学习背景下使用过的同一个山地车问题来说明这些基本思想[7]。

本文的主要结论是,最小化智能体状态的平均惊奇(条件熵)就足以解释适应性行为。这可以通过策略或经验先验(运动方程)来实现,这些策略或先验引导行动并在其状态空间中诱导随机吸引子。这些吸引子将智能体吸引到(低代价)不变状态集,并导致自创生和遍历行为。

2. 系综动力学与随机吸引子

适应性智能体优化什么?我们使用系综密度表述来探讨这个问题,该表述与进化过程模型 [15–17] 和博弈论中的均衡 [18] 有密切联系。我们还引入了一个基于随机动力系统的互补视角 [19]。均衡方法依赖于智能体状态上的系综密度。这可以被视为智能体的无数副本的密度,每个副本由相空间或状态空间中的一个点表示。

对于一个定义良好的智能体来说,要存在,其系综密度必须是遍历的;也就是说,是一个不变概率测度 [20]。换句话说,密度不能随时间变化;否则,智能体(根据其所占据的状态)的定义就会改变。一个简单的例子是有机体的温度,其系综密度被限制在某些相边界内。跨越这些边界会把智能体变成别的东西(通常是死掉的智能体)。智能体的系综密度存在并被限制在相边界内(即,是遍历的或不变的)这一简单事实,具有一些根本性的含义,我们现在更正式地考虑这些含义。

2.1. 设定:状态与依赖关系。如果智能体及其环境都有状态,那么智能体的状态不同于其环境的状态意味着什么?我们将此理解为:智能体具有内部和外部状态,这些状态是条件独立的,因此被一个马尔可夫毯隔开。这个毯存在的最小(非平凡)要求是将状态划分为两对子集,其中一对构成另一对的马尔可夫毯。



马尔可夫毯的概念指的是智能体内部状态和隐藏状态之间的一个(统计)边界。对于简单的(细胞)生物体,这可能与细胞表面相关联,其中感觉状态对应于受体和离子通道的状态,而行动对应于各种转运蛋白和细胞粘附过程。对于更复杂的多细胞生物体(如我们),智能体的边界最好从系统的角度来思考。例如,神经系统在其受体处具有明确定义的感觉状态,而行动由离散数量的效应器介导。在这里,表面的概念可能不太有用,因为在某种意义上,感觉上皮的空间部署变成了一个隐藏状态(并依赖于行动)。


宏观秩序(及其相关状态)的出现很容易模拟。图2提供了一个简单的例子,其中十六个(洛伦兹)振子已经相互耦合,使得每个振子(具有三个微观状态)都能看到所有其他振子。在这个例子中,宏观状态(参见序参量)只是每个状态在所有振子上的平均值;这个特定的相函数被称为平均场:参见 [27] 对神经动力学平均场处理的讨论。在这里,平均场役使每个振子的状态,使得每个微观状态与其平均值之间的差异迅速衰减;这些差异是稳定模式并衰减到零。这将微观状态吸引到一个低(三)维流形,称为同步流形 [28]。尽管秩序的出现很容易模拟,但它也很容易被破坏。图3显示了当状态运动上的随机涨落增加时,宏观秩序如何崩溃。在这里,没有役使,因为系统已经从相干区域移动到非相干区域,其中每个振子走自己的路。秩序也可以通过使相干性变得平凡来破坏;这被称为振子死亡,发生在每个振子接近状态空间中的一个不动点时(有趣的是,当振子解耦时,这些不动点是不稳定的,参见 [24])。振子死亡在图3中通过增加沿每个振子轨道(轨迹)的速度的随机离散度来说明。在这些例子中,宏观秩序崩溃为不相干或平凡相干的动力学。我们故意选择用一组相似的振子(技术上称为全局耦合映射;也参见 [29])来说明这些现象,因为宏观动力学重现了每个振子在孤立状态下的动力学。这意味着人们可以想象,微观状态本身是微观微观状态的相函数,如此无限递推。启发式地说,这说明了复杂自组织系统的分层和自相似动力学 [30, 31]。



总之,宏观秩序的出现并不神秘,它源于时间尺度的自然分离,而这种分离通过某些变量变换得以显现。然而,由此产生的秩序是脆弱的,很容易被破坏。在接下来的内容中,我们将试图理解自组织如何使智能体的宏观状态在较长时期内保持在有界集内。为此,我们将更仔细地考察它们的动力学。

2.2. 动力学与遍历性。 令(宏观)状态之间的条件依赖关系如图1所示,由以下耦合微分方程描述:


其中(正如我们稍后将看到的)














2.5. 总结。总之,遍历或系综视角将关于适应性行为的问题简化为理解通过状态空间的运动如何最小化惊奇及其长期平均值(条件熵)。行动确保运动符合自创生的流或策略,


3. 自由能表述

在本节中,我们引入自由能原理,作为通过行动最小化智能体状态条件熵的一种手段。如上所述,这些状态及其熵对智能体是隐藏的,只能通过感觉状态来访问。这意味着行动不能直接最小化隐藏状态的熵。然而,它可以通过最小化感觉状态的熵来间接地做到这一点,


这一等价性源于两个假设:隐藏状态与感觉状态之间存在微分同胚映射,并且该映射的雅可比行列式(即,感觉信号对其原因的敏感性)在所遇到的隐藏状态范围内是常数(见附录 B)。至关重要的是,由于感觉熵是感觉惊奇的长期平均值,上述极值条件要求行动最小化感觉惊奇的路径积分。这意味着(根据变分法的基本引理),对于 t ∈ [ 0 , T ]



自由能是感觉状态和内部状态的一个泛函,它上界于感觉惊奇,并且可以通过行动来最小化(参见 (2))。实际上,自由能允许智能体通过将通常难以处理的对积分问题(评估惊奇)重新表述为优化问题,来巧妙地处理它。这一著名的方法由费曼 [43] 引入,并已在机器学习和统计学中广泛利用 [44–46]。所需的自由能界是通过向惊奇中添加一个非负的库尔贝克-莱布勒散度或交叉熵项 [47] 来创建的:




行动通过改变隐藏状态的广义运动来最小化自由能。本质上,它确保感觉状态的轨迹符合由内部状态编码的智能体条件信念。注意,行动从根本上不同于最优控制和强化学习中的策略。行动不是隐藏状态的确定性函数,并且对引起感觉状态的随机涨落敏感。这意味着,与最优策略不同,行动可以通过抵消感觉状态中意外的涨落来抑制惊奇:尽管最优控制方案可以从扰动中恢复,但它们无法主动取消扰动。然而,正如我们将在下面看到的,最优策略在提供对隐藏状态流的先验约束方面发挥着关键作用,而行动试图揭示这些隐藏状态。

3.1. 主动推理与广义滤波。在下文中,我们将假设关于行动和内部状态 (11) 的自由能最小化符合广义梯度下降,


这些耦合微分方程分别描述行动和知觉。第一个方程只是说行动抑制自由能。第二个方程被称为广义滤波 [53],其形式与时间序列分析中使用的贝叶斯(例如,卡尔曼-布西)滤波相同。第一项是基于微分算子 D 的预测,该算子返回编码条件预测的内部状态的广义运动。第二项通常表示为预测误差的混合,它确保内部状态(充分统计量)以贝叶斯最优的方式更新(见下文)。上述微分方程是耦合的,因为感觉状态依赖于行动,而行动通过条件预测依赖于知觉。这种循环依赖导致对感觉输入的采样既是被预测的又是可预测的,从而最小化自由能和惊奇。这被称为主动推理。


方程 (12) 描述了行动和内部状态的动力学,其具体形式取决于世界的生成模型。我们将假设该模型具有以下形式:





因为行动只能通过改变感觉状态来影响自由能,所以它只能影响感觉预测误差。由 (13),我们有


在生物学上合理的主动推理实例中,(15) 中的偏导数必须基于从行动到感觉后果的映射来计算,这通常相当简单;例如,激活肌梭内纤维会引发相应纺锤体中牵张感受器的活动:参见 [6] 的讨论。

3.2. 总结。总之,我们可以用行动来解释自组织生物系统不同寻常的持续性,这些行动抵消了其状态因随机涨落而发生的弥散。这种行动通过在每个时间点最小化感觉惊奇或自信息的自由能上界,来最小化其遍历密度的熵。为了确保自由能是惊奇的良好代理,内部状态也必须最小化自由能,并隐含地表征隐藏状态。这种最小化依赖于一个生成模型,该模型提供行动能够满足的条件预测。这些预测依赖于运动方程,这些方程构成了关于世界中隐藏状态流的(经验)先验 [55]。简言之,智能体配备了其局部环境的动力学模型,并在该环境中导航以最小化其惊奇。


4. 策略与价值







李雅普诺夫函数总是随时间减少(或增加),并用于确定确定性动力系统中不动点的稳定性。这意味着每个策略(期望流)都作为时间的函数减少惊奇。换句话说,它必须引导流向更可能(并且具有更长逗留时间)的状态。这只是对以下事实的形式化陈述:遍历系统必须平均而言持续抑制惊奇,以抵消随机涨落的弥散效应。Ao 综述了 (17) 中分解的重要性和普遍性,以及它如何为进化动力学和统计动力学提供统一的视角 [38]:这种分解表明,达尔文动力学中的涨落意味着存在玻尔兹曼-吉布斯类型的正则分布。此外,它证明了热力学第二定律,而无需细致平衡。特别地,负责打破细致平衡的动力学(无散度)分量对熵的变化没有贡献。简言之,(17) 代表了“统计力学和热力学的一个简单出发点,并且与主导物理科学的保守动力学一致” [58]。通过考虑分别强调无旋度和无散度分量的两种极端流的情况,可以领会这种表述的普遍性。



这引入了速度运动(加速度)中依赖于运动的减少,对应于摩擦。注意,摩擦是速度随机涨落的一种涌现属性(仅此而已)。关于随机涨落引起的扩散与摩擦之间关系的更彻底处理,可以使用广义爱因斯坦关系在 [57] 中找到。现在考虑随机涨落占主导且保守(无散度)流可以被忽略的系统。



4.3. 总结。在本节中,我们已经看到,策略或关于流的经验先验(由关于运动方程参数的条件信念规定)可以被分解为无旋度和无散度分量,根据价值函数和决定经典力学中所见那种保守流的反对称矩阵来规定。至关重要的是,这个价值函数只是负惊奇,并定义了隐藏状态上的遍历(不变)概率密度。然而,我们不知道策略从何而来。我们所知道的是,它为福克-普朗克方程提供了一个解;这是对智能体与环境交换的一种特殊描述。本文的其余部分将关注策略如何被规定,以及它们如何根据价值函数被实例化。

进化理论 [61, 62] 表明,物种(随机吸引子)并非从头产生,而是通过自然选择进化而来(例如,通过间断平衡或系统渐进;[63, 64])。我们将其理解为策略是可遗传的,并且可以(表观遗传地)根据价值或代价函数进行编码。我们将假设智能体配备了一个代价函数,该函数将状态标记为有吸引力或不


技术上,代价指示每个状态是否位于随机吸引子的核或不动点集合中 [65]。在确定性极限 Γ → 0 下,这个核退化为通常意义上的吸引子。从现在起,我们将用 A ⊂ O 来表示随机吸引子的核或确定性意义上的吸引子。代价的引入使我们能够将动力系统中的吸引子与强化学习和最优控制中的吸引态联系起来。非正式地说,代价将状态标记为有吸引力(例如,满足的)或有代价(例如,口渴的)。代价函数也可以被视为一个特征函数,指示当前状态是否是智能体所属类别的特征。这种标记足以规定确保

平衡解的策略,正如进化智能体的存在所证明的那样。问题是如何做到?我们将从考虑控制理论开始。

5. 最优(不动点)控制与强化学习

在本节中,我们从最优控制理论和强化学习的角度考察策略和价值。在上一节中,价值被认为产生于将流分解为无旋度和无散度部分。在那种设定中,价值仅仅报告状态被占据的惊奇。换句话说,价值是策略的一种属性。最优控制理论将其颠倒过来,并假设策略是价值的一种属性。这使得策略可以通过代价函数由价值来规定。在本节中,我们将把最优控制理论视为优化策略(流),其吸引不动点由代价函数规定。至关重要的是,因为最优控制策略不规定无散度流,它们只能规定具有吸引不动点的策略(价值函数的最大值)。在下一节中,我们将转向利用无散度流来支持游走策略的广义策略。我们将在本节中坚持连续时间表述,并在附录中提供主要结果的离散时间版本。







这就是著名的哈密顿-雅可比-贝尔曼(HJB)方程。附录 F 为感兴趣的读者提供了更一般的形式。由求解 HJB 方程以得到价值所提出的基本问题是,价值函数依赖于最优控制,以便能够评估未来代价。然而,最优控制又依赖于价值函数。这种循环依赖只能通过求解上述自洽方程来解决,也称为动态规划递推。这就是价值学习的存在理由。

在工程、规划和 control 问题中,HJB 方程通常通过反向归纳法求解(从期望的不动点开始并向后推)。然而,对于必须在线学习价值函数的智能体来说,这不是一种行为学上的选择。另一种解决方案利用了当前状态价值的期望增加就是代价这一事实。这导致了一个直接的价值学习方案


启发式地说,这个方案侵蚀价值景观,产生梯度以确保流通过状态空间中有代价的区域。唯一免受这种侵蚀的点是具有零流和零代价的最大值(或在存在涨落时为负代价)。这些是由代价函数规定的吸引集的不动点。


5.2. 总结。总之,人们可以将任何策略或期望流分解为无散度部分和增加价值的部分,其中价值是负惊奇或状态被占据的对数概率。这意味着,给定期望流和围绕该流的随机涨落幅度,人们可以计算遍历密度和相关的价值函数。此外,如果人们将任何状态的惊奇(负价值)定义为从该状态累积的期望代价,那么评估任何给定策略所隐含的代价函数就变得直接了。图4使用前面图中的洛伦兹吸引子给出了一个例子。


使用这种代价定义,强化学习和最优控制理论试图通过假设受控流最小化累积代价,从代价函数推导出价值。这涉及求解包含这些假设的自洽方程。由此产生的价值函数引导流,以确保在运动约束下代价被最小化。在动力学意义上,这种方法根据其标量势来优化策略,其最大值与状态空间中 c ( x ) ≤ 0 的点重合。然而,尽管在神经科学中很突出,最优控制理论对于理解生物系统中的自组织并不十分有用。例如,人们无法规定图4中洛伦兹吸引子所遵循的策略,因为其动力学不具有细致平衡。换句话说,

尽管人们可以从任何流推导出代价函数,但人们无法用代价函数来规定任何流:要规定任何给定的策略,人们需要上述向量势(或反对称矩阵)。

此外,最优控制方案和相关启发式方法有几个缺点:(i) 它们以缓慢著称,即使学习最简单的价值函数也需要数百甚至数千次试验,(ii) 基于随机迭代的价值学习依赖于那些为了追求策略而需要被抑制的相同随机涨落,(iii) 最优控制理论对状态空间的探索只字未提,(iv) 这些方案的一个明显局限是它们只解释具有平稳不动点的策略(即,最优情况下会什么都不做的智能体)。这意味着它们无法解释真实行为的游走和情境敏感性质。为了解决这些问题,我们现在转向广义策略,这些策略包括无散度流,并且直接受到约束,而不是对价值函数施加约束。

6. 广义(游走)策略



该简洁结论表明:当散度减小时,驻留时间(即系统处于某一状态的时间占比)会上升。这意味着散度会降低价值、提升惊奇度。这一点很直观:散度表征流场在给定点处表现为源或汇的程度。状态空间中具备吸引力、高价值的点,都是散度较小的汇点。在遍历密度的峰值处,其梯度为零,曲率为负:












重要的是要理解在这个模拟中已经实现了什么和没有实现什么:使用位置的单个标量代价函数,我们已经能够诱导自适应目标导向行为,而无需任何价值学习或强制探索环境。这种行为立即被引发,无需重复试验或暴露。此外,所需的探索和利用作为智能体先验的直接结果而显现,无需在训练期间仔细校准随机项。这种自适应行为让人联想到在昆虫和其他生物智能体中看到的觅食;其中环境在自主动力学下被探索,直到遇到某种奖励。在实验背景下,上述模拟可以被视为引发足部电击逃避行为 [75];因为均匀的高代价只能通过逃到低代价位置来避免。用到处通常都很高的代价来规定行为似乎难以置信;然而,人们可以很容易地看到驱动状态如何可能对应于高代价以及随后的觅食或寻求行为 [76, 77]。数学上,这反映了代价扮演许可角色这一事实,即它通过排除其他地方的极大值,确保遍历密度的极大值位于状态空间的低代价区域。在这个意义上,重点在于

有代价不动点的自访问,而不是吸引子的自创生。


6.2. 最优游荡与弱吸引集。 显然,我们可以用许多不同的方式来制定广义策略并用成本函数对其进行约束:我们将专注于使用成本来制定游荡(itinerant)策略:游荡很重要,因为它为动物行为学中的探索和觅食提供了原则性的解释 [78]。此外,它提供了与大脑动力学系统理论方法的关键联系 [79],这些方法强调了游荡混沌 [80]、亚稳态 [81]、自组织临界性 [82]、无胜者竞争 [83] 和吸引子 [84] 的重要性。基于亚稳态的类似结构已被用于理解分子生物学的动力学以及癌症等疾病状态的出现 [85]。这里的共同主题是通过破坏不动点或导致它们的梯度来诱导游荡 [86]。随之而来的吸引子废墟(attractor ruins)或遗迹 [87] 为异宿轨道(heteroclinic orbits)提供了一个框架,这些轨道在神经生物学、电生理学 [88]、认知 [89] 和大规模神经元动力学 [90] 中无处不在。

将上面的山地车例子扩展到产生具有异宿轨道和无胜者竞争的游荡行为是相当容易的 [83]。直观地说,这可以被视为一种适应性行为,其中按顺序访问各种奖励以维持生理稳态(例如,进食和饮水)。通过使成本函数依赖于状态,这很容易建模。这使得成本能够被它诱导的行为所改变。图 8 提供了一个简单的例子,其中我们将成本函数的饱腹感(satiety)参数作为生成模型(和环境)中的隐藏状态,以便每当成本低时饱腹感就会增加。成本只有在吸引状态下才能低,这意味着吸引状态在被占据太久时会变得不具吸引力。在山地车设置中,当饱腹感上升时,各处的成本都均匀地低,智能体将简单地停留在谷底并待在那里,直到饱腹感充分衰减,使停车位置再次具有吸引力。图 8 显示了运动方程和随后的动力学,使用与前面图片相同的格式。这种行为是无胜者竞争的特征,从某种意义上说,吸引不动点本质上是不稳定的,并将轨迹释放到序列中的下一个不动点。在这种情况下,不稳定性是通过依赖于状态的成本动态诱导的。这导致山地车定期从谷底唤醒自己,并短暂访问停车位置,直到吃饱,然后返回谷底休息。


昂贵吸引子的失效(vitiation)是一种以几种形式出现的机制,并在许多领域找到了重要的应用。例如,它与情境(具身)认知中的自创生(autopoiesis)和自组织概念密切相关 [42]。它在形式上与意向性协同处理中梯度的破坏有关 [86]。在数学上,它在通用优化方案 [91] 中找到了强大的应用,实际上,作为感知分类的模型 [92]。这些方案所依赖的动力学现象涉及沿着异宿通道(连接不同不动点的轨道)在状态空间中的游荡。至关重要的是,这些吸引集是弱(Milnor)吸引子或吸引子废墟,它们排斥状态,直到它找到下一个弱吸引子。结果是通过状态空间的一系列转换,在某些情况下,可以是稳定和重复的。由此产生的稳定异宿通道已被提出作为神经元动力学和潜在认知处理的隐喻 [83]。此外,Milnor 或废墟吸引子的概念构成了游荡动力学技术和认知文献的大部分基础。例如,可以使用弱吸引集的概念来解释“生物视觉中的一系列现象,如心理旋转、视觉搜索以及适应中多个时间尺度的存在” [92],另见 [93]。正是这种动力学行为可能支撑直接用运动方程(而不是最优控制中的价值函数)指定的广义策略。

6.3. 总结。 在本节中,我们看到了如何使用成本在隐藏状态空间中诱导吸引不动点,同时破坏不具吸引力的不动点。这不涉及任何价值学习,而是基于这样一个事实:稳定的不动点源于具有负散度的流。我们已经看到这些策略如何在主动推断下以直接的方式实现,以及赋予成本情境敏感性如何导致游荡但有目的的行为,这让人联想到生物系统。这里的基本信息是,仅根据智能体关于其在状态空间中运动的(隐式)先验信念所诱导的游荡动力学来理解自适应自组织行为可能就足够了。这些动力学及其相关的吸引子可以用不稳定不动点(弱吸引子)来表征,并且在大多数情况下,用相关的异宿轨道序列来表征。在这种动力学设置中,指定(和继承)定义表型行为的弱吸引集的一种自然方法是破坏或排除不属于吸引集的(稳定)不动点。请注意,这与最优控制理论形成了鲜明对比,后者试图使用价值函数来优化流。然而,如果对流(定义价值的流)施加简单的约束就足够了,那么这些(通常难以处理的)函数的计算可能是不必要且不自然的。

7. 讨论

本文从具有随时间守恒的定义特征的智能体(系统)的存在性开始。我们使用遍历理论、随机动力系统和信息论的论据来确定其动力学的命令。由此呈现的图景可以总结如下。智能体(通过进化或工程)配备了一个关于它们应当占据或拥有的状态的特征(代价)函数。这个函数对关于通过状态空间的运动(状态转移)的先验信念施加约束。行动通过抑制偏离由此产生的预测的随机或令人惊奇的偏差来实现这一策略,从而最小化惊奇和遍历密度(在长时间内)的熵。结果是一个随机动力吸引子,其测度很小,确保智能体占据一个有限的吸引状态集(或表达随时间守恒的表型特征)。每个策略(流)都有一个相关的价值函数,它是任何广义状态的(对数)遍历密度(或负惊奇)。代价函数与其所产生的遍历密度的自洽性由自然选择来保证;从某种意义上说,不诱导遍历行为的代价函数不能被遗传。在最后几节中,我们比较和对照了最优控制理论中的策略与基于动力系统理论、导致游走行为的广义策略。

7.1. 动力学与强化学习。本文中的表述强调代价函数与策略之间的联系。最优控制理论和强化学习假设价值是未来的期望代价。这使得策略可以根据控制进行优化,从而最小化代价的期望路径积分。由此产生的策略由价值直接规定,价值充当引导函数。这需要找到连接价值和代价的一组自洽方程的解。然而,这是一个困难的问题,并导致一些不一致;例如,为贝尔曼方程提供解所需的自主或随机状态空间探索,恰恰是最优控制试图避免的涨落。广义策略解决了这些困难,因为它们不将价值定义为期望代价:价值根据最频繁访问的状态(即,遍历密度)来定义,并且是流(策略)的函数。上一节试图表明,存在直接的方法来施加约束策略;即,摧毁不具吸引力的不动点。总之,强化学习从代价函数开始,从中推导出价值函数。然后使用价值来优化策略。相反,在随机吸引子的设定中,代价函数直接约束策略。根据定义,策略随后最大化价值或最小化惊奇。这避开了求解相应贝尔曼方程的需要,为探索性或游走动力学提供了有原则的解释,并提供了一种高效且生物学上合理的方案。此外,它允许行动主动抑制偏离策略的未预测偏差。

动力学游走性的重要性在过去已被多次阐述 [94],特别是从计算和自主性的角度;参见 [93] 对 Milnor 吸引子的关注。它也已在与认知相关方面被正式考虑;参见 [87] 对吸引子遗迹、幽灵或废墟的关注。事实上,人们越来越有兴趣根据游走性和亚稳定性来理解大脑动力学本身[81, 83, 88, 89]。Tani 等人 [95] 根据产生多个目标导向行动(在行为侧)和相同参数优化(在识别行动时)的分岔参数来考虑游走动力学。他们提供了一系列优雅的机器人模拟,以展示通过这种方案学习实现的泛化。也参见 [96] 以获取有趣的游走探索模拟,仅使用随时间对感觉样本的预测误差。

强化学习将适应性行为的问题表述为获取远端和稀疏奖励。在某种意义上,这不是一个问题;它是智能体及其与环境互动所蕴含的解决方案。在这种观点中,智能体并不寻找有价值的(奖励的)状态;

有价值的状态只是智能体频繁访问的状态。这挑战了任何关于最优控制在适应性行为中具有核心或独特作用的先入之见。话虽如此,最优控制和强化学习的前提,即智能体最小化期望未来代价,是一个引人注目且持久的启发式。这种启发式可能被大脑利用,特别是在使用基于模型的方案进行高层(例如,认知)处理方面。

7.2. 价值学习与知觉学习。山地车例子可以被视为由先天或形式先验(代价函数)约束的行为反应的模型。然而,生物设定中大多数有趣的问题可能在于在知觉过程中被优化的习得或经验先验。无论这种优化的细节如何,在主动推理下,优化都成为一个知觉推断和学习问题。换句话说,刺激-反应链接在学习过程中被选择性强化的观念消失了,并被刺激-刺激关联的学习所取代。这些规定了条件信念,而行动则满足这些信念。这很重要,因为它将许多行为主义置于知觉领域,并重申了行动与知觉之间的密切联系。

从完整类定理可知,先验与代价函数之间存在密切关系;从某种意义上说,任何可容许的决策规则对至少一个先验和代价函数是贝叶斯最优的 [97]。本文的处理表明,当决策涉及推断的世界状态时,代价函数可以被视为先验。启发式地说,代价函数是智能体的固定属性,因此只能表现为关于智能体推断及其后续行为的形式先验。这在生物设定中尤为重要,因为自然选择赋予智能体形式或先天先验,以约束其与环境的交换。

8. 结论

在本文中,我们试图理解最优控制理论与自由能原理的关系。我们从回顾系综动力学及其为强化学习和最优控制提供的视角开始。这些方法提供了收敛于状态空间中由代价函数规定的吸引子的策略或运动方程。传统方案根据价值函数或代价到目标来规定这些方程,这需要求解相应的贝尔曼方程。我们考虑了一种动力学替代方案,基于对状态空间中有代价区域中稳定不动点的选择性破坏。尽管在最小化代价路径积分方面效率较低,但这种基于散度的方案不涉及价值学习,并解释了不需要随机干预的探索性动力学。在这种背景下,最优控制的策略成为生成模型中用于推断隐藏状态和预测感觉的形式先验。行动通过抑制惊奇的自由能上界来满足这些预测。至关重要的是,优化行动、知觉推断、知觉学习以及先验本身,都是由自由能原理所要求的。这个原理只是对以下事实的重新表述:适应性系统抵抗趋向无序的自然倾向。总之,智能体必须配备规定其通过状态空间的期望运动(即,状态转移)的策略,以及通过行动抵消偏离期望轨迹的令人惊奇(随机)偏差的能力。由策略规定(并由行动实现)的运动诱导低熵密度(就系综动力学而言)或小测度的随机吸引子(就随机动力系统而言)。这些足以解释遍历自组织系统的存在,这些系统的属性随时间守恒。

原文链接:https://onlinelibrary.wiley.com/doi/pdf/10.1155/2012/937860

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
安全车下被迫停车,拉塞尔:争冠已经结束了

安全车下被迫停车,拉塞尔:争冠已经结束了

甜份超标的我
2026-10-04 20:41:11
弘一法师:有人不信轮回,四季就是轮回;有人不信因果,贫富美丑就是因果——因果何曾饶过谁?

弘一法师:有人不信轮回,四季就是轮回;有人不信因果,贫富美丑就是因果——因果何曾饶过谁?

杏花烟雨江南的碧园
2026-10-04 15:15:04
空姐下跪事件后续,涉事男主角已曝光,东航再发通报

空姐下跪事件后续,涉事男主角已曝光,东航再发通报

平老师666
2026-10-04 11:56:10
41岁朱启南谈浙江健儿亚运佳绩,如今已是副局长,22年前奥运夺冠潇洒帅气

41岁朱启南谈浙江健儿亚运佳绩,如今已是副局长,22年前奥运夺冠潇洒帅气

米修体育
2026-10-05 00:19:08
九寨沟、稻城亚丁、峨眉山、龙门石窟、五台山等多处景区,发布预警

九寨沟、稻城亚丁、峨眉山、龙门石窟、五台山等多处景区,发布预警

政知新媒体
2026-10-04 22:31:48
出门尽量不点的5道菜,有的不洗就下锅,老板:不是厨师就是内行

出门尽量不点的5道菜,有的不洗就下锅,老板:不是厨师就是内行

神牛
2026-10-04 13:14:19
全球第一艘无人母舰!四川舰实现连续弹射起飞固定翼无人机 ,专家:把固定翼隐身无人机和四川舰相互组合,这种能力只有中国才能具备

全球第一艘无人母舰!四川舰实现连续弹射起飞固定翼无人机 ,专家:把固定翼隐身无人机和四川舰相互组合,这种能力只有中国才能具备

每日经济新闻
2026-10-05 08:37:31
王楚钦出镜海报!媒体人:5枚银牌得主更该出现,为何就他破例

王楚钦出镜海报!媒体人:5枚银牌得主更该出现,为何就他破例

奥拜尔
2026-10-04 14:39:48
国庆首日高速惨剧,一车人的团圆梦戛然而止

国庆首日高速惨剧,一车人的团圆梦戛然而止

笔墨V
2026-10-05 09:46:48
暴跌58%,亏损上百万,坑惨二手表商,“硬通货”劳力士怎么了?

暴跌58%,亏损上百万,坑惨二手表商,“硬通货”劳力士怎么了?

一些小事
2026-10-05 05:48:51
抚仙湖石锅鱼店林立,游客意外得知鱼多是外面拉来的 官方:多是周围水库或其他渠道合法养殖鱼类

抚仙湖石锅鱼店林立,游客意外得知鱼多是外面拉来的 官方:多是周围水库或其他渠道合法养殖鱼类

红星新闻
2026-10-05 16:03:52
伊朗爆发“软政变”?最高领袖隐身、总统代传圣旨,反美议员入狱

伊朗爆发“软政变”?最高领袖隐身、总统代传圣旨,反美议员入狱

国际法大视野
2026-10-04 21:22:20
电击、枪顶头等画面曝光,“佤邦”的一个地区就有近6万人涉诈,警方:一度“望缅(北)止步”,而后10万民警抵达中缅边境参与专项行动

电击、枪顶头等画面曝光,“佤邦”的一个地区就有近6万人涉诈,警方:一度“望缅(北)止步”,而后10万民警抵达中缅边境参与专项行动

台州交通广播
2026-10-05 14:51:46
李月汝:四年漂泊留洋,薪资微薄,下一站继续WNBA还是转战欧洲?

李月汝:四年漂泊留洋,薪资微薄,下一站继续WNBA还是转战欧洲?

篮眼看球
2026-10-04 15:47:06
WTT中国大满贯男单首轮:莫雷加德3-2险胜陈颢桦,决胜局20-18史诗级逆转!10月6日,对阵国乒小将

WTT中国大满贯男单首轮:莫雷加德3-2险胜陈颢桦,决胜局20-18史诗级逆转!10月6日,对阵国乒小将

开成运动会
2026-10-05 21:19:01
“巨人之旅”夺冠后赵家驹身价破千万,签约费翻了10倍!“再多流量和商业我都接得住,我不存钱,钱全交给妻子”

“巨人之旅”夺冠后赵家驹身价破千万,签约费翻了10倍!“再多流量和商业我都接得住,我不存钱,钱全交给妻子”

大风新闻
2026-10-05 10:19:07
国安部披露:有境外组织以“旅游”“科考”为名,深入我国生态敏感区,或借“医疗检测”非法采集人血样,窃取我国基因资源与研究数据

国安部披露:有境外组织以“旅游”“科考”为名,深入我国生态敏感区,或借“医疗检测”非法采集人血样,窃取我国基因资源与研究数据

每日经济新闻
2026-10-04 17:10:59
人山人海,为何没换来盆满钵满?

人山人海,为何没换来盆满钵满?

钛媒体APP
2026-10-04 17:07:59
真不愧是“化痰冠军”,才喝2回,痰根拔掉,润喉又顺畅

真不愧是“化痰冠军”,才喝2回,痰根拔掉,润喉又顺畅

王二哥老搞笑
2026-10-01 20:43:05
迪拜航空副驾驶被曝曾企图在赴以航班上实施袭击

迪拜航空副驾驶被曝曾企图在赴以航班上实施袭击

国际在线
2026-10-05 18:32:11
2026-10-05 22:40:49
CreateAMind incentive-icons
CreateAMind
CreateAMind.agi.top
1610文章数 21关注度
往期回顾 全部

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

头条要闻

高市早苗新内阁遭"当头一棒":日农相丑闻被披露遭围攻

头条要闻

高市早苗新内阁遭"当头一棒":日农相丑闻被披露遭围攻

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永回应漏洞百出,太平轮旧事被扒

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

艺术
数码
亲子
旅游
家居

艺术要闻

北京出生,现年81岁!建筑大师参选日本市长职位

数码要闻

AMD锐龙AI Max Pro 495亮相 统一内存最高192GB

亲子要闻

今天我们来玩一个锻炼反应能力的小游戏

旅游要闻

甜城两日,溯脉千年 国庆长假仅余两日,何不向内江而行?

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版