网易首页 > 网易号 > 正文 申请入驻

主动推理视角下的神经反馈训练

0
分享至

主动推理视角下的神经反馈训练

An Active Inference perspective on Neurofeedback Training

https://hal.science/hal-05059420/document



摘要

神经反馈训练(NFT)旨在通过实时反馈教会个体自我调节大脑活动,但其结果高度可变,且机制尚不明确,这阻碍了其有效性验证。为解决这些问题,我们提出了神经反馈闭环的形式化计算模型。利用主动推断(Active Inference)——一种模拟感知、行动和学习的贝叶斯框架——我们模拟了与神经反馈环境交互的智能体。这使得我们能够测试设计选择(如反馈质量、生物标志物有效性)和主体因素(如先验信念)对训练的影响。模拟结果表明,训练效果对反馈噪声或偏差以及先验信念敏感(凸显了指导说明的重要性),但也揭示出,完美的反馈并不足以保证高性能。该方法为评估和预测神经反馈变异性、解释经验数据,以及潜在开发个性化训练方案提供了一种工具。

1 引言

脑机接口(BCIs)涵盖了大量专门用于采集脑信号、分析信号并将其转化为外部系统命令或信息的技术[SKW12]。神经反馈是脑机接口的一个特定用例,其中通常通过脑电图(EEG)采集的信号旨在促进大脑活动的自我调节。动物通过神经反馈驱动的操作性条件反射来控制自身大脑活动的能力早在20世纪70年代就已得到证实[Fet69]。除了这些早期实验,能够让人类控制脑机接口的学习机制的本质至今仍争论不休[WKW14, HCW+15, SRS+17, CCS+20]。事实上,对于相当大比例的使用者来说,有效控制此类接口已被证明非常困难甚至不可能,这导致了“脑机接口文盲”[VB10, Tho19]和“神经反馈无反应者”[AARST18]这两个有争议的概念的出现。

神经反馈训练试图教导受试者如何控制源自自身大脑活动的特定生物标志物(或神经标志物)。神经标志物指的是一种可测量的神经生理活动,它被假定能够特异且真实地反映某种感兴趣的心理或精神状态。最常见的基于脑电图测量的神经反馈方案针对的是自发脑节律,即特定频段的振荡[MMM16, ABB+17],其空间分辨率相对较低。其他较不常见的方法涉及不同的大脑标志物(如连接性估计)或更复杂的测量设备,如功能性磁共振成像(fMRI)[BBPD20]或脑磁图(MEG)[OHL+15],这些方法具有更好的空间分辨率,但实验室外的应用前景较窄。

[EGSPA19]列举了神经反馈的三个主要应用领域。首先,研究人员使用神经反馈训练来提高健康受试者的认知表现[Gru14, Gru13, YHK117]。这种方法依赖于大脑可塑性,以在注意力、拼写、自信心等领域引发健康受试者行为的定向变化[LZH21]。神经反馈的另一个新兴用途是作为科学工具[SRS+17]。实际上,神经反馈可用于促进特定神经生理模式的出现,并研究相关的行为模式[BBPD20]。


以及相关的主观报告。然而,大多数神经反馈研究侧重于为精神和神经疾病开发非药物治疗方法,如注意缺陷多动障碍(ADHD)[EGSPA19, ACT+20, HSHB20, DAH+19]、失眠[HPH+82, SGG+17, LBJPB21, HCBI11, LLZ+22]、焦虑[MPP+11, HZL+21, CXB+21]、癫痫[ZWLH09, SBWK14]、慢性疼痛[RdLVJM20]等。此类神经反馈训练方案通常旨在对行为症状产生显著(积极)影响(例如,改善注意力障碍儿童的学习和专注能力)。

近十年来,神经反馈治疗方案在公众中的广泛采用急剧增加,但科学界尚未就神经反馈治疗的疗效达成共识[LSSO95, MFGF+14, CFB+16]。评估神经反馈整体疗效的主要挑战之一在于其广泛的治疗声称,这导致其应用于多种多样的生物标志物。这种多样性使得比较不同研究的结果变得复杂。此外,这些生物标志物与特定疾病的相关性常常未得到充分验证[BBC+19]。通常,研究人员依赖经验证据,这些证据显示认知障碍(如注意力缺陷)与特定的神经标志物偏差(如脑电图测量的θ/β功率比)之间存在显著相关性。他们假设,使这种偏差正常化将因此增强受影响个体的认知功能。为检验这些假设并消除安慰剂或非特异性训练因素以外的影响,双盲随机对照试验已成为神经反馈研究的金标准。然而,随机对照试验的设置尤为繁琐。现有研究的结果难以综合,因为它们在目标人群和生物标志物、设计方案等诸多方面存在差异。此外,样本量通常有限。因此,证据稀缺且脆弱[MMM16, EGSPA19, TKLM20, RMYBCSZ21]。例如,尽管针对ADHD患者的神经反馈治疗已成为常见做法,但多项研究得出结论,受试者行为的变化不能被证明超出安慰剂效应[LGH+07, AS13, CTCB13]。即使训练在短期内成功,神经反馈治疗的长期效果往往乏善可陈,且需要补充解决方案[MHS+09]。这引发了关于实验应如何进行的争论:训练的目标是什么、如何实施适当的控制条件(如假反馈)、如何评估训练的效果和特异性等[DBVSWB13, CPS+14, vDBVSWB14]。

近年来,尽管一些实验研究和荟萃分析得出了支持积极结果的结论[ARS+09, ABB+17, PBAEG21],但另一些研究则指出了不足之处。该领域在得出扎实且共识性结论方面所面临的这一明显困难,已引发了对方案和报告标准化的呼吁[MFGF+14, TVOR18, REGZ+20]。此外,为解释结果的不一致性,研究人员也对比较这些方法的方法学和技术细节表现出兴趣,并为成功或失败提出了不同的解释[MMM16, CFB+16, BCB+19]。

这种加强方法学的共同努力和强烈呼吁令人鼓舞,是神经反馈这门年轻科学走向成熟的明确标志。然而,目前仍缺乏对训练过程的通用性描述,用以清晰地阐明我们围绕神经反馈训练(NFT)期间作用机制的部分理解所构建的假设。这一缺失的部分是进一步指导神经反馈发展的必经下一步,因为它应作为研究人员的通用语言,以便:1. 理解神经反馈训练的基本目标是什么;2. 形式化在设计训练范式时所做出的假设;3. 量化显性和隐性训练因素的影响,以预测结果;4. 交流其结果,并解释受试者控制自身大脑活动的能力(或无能)。本文表明,主动推断(Active Inference)框架[FFR+16](在2.2.1节中简要概述)可被用来提供脑机接口/神经反馈训练的完整描述。在本引言剩余部分,我们向读者概述神经反馈训练回路的主要组成部分以及解释结果变异性的主要因素。然后,我们简要回顾了已有处理神经反馈训练问题的建模工作。最后,我们阐述引入一种新的、以受试者为中心的脑机接口交互高层次模型的动机,以解释前述所有因素。

神经反馈的不确定性与假设:神经反馈训练依赖于众多功能组件。科学界已在努力形式化神经反馈流程中哪些要素可以解释训练失败。[ABB+17]总结了针对ADHD儿童的神经反馈的主要优势和陷阱。作者指出了主要影响训练效果的两类问题:与记录或试验设计参数相关的技术性问题(信号质量、处理算法、奖励阈值和时机、反馈性质、会话结构和频率、基于试验和基于会话的学习曲线、实验者的影响、迁移练习……)以及与学习机制相关的问题(可学习性、可感知性、掌握程度、动机、自主性)。[AARST18, WEE20]中引入的预测性方法则侧重于查明哪些神经生理标志物可以解释训练成功或失败,以及哪些机制解释了受试者之间的结果差异。

最后,[BBC+19]提出了若干内在因素,这些因素挑战了神经反馈的疗效,并减缓了其作为有效治疗方法被更广泛的神经科学界认可的过程。首先是用于推断受试者认知状态的生物标志物假设。我们仍然难以理解大脑活动特征与认知维度之间的确切关系。理解精神障碍如何影响大脑活动也具有挑战性。这限制了将全脑范围的生理信号作为治疗载体,因为这需要特异、可靠且可观测的标志物[YHY+17]。其次,许多神经反馈训练因素因人而异。我们对于如何最好地使神经反馈回路适应受试者,以及内源性因素(动机、注意力、嗜睡等)和外源性因素(指导语效果、任务设置、反馈设计)的影响,仍仅有非常肤浅的认识,且这些影响几乎未被量化。最后,对意识性调节大脑机制背后的机制严重缺乏理解。这一宽泛表述在神经反馈实践中掩盖了两个关键问题之间的语义歧义:(1) 受试者如何学习?以及 (2) 受试者学习什么?尽管二者相关,但它们分别探讨了该范式的不同角度:

  • “受试者如何学习?”针对的是最能描述受试者在训练过程中知识积累过程的伪算法。大多数神经反馈练习作为旨在优化正反馈的探索性任务,其性质自然地指向了操作性条件反射(斯金纳)[GHA+09a]。受试者倾向于选择能引起反馈正向变化的动作,并避免产生相反效果的动作。然而,在缺乏显式奖励的情况下,操作性条件反射本身难以解决训练后的泛化问题。本文中将展示的一种替代观点,将训练形式化为学习神经反馈回路的有效表征。受试者学习的不是何种动作能带来正反馈,而是他们的动作如何影响了其(心理)环境,提高反馈只是其驱动力的一部分。

  • “受试者学习什么?”关注的是训练的目标以及训练过程对受试者动态的影响。尽管与前一点密切相关,但它侧重于训练影响了受试者动态的哪些部分。在操作性条件反射中,所学的是刺激(例如,低水平的反馈)与动作概率之间的映射。这有一定局限性,因为它难以解释为何在没有显式反馈的情况下(实际上将真正的神经反馈效果简化为单纯的习惯)这种训练会有任何用途。有两个可能相容的因素可以缓解这一情况:首先,神经反馈训练可能是受试者学习如何解读内隐的(内感受性)反馈信号(心率、元认知意识等)的一种方式。通过将这些信号与训练期间执行的动作相关联(遵循某种经典条件反射(巴甫洛夫)),受试者便能在训练环境之外运用这一知识。其次,受试者可能学习的是动作如何影响隐藏状态,而非在给定特定反馈时应执行何种动作。这与[VKC21]的观点一致,他们认为技能学习[GHA+09b]——定义为观察后建立模型的意识性和主动性机制——在神经反馈训练中发挥着不可或缺的作用。

神经反馈疗效的因素:许多关键因素已被证明对脑机接口训练的结果有强烈影响。理想情况下,神经反馈训练模型应能捕捉以下一个或多个效应:

  • F1:生物标志物特异性。我们对大脑动态的认识仍然肤浅,关于生理标志物如何与行为(及认知)特征相关的科学共识往往是近似的且不断变化[PCB+20]。非特异性生物标志物可能受到多个认知维度的影响,调节它们可能导致非预期的认知改变:例如,运动想象训练[ZCY+22]可能引发焦虑[CXB+21],因为所选生物标志物可能共享共同特征。训练多种可能的认知状态可能引发若干局限性:认知训练可能因受试者专注于非目标认知状态(这些状态也能触发正反馈)而失败[MJL14, RBCC13, GSF+17]。依赖于多个可能不相关的认知状态的生理标志物也会成为不良的训练指标,因为它们的值可能随状态组合而变化,从而阻碍有效学习。最后,自我调节所涉及的认知通路可能影响非预期的认知维度(例如,“为了集中注意力,我学会了以一种同时也引发焦虑的方式行事……”)。

  • F2:测量噪声。用于向受试者提供反馈的脑信号在测量过程中可能被显著改变。这可能源于通过受试者头部的变形/扩散、测量噪声源、分辨率损失、盲区等原因。实验者使用正向模型从测量值重建大脑的原始生理状态,但这些推断可能存在缺陷并引入显著误差源:例如,高反馈噪声可能阻碍受试者有效找出哪种心理策略能有效提高反馈/发现反馈如何响应其心理活动的规律。这可能使训练无用,因为指标看起来不可控或随机。

  • F3:用户因素(外源性和内源性)。与患者认知和行为相关的若干因素对脑机接口训练的进程有显著影响。外源性因素,如实验者在训练前和训练中的指导语、任务设置或提供给受试者的反馈形式,已被认为是训练成功的重要因素[JLB+18, REGZ+20, RPM+21]。内源性因素,如受试者疲劳、动机或特定情绪,对脑机接口训练有显著影响[RBCC13, MJL14, GSF+17],但这些效应也被证明难以解释。一些建模研究,如[OLPS17],利用脑活动中的自发噪声来描述内部内源性扰动,但据我们所知,这些因素尚未成为明确量化建模的对象,我们相信这是解释训练结果的关键点。值得庆幸的是,最近预测编码和主动推断领域的方法已经开始对某些内源性因素(正念、情绪)的认知效应进行建模,并提供了研究它们对训练影响的概念框架[HSP+21, SSHL+20]。

  • F4:学习机制。由于脑机接口/神经反馈训练属于学习范式,它们要求实验者设计一个深思熟虑的环境来引导受试者的进化。脑机接口训练过程中所涉及的学习机制的性质一直存在激烈争论(见上文)。

  • F5:安慰剂效应。最后,安慰剂效应对训练结果的影响已被证明很难与“真正的”神经反馈效应区分开来[OMHT23]。神经反馈研究中的普遍共识是通过双盲研究来系统评估神经反馈方案[FMFV+17, SGG+17, REGZ+20]。这促使[TLR17]为神经反馈训练创造了“超级安慰剂”一词:即一种实验者和受试者都相信某种做法具有治疗益处(尽管缺乏支持证据)的范式,从而导致安慰剂效应增强和更偏向性的报告。其他方法则强调,安慰剂效应是神经反馈训练的组成部分[OLRV21],在训练疗效中起中性或放大作用。无论最终哪种论点占上风,与技术和使用者相关的神经反馈训练非特异性机制[WK18, PRNL21](无论是否在训练过程本身之内),都是这些研究的关键特征,尽管有时仍报告不足。

已有建模工作:建模方法已在上述理论线索的基础上构建了神经反馈训练的计算表征。这些研究的目的是捕捉神经反馈训练固有的一部分动态,解释当前的实验结果,并有望预测某些参数对训练结果的影响。先前的形式化方法侧重于定义神经反馈的关键概念,特别是受试者的反馈感知、反馈控制和学习。Gaume等人[GVMS+16]提出了神经反馈中涉及的心理动态的形式化描述,并推导出了一个受控制论启发的神经反馈训练模型,该模型兼具内隐和外显反馈模态。然而,他们并未提供描述训练动态的明确计算模型。Davelaar提出了通过神经反馈进行脑电波调节的基于解剖学的多阶段模型[Dav18],以及神经反馈受试者学习阶段的多阶段模型[Dav20]。在前者中,使用了兴奋性和抑制性神经元池来生成人工脑电数据,如[Izh03]中所述。一个由1000个二元神经元组成的人工纹状体单元控制了被选为标志物的峰值α频率。智能体通过利用提供给它的反馈,进行增量概率更新来寻找负责的神经元群。该方法是一个神经元选择的低层模型,描述了受试者自我调节过程中所涉及的生理通路,但未涉及更高层次的功能。例如,该模型未描述训练对使用者心理状态的影响或先验偏差的影响。[OLPS17]研究了时间因素对受试者自我调节能力的影响。它提出了一个在功能磁共振成像神经反馈训练过程中受试者自我调节的模型,该模型涉及一个困难的信用分配问题,并受反馈延迟和噪声的调节。重要的是,两种不同的学习结构被比较以测试不同受试者学习策略的影响。认知学习旨在代表受试者在面对反馈时可能选择的显式策略,而自动学习则与一种更内隐的模态相关,即受试者试图在给定反馈信号的情况下控制一组无约束的认知状态,其表述让人联想到强化学习(RL)。最近,Lubianiker及其同事的一项研究[LPDH22]提出了一族与本论文中展示的模型相似的模型,这些模型将传统的神经反馈训练组成部分映射到经典的(无模型)强化学习元素上。根据这一表述,提供给受试者的反馈构成状态,而神经反馈受试者被类比为强化学习智能体,必须通过学习一个值函数来选择动作,该值函数将这些状态与潜在的心理动作相关联。尽管所提出的框架构成了受试者与脑机接口回路之间初始交互的适当近似,但它难以解释训练的后期部分,尤其是受试者学习更精细的环境表征或将所学知识迁移到另一环境中的能力。我们认为,需要一种更基于模型的神经反馈训练过程中受试者经验的描述,以解释这些现象,并捕捉内源性因素(如受试者动机、实验者指导语)的影响,更广泛地说,以允许更好地解释训练机制和结果。

动机:本文旨在通过提供关于脑机接口/神经反馈训练的替代视角来改进以往的方法。总而言之,本文回应了神经反馈社区所表达的三重需求:

  1. 我们提出了一个基于主动推断框架的完整模型族,使我们能够描述神经反馈训练过程中受试者的学习,从最初的探索步骤到迁移学习。该模型族具有通用性,并可包含关于训练驱动机制/目标的若干替代假设。

  2. 我们展示了如何使用这一表述来清晰地界定神经反馈训练的目标和假设:我的神经反馈训练旨在受试者内部产生何种变化?关于我所使用的生物标志物,我的假设是什么?我期望我的指导语如何影响训练?

  3. 我们展示了该模型族可用于回答研究人员的问题,并为受试者参数提供广泛的估计量。如果实验者对训练的某些关键参数(生物标志物的噪声、受试者认知状态的布局等)有精确的预期,我们或许能够解释结果的变异性,并最终根据受试者的内部参数预测其训练曲线。这可能最终通过为每个个体量身定制训练范式来提高治疗效果。

我们的方法通过建模训练过程中受试者信念的演化,突破了先前已建立的工作。与[LPDH22]类似,我们将整个脑机接口回路描述为一个动作选择问题,但我们利用主动推断为受试者配备更广泛多样的环境内部表征。这使得我们能够显式地建模受试者的感知不确定性、关于其环境的先验信念(关于反馈的信念、关于其控制自身大脑活动能力的信念)、实验者指导语的效果、各种心理表征等。与Davelaar和Oblak的工作相反,我们的表述侧重于训练的认知方面,并未明确展示受试者的大脑活动,而是考虑其认知活动与所提供反馈之间的直接映射。

2 方法 2.1 通过交互学习:脑机接口训练的认知模型

神经反馈,以及更广义的脑机接口交互,可以理解为一种独特的人机交互形式,其特征是两个主要智能体——受试者和实验者——之间的双向学习过程。在这种设置中,受试者通过自身神经活动的调制与人工环境互动,而实验者则设计和校准环境对这些神经信号的响应。因此,神经反馈的效果取决于双方所持有的内部模型和假设:受试者对如何与系统交互的不断演化的理解,以及实验者关于认知或行为特征之神经相关性的假设。

实验者:在设计反馈回路时,实验者通常会假定可测量的神经生理模式与某些感兴趣的行为或认知特征之间存在关系——例如,注意缺陷个体中θ活动增强或β活动减弱。我们的框架引入了一个中间概念构念——认知系统——它起到连接可观察行为与可测量大脑活动的作用。因此,靶向一个神经生物标志物隐含着靶向一组可通过行为从外部推断的认知状态。例如,针对ADHD或失眠等疾病的神经反馈干预通常旨在调节注意过程[ACT+20, MMM16],其假设是这些过程反映在特定的脑电信号特征中[MFBF+19, PCB+19]。这一认知模型使我们能够将神经反馈交互分解为两个相互关联的组成部分:(1) 生物标志物假设,它假定认知状态与神经生理信号之间存在映射;(2) 正向模型,它描述脑信号如何被处理并转化为反馈刺激。从这个角度看,呈现给受试者的反馈构成了对其当前认知状态的推断估计——例如:“反馈值低,这意味着你的注意力水平低”。

受试者:在这种环境中,受试者必须同时执行两项任务:感知任务和决策任务。首先,他们必须理解反馈的含义(“反馈值低,这关于我的注意力水平意味着什么?”)。其次,他们必须找出一种心理策略,使其能够提高反馈或自愿控制其水平(我的行动如何改变我的认知状态以表现良好?)。注意,在这种情况下,所执行的行动是心理行动(集中注意力、进行心理意象、回忆记忆、内心语言等)。为了能够在训练中更好地导航该环境,受试者需要学习神经反馈环境的规则,以进行更明智的推断。我们的模型假设受试者利用所提供的反馈来构建其环境的(近似)内部表征,并从反馈观察和心理行动的历史中学习。注意,这种表征的复杂性不必与完整的神经反馈回路匹配,但应允许他们尽可能有效地在其中导航。为了能够捕捉神经反馈受试者内部因素(如他们对自我调节的先验知识)的影响,我们的模型因此明确描述了受试者对其认知状态的信念如何随训练而演化。

总结,我们将神经反馈(以及由此延伸的脑机接口)训练视为受试者的一项联合练习,包括反馈感知、心理决策和学习。由于系统周围存在众多不确定性(见第1节)以及上述影响训练的众多因素,这项练习尤为艰巨。尽管神经反馈/脑机接口训练中所利用的学习机制的性质仍存在争议[EGHH17, VKC21],但常见的机器学习范式已被提出用以解释这种表征构建。最著名的可能是无模型强化学习[LPDH22],尽管我们认为,一种基于主动推断框架的更复杂的基于模型的方法,为更广泛的受试者表征家族提供了基础,这些表征可能在神经反馈情境中更具适用性(例如,信念/不确定性的显式建模、处理部分可观测性、更好的泛化/迁移潜力、解释指导语/先验的效果)。在下一节中,我们将介绍这一框架并解释它如何形式化脑机接口情境中的受试者学习。


2.2 主动推断简介

主动推断框架(AIF)[FFR+16, SSPF20]是一个广义术语,涵盖了一族能够通过最小化单一代价函数(即变分自由能)来执行感知、行动和学习的模型。它提供了一个生物学上合理的框架,用于建模受试者认知状态对反馈响应的动态。本节简要概述了AIF的理论基础及其在表征神经反馈及相关脑机接口范式中的学习过程方面的适用性。

2.2.1 理论基础

主动推断将贝叶斯大脑假说[KP04]付诸实践,该假说认为大脑构建并维持其环境的生成模型,以预测传入的感觉数据并指导适应性行为。这一观点表明,维持内稳态(即保持在可行的生理界限内)需要有机体通过更新其内部模型和选择适当的行动来持续最小化预测误差。感知对应于更新关于感觉输入当前原因的信念(模型反演),而学习则涉及在更长时间尺度上精炼模型参数[SSPF20]。








以这种方式进行规划,自然地在结果的预期效用(达到偏好状态,编码在对结果的先验偏好中)和预期信息增益(减少关于隐藏状态或模型参数的不确定性)之间取得平衡[PF19a]。我们的实现采用了原始主动推断规划方案的扩展:精妙推断方案[FDCH+20],该方案对可能的未来行动-结果序列执行树搜索,以评估期望自由能并选择最优策略,尽管对于长规划视野而言可能计算密集。

这种统一的形式化使智能体能够构建日益连贯的内部生成模型,无论是通过推断模型中的隐藏变量、采取行动来解决关于它们的不确定性,还是学习系统的内在动态。本质上,主动推断假定感知、行动选择和学习都源于一个单一的命令:最小化自由能(感知和学习的变分自由能,行动选择的期望自由能)。这发生在三个不同的步骤中:1)在推断过程中,利用关于隐藏状态演化和观察的知识来猜测最可能的隐藏状态。这是一种非常短期的机制,在顺序模拟中每个时间步被利用一次。2)状态推断之后,智能体采取行动以追求期望的结果[SSPF20]并解决不确定性。3)最后,智能体改变其对世界的整体模型。这种演化通过更新其对一般环境动态的表征来影响更广泛的时间尺度。这三种机制共同提供了智能体在单次试验以及大量试验中规划和行为的一般描述:


其中5a为隐藏状态推断(每个时间步计算),5b为行动选择(每个时间步计算),5c为环境动态学习(在一次试验结束时计算)。

2.2.2 离散主动推断:马尔可夫决策过程中的变分推断

为将主动推断应用于神经反馈训练,我们使用离散部分可观测马尔可夫决策过程(POMDP)对受试者-环境交互进行建模,如图3所示。这种形式化使我们能够明确区分真实环境动态(生成过程)与受试者的内部表征(生成模型)。



2.2.3 数学形式化

本节详细阐述了在AIF-POMDP框架内控制感知、规划和学习的核心数学方程。我们假设受试者可能感知到来自多个隐藏状态因子( f f)的多种观察模态( m m)。向量化参数以粗体表示。为简洁起见,在无歧义处省略因子/模态的上标。


规划与决策:主动推断智能体试图通过执行能够(a.)导向偏好结果(在我们的情境中,即高正反馈水平)和(b.)增进智能体对其环境知识的行动,来最小化其模型的期望自由能(EFE)[FFR+17]。EFE可被视作智能体规划其下一步行动时的一种目标函数。精妙推断智能体[FDCH+20]构建未来行动和结果的树状结构来规划其下一步行动。选择此规划方案而非传统主动推断,是因为它允许更灵活的行动选择,无需预定义行动序列(或策略)。对于每个预期时间步τ,一个行动-结果分支(oτ, uτ)具有如下的负期望自由能:






与感知和行动选择(时间步级别)相比,这种学习机制在较慢的时间尺度(逐试验)上运行。试验的时长可以影响初始探索模式。由于狄利克雷更新的累积性质,先验信念会随着经验的积累而变得日益根深蒂固,除非引入参数衰减(“遗忘”)等机制,否则可能降低适应变化的灵活性[HSP+21]。重要的是,有效学习需要信息丰富的先验;具有无信息(例如,平坦的)初始先验的智能体难以从观察中构建连贯的模型[MKG22],这凸显了指导语或先前经验在促进脑机接口技能习得中的潜在作用。

大量方法[FFR+16, PF19b, FDCH+20, TSB20, DCPS+20, HSP+21, SSHL+20, SFW21]已经记录了在状态推断、行动推断和学习过程中,变分自由能和期望自由能梯度是如何相对于受试者模型变量和参数计算的。在本节中,我们对模型更新提供了简化的说明,但我们强烈建议感兴趣的读者参阅前述引用的方法,以获取对我们模拟背后计算的更完整解释。

2.3 使用主动推断进行神经反馈训练建模 2.3.1 不确定性下的训练模型

应用AIF-POMDP框架使我们能够形式化地建模受试者在神经反馈训练期间的体验和学习轨迹,明确地处理所涉及的固有不确定性。


表1提供了基于共识指南[REGZ+20]的传统神经反馈成分与我们AIF模型中对应元素之间的直接映射。

神经反馈/脑机接口训练与通常使用AIF框架探索的大多数行为范式有显著不同。主要区别之一在于该范式受到非常大量的不确定性的影响。两个主要的不确定性来源对神经反馈学习挑战至关重要,并在AIF中被自然地捕捉:1)感知不确定性:关于受试者潜在认知状态与观察到的反馈信号之间关系的模糊性。这通过真实似然映射(A)与受试者学习到的模型(a)之间的差异来表示。信号噪声、生物标志物的选择以及反馈处理等因素对A有贡献,而实验者指导语和先验信念则塑造了初始的a。2)控制不确定性:关于相关认知状态空间的拓扑结构以及特定心理行动在状态间转移的有效性的模糊性。这通过真实状态转移动态(B)与受试者学习到的模型(b)之间的差异来表示。

我们使用规范的主动推断模型组件来描述受试者在心理训练任务中的体验。这需要描述受试者的认知活动如何响应其对反馈的感知而演化,其次描述受试者如何选择影响反馈的各种心理行动。我们将受试者探索的认知拓扑形式化为一组离散的潜在状态。然而,并非所有状态都被同等建模!有些状态比其他状态更受偏好,因为它们与实验者关于受试者脑信号的偏好相关。由于在主动推断表述中认知动态由贝叶斯动态驱动,当面对新观察时信念的演化方式受到初始先验质量和受试者所持有的主观不确定性水平的强烈影响。这一思想是我们建模神经反馈及其治疗效果的核心。图4提供了一个可视化表示,描述了我们如何使用总体的主动推断框架来阐明受试者在各种脑机接口训练过程中的感知、规划和学习。



值得庆幸的是,人们并不需要完美的反馈模型来获取证据以学习如何控制它。已有研究表明,人类能够从宽泛的先验中推导出连贯的、结构化的交互模型。然而,在非侵入性脑机接口交互的具体情况下,低信噪比为已经困难的推理问题增加了额外复杂性,这可能解释了受试者表现不佳的原因。正如在自然环境中常见的情况,智能体的生成模型与其试图模仿的过程最终可能大相径庭,导致不准确的隐藏状态感知和次优行动。受试者模型的质量不是以其完美反映观察原因的能力(这将极其复杂且在计算上不可行)来评估的,而是以其支持准确预测和目标导向控制的能力来评估的。

在考虑脑机接口训练回路的这种表征时,人们可能会提出以下问题:根据这一表述,神经反馈/脑机接口训练的机制目标是什么?这种表征提供了几个答案:首先,模型中的学习对应于智能体逐步映射其内部认知景观并发现有效的心理行动以进行导航,同时可能精炼其对所提出的(脑机接口诱导的)反馈信号的模型。然后,导致期望反馈的行动序列的强化导致了稳健控制策略的形成,类似于习惯形成。最后,标准的神经反馈回路可以扩展以纳入内感受观察模态。在这种表述下,受试者在每个时间步接收两种类型的感觉信息:外部的、明确提供的反馈,以及内部的、内感受的信号。关键的是,在这种情境下,学习不仅涉及解释明确的反馈,还涉及发展识别和调节与成功控制相关的内部身体信号的能力。这已被引证为脑机接口训练的潜在促进因素,以及确保训练后内稳态的关键机制[Dav18]。

2.3.2 底层假设

我们对脑机接口认知训练的主动推断形式化做出了若干隐式的建模假设。首先,也是最重要的,我们将受试者对其自身认知状态的感知(“我所相信的关于我当前注意力水平”)与其实际认知状态(“我当前的注意力水平”)区分开来。例如,在注意力训练的情况下,我们假设受试者的认知注意力水平在神经反馈训练期间由一个独立过程明确地调节。这假设受试者需要通过使用反馈信号和潜在的内感受来对其当前注意力状态进行推断。此外,我们假设反馈信号不受受试者调节过程的直接影响。

其次,它假设了被调节维度的认知状态空间结构以及受试者如何表征它。为提供对神经反馈训练的准确描述,我们必须设定智能体可能导航的合理认知状态空间,以模拟训练练习。然而,由于大多数心理训练范式周围存在的不确定性,这必然是一种近似。在本文中,我们提出了一个非常通用的图结构,以展示所利用框架在建模不同神经反馈特性方面的能力。我们在讨论部分讨论这一建模选择及其含义。

第三,表格化的主动推断形式化对反馈值、(真实和感知的)认知状态的拓扑以及受试者可能选择的行动进行了离散化。尽管连续谱对于其中某些模型变量(例如反馈或行动)可能是更合理的表征,但利用主动推断的离散形式化使我们能够创建更复杂的认知图和交互,同时保持计算的可处理性。

2.3.3 神经反馈推理问题与性能指标



3 模拟 3.1 通用模拟设置









3.2 通过模拟应对脑机接口问题

AIF框架能够模拟多样化的神经反馈场景,以解决关于训练机制的具体问题。我们聚焦于以下关键方面:

3.2.1 反馈噪声如何影响训练?



3.2.2 关于反馈质量的初始预期的影响


3.2.3 建模受试者对反馈信心的变化


3.2.4 模拟内感受学习的训练


4 结果

本节呈现的图表以及用于生成结果的模拟代码可在 https://github.com/Erresthor/ActivPynference_Public/tree/main/paper_scripts/paper_ActiveInference_BCI获取。

4.1 反馈噪声如何影响训练?

高保真反馈:我们首先模拟了一组10个人工智能体,使用完美反馈进行自我调节。图6b、6c、6d展示了其中一个智能体在三次试验(第1、5和15次)中的内部变量。图中上方行显示观察(观察到的结果和采样分布),中间行显示隐藏状态(真实隐藏值和受试者推断),下方行描绘受试者对行动的后验(给定行动对受试者而言的理想程度)和所选行动(在此情况下为行动后验中最大的行动)。在所有三次试验中,智能体都嵌入了完美的感知模型,因此感知成为一项琐碎的任务,并解释了智能体在给定反馈下推断其隐藏心理状态的确定性。受试者利用初始试验来测试行动并学习转移规则。然而到第15次试验时,行动模型已有足够信息以促使受试者采取利用性行为(总是采取最短路径朝向目标状态)。在试验层面上可以注意到明显的探索/利用转变。图6e展示了相同情况,但处于整个训练尺度上。这次显示了全部10个受试者的结果,并使用一组指标(见附录定义)量化受试者表现以提高可读性。我们绘制了智能体在训练最后15次试验中获得的平均反馈水平和认知状态。我们还绘制了其转移模型和观察模型与其真实对应模型之间的KL散度总和。我们再次注意到大约在第10次试验左右出现探索/利用转变。






4.2 关于反馈质量的初始预期的影响

我们为人工智能体提供了多样化的反馈噪声。与之前的模拟相反,智能体对反馈的指示持谨慎态度。这意味着受试者对其认知状态的感知并非一项琐碎的任务。图9显示了与第4.1节模拟的主要区别:受试者对其心理状态的信念变得更加不确定,导致心理行动学习不够激进。实际上,受试者对显式反馈的不确定性反映在它们能够从中学习到的内容上:如果它们过于怀疑反馈,则证明很难建立与反馈交互的准确模型。尽管如此,对反馈保持合理程度的谨慎并未显著损害完美反馈下的自我调节能力。图9d。






4.3 建模受试者对反馈信心的变化

先前的模拟已经展示了影响生物标志物的噪声如何根据受试者的预期影响其训练。然而,它们也假设这些预期是固定的,并且在整个训练过程中不改变。我们认为这种过度简化掩盖了脑机接口训练的主要机制之一:受试者在试验过程中对所提供的反馈可靠性的信心水平的变化。接下来的模拟具有与前几节(3.2.1和3.2.2)相同的模型,但有一个重要区别:受试者动态地改变其观察映射(关联认知状态和观察),从而考虑了脑机接口训练特定的双重感知-行动不确定性。

我们在图13中展示了这些模拟的结果。首先,我们模拟了非常典型的训练设置,即谨慎的受试者被提供完美反馈图13a,天真的受试者被提供有噪声反馈图13b,以及谨慎的受试者被提供有噪声反馈图13c。为努力减少其自由能,智能体更新了其反馈模型(右下角图)。由于智能体同时学习行动和感知模型,这些学习轨迹相互动态影响。通常,这表现为在行动模型改善的同时反馈模型恶化。一旦心理行动拓扑被充分探索,智能体的模型便收敛到局部自由能最小值。图13d将这些评论推广到更广泛的真实反馈/受试者预期参数范围。

最后,我们想了解质疑所提供的反馈质量是否会对脑机接口训练受试者产生负面影响。我们将这些反馈学习智能体的表现与图12a中显示的结果(固定反馈映射)进行了比较。我们的模拟(图13e)表明,实际影响因受试者的初始模型而异:当受试者的模型最初与真实反馈过程紧密对齐时,持续学习反馈往往损害训练表现?反过来,对于反馈映射与真实情况显著不同的受试者(如天真或过度谨慎的受试者),学习反馈导致了更好的行动映射,显示出某种“保护机制”,防止受试者学习有害的心理行动。


4.4 模拟内感受学习的训练



5 讨论

本文的目的有两个方面:首先,展示受试者的认知系统如何有助于描述神经反馈训练过程中起作用的复杂调节机制。其次,展示主动推断框架如何提供一套相关的工具来对训练进行计算建模,并通过计算方式测试各种假设和可能指导语的效果,从而为脑机接口研究做出贡献。

5.1 认知调节处于神经反馈学习的核心

在通常的神经反馈机制解释中,大脑激活长期以来被视为自变量,而认知和行为被视为因变量[SRS+17]。我们提出了一种基于受试者对反馈的认知控制的替代框架。在这种表述中,受试者通过感知、心理行动和学习来引导训练的动力学。在这种表述中,大脑活动部分由认知动态预测,而认知动态又依赖于高层次的感知、规划和学习。注意,这些过程对受试者而言不一定是意识层面的。换言之,我们的模型并未明确延伸至受试者大脑的生理维度,而是聚焦于它们所耦合的认知状态。当然,所建模的认知状态与实际测量的生物标志物之间的假设联系在实践中仍然是一个关键(且往往是薄弱的)点,这强化了生物标志物选择和适当报告的重要性[REGZ+20]。

泛化能力:训练成功或失败是一个难以清晰形式化的概念,主要是因为对成功训练的评价因范式不同而有很大差异。此外,受试者将训练中积累的知识迁移到训练环境之外的情境中的能力,对于脑机接口/神经反馈训练的成功至关重要,尤其是在治疗方法中。一方面,可以提出一个总体论点,即脑机接口训练本质上是一种认知训练,旨在为受试者提供学习适当心理策略的方法。按照这一论点,未经训练的受试者缺乏足够准确的认知模型来轻松导航其(心理)环境。这可能导致可观察的行为障碍,或无法控制外部设备等。训练将使受试者能够构建准确的感知和行动模型,使其能够更主动地控制其认知,或构建可靠的内部观察者(元认知)。因此,成功的训练将等同于构建良好的内部模型。按照我们的主动推断表述,这意味着成功的训练将最小化目标认知维度中真实环境动态 A 、 B 与建模动态 a 、 b 之间的差异。

另一个普遍假设假定了一种替代性内部观察模态的学习:其他建模方法如[Dav18]已经理论化了训练过程中内感受观察通路的出现,并讨论了它们增强正在进行的训练,然后在训练后被用作唯一强化物的能力。我们的模型在训练中显示了这种增强效应(见模拟4.4),并强调了这种“直觉”的重要性,因为当与外部反馈切断时,它将使训练对受试者无用。

在最初的模拟中,我们极大地简化了受试者在训练过程中的体验性质。实际上,我们假设受试者推断其认知活动的唯一方式是使用外部(配备脑机接口的)观察管道。尽管当训练的最终目标是学习如何使用外部设备时,这种表征可能足够,但在处理神经反馈泛化问题时则显不足:当被剥夺外部反馈时,受试者如何进行自我调节?我们认为这一经验问题通过学习内部观察模态得以解决。我们将这种内感受通路建模为一种独立的观察模态,类似于外部反馈,但其他表征方式,如层次模型[HSP+21, SSHL+20],可能提供有前景的替代方案。

工具学习与文盲:尽管如果受试者知道环境的所有动态(我的行动对我的心理状态有何影响?以及 给定的心理状态如何转化为反馈水平?),赋予合成智能体的任务将是微不足道的,但当它们面临来自一种(或两种)模态的不确定性时,事实证明要困难得多。学习与新技术交互需要使用者构建观察和行动的全面模型。在脑机接口交互过程中,这尤其困难,因为受试者关于观察和行动模态的信念缺乏消除这种不确定性所需的先验证据。为了有效学习,受试者需要对其模型的某一部分有相当的信心,以便逐步设计越来越好的交互模型。我们的模拟表明,受试者模型中的大量不确定性导致了较差的训练表现,即使是在存在精确反馈的情况下也是如此。这在任何环境中都是如此(事实上,在主动推断文献中,大多数方法要么关注在给定已知行动矩阵的情况下学习观察矩阵[FFR+16, SFW21, TSB20],要么相反)。然而,在我们的方法中,由于神经反馈和其他基于脑机接口的应用依赖于更不确定的动态集合,我们提出的模型将在智能体感知和行动信念中呈现不同水平的不确定性。推理问题的复杂性及其对受试者初始先验的依赖是受试者间高度异质性的首要解释。

最后,我们的模拟表明,在某些情况下,受试者可能更容易通过质疑所提供反馈的可靠性(无论其实际内在质量如何)来解释自己的训练表现不佳,而不是归因于自己未能找出适当的转移规则。在反馈可靠性高且与其初始信念匹配时,持续更新其对反馈信心的模拟智能体表现比更天真的对应者差,但在反馈质量较差时表现更好。使用通常的脑机接口任务数据是否能够捕捉到这种细微的训练效应,仍有待观察。

5.2 脑机接口训练建模

主动推断框架被证明特别适合建模脑机接口(BCI)训练,原因如下:

  • 它能有效适应受试者特定的内部参数和学习环境标准。

  • 它涵盖了行动、感知和学习,这些都是脑机接口训练动态的基本组成部分。

  • 其多功能性使得能够在统一框架内建模各种类型的训练回路和受试者模型。本文所述模型的通用性意味着该框架能够解释脑机接口训练方案(生物标志物、反馈设计、训练认知维度)的巨大多样性。

  • 模型可能的扩展提供了可扩展性和层次化结构,以适应脑机接口训练场景的复杂性。[FRP+17, PRF18]

  • 该框架反映了不同的时间尺度,包括快速过程(如状态推断和决策制定)和较慢过程(如学习)。

通过利用主动推断,可以将脑机接口训练中的受试者行为概念化为类似于在不确环境中导航。关键地,这种形式化包含了大量的初始参数和超参数,使建模者能够复现脑机接口训练的现实。操控这些参数能够探索特定训练方案的潜在局限性及其对智能体行为的影响。特别重要的是构成反馈基础的生物标志物可靠性(包括偏差和噪声)以及受试者模型中的先验(代表受试者在训练开始时对系统的初始信念)。我们的基本模拟表明,单独一个完美设计的反馈机制并不能确保训练成功。因此,我们可以在脑机接口训练方案的基本要素[REGZ+20]与基于信息论的变量之间建立联系,以研究学习效果。

主动推断框架的广泛适用性既带来了优势也带来了挑战。一方面,其通用性使得能够使用同一套工具建模多种多样的情境。另一方面,这种多功能性需要大量的参数,使得模型难以测试,最终难以拟合。为限制模拟参数的空间,我们对这些参数的初始值施加了约束。具体地,我们:

  • 假设了受试者心理状态的真实拓扑及其在受试者模型中的表征。我们也选择将状态转移限制在相邻的心理状态,以描述一个连续过程。最后,我们使用朝向较低状态的自发状态转移来反映心理静息状态。

  • 将反馈/生物标志物建模为有噪声但无偏的,实际上避免了深入特定生物标志物偏差的广阔模型空间,因为其影响可能证明是次要的且难以彻底检验。出于同样原因,我们也将受试者初始反馈先验描述为有噪声但无偏的。

解释脑机接口训练变异性:在本研究中,主要目标之一是阐明在某些研究中观察到的受试者间差异,即一些参与者成功调节其大脑活动而另一些则没有,导致所谓的“脑机接口文盲”。在我们的形式化中,这些个体差异可归因于几个因素。首先,在具有相似内部参数的单一智能体组内,生物标志物噪声的随机性和我们智能体的决策过程可能引入随机性,特别是当多个行动表现出相似的感知价值时。因此,模拟具有特定特征的单个智能体的行为是不够的,需要检查多个具有相似初始属性的智能体的平均性能指标以得出有意义的结论。

我们提出的形式化强调了通用脑机接口训练范式中固有的结构性不确定性来源,强调了由于感知和行动领域的高度不确定性,训练任务的复杂性。通常,当面对一组动态的不确定性时,其他维度的强先验可以促进插值和构建不确定维度的连贯模型。然而,在许多脑机接口应用(包括神经反馈)中,智能体通常在感知和行动两方面都以不确定的先验开始,这使得建立反馈与认知状态之间的关系具有挑战性。这种双重不确定性为神经反馈疗效研究中观察到的变异性提供了一种合理的机制解释。

此外,初始参数的差异可能对训练过程的结果产生群体效应,差异源于动机、习惯和先验知识等因素。我们的模型允许研究人员通过考虑替代偏好矩阵、行动习惯和先验模型来揭示这些群体差异的影响。

然而,我们的模拟表明,在适当条件下,这种不确定性带来的挑战可以得到解决,即使使用不完美的先验也可以实现成功的模型学习和系统导航。带有额外内感受观察者的模拟训练被证明要成功得多。配备了这种额外观察通路的智能体需要较低要求的先验质量即可达到令人满意的结果。

5.3 对脑机接口实验者的启示

我们的基本模拟强调了神经反馈训练某些参数的一般动态。首先,我们展示了所用生物标志物可靠性的重要性:受试者变得无法自我调节的阈值噪声特别低,且下降急剧。这表明基于非特异性生物标志物的神经反馈训练范式可能面临很大困难。总体而言,受试者理解反馈的能力直接与其判别性相关,即两个不同的心理状态在反馈中表现出的差异程度如何。

受试者关于反馈及其心理策略的先验在我们的模拟中扮演了特别重要的角色。尽管这些先验可能取决于受试者/人群特定的参数,但它们受到实验者指导语的强烈影响。总体而言,长期以来一直呼吁对给予受试者的指导语进行规范化和澄清[REGZ+20],这是(1.)简化患者任务、(2.)允许更好的可重复性、(3.)更好地解释训练结果的重要第一步。更明确定义的训练参数集也可用于更好地理解训练失败的原因,并有希望解决它们。更具体地,基本模拟表明:

  • 反馈:总体而言,智能体受益于对反馈的有限程度的先验谨慎,即不过于天真地相信其准确性。在非常差的条件下(即当受试者先验显著偏离或反馈噪声显著较高时),怀疑反馈(4.3)起到了保护机制的作用,以避免学习有缺陷的相关性。然而,它也会损害初始反馈感知适当的受试者的表现,这表明实验者应诚实地沟通其神经反馈训练范式的可靠性,尽管这种沟通的性质仍然模糊。

  • 心理策略:在我们的模拟中,我们有意识地限制了可用心理行动的数量,以便在可行的时间范围内促进学习。促使智能体探索其心理行动的特定子集(通过低初始行动映射置信度)对于启动必要的探索和学习过程至关重要。这表明在训练开始时推动受试者尝试特定的心理策略尤为重要,如果忽视可能会阻碍训练。这是文献中一个争论的问题,一些人认为提供一套清晰的策略并展示示例可能促进脑机接口技能的学习[LLM13],而另一些人则警告模糊的指导语可能与期望的结果不一致[EJSV16]。

  • 内感受:我们将受试者无需反馈即可感知自身心理状态的能力描述为一种独立的内部观察模态。我们认为它不仅仅是训练期间的增强机制,实际上是允许受试者在被剥夺外部反馈后使用神经反馈训练中获得的知识的必要通路。为促进这种直觉的学习,实验者指导语应引导受试者关注内部信号。更一般地,这种内感受观察通路已被引用为训练后效果维持的主要候选者,通过允许内稳态来实现[Dav18]。

5.4 建模局限性

尽管我们的脑机接口交互模型必然是高度简化的,但在我们的方法范围之内和之外,都有一些局限性值得一提:

  • 受试者的生理活动:大脑活动调节一直是神经反馈训练的核心,一些研究根据生理调节程度来评估其训练成功(有时却忘记检查其对受试者行为的影响)。一些已有的建模方法已明确描述了其通过调节的演化。我们选择通过提供认知与反馈之间直接映射的函数来使该维度隐含化。模拟神经反馈受试者的生理学是我们的模型在实际脑机接口实践中部署和使用的必要下一步。

  • 受试者在训练期间和之后的可见行为:尽管直接与反馈相关的认知行动被建模,但可见行为未被模拟。当然,这是我们方法的一个主要局限,因为它阻止了我们比较调节和行为的结果(通常神经反馈训练的最终目标)。

  • 反馈训练回路的时间动态:先前的神经反馈建模方法已经探讨了时间因素如延迟或连续反馈对训练的影响[OLPS17]。然而,由于我们框架的顺序性质,它可能不适合单独探索反馈时间性对人类感知的影响。

  • 受试者在训练环境之外的行为:这一主题在讨论治疗性神经反馈时尤为重要。神经反馈训练对受试者在正式训练之外的影响未被直接模拟:我们只能对训练后智能体模型(学习、习惯等)与其在其他情境下的表现之间的关系做出简化假设。这很可能与迁移学习等概念相关,而我们在此未予考虑。

这些局限性使我们无法考虑训练的一些维度。此外,关于受试者生成模型和认知状态的性质已做出了一些假设。这些假设在第2.2节中总结,并对神经反馈过程中的感知和行动选择规则做出了(合理的)假设。

5.5 未来方向

本文所呈现的工作为三个主要发展方向铺平了道路。

首先,主动推断模型是用于(贝叶斯)参数估计方法[JJ00]的良好候选者。这将允许研究人员使用实验训练数据来找出最可能解释其结果的受试者/训练管道特征。除了更好的结果解释外,经过验证的训练模型可作为训练结果预测器或自适应训练方案的基础。

其次,为模型配备神经生理学组件以明确特征化训练期间使用的生物标志物,将使我们能够闭合回路,并提出大脑中认知与生理耦合的更完整近似。这可能最终使我们能够将替代模型与实验结果进行对比,以更紧密地拟合受试者在与脑机接口交互时的内部模型。尽管棘手,但这可以通过使用信念更新期间生成的预测合成生理响应来实现[FFR+16]。或者,改编信号分类中使用的兼容方法,如深度自回归层次马尔可夫模型[WAMH18],可能证明是有趣的。

第三,将当前(认知)模型扩展到特定的认知动态(如注意力)可能有助于研究(元)认知维度(如注意力)的影响。基于主动推断的方法如[HSP+21, SSHI+20]已在主动推断框架中处理了注意力和效价问题,使用这组模型的自我调节模型可能为针对ADHD的神经反馈训练范式产生更具体的训练曲线。

6 结论

本文旨在通过提出一个新的建模角度——即受试者的认知系统——来为神经反馈疗效辩论做出贡献。重要的是,我们的研究使受试者的大脑活动成为隐含的。我们提出了一族通用模型,将大多数脑机接口训练范式表征为受试者必须通过感知、行动和学习来解决的复杂推理问题,尽管存在不确定的先验和反馈。这种表述允许研究人员明确建模关键变量的影响,如受试者的先验置信度、实验者指导语的影响、反馈质量或受试者的动机,而先前基于生理学的建模方法在此方面存在困难。

我们利用主动推断框架来模拟生物学上合理的人工智能体的行为,这些智能体的任务是解决我们提出的问题。这一努力使我们能够对数千个合成受试者进行实验,使我们能够在不依赖耗时且往往统计功效不足的研究的情况下,估计基本实验方案的结果。

这些最小模型产生的预测被用来提供关于神经反馈训练中生物标志物噪声、受试者期望和学习机制影响的首个定量描述。最后,这种对受试者体验的机制性描述表明,发展精确的内感受信号不仅使训练更容易,而且对于将神经反馈训练的效果泛化到日常生活环境中可能也是至关重要的。

原文链接: https://hal.science/hal-05059420/document

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
记者拿副驾夺机质问爱尔兰主帅:你支持的人为何想杀以色列乘客?

记者拿副驾夺机质问爱尔兰主帅:你支持的人为何想杀以色列乘客?

桂系007
2026-10-04 16:54:08
iPhone 18 Pro Max彻底翻车,苹果社死了

iPhone 18 Pro Max彻底翻车,苹果社死了

李东阳朋友圈
2026-10-05 16:21:15
9月销量出炉,又是“一米穿五界”!网友:余承东不必尴尬,华为乾崑ADS车型已经遍地开花

9月销量出炉,又是“一米穿五界”!网友:余承东不必尴尬,华为乾崑ADS车型已经遍地开花

大白聊IT
2026-10-02 22:29:11
贾乃亮带甜馨迪拜出游!甜馨长到认不出!和贾乃亮搞怪自拍

贾乃亮带甜馨迪拜出游!甜馨长到认不出!和贾乃亮搞怪自拍

喜欢历史的阿繁
2026-10-05 00:15:37
王心凌的健身照绝了!这个状态,谁敢想她都44岁了?

王心凌的健身照绝了!这个状态,谁敢想她都44岁了?

小方说跑步
2026-10-03 19:20:06
中网16强对阵出炉,2-1,2-0,斯瓦泰克晋级,郑钦文下轮对手确定

中网16强对阵出炉,2-1,2-0,斯瓦泰克晋级,郑钦文下轮对手确定

南海浪花
2026-10-05 17:32:19
爱奇艺独播,38集年代刑侦大剧来袭!全演技派阵容,又有好剧追了

爱奇艺独播,38集年代刑侦大剧来袭!全演技派阵容,又有好剧追了

乡野小珥
2026-10-05 02:08:54
百年无解历史难题:为何百万大军无人割据?毛主席的智慧全是人性

百年无解历史难题:为何百万大军无人割据?毛主席的智慧全是人性

听雪禅
2026-10-05 16:40:07
太心酸了!42岁著名女歌手江苏走穴,宾客只顾吃席没人搭理

太心酸了!42岁著名女歌手江苏走穴,宾客只顾吃席没人搭理

小徐讲八卦
2026-02-12 12:13:20
开国上将晚年坦言:别再骂李德无能,草地分兵他救了红军

开国上将晚年坦言:别再骂李德无能,草地分兵他救了红军

利刃说史
2026-10-05 13:00:00
“滚回你们自己的国家!”日本42万穆斯林遭仇恨,风向彻底变了

“滚回你们自己的国家!”日本42万穆斯林遭仇恨,风向彻底变了

风流女汉
2026-06-15 15:52:33
饶颖:赵忠祥与我发生关系7年,他的特殊性癖,让我身心受到伤害

饶颖:赵忠祥与我发生关系7年,他的特殊性癖,让我身心受到伤害

林轻吟
2026-09-19 16:09:02
除了房子越来越不值钱外,2026年我国还将迎来4大“贬值潮”!

除了房子越来越不值钱外,2026年我国还将迎来4大“贬值潮”!

职场资深秘书
2026-10-05 11:38:09
54岁藤原纪香,从未活在美颜滤镜里

54岁藤原纪香,从未活在美颜滤镜里

草莓解说体育
2026-09-15 06:46:01
红薯正大量上市!研究发现:糖尿病吃一次红薯,等于给血糖添堵?

红薯正大量上市!研究发现:糖尿病吃一次红薯,等于给血糖添堵?

王医生健康讲坛
2026-10-05 20:40:06
港圈金牌经纪人霍汶希杂志同框女儿,干爹谢霆锋成焦点,亲生爸爸成最大问号

港圈金牌经纪人霍汶希杂志同框女儿,干爹谢霆锋成焦点,亲生爸爸成最大问号

草莓解说体育
2026-10-05 05:55:36
44岁姚笛独自在杭州豪宅家中煮泡面,眼神中难掩落寞

44岁姚笛独自在杭州豪宅家中煮泡面,眼神中难掩落寞

追影客栈
2026-10-03 16:08:17
最高法:回村定居的退休人员,有权重修祖宅或申请宅基地建房

最高法:回村定居的退休人员,有权重修祖宅或申请宅基地建房

智慧生活笔记
2026-10-01 09:54:07
19岁李嫣跟老爸聚餐!手不离烟动作熟练,170cm身材干瘪太像王菲

19岁李嫣跟老爸聚餐!手不离烟动作熟练,170cm身材干瘪太像王菲

一娱三分地
2025-08-14 13:28:27
笑死!北京会惩罚每一个过度规划的游客,网友:兵马俑都没你能走

笑死!北京会惩罚每一个过度规划的游客,网友:兵马俑都没你能走

夜深爱杂谈
2026-10-01 20:22:18
2026-10-05 22:43:00
CreateAMind incentive-icons
CreateAMind
CreateAMind.agi.top
1610文章数 21关注度
往期回顾 全部

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

头条要闻

高市早苗新内阁遭"当头一棒":日农相丑闻被披露遭围攻

头条要闻

高市早苗新内阁遭"当头一棒":日农相丑闻被披露遭围攻

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永回应漏洞百出,太平轮旧事被扒

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

艺术
健康
数码
公开课
军事航空

艺术要闻

北京出生,现年81岁!建筑大师参选日本市长职位

刷酸祛痘,为什么有人翻车?

数码要闻

AMD锐龙AI Max Pro 495亮相 统一内存最高192GB

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

俄军连续4天轰炸基辅大桥

无障碍浏览 进入关怀版