网易首页 > 网易号 > 正文 申请入驻

贝叶斯因子假设检验在元分析中的应用:实用优势与方法学考量

0
分享至

贝叶斯因子假设检验在元分析中的应用:实用优势与方法学考量

Bayes Factor Hypothesis Testing in Meta-Analyses: Practical Advantages and Methodological Considerations

https://arxiv.org/pdf/2511.22535



摘要

通过贝叶斯因子进行的贝叶斯假设检验为元分析中的经典p值方法提供了一种有原则的替代方案,尤其适合其累积性和序贯性特征。与标准零假设显著性检验中通常报告的p值不同,贝叶斯因子允许量化对效应存在与否的支持,便于持续的证据监测,并在纳入更多研究时保持连贯的长期行为。近期的理论进展进一步表明,贝叶斯因子如何通过与e值理论的联系灵活控制第一类错误率。尽管有这些优势,其在元分析文献中的使用仍然有限。本文对其理论性质、方法学考量——如先验敏感性——以及证据合成的实用优势进行了批判性概述。提供了两个示例性应用:一个关于语言障碍个体的统计学习,另一个关于乳腺癌患者术后运动后血清肿的发生率。支持这些方法的新工具可在开源R包BFpack中获得。

关键词:(累积)元分析,贝叶斯因子,证据合成,假设检验,先验设定。

亮点

已知内容

  • 元分析方法被广泛用于合并跨研究的效应量,通常是在传统的频率派框架内。

  • 这些方法在假设检验中面临挑战,因为元分析的累积性质固有地引入了多重检验问题。

  • 贝叶斯因子提供了一种替代方案,直接量化假设之间的证据,并允许自然的证据累积。

新内容

  • 本文比较了元分析中的贝叶斯因子检验与经典显著性检验,阐明了它们在概念和方法学上的差异。

  • 它提出了五种用于证据合成的贝叶斯因子模型,并使用标准的单一效应量元分析设置进行了说明。

  • 本文讨论了先验设定,包括(冗余)研究间异质性的先验。

  • 它强调了贝叶斯因子与e值之间的联系,作为在累积元分析中进行灵活经典错误控制的一种手段。

  • 所有方法均在R包BFpack中实现。

潜在影响

  • 该概述旨在指导研究人员选择合适的证据合成方法,并促进在(累积)元分析中采用灵活、统计上稳健的贝叶斯方法进行假设检验。

1 引言

元分析是指用于合并针对同一研究问题的独立研究的统计方法学。该方法提高了结果的精确度,合并了现有证据,并且当多项研究得出相互矛盾的结论时,它也可能解决争议(Deek等人,2023)。给定现有的已发表研究,元分析者通常感兴趣的是估计全局效应的量级及其统计不确定性。除了估计或作为估计的补充,元分析者的焦点可能是检验效应是否等于某个特定值,通常是零(例如,Higgins等人,2009,2011;Rice等人,2018)。例如,如果目标是回答某种治疗平均而言是否有益,这就很有意义。

在过去几十年中,贝叶斯估计方法变得越来越流行(例如,Smith等人,1995;Higgins等人,2009;Turner等人,2015;Hackenberger,2020;Schmid等人,2021)。在研究数量较少的情况下,这些方法可能更准确,因为它们不依赖于大样本理论,并且有可能在先验分布中包含外部信息(Friede等人,2017;Rhodes等人,2016)。如果数据中的信息主导了先验,经典估计方法和贝叶斯估计方法的表现会相似。当目标是检验效应是否等于某个特定值(或特定范围)时,基于经典显著性的检验最为常见,使用的是经典双侧p值。检验也可以通过评估该特定(零)值是否落在经典置信区间(CI)内或贝叶斯可信区间(CrI)内来执行。在元分析中检验假设的另一种方式是使用贝叶斯因子,这是一种用于假设检验的贝叶斯准则(Jeffreys,1961;Kass & Raftery,1995)。贝叶斯因子具有与基于显著性的检验根本不同的性质。这种贝叶斯准则对于统计证据在多项研究中累积的元分析可能特别有用。虽然元分析通常被建模为合并独立研究,但在实践中,早期的发现往往会影响后续研究是否进行,这意味着真正的独立性很少成立(例如,Ter Schure & Grünwald,2019)。这种隐含的序贯依赖性进一步推动了贝叶斯因子的使用,因为在这种证据的累积积累下,贝叶斯因子仍然有效。由于元分析界对这种替代方法学不太熟悉,本文旨在对其理论性质、方法学考量和实用优势进行批判性概述。表1总结了经典p值检验与贝叶斯因子检验之间的关键概念性和实践性差异,我们将在下文详细阐述。


经典p值检验的目标是在特定预设的α水平上控制第一类错误率的同时做出二分决策。这与贝叶斯因子的目标形成对比,后者通过所谓各自假设(即H1和H0)下现有数据的边际似然之比,量化现有已发表研究中假设之间的相对证据。在数学上,贝叶斯因子定义为:



从公式(1)可以看出,贝叶斯因子是一种似然比。与在未知参数的最大似然估计值处计算的经典似然比检验统计量不同(Casella & Berger,2024,第8章),边际似然是根据假设下未知参数的先验分布对似然进行加权后的加权平均值来计算的(Jeffreys,1961;Kass & Raftery,1995)。因此,贝叶斯因子对先验的选择很敏感:只有当所选的先验有意义时,尤其是在针对被检验的参数时,其结果才有意义。另一方面,在元分析模型的贝叶斯估计中,如果使用“模糊”、弱信息或无信息先验¹,先验所起的作用则要小得多。当使用贝叶斯因子检验假设时,不应对被检验的效应使用极其模糊的先验。此类先验涵盖了不切实际的大效应量,往往导致贝叶斯因子对假设之间相对证据的量化不切实际。

虽然这种先验敏感性有时被引为一种局限性(例如,Higgins等人,2009),但经典检验方法也需要主观输入,例如为等效性检验定义最小关注效应,或为功效分析选择合理的效应量(Lakens,2017;Hoenig & Heisey,2001)。因此,两种统计方法都要求对备择假设进行深思熟虑的设定(Rouder等人,2016)。由于先验设定的重要性,本文在多种元分析模型下详细讨论了这一主题。


图1展示了用于解释贝叶斯因子的定性界限,正如文献中所提出的(例如,Jeffreys,1961;Kass & Raftery,1995),这些界限主要作为对不太熟悉该概念的研究人员的指南,不应严格应用。虽然贝叶斯因子自然地提供了分级的证据度量,但它们也可以与阈值进行比较以做出二分决策,甚至可能在正在进行中的元分析中控制经典第一类错误率,在这些元分析中研究是序贯评估的,无论先前研究中应用的停止规则或数据收集决策如何(Grünwald等人,2024;De Heide & Grünwald,2021;Ter Schure & Grünwald,2019;Rouder,2014)。相比之下,经典检验对此类设计需要仔细的预先规划(见表1;Higgins等人,2011)。贝叶斯因子在序贯设置中的这种第一类错误控制是由“e值理论”的最新进展实现的,该理论支持“安全的任意时间有效推断”——一种相对新颖的统计框架,确保无论数据收集或分析何时停止,统计结论都保持有效,而不需要仔细的预先规划(Ramdas & Wang,2024;Ly等人,2024;Grünwald等人,2024)。此外,贝叶斯因子在统计上是一致的,随着研究数量的增长,证据会累积指向真实假设,而经典检验则保持不一致,因为在预先指定的α水平上始终存在拒绝真实零假设的机会。


最后,贝叶斯因子对于检验涉及多个参数上等式和顺序约束组合的更复杂假设相对灵活。此类假设可以反映关于参数之间特定关系的更精确的科学预期(例如组均值之间的顺序约束)。虽然不是很常见,但它们已被用于元分析应用(例如,Kuiper等人,2013;van Wonderen等人,2024)。尽管p值也可用于检验此类假设,但可检验的顺序约束假设类别是有限的(例如,只能将嵌套假设相互检验;Silvapulle & Sen,2004)。

为了指导有兴趣在元分析中使用贝叶斯因子进行假设检验的研究人员,我们从一个激发我们工作的已发表示例开始(第2节)。第3节介绍了五种元分析模型,重点关注正态分布效应量、已知误差方差和每项研究独立贡献的标准框架。选择这种标准设置是为了易于理解,并且因为正态模型最常被使用。

当然,在适用的情况下,通常建议使用精确模型(例如,用于二元数据的逻辑模型)。在整篇论文中,我们聚焦于(最常见的)双侧假设检验。第4节讨论了(平均)效应量的先验设定,这可能反映标准化均值差、对数优势比或Fisher变换相关系数,并简要提及了研究间异质性的先验。第5节概述了如何计算这五个模型的贝叶斯因子。第6节将贝叶斯因子与e值联系起来,强调它们对序贯元分析的适用性。第7节提供了一个模拟示例,第8节将贝叶斯因子应用于两个真实的元分析。我们以讨论作结,并指出R包BFpack(Mulder, Williams, et al., 2021)已被扩展以支持本文中介绍的若干贝叶斯因子检验。

2 动机示例

McNeely等人(2010)提出了一项关于乳腺癌手术后三天内或三天后开始运动的患者血清肿发生率的元分析。该元分析纳入了五项研究,每项研究中患者被分配到早期或延迟运动条件。结局变量是血清肿的发生。因此,对数优势比是感兴趣的效应量度量。对数优势比大于(小于)零表明,与延迟运动条件相比,血清肿在早期阶段更(不)可能出现。该元分析的数据(包括按时间顺序排列的研究发表年份)和相应的95%置信区间展示在图2的森林图中。

我们可以为这一应用构建以下双侧检验:


由于这种统计不确定性,一个研究小组可能有动机开展一项关于血清肿发生率的新研究。然而,一旦发表,使用经典显著性检验更新元分析会引入一个挑战:在第二次检验零假设时,应该使用什么显著性水平( α )?重新检验自然会膨胀总体显著性水平。忽视这一多重检验问题会削弱经典基于p值推断所依赖的固定样本量这一核心假设。

在此类情境下,贝叶斯因子提供了一种有吸引力的替代方案。首先,它们可以区分证据的缺乏(即,一项功效不足的研究,导致贝叶斯因子接近1)和支持零假设的证据(即,贝叶斯因子表明对零假设的实质性支持;图1)。其次,随着新研究的出现,贝叶斯因子允许直接更新竞争假设的相对证据。此外,e值理论的最新进展(Ramdas & Wang, 2024; Grünwald et al., 2024; Hendriksen et al., 2021; De Heide & Grünwald, 2021)使得在不依赖主观先验的情况下维持第一类错误控制成为可能,从而在受益于贝叶斯更新的同时保留了理想的频率派属性。

最后请注意,元分析者可能会考虑报告平均效应为正的贝叶斯概率,特别是如果预期该方向的话。然而,此类概率的行为类似于单侧p值(Marsman & Wagenmakers, 2017),因此在假设检验的背景下,面临着与双侧p值类似的挑战。

3 贝叶斯证据合成的统计模型

根据应用的不同,可以使用不同的元分析模型。本节简要概述三种传统元分析模型和两种较新的混合元分析模型。贝叶斯因子检验将在后续章节中在这些模型下进行讨论。

3.1 传统元分析模型

3.1.1 共同效应模型

在共同效应(CE)模型下,关键参数(记为 θ θ)被假定为在所有研究中是共同的。为了使这一假设成立,每项研究中收集数据的条件需要(实际上)相同,例如心理学中的重复研究(Schmidt, 2009),或由同一研究者针对来自同一人群的患者进行的一系列随机临床试验,并测试完全相同的治疗(Borenstein等人, 2010)。


在CE模型下,我们考虑统计实践中最常见的精确零假设检验,该检验假定平均效应为零,相对于双侧零假设检验,后者假定平均效应非零,即,


3.1.2 随机效应模型



3.1.3 固定效应模型

与RE模型类似,且不同于CE模型,固定效应(FE)模型也假定研究间效应是异质的。然而,FE方法并未指定研究间异质性的分布(其参数从数据中估计),而是在没有多层结构的情况下加以考虑。感兴趣的参数是各项研究的真实效应量。尽管不太常见,FE模型已被用于元分析应用(Rice等人,2018;Kuiper等人,2013;Klugkist & Volker,2023;van Wonderen等人,2024;Van Lissa等人,2024),以及在跨受访者汇总证据时(Stephan等人,2007;Regenwetter等人,2018;Klaassen等人,2018)²。此外,固定效应模型也可以被视为一种共同效应模型,通过纳入一个对每项研究具有唯一值的调节变量而扩展为元回归模型。根据这一元回归模型,每项研究也有其自身的真实效应量。

再次假定研究特定效应量估计值服从高斯误差。FE模型于是可以表述为


由于缺乏全局效应的参数,零假设假定所有研究特定效应均为零或并非如此(Rice等人,2018),即,



有人认为,FE模型的一个优势在于,当研究设计和/或关键变量的测量水平在研究间(高度)变化时,它仍可使用(Kuiper等人,2013;Klugkist & Volker,2023)。其论据是,我们并非在合并可能具有(高度)不同量纲的效应量,而是在计算贝叶斯因子时合并关于假设的统计证据。然而,由贝叶斯因子量化的假设之间的相对证据,会直接受到观察到的效应量及其不确定性(通过似然)的影响。因此,合并来自设计差异极大的不同研究的证据是否合适——例如,报告效应量基于二分结局和连续结局的研究,或具有实验设计或观察性设计的研究——应由实质性专家仔细评估。此外,当考虑具有根本不同量纲的效应量时,先验设定可能更具挑战性。

3.2 混合效应模型

要应用传统的元分析模型,需要做出一个二分决策:是假定研究间同质性(即CE模型),还是研究间异质性(即RE模型,其远比FE模型常见)。这归结为以下模型选择问题:


尽管Q检验(Cochran, 1954)可用于检验数据是否同质,但不推荐将其用于模型选择,因为根据元分析中纳入的研究数量、研究的样本量以及真实的研究间异质性,它可能具有较低的统计功效(Viechtbauer, 2007; Borenstein et al., 2010)。这意味着在选择两种可能模型中的任意一种时,可能会出现潜在的高错误率。

具体而言,当采用不正确的CE模型时,关键参数的标准误会被低估。在经典显著性检验中,这会导致第一类错误率膨胀,而在贝叶斯证据合成中,这会导致对真实假设的证据高估。另一方面,当采用不正确的随机效应模型时,除非被估计为零,否则关键参数的标准误会被高估。在经典显著性检验中,这会导致检验功效不足,而在贝叶斯证据合成中,这会导致对真实假设的证据低估。因此,当

关于真实底层模型存在相当大的统计不确定性,且没有理论理由偏好某一模型而非其他模型时,采用一种同时涵盖CE和RE模型的统计模型是有用的,以避免可能导致统计证据量化不可靠的、潜在易出错的二分决策(Gronau et al., 2021; van Aert & Mulder, 2022)。我们将同时涵盖CE模型和随机效应模型的这一类模型称为混合效应模型。据我们所知,文献中已提出了两种混合效应模型,我们将在下文讨论。附录A讨论了一些统计学差异。

3.2.1 边际化随机效应元分析(marema)模型

边际化随机效应元分析(marema)模型(van Aert & Mulder, 2022)与RE模型密切相关,不同之处在于它还允许过度同质性的可能性,这意味着研究间的变异小于随机预期。marema模型可以写为


这些模型之间的选择,取决于所存在的研究间异质性。最后请注意,负方差在潜变量模型(如RE模型)中非常常见。在因子分析文献中,这些被称为“Heywood案例”,通常表明模型设定错误(Kolenikov & Bollen, 2012)。在我们当前的设置中,这意味着给定现有数据,RE模型将是不合适的。边际化RE模型也已被倡导用于各种其他统计问题(例如,Mulder & Fox, 2019; Fox et al., 2017; Nielsen et al., 2021)。

在marema模型下,关于全局效应的假设检验将与RE模型下相同,即,


3.2.2 贝叶斯模型平均元分析模型

第二种混合模型通过使用贝叶斯模型平均(BMA)——贝叶斯统计中的一种常见方法(Hoeting等人,1999)——对考虑中的所有模型进行加权平均,从而纳入关于真实元分析模型的统计不确定性。贝叶斯模型平均元分析模型(Gronau等人,2021)可以通过根据以下方式对CE模型和RE模型进行平均来获得:


BMA方法也已被扩展,以纳入校正发表偏倚的(子)模型(Maier等人,2023)。

4 参数的先验设定

需要为所采用的元分析模型下的参数选择先验分布(或简称先验)。先验反映了在观察数据之前参数值的合理性。为了检验平均效应,需要在所有五个模型下为平均效应制定合适的先验。此外,在RE模型、marema模型和BMA模型下,需要为研究间异质性制定先验,这是H0和H1下共同的冗余参数。在RE模型和marema模型下,可以使用无信息非正常先验。在BMA模型下,冗余参数的先验必须是正常的(另见附录A)。

首先,我们说明贝叶斯因子对被检验参数先验的敏感性。接下来,我们分别讨论平均效应和研究间异质性参数的先验设定。表2概述了现有R包中目前可用的默认先验:BFpack(Mulder, Williams, et al., 2021)、RoBMA(Bartoš & Maier, 2020)、metaBMA(Heck et al., 2019)。由于R包bayesmeta(Röver, 2020)不提供用于贝叶斯因子检验的默认先验,该包在表中被省略。


4.1 先验敏感性




4.2 平均效应的先验

在标准化均值差的情况下,(平均)效应的先验可以基于不同的考量来设定。因为我们是在检验平均效应是否为零,一个自然的选择是将先验的中心设在零,这样负效应与正效应同样可能,并且在观察数据之前,小效应平均而言比大效应更可能。此外,由于给定未知真实效应的观察效应分布也是正态的,一个(共轭)正态先验将是一个自然的选择。先验标准差的选择尤为重要,正如巴特利特悖论所说明的那样(图3)。标准差为1是R包RoBMA(Bartoš & Maier, 2020)和BFpack(Mulder, Williams, et al., 2021)中的默认值,这意味着相当大的效应被认为是合理的。在metaBMA中,更重尾的柯西先验(尺度为0.707)是默认值。

对于作为效应量度量的对数优势比(其位于近似正态尺度上),人们可以从对两组(例如,治疗组和对照组)的成功概率放置先验开始,然后将其转换为对数优势比。作为默认选择,可以为成功概率指定合适的独立均匀先验,这些先验假定所有成功概率在先验上同等可能。通过将这些转换为对数优势比,可获得一个尺度为2.35、自由度为13的近似t分布(附录B)。这是BFpack中的默认值。另一种选择是从平均效应的先验开始,例如, N ( 0 , 1 ) 先验,并使用(Borenstein等人,2010,第7章)的转换公式将此先验转换到对数优势尺度。这是RoBMA中的默认值,其优势在于,无论感兴趣的效应量度量是标准化均值差还是对数优势比,先验分布的尺度都大致相同。在metaBMA中,先验分布的默认尺度也根据效应量度量进行了调整:使用尺度为1.283的柯西先验,因为对数优势比的分布大约比标准化均值差宽1.81倍。当同一元分析中各项研究的结局变量尺度不同时,使用转换公式可能特别有用。当然,只有当具有不同测量水平的高度异质性结局的实质性意义成立时,才建议综合来自这些结局的证据。

皮尔逊相关系数通常在应用Fisher z变换后进行元分析(Fisher, 1915)。Fisher z变换后的相关性近似正态分布。对于Fisher变换后的相关性,可以在区间 ( − 1 , 1 ) 内为相关性指定先验,然后通过应用Fisher z变换进行转换。对于相关性,一个自然的合适非信息选择是在区间 ( − 1 , 1 ) 内使用均匀先验(另见Jeffreys, 1961; Mulder & Gelissen, 2023)。在应用参数变换后,这对应于Fisher z变换相关性的尺度为0.5的逻辑斯谛先验分布(附录B)。这是BFpack中当前的默认值。或者,也可以再次使用来自Borenstein等人(2010)的转换公式,这是RoBMA中的默认值。在metaBMA中,默认使用尺度为0.354的柯西先验,以考虑到Fisher z变换相关性的分布与标准化均值差分布之间的关系。


当将平均效应的先验视为效应量的总体分布(当前元分析的未知效应量从中“抽取”)时,人们可以使用已发表研究中效应量的估计分布来创建经验信息先验。例如,这已用于罕见事件二元数据的元分析(Günhan等人,2020)、医学及其子领域(Bartoš等人,2021),以及二元试验数据和时间至事件数据(Bartoš等人,2023)。根据手头元分析相关已发表效应量的可用性,这种方法可能是合理的。平均效应的先验也已被利用关于手头效应量的外部知识为元分析所引出(Gronau等人,2017)。

4.3 研究间异质性的先验



4.4 关于先验设定的最终评论

从更理论化的角度来说,有人认为先验应导致信息一致的贝叶斯因子(例如,Liang等人,2008;Gronau, Ly, & Wagenmakers, 2020;Mulder, Berger, et al., 2021)。信息一致性意味着当估计效应趋于正无穷或负无穷时,支持备择假设的证据应趋于无穷大。粗略地说,当平均效应的(边际)先验的尾部比作为平均效应函数的(积分)似然的尾部更薄时,贝叶斯因子就不是信息一致的(在积分掉冗余参数 之后)。由于在RE模型下积分似然遵循近似的学生t分布,因此当使用尾部更厚的先验(如柯西先验)时,可以保证信息一致性。正如Mulder, Berger, et al.(2021)所表明的,当效应量极大(例如标准化效应量为10)时,正态边际先验(尾部非常薄)可能是有害的,导致相对证据大约为1(表明零假设和备择假设的证据相等)。对于CE和FE模型,作为均值函数的似然具有高斯形状,其尾部已经很薄。因此,使用正态先验时甚至不会出现信息不一致。根据我们的经验,信息一致性主要是一种理论属性,而非实际属性,因为效应量通常不会极端到使信息不一致的贝叶斯因子导致冲突行为。因此,在选择先验时,信息一致性一般可能不是一个严重的问题。

通用的近似贝叶斯方法也可用,它们避免了手动先验设定,例如贝叶斯信息准则(BIC; Schwarz, 1978; Raftery, 1995)或分数/内在贝叶斯因子(J. O. Berger & Pericchi, 1996; O'Hagan, 1995; Mulder, 2014),或其近似值(Gu et al., 2017)。例如,这些方法已被应用于固定效应元分析(Kuiper et al., 2013; van Wonderen et al., 2024; Van Lissa et al., 2024)。隐含地,这些近似遵循最小信息先验原则,可与单位信息先验相媲美。然而,为了简化证据的解释,可能更倾向于仅将这些近似方法用于现有贝叶斯元分析软件不支持的假设检验问题(例如,由于所提出的假设、统计模型或研究设计)。

最后,附录C展示了一个关于贝叶斯因子对冗余的研究间异质性先验敏感性的小型模拟。如所示,贝叶斯因子对确切的选择相当稳健。

5 计算用于证据合成的贝叶斯因子

根据所采用的元分析模型以及所选择的先验(例如,是否使用了共轭先验),贝叶斯因子计算的复杂性有所不同。此外,当有新的研究可用时,可以通过不同的公式来更新贝叶斯因子。

5.1 通过(常规)贝叶斯更新进行证据合成






5.2 通过乘积贝叶斯因子进行证据合成

在FE模型(6)下,每项研究被假定具有独特的效应量,这些效应量不通过低层分布(如RE模型中那样)相联系。因此,用于检验(12)中零假设的贝叶斯因子可以简化为各项独立研究的贝叶斯因子的乘积(附录D):


这有时被称为“乘积贝叶斯因子”(例如,Van Lissa et al., 2024)。因此,当有新研究报告时,我们只需将当前的贝叶斯因子与新研究的贝叶斯因子相乘,于是,(11)可以简化为


6 证据监测与e值理论

6.1 证据监测

监测证据具有巨大潜力,可以通过帮助研究人员、从业者、患者和资助者根据关于某些效应(不)存在的现有统计证据,做出更明智的决策来启动新研究,从而最大限度地减少研究浪费(Lau et al., 1992; Chalmers & Glasziou, 2009; Clarke et al., 2014)。例如,如果元分析中有压倒性的证据表明某种治疗有益,那么新研究最可能不会启动。另一方面,当元分析p值接近显著性阈值,或者等价地,零值非常接近其置信区间的边界时,元分析者可能有动机启动另一项研究,以阐明总体均值是否与零显著不同(这一信息在Fergusson et al., 2005中也有呼应)。各种回顾性元分析表明,许多研究在已有令人满意的证据时仍在进行,这表明对现有证据的使用效率低下。这也意味着,即使只进行过一次的元分析,也可能隐含地是累积性的,因为许多纳入的研究可能是鉴于先前的结果而启动或设计的(另见Ter Schure & Grünwald, 2019)。总之,这些观察结果导致了对更多基于证据的研究的呼吁(Lund et al., 2016)。

元分析通常使用经典p值检验来检验假设,而默认情况下,这种检验并未考虑已发表研究固有的序贯性质。其后果是,如果基于已发表研究的证据(反复)检验假设来启动新研究,可能会导致第一类错误率膨胀(Ter Schure & Grünwald, 2019)。正如Higgins等人(2011)所讨论的,为了在经典序贯分析中正确控制第一类错误率,需要限制性的决策规则,包括当序贯分析需要永久停止时预先指定的最大信息量。当超过这个界限时,就不再允许收集更多信息,“且不清楚如何继续”(Higgins et al., 2011)。尽管如此,在这种情况下,我们不能声称有支持零假设的证据,而且据我们所知,没有可用的序贯程序用于等效性检验来实现这一点。这些考虑凸显了在更新元分析中控制经典错误控制率的复杂性。这尤其成问题,因为许多零假设在应用研究中实际上可能是真的(Johnson et al., 2017)。

另一方面,使用贝叶斯因子,人们可以随着新研究的出现以灵活的方式监测和更新证据。根据所获得的证据(例如,使用图1),元分析者可以决定是否启动新研究,而无需对多重检验进行校正。这里应考虑元分析者对先验的解释。如果考虑纯粹主观的贝叶斯方法,即贝叶斯因子基于准确反映元分析者先验信念的信息先验,那么结合多重检验增加更多研究就不是问题(De Heide & Grünwald, 2021)。这可以追溯到关于主观贝叶斯统计的工作(de Finetti (1937), Savage (1972))。粗略地说,可以说贝叶斯因子通常在先验集中的区域表现良好(包括准确的第一类错误率),无论用于决定是否启动新研究的确切规则是什么(例如,另见Raftery & Gill, 2002; Rouder, 2018)。

当使用无信息、模糊或默认先验时——这些先验可能是出于方便而选择的(例如,为了避免仔细(可能耗时)地指定信息先验)——情况就变得更加复杂(Hendriksen et al., 2021; De Heide & Grünwald, 2021)。例如,当检验全局均值时,对研究间异质性使用无信息先验,贝叶斯因子可能无论真实值或冗余参数如何都表现良好。这是因为冗余参数先验的确切选择通常对贝叶斯因子没有很大影响。然而,e值理论的最新发展表明,贝叶斯因子具有良好的经典错误率,但这取决于先验的选择。

6.2 贝叶斯因子与e值理论

在过去十年中,关于所谓e值(“e”代表期望或预期值)的统计理论有了相当大的发展。关于统计基础的近期概述,请参见Ramdas & Wang (2024)。该理论提供了关键条件,这些条件必须成立,才能以灵活的方式在序贯数据设计中控制经典第一类错误率,允许可选停止/继续,而不需要像经典p值检验那样进行校正。有趣的是,e值与贝叶斯因子之间存在密切关系(例如,Grünwald et al., 2024)。在讨论这一点之前,我们首先给出e值的一般定义。





7 数值示例



8 两个实证元分析中的贝叶斯证据合成

本节描述了五种贝叶斯证据合成方法在两个元分析示例中的应用。我们使用R包BFpack(Mulder, Williams, et al., 2021)中的实现来计算CE、RE和marema模型的贝叶斯因子和后验模型概率。BFpack也用于计算单项研究的贝叶斯因子,这些因子作为FE模型下贝叶斯证据合成的输入。R包metaBMA(Heck et al., 2019)用于使用BMA模型分析数据。同时报告了频率派CE和RE模型的结果以供比较。这些结果

是使用R包metafor(Viechtbauer, 2010)获得的。分析所用的R代码可在 https://osf.io/8h5n6/files/rdp3c和 https://osf.io/8h5n6/files/5b48r获取。

8.1 示例1:语言障碍者的统计学习

第一个示例是Lammertink等人(2017)提出的一项元分析,关于特定语言障碍者与无语言障碍者在序贯统计学习能力上的差异。序贯统计学习是指学习文本中结构的能力,例如通过听人们对话。该元分析的目的是评估语言障碍者在统计学习上的得分是否与无此障碍者不同。该元分析纳入了十个效应量。每项研究都报告了Hedges' g 标准化均值差,其中较大的Hedges' g 表明无语言障碍者优于有语言障碍者。该元分析的数据展示在图6左侧面板的森林图中。






8.2 示例2:乳腺癌手术后的运动

第二个示例是McNeely等人(2010)的一项元分析,关于乳腺癌手术后三天内或三天后开始运动的患者血清肿的发生率。该元分析纳入了五项研究,每项研究中患者被分配到早期或延迟运动条件。结局变量是血清肿的发生。因此,对数优势比是感兴趣的效应量度量。对数优势比大于(小于)1表明,与延迟运动条件相比,血清肿在早期阶段更(不)可能出现。该元分析的数据展示在图7左侧面板的森林图中。



在使用贝叶斯因子作为检验统计量对该元分析进行后续检验时,第一类错误率不会受到威胁。然而,对于经典检验,这将会是个问题。例如,在RE模型下,基于显著性水平.05获得了不显著效应,这意味着完整的第一类错误概率.05已经被“花费”了(Ter Schure & Grünwald, 2019),因此“不清楚如何继续”(Higgins et al., 2011)。

我们还研究了结果对冗余参数使用不同先验分布的敏感程度。这些敏感性分析表明,当使用不同的先验分布时,结果几乎没有变化。关于这些敏感性分析的细节报告在附录I中。

9 讨论

本文强调了在元分析中进行贝叶斯因子检验时的实际益处和方法学考量。针对五种不同的元分析模型讨论了该检验。表6概述了这五种方法、关键假设、假设检验以及贝叶斯更新的公式。该概述旨在指导研究人员根据手头的元分析应用合适的证据合成模型。

由于先验的重要性,特别是备择假设下全局效应的先验,我们 thorough 讨论了先验设定。根据数据的性质(对数优势比、标准化均值差或相关性),可以考虑不同的选择。对于研究间异质性——(\mathcal{H}_0) 和 (\mathcal{H}_1) 下共同的冗余参数——我们讨论了无信息先验以及信息逆伽马先验。尽管在计算元分析中的贝叶斯因子时,无信息非正常先验在很大程度上被忽视了,但无信息先验对于默认的贝叶斯因子检验是有用的。

特别值得关注的可能是混合效应模型(marema和BMA方法),它们避免了在CE和RE模型之间进行易出错的二分决策。这些混合模型会根据研究间异质性的程度自动

按照CE或RE公式行事。此外,它们为支持随机效应公式提供了贝叶斯量化,而不依赖于大样本理论,如常用的Q检验。

研究还表明,FE模型在所检验的零假设上与其他方法有根本不同。在FE模型下,所有研究特定均值都被检验为零,这可以通过将各项独立研究的贝叶斯因子相乘来实现,而其他方法则侧重于检验全局效应,并将个体研究效应视为冗余参数。正如Rouder & Morey(2011)在回应Wagenmakers等人(2011)和Bem(2011)时所指出的,当目标是检验一个共同的全局效应时,通过相乘研究特定贝叶斯因子来汇总跨研究的证据可能会产生不一致的推断。这种不一致性之所以出现,是因为每项研究都是在其自身的参数化下评估的,而这与共享的全局效应无关。例如,当基于小样本的个体研究都产生小效应量时,我们可能会观察到所有独立研究都只有微弱的证据支持零假设,因此将这些贝叶斯因子相乘将产生对零假设的强烈支持。相比之下,使用CE、RE或混合模型的联合分析可能会由于合并数据带来的精度提高,而产生支持非零全局效应的强有力证据。从概念上讲,使用其他方法也可能出现类似的矛盾。例如,研究特定效应的单独置信区间可能都包含零,而全局效应的置信区间(在FE或CE模型下)可能排除零。因此,当兴趣在于检验全局效应时——这通常是元分析应用的主要目标——不应使用基于乘积的FE方法。当研究特定效应定义在不同尺度上(且兴趣也在于联合检验所有单独效应)时,FE模型可能仍然有用,尽管此时应仔细评估,鉴于较大的研究间异质性,合并证据是否具有实质性意义。

最后,由于e值理论的最新发展,已知贝叶斯因子可以转换为保守的p值,同时它们对(通常未知的)过去启动新研究的决策(例如,因为先前研究中的“显著”发现而决定启动新研究)不敏感。因此,贝叶斯因子可用于基于显著性的检验,而不会冒着第一类错误膨胀的风险(与经典p值不同)。这种稳健性尤其相关,因为

即使是看似非序贯的元分析,也往往具有隐含的累积性质。这使得贝叶斯因子成为一种高度灵活的统计检验程序,适用于证据目前尚无定论的元分析。

原文链接:https://arxiv.org/pdf/2511.22535

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
零跑汽车紧急声明:已下线与蔡康永相关的全部内容,并保留追究法律责任的权利

零跑汽车紧急声明:已下线与蔡康永相关的全部内容,并保留追究法律责任的权利

都市快报橙柿互动
2026-10-05 00:27:48
事态升级!蔡康永风波扯出5位港台明星,已不是道德问题这么简单

事态升级!蔡康永风波扯出5位港台明星,已不是道德问题这么简单

孤城落日
2026-10-05 16:53:01
特朗普:我和金正恩相处得很好,若有人拥有112枚核武器,应当与他保持良好关系

特朗普:我和金正恩相处得很好,若有人拥有112枚核武器,应当与他保持良好关系

台州交通广播
2026-10-05 08:37:45
深圳APEC开幕在即,高市称谓被撤!中方拒认“首相级”外交名分

深圳APEC开幕在即,高市称谓被撤!中方拒认“首相级”外交名分

无情有思可
2026-10-05 16:13:32
《兰香如故》大结局:吕蕺儿经商20年重回金陵!许兰香独撑林家濒临绝境,蕺儿携十万两白银救急,两姐妹后巷抱头痛哭:我再也不走了

《兰香如故》大结局:吕蕺儿经商20年重回金陵!许兰香独撑林家濒临绝境,蕺儿携十万两白银救急,两姐妹后巷抱头痛哭:我再也不走了

喵喵的追剧笔记
2026-10-05 19:09:22
广西一处新能源充电站内多名小孩用充电枪荡秋千,客服:严禁该行为,将联系巡查;专家:属高压带电设备,未成年人擅自玩耍有极大安全隐患

广西一处新能源充电站内多名小孩用充电枪荡秋千,客服:严禁该行为,将联系巡查;专家:属高压带电设备,未成年人擅自玩耍有极大安全隐患

极目新闻
2026-10-04 22:59:09
国际乒联最新世界排名:王楚钦第四林诗栋第九,国乒男单无缘前三,松岛辉空升至第一;孙颖莎重回女单第一

国际乒联最新世界排名:王楚钦第四林诗栋第九,国乒男单无缘前三,松岛辉空升至第一;孙颖莎重回女单第一

先锋新闻
2026-10-05 15:17:26
中纪委严厉强调!要求各地哪怕脱层皮,也要一抓到底!

中纪委严厉强调!要求各地哪怕脱层皮,也要一抓到底!

职场资深秘书
2026-10-05 14:17:32
新娘婚礼前两天被马蜂蜇伤,嘴唇肿胀自嘲“像蛤蟆精”,当事人:连夜就医,婚礼如期举行

新娘婚礼前两天被马蜂蜇伤,嘴唇肿胀自嘲“像蛤蟆精”,当事人:连夜就医,婚礼如期举行

极目新闻
2026-10-05 14:00:13
真的辣眼睛!苦命的鸳鸯,在田野里的私会,却是最美的风景吗

真的辣眼睛!苦命的鸳鸯,在田野里的私会,却是最美的风景吗

史海流年号
2026-10-03 15:16:56
央视:“佤邦联合军”副总司令鲍军峰落网画面公开,住所查获大量珠宝豪车

央视:“佤邦联合军”副总司令鲍军峰落网画面公开,住所查获大量珠宝豪车

黄河新闻网吕梁
2026-10-05 16:52:56
苹果让友商怎么活!iPhone 18 Pro系列国内开售不到半月最新销量出炉:很快破250万台

苹果让友商怎么活!iPhone 18 Pro系列国内开售不到半月最新销量出炉:很快破250万台

快科技
2026-10-04 17:28:04
快讯!杨兰兰不简单呀!

快讯!杨兰兰不简单呀!

故事终将光明磊落
2026-10-05 12:55:20
耐克水深火热:取消大中华独立大区,市值蒸发近15000亿

耐克水深火热:取消大中华独立大区,市值蒸发近15000亿

南方都市报
2026-10-05 18:58:05
乔布斯去世15周年,苹果新CEO特努斯发文缅怀:他教会了我们用心对待每一个细节、每一份体验和每一个人,这份教益至今依然指引我们的工作

乔布斯去世15周年,苹果新CEO特努斯发文缅怀:他教会了我们用心对待每一个细节、每一份体验和每一个人,这份教益至今依然指引我们的工作

极目新闻
2026-10-05 22:19:09
出生792万,死亡1131万!2027年,中国人口或将迎来三大巨变

出生792万,死亡1131万!2027年,中国人口或将迎来三大巨变

掠影后有感
2026-10-05 09:20:34
空姐被逼下跪后续!欧某某的面相、T恤被网友吐槽:真是求锤得锤自作自受

空姐被逼下跪后续!欧某某的面相、T恤被网友吐槽:真是求锤得锤自作自受

王老师你还好吗
2026-10-05 14:48:03
“家里钱多的鲍岩板,有个大库房专门装钱,警卫员偷他一千多万都没发现!”缅北电诈覆灭纪实第一集《利剑出鞘》,完整视频来了

“家里钱多的鲍岩板,有个大库房专门装钱,警卫员偷他一千多万都没发现!”缅北电诈覆灭纪实第一集《利剑出鞘》,完整视频来了

都市快报橙柿互动
2026-10-05 19:13:23
市长邀请?蔡康永回应漏洞百出,太平轮旧事被扒,罗永浩遭牵连

市长邀请?蔡康永回应漏洞百出,太平轮旧事被扒,罗永浩遭牵连

揭秘世间万象
2026-10-05 19:31:03
大唐不夜城人均消费一块五引质疑

大唐不夜城人均消费一块五引质疑

热点追踪人
2026-10-05 15:04:00
2026-10-05 22:47:00
CreateAMind incentive-icons
CreateAMind
CreateAMind.agi.top
1610文章数 21关注度
往期回顾 全部

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

头条要闻

高市早苗新内阁遭"当头一棒":日农相丑闻被披露遭围攻

头条要闻

高市早苗新内阁遭"当头一棒":日农相丑闻被披露遭围攻

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永回应漏洞百出,太平轮旧事被扒

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

健康
数码
教育
亲子
时尚

刷酸祛痘,为什么有人翻车?

数码要闻

AMD锐龙AI Max Pro 495亮相 统一内存最高192GB

教育要闻

聪明的父母,大多是“农民思维”

亲子要闻

今天我们来玩一个锻炼反应能力的小游戏

帆布鞋,今年这样穿酷极了!

无障碍浏览 进入关怀版