Bayesian Clustering Factor Models
贝叶斯聚类因子模型
https://onlinelibrary.wiley.com/doi/epdf/10.1002/sim.70350
![]()
摘要
我们提出了一个用于同时进行降维和聚类的新颖框架。该框架基于一类新颖的贝叶斯聚类因子模型。这些模型假设了一种因子模型结构,其中公共因子向量服从高斯混合分布。我们开发了一个吉布斯采样器来探索后验分布,并提出了一种信息准则来选择聚类数量和因子数量。模拟研究表明,我们的推断方法能恰当地量化不确定性。此外,与两种先前发表的竞争方法相比,我们的信息准则在正确选择聚类数量和因子数量方面表现出更优的性能。最后,我们通过一个关于阿片类药物使用障碍康复数据的应用,说明了我们框架的能力,其中对个体进行聚类可能有助于个性化医疗保健。
1 | 引言
我们考虑来自横断面研究的数据,在这些研究中,受试者对一份包含多个(通常相互关联的)评估的长问卷做出回答。在这些研究中,根据受试者的回答对他们进行聚类,可能有助于个性化医疗保健的开发和实施。遗憾的是,将多维大数据集聚类的结果用于医疗用途具有挑战性,因为聚类结果往往难以解释,从而无法提供可操作的信息。过去,研究人员结合主成分分析(PCA)来估计潜在结构,并基于这些结构,使用 k k-means 聚类 [1] 来寻找聚类 [2, 3]。然而,这种 PCA 和 k k-means 的组合(此后称为 PCA+ k k)并未量化参数估计和受试者聚类分配中的不确定性。此外,PCA+ k k依赖于启发式方法来选择主成分的数量和聚类的数量。为了解决这些局限性,我们提出了新颖的贝叶斯聚类因子模型(BCFM),该模型假设聚类发生在潜在空间中,从而为每个聚类提供有意义的解释。我们提出的框架结合了因子模型和高斯混合分布,用于同时进行降维和聚类。
自 1904 年 Spearman 引入因子模型以来 [4],它们已成为多变量数据分析中使用最广泛的统计工具之一 [5-8]。特别是,贝叶斯因子模型——由于其灵活性——已成功开发并应用于多种领域,如组学数据分析 [9-14]、时空数据分析 [15-18]、经济学 [19-21]、金融 [22-24] 和神经科学 [25]。由于观测变量的数量通常远大于潜在因子的数量,因子模型能够实现降维。关于贝叶斯因子模型的详尽文献综述,读者可参考 Lopes 的综述章节 [26]。与其他因子模型类似,BCFM 假设感兴趣的观测变量向量可以写成未知因子载荷矩阵与潜在因子向量的乘积,再加上一个误差向量。
结合多个高斯成分的高斯混合分布已成功用于聚类数据 [27, 28]。在这种背景下,每个成分对应一个聚类,每个观测值以一定的聚类概率属于某个聚类。为了对多变量数据进行聚类,BCFM 假设公共因子向量服从高斯混合分布。这是有益的,因为它允许 BCFM 通过因子模型结构同时进行降维,并通过高斯混合进行聚类。
我们开发了一个用于参数估计、因子数量和聚类数量选择以及受试者聚类分配的推断框架。我们的推断框架使用条件共轭先验,这在纳入先验信息和促进计算方面提供了灵活性。此外,我们提出了一种受单位信息先验 [29, 30] 启发的默认先验超参数选择,允许数据分析人员自动使用我们的 BCFM 框架,而无需具备先验引出的专业知识。我们开发了一种马尔可夫链蒙特卡洛(MCMC)算法 [31-33] 来探索参数的后验分布。具体而言,我们提出的 MCMC 算法是一个基于模型未知量全条件分布的吉布斯采样器。最后,我们提出了一种信息准则,利用 MCMC 输出——在模型选择框架内——选择最优的因子数量和聚类数量。
为了检验我们提出的 BCFM 估计框架的准确性,我们进行了模拟研究。具体而言,为了评估所提出的估计方法的质量和模型的可识别性,我们模拟了两个数据集:一个包含三个因子和四个聚类,另一个包含五个因子和三个聚类。然后我们应用了基于 MCMC 的估计算法,对于这两个数据集,该算法都能够提供接近真实值的参数估计。此外,可信区间的频率学覆盖率高于名义水平。更重要的是,很大一部分受试者被分配到了正确的聚类中。综上所述,这些结果表明我们提出的 BCFM 估计和聚类方法提供了适当的不确定性量化。
为了评估所提出的信息准则在 BCFM 中选择因子数量和聚类数量的质量,我们再次考虑了两种设定:包含三个因子和四个聚类,以及包含五个因子和三个聚类。对于这两种设定中的每一种,我们都考虑了 10 种不同的聚类间分离度设定。对于结合了因子数量、聚类数量和分离度的每一种设定,我们模拟了 100 个数据集,并且对于每个数据集,我们都基于 PCA+ k k、偏差信息准则(DIC)[34] 以及我们提出的信息准则来获得最佳模型——即最佳的因子数量和聚类数量。当与 PCA+ k k和 DIC 进行比较时,使用我们的信息准则进行模型选择在聚类数量和因子数量的选择方面均表现出更优的性能。重要的是,正如直觉所预期的那样,随着聚类间分离度的增加,我们的信息准则在选择聚类数量方面的性能会有所提高。
最后,我们通过一个关于阿片类药物使用障碍康复数据的应用,来说明我们 BCFM 框架的能力,其中对个体进行聚类可能有助于个性化医疗保健。
本文的其余部分安排如下。第 2 节介绍我们提出的贝叶斯聚类因子模型。在第 3 节中,我们提出了一种用于探索后验分布的 MCMC 算法,以及一种用于选择聚类数量和因子数量的信息准则。第 4 节展示了模拟研究的结果,这些结果评估了我们提出的推断程序在估计和模型选择方面的性能。第 5 节通过一个关于阿片类药物使用障碍康复数据的应用,说明了我们 BCFM 框架的能力。最后,第 6 节简要讨论了本文的主要贡献以及未来研究的可能途径。
2 | 模型设定
2.1 | 贝叶斯聚类因子模型
为了引入 BCFM,我们考虑一个多变量设定,其中对 n 个受试者中的每一个都观测了 R 个变量。此外,我们假设这 R 个变量之间的依赖结构可以由数量少得多的 F 个潜在因子来解释。此外,我们假设在这个较小的 F 维潜在空间中,受试者可以被聚类为 K 个聚类。本节描述了所提出的 BCFM,用于执行这种同时进行的降维和聚类。
![]()
![]()
![]()
![]()
2.2 | 先验
在本节中,我们展示了用于 BCFM 数据分析的先验。我们倾向于条件共轭先验,这种先验允许纳入广泛的先验信息,同时能带来直接的计算 [36]。
![]()
![]()
接下来,我们提出一种为聚类均值向量和协方差矩阵选择先验超参数的方法。已经提出了不同的方法用于混合模型中超参数的數據依赖选择 [30, 39-41]。特别地,Steele 和 Raftery [30] 为作为观测数据模型的高斯混合分布开发了单位信息先验 [29]。与 Steele 和 Raftery [30] 的工作类似,我们的提议不假设每个混合成分的均值向量和协方差矩阵具有相同的先验。因此,这种先验选择消除了后验分布多峰性的问题,并 consequently 改善了 MCMC 收敛和标签切换问题。然而,与 Steele 和 Raftery [30] 将高斯混合分布作为观测数据模型的提议相反,在我们的工作中,我们将混合分布用于潜在因子,这使得先验超参数的选择成为一个 somewhat 更困难的问题。
![]()
![]()
3 | 统计推断
3.1 | 后验探索
我们提出一种 MCMC 算法 [32, 33] 来探索 BCFM 参数的后验分布。具体而言,该 MCMC 算法是一个吉布斯采样器 [31],它从参数的全条件分布中模拟抽样。在本节中,我们展示这些全条件分布。
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
3.2 | 模型选择信息准则
在实践中,聚类数量和因子数量是未知的。在本节中,我们提出一种用于模型选择的信息准则,以选择聚类数量和因子数量。
我们提出的信息准则类似于贝叶斯信息准则(BIC)。这与 Roeder 和 Wasserman [43] 开发的将 BIC 用于选择高斯混合分布中成分数量的做法有关。虽然原始 BIC 考虑参数的极大似然估计,但在这里我们遵循 Roeder 和 Wasserman [43] 的做法并使用后验均值。因此,我们提出的信息准则定义为
![]()
信息准则较小的模型更可取。虽然我们的信息准则对大多数数据集效果良好,但对于少数数据集,信息准则可能会指向一个具有空聚类或观测值数量很少的聚类的模型。这可能与 [44] 中关于混合模型后验分布渐近行为的结果有关,该混合模型的聚类数量大于真实聚类数量,但需要注意的是,由于我们对聚类参数使用了不同的先验分布,他们的结果可能不直接适用于 BCFM。为了改善观测值数量很少的聚类的问题,我们将模型视为不可接受,并且如果其某个聚类被推断为观测值数量低于预先指定的阈值,则将其信息准则赋值为 I C = ∞ 。在第 4.2 节中展示的模拟研究和第 5 节中展示的应用中,该阈值均设定为样本量 n 的 5%。正如第 4.2 节中报告的模拟研究所表明的,我们提出的信息准则在指导因子数量和聚类数量的选择方面效果良好。
也可以为 BCFM 开发其他贝叶斯模型选择准则。例如,Lopes 和 West [5] 比较了几种贝叶斯准则在因子模型中选择因子数量的性能,Steele 和 Raftery [30] 比较了几种准则在高斯混合模型中选择成分数量的性能。特别地,Lopes 和 West [5] 发现,用拉普拉斯-梅特罗波利斯估计器 [45] 近似的边缘密度在因子模型中选择因子数量方面效果良好(另见 Prado 等人 [36])。我们对 BCFM 的拉普拉斯-梅特罗波利斯边缘密度进行了一些初步探索,但我们在此提出的信息准则表现要好得多。
4 | 模拟研究
4.1 | 估计的评估
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
总之,我们在第 2.2 节中提出的先验设定,结合我们在第 3.1 节中提出的 MCMC 方法,能够对模型参数进行准确估计,并提供适当的不确定性量化。
5 | 在阿片类药物使用障碍康复中的应用
本节展示了对一个关于阿片类药物使用障碍康复数据集的 BCFM 分析。数据来自“慢性阿片类药物使用缓解——研究康复的环境和社会经济因素”(RECOVER, NCT03604861)研究 [48]。虽然 RECOVER 研究收集了 24 个月的数据,但这里我们关注的是来自第一个时间点的数据,该时间点被称为基线。
我们考虑的数据集包含 n = 348 名参与者,他们拥有来自 R = 13 个变量的完整数据。这些变量包括:主观阿片戒断量表(SOWS)、贝克抑郁量表 II(BDI)、家庭与社会冲突评分、简明疼痛量表(BPI;3 个条目分别代表平均、最严重和最轻微疼痛)、凯斯勒心理困扰量表(K6)、一个关于终生阿片类药物使用障碍药物需求的问题、一个关于戒断信心的问题、12 项简短健康调查(SF-12)的身体和心理健康类别,以及一个与访谈质量相关的问题。回想一下,分层结构约束导致分析依赖于变量的顺序。因此,在此应用中,我们采用与 Shin 和 Ferreira [18] 类似的流程,并基于探索性因子分析对变量进行排序。
为了选择因子数量和聚类数量,我们计算了第 3.2 节中提出的信息准则,针对因子数量从 1 到 5 变化、聚类数量从 1 到 6 变化的模型。表 1 展示了不同聚类数量和因子数量组合下我们的信息准则结果。根据该准则,5 聚类和 4 因子模型是最佳模型。因此,此后我们展示五聚类和四因子模型的结果。
![]()
![]()
![]()
6 | 结论
我们提出了 BCFM,它结合了高斯混合模型和因子模型,用于同时进行降维和聚类。此外,我们开发了一个吉布斯采样器来估计模型的参数。最后,我们提出了一种信息准则,用于联合选择因子数量和聚类数量。
模拟研究表明,我们的 BCFM 框架能够准确估计模型参数。此外,我们比较了我们提出的用于选择因子数量和聚类数量的 BCFM 信息准则,与结合了 PCA+ k k-means 的 Kaiser 准则和间隙统计量(gap statistics)的性能。总体而言,BCFM 对中等分离度(分离度 = 0.5)到分离良好(分离度 = 1.0)的聚类能够正确识别聚类数量。同时,结合了 PCA+ k k-means 的间隙统计量无论分离度如何,都始终低估聚类数量。
我们展示了 BCFM 在阿片类药物使用障碍数据集上的实际可用性。在 RECOVER 数据集中,BCFM 信息准则选择了五个聚类和四个因子作为最佳模型。在这项研究中,大多数受试者被分配到某个聚类的后验概率很高,只有少数参与者在聚类分配上表现出一些不确定性。
未来研究有许多可能的途径。我们目前正在探索的一个途径是将 BCFM 扩展到纵向研究,即对许多受试者的多变量数据进行长期收集。这对于阿片类药物使用障碍康复的纵向研究 [3] 将很有用,并将使研究人员能够通过聚类识别受试者特定的时间轨迹。另一个有前景的未来研究主题是将 BCFM 扩展到混合类型数据。我们注意到 Mo 及其同事 [13] 已经提出了一种用于混合类型多组学数据的贝叶斯稀疏潜在因子模型,并且该工作已被 Sun 及其同事 [14] 扩展以整合通路信息。将这些工作与 BCFM 中公共因子高斯混合的概念相结合,将有助于在每个受试者提供包含二元、计数和连续变量混合的多变量数据集中同时进行降维和聚类。
https://onlinelibrary.wiley.com/doi/epdf/10.1002/sim.70350
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.