机器学习是一种主要依靠机器算力解决问题的科学方法,包括支持向量机、多层感知机和深度学习等,具备高精度、高效率和高泛化性等优点,目前广泛应用于医学领域的生产和科研实践中
[1-3]。同时,医院日常工作产生的医疗数据具有维度高、模态多、数量大的特点,符合机器学习对数据的要求
[4-5]。以ChatGPT为代表的预训练大模型的成功,从实践的角度证明了海量丰富的高质量数据有利于机器学习模型向更高精度和泛化性的方向优化
[6-7]。但数据隐私保护的实施将限制各大医院之间的数据交流,制约机器学习模型的大规模、多种类、高深度的训练
[8-9]。联邦学习作为一种保护隐私的多中心数据学习方式,获得了广泛的关注
[10-13]。联邦学习一般是将在不同医院数据训练的局部模型汇聚到中心服务器进行加权平均聚合,得到一个新模型的更新方法(
图1)。这种聚合过程并不涉及私人数据的传输,从原理上杜绝了隐私泄露的风险。随着研究的深入,研究人员发现如果不同中心数据的分布有较大差异,可能会对联邦学习的学习性能产生不利影响。这种数据分布差异巨大的情况,被称为非独立同分布。通过学习具有不同种类、模态和质量等因素的数据,不同的局部模型参数可能差异巨大,经由联邦学习聚合得到的新模型并不能有效解决具有不同分布数据产生的问题
[14-15]。如综合医院的诊断经验并不能完全适用于专科医院,最大的原因在于综合医院的疾病分布与专科医院的差异较大。针对非独立同分布数据对联邦学习聚合出的模型性能造成的不利影响,研究人员提出个性化联邦学习的思路
[16-18]。个性化联邦学习的主要思想是通过提取多中心数据的共同信息,融合到局部信息中,更新得到符合本地局部数据分布的个性化模型
[18]。相比传统联邦学习,个性化联邦学习在解决非独立同分布数据的问题时,更具优越性。在现实的医疗场景中,个性化联邦学习更具有可行性,原因在于不同中心的医疗数据分布会随着设备参数、病例类型、医师水平等因素的差异而变化
[19-20]。如南方医院因患者的生活习惯、医院的设备参数以及医师的治疗手段不同,与北方医院的某些医疗数据分布差异较大
[20-22]。
1 个性化联邦学习的基本概念及主要算法
1.1 基于联邦学习的个性化延伸
联邦学习从特征角度可以分为纵向联邦学习
[23]和横向联邦学习
[24],其中纵向联邦学习是指所有参与学习的医院所提供的数据维度不完整,只有所有医院数据集合在一起才是完整的数据。与纵向联邦学习不同,参与横向联邦学习的医院拥有患者的完整数据。目前隐私保护多是针对医院之间的数据交流进行限制,故医学领域现实场景较多且研究较深入的是横向联邦学习
[9]。横向联邦学习最为经典的算法是对参数进行加权平均聚合,即FedAvg,具体的实现方式为:
其中
表示第
个用户参与联邦学习时,通过该用户本地数据训练出来的最优模型参数;
表示第
个用户的数据量;
表示通过
个用户的局部最优模型聚合之后得到的最终模型参数
[25]。这种方式可以有效整合不同中心医院数据的共同信息,但可能会造成各中心医院特有的信息被忽视。因此,当参与联邦学习的中心医院之间的数据差异较大时,单纯地对模型参数进行加权平均聚合,可能忽视它们之间的特有信息。研究人员提出根据数据的分布特点,个性化聚合不同模型的参数,既能整合公共知识,又能根据医院的特点制定个性化聚合模型
[16-18],实现模型的更高性能,其通用表达式为:
其中,
和
分别是本地模型在第
个用户的数据中进行训练得到的最优参数的公共部分和个性化部分;
和
分别表示公共部分模型参数的聚合方法和个性化部分模型参数的聚合方法;
和
分别表示属于第
个用户的个性化模型聚合之后的公共部分参数与个性化部分参数,个性化联邦学习过程示意见
图2。
通过研究不同的聚合方法和,可以改善公共信息和局部信息的提取及聚合能力。目前,研究人员多采用平均、对齐、聚类等方法来改善个性化模型的公共信息提取能力,并且通过保留更新、选择性更新和正则化等方法增强个性化模型的局部信息学习能力。
1.2 个性化联邦学习的主要方法
对于传统联邦学习模型在参与者之间的数据差异较大时表现不佳的问题,Arivazhagan等
[26]针对深度学习模型提出,通过加权平均聚合模型的表示层参数,保留模型对公共信息的提取能力,并且不聚合分类器层参数,以提高模型对局部信息的感知能力,这种个性化聚合模型的方式较为简便,但无法调节个性化程度,不能适配数据分布差异不大的情况。Hanzely和Huang等
[27-28]针对可调节的个性化参数提出模型聚合的正则化方法L2GD和FedAMP,其主要的表达式为:
其中,
为正则化项的超参数,用于调节模型参数更新的幅度。上述两方法分别选择不同的函数限制个性化模型之间的参数差异,即允许个性化模型之间根据本地数据差异,发生小范围的波动。在尽可能多地保留公共信息的同时,保留个性化模型对局部信息的感知能力。正则化方法相对简单,同时具有调节能力,但其仅关注个性化部分,削弱了对公共信息的提取能力,并且两者计算复杂度较大,限制了联邦学习的拓展性。Dinh等
[29]将全局信息植入到正则化项中提出pFedMe,使局部模型在本地数据中更新时尽可能不偏离全局信息,其表达式为:
其中,
是带有本地信息的个性化模型参数,而
是带有全局信息的参数。与L2GD和FedAMP相比,此种方法对算力资源消耗较小,拓展性较强,但该方法将所有参与联邦学习的数据信息纳入正则化选项,个性化模型存在被“误导”的可能,稳定性不够。Wang等
[30]提出rFedAvg,通过不同客户之间的样本在希尔伯特空间映射后的正则化对齐,实现聚合模型更高精度和泛化性。但这种方式可能违反联邦学习的数据保护的原则。不同于正则化的方法,Ghosh等
[31]基于聚类的方式提出IFCA,即对参与联邦学习的每个用户在本数据下的
个公共模型中获得的最小损失进行聚类,每一轮更新均以所得最小损失模型参数为起点进行更新,获得
个个性化模型。该方式有利于个性化模型学习全局信息,并且局部信息也能在一定范围内保留,但其对资源的消耗较大,非常占用网络传输资源,局部模型的反复更新也会较多地消耗本地算力,不利于实际部署。Lu等
[32]提出OCFL,通过计算不同客户端之间本地模型的余弦距离进行聚类,而后将聚类中心的模型参数发送至对应的客户端,实现高适用性和泛化性的个性化聚合。该方法最大的问题在于聚类中心之间没有交流,部分聚类中心可能会与实际分布出入较大。Morafah等
[33]则是提出FLIS,通过每一客户返回的本轮局部模型,计算位于服务器的共享数据集结果,而后通过这些结果对本轮局部模型进行聚类,在同一类别下进行加权平均聚合。该类聚合方法克服了参与联邦学习人数较少时聚类偏倚较大的问题,但极大地提高了服务器的计算成本,同时位于服务器的数据集质量直接决定聚类聚合的效果。Long等
[34]则提出FeSEM,即在服务器端直接对模型进行聚类,而后在多轮次聚合过程中,通过发送某一聚类中心的模型,使随机期望最大化,并逐渐收敛,得到最接近该客户局部数据分布的个性化模型。该方法在参与联邦学习的客户较多时具有较大优势,但客户数量较少时难以聚集出有效的聚类中心。Chen和Chao
[35]提出FedRoD,通过定义新的损失函数对齐模型参数,并且在对齐参数的基础上,模型中的判别器进一步学习符合本地数据分布规律的局部信息。该方法在各参与联邦学习的数据类别分布不均时效果较好,并且算力资源消耗较小,利于部署,但是其对各数据的分布规律依赖较强,导致其对占总体样本少数的类别数据忽视较为严重,对于重视模型特异性的领域,如罕见病的诊断、局部影像异常识别以及治疗方案的精确制定等方面不适用。Wang等
[36]提出FedABC,即通过将多分类任务转换成多个二分类任务,之后使用二分类交叉熵尽可能保证二分类类别一致,从而减弱标签偏移带来的对联邦学习聚合模型的影响。在类别数量较少的情况下,该方法有利于实现类别之间的平衡,提高模型精度。但多分类任务转为多个二分类本身会造成极度的类别比例失衡,影响聚合模型性能。Mclaughlin和Su
[37]则是提出FedLDA,通过减小表示器输出的局部数据特征分布差异性,对齐不同分布数据训练下的表示器参数,之后通过输出的特征分布,个性化聚合分类器。该方法精度和泛化性能较好,但各局部数据的特征在客户端之间传输,牺牲了数据的隐私安全,
表1是对上述几类算法的总结。
表2是以上所述的部分算法在二分类任务中,不同数据分布时,聚合模型最终精度的对比结果。其中,λ表示数据两个类别在数据中的比例。可以发现,当两个类别平衡时(λ=1),FedAvg算法表现良好,但数据中的两个类别比例失衡时,个性化联邦学习算法的表现明显优于传统联邦学习。
2 医学数据在联邦学习的应用
2.1 多中心医学数据在联邦学习的应用
在诊断疾病时,医师往往需要结合核磁等影像模态、超声等时序模态以及病例等文本模态的数据进行确诊,体现医学数据的模态多样性。临床上详细的病例资料、高精度的成像检查以及繁多的检查化验项目,表明医学数据的空间维度大。而医学数据模态多、维度大的特点,决定了数据的数量和多样性对训练机器学习模型有重大影响。但当前的医疗水平并不能实现从单个医院收集到足够多的数据,充分训练机器学习模型
[38]。同时,公众对隐私保护的重视,在时间和经济成本上,提高了多中心医疗信息的交流门槛。因此,联邦学习以其降低多中心数据信息交流成本,逐渐走进医疗研究人员的视野。
Sheller等
[39]研究了参与联邦学习的医学中心数量对于生物标记物的诊断和预后模型最终性能的影响,结果支持参与联邦学习用户数量越多,各中心获得的收益越大。Rønn Hansen等
[40]通过联邦学习模型,在确保多中心数据隐私的前提下,实现了对喉癌患者的分层Cox回归生存分析。Jiménez-Sánchez等
[41]利用多中心数据可以富集罕见病例的优势,通过联邦学习训练性能较好的能够鉴别X线成像的乳腺癌模型。Wang等
[42]利用联邦学习保护隐私的优势,对隐私程度较高的单细胞RNA序列进行分类训练,该模型性能不亚于集中式学习的模型性能。Truhn等
[43]深入优化联邦学习隐私保护的机制,对高度隐私的影像和病理数据中癌症分类模型进行训练,在确保数据安全的同时,获得性能优异的分类模型。Huang等
[44]考虑到各大药理机构的药理数据隐私保护和知识产权问题,使用联邦学习的方式,在多方协作下促进了新型药物的发现过程。Kassem等
[45]通过半监督场景下的联邦学习,在少量标注的情况下,实现更高性能的手术相位识别模型,降低了联邦学习的大规模推广的门槛。这些研究表明,联邦学习拥有不亚于集中式学习的学习能力,并且可以应用到医学行业的多个领域。但在遇到多中心数据分布差异性较大的情况时,传统联邦学习的模型性能将大打折扣。
2.2 非独立同分布数据在个性化联邦学习的应用
传统的联邦学习能够降低多中心医学数据的交流门槛,但多中心数据因其疾病种类分布不均、医院设备参数差异以及医师诊疗水平不同等问题,造成各中心数据的分布具有差异,即非独立同分布数据
[11,17]。这种数据将会对传统的联邦学习模型效能产生不利影响,而当前主要通过个性化联邦学习的方法减轻了这类问题对联邦学习性能造成的影响。
Chen等
[46]通过循环知识蒸馏的方式,实现联邦学习的个性化生理活动监测模型的训练,即使用训练到一定程度的局部模型参数引导其他局部模型更新,从而将该训练到一定程度的模型所包含的局部信息,通过模型引导的方式传递给其他模型,在保证了本地信息的安全性前提下,提高了其流动性。相较于传统的联邦学习方法,这一方法保存了更多的局部信息,实现更优的模型性能和更高的保密程度。Peng等
[47]在考虑到不同国家和地区数据异质性较大的可能性下,分别通过对比集中式学习、传统联邦学习(FegAvg)和3种个性化联邦学习(FedAMP、FedProx、FedBN),对42家美国和欧洲医院的新冠肺炎影像数据进行训练,实验证明联邦学习的可行性,FedAvg的优势在于其泛化能力较强,这可能与其主要聚合全局信息有关
[48]。而在聚合数据异质性较强的数据时,以FedAvg为代表的传统联邦学习方法局限性便凸显出来,这种模型主要聚焦于数量较大的类别,个性化联邦学习则在其内部验证上取得了比较良好的结果,在实验上验证了个性化联邦学习优于传统联邦学习方法。Wicaksana等
[48]将模型拆分为特征提取器和分类器,其通过将本地特征提取器的参数与全局模型的特征提取器参数尽可能对齐,在保留本地模型的局部信息的基础上,尽可能保留全局信息,从而增强其泛化能力。同时,作者保留分类器参数不参与联邦聚合,使模型的分类器能够很好地适应本地数据的分布,提高了模型在本地数据上的精度,并在多源的前列腺癌和皮肤病数据上进行了验证。Tarumi等
[49]通过可解释性的协变量调整方法,首先在先验的联邦学习基础上,获得一个代表客户间协变量变化的倾向评分模型,然后根据估计的倾向评分对每个训练样本的个性化模型的贡献进行加权。实现个性化电子病历住院死亡率预测模型,既达到了优秀的准确性,又实现了对预测模型的解释。目前医疗领域个性化联邦学习有待更加深入的研究。
2.3 医学场景下的个性化联邦学习前景展望
当前正值人工智能从实验室走向实际应用的关键时间节点,医疗作为高度程序化的行业,借助人工智能技术实现诊疗向着更高质量、更高效率和更低成本的方向发展是该领域的必然选择
[38]。但人工智能技术面对高维度、多模态和大体积的医疗数据时,离不开充分且丰富的数据进行训练。联邦学习技术便是联通因数据隐私保护而形成的信息孤岛间的桥梁,其中个性化联邦学习技术优化了孤岛之间信息交流的方式,使得联邦学习技术更加贴近真实场景。同时,随着模型精简更新技术的发展
[50]、弱监督和无监督技术的优化
[51]以及大小模型协同训练技术的进步
[52],个性化联邦学习技术将向网络资源、专家资源和计算资源受限的地区覆盖,以减轻国家和社会医疗资源不平衡的问题。随着生物信息技术的发展,医学研究也将向着高维度、大容量和高成本的方向发展
[53],各大医院和研究所对于医学数据的研究将向算力倾斜,彼此交流也将更加密切,个性化联邦学习在降低交流成本的同时,在获得更优研究成果方面有更广阔的前景。
3 结语
本文概述了联邦学习和个性化联邦学习的优势与不足,并在理论层面上对个性化联邦学习的一些主要方法进行比较分析,梳理了这些方法的优缺点,为个性化联邦学习在医学场景中的应用做出理论分析、案例列举以及前景展望。我们对个性化联邦学习在医疗场景中应用持积极态度,不仅在于该方法能够低成本,打破各大医院之间因隐私保护造成的数据孤岛困局,更在于其在高效率收集数据、低成本分析数据和更密切交流数据上有着明显优势。
国家自然科学基金项目(62302522)