阿尔茨海默病(Alzheimer's disease, AD)是一种因大脑细胞代谢异常导致的不可逆神经退行性疾病,属于痴呆症的一种
[1,2]。其临床特征主要表现为记忆力衰退、语言表达困难以及认知功能的下降
[3],严重影响AD患者的生活质量。轻度认知障碍(mild cognitive impairment,MCI)是介于正常老化和AD之间的过渡状态
[4,5]。根据疾病的进展,轻度认知障碍可以进一步细分为早期轻度认知障碍(early mild cognitive impairment,EMCI)和晚期轻度认知障碍(late mild cognitive impairment,LMCI)
[6]。目前AD尚无有效的根治方法,因此早期识别MCI并进行干预,对延缓病情进展为AD具有重要意义。结构磁共振成像(structural magnetic resonance imaging,sMRI)是一种非侵入性成像技术,临床常用于MCI和AD的诊断
[7]。近年来,随着人工智能技术的进步,机器学习与深度学习算法被广泛应用于医学图像数据处理。然而sMRI数据的高维度、小样本特性以及个体间的异质性等特点使得机器学习方法在特征选择和分类性能上面临挑战。如何从复杂的sMRI数据中筛选具有判别力的特征并构建鲁棒的分类模型,一直都是当前研究的核心问题。为此,本研究基于sMRI数据和患者临床信息特征[年龄、性别、教育水平、简易智力状态检查(mini-mental state examination,MMSE)评分],提出两种基于动态阈值调整的特征选择方法:基于动态阈值调整的L1正则化(L1-dynamic threshold filtering strategy,L1-DTFS)特征选择法和基于动态阈值调整的梯度提升决策树(gradient boosting decision tree-dynamic threshold filtering strategy,GBDT-DTFS)特征选择法,并与逻辑回归(logistic regression, LR)、Transformer这两种分类算法结合,构建预测模型。
1 材料与方法
1.1 数据来源
本研究数据来源于美国阿尔茨海默病神经影像计划(Alzheimer's disease neuroimaging initiative, ADNI)数据库(
http://adni.loni.usc.edu/)。研究对象为编号4 018~5 210的543例受试者,根据ADNI标准,研究对象被分为四组:认知正常组(normal controls, NC)139例、EMCI组220例、LMCI组108例和AD组76例。为使分类更精确,以准确识别疾病发展阶段,本研究将NC、EMCI、LMCI和AD四组样本进行两两配对组合,将原有的四分类问题转化为二分类任务,具体包括NC-EMCI(“-”表示NC组与EMCI组分类,下同)、NC-LMCI、NC-AD、EMCI-LMCI、EMCI-AD以及LMCI-AD 6个分类组。
1.2 数据预处理及增强方法
1.2.1 结构磁共振成像数据采集与预处理
本研究选用ADNI数据库中通过Philips 3.0T MRI设备采集的sMRI图像,成像参数具体如下:TR 6.8 ms,TE 3.1 ms, FA 9°,FOV:RL 204 mm、AP 240 mm、FH 256 mm,层厚1.2 mm,层数170,体素1 mm×1 mm×1.2 mm。将原始图像通过Freesurfer神经影像分析平台(版本4.3.0)进行标准化预处理,包括空间标准化、图像平滑处理、脑区分割及强度调制等步骤。经处理后,每例受试者的脑结构特征量化为272个形态学指标,具体包括:69个皮层体积(cortical volume,CV)、16个海马亚区体积(hippocampal subfield,HS)、49个皮层下体积(subcortical volume,SV)、68个皮层厚度(cortical thicknesses,CT)以及70个皮层表面积(surface area,SA)。
1.2.2 数据标准化与类别不均衡处理
针对sMRI影像特征的尺度差异,采用Z-score归一化对272个sMRI特征进行标准化,以消除量纲影响并提高模型稳定性。由于LMCI及AD患者样本量较少,类别不均衡可能降低模型对少数类的识别能力。本研究采用合成少数类过采样技术(synthetic minority over-sampling technique,SMOTE)进行数据增强,通过在少数类样本空间内生成合成样本,扩展数据规模,确保分类模型在少数类上的识别能力,同时避免随机过采样带来的数据冗余,提高模型的泛化能力
[8,9]。SMOTE通过插值方法扩展少数类样本,首先构建少数类样本集:利用
k近邻(
k-nearest neighbors,
k-NN)方法,为每个少数类样本找到5个最近邻。随机选取一个近邻样本,计算其与当前样本的特征向量差异。通过线性插值公式生成合成样本:
其中,Xnew 为生成的新合成样本的特征向量,Xori 为少数类样本集中的一个原始样本的特征向量,Xnn 为从Xori 的K近邻中随机选取的特征向量,θ为(0,1)区间内的随机数,确保新样本均匀分布在原始样本的特征空间范围内。重复上述过程,直至少数类样本数量达到目标扩充比例,使数据集在类别分布上趋于均衡。本研究中SMOTE处理前,6组二分类任务NC-EMCI、NC-LMCI、NC-AD、EMCI-LMCI、EMCI-AD和LMCI-AD的样本数分别为359,247,215,328,296和184。经SMOTE处理后,分别为440,278,278,440,440和216,以此来匹配各组二分类任务中的最大类样本量。
1.3 数据集划分与交叉验证
为构建稳健的预测模型,本研究将总体数据集按80%∶20%的比例随机划分为训练集与测试集。为增强模型评估的可靠性,在训练集上采用5折交叉验证进行模型训练与参数调优。即在每一折中,将训练数据进一步划分为4份用于训练,1份用于验证,循环5次以确保所有训练数据均参与验证。该策略有助于更准确地评估模型泛化能力,并避免过拟合。
1.4 L1-DTFS特征选择法与GBDT-DTFS特征选择法
在机器学习与深度学习建模中,高维特征可能导致计算复杂度增加和维度灾难。特征选择可降低数据维度,提高模型泛化能力和计算效率
[10,11]。本研究提出两种基于动态阈值调整的特征选择方法:L1-DTFS和GBDT-DTFS。两者均属于嵌入式方法,L1-DTFS通过L1正则化筛选稀疏特征,GBDT-DTFS依赖GBDT评估特征重要性。为优化特征选择效果,本研究引入基于特征重要性分布的动态阈值调整策略。
1.4.1 L1-DTFS特征选择
L1-DTFS通过在损失函数中加入L1范数惩罚项,使得部分特征的系数收缩至零,从而实现特征选择。其目标优化函数定义如下:
其中,j为特征的索引,m为特征的总数量,为样本属子正类的预测概率,为模型系数问量,为正则化系数。训练完成后,可通过系数绝对值衡量特征的重要性:
进一步进行最大归一化处理(映射到[0,1]范围):
然后设定动态阈值,(其中为为可调参数,本研究取0.5),最后保留重要性超过动态阈值的特征。
1.4.2 GBDT-DTFS特征选择法
GBDT-DTFS依赖GBDT评估特征重要性。GBDT通过多棵决策树的加权组合构建强分类器,每棵树的特征分裂贡献可用基尼指数或信息增益衡量特征重要性
[12]。本研究先利用网格搜索优化GBDT超参数,并根据训练所得的特征重要性进行筛选,其计算公式为:
其中,表示第个特征在第棵树中的重要性贡献,为总决策树数。最后,同样结合动态阈值调整策略进行特征筛选。
1.4.3 动态阈值调整策略
为了提高特征选择的自适应性,本研究提出了一种基于特征重要性分布的动态阈值计算方法。设某一特征集的重要性度量值为,则动态阈值定义如下:,其中,为特征重要性的均值,为标准差,为调节因子。当取值较小时,更多的特征会被保留;反之,当取值较大时,仅保留最重要的特征。此方法确保特征选择的动态性,避免固定阈值带来的局限性。本研究中,是基于初步实验在多个分类任务中取得的平衡点。为进一步验证其合理性,本研究比较了范围内模型性能变化,结果显示在多数任务中表现稳定。
本研究数据分析及分类模型算法实现均基于Python 3.9环境开发完成。
1.5 两种分类模型区别每组分类中的不同病程阶段
本研究通过Transformer和LR两种模型对数据样本识别比较。将两种特征选择方法筛选出的最优特征子集与4项人口学指标共同输入LR和Transformer模型,分析比较两种模型与两种特征选择方法结合后对各病程的分类效果。
1.5.1 LR模型
逻辑回归是一种经典的线性分类模型,特别适用于二分类问题。该模型通过寻找最优的决策边界来实现类别划分
[13,14]。相较于深度学习模型,逻辑回归具有训练效率高、模型解释性强的显著优势,尤其在数据规模有限的情况下,其分类性能往往更为优异
[15]。其假设函数为:
,其中,
P为给定输入特征X时样本属于正类的概率,
为输入特征向量,
为权重向量,
为偏置项,
为sigmoid激活函数。逻辑回归的损失函数通常采用对数损失(Log Loss):
其中,为真实标签,为预测概率,为样本数,L为模型的对数损失,i为样本的索引。
1.5.2 Transformer模型
Transformer依赖自注意力机制建模长程依赖关系,自适应分配特征权重,提升分类准确性与鲁棒性
[16]。相较于传统机器学习及卷积神经网络(convolutional neural network,CNN),Transformer模型凭借其强大的全局特征提取能力,突破了局部感受野的局限,并通过多头注意力(multi-head self-attention, MHSA)动态聚焦关键特征,从而显著提升了模型的泛化性能
[17]。此外,Transformer无需固定特征排列,结合层归一化和残差连接提升训练稳定性,使其在医学数据上表现更优。
Transformer编码器由多个相同的编码器层叠加组成,每个编码器层主要包含两个核心子层:多头注意力(multi-head self-attention, MHSA)与前馈神经网络(feedforward neural network, FNN)。MHSA的单头注意力输出为,其中,分别代表查询、键和值,为输入特征的维度。它计算特征间的相关性权重,自适应地调整不同结构性特征的重要性。多头机制并行执行多个这样的注意力计算,使模型能够同时关注来自不同表示子空间的信息,从而增强其全局建模能力。FNN是一个应用于每个位置上的独立且相同的两层全连接网络,对自注意力层输出的特征进行非线性变换和细化为,该层为模型引入了关键的非线性表达能力。为了确保训练过程的稳定与高效,每个上述子层(MHSA和FNN)的输出均会进行以下操作:首先,将子层的输入通过一个残差连接与其输出相加;随后,对相加的结果进行层归一化。这种“残差连接+层归一化”的设计有效地缓解了深层网络中的梯度消失问题,并加速了模型收敛。本研究中Transformer编码器层数为6,多头注意力头数为8,隐藏层维度为512,前馈神经网络维度为2048,使用层归一化和残差连接,丢弃率为0.1。
本研究将高维sMRI数据特征输入Transformer编码器,利用自注意力机制计算特征间的全局相关性。通过多层Transformer编码器提取全局特征表示,并将其传递至全连接层。使用全连接层及Softmax(柔性最大值)激活函数计算最终分类概率。采用交叉熵损失函数进行优化,训练过程中使用AdamW优化器(Adam with weight decay),并结合早停策略防止因数据量小导致过拟合。
1.6 分类效果与评价
本研究将准确率、敏感度、特异度和受试者工作特征曲线(ROC)下的面积(area under curve,AUC)作为分类结果的评价指标。其中,AUC值作为衡量模型区分能力的重要指标,当其大于0.9时,通常认为模型具有较高的分类效能和临床应用价值
[18,19]。
2 结果
2.1 特征选择结果
L1-DTFS特征选择法对于NC-EMCI、NC-LMCI、NC-AD、EMCI-LMCI、EMCI-AD、LMCI-AD分别筛选出141,100,54,121,82,92个重要特征。特征选择结果按其对分类组贡献度的大小进行排序,各组贡献度最高的10个特征具体见
表1。GBDT-DTFS特征选择算法对于NC-EMCI、NC-LMCI、NC-AD、EMCI-LMCI、EMCI-AD、LMCI-AD分别筛选出55,57,29,59,28,36个重要特征。按重要性排序靠前的前10项最重要特征如
表2所示。本研究发现基于两种特征选择方法得到的重要特征集呈现显著重叠,但就单个重要特征而言,其在两种特征选择方法下的重要性排序却不同。两种特征选择方法所确定的重要特征,主要集中于边缘系统及颞叶区域(包括海马体、海马下托、内嗅皮层和杏仁核等),此外颅内体积也被识别为关键特征之一。为验证L1-DTFS与GBDT-DTFS两种特征选择方法的有效性,本研究将其与经典特征选择方法:随机森林(random forest,RF)、递归特征消除法(recursive feature elimination,RFE)在相同数据集上进行比较。结果显示,L1-DTFS与GBDT-DTFS在多数分类任务中筛选出的特征子集使其下游分类模型(Transformer模型与LR模型)获得了更优的分类性能。如
表3所示,将不同特征选择下最优模型的AUC值进行对比,结果显示:L1-DTFS与GBDT-DTFS两种特征选择方法在多数分类任务中的AUC值更高,总体效能更好。
2.2 模型预测结果
本研究对272项sMRI数据经过两种特征选择后筛选出最优特征子集,将各组中优势特征子集与3项人口学指标及MMSE评分共同输入训练好的LR模型、Transformer模型,比较不同模型在测试集中对各病程的分类效果。年龄、性别、受教育程度3项人口学指标及MMSE评分数据见
表4。结果表明,所有模型均表现出良好的分类性能,但分类难度在不同任务间存在差异。各组最优模型及其性能指标见
表5。其中NC与LMCI组是区分度最高的任务。L1-DTFS特征选择下的Transformer模型取得了最佳性能,准确率达到100%,AUC值高达1.00。这表明模型具有极高的临床鉴别能力。对于NC与AD分类,L1-DTFS特征选择下的LR模型展现出较高的特异度(100%),确保NC组被准确识别,但其相对略低的敏感度(97.14%)提示一部分AD个体可能被遗漏。在区分NC与EMCI这一极具挑战性的分类任务中,基于L1-DTFS特征选择的Transformer模型取得了78.41%的准确率和0.79的AUC值。EMCI与LMCI这一分类任务旨在区分同一疾病谱系内两个连续的早期阶段,难度较大。L1-DTFS特征选择下的LR取得了最优结果,准确率为84.09%,AUC为0.92,它的准确率与AUC值都相对比较低。EMCI与AD分类是区分早期阶段与终末阶段,GBDT-DTFS特征选择下的Transformer模型表现最优,准确率为93.18%,AUC值为0.91,特异度略高于敏感度,说明模型在确认AD患者方面稍优于排除EMCI患者。LMCI与AD分类,L1-DTFS特征选择下的Transformer模型再次表现优异,准确率为95.45%,AUC值为0.95,敏感度与特异度相等,表明模型在两类错误上达到平衡,客观反映了这两个阶段在脑结构特征上的连续过渡性。总体来看,LI-DTFS特征选择与Transformer模型这种组合是最优组合模型,它在3组二分类任务中均被选为最优模型。
3 讨论
本研究不仅揭示了AD病程进展中的关键病变部位,还通过机器学习算法量化了各特征的重要性排序,进而明确了皮层厚度、海马体积等具体影像学指标对疾病发展的影响程度。结果表明,通过特征选择获得的最优特征子集主要集中于边缘系统和颞叶区域,其中海马、海马亚区及杏仁核等边缘系统关键结构尤为突出。这一空间分布特征提示上述脑区可能是AD患者的关键病理敏感区域。内嗅皮层作为海马体与新皮质之间的关键枢纽,是AD病理最早累及的区域之一,其萎缩与tau蛋白的早期沉积密切相关,这解释了其在多项分类任务中均被识别为关键特征的原因。海马体及其亚区(如海马下托)的体积变化是AD相关记忆障碍的核心影像学标志。杏仁核的受累则可能与AD患者常见的情感和行为症状有关。无论是L1-DTFS还是GBDT-DTFS特征选择算法,颅内体积都是比较重要的特征,如
表1所示,用L1-DTFS特征选择时,NC-EMCI、NC-LMCI、NC-AD这三组分类中,颅内体积均是重要特征。用GBDT-DTFS特征选择时,NC-EMCI、NC-LMCI这两种分类任务中,颅内体积也是重要特征。以往研究也证明MCI和AD患者常会出现神经元与突触丢失,从而导致了脑萎缩现象
[20,21]。内嗅皮层作为海马体和新皮质之间的桥梁,在记忆的形成和提取中起重要作用,它还参与时间信息的编码,帮助记忆事件的时间顺序。AD患者内嗅皮层早期受损出现记忆和导航功能下降
[22-24]。本研究两种特征选择方法筛选出的前10项特征均包含内嗅皮层指标,内嗅皮层的表面积、体积、厚度在AD病程发展中都发生了显著变化。GBDT-DTFS特征选择在NC-LMCI、NC-AD两组分类任务中筛选出的重要特征中海马体处于较前位置,说明海马体在NC与LMCI以及AD患者间存在较大差异。有研究发现AD和MCI患者的海马体发生显著变形,海马多变量形态测量统计(MMS)可用作个体水平AD早期诊断的敏感成像生物标志物,海马作为大脑边缘系统的重要组成部分在认知和记忆中起关键作用
[25]。
本研究在方法学上进行了多项创新性改进,显著提升了模型的性能表现。首先,针对数据不平衡问题,本研究引入了SMOTE算法,通过生成高质量的合成样本,使少数类别的样本量提升至接近多数类别的水平,有效解决了类别不平衡问题
[26,27]。比如在NC-EMCI分类任务中,使用SMOTE后,Transformer模型的敏感度从约70%提升至78.68%,AUC值从0.71提升至0.79。其次,在特征选择方面,本研究对GBDT算法进行了优化改进。通过动态调整特征选择阈值,使模型能够更灵活地筛选出对分类任务最具贡献的特征子集。这种动态调整机制克服了传统固定阈值方法可能导致的特征遗漏或冗余问题。通过筛选出最具代表性的特征,不仅降低了模型的复杂度,还进一步提升了模型的泛化能力
[28]。此外,本研究创新性地将Transformer模型引入AD病程分类任务中。Transformer模型凭借其强大的序列建模能力和并行计算优势,在多个领域都取得了突破性成果
[29-31]。本研究充分利用Transformer的自注意力机制,使其能够有效捕捉特征之间的长距离依赖关系,例如,AD相关的萎缩涉及多个脑区(如海马体、内嗅皮层、后扣带回等)的协同变化,传统CNN难以捕捉这些分布区域的复杂关系,而Transformer的自注意力机制可自然捕捉这些长程关系。
且本研究对MCI阶段细分为EMCI与LMCI,不仅提高了疾病分期的精确性,还为早期干预、生物标志物开发和临床试验优化提供了重要支持。本实验对6组分类任务均取得了较高的分类精度和准确率。Alorf等
[32]使用堆叠稀疏自动编码器(SSAE)网络对NC-AD组的分类准确率为90.89%。Tang等
[33]研究者通过提取海马体和杏仁核的形态学差异特征,并结合异性分数值作为分类指标,在基于支持向量机(SVM)的AD与NC的分类实验中,达到了96.4%的高准确率。而本实验在NC-AD组的分类准确更是达到了98.57%。特别值得注意的是,在更具挑战性的NC-LMCI组分类任务中,我们的最优模型展现出了卓越的性能,其分类准确率、精确度和敏感度均达到100%,同时AUC值也达到1.00的满分水平。这一系列指标均超越了同类研究的性能表现
[34]。
但本研究也存在一定的局限性,例如对于NC-EMCI组的分类准确率低。这可能由于NC与EMCI之间界限相对模糊,特征存在一定重叠。相比之下,NC与AD的差异较为明显,sMRI、MMSE评分等方面的特征明显不同,因此分类效果更好。同理,NC和LMCI之间的区分也比EMCI与LMCI更为显著。为进一步提升模型的泛化能力和预测精度尤其是NC-EMCI和EMCI-LMCI两组的分类精度,后续研究将整合多模态数据,包括正电子发射型计算机断层显像(PET)、功能磁共振成像(fMRI)以及脑脊液生物标志物检测等
[35,36],并通过扩大样本量来优化分类器性能。当然未来也会开发更高效的Transformer变体,来适应医学数据有限的特点,同时推动临床试验,验证算法在真实医疗环境中的效用。
山西省留学回国人员科技活动择优资助项目(619017)
山西省重点研发计划国际合作项目(201803D421068)