基于特征融合的神经影像数据分类模型

李修军 ,  王圆圆 ,  葛雄心 ,  杨菁菁 ,  佟丹

吉林大学学报(工学版) ›› 2026, Vol. 56 ›› Issue (5) : 1407 -1417.

PDF (3378KB)
吉林大学学报(工学版) ›› 2026, Vol. 56 ›› Issue (5) : 1407 -1417. DOI: 10.13229/j.cnki.jdxbgxb.20241229
计算机科学与技术

基于特征融合的神经影像数据分类模型

作者信息 +

Neural image data classification model based on feature fusion

Author information +
文章历史 +
PDF (3458K)

摘要

为了解决三维卷积神经网络(3D CNN)在神经影像数据分类预测中难以捕捉数据全局特征的问题,引入有效建模全局关系的多层感知混合器(MLP-Mixer),提出了一种基于特征融合的混合模型,通过结合3D CNN和MLP-Mixer的优势,提高对神经影像数据的分类性能。首先,在特征提取阶段,将3D CNN用于从静息态功能性磁共振成像(rs-fMRI)数据中提取局部空间特征,将MLP-Mixer用于捕捉全局关系特征;其次,在融合分类模块,采用缩放点积自注意力技术结合空间特征和全局关系特征,动态地权衡和整合不同特征的重要性,增强模型的表达能力,并通过全连接层完成分类任务。实验结果显示,该混合模型在处理神经影像数据的二分类和多分类任务时,分类准确率分别提高了4.12%和5.16%,在召回率、F1分数等指标上也显著优于其他网络模型,表明本文混合模型能有效提升分类准确性,为神经影像数据的自动化分类提供了一种新的技术途径,具有广泛的工程应用潜力。

Abstract

In order to solve the problem of difficulty in capturing global features of three-dimensional convolutional neural network (3D CNN) in the classification and prediction of neuroimaging data, a multi-layer perceptron mixer (MLP-Mixer) that effectively models global relationships was introduced, and a feature fusion based hybrid model was proposed aimed at improving the classification performance of neuroimaging data by combining the advantages of 3D CNN and MLP-Mixer. Firstly, in the feature extraction stage, 3D CNN was used to extract local spatial features from resting-state functional magnetic resonance imaging (rs-fMRI) data, while MLP-Mixer was used to capture global relational features. Secondly, in the fusion classification module, the scaled dot-product self-attention technique was used to combine spatial features with global relationship features, dynamically balancing and integrating the importance of different features, enhancing the expressive power of the model, and completing the classification task through a fully connected layer. The experimental results show that the hybrid model has achieved a maximum improvement of 4.12% and 5.16% in classification accuracy for binary and multi-class classification tasks of neural imaging data, respectively. It is also significantly better than other network models in terms of recall rate, F1 score, and other indicators. This indicates that the hybrid model proposed can effectively improve classification accuracy and provide a new technological approach for automated classification of neuroimaging data, with broad potential for engineering applications.

Graphical abstract

关键词

计算机技术 / 三维卷积神经网络 / 多层感知混合器 / 功能性磁共振成像 / 特征融合

Key words

computer technology / 3D convolutional neural network / multi-layer perceptron mixer / functional magnetic resonance imaging / feature fusion

引用本文

引用格式 ▾
李修军,王圆圆,葛雄心,杨菁菁,佟丹. 基于特征融合的神经影像数据分类模型[J]. 吉林大学学报(工学版), 2026, 56(5): 1407-1417 DOI:10.13229/j.cnki.jdxbgxb.20241229

登录浏览全文

4963

注册一个新账户 忘记密码

0 引 言

随着现代社会人口老龄化的加速,对神经退行性疾病的早期诊断和干预需求日益增长12。功能性磁共振(fMRI)作为一种关键的神经影像技术,能够通过检测与神经元活动相关的血流和血氧水平变化,捕捉大脑活动的时空动态3。这使得fMRI成为早期诊断和干预的潜在工具。深度学习技术的进步,尤其是三维卷积神经网络(Three-dimensional convolutional neural network,3D CNN),在自动提取fMRI数据的特征方面展现出巨大潜力,为神经系统疾病的早期诊断提供了新的方法和工具。

在深度学习与神经影像学结合的研究中,已有研究利用3D CNN或多层感知混合器(MLP-Mixer)模型成功地对神经影像数据进行分类,展示了处理神经元激活移位和缩放的能力。例如,Thanh等1基于3D CNN计算机辅助诊断方法,通过从静息态fMRI(rs-fMRI)数据中提取独立成分分析(Independent component analysis,ICA)特征,阿尔茨海默病(AD)与正常对照组(NC)分类准确率达到85.27%;Hanh等4利用3D CNN模型提取任务相关信息,成功地对AD的实时fMRI进行五类分类,分类准确率可达78.5%;Li等5提出端到端的数据驱动模型(C3d-LSTM),结合3D CNN,从fMRI图像序列中提取每一体积的三维静态图像空间特征,实现了97.37%的AD和NC分类准确率;He等6基于自监督学习(Self-supervised learning,SSL)提出了通道注意MLP-Mixer网络(SCAMLP-Net),用于脑电图(Electroencephalogram,EEG)分类,通过有效地学习时间和空间信息,显示出优异的分类性能;Qiu等7结合完全卷积网络(Fully convolutional network,FCN)和传统MLP,分析结构性MRI(sMRI)数据并生成高分辨率的疾病概率图,达到了神经科医生级别的AD状态诊断精度;Zhou等8提出的ME-Mixer CNN模型,通过整合ME-Mixer模块到主干CNN中,对COVID-19和ISIC-2019数据集进行分类,表现优于其他方法;Zhang等9基于MLP-Mixer架构建立了3D-Mixer模型,通过对sMRI和PET数据集进行AD与NC的分类,在曲线下面积(Area under the curve,AUC)、精确率-召回率曲线下面积(Area under the precision-recall curve,AUPR)和准确率(Accuracy,ACC)指标表现均出色。

尽管基于3D CNN的方法在捕捉局部空间特征方面表现出色,但在分析广泛分布的脑网络活动时,通常难以捕捉到全局上下文和长距离的依赖关系10。同时,虽然MLP-Mixer在全局信息处理方面具有优势,但缺乏对细节空间位置的敏感度,这在解析早期微小脑区变化时尤其关键。单独使用任一技术都难以全面捕捉神经影像数据中的复杂信息。此外,现有的研究在神经退行性疾病的明显症状期取得了一定进展,但对于早期的诊断预测,尤其是在早期阶段缺乏足够的成像模态数据中11,仍面临着挑战。

因此,本文设计了一种新的特征融合模型——CMm-ATFusionNet。该模型整合了3D CNN与MLP-Mixer的优势,旨在深度挖掘阿尔茨海默病患者数据中的潜在特征,并引入缩放点积自注意力机制实现特征的高效融合与分类。其中,3D CNN擅长从图像数据中提取高分辨率的局部空间特征,捕捉AD患者大脑中微小且局部的脑区萎缩等结构变化;MLP-Mixer提取全局关系特征,弥补了3D CNN在跨区域的功能连接和全局模式方面的不足。缩放点积自注意力机制则根据特征的重要性进行动态调整,灵活地分配不同特征的权重,增强了特征融合效果,特别适用于整合来自不同特征提取模块的信息,从而提高分类性能。

该模型在自采集的阿尔茨海默病静息态功能性磁共振成像(rs-fMRI)数据集上进行了实验验证。静息态是指大脑处于不执行具体认知任务、保持安静、放松、清醒状态的情况。rs-fMRI数据反映不同脑区的活跃程度,对于了解大脑在静息态下的基础功能和不同区域的活动特征具有重要意义,为揭示疾病早期变化提供了关键线索。实验显示,二分类任务中,ADvs.NC的精确率达到了98.94%,SCDvs.MCI的召回率达到了98.99%;多分类任务中,SCDvs.MCIvs.AD的分类准确率达到了98.76%,SCD vs.MCI vs.AD vs.NC的精确率达到了97.32%。结果表明,该方法在提取空间和全局信息方面表现优异,显著增强了特征表示的多样性和丰富性,从而提升了分类的性能。作为一种创新的混合模型,CMm-ATFusionNet为神经影像数据的自动分类提供了新的技术手段,特别是在疾病的早期诊断阶段展现出巨大的应用潜力,具有广泛的工程应用前景,有望推动相关领域的智能诊断技术发展。

1 数据材料

1.1 数据收集

本文共纳入了吉林大学第一医院放射科登记的年龄在60至85岁之间的老年人,总计有69名受试者的静息态功能性磁共振数据(rs-fMRI)被采用。这一年龄段的选择是基于其高发的神经退行性疾病风险,特别是60岁以上人群中,AD及其早期阶段的发生率显著增加。所有参与者在数据采集前提供了书面知情同意书,在部分AD患者无法自身提供知情同意的情况下,近亲在参与前给予同意。为了保证数据的准确性,参与者的选择标准为:①无脑损伤史;②无神经精神疾患;③无磁共振检查禁忌物(包括心脏起搏器植入患者、体内有移植物或金属异物患者);④右利手。排除标准为:①有严重基础疾病患者;②幽闭症患者;③无法配合实验者12。另外,参与者也完成了简易精神状态量表评分(Mini-mental state examination,MMSE)和临床痴呆评定量表(Clinical dementia rating,CDR)的神经心理学测验评估,并记录得分。最终,经过MMSE和CDR测试选定的受试者信息为NC有18名、AD有17名、MCI有18名、SCD有16名,具体信息如表1所示。其中,NC(正常对照组)为基线对照,受试者无明显的脑萎缩或异常病变;AD(阿尔茨海默病组),患者大脑海马体明显萎缩;MCI(轻度认知障碍组),患者海马体萎缩程度介于NC与AD组之间,尚未达到AD的严重程度;SCD(主观认知下降组),患者脑结构无明显萎缩或异常,但主观报告有认知下降的体验。

所有参与者均使用吉林大学第一医院放射科磁共振室的Philips Ingenia 3.0Tesla MRI仪进行扫描,使用具有以下参数的采集类型:GE-EPI/GRE-EPI序列,TR为2 500 ms,TE为27 ms,矩阵为64×64,FOV为230×230 mm2,切片层厚为4 mm,间隔为0,扫描时间为456 s,层数为33层。参照常规标准,在扫描过程中,受试者头部采用海绵垫和绑带舒适固定,以防止头动,安静平卧于检查床;给予耳塞,以减少扫描噪音对被试听力的影响;不做任何动作,只需保持静止、睁眼,持续清醒状态下双目注视头顶标注的“+”字标记。

1.2 数据预处理

在rs-fMRI数据的预处理阶段,使用Matlab中的SPM工具箱进行操作处理。首先,为了考虑磁共振设备在启动扫描阶段需要达到磁化平衡状态的时间需求,丢弃了最初的4个体积数据。然后,对每位受试者剩余的182个体积数据进行了以下标准化的预处理操作流程。

(1)时间校正:确保所有脑切片的采集时序与重复时间(TR)相匹配,从而保证数据采集的一致性。

(2)头动校正:消除采集期间可能发生的头部运动对数据质量的干扰。在这个过程中,头部运动超过预设标准的受试者数据会被剔除,预设标准为最大平移不超过3.0 mm或最大旋转不超过3.0°。

(3)结构去骨和空间对齐:采用基于T2加权MRI的结构去骨技术,去除与脑部结构无关的部分,并将处理后的fMRI数据与蒙特利尔神经学研究所(Montreal neurological institute,MNI)空间进行对齐,确保数据在标准脑空间的一致性。

(4)空间平滑处理:为了提高数据分析的灵敏度和信号可靠性,对数据应用了半高全宽(Full width at half maximum,FWHM)为8 mm的高斯滤波器进行空间平滑操作。

2 模型设计

2.1 CMm-ATFusionNet整体架构

CMm-ATFusionNet的整体架构如图1所示,主要分为特征提取和特征融合分类两个核心部分。

在特征提取阶段,模型结合了三维卷积神经网络(3D CNN)和多层感知混合器(MLP-Mixer)。首先,3D CNN用于捕捉fMRI数据中的空间和时间特征。通过卷积和池化操作,3D CNN能够有效提取图像的局部特征,生成信息丰富的特征表示。这些提取出的特征经过归一化和维度调整后被展平为一维向量,并封装为二维向量的形式,以便更好地输入后续分类器。

同时,MLP-Mixer专注于建模全局特征关系。通过一系列Mixer层,该组件实现了对空间和通道信息的增强,捕获数据中的全局依赖关系。与3D CNN相似,MLP-Mixer提取的特征经过预处理后展平为一维向量,并封装为包含批量和特征维度的二维向量,供分类器使用。在特征融合分类部分,采用缩放点积自注意力模块,将来自3D CNN和MLP-Mixer的特征进行融合,确保局部与全局信息的有效结合。最终,经过将拼接的特征向量输入全连接层,实现向类别空间的映射,并完成分类任务。

2.2 空间特征的提取

在利用卷积神经网络进行空间特征提取时,本文采用了3D CNN模型。相比于2D CNN,3D CNN能够更好地从三维图像数据中提取高分辨率特征,准确反映神经退行性变化的空间分布和模式,从而显著提高AD的分类性能13。AD患者的大脑中存在海马体萎缩、脑皮层厚度减少等微小且局部的结构变化,这些变化在早期阶段(如SCD、MCI)更是非常细微,仅凭低分辨率特征难以有效捕捉和识别。而高分辨率特征能够提供丰富的细节信息,使模型能够识别和区分健康个体与AD及其早期阶段之间的细微差异,这在病情诊断和检查中具有关键意义。本文中3D CNN结构如图2所示。

首先,从三维rs-fMRI数据中提取小的3D块(Patches),每个图像块的大小为16×16×16。为了增强数据的多样性,对数据进行了随机翻转和旋转等数据增强操作,使得图像块在不同轴上进行随机变化。随后对数据进行标准化,并转换为张量格式,表示为(CDHW),其中,C为通道数(因为fMRI数据通常是灰度图像,所以设为1),DHW分别为深度、高度和宽度(均为16,即图像块的大小)。接下来,经过标准化的3D数据被输入至3D CNN模块中进行特征提取。3D CNN由4个卷积层和最大池化层组成,每一层的卷积核大小为3×3×3,步长(Stride)为1,并在每个卷积层中加入零填充操作以保证卷积输出的空间维度与输入保持一致。卷积层的操作可以表示为:

Conv=ActW*X+b

式中:*表示卷积操作;W为卷积核的权重,大小为3×3×3;X为输入的3D图像块,大小为16×16×16;b为偏置项,与卷积核的输出通道数对应,每层卷积的输出通道数分别为16、32、64和128;激活函数Act采用ReLU函数,它将输出中的负值替换为0,以增强模型的非线性拟合能力。

为了进一步降低数据的空间维度并减少模型的计算复杂度,在每层卷积后均应用了最大池化(Max pooling)操作。最大池化通过从输入数据的局部区域中提取最大值,实现特征图的下采样。最大池化操作可以表示为:

y=max(Xsubregion)

式中:Xsubregion为被池化窗口覆盖的局部区域。

池化窗口的大小设定为2×2×2,步长为2,确保每次池化操作不发生重叠。经过池化操作后,特征图的尺寸被显著减小,同时保留了最重要的特征信息。

经过4层3D卷积核与最大池化操作后,输入的图像块被处理为大小为1×1×1的特征图,此时的输出通道数为128。展平后的向量通过线性层进一步映射为一个大小为128的特征向量。最后,这些特征向量被封装为二维张量,其中第一维表示批量大小(64),第二维表示特征向量的维度(128),然后输入到分类器中进行类别预测。

2.3 全局关系特征的提取

MLP-Mixer是一种纯多层感知器(MLP)架构,适用于图像分类等任务。与传统卷积神经网络(CNN)不同,MLP-Mixer不依赖卷积操作,而是通过独立处理空间位置信息(即Token mixing)和通道信息(即Channel mixing)捕捉特征间的关联性和复杂模式14。在本文中,MLP-Mixer模块对三维fMRI数据进行全局特征提取,其详细结构如图3所示。

首先,输入数据经过数据增强处理,包括随机翻转和旋转操作,然后将三维fMRI数据展平(Flattening)成二维数据张量,形状为(64,4 096),其中,64为批量大小,4 096为维度特征。在数据进入MLP-Mixer之前,应用层归一化(Layernorm)操作,以加速模型训练,减少数值波动,提高模型的稳定性。其层归一化公式为:

LN(xi)=xi-μσ·γ+β

式中:xi为当前层的输入特征向量;μσ分别为同层内特征向量在维度上的均值和标准差;γβ为可学习参数,用于对归一化结果进行缩放和平移。

初始时,γ=1β=0,在训练过程中,这些参数动态调整,确保归一化操作不破坏模型的学习能力。

归一化后的特征输入到多个MixerBlock中。每个MixerBlock由两个主要的MLP结构组成,即Token-mixing MLP和Channel-mixing MLP,如图4(a)所示。每个MLP模块包含两个全连接层、一个GeLU激活函数和两个Dropout层,具体结构如图4(b)所示。其中,Token-mixing MLP关注的是token维度(即空间位置)之间的关系,而Channel-mixing MLP则重点处理channel维度(即通道位置)之间的关联。对于输入张量X,Token-mixing和Channel-mixing的计算分别如下:

Y=X+MLPtokensLN(XT)T
Z=Y+MLPchannelsLNY

式中:X为输入张量;Y为Token-mixing的输出;Z为Channel-mixing的输出;LN表示层归一化;“+”表示残差连接,用于将MLP的输出与原输入相加。

在Token-mixing操作中,首先将输入矩阵X转置得到XT,以交换token维度和特征维度,从而使MLP能够在每个特征维度上处理不同空间位置的token。接着,对转置后的XT进行层归一化,帮助消除特定特征值的极端情况,防止影响模型性能。经过MLP的处理后,结果再次转置回原始形状。最后,通过残差连接,将MLP的输出Y与原始输入X相加,以保留原始的输入特征,防止多层处理导致的信息丢失或梯度消失问题。

在Token-mixing完成后,输出Y被传递到Channel-mixing MLP作为输入。在此阶段,由于处理的是token内部的通道维度,因此无需再进行转置操作。首先,对Y进行层归一化,使模型能够更加高效地学习通道信息。然后,将归一化后的Y输入MLP,捕捉每个token内部不同通道之间的关系。最后,通过残差连接,将MLP的输出Z与输入Y相加,以保留原有的通道信息,同时增强模型在通道维度上的特征学习能力。

经过N个MixerBlock的交替运算后,MLP-Mixer的输出最终通过线性层(Linear layer)映射到下一个处理阶段。在这一过程中,Token-mixing MLP和Channel-mixing MLP协同作用,有效地在空间和通道两个维度上混合特征,从而实现更加灵活的全局信息整合和特征学习。

2.4 特征融合及分类

缩放点积自注意力机制是一种改进的点积注意力方法,旨在减轻输入向量对注意力权重的影响,并融合不同特征。本文利用该机制实现特征融合和分类。核心步骤是:首先通过查询向量 Q 与键向量 K 之间的点积,衡量二者相似性,然后通过Softmax函数将点积结果转换为概率分布,从而确定值向量 V 的加权重要性,最后,经过加权求和生成输出15。其公式如下:

AttentionQ,K,V=SoftmaxQKTdkV

式中: QKV 分别为查询矩阵、键矩阵和值矩阵;dk为键向量的维度,dk作为缩放因子引入,为了防止高维度情况下的点积值过大,避免出现梯度消失或梯度爆炸的现象。

图5所示,缩放点积自注意力的执行过程首先是接收前面阶段提取到的特征。具体而言,3D CNN负责捕捉局部空间特征,而MLP-Mixer则用于提取全局特征。两个模块的输出在经过线性变换(Linear transformation)后,分别映射为 QKV。其中,线性变换通过全连接层(FC)实现,旨在将不同维度的数据统一到注意力机制的计算空间中。

然后,查询向量 Q 与键向量 K 之间的点积结果通过缩放因子进行缩放,之后经过Softmax处理后,点积结果被转换为归一化的概率分布,用以计算值向量 V 的权重。通过对 V 进行加权求和,生成上下文向量,该向量结合了 QKV 三者所包含的全局特征信息。为充分利用3D CNN与MLP-Mixer提取到的特征,生成的上下文向量会与3D CNN的原始输出进行拼接,从而实现全局和局部特征的结合。拼接后的特征通过线性层进行变换,压缩维度,最终经过全连接层进行处理,完成分类任务并输出最终的分类结果。

3 实验及结果

3.1 实验设置

在本文实验中,首先读取在吉林大学第一医院放射科登记采集的69名60~85岁老年人的静息态功能性磁共振成像(rs-fMRI)的NIfTI格式三维图像数据。其中,所有数据均使用吉林大学第一医院放射科磁共振室的Philips Ingenia 3.0Tesla MRI仪进行采集,相关详细信息请参见1.1节数据收集。然后,从这些3D体积数据中提取更小的3D块。每个提取的块大小为16×16×16,步长设置为16。本研究中使用的数据集包含69名受试者,每名受试者的182个rs-fMRI数据提取了6 552个3D块,总共生成了452 088个3D块样本。每个3D块根据预设的类别范围分配标签。为了使用不同的数据集调整模型参数,并对模型进行验证和评估,将这些3D块随机划分为训练集、验证集和测试集,比例为7∶1.5∶1.5,即70%的数据用于训练、15%用于验证、15%用于测试。最终划分后的数据集包括fMRI图像数据的3D块及其对应的标签,用于后续的模型训练和评估。本文所有实验均在配备NVIDIA GeForce GTX 1660 Ti GPU(6 GB GDDR6显存)的服务器上进行,使用Pytorch 2.0.1深度学习框架完成。

3.2 优化和评估

在本文中,采用类别加权交叉熵损失(Weighted cross-entropy loss,WCEL)函数量化模型预测与实际标签之间的差异。交叉熵损失函数是一种常用于分类任务的损失函数,特别是在多分类问题中。它衡量模型输出的概率分布与真实标签的概率分布之间的差异16。当模型的预测概率分布接近真实的标签概率分布时,交叉熵损失较小;反之,则损失较大。然而,当数据集中存在类别不均衡时,标准的交叉熵损失函数可能导致模型偏向多数类,忽视少数类。为了处理这个问题,引入了类别加权机制,通过为每个类别分配不同的权重,使得模型在训练过程中更加关注少数类。类别加权交叉熵损失函数的公式如下所示:

Lp,q=-1Nc=1Ni=1Cωi·yc,i·logpc,i

式中:N为样本总数;C为类别总数;yc,i为样本c在类别i上的真实标签(若真则为1,否则为0);pc,i为模型预测样本c为类别i的概率;ωi为类别i的权重,通常与类别的频率成反比,以提高模型对少数类的敏感性。

此外,为了进一步应对类别不平衡问题,在数据加载过程中采用加权随机采样器(Weighted random sampler),根据每个样本所属类别的权重,调整采样概率,确保在每个训练批次中,各类别样本被均匀地抽取,进一步平衡训练数据中的类别分布。

为了训练模型,利用优化器AdamW进行参数优化。AdamW是Adam优化器的一个变种,其关键在于它将权重衰减与梯度更新分开处理,有助于解决L2正则化与自适应学习率算法(如Adam)不兼容的问题17。公式如下所示:

θt=θt-1-ηm^tν^t+ϵ+λθt-1

式中:θt为在时间步t的参数值;η为学习率;m^tv^t分别为偏差校正后的一阶和二阶矩估计;ϵ为一个小常数,用于保证数值稳定性;λ为权重衰减系数。

在实验中,学习率lr最初设置为0.000 1,如果在训练过程中验证损失在10个epoch内没有减少,那么lr将缩小一半

使用训练集数据对CMm-ATFusionNet模型进行训练,并通过验证集对模型进行调优和参数选择。在测试集上评估模型的性能,采用的评估指标包括准确率(ACC)、精确率(PRE)、召回率(REC)、F1分数(F1)、Matthews相关系数(MCC)。这些指标的值越高,则表明模型的表现越优越。

3.3 分类结果

为了评估所提出的CMm-ATFusionNet模型的有效性,针对四类受试者进行了二分类和多分类任务的实验。二分类任务包括:①AD与NC的分类;②MCI与SCD的分类。多分类任务包括:③AD、MCI和SCD的分类;④AD、NC、MCI和SCD的分类。

表2展示了CMm-ATFusionNet模型在这些分类任务中的性能表现。在二分类任务中,模型在区分阿尔茨海默病患者与健康正常对照时,准确率达到98.93%,精确率(P)为98.94%,召回率为98.93%。在识别轻度认知障碍与主观认知下降时,模型表现更为出色,准确率达到98.98%,精确率为98.96%,召回率为98.99%。在更具挑战性的多分类任务中,CMm-ATFusionNet在三分类(AD、MCI、SCD)任务中仍保持较高性能,准确率为97.53%,精确率为97.54%,召回率为97.53%。而在四分类任务(AD、NC、MCI、SCD)中,模型的准确率为97.19%,精确率为97.27%,召回率为97.16%。这些结果表明,CMm-ATFusionNet模型不仅在二分类任务中表现优异,而且在更为复杂的多分类任务中也能保持稳定的高性能,证明了其在识别和区分阿尔茨海默病相关症状分类时的有效性和可靠性。

3.4 方法比较及分析

3.4.1 消融实验

为了验证CMm-ATFusionNet模型中,3D CNN模块在特征提取方面的贡献及其不可替代性,将所提出的CMm-ATFusionNet与单独的MLP-Mixer模型进行四分类任务的对比,结果如图6所示。图6显示,CMm-ATFusionNet在所有性能指标上的结果都显著优于MLP-Mixer模型。另外,在计算资源方面,CMm-ATFusionNet每个epoch运行时间为445.9 s,最大GPU内存使用量为2.01 GB,而单独的MLP-Mixer的运行时间为225 s,内存为1.1 GB。这些结果表明,尽管CMm-ATFusionNet在计算时间和内存使用上略高,但其分类任务上存在优势,相比之下,MLP-Mixer的表现明显逊色,两者之间的差距尤为明显。不使用3D CNN模块进行特征提取时,模型性能显著下降,强调了在捕捉复杂模式和关系方面的挑战性。3D CNN模块在CMm-ATFusionNet结构中的重要性不容忽视,它在提升整体模型的特征提取能力和分类准确度方面起到了关键作用。通过这些比较可以明确看出,3D CNN模块在CMm-ATFusionNet模型中的不可替代性,对提高模型性能至关重要。

3.4.2 模型深度分析

为了评估MLP-Mixer模型的性能并探索其深度对实验结果的影响,在CMm-ATFusionNet模型中调整了MixerBlock的数量,将N设置为2、4、6、8和10。图7为不同深度的CMm-ATFusionNet模型在四分类任务上的性能表现,其中横轴表示MixerBlock的数量N,纵轴表示对应的评估指标结果。图7中数据显示,随着模型深度(即MixerBlock数量)的增加,所有性能指标均有所提高,这表明模型深度在提升分类性能方面起到了积极作用。尤其是MixerBlock数量从2增加到8时,性能提升显著。但是,从图7中可以看出,模型深度并非是越深越好,当数量从8增加到10时,性能不再提升反而下降,模型在深度为8时已接近最佳状态。这是因为随着模型深度的增加,可学习参数数量显著增加,使得深度更高的模型更难进行训练,泛化能力下降,产生了过拟合现象,导致测试数据上的性能减弱。

3.4.3 对比试验

本文进行了多种不同结构的多模型比较实验,以进一步验证本文模型的有效性。通过与多种竞争方法的比较,验证了本文方法在阿尔茨海默病分类任务中的优越性能。具体结果如表3表4所示,分别包括二分类与四分类的比较结果,表中,加粗数据表示最佳结果。

表3显示了CMm-ATFusionNet与其他对比模型在AD与NC分类任务中的性能。显然,与其他方法相比,CMm-ATFusionNet在各项指标上均表现出色,特别是在准确率和Matthews相关系数上达到了98.93%和96.87%。表4为CMm-ATFusionNet与其他对比模型在四分类任务中的性能。同样,CMm-ATFusionNet在所有指标上均优于其他模型,尤其在准确率和Matthews相关系数上表现突出,分别为97.30%和96.41%。

综上所述,CMm-ATFusionNet在多组对比实验中均表现出优异的分类性能,面对复杂分类任务时优势尤为显著。由于3D CNN强大的特征提取能力以及MLP-Mixer对独特特征的处理结构,CMm-ATFusionNet模型在阿尔茨海默病分类任务中表现优越,尤其在高维数据处理方面表现突出。上述实验结果证实,引入新型深度神经网络架构,能够有效提升阿尔茨海默病等神经退行性疾病的智能分类精度,对该领域计算机辅助诊断研究具备重要参考价值。

4 结束语

本文提出了一种新的图像分类模型——CMm-ATFusionNet,由3D CNN和MLP-Mixer以及缩放点积自注意力机制组成。该模型的创新之处在于结合了3D CNN和MLP-Mixer的优势,并通过自注意力机制有效整合全局和局部特征,从而提升了分类性能。具体而言,3D CNN擅长提取局部空间特征,捕捉功能性磁共振成像(fMRI)数据中的细微结构变化;而MLP-Mixer能够建模全局关系特征,补充了3D CNN在全局数据关系方面的不足。这两者的结合使得模型在特征提取方面更加全面和高效。缩放点积自注意力机制在特征融合阶段动态权衡和整合不同特征的重要性,进一步增强了模型的表达能力和分类准确性。研究结果表明,在阿尔茨海默病数据集上的分类任务中,相较于其他传统方法,CMm-ATFusionNet在准确率上提高了5.16%,F1分数提升了4.17%,MCC提高了5.95%,展现了其卓越的鲁棒性和高效性。因此,该模型在阿尔茨海默病的分类诊断任务中表现出良好的性能和广阔的应用前景,未来有望成为临床实践中疾病诊断的重要辅助工具,为医护人员提供更准确、快速的诊断决策支持。

参考文献

[1]

Thanh N D, Seungjun R, Iqbal N M Q, et al. 3D-deep learning based automatic diagnosis of Alzheimer's disease with joint MMSE Prediction using resting-state fMRI[J]. Neuroinformatics, 2020, 18(1): 71-86.

[2]

Wang M L, Lian C F, Yao D R, et al. Spatial-temporal dependency modeling and network hub detection for functional MRI analysis via convolutional-recurrent network[J]. IEEE Transactions on Biomedical Engineering, 2019, 67(8): 2241-2252.

[3]

Warren S L, Moustafa A A. Functional magnetic resonance imaging, deep learning, and Alzheimer's disease: a systematic review[J]. Journal of Neuroimaging: Official Journal of the American Society of Neuroimaging, 2022, 33(1): 5-18.

[4]

Hanh V, Hyun-Chul K, Minyoung J, et al. fMRI volume classification using a 3D convolutional neural network robust to shifted and scaled neuronal activations[J]. NeuroImage, 2020, 223: 117328-117328.

[5]

Li W, Lin X, Chen X. Detecting Alzheimer's disease based on 4D fMRI: an exploration under deep learning framework[J]. Neurocomputing, 2020, 388: 280-287.

[6]

He Y, Lu Z, Wang J, et al. A self-supervised learning based channel attention MLP-mixer network for motor imagery decoding[J]. IEEE Transactions on Neural Systems and Rehabilitation Engineering, 2022, 30: 2406-2417.

[7]

Qiu S, Joshi P S, Miller M I, et al. Development and validation of an interpretable deep learning framework for Alzheimer's disease classification[J]. Brain: a Journal of Neurology, 2020, 143(6): 1920-1933.

[8]

Zhou Z, Islam M T, Xing L. Multibranch CNN with MLP-mixer-based feature exploration for high-performance disease diagnosis[J]. IEEE Transactions on Neural Networks and Learning Systems, 2024, 35(6): 7351-7362.

[9]

Zhang Zi-chao, Zhao Xing-zhong, Dong Gui-ying, et al. Improving Alzheimer's disease diagnosis with multi-modal PET embedding features by a 3D multi-task MLP-mixer neural network[J]. IEEE Journal of Biomedical and Health Informatics, 2023, 27(8): 4040-4051.

[10]

王威, 孙钰洁, 王新. 频率和空间特征融合的轻量级多尺度遥感图像场景分类网络[J]. 吉林大学学报: 工学版, 2025, 55(10): 3361-3371.

[11]

Wang Wei, Sun Yu-jie, Wang Xin. Lightweight Frequency and spatial feature fused multi-scale remote sensing scene classification network[J]. Journal of Jilin University (Engineering and Technology Edition), 2025, 55(10): 3361-3371.

[12]

Liu Y B, Yue L, Xiao S F, et al. Assessing clinical progression from subjective cognitive decline to mild cognitive impairment with incomplete multi-modal neuroimages[J]. Medical Image Analysis, 2022, 75: 102266-102266.

[13]

Chen Z P, Ma X, Chen R, et al. A reparametrized CNN model to distinguish Alzheimer's disease applying multiple morphological metrics and deep semantic features from structural MRI[J]. Frontiers in Aging Neuroscience, 2022, 14: 856391-856391.

[14]

王学智, 李清亮, 李文辉. 融合迁移学习的土壤湿度预测时空模型[J]. 吉林大学学报: 工学版, 2022, 52(3): 675-683.

[15]

Wang Xue-zhi, Li Qing-liang, Li Wen-hui. Spatio-temporal model of soil moisture prediction integrated with transfer learning[J]. Journal of Jilin University(Engineering and Technology Edition), 2022, 52(3): 675-683.

[16]

江晟, 王祎笛, 谢睿麟, . 基于门控循环网络时空关联的交通事故预测模型[J]. 吉林大学学报: 工学版, 2025, 55(3): 954-962.

[17]

Jiang Sheng, Wang Yi-Di, Xie Rui-Lin, et al. Traffic accident anticipation baed on spatial-temporal relational learning and convolutional gated recurrent network[J]. Journal of Jilin University (Engineering and Technology Edition), 2025, 55(3): 954-962.

[18]

Sohn G, Zhang N, Olukotun K. Implementing and optimizing the scaled dot-product attention on streaming dataflow[J/OL]. [2024-11-21].

[19]

李云红, 王梅, 苏雪平, . 结合注意力与上下文融合的遥感图像道路提取[J]. 吉林大学学报: 工学版, 2025, 55(12): 4034-4044.

[20]

Li Yun-hong, Wang Mei, Su Xue-ping, et al. Road extraction from remote sensing images combining attention and context fusion[J]. Journal of Jilin University (Engineering and Technology Edition), 2025, 55(12): 4034-4044.

[21]

Zhou P, Xie X, Lin Z, et al. Towards understanding convergence and generalization of AdamW[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024, 46(9): 6486-6493.

[22]

Sima G, Ahmad S. Predicting conversion from MCI to AD by integration of rs-fMRI and clinical information using 3D-convolutional neural network[J]. International Journal of Computer Assisted Radiology and Surgery, 2022, 17(7): 1245-1255.

[23]

Mohammed A, Tianfu W, Ahmed E. Fusing multimodal and anatomical volumes of interest features using convolutional auto-encoder and convolutional neural networks for Alzheimer's disease diagnosis[J]. Frontiers in Aging Neuroscience, 2022, 14: 812870-812870.

基金资助

吉林省教育厅项目(JJKH20230847KJ)

吉林省自然科学基金项目(20210101413JC)

AI Summary AI Mindmap
PDF (3378KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/