心音异常高检出率模型MS-DTNet:融合多尺度卷积与双塔注意力的方法

温耀棋 ,  卢学麒 ,  吴秋岑 ,  陈华元 ,  陈超敏

南方医科大学学报 ›› 2026, Vol. 46 ›› Issue (06) : 1444 -1454.

PDF (1195KB)
南方医科大学学报 ›› 2026, Vol. 46 ›› Issue (06) : 1444 -1454. DOI: 10.12122/j.issn.1673-4254.2026.06.24

心音异常高检出率模型MS-DTNet:融合多尺度卷积与双塔注意力的方法

作者信息 +

MS-DTNet: an efficient model combining multi-scale convolution and dual-tower attention for detecting abnormal heart sounds

Author information +
文章历史 +
PDF (1223K)

摘要

目的 提高心音异常的检出率,为自动化心音分析提供技术支持。 方法 本文提出了一种基于多尺度卷积与双塔注意力机制的模型(MS-DTNet),其通过深度可分离卷积以降低计算复杂度的同时结合多尺度卷积以并行获取不同感受野的特征,然后采用双塔结构兼顾短时与长时信息提取,并引入翻转注意力机制以进一步增强特征表征能力,从而提高对心音图分类的精度。 结果 使用公开数据集CinC2016对提出的模型进行五折交叉验证实验。在心音异常分类任务中,模型在测试集上的平均准确率、平均特异性、平均召回率、平均精确率、平均F1分数与平均ROC分别达到94.49%、93.44%、95.49%、93.81%、94.64%和98.65%,结果均优于其他几种模型。 结论 本研究提出的MS-DTNet模型在心音图分类表现出色,为后续的多源心音数据分析与临床辅助决策研究提供了有效的技术基础。

Abstract

Objective To develop an efficient model for detecting abnormal heart sounds and providing technical support for automated phonocardiogram (PCG) analysis. Methods The proposed model, MS-DTNet, integrates multi-scale convolution and a dual-tower attention mechanism. The network employs depthwise separable convolution to achieve a lightweight architecture, applies multi-scale convolution to capture features across receptive fields in parallel, utilizes a dual-tower structure to extract both short- and long-term temporal information, and incorporates a flipped-attention mechanism to further enhance feature representation. Experiments were conducted on the public CinC2016 dataset using 5-fold cross-validation. Results In the abnormal heart sound classification task, the proposed model achieved an average accuracy of 94.49%, a specificity of 93.44%, a sensitivity of 95.49%, a precision of 93.81%, F1-score of 94.64%, and ROC-AUC of 98.65%, outperforming all the comparison models. Conclusion The proposed MS-DTNet model demonstrates excellent performance in PCG classification and provides technical assistance for multi-source heart sound analysis and clinical decision support.

Graphical abstract

关键词

心音图分类 / 轻量化神经网络 / 深度可分离卷积 / 多尺度特征卷积 / 注意力机制 / 双塔机制

Key words

phonocardiogram classification / lightweight neural network / depthwise separable convolution / multi-scale convolution / attention mechanism / dual-tower architecture

引用本文

引用格式 ▾
温耀棋,卢学麒,吴秋岑,陈华元,陈超敏. 心音异常高检出率模型MS-DTNet:融合多尺度卷积与双塔注意力的方法[J]. 南方医科大学学报, 2026, 46(06): 1444-1454 DOI:10.12122/j.issn.1673-4254.2026.06.24

登录浏览全文

4963

注册一个新账户 忘记密码

心血管疾病(CVD)作为全球致死率最高的慢性疾病,每年造成约1790万人死亡1。自1990年以来,我国在解决CVD“救治难”的问题上已经取得了长足的进步。但由于我国人口数量巨大,加之人口老龄化加速,CVD仍是我国居民健康的最大威胁之一。在我国城乡居民疾病死亡构成比中,CVD占首位,2021年调查报告显示,CVD导致的居民死亡分别占农村、城市死因的48.98%和47.35%2,每5例死亡中就有2例死于CVD,因此早期筛查和动态随访对CVD患者具有重大临床意义。
心音图(PCG)是通过仪器记录心脏振动波所形成的图形,其中包含了关于心脏瓣膜开闭、血流动力学状态以及心肌收缩力等的丰富信息,能够在资源有限的环境下提供廉价、无创的检查,用于辅助CVD的诊断3。PCG可记录个4心音(S1~S4)及心脏杂音,弥补了传统的心脏听诊对于第四心音检测的不足,并且传统听诊依赖于医师的临床经验,并且容易受环境噪声和听觉主观感受,导致漏诊与误诊的风险较高4。另外,优质医疗资源分布并不均衡,尤其在偏远和基层地区,缺少经验丰富的心内科医生让PCG在早期疾病筛查中的普及和效果都受到限制。开发一种能够客观准确的、自动化的分析PCG信号的计算机辅助诊断系统,不仅能提升CVD筛查的准确度和一致性,也能在资源有限的环境中发挥重要的临床和社会价值。
随着人工智能技术的飞速发展,特别是深度学习(DL)5在医学图像、语音信号处理等领域的成功应用,为PCG的自动分析开辟了新的道路6。而对于传统手工特征提取,如小波变换7、梅尔频率倒谱系数8与时域统计特征9,以及机器学习分类器,如支持向量机10、随机森林11的方法,端到端的DL模型能够自动从原始数据中学习更多层次、更高抽象的判别性特征,展现出更优越的性能和更强的泛化能力12
现有研究已经尝试多种DL架构来实现心音分类。比如,卷积神经网络(CNN)依托局部连接与权重共享的优势,能够实现高效提取PCG的局部时频特征,是目前应用最广的方案之一13。与此同时,循环神经网络(RNN)及其变体(如LSTM、GRU)则着重建模长程时间依赖关系,在捕捉心音的节律变化和时序模式方面显示出潜在优势14。进一步地,混合模型(CNN-RNN)把CNN的空间特征提取能力和RNN的时序建模能力结合起来,从而实现对PCG时-空特征的多学习15。值得一提的是,Mamba模型通过独特的结构化状态空间序列设计,针对传统Transformer在长序列处理时的计算效率和内存消耗问题提供了新的解决思路1617。例如,Bao等18系统研究了心音信号时长对深度学习分类性能的影响,采用MFCC特征结合CNN与多种RNN模型(LSTM、BiLSTM、GRU、BiGRU)在CinC2016数据集上进行对比实验,实验发现1 s片段显著削弱RNN性能而CNN几乎不受影响,RNN整体优于CNN且彼此差异不大,添加动态信息对RNN无益、对CNN提升亦不足2.5%,据此建议RNN应至少使用2 s时长;有研究19提出一种极低参数量的1-D CNN新架构,以原始PCG波形为输入,通过堆叠clique块、过渡块及可分离卷积并在CinC 2016数据集上训练,在仅0.19 M参数下取得93%准确度与91%综合评分,超越同等规模模型并证明结构轻量化与注意力机制的有效性;Orozco-Reyes等20将STFT、mel谱图与WSST三种时频图融合为224×224图像,分别输入AlexNet、VGG-16、ResNet50、Ullah-CNN及自设计CNN,在3大公开心音库上经十折交叉验证显示,单谱图最高约86%;Harimi等21首次把PCG信号通过重构相空间投影成RGB“chaogram”图像,借助ImageNet预训练CNN并微调,在CinC 2016数据库上采用5折交叉验证,InceptionV3取得最高88.06%的Score(平均敏感度与特异度),优于同期多种手工特征方法,验证了混沌图像化+迁移学习在小样本心音分类中的潜力;Suchithra等22进一步将chaogram图像送入CNN-LSTM混合网络,以CNN提取局部特征、LSTM捕捉时序依赖,在CinC 2016数据库5 s片段上获得89.68%准确度,明显高于单独CNN的82.43%,显示混合模型对chaogram动态纹理更具判别力;有研究23提出综合采用GCT与ECA注意力模块提取特征,并结合LSTM层捕获时序信息,引入BCE损失函数解决了数据类别不平衡的问题,在CinC 2016数据库上达到93.1%的准确率;Barnawi等24引入了高斯混合模型聚类方法给数据进行去噪,并且根据Kernel Density Estimation进行最优时长筛选,将得到的数据转换为Mel频谱图进行训练,在CinC 2016数据库上达到94.6%的特异度;有研究25提出基于互信息最大化准则的多域特征选择策略,包括JMI、ICAP、CIFE、MRMR、CMI等进行特征降维,并使用HSMM方法对信号进行分段(S1、Systole、S2和Diastole),实验取得了89.28%的准确率;Sondermann等26提出了心周期(S1-S1)的归一化方法,并与传统的固定长度分段进行对比,在PhysioNet2022数据集上取得了79.5%的AUROC,比传统分段方法高4.4%。
在上述研究中,在基于PCG的DL模型在分类任务中取得了较好的效果,但仍存在以下几个挑战:特征提取的单尺度限制,现有方法多采用单尺度卷积操作,难以捕捉PCG信号中更为丰富的多尺度特征;并未着眼于局部与全局的关系,仅以局部考察特征,或是全局上转换为2D形式,这并没有将1D信号中局部与全局的信息进行整合,这其中关系在现有模型中可能被低估;模型复杂度较高,尽管基于PCG的自动诊断模型性能已优于人工分析,但其层数较大,模型复杂度较高,识别准确率仍有提升空间。
针对上述存在的问题,本研究提出一种兼具高准确率、低复杂度的基于多尺度卷积与双塔注意力机制的PCG分类神经网络模型,用于进行PCG分类任务。本文的主要贡献如下:设计了一个多尺度特征融合模块:该模块采用“先降维后并行”的结构,利用多个不同卷积核大小的深度可分离卷积并行提取多尺度特征,随后进行特征拼接与融合,使模型能够同时高效地捕获PCG中不同持续时间的病理特征,增强了模型的特征表达能力;提出了一种双塔特征提取结构,通过“轻量塔-增强塔”的互补机制,实现了局部细节与全局节律特征的分层建模,针对PCG信号“局部病理事件+全局节律异常”的双重特性进行定制化设计;引入了一种新颖的翻转注意力机制:本研究集成了通道注意力和空间注意力,并在前向传播中加入了对特征图的翻转操作,再反向注意力中对特征图进行提取特征,实现通道维度的翻转对称正则化操作,在少量线性增加计算负担的前提下增强了模型对判别性特征的聚焦能力和鲁棒性;构建了一个端到端的多尺度特征提取和双塔注意力机制网络(MS-DTNet)并进行充分实验。结果表明,与当前主流的DL模型相比,MS-DTNet在取得了更优的分类精度,实现了精度与效率的良好平衡。

1 材料和方法

本研究的整体流程分为4个关键步骤:数据选择、数据预处理、模型构建和模型评估。

1.1 实验数据

本研究采用CinC2016心音数据库27。该数据库是PCG分类领域广泛使用的公开数据集,共收录了来自765例患者的3541条PCG信号。这些数据记录由多家研究机构使用电子听诊器在全球各地采集,具有多样性。数据集中的每条记录的时长5~120 s,均由专家根据其临床意义标注为正常或异常。由于该数据库未将标注为异常的数据进行细分,因此在本研究只做正常与异常的二分类任务(表1)。

1.2 数据预处理

CinC2016数据集中的原始PCG信号长度差异较大且含有大量噪声,若直接输入网络训练既难以保证模型收敛,又会造成计算低效。为了提升信号质量并实现数据的规范化,本研究设计了如下标准化预处理流程。

1.2.1 截取

在分析CinC2016数据库的3541条记录后发现,其平均时长为32.59 s,中位数为35.60 s,并且在随机查看100条数据形状后,发现许多样本的前2 s是充满噪音的,即使经过去噪处理仍无法辨认心音形态。为此本研究从每条录音中截取[5000,45000],即中间一段40 000个采样点的片段,对应原始2000 Hz采样率下的20 s。此操作避免了数据开头和结尾可能存在的不稳定部分,又确保了大多数录音有足够长度的有效信息28

1.2.2 降采样,去噪与归一化

将截取后的片段从2000 Hz降采样至100 Hz,因为心音的主要诊断信息集中在低频段,此操作在保留关键信息的同时,将数据量减少至原来的1/20,这极大加快了模型训练和推理速度;然后通过巴特沃斯带通滤波器进行去噪,去噪前后对比如图2,去噪后的PCG信号更加平滑,基线水平一致,有利于后续的特征提取;最后归一化采用Z-score标准化方法以解决信号幅度差异的问题,使归一化后的PCG具有相同的均值以及标准差,这不仅便于对不同样本进行比较和分析,还能有效提高模型训练的稳定性和检测性能29。其计算公式:Z=(x-μ)δ

1.2.3 数据清洗

为保证PCG信号的质量与模型训练的可靠性,本研究建立了基于特征评分的多阶段数据清洗流程。本研究对训练集和验证集的3240个数据提取九类质量特征,分别是均方根能量30、峭度、偏度31、频谱熵31、信噪比32、包络峰点数33、活跃度34、自相关周期性35以及过零率36。各特征经过最小-最大归一化后,计算综合质量分数:Q=iwif^i,其中wi为特征权重,f^i为归一化特征值,分数Q[0,1],反映信号整体质量。九类质量特征公式如下:

RMS=1Ni=1Nxi2                                                         
Kurtosis=1Ni=1N(xi-x¯)4(1Ni=1N(xi-x¯)2)2                            
Skewness=1Ni=1N(xi-x¯)3(1Ni=1N(xi-x¯)3)32                          
Spectral Entropy=-k=1KPklog2(Pk)                      
SNRdB=10log10(Es/En)                                   
EPC=countti|e'ti-1>0, e'ti+1<0    
AR=count{|xi|>θ}/N                                         
AP=arg maxτ(0,T] Rxx(τ)                                               
ZCR=1Ni=1N-1[xixi+1>0]                        

公式(2)中峭度越大,表示信号峰度越尖锐;公式(3)中x¯是信号均值,若偏度>0,表示信号分布右偏,反之则左偏;公式(4)Pk=|Xk|2/j=1K|Xj|2Xk为信号的傅里叶变换系数;公式(5)中Es为信号能量,En为噪声能量;公式(6)通过希尔伯特包络检测局部极大值点数,反映心音信号中显著能量峰的数量,与S1/S2结构相关;公式(7)中θ为幅值阈值;公式(8)中Rxxτ=ixixi+τ,T为最大延迟;公式(9)中Ⅱ()是指示函数。

清洗过程分为3步:(1)依据信号的包络峰点数Np<Nmin(如3)剔除仅含单个心拍或静音片段;(2)依据上述质量分数Q<Qth进一步去除低质量样本,其中Qth=max (thresh,P10(Q));(3)对Q分值较低但峰点数较多的样本进行恢复(NpNrecheck)(如8),防止误删,并且在最终输出清洗后的数据与标签文件,并生成清洗报告。这操作显著提升了数据集的整体质量与信号可用性,具体清洗结果如表2

1.2.4 划分训练集、验证集、测试集

本研究将3240条数据按照9∶1的比例,划分为训练集、验证集,将301条数据作为测试集(表3)。

1.2.5 数据增强

为增加训练样本数量并提升模型泛化能力,本研究采用smote方法解决样本类别不平衡37。smote方法通过对数据进行过采样的方式,生成新的少数类样本,而不是简单复制样本来平衡数据集,公式如下:

xnew=xi+μ*(xz-xi)

其中μ是[0,1]范围内的随机数,xi为第i个样本,xzxi样本的k近邻样本中的随机一个样本。最终,从2870条数据中共得到4568个20s长度2000个点的单通道片段,每个片段继承其源录音的标签(正常或异常)。

1.2.6 实验环境

本研究在CUDA版本为12.6,配备了13th Gen Intel® Core™ i5-13490F为CPU,显存为8 GB的NVIDIA GeForce RTX 4060 Ti为GPU的设备上进行部署。实验编程语言使用Python3.8.20,DL框架为Pytorch2.4.1。

1.3 模型设计

为PCG分类任务所设计的神经网络模型——MS-DTNet,与以往直接堆叠卷积与注意力模块的设计不同,MS-DTNet的创新点主要体现在2个层面:结构创新与正则化创新。在结构上,提出双塔特征提取结构,通过“轻量塔-增强塔”的互补机制实现局部细节与全局节律特征的综合建模;在注意力机制上,提出翻转注意力机制,通过通道维度的对称映射实现结构正则化与稳健注意力学习,显著提升了模型的鲁棒性与泛化性能。

1.3.1 网络整体架构

MS-DTNet是一个端到端的一维卷积神经网络,其输入为预处理后的PCG,输出为对应的病理类别概率。整体结构遵循“特征提取-多尺度表示-双塔提取多层次特征-全局汇聚-分类判别”的层次化思路。图3展示了模型的整体架构框图,表3展示了模型各参数的设置。

模型的前向传播过程如下:(1)主干模块:输入信号首先通过一个主干模块。该模块由一个标准的7x1卷积、批归一化和激活函数组成,其步长为2。其主要作用是进行初步的、激进的特征提取和下采样,将输入序列长度减半,同时将通道数提升至一个基础的宽度,为后续深度处理奠定基础。该模块的计算过程可表述为: X0=δ(BNConv1D7×1,stride=2Xin)               (11)

其中Xin为输入张量,X0为输出的特征张量;(2)多尺度卷积模块38:利用3×1、5×1和7×1三种卷积核并行提取不同尺度特征,分别捕获心音中的短时、中时和长时病理模式。多分支输出在通道维度拼接后,经翻转注意力机制增强,形成多尺度融合特征;(3)双塔架构39:设计轻量化塔(LightResBlock)与增强型塔(ResNeXt1DBlock40)并行处理多尺度特征。轻量化塔采用深度可分离卷积构建,降低参数量;增强型塔基于分组卷积构建,提升特征丰富度。双塔内部引入“注意-翻转-再注意”机制,沿时间轴进行翻转注意力加权,增强对PCG时序关系的建模;(4)全局特征汇聚与分类:融合特征经全局平均池化与全局最大池化聚合后拼接,通过全连接层进行降维、激活、Dropout处理,最终输出分类结果。

1.3.2 深度可分离卷积(DSC)

DSC是整个轻量化网络的核心构件,它通过结构分解显著降低了一维卷积的计算量41。其基本思想是将标准卷积拆解为两步:深度卷积与逐点卷积,分别负责不同层面的特征处理。(1)深度卷积:在这一阶段,每个输入通道独立地使用一个专属卷积核进行时序卷积运算,仅捕获通道内部的局部时间特征。这样可以避免通道间的冗余计算,大幅度减少卷积核数量和乘加操作。(2)逐点卷积:通过一层1×1卷积,将深度卷积的输出在通道维度上重新组合,实现跨通道的信息融合与特征映射。与传统卷积需要同时在通道和时间维度上进行完整卷积操作不同,DSC的计算量仅为两部分之和:深度卷积的线性开销与逐点卷积的通道映射开销。理论上,其计算复杂度大约是标准卷积的(1/Cout+1/k)倍,其中Cout为输出通道数,K为卷积核大小。输出通道和卷积核越大,节省越显著。

1.3.3 轻量多尺度模块(LMS)

心音病理特征多变,要求模型具备多尺度感知能力,但是简单地并行多个大卷积核会急剧增加参数量。本研究提出的LMS模块以一种高效的方式实现了这一点。

通道压缩:1×1卷积将输入通道Cin降至中间通道Cout=max (8,Cout/2),降低计算量。多分支深度卷积:特征送入3个DSC分支,卷积核分别为3、5、7,提取短、中、长时间特征。拼接融合:将3路输出沿通道维拼接成3*Cout张量。激活输出:LeakyReLU得到最终多尺度融合特征Xout。借助瓶颈与深度卷积设计,该模块在增强多尺度表达的同时显著压缩参数与计算量。

1.3.4 双塔结构(DT)

MS-DTNet的核心在于双塔并行特征提取,分别为ResNeXt Block分支(R塔)与LightResBlock分支(L塔),该架构两个塔功能互补,二者共享同一输入,以并行方式进行特征建模,但在设计目标与特征关注点上存在显著差异。

ResNeXt分支(R塔)由多层ResNeXt1DBlock组成,R塔通过分组卷积和瓶颈设计强化了跨通道的特征交互与深层表示,能够捕获全局模式与复杂时序结构。LightRes分支(L塔)使用LightResBlock,以DSC和SELite与SpatialGate1D翻转注意力实现轻量化与精细化通道校准,更关注局部细节与关键信号。两塔的输出在通道维度上进行逐元素相加,从而形成综合特征,再进入额外的ResNeXt1DBlock进行高层次整合,最后通过全局平均池化、全局最大池化并拼接,供分类器判别。R塔:采用多层ResNeXt1D模块,通过分组卷积与扩张卷积实现多通道交互与深层特征提炼,具有较强的全局建模能力,能够捕获心音信号中与节律结构、周期性变化以及跨周期病理模式相关的长时间依赖特征,适合建模“整体音循环的异常趋势”。L塔:采用基于DSC的轻量化残差块,并结合通道与空间翻转注意力42,该架构的重点在于以极低的参数量实现对局部微弱变化和关键心音片段(如S1、S2或杂音段)的高分辨率建模,增强对局部病理情况的敏感性。两塔分别侧重“全局-宏观”和“局部-微观”两个层面的信息建模,最终通过通道对齐后逐元素加和融合,实现“全局-局部”的多层次特征综合表达,这双塔构筑避免了单一模型对某一特征的过拟合,强化了模型对于异常病理形态的判别能力。从临床角度来看,PCG信号的异常往往表现为局部病理片段与全局节律模式的交互异常,R塔对应全局节律层面(如心动过速、房颤等节律性病变),对心音周期间的结构变化更敏感,L塔对应局部事件层面(如收缩期杂音、瓣膜关闭不全等),捕获短时不规则波动。这样双塔并行建模,使得模型能够同时识别周期性病例趋势和瞬时病理事件,因此本研究提出的双塔机制虽会略微增加参数量(约为单塔的1.8~2倍),但在全局建模和局部剖析异常特征上存在显而易见的成效,提高了模型在复杂临床样本下的鲁棒性与泛化能力。

1.3.5 翻转注意力机制

本研究设计了一种轻量且有效的翻转注意力机制,该机制在常规通道与空间注意力的基础上,引入了通道维度的翻转对称正则操作,启发自Cohen等43对翻转设计卷积的研究,本研究在结构上建立一种显式的对称性约束,以提升注意力权重分布的稳定性与泛化能力。翻转注意力机制由两个部分构成:前向注意力路径与翻转注意力路径。前向路径首先通过全局平均池化将每个通道的时间序列压缩为单一标量,以捕获全局通道信息,随后经由两层1×1卷积实现通道降维与恢复,并结合LeakyReLU与Sigmoid生成0~1之间的通道权重向量;接着使空间注意力模块在通道维度上计算平均值与最大值,将两者拼接后输入一维卷积,再经Sigmoid函数得到时间位置权重,从而完成对时间维度特征的逐位置重标定。在上述操作基础上,是我们提出的翻转注意力路径,我们将特征图在通道维度上进行翻转,使通道顺序完全颠倒,再将其输入与前向路径相同的通道与空间注意力模块,最后将输出翻转回正序。该操作相当于在正序与反序两个对称视角下分别计算注意力分布,通过这种结构设计,模型在训练中得以在两种相互镜像的通道排列下学习一致的注意力映射,从而抑制单向注意力机制中可能出现的通道依赖性偏置问题。与随机扰动或dropout类正则化操作不同,翻转注意力机制是一种确定性、结构化的正则化方式,其约束基于通道对称性44,使网络在结构上获得更强的稳定性。

相比传统的SE模块与CBAM模块,翻转注意力机制在保持通道与空间双重注意力能力的同时,引入了结构对称约束,使模型在正反通道映射下学习到更为稳健的注意力权重分布。该机制尤其适用于处理非平稳且噪声复杂的心音信号,可有效提升模型对关键病理片段的关注度与稳定性。

1.4 模型评估

本研究在以下维度对模型进行全面的评估:准确率(ACC)、特异性(Spe)、精确率(Pre)、F1分数、受试者工作特征曲线下面积(AUC)。这将会在分类能力,泛化能力等多个角度全面衡量本研究所提模型的表现。相关评价公式如下所示:

ACC=TP+TNTP+TN+FP+FN                               
Spe=TNTN+FP                                                        
Pre=TPTP+FP                                                        
Recall=TPTP+FN                                                   
F1=2×Precision×RecallPrecision+Recall                               
AUC=01TPTP+FNFPTN+FP-1xdx           

真阳性(TP):指被模型正确识别为异常的样本数;真阴性(TN):指被模型正确识别为正常的样本数;假阳性(FP):指正常样本被误判为异常的数量;假阴性(FN):指异常样本被误判为正常的数量。ACC反映整体分类正确程度;Spe衡量模型对正常样本的检出能力;Pre表示预测为异常的样本中有多少确实为异常;Recall亦称灵敏度,反映异常样本被成功检出的比例;F1分数为Pre与Recall的调和均值,用于综合评价模型在少数类(异常)上的性能;AUC 则通过计算不同阈值下灵敏度与1–特异度的曲线面积,考察模型整体判别能力,其值越接近1表示分类性能越佳。

为了进一步提升模型的稳健性和评估精度,本研究在训练集中引入五折交叉验证策略45。在每次迭代中记录模型的性能指标,并将5次迭代的结果取平均值,作为模型整体性能的最终评估。以下是实验训练的配置与参数(表5),并且本研究在所有消融实验与对比实验中,超参数设置均保持不变。

2 结果

2.1 对比实验

本研究将提出的MS-DTNet与其他使用CinC2016数据库的文献进行对比,本研究直接引用该文献其提出的方法对于CinC2016数据库分类结果与本研究提出的方法得到的指标进行对比(表6)。

为验证所提出的MS-DTNet模型在心音分类任务中的有效性,本研究选取了7种在CinC 2016心音挑战数据集上具有代表性的方法作为对比。这些方法覆盖了多种建模范式与技术路线,包括:循环网络类(BiLSTM、CNN-LSTM),代表时序依赖建模方向;卷积网络类(1D-CNN、2D-CNN、TF-DeepCNN),代表局部特征提取范式;多尺度与时频特征融合类(WST-based CNN、TF-DeepCNN),代表时频融合与多尺度分析方向。

这些模型均为近年心音分类研究中引用频次高、性能较优、具有代表性的工作,且均基于相同的CinC 2016公共数据集进行验证,能够体现该任务的主流技术发展水平。因此,本研究将其作为主要baseline进行对比,以确保实验的公平性和结论的可信性。表7汇总了各方法的核心结构与性能表现。

从表中可以看出,现有的代表性方法在CinC 2016数据集上的平均分类准确率集中在85%~93%,主要受限于单一尺度特征提取或对时序关系建模能力不足。本研究提出的MS-DTNet在相同实验设置下达到96.61%的平均准确率,较现有SOTA模型显著提升,验证了其在多尺度特征融合与时序注意建模方面的有效性与优越性。

2.2 消融实验

设计并以本研究提出的模型MS-DTNet与以下6种模型进行对比:(1)Baseline模型:仅使用stem模块以及全局池化层,而其他模块则是移除,将这一模型记为“Baseline”模型;(2)Baseline-LMS:在Baseline模型中加入轻量化多尺度感受野模块,记为“Baseline-LMS”模型;(3)Baseline-LMS-RT:在Baseline模型中加入LMS模块以及R塔模块,记为“Baseline-LMS-RT”模型;(4)Baseline-LMS-LT:在Baseline模型中加入LMS模块以及L塔模块,记为“Baseline-LMS-LT”模型;(5)Baseline-DT:在Baseline模型中加入DT模块,记为“Baseline-DT”模型;(6)MS-DTNet-noflip:在本研究提出的MS-DTNet中,去除了翻转注意力机制的翻转操作,去除了反向路径注意力部分,记为“MS-DTNet-noflip”模型;(7)MS-DTNet-SE:在本研究提出的MS-DTNet模型中,将翻转注意力机制模块改为SE模块,记为“MS-DTNet-SE”模型;(8)MS-DTNet-CBAM:在本研究提出的MS-DTNet模型中,将翻转注意力机制模块改为CBAM模块,记为“MS-DTNet-CBAM”模型48;(9)MS-DTNet:本研究提出的模型,在Baseline模型中加入了LMS模块、DT模块、翻转注意力机制。

在消融实验中,除了模型结构外,其他包括数据集、损失函数、优化器等实验设置均保持一致,本实验所有模型同样采用五折交叉验证方法。

Baseline模型在分类任务中的五折交叉实验的平均初始准确率仅为(81.95±2.14)%;当加入LMS模块后,Baseline-LMS模型的平均准确率提升至(83.14±4.40)%;当Baseline-LMS模型引入RT模块后,Baseline-LMS-RT模型的平均准确率提升至(90.64±3.25)%;当Baseline-LMS模型引入LT模块后,Baseline-LMS-LT模型的平均准确率提升至(91.84±4.79)%;当Baseline模型仅引入DT模块,Baseline-DT模型的平均准确率为(94.70±2.02)%;当我们提出的MS-DTNet去除了翻转注意力中翻转操作,MS-DTNet-noflip-attention模型在五折交叉实验的平均准确率为(92.17±1.08)%;另外,本研究MS-DTNet模型中翻转注意力机制改为标准SE注意力机制的平均准确率为(93.10±0.77)%;本研究MS-DTNet模型中翻转注意力机制改为CBAM注意力机制的平均准确率为(92.77±0.88)%;最后,本研究提出的MS-DTNet在五折交叉实验的平均准确率为(96.61±0.72%)。

3 讨论

本研究提出的MS-DTNet在CinC2016数据集上取得了96.61%的平均准确率与98.99%的AUROC,整体性能明显优于多篇已有方法,与这些方法相比,MS-DTNet能够实现高精度,其性能优势主要来自以下方面:一是DSC的高效特征提取,二是LMS模块对不同时间跨度的特征细节的有效捕捉,三是DT结构的全局-局部互补,四是翻转注意力机制的多视角特征增强。DSC将标准卷积分解为深度卷积与逐点卷积,在减少参数量和计算量的同时保留了关键的时序特征提取能力,这与MobileNet49在语音与图像任务中的发现相呼应,也验证了DSC在PCG这一非平稳时序数据上的可行性与鲁棒性。

LMS模块利用多种卷积核并行操作,有效捕获了从短期S1/S2到长期杂音的不同时间尺度特征,这是为了解决引言中指出的心音非平稳、病理模式持续时间跨度大的挑战。与Jin-A等通过多尺度小波分析实现时频特征捕捉的策略相比,MS-DTNet在端到端框架下以更低计算成本实现了类似的多尺度感知。

DT结构则通过增强塔与轻量塔的并行建模,实现了局部细节与全局模式的互补:轻量塔聚焦局部细节,增强塔强调长程依赖,二者通道维融合使特征多样性与鲁棒性显著提升。这一结果与ResNeXt类架构在图像领域的分组卷积优势一致,也提示PCG的全局-局部混合建模可成为未来PCG分析的一个新框架,与Li等提出的ECG+PCG双模态并行结构不谋而合,在本研究中单一PCG模态下即可达到类似的多模态优势,这表明合理的架构设计可部分替代多模态输入带来的信息增益。

翻转注意力机制进一步提升了模型的泛化能力与鲁棒性,该机制通过在通道维度翻转后再次施加通道与空间注意力,使得模型打破了对特定通道顺序的潜在依赖,实现了通道维度上的对称结构正则化,从而降低过拟合风险并强化模型对关键特征地稳健表达。翻转注意力机制与经典SE模块相比,这一设计在计算量几乎不增加的情况下带来了稳定的性能增益,补充了现有注意力机制主要关注特征选择而较少考虑特征顺序扰动的研究空白,也为未来轻量化注意力的设计提供了新的思路。消融实验表明,当去除翻转操作时,模型的平均准确率从96.61%降至92.17%,这验证了翻转注意力在增强特征鲁棒性和提高泛化能力方面的实际价值。

本研究的主要贡献如下:其一,本研究提出了“轻量化-多尺度-双塔-翻转注意力”这一整体框架,证明在单模态PCG下即可同时兼顾高精度与高效率需求,为PCG深度建模提供了新的体系化方案。其二,本研究验证并扩展了多尺度特征在心音分类中的核心地位:即便不依赖外部时频变换,仅通过卷积核尺度并行即可实现多时间尺度病理模式的有效捕获。其三,本研究引入翻转注意力这一正则化注意力策略,并且揭示了通道顺序对称结构正则化可提升模型泛化的潜在机制,为注意力机制的理论发展提供了新的视角。

尽管MS-DTNet在精度与效率上均表现出色,其仍存在以下局限:本研究在CinC2016数据集上进行训练,对于跨地区、跨年龄和特殊病理的人群有待通过多中心数据验证及迁移学习来提升,因此在模型的泛化能力上仍存在一定的局限;虽然翻转注意力提供了一定的可解释性,但本研究与临床诊断知识的深度融合仍不足,尚不能完全满足临床决策的可解释需求。基于现有研究基础,未来将从以下方面进行深入研究:(1)建立标准化PCG信号预处理平台,整合来自不同地区、不同设备及不同采集环境的多源PCG数据,从而进行全面的模型训练与评估,提升模型在不同数据集上的泛化能力和适用性;(2)便携式健康检测设备:我们将进一步优化模型并将其部署于可穿戴设备中,为患者提供便捷的实时的PCG监测服务;(3)引入可视化和可解释性工具,将注意力权重与心音病理学标注对齐以辅助医生决策;(4)融合心电图、脑电图等多模态生理信号,探索更丰富的跨模态特征交互。

参考文献

[1]

World Health Organization. Global report on hypertension: the race against a silent killer[M]. World Health Organization, 2023.

[2]

刘明波, 何新叶, 杨晓红, . 《中国心血管健康与疾病报告2023》要点解读[J]. 中国心血管杂志, 2024, 29(4): 305-24. doi:10.3969/j.issn.1007-5410.2024.04.002

[3]

Rangayyan R M, Lehner R J. Phonocardiogram signal analysis: a review[J]. Critical Reviews Biomedical Engineering, 1987, 15(3): 211-36.

[4]

Krishnan PT, Balasubramanian P, Umapathy S. Automated heart sound classification system from unsegmented phonocardiogram (PCG) using deep neural network[J]. Phys Eng Sci Med, 2020, 43(2): 505-15. doi:10.1007/s13246-020-00851-w

[5]

LeCun Y, Bengio Y, Hinton G. Deep learning[J]. Nature, 2015, 521(7553): 436-44. doi:10.1038/nature14539

[6]

Chen W, Sun Q, Chen XM, et al. Deep learning methods for heart sounds classification: a systematic review[J]. Entropy, 2021, 23(6): 667. doi:10.3390/E23060667

[7]

Misal A, Sinha G R. Denoising of PCG signal by using wavelet transforms[J]. Advances in Computational Research, 2012, 4(1): 46-9. doi:10.26634/jcs.1.1.1740

[8]

Farzam B, Shirazi J. The diagnosis of heart diseases based on PCG signals using MFCC coefficients and SVM classifier[J]. IJISET-International J Innovative Science, Engineering & Technology, 2014, 1(10): 230-8.

[9]

Ari S, Hembram K, Saha G. Detection of cardiac abnormality from PCG signal using LMS based least square SVM classifier[J]. Expert Syst Appl, 2010, 37(12): 8019-26. doi:10.1016/j.eswa.2010.05.088

[10]

Ghosh SK, Tripathy RK, Ponnalagu R N. Classification of PCG signals using Fourier-based synchrosqueezing transform and support vector machine[C]//2021 IEEE Sensors. October 31-November 3, 2021. Sydney, Australia. IEEE, 2021: 1-4. DOI:10.1109/sensors47087.2021. 9639687 .

[11]

Arslan Ö. Automated detection of heart valve disorders with time-frequency and deep features on PCG signals[J]. Biomed Signal Process Control, 2022, 78: 103929. doi:10.1016/j.bspc.2022.103929

[12]

Zhang X, Lin MJ, Hong Y, et al. MSFT: a multi-scale feature-based transformer model for arrhythmia classification[J]. Biomed Signal Process Control, 2025, 100: 106968. doi:10.1016/j.bspc.2024.106968

[13]

Alzubaidi L, Zhang JL, Humaidi AJ, et al. Review of deep learning: concepts, CNN architectures, challenges, applications, future directions[J]. J Big Data, 2021, 8(1): 53. doi:10.1186/s40537-021-00444-8

[14]

Sherstinsky A. Fundamentals of recurrent neural network (RNN) and long short-term memory (LSTM) network[J]. Phys D Nonlinear Phenom, 2020, 404: 132306. doi:10.1016/j.physd.2019.132306

[15]

Wang J, Yang Y, Mao JH, et al. CNN-RNN: a unified framework for multi-label image classification[C]//2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). June 27-30, 2016. Las Vegas, NV, USA. IEEE, 2016: 2285-94. DOI:10.1109/cvpr.2016.251 .

[16]

Han K, Xiao A, Wu E, et al. Transformer in transformer[J]. Advances Neural Information Processing Systems, 2021, 34: 15908-19.

[17]

Lin MJ, Zhang X, Hong Y, et al. RDiffGAN-ECG: High-quality specific R-peaks conditional ECG generation using denoising diffusion generative adversarial network with state space models[J]. Biomed Signal Process Control, 2026, 112: 108544. doi:10.1016/j.bspc.2025.108544

[18]

Bao XQ, Xu YJ, Kamavuako EN. The effect of signal duration on the classification of heart sounds: a deep learning approach[J]. Sensors, 2022, 22(6): 2261. doi:10.3390/s22062261

[19]

Xiao B, Xu YQ, Bi XL, et al. Heart sounds classification using a novel 1-D convolutional neural network with extremely low parameter consumption[J]. Neurocomputing, 2020, 392: 153-9. doi:10.1016/j.neucom.2018.09.101

[20]

Orozco-Reyes L, Alonso-Arévalo MA, García-Canseco E, et al. A deep-learning approach to heart sound classification based on combined time-frequency representations[J]. Technologies, 2025, 13(4): 147. doi:10.3390/technologies13040147

[21]

Harimi A, Majd Y, Gharahbagh AA, et al. Classification of heart sounds using chaogram transform and deep convolutional neural network transfer learning[J]. Sensors, 2022, 22(24): 9569. doi:10.3390/s22249569

[22]

Suchithra KP, Mohan N. Deep learning-based classification ofPCG signals using chaogram transform andCNN-LSTM network[C]//Innovative Computing and Communications. Singapore: Springer, 2024: 567-76. doi:10.1007/978-981-97-3817-5_40

[23]

Zhu LX, Qiu WY, Ma Y, et al. LEPCNet: a lightweight end-to-end PCG classification neural network model for wearable devices[J]. IEEE Trans Instrum Meas, 2024, 73: 1-11. doi:10.1109/tim.2023.3315401

[24]

Barnawi A, Boulares M, Somai R. Simple and powerful PCG classification method based on selection and transfer learning for precision medicine application[J]. Bioengineering, 2023, 10(3): 294. doi:10.3390/bioengineering10030294

[25]

Touahria R, Hacine-Gharbi A, Ravier P, et al. Relevant multi domain features selection based on mutual information for heart sound classification[C]//Proceedings of the 13th International Conference on Pattern Recognition Applications and Methods. February 24-26, 2024. Rome, Italy. SCITEPRESS-Science and Technology Publications, 2024: 918-23. DOI:10.5220/0012565300003654 .

[26]

Sondermann M, Bisgin P, Tschorn N, et al. Comparative Analysis of CNN and Transformer Architectures with Heart Cycle Normalization for Automated Phonocardiogram Classification[J]. arXiv preprint arXiv:2025. doi:10.1109/EMBC58623.2025.11251770

[27]

Liu CY, Springer D, Li Q, et al. An open access database for the evaluation of heart sound algorithms[J]. Physiol Meas, 2016, 37(12): 2181-213. doi:10.1088/0967-3334/37/12/2181

[28]

Egger J. PCG-cut: graph driven segmentation of the prostate central gland[J]. PLoS One, 2013, 8(10): e76645. doi:10.1371/journal.pone.0076645

[29]

Cheadle C, Vawter MP, Freed WJ, et al. Analysis of microarray data using Z score transformation[J]. J Mol Diagn, 2003, 5(2): 73-81. doi:10.1016/s1525-1578(10)60455-2

[30]

Sharma S. Digital signal processing[M]. Khanna Publishing, 2025. doi:10.1016/j.bspc.2024.106826

[31]

Groeneveld RA, Meeden G. Measuring skewness and kurtosis[J]. Statistician, 1984, 33(4): 391. doi:10.2307/2987742

[32]

KaySteven M. Fundamentals of statistical signal processing: estimation theory[M]. Technometrics,1995. doi:10.2307/1269750

[33]

Boashash B.Time-Frequency Signal Analysis and Processing: A Comprehensive Review[M]. Oxford: Academic Press. doi:10.1016/b978-0-12-398499-9.09989-1

[34]

Ramı́rez J, Segura JC, Benı́tez C, et al. Efficient voice activity detection algorithms using long-term speech information[J]. Speech Commun, 2004, 42(3/4): 271-87. doi:10.1016/j.specom.2003.10.002

[35]

Rabiner L. On the use of autocorrelation analysis for pitch detection[J]. IEEE Trans Acoust, Speech, Signal Process, 1977, 25(1): 24-33. doi:10.1109/tassp.1977.1162905

[36]

Kedem B. Spectral analysis and discrimination by zero-crossings[J]. Proc IEEE, 1986, 74(11): 1477-93. doi:10.1109/proc.1986.13663

[37]

Sujit NR, Kumar CS, Rajesh CB. Improving the performance of cardiac abnormality detection from PCG signal[J]. AIP Conf Proc, 2016, 1715: 020053. doi:10.1063/1.4942735

[38]

Elizar E, Zulkifley MA, Muharar R, et al. A review on multiscale-deep-learning applications[J]. Sensors, 2022, 22(19): 7384. doi:10.3390/s22197384

[39]

He Q, Li XK, Cai B. Graph neural network recommendation algorithm based on improved dual tower model[J]. Sci Rep, 2024, 14: 3853. doi:10.1038/s41598-024-54376-3

[40]

Meng T, Tao Y, Chen ZQ, et al. Depth evaluation for metal surface defects by eddy current testing using deep residual convolutional neural networks[J]. IEEE Trans Instrum Meas, 2021, 70: 1-13. doi:10.48550/arXiv.2104.02472

[41]

Chollet F. Xception: deep learning with depthwise separable convolutions[C]//2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). July 21-26, 2017. Honolulu, HI. IEEE, 2017: 1251-8. DOI:10.1109/cvpr. 2017. 195 .

[42]

Hu J, Shen L, Sun G. Squeeze-and-excitation networks[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. June 18-23, 2018. Salt Lake City, UT. IEEE, 2018: 7132-41. DOI:10.1109/cvpr.2018.00745 .

[43]

Cohen T, Welling M. Group equivariant convolutional networks[C]//International conference on machine learning. PMLR, 2016: 2990-9. doi:10.48550/arXiv.1602.07576

[44]

Liu B, Wang C, Liu X, et al. HyMamba: Mamba with Hybrid Geometry-Feature Coupling for Efficient Point Cloud Classification[J]. arXiv preprint arXiv:2025.

[45]

Rastogi D, Johri P, Tiwari V, et al. Multi-class classification of brain tumour magnetic resonance images using multi-branch network with inception block and five-fold cross validation deep learning framework[J]. Biomed Signal Process Control, 2024, 88: 105602. doi:10.1016/j.bspc.2023.105602

[46]

Karhade J, Dash S, Ghosh SK, et al. Time-frequency-domain deep learning framework for the automated detection of heart valve disorders using PCG signals[J]. IEEE Trans Instrum Meas, 2022, 71: 1-11. doi:10.1109/tim.2022.3163156

[47]

Morshed M, Fattah SA. A deep neural network for heart valve defect classification from synchronously recorded ECG and PCG[J]. IEEE Sens Lett, 2023, 7(9): 1-4. doi:10.1109/lsens.2023.3307053

[48]

Woo S, Park J, Lee JY, et al. CBAM: convolutional block attention module[C]//Computer Vision-ECCV 2018. Cham: Springer, 2018: 3-19. doi:10.1007/978-3-030-01234-2_1

[49]

Tian GY, Lian C, Xu BR, et al. Classification of phonocardiogram based on multi-view deep network[J]. Neural Process Lett, 2023, 55(4): 3655-70. doi:10.1007/s11063-022-10771-3

基金资助

国家重点研发计划(2023YFC2414500)

国家重点研发计划(2023YFC2414502)

RIGHTS & PERMISSIONS

版权所有©《南方医科大学学报》编辑部2021

AI Summary AI Mindmap
PDF (1195KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/