基于膨胀卷积与图注意聚合的多模态医学图像融合

靳凯欣 ,  王丽芳 ,  郭威 ,  韩强 ,  郁晓庆

中北大学学报(自然科学版) ›› 2025, Vol. 46 ›› Issue (05) : 549 -560.

PDF (5464KB)
中北大学学报(自然科学版) ›› 2025, Vol. 46 ›› Issue (05) : 549 -560. DOI: 10.62756/jnuc.issn.1673-3193.2025.01.0006
智能图像处理技术专栏

基于膨胀卷积与图注意聚合的多模态医学图像融合

作者信息 +

Multimodal Medical Image Fusion Based on Dilated Convolution and Graph Attention Aggregation

Author information +
文章历史 +
PDF (5594K)

摘要

针对目前基于深度学习的多模态医学图像融合方法存在高级特征提取不足和低级特征容易丢失的问题, 本文提出了基于膨胀卷积与图注意聚合的多模态医学图像融合方法。该方法由双分支编码器、 融合模块和解码器三部分组成。双分支编码器由基于卷积的低级编码器和基于图卷积的高级编码器构成。其中, 基于卷积的低级编码器主要采用膨胀卷积来减少纹理细节等低级特征的丢失, 同时为高级编码器提供初始化的节点特征。基于图卷积的高级编码器则主要采用图注意聚合模块, 有效捕获深层语义等高级特征。图注意聚合模块结合边缘编码的多头注意力构建节点邻接矩阵, 再基于此邻接矩阵通过图卷积对节点进行深层聚合。融合模块对提取到的特征进行融合, 最后使用解码器重建融合图像。将该方法与6种先进的图像融合方法在主观视觉和客观评价指标上进行了对比。结果显示, 该方法在EN上相较于IGNet方法提升了2.4%, 在AG和MI上相较于DATFuse方法分别提升了3.53%和5.06%, 在SD、 SF和SCD上相较于SwinFusion方法分别提升了1.18%, 6.24%和3%,同时该方法得到的融合图像保留了更多的纹理细节信息。综合实验结果表明, 该方法实现了多模态医学图像的有效融合, 为临床诊断提供了更可靠的图像支持。

Abstract

Existing deep learning-based multimodal medical image fusion methods suffer from insufficient high-level feature extraction and easy loss of low-level features. To tackle these problems, this paper proposed a multimodal medical image fusion method based on dilated convolution and graph attention aggregation. The method was comprised of three components: a dual-branch encoder, a fusion module, and a decoder. The dual-branch encoder consisted of a convolution-based low-level encoder and a graph-convolution-based high-level encoder. The convolution-based low-level encoder employed dilated convolution to mitigate the loss of low-level features like texture details and provided initialized node features for the high-level encoder. The graph-convolution-based high-level encoder mainly adopted the graph attention aggregation module to effectively capture high-level features such as deep semantics. The graph attention aggregation module constructed a node adjacency matrix by integrating multi-head attention with edge encoding and then performed deep aggregation of nodes through graph convolution based on this adjacency matrix. The fusion module fused the extracted features, and the decoder reconstructed the fused image. The method was compared with six state-of-the-art image fusion methods on subjective vision and objective evaluation metrics. The results show that this method improves 2.4% on EN compared to the IGNet method, 3.53% and 5.06% on AG and MI compared to the DATFuse method, and 1.18%, 6.24%, and 3% on SD, SF, and SCD compared to the SwinFusion method, respectively, while the fused image obtained by this method retains more texture detail information. The comprehensive experimental results demonstrate that this method achieves effective fusion of multimodal medical images, offering more reliable image support for clinical diagnosis.

Graphical abstract

关键词

多模态医学图像融合 / 双分支编码器 / 膨胀卷积 / 图卷积 / 多头注意

Key words

multimodal medical image fusion / dual-branch encoder / dilated convolution / graph convolution / multi-head attention

引用本文

引用格式 ▾
靳凯欣,王丽芳,郭威,韩强,郁晓庆. 基于膨胀卷积与图注意聚合的多模态医学图像融合[J]. 中北大学学报(自然科学版), 2025, 46(05): 549-560 DOI:10.62756/jnuc.issn.1673-3193.2025.01.0006

登录浏览全文

4963

注册一个新账户 忘记密码

0 引 言

在临床医学中, 多模态医学图像融合技术展现出了无可替代的重要性, 突破了单一模态图像在揭示人体复杂生理结构时的信息局限性1。例如, 计算机断层扫描(Computed Tomography, CT)或核磁共振成像(Magnetic Resonance Imaging, MRI)擅长于捕捉特定类型的信息, CT在骨骼成像上表现出高空间分辨率, 但软组织对比度不足, 而MRI则在软组织成像上更优, 但骨骼成像分辨率较低。多模态图像融合技术整合了两者优势, 可生成既包含详尽骨骼结构又具备丰富软组织细节的图像2, 为临床诊断和治疗提供更全面的信息支持。

现有的多模态医学图像融合方法分为传统的融合方法和基于深度学习的融合方法。传统的融合方法存在融合质量不佳和计算复杂的问题, 例如: 基于空间域的方法3会带来空间畸变和光谱畸变的问题, 基于变换域的方法4存在参数过多和参数设置复杂的问题。基于深度学习的融合方法5-6具有强大的特征提取能力和数据表达能力, 而卷积神经网络(Convolutional Neural Network, CNN)和Transformer作为深度学习的重要分支, 在特征提取中发挥着不同作用。其中, CNN通过其内部卷积核的局部感受野, 能够充分提取局部重要信息7-8, 如Shao等9提出的自适应频域优化的渐进式医学图像融合网络, 利用CNN充分保留了医学图像的纹理细节等局部信息, 但是CNN在特征提取上存在全局上下文信息容易丢失的问题。Transformer10通过其注意机制更好地建立长期依赖关系, 解决了全局上下文信息丢失的问题, 如Chen等11提出了一种用于高级视觉任务的HitFusion, 通过采用Transformer学习了源图像之间的跨特征相关性和长距离依赖性, 但其存在局部信息容易丢失的问题。为了充分提取全局上下文信息且不丢失局部信息, Li等12提出了混合密集连接CNN与Transformer网络, 该网络融合了Transformer和CNN结构, 以充分提取图像中的全局和局部信息。然而, Transformer在处理医学图像时, 因其采用单一尺度的注意力机制, 难以捕捉特征层次化演变, 进而导致病灶深层语义特征与组织结构的多尺度上下文等高级特征提取不足。

图神经网络(Graph Neural Networks, GNN)作为深度学习的一个重要分支, 在处理非结构化数据方面展现了强大的语义信息表示能力。非结构化数据以节点和边构成的图结构形式存在。GNN通过聚合节点及其邻居节点的特征信息, 使其在处理具有多层次、 多关系的数据时, 能够更准确地捕捉特征间的关联性和演变规律, 从而能提取出更丰富的高级特征13。例如, Xu等14提出的对比图池化, 借助GNN捕获图的上下文与邻居节点信息, 提取出丰富的脑组织结构等高级特征。鉴于GNN的这些优势, 它被用于了多模态图像融合领域15。其中, Li等16采用了图表示学习方法对图像进行特征学习, 深入挖掘疾病结构等高级特征, 使得融合后的图像能够更精确地反映源图像中的语义信息。然而, 上述方法在特征提取上依赖堆叠的图神经网络结构, 存在明显局限。简单的堆叠结构在处理图像时会引发过度平滑问题, 致使颜色、 边缘以及局部纹理等用于初步识别病灶的低级特征丢失。同时, 对于像病理组织学特征和疾病阶段特征这类有助于深入理解疾病的高级特征, 也难以做到充分提取与利用。鉴于低级和高级特征对融合结果的准确性和信息完整性都十分关键, 有效融合并利用这些特征成为亟待解决的问题。

针对上述多模态医学图像融合方法中存在着高级特征提取不足和低级特征容易丢失的问题, 本文提出一种基于膨胀卷积和图注意聚合的多模态医学图像融合方法。该方法首先采用基于CNN的低级编码器和基于GCN的高级编码器分别进行低级和高级特征提取。其中, 在基于CNN的低级编码器中, 通过使用基于膨胀卷积的多尺度模块高效地提取图像中不同尺度和感受野的低级特征, 同时为高级编码器提供更全面的节点特征表示。在基于GCN的高级编码器中, 通过使用图注意聚合模块基于结合边缘编码的多头注意力为节点构建了具有全局信息的邻接矩阵, 再使用图卷积神经网络聚合深层节点特征, 以充分捕获高级特征。然后使用分级Softmax多模态融合网络进行特征融合, 最后通过解码器对图像进行重建。对比实验表明, 本文方法在主观视觉评价和客观评价指标上均优于最先进的6种图像融合方法。

1 相关工作

1.1 膨胀卷积

膨胀卷积是一种创新的卷积技术, 其与普通卷积的核心区别在于: 普通卷积以连续无间隔的方式对输入采样, 卷积核紧密作用于相邻像素, 感受野随网络层数呈线性扩展; 而膨胀卷积通过引入膨胀率(Dilation Rate), 在卷积核元素间增加 “空洞” 实现间隔采样17, 能够在不改变参数量、 不降低特征分辨率的前提下, 指数级扩大感受野。以3*3卷积核为例, 当Dilation=1(即未引入膨胀率)时, 卷积核以连续无间隔的方式对输入特征图进行采样; 当Dilation=2或Dilation=3时, 3*3膨胀卷积的实际感受野可拓展至5*5或7*7, 如图 1 所示。凭借这一特性, 膨胀卷积无需增加卷积核物理尺寸或显著提升计算负担18, 即可同时实现全局信息捕获与细节特征保留。

相较于普通卷积操作, 膨胀卷积确保了较大的感受野, 这对于解析复杂图像结构、 捕捉长距离依赖关系至关重要, 特别是在图像检测19、 分割20等高级视觉任务中, 由于膨胀卷积能够覆盖更广泛的区域, 它能够在不丢失细节的情况下, 更好地保留图像中的关键特征, 从而减少了特征丢失。

1.2 图卷积神经网络(GCN)

图神经网络(GNN)不同于CNN, CNN是对欧几里得空间中的数据集进行处理, 它将图像视为固定维度的矩阵; 而GNN用于非欧几里得空间的数据分析21, 早期应用于知识图谱22和蛋白质23 等非结构化数据处理。通过图像分割24将图像转换为图结构, GNN也可以有效处理结构化数据, 因此在图像分类25-26、 目标检测27等领域得到了广泛应用。

图卷积神经网络(Graph Convolutional Neural Network, GCN)属于GNN的一类, 是在图结构中引入卷积操作, 通过迭代聚合邻居节点的特征向量, 更新节点的隐藏状态, 从而学习节点的特征28。在GCN的第l层中, 输出的隐藏表示Hl, 如式(1)所示。

Hl=σ(D̑-12ȂD̑-12Hl-1Wl),

式中: Ȃ=A+IN为添加自连接的邻接矩阵, A 为邻接矩阵, IN为单位矩阵; D̑ij=jȂij, 为度矩阵; W 为特定层可训练的权重矩阵; σ(·)为激活函数; Hl-1为第l-1层的输出。

2 基于膨胀卷积与图注意聚合的多模态医学图像融合

本文提出的基于膨胀卷积和图注意聚合的多模态医学图像融合方法由双分支编码器、 融合模块和解码器三部分组成, 如图 2 所示。

在双分支编码器中使用基于CNN的低级编码器和基于GCN的高级编码器来分别提取低级和高级特征。在基于CNN的低级编码器中, 使用基于膨胀卷积的多尺度模块提取不同尺度和感受野的纹理细节等低级特征Xlow。在基于GCN的高级编码器中, 图构建模块结合多尺度模块的特征图X¯生成节点特征矩阵 H, 然后图注意聚合模块通过结合边缘编码的多头注意力构建邻接矩阵 A, 并利用图卷积聚合节点的深层结构信息, 得到高级特征H¯, 最后图形编码器将图结构信息转化为特征图Xhigh。融合模块采用分级Softmax多模态融合网络整合特征f, 最后由解码器重建融合图像If

2.1 基于CNN的低级编码器

基于CNN的低级编码器由两层CNN模块和基于膨胀卷积的多尺度模块构成, 如图 2 所示。

首先, CNN模块1通过两个卷积块提取浅层特征XRH*W*N/(2*2)。其中, 卷积块1由1*1卷积和Relu函数构成, 卷积块2由stride=2、 kenerl size=3*3、 padding=1的卷积、 BatchNorm和Relu函数构成。

在多尺度模块中使用膨胀卷积从浅层特征X中捕获更为丰富且多尺度的信息, 如图 3 所示。该模块采用3个不同膨胀率(1、 3、 5)的平行路径, 每个路径包含两组膨胀卷积块, 每块由BatchNorm、 3*3膨胀卷积和Relu函数构成。此外, 两层卷积间添加了kenerl size=3*3, stride=1, padding=1的平均池化层, 以减少冗余信息并保持图像尺寸不变。经过多尺度模块后得到不同尺度和感受野的低级特征。最后, 这些特征通过CNN模块2整合。其中, CNN模块2由两个卷积块构成, 每个卷积块均由3*3卷积、 BatchNorm和Relu函数构成, 最终得到低级特征XlowRH*W*N/(2*2)

2.2 基于GCN的高级编码器

本文采用基于GCN的高级编码器充分学习图结构信息, 以捕获更全面的高级特征。整个分支分为三部分: 图构建模块、 图注意聚合模块和图形编码器, 如图 2 中的基于GCN的高级编码器所示。

2.2.1 图构建模块

图构建模块是将图像构建为图结构并生成节点特征矩阵, 整个过程划分为图像分割和节点初始化两个阶段, 如图 4 所示。

在图像分割阶段, 首先将图像IctRH*W*C平均分割为多个图像块, 以减少计算复杂度, 将分割后的图像块视作图结构中的节点, 节点表示为V={v1,v2,,vn}; 对于每个节点vi, 根据K-近邻算法来计算图像块之间的欧氏距离, 选出k个最近邻居节点NVi, 为节点vi与其邻居节点NVi之间添加一条边Eij, 由此得到图结构表示G=V,E

在节点初始化阶段, 本文利用膨胀卷积提取多尺度特征的能力, 将提取的特征作为节点初始特征H={h1,h2,,hn}。通过这种方式, 节点能够捕捉丰富的多尺度信息, 提升节点特征的表达能力, 同时为图注意聚合提供高质量的输入。如图4所示, 将多尺度模块的特征图X¯上采样至图像大小得到X˜, 将X˜与图像块(即节点)进行匹配, 并在X˜中选取出最大像素值作为相应的节点特征, 确保每个节点捕获对应区域最显著的特征, 最终得到节点特征矩阵HRn*d, 如式(2)所示。

Hij=max(p,q)PkX˜j,(p,q),

式中: HijRn*d为第i个节点的第j个特征; Pk为第k个图像块; (pq)为Pk中每个像素的位置; X˜j,(p,q)为位置(pq)第j个通道中特征图的值。

2.2.2 图注意聚合模块

图注意聚合模块主要由多头注意力和图卷积块组成, 如图 2 所示。

多头注意力通过结合边缘编码共同构建邻接矩阵, 捕捉节点的全局结构信息和连接特性, 优化图卷积对节点深层特征的聚合。其中, 多头注意力通过并行多个注意力头, 计算图中节点全局结构信息。边缘编码通过高斯函数对节点之间的边进行权重赋值, 以此更好地反映节点之间的相似性和关联性, 具体的计算式如(3)所示。

Eij=ϕ(hi-hj),ifhjN(hi),0,otherwise,

式中: Eij为节点ij之间的边缘编码; ϕ(x)=e-rx2为高斯函数; hi-hj2为节点之间的欧几里得距离; r是一个经验设定的值, 赋值为0.2; N(hi)为节点hi的邻接节点集合。

多头注意力的具体结构如图 5 所示, 首先将节点特征HRn*d送入到具有M个头的多头注意力中进行分头计算, 然后由线性变换得到向量序列 QKV, 再计算每个注意力头中 QK 值相似度矩阵S¯, 同时结合边缘编码E, 由式(4)~式(5)表示。

S¯ij=(hiWQ)(hjWk)Td,
Sij=S¯ij+Eij,

式中: WQWK分别为 QK 的投影权值; d为节点特征的维度。计算 QK 的相似度矩阵 S 后, 再经过softmax层后与 V 值进行注意力关系的计算, 依次得到M个头的关系矩阵G={G1,G2,GM}, 然后使用一组可学习的权重向量W=[w1,w2,,wM]R1*M, 学习最终的邻接矩阵ARn*n, 由式(6)~式(7)表示。

G=Attn(H)=softmax(S)V,
A=i=1MwiGi,

图卷积块主要结合了图卷积网络(GCN)和前馈神经网络(FFN)的优势, 实现了对图中节点特征的深度聚合, 不仅显著提升了节点特征的表达能力, 还增强了模型对图结构的处理能力。其中, 图卷积块由三层包含GCN和FFN的GCF块堆叠而成, 如图 6 所示。GCN块由图卷积和Relu函数构成, 用于聚合节点特征; FFN由两个卷积块组成, 卷积块中包含BatchNorm、 1*1卷积和Relu函数, 避免了堆叠GCN出现过度平滑现象29。图卷积块的公式由式(8)~式(10)表示。

GCF(Hl-1,A)=Hl=FFNH̑l)+H̑l,
FFN(H̑l-1)=Conv(Conv(H̑l)),
H̑l=GCN(Hl-1)+Hl-1,GCN(Hl-1)=σ(D̑-12ȂD̑-12Hl-1Wl),

式中: Hl-1l-1层GCF模块的输出; D̑为度矩阵; Ȃ=A+IN为添加自连接的邻接矩阵, A 为邻接矩阵, IN为单位矩阵; W 为可学习的权重; σ为激活函数; Conv为卷积块。

2.2.3 图形编码器

在图形编码器中, 通过构建图像块与像素之间的映射矩阵 Q30, 可以有效地将图结构信息转换为特征图XhighRH*W*N, 由式(11)~式(12)所示。

Qi,j=1,ifX̑iPj,0,otherwise,X̑=Flatten(I),
Xhigh=Reshape(QH¯),

式中: Pj为第j个图像块; IRH*W*C为原始图像; Flatten(·)为将空间维度平坦化; X̑iRHW*C为平坦后的原始像素中第i个像素; Qi,j为第i个像素和第j个图像块之间的关系; Reshape(·)为恢复数据的空间维度。

2.3 分级Softmax多模态融合网络

本文采用分级Softmax多模态融合网络进行特征融合, 其结构如图 7 所示。首先融合不同模态的同级别特征, 确保同级别信息的有效整合; 再融合不同级别的特征, 实现跨级别信息的交互与利用。

在分级Softmax多模态融合网络中, 首先分别将不同模态的低级特征XlowRH*W*N/(2*2)上采样至高级特征XhighRH*W*N相同尺寸, 然后对不同模态的高低级特征分别进行串联, 以得到不同级别的特征f1f2。然后使用Softmax加权对f1f2进行特征融合, 将f1f2进行归一化处理, 以减少后续计算的复杂度得到f1'f2'。然后分别对f1'f2'中各个通道信息进行求和, 将多通道特征压缩为单通道特征, 来捕获不同级别的整体信息, 由式(13)所示。

S1=jf'1,j,    S2=jf'2,j,

式中: S1S2为不同级别的单通道特征; f1,j'f2,j'为不同级别的第j个通道的特征, 对得到的S1S2使用Softmax函数, 以获得不同级别特征的权重W1W2, 由式(14)所示。

Wi=exp(Si)iexpSi

式中: Wi ,i{1,2}, 为不同级别的权重值; exp表示指数运算。最终, 融合不同级别权重值与相应特征得到融合特征f, 由式(15)表示。

f=W1f'1+W2f'2

2.4 解码器

解码器由3个CNN模块构成, 将融合特征f重构得到图像If, 如图 2 中的解码器所示。每个CNN模块均由两层的3*3的卷积、 BatchNorm和Rule函数构成, 用于提取和恢复特征, 从而实现对融合特征的重建, 同时为了避免梯度消失, 在CNN模块1和2与CNN模块2和3之间采用了残差连接的方式, 最后得到重建融合图像If

2.5 无监督训练

本文方法采用的是无监督训练, 旨在通过对单一图像重建的方式, 对双分支编码器与解码器进行训练。在训练过程中使用由重建损失Lrecon和梯度损失Lgradient构成的总损失函数Ltotal进行无监督训练。其中, Lrecon避免了源图像在编码和解码过程中信息的丢失, Lgradient保留了源图像更多的纹理细节信息, 由式(16)~式(18)表示。

Ltotal=Lrecon+βLgradient,
Lrecon=Ict-Ict'22,
Lgradient=1HWIct-Ict'1,

式中: β为调优参数; 2L2范数; Ict为源图像的梯度信息; Ict'为重构图像的梯度信息; 1L1范数。

3 实 验

3.1 数据集及参数设置

本文的数据集来自美国哈佛医学院官方网站所开源的正常脑图像和脑肿瘤疾病图像, 从中挑选出脑部纹理清晰、 细节特征丰富的数据集, 其中包含CT、 MRI等医学图像共10 000张作为训练集, 已配准的成对CT/MRI图像共20 对作为测试集。 所有图像大小统一调整为256×256。

参数设置: GPU为GeFore RTX3090搭载24 GB; 环境框架为Pytorch; 训练时使用Adam优化器, batch-size设置为16, epoch设置为100, 初始学习率为1×10-4, 学习率每 20个epoch衰减0.5, 损失函数Ltotalβ设置为1。

3.2 评价指标

为了客观评价多模态医学图像融合方法的性能, 本文选取了7个常用指标: 熵、 标准差、 平均梯度、 互信息、 边缘信息保留、 空间频率和差异相关和。

熵(Entropy, EN): 衡量融合图像的信息丰富程度, 值越高表示纹理细节和多样性越多, 计算公式为

EN=-i=0L-1p(i)log2p(i),

式中: L为融合图像灰度级数; p(i)为灰度值i出现的概率。

标准差(Standard Deviation, SD): 评估图像信息丰富度, 值越大表示图像灰度分布更分散, 信息量更多, 融合图像质量越好, 计算公式为

SD=1MNi=1Mj=1N(F(i,j)-F¯)2,

式中: MN分别为图像的高和宽; F为融合图像; F¯为图像平均灰度。

平均梯度(Arerage Gradient, AG): 描述图像的边缘特征, 值越高表示边缘特征越明显和丰富, 计算公式为

AG=1MNi=1Mj=1NFx2(i,j)+Fy2(i,j)2,

式中: Ix2Iy2分别为融合图像Fxy轴熵的梯度。

互信息(Mutual Information, MI): 度量源图像与融合图像之间的信息特征相似性, 值越高表示信息特征越丰富, 计算公式为

MI(A,B)=H(A)+H(B)-H(A,B),

式中: H()为计算图像的熵; A、 B分别为源图像。

边缘信息传递因子(Edge Information Transmission Factor, QAB/F): 测量源图像与融合图像的边缘信息量, 值越大表示边缘信息保存得越好, 计算公式为

QAB/F=i=1Nj=1M(QAF(i,j)ωA(i,j)+QBF(i,j)ωB(i,j))i=1Nj=1M(ωA(i,j)+ωB(i,j)),

式中: QAF(i,j)QBF(i,j)为不同源图像AB与融合图像之间的边缘信息保存值; ωA(i,j)ωB(i,j)为权重。

空间频率(Spatial Frequency, SF): 评估融合图像的灰度变化率, 值越大表示图像越清晰, 计算公式为

SF=RF2+CF2
CF=i=1Mj=1N(F(i,j)-F(i-1,j))2,
RF=i=1Mj=1N(F(i,j)-F(i,j-1))2,

式中: CFRF分别为列频率和行频率。

差异相关性总和(Sum of Correlations Differences, SCD): 测量融合图像与源图像之间的差异, 值越大表示相关性越高, 细节和结构特征保持得越好, 计算公式为

SCD=i,jA(i,j)DA,F(i,j)i,jA(i,j)2i,jDA,F(i,j)2+
i,jB(i,j)DB,F(i,j)i,jB(i,j)2i,jDB,F(i,j)2,

式中: DA,FDB,F分别表示融合图像F与源图像AB之间的差异; (i, j)表示图像中的像素位置。

3.3 对比实验

本文选取了6种基于深度学习的图像融合方法, 包括TUFusion31、 Swinfusion32、 IGNet33、 U2Fusion7、 ITFuse34, 和 DATFuse35, 将其与本文的方法进行定性和定量两个方面的比较, 以全面客观地评价本文方法在多模态医学图像融合上的性能。

3.3.1 定性比较

为评估本文方法在多模态医学图像融合中的效果, 选取脑肿瘤、 脑中风、 脑出血及脑梗四类典型病例的 CT/MRI 融合图像开展整体视觉定性比较。具体通过目视检查融合图像与原始模态图像的色彩合理性、 边缘清晰度、 组织对比度和尺寸的一致性以及模态互补性表现36

本文方法与6种对比方法得到的融合结果如图 8 所示。各方法具体表现如下: TUFusion在脑肿瘤、 脑中风等场景中虽保留了部分纹理细节与边缘特征, 但脑肿瘤病灶局部、 脑中风影像特定位置模糊, 病灶区域清晰度不足, 影响关键部位辨识; SwinFusion的融合图像亮度和对比度与源图像相近, 但在脑肿瘤和脑梗死影像中丢失部分精细细节, 边缘部分也有待完善; IGNet处理医学图像中的组织信息时精细结构不突出且整体亮度偏暗, 如脑梗死融合图像因亮度不足, 难以观察脑组织层次与病变细节; U2Fusion在脑肿瘤、 脑出血等场景中保留了丰富的纹理细节, 但脑部轮廓描绘有缺陷; ITFuse得到的融合结果整体颜色偏暗, 在脑肿瘤等场景中纹理细节显著模糊; DATFuse在融合MRI图像时, 对其细节突显不足, 如脑梗死图像无法充分突出组织细节而影响病灶细微特征的捕捉。在脑肿瘤、 脑中风等场景中, 本文方法能有效保留CT与MRI的纹理细节、 边缘等低级特征, 同时清晰表征了精细结构与脑组织的空间关系, 以及病灶位置与大小等高级特征。综上所述, 本文方法在视觉效果上优于6种对比方法, 可为医生诊断提供更优质的影像依据。

3.3.2 定量比较

将本文方法及6种对比方法在7种常用指标上进行定量比较, 实验的测试结果如表 1 所示, 其中, 黑色加粗字体表示该指标的最优值。本文方法在7种客观评价指标上均表现优异, 特别是在EN和SD指标上展示了卓越的图像内容和语义信息保留能力, 同时, 在QABF和AG指标上显示出对图像细节和边缘对比度的良好捕捉。SF、 SCD和MI指标进一步凸显了本文方法在综合保留高级和低级视觉特征上的全面优势。同时, 相较于表 1 中的次优值, 本文方法在EN、 SD、 AG、 SF、 SCD和MI上分别提升了2.4%, 1.18%, 3.53%, 6.24%, 3%和5.06%。其中, 提升比例=(最优值-次优值)/次优值×100%。这不仅体现了本文方法的实际应用潜力, 也为其在图像处理领域的广泛应用奠定了坚实基础。

此外, 图 9 的折线图进一步展示了本文方法与对比方法在测试集上的趋势对比。从图 9 中可以看出, 本文方法在指标上均呈现出明显的优势, 验证了其在图像融合和特征保留方面的优越性。

3.4 消融实验

消融实验旨在全面评估本文所提出的方法中各个关键组件以及损失函数权重对融合效果的具体贡献, 从而验证该方法在多模态医学图像融合任务上的有效性。为了清晰评估各组件和损失函数权重的影响, 本文设置了5组消融实验:

实验一: 将低级 CNN 编码器的多尺度模块中的膨胀卷积替换为普通卷积, 其余不变, 探究膨胀卷积对低级特征提取的影响。

实验二: 去除高级 GCN 编码器的多头注意力模块, 其余不变, 探究其对高级特征提取充分性的影响。

实验三: 去除多头注意力中的边缘编码, 其余不变, 验证其对高级特征丰富性及融合图像质量的影响。

实验四: 将损失函数权重设为 0, 使训练时损失函数不影响参数更新, 以明确梯度损失在融合过程的作用。

实验五: 将损失函数权重设为 2, 相比默认权重增大, 促使模型更关注梯度损失优化。

本文对上述消融实验结果开展了定性与定量对比分析, 其中定性结果如图 10 所示。

图 10 可以看出, 相比其他方法, 本文方法得到的融合图像更好地保留了骨骼结构和软组织细节, 有效地融合了CT/MRI图像的低级特征, 同时对脑肿瘤等病变区域的关键语义信息表征更为清晰, 且具有更丰富的高级特征。定量结果见表 2, 黑色加粗字体表示该指标的最优值, 带有下划线的为次优值。相较于表 2 中的每个指标的次优值, 本文方法在EN值、 SD值、 QABF值、 SF值、 SCD值和MI值上分别提升了3.93%, 2.32%, 4.08%, 3.98%, 0.72%和5.06%。综合上述定量和定性比较, 本文方法的融合效果优于其他方法。

4 结 论

本文所提出的基于膨胀卷积和图注意聚合的多模态医学图像融合方法, 通过采用基于CNN的低级编码器和基于GCN的高级编码器分别充分提取了低级和高级特征, 有效解决了多模态医学图像融合中存在高级特征提取不足和低级特征容易丢失的问题。从实验结果上可知, 本文方法得到的融合图像保留了更多的低级特征, 对纹理细节表征清晰, 保留了丰富的边缘特征, 同时保留了更为完整的高级特征, 清晰地描述了图像中病变区域的组织结构, 更有助于医生的诊断, 其在主观视觉评价和客观指标评价方面都有较好的表现。

本方法采用的双分支编码器在可解释性方面还存在一定局限, 同时, 模型的复杂结构使得其决策过程和特征表示难以直观理解, 这在一定程度上限制了其在临床实践中的广泛应用。后续可将本文方法与现有大模型相结合, 借助大模型强大的语义理解和知识表示能力来改善双分支编码器的可解释性, 进一步提升方法的性能和实用性, 从而更好地服务于医学诊断。

参考文献

[1]

DIWAKAR MSINGH PRAVI Vet al. A non-conventional review on multi-modality-based medical image fusion[J]. Diagnostics202313(5): 820.

[2]

HUANG BYANG FYIN Met al. A review of multimodal medical image fusion techniques [J]. Computational and Mathematical Methods in Medicine20202020: 8279342.

[3]

DU JLI W. Two - scale image decomposition based image fusion using structure tensor [J]. International Journal of Imaging Systems and Technology202030(2): 271-284.

[4]

XIA J MCHEN Y MCHEN A Yet al. Medical image fusion based on sparse representation and PCNN in NSCT domain [J]. Computational and Mathematical Methods in Medicine2018(1): 2806047.

[5]

WEI XQIU YXU Xet al. ECINFusion: A novel explicit channel-wise interaction network for unified multi-modal medical image fusion[J]. IEEE Transactions on Circuits and Systems for Video Technology202535(5): 4011-4025.

[6]

CHEN JDING JYU Yet al. THFuse: An infrared and visible image fusion network using transformer and hybrid feature extractor[J]. Neurocomputing2023527: 71-82.

[7]

XU HMA JJIANG Jet al. U2Fusion: A unified unsupervised image fusion network [J]. IEEE Transactions on Pattern Analysis and Machine Intelligence202244(1): 502-518.

[8]

LI HXU TWU X Jet al. LRRNet: A novel representation learning guided fusion network for infrared and visible images [J]. IEEE Transactions on Pattern Analysis and Machine Intelligence202345(9): 11040-11052.

[9]

SHAO DYANG HMA Let al. AFPNet: An adaptive frequency-domain optimized progressive medical image fusion network[J]. Biomedical Signal Processing and Control2025103: 107357.

[10]

LIU ZLIN YCAO Yet al. Swin transformer: Hierarchical vision transformer using shifted windows [DB/OL]. (2021-08-17) [2025-01-06].

[11]

CHEN JDING JMA J. HitFusion: Infrared and visible image fusion for high-level vision tasks using transformer[J]. IEEE Transactions on Multimedia202426: 10145-10159.

[12]

LI XHE HSHI J. HDCCT: Hybrid densely connected CNN and transformer for infrared and visible image fusion[J]. Electronics202413(17): 3470.

[13]

LIN ZSUN WTANG Bet al. Semantic segmentation network with multi-path structure, attention reweighting and multi-scale encoding[J]. The Visual Computer202339(2): 597-608.

[14]

XU JBIAN QLI Xet al. Contrastive graph pooling for explainable classification of brain networks[J]. IEEE Transactions on Medical Imaging202443(9): 3292-3305.

[15]

LI JCHEN JLIU Jet al. Learning a graph neural network with cross modality interaction for image fusion [DB/OL]. (2023-08-07) [2025-01-06].

[16]

LI JBAI LYANG Bet al. Graph representation learning for infrared and visible image fusion[DB/OL]. (2023-11-01) [2025-01-06].

[17]

MA JLI XZHANG Yet al. U-Convnext network for infrared small target detection[C]//IEEE International Conference on Image Processing(ICIP), 2024: 1371-1376.

[18]

ZHOU MXU XZHANG Y. An attention-based multi-scale feature learning network for multimodal medical image fusion [DB/OL]. (2022-12-09) [2025-01-06].

[19]

曲海成, 李瑞柯, 王蒙, . 基于特征重用和膨胀卷积的遥感图像舰船检测[J]. 智能系统学报202419(5): 1298-1308.

[20]

QU HaichengLI RuikeWANG Menget al. Ship detection in remote sensing images via feature reuse and dilated convolution [J]. CAAI Transaction on Intelligent Systems202419(5):1298-1308. (in Chinese)

[21]

马吉权, 赵淑敏, 孔凡辉. 多尺度条形池化与通道注意力的图像语义分割[J].中国图象图形学报202227(12): 3530-3541.

[22]

MA JiquanZHAO ShuminKONG Fanhui. Semantic image segmentation by using multi-scale strip pooling and channel attention[J]. Journal of Image and Graphics202227(12): 3530-3541. (in Chinese)

[23]

LIANG FQIAN CYU Wet al. Survey of graph neural networks and applications[J]. Wireless Communications and Mobile Computing2022(1): 9261537.

[24]

许智宏, 张天润, 王利琴, . 融合图谱重构的时序知识图谱推理[J]. 计算机工程与应用202460(9): 181-187.

[25]

XU ZhihongZHANG TianrunWANG Liqinet al. Temporal knowledge graph reasoning with graph reconstruction [J]. Computer Engineering and Applications202460(9): 181-187. (in Chinese)

[26]

PANCINO NGALLEGATI CROMAGNOLI Fet al. Protein–protein interfaces: A graph neural network approach [J]. International Journal of Molecular Sciences202425(11): 5870.

[27]

ACHANTA RSHAJI ASMITH Ket al. SLIC superpixels compared to state-of-the-art superpixel methods[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence201234(11): 2274-2282.

[28]

ZHOU HLUO FZHUANG Het al. Attention multihop graph and multiscale convolutional fusion network for hyperspectral image classification[J]. IEEE Transactions on Geoscience and Remote Sensing202361: 5508614.

[29]

SHI CWU HWANG L. CEGAT: A CNN and enhanced-GAT based on key sample selection strategy for hyperspectral image classification[J]. Neural Networks2023168: 105-122.

[30]

PENG FLU WTAN Wet al. Multi-output network combining GNN and CNN for remote sensing scene classification[J]. Remote Sensing202214(6): 1478.

[31]

YING CCAI TLUO Set al. Do transformers really perform bad for graph representation? [DB/OL]. (2021-06-09) [2025-01-06].

[32]

HAN KWANG YGUO Jet al. Vision GNN: An image is worth graph of nodes [DB/OL]. (2022-11-04) [2025-01-06].

[33]

CHEN JLIU WHUANG Zet al. Universal deep GNNs: Rethinking residual connection in GNNs from a path decomposition perspective for preventing the over-smoothing[DB/OL]. (2022-05-30) [2025-01-06].

[34]

ZHAO YZHENG QZHU Pet al. TUFusion: A transformer-based universal fusion algorithm for multimodal images[J]. IEEE Transactions on Circuits and Systems for Video Technology202434(3): 1712-1725.

[35]

MA JTANG LFAN Fet al. SwinFusion: Cross-domain long-range learning for general image fusion via swin transformer[J]. IEEE/CAA Journal of Automatica Sinica20229(7): 1200-1217.

[36]

LI JCHEN JLIU Jet al. Learning a graph neural network with cross modality interaction for image fusion[DB/OL].(2023-08-07) [2025-01-06].

[37]

TANG WHE FLIU Y. ITFuse: An interactive transformer for infrared and visible image fusion[J]. Pattern Recognition2024156: 110822.

[38]

TANG WHE FLIU Yet al. DATFuse: Infrared and visible image fusion via dual attention transformer[J]. IEEE Transactions on Circuits and Systems for Video Technology202333(7): 3159-3172.

[39]

AZAM M AKHAN K BSALAHUDDIN Set al. A review on multimodal medical image fusion: Compendious analysis of medical modalities, multimodal databases, fusion techniques and quality metrics[J]. Computers in Biology and Medicine2022144: 105253.

基金资助

山西省“1331工程”科技创新计划(20210222)

山西省重点研发项目(202202010101008)

山西省重点研发项目(202102010101011)

山西省省筹资金资助回国留学人员科研项目(2024-118)

AI Summary AI Mindmap
PDF (5464KB)

587

访问

0

被引

详细

导航
相关文章

AI思维导图

/