基于TransNeXt的红外与可见光图像融合

杨艳春 ,  杨万轩 ,  雷慧云

湖南大学学报(自然科学版) ›› 2025, Vol. 52 ›› Issue (8) : 69 -79.

PDF (7346KB)
湖南大学学报(自然科学版) ›› 2025, Vol. 52 ›› Issue (8) : 69 -79. DOI: 10.16339/j.cnki.hdxbzkb.2025284
计算机科学

基于TransNeXt的红外与可见光图像融合

作者信息 +

Fusion of Infrared and Visible Based on TransNeXt

Author information +
文章历史 +
PDF (7522K)

摘要

针对红外与可见光图像融合过程中出现的细节丢失和易产生伪影等问题,本文提出了一种基于TransNeXt的融合算法.首先,通过卷积神经网络与TransNeXt对源图像进行浅层与深层特征提取,并通过信息补偿模块对红外浅层特征进行信息补偿,使其具有更多的语义信息.然后,通过基于交叉注意力的融合模块进行特征融合,它能够根据源图像不同区域的重要性调整权重以适应场景变化,提高融合结果的鲁棒性和准确性.最后,通过基于Transformer的模块进行图像重建以得到最终融合图像.此外,本文通过基于VGG19显著区域掩膜的损失函数约束融合过程,使融合结果在重要区域保留更丰富的信息.实验结果表明,与其他7种对比方法相比,本文方法的客观评价指标信息熵、标准差、差异相关性总和、峰值信噪比和像素特征互信息分别平均提高了10.92%、14.85%、24.80%、2.26%、1.30%,并且能够在保留丰富的纹理信息的同时伪影较少,具有优异的夜间灯光融合效果,在目标检测上相较对比方法也取得了更好的效果.

Abstract

This paper proposes a fusion algorithm utilizing TransNeXt to address detail loss and artifact generation issues in the fusion of infrared and visible images. Firstly, shallow and deep features are extracted from the source images using convolutional neural networks and TransNeXt. An information compensation module is employed to enhance the semantic information of the infrared shallow features. Secondly, a cross-attention-based fusion module integrates these features, and dynamically adjusts weights based on the importance of different regions in the source images to adapt to scene variations, thereby improving fusion robustness and accuracy. The final fused image is obtained through Transformer-based image reconstruction. In addition,the proposed method constrains the fusion process through a VGG19-based saliency mask loss function, preserving richer information in key regions of the fused results. The experimental results indicate that, compared with the other seven methods, this approach has improved the objective evaluation metrics: namely information entropy, standard deviation, sum of correlation differ-ences, peak signal-to-noise ratio, and pixel feature mutual information, by an average of 10.92%, 14.85%, 24.80%, 2.26%, and 1.30%, respectively. Furthermore, it effectively preserves rich texture information while minimizing artifacts, demonstrating outstanding performance in night light fusion. Additionally, it has achieved superior results in object detection relative to the comparison methods.

Graphical abstract

关键词

红外与可见光图像融合 / 卷积神经网络 / Transformer / TransNeXt

Key words

infrared and visible image fusion / convolutional neural network / Transformer / TransNeXt

引用本文

引用格式 ▾
杨艳春,杨万轩,雷慧云. 基于TransNeXt的红外与可见光图像融合[J]. 湖南大学学报(自然科学版), 2025, 52(8): 69-79 DOI:10.16339/j.cnki.hdxbzkb.2025284

登录浏览全文

4963

注册一个新账户 忘记密码

单一类型的图像传感器由于硬件设计或成像方法的限制,仅能捕获到特定的场景信息,为了克服这一局限性,图像融合技术应运而生.图像融合技术具有整合多种成像方式的独特优势,能够生成出信息更全面的融合图像1-3.红外与可见光图像融合是图像融合领域的重要分支,红外图像能够捕捉低光环境下的热目标,而可见光图像则能提供丰富的场景细节信息.融合这两种图像可以在军事、安防、环境监测等领域中提供更全面与准确的视觉信息,能够增强图像处理和分析的效果,有助于实现更精确的目标检测、识别和监控4-5.
近年来,随着深度学习的迅猛发展,深度学习模型凭借其强大的特征提取能力能够从源图像中挖掘出复杂的特征关系,有效融合不同模态的图像信息,已在红外与可见光图像融合领域取得了显著进展.Ma等6通过两个判别器区分融合图像与两个源图像的结构差异.Li等7提出了一种残差融合网络RFN,利用卷积神经网络与残差连接对多尺度深层特征进行融合.Zhang等8将图像融合任务转化为梯度和强度信息的提取和重构,还通过融合图像的分解促使融合结果包含更多场景信息.但是卷积神经网络只能进行局部处理,长距离依赖的捕捉能力相对有限9.Vaswani等10提出了全新的网络架构Transformer,其通过自注意力机制有效地捕捉图像中任意位置之间的长距离依赖关系,能够更好地处理全局信息的整合.Wang等11将Swin Transformer12作为提取全局特征的主干,并且利用残差连接实现低级特征聚合与信息保留.Tang等13将通道注意力和空间注意力结合起来进行特征提取,并通过Transformer模块来保存全局互补信息.
深度学习方法在红外与可见光图像融合领域已经取得了许多成果,但是卷积神经网络受感受野的限制难以学习到特征间的一些重要关系,在融合过程中可能丢失部分细节信息.自注意力机制的复杂度较高,一些Transformer往往使用堆叠窗口的方式降低自注意力计算的复杂度,然而堆叠窗口分区时容易产生伪影.
为了解决上述问题,本文先利用卷积神经网络提取浅层特征,并将提取到的可见光浅层特征通过信息补偿模块(ICB)对红外浅层特征进行补偿,ICB能够选择性学习语义更丰富的分支,再将TransNeXt作为主干网络进行深层特征提取.然后通过基于交叉注意力的融合模块进行特征融合,最后通过基于Transformer的图像重建模块进行重建.此外,本文还使用了基于VGG19显著区域掩膜的损失函数,通过约束融合过程使融合结果在重要区域保留更丰富的信息,并保持显著性目标的突出性.实验结果表明,本文方法细节信息丰富且伪影较少,对夜间灯光的处理效果显著优于其他方法,并且在后续的目标检测中表现出色.

1 相关工作

1.1 Vision Transformer

Transformer在自然语言处理中取得巨大成功后,在计算机视觉领域也引起了广泛关注.Dosovitskiy等14提出了Vision Transformer(ViT),首次将Transformer应用于计算机视觉领域,其将一张图片划分为固定大小的图像块(patch)后,嵌入固定大小的向量中再进行后续处理,在各种视觉任务中都取得了十分优越的性能.

虽然ViT在计算机视觉领域的应用取得了突破性的进展,但由于自注意力计算复杂度较高,Transformer模型往往需要较高的内存与较多的计算资源,难以应用于高分辨率图像.

1.2 TransNeXt

为了改善Transformer的计算效率与资源需求,部分学者通过稀疏注意力的方法对其进行优化,其中代表性方法之一是窗口注意力12,它将注意力限制在特征图上的一个窗口内.然而这种方法往往需要交替堆叠不同类型的token混合器来实现跨窗口的信息交换,而深层堆叠时窗口分区的轨迹容易形成不自然的伪影,这限制了融合图像质量的进步一提高.

TransNeXt15中的聚合注意力机制(aggregated attention)通过一种基于仿生设计的token混合器,模拟了生物的中央凹视觉和连续的眼球运动,使特征图上的每个token具有全局感知.并且通过结合与常规查询和键交互的可学习token,使生成的亲和矩阵更加多样,有效避免了深度退化并实现了自然的视觉感知.此外,TransNeXt还提出了Convolutional GLU(Conv GLU)作为通道混合器,使每个token能够基于其最近邻图像特征进行通道注意,增强了局部建模能力和模型鲁棒性.图1为TransNeXt块结构.

1.2.1 像素聚焦注意力

像素聚焦注意力(pixel-focused attention, PFA)15对每个查询(Query)附近具有细粒度感知的同时,对全局信息也具有粗粒度感知.其采用一种双路径设计,即以Query为中心的滑动窗口注意力和池化注意力,并在一个Softmax中计算两条路径Query与Key相似度的重要程度.像素聚焦注意力过程如下.

Q,K,V分别表示查询向量(Query)、键向量(Key)与值向量(Value).首先分别计算两条路径Query与Key的相似度G

G(i,j)~ρ(i,j)=Q(i,j)Kρ(i,j)TG(i,j)~σ(X)=Q(i,j)Kσ(X)T

式中: ρij)为输入特征图上以(ij)为中心的滑动窗口内的像素集合,窗口大小为k2σX为池化后的特征图集合,特征图大小为HpWp .

然后将相似度结果进行拼接后通过Softmax计算出注意力权重A,这导致了细粒度和粗粒度特征之间的竞争,使得像素聚焦注意力转化为多尺度注意力机制,如式(2)所示:

GConcat=ConcatG(i,j)~ρ(i,j),G(i,j)~σ(X)
A(i,j)=SoftmaxGconcatd+B(i,j)

式中:d为键向量K的维度数;B(i,j)为位置偏差.

再将注意力权重分割为拼接前的形状.

A(i,j)~ρ(i,j),A(i,j)~σ(X)=Split(A(i,j))                                   with size [k2,HpWp]

最后像素聚焦注意力PFA可以表示为:

PFA(X(i,j))=A(i,j)~ρ(i,j)Vρ(i,j)A(i,j)~σ(X)Xσ(X)

1.2.2 聚合注意力

聚合注意力是对像素聚焦注意力的一个改进15.其通过向所有Query token 中添加可学习的查询嵌入(query embedding,QE) 实现了信息聚合效果,且额外开销较少几乎可以忽略,只需要将式(1)修改为如下形式:

G(i,j)~ρ(i,j)=(Q(i,j)+QE)Kρ(i,j)TG(i,j)~σ(X)=(Q(i,j)+QE)Kσ(X)T

长度缩放余弦注意力使用了余弦相似度,相对缩放点积注意力,它能够生成更均匀的注意权重分布,提高大型视觉模型的训练稳定性.在计算长距离余弦注意力时,长度缩放余弦注意力将一个额外的可学习系数λ乘到Query和Key的余弦相似度上,使得注意力机制可以有效地忽略不重要的token,将λ设置为τlogN,其可以表示为式(6)

Attention(Q,K,V)=Softmax(τlogNQ^K^T)V

式中:Q^K^为Query和Key分别在每个头的特征维度上进行l2正则化后的向量;τ为每个注意力头初始化为10.24的可学习变量; N表示每个Query与有效Key交互的次数,不包括掩码标记的次数.

为了进一步增强像素聚焦注意力机制对多尺度图像输入的外推能力,还采用了不同的方法计算两条路径上的B(i,j)~ρ(i,j)B(i,j)~σ(X).在池化特征路径上使用对数间隔连续位置偏差(log-CPB)12Q(i,j)Kσ(X)的空间相对坐标Δ(i,j)~σ(X)进行计算得到B(i,j)~σ(i,j),而在滑动窗口路径上直接使用可学习的B(i,j)~ρ(i,j).

此外,为了增强局部建模能力和提高鲁棒性,在每个注意头中引入一组可学习的标记T,其与查询交互可以获得额外的动态位置偏差,因此将Q^(i,j)T添加到A(i,j)~ρ(i,j)中.

综上所述,聚合注意力AA的过程可以描述为:

G(i,j)~ρ(i,j)=(Q(i,j)+QE)Kρ(i,j)T
G(i,j)~σ(X)=(Q(i,j)+QE)Kσ(X)T
B(i,j)=Concat(B(i,j)~ρ(i,j),log-CPB(Δ(i,j)~σ(X)))
Gconcat=Concat(G(i,j)ρ(i,j),G(i,j)σ(X))
A(i,j)=Softmax(τlogNGconcat+B(i,j))
A(i,j)~ρ(i,j),A(i,j)~σ(X)=Split(A(i,j))                                   with size [k2,HpWp]
AA(X(i,j))=(A(i,j)~ρ(i,j)+Q^(i,j)T)Vρ(i,j)+
                      A(i,j)~σ(X)Vσ(X)

1.2.3 Convolutional GLU

门控线性单元 (GLU) 16是一种通道混合器,其由两个逐元素相乘的线性投影组成,其中一个投影由门控函数激活.Convolutional GLU(Conv GLU)在GLU的gating分支的激活函数之前,添加了一个最小形式的3×3深度卷积,使它的结构符合基于最近邻特征的门控通道注意力(gated channel attention)的设计概念,并将其转换为门控通道注意力机制.

Conv GLU中每个token都拥有唯一的门控信号,基于其最近的细粒度特征.这解决了SE机制中全局平均池化过于粗粒度的缺点,也满足了部分没有位置编码设计的 ViT 模型需要深度卷积提供位置信息的需求.具体结构如图2所示.

2 本文方法

本文提出了一种基于TransNeXt的红外与可见光图像融合方法,主要分为特征提取、特征融合以及图像重建三个部分,融合框架流程如图3所示.

2.1 特征提取

红外与可见光图像I输入网络后,首先对其进行浅层特征提取SF(·),得到浅层特征F1.卷积层能够较好地捕捉图像的局部特征,例如边缘纹理等,因此采用两个卷积层作为浅层特征提取模块,其卷积核大小均为3×3,步长均为1,过程可以表述为

Fv1=SF(Iv),Fi1=SF(Ii)

由于交叉注意力机制只关注相关性,忽略了互补信息17.因此引入信息补偿模块(ICB)引导模型学习不同模态之间的相关性和互补性,增强可见光和红外图像特征之间的协同作用.通过这种方式,ICB模块不仅促进了特征的有效融合,还能够避免冗余信息的影响.ICB能够通过Sigmoid函数可选择地学习两条分支中语义更丰富的部分,其具体结构如图4所示.

红外与可见光浅层特征通过卷积和Sigmoid函数激活后能够得到一对权重ω1,ω2ω1,ω2均为0~1之间的实数,并且和为1.

然后对Fv1Fi'1进行深层特征提取DF(·),得到深层特征Fv2DF(·)为每层两个TransNeXt块结构,共四层的深层特征提取单元,其过程如下:

Fv2=DF(Fv1),Fi2=DF(Fi'1)

2.2 特征融合

特征融合旨在整合来自不同模态的特征信息,本文采用基于交叉注意力的特征融合方法,具体流程见图5.

为了全面整合所有维度的特征,首先使用交叉注意力机制来交互不同模态的特征.具体可以表示如下:

{Qv,Kv,Vv}=CrossA(Fv2){Qi,Ki,Vi}=CrossA(Fi2)

然后交换两种模态的查询 Q 以进行空间交互:

Ffi=SoftmaxQvKidkViFfv=SoftmaxQiKvdkVv

式中:dk为缩放因子即查询向量的维度数.最后将交叉注意力计算的结果进行拼接以得到融合特征:

Ff=Concat(Ffi,Ffv)

2.3 图像重建

在充分融合红外与可见光特征后,先采用基于Transformer的深层特征重建模块RD(·)恢复与细化融合后的特征,然后通过基于卷积层的图像重建模块R(·)减少通道数以生成最终的融合图像.其过程可以表述为

FSF=RD(Ff)F=R(FSF)

2.4 损失函数

损失函数旨在保留源图像的显著部分并且生成细节丰富的融合图像.为实现这一目标,采用像素损失保持像素级一致性,结构相似性损失保留关键视觉结构,梯度损失增强细节表现.损失函数具体定义为

Ltotal=λ1Lint+λ2Lssim+λ3Lgrad
Lint=j=12MjO-MjIj1
Lssim=j=121-SSIM(MjO,MjIj)
Lgrad=j=12MjO-MjIj1

式中: Lint为像素损失;Lssim为结构相似性损失;Lgrad为梯度损失;1 表示L1范数;O为输出图像即融合结果;Ij 为源图像,j=1和2时,分别代表红外和可见光源图像;为梯度算子;Mj为显著区域掩膜;λ为平衡损失函数的超参,取值为λ1=20λ2=10λ3=20.

2.5 基于VGG19的显著区域掩膜

为了使模型关注到源图像更重要的部分,在损失函数中使用了显著区域掩膜,通过VGG19计算出的显著性图能够突出输入图像中的重要性区域.首先,使用预先训练好的VGG-19网络18提取输入图像的m组特征图,然后通过上采样将它们调整为与源图像相同的比例:

ϕIin'=UpsampingϕIin,2i-1

式中:Upsampling(X,Y)表示对矩阵X进行倍数为Y的上采样操作;ϕIin是将输入图像I送入预训练的 VGG-19网络后,在第i个最大池化层之前获得的特征图的第n通道.然后使用L1范数计算源图像的初始活动水平图:

AIi=ϕIi1Ci'1

式中:Ci表示相应特征图中的通道数.接下来,使用基于窗口的平均策略来处理错位问题18

AIi'x,y=d=-rrAIix+d,y+d2r+12

式中:r是控制窗口大小的参数.接下来,通过对这k个特征图取平均值来获得活动水平图AM

AMIx,y=1ki-1kAIi'x,y

最后,根据以下活动水平图计算得到显著区域掩码:

Mix,y=1,AMIix,yAMI3-ix,y0,AMIix,y<AMI3-ix,y

3 实验结果与分析

3.1 实验说明

本文选择使用MSRS数据集19,其包含1 083对训练图像和361对测试图像.在训练过程中将训练图像剪切为128像素×128像素大小的图像并归一化为[0,1],参数优化器为Adam,学习率初始化为2×10-4,训练时Batch size为2,训练过程在pyTorch框架上实现.实验仿真平台采用Intel(R) 13400f CPU,NVIDIA RTX 4060TI 16 G GPU.

为验证本文算法的可行性与有效性,在测试集中选定5组图像进行实验与分析,其大小均为640像素×480像素.并将本文方法的融合结果与U2Fusion方法20,SDNet方法8、SeAFusion方法21、PIAFusion方法22、DATFuse方法23、CDDFuse方法24和 PSFusion25方法进行了对比.

3.2 定性分析

5组实验的融合结果如图6所示.前两组测试图为日间场景,日间场景的红框内容为显著红外目标,绿框中为局部细节图;后三组测试图像为夜间场景,其中红框内容为显著的红外目标,绿框中为灯光.通过对比实验可以看出, U2Fusion与SDNet的结果整体泛白,没有很好地突出显著目标.SeAFusion、PIAFusion、DATFuse与PSFusion在日间场景的局部细节图中产生了一些伪影.PIAFusion、CDDFuse、PSFusion的夜间灯光中产生了不正常的黑影.本文方法整体视觉效果更接近可见光图像,在保留丰富局部细节的同时避免了伪影,在夜间场景中不但突出了显著目标,还对夜间灯光具有更自然的融合效果.

图7是对融合结果中的显著目标进行热力图与三维地形图的定性分析,从左到右分别为源图像、热力图与三维地形图.从热力图中可以看出,本文方法能够更好地平衡红外图像与可见光图像的重要信息,保留红外图像与可见光图像中的显著目标,整体对比度仅次于PSFusion.从三维地形图可以看出, PSFusion方法整体灰度值高于源图像,而本文方法的显著目标灰度值更接近源图像,更符合人眼视觉特性.

3.3 定量分析

为验证算法性能及图像融合质量,本文采用信息熵(EN)、标准差(SD)、差异相关性总和(SCD)、峰值信噪比(PSNR)和像素特征互信息(FMI_pixel)进行客观的分析.其指标均为数值越大,融合质量越好.其中基于EN、FMI_pixel、PSNR为基于信息论的评估指标,SD为基于图像特征的评估指标,SCD为基于源图像与生成图像的评估指标.EN用于衡量融合图中的信息量,FMI_pixel用于检测像素特征信息的传递情况,PSNR用于衡量图像有效信息与噪声之间的比率,能够反映图像是否失真.SD代表了图像灰度值分布情况,而SCD通过测量融合图像与源图像的差异来衡量信息丰富程度.

表1为MSRS数据集中30对图像平均定量的结果,其中加粗指标为每一项的最优指标,次优指标为加了下划线的指标.可以看出本文方法在其中四个指标中均处于最优地位,差异相关性总和中处于次优地位.图8为7种对比方法在30种不同图像的指标数值折线图.因空间限制,在图8中,方法U2Fusion、SeAFusion 、PIAFusion、PSFusion分别简写为U2、SeA、PIA、PS,而DATFuse、CDDFuse分别简写为DAT、CDD.

从上述对比实验可以看出,本文方法的融合结果相较于其他对比方法,细节信息更加丰富且避免了伪影的产生,对显著目标与夜间灯光的融合效果更加优异,整体融合效果更接近源图像.

3.4 消融实验

为验证本文所采用的信息补偿模块与显著区域掩膜的有效性,通过加入不同模块对MSRS数据集的30对图像进行消融实验,所有实验均使用相同的数据集和参数设置.

图9中从上至下依次为红外(IR)图像、可见光(VIS)图像、无信息补偿模块融合图、无显著区域掩膜融合图、无信息补偿模块与显著区域掩膜融合图及本文方法融合图.从图中可以看出,无显著区域掩膜的融合结果中的红外目标相比本文方法亮度偏低.因此可以证明:带显著区域掩膜的损失函数训练出的权重更能突出显著目标;而无信息补偿模块的融合结果相比本文方法细节不够丰富,说明了信息补偿模块能够选择性地将语义信息补充到红外图像的浅层特征图中.

表2为不同模块对MSRS数据集的30对图像定量的结果,可以看出本文方法在五项指标上均为最优,说明了信息补偿模块和显著区域掩膜提高融合质量的有效性.综上所述,通过消融实验可以证明本文方法中信息补偿模块与显著区域掩膜对融合结果有着重要作用.

3.5 目标检测性能

不同的融合算法可以将红外图像和可见光图像的互补信息进行融合,目标检测作为高级计算机视觉任务能够反映融合图像中的语义信息.本文采用YOLOv526来评估融合图像上的行人目标检测性能.从MSRS数据集中选择80幅图像作为测试集.图10上方为01348N夜间场景,下方为00209D日间场景,01348N中可见光图像难以对低光照下的目标进行检测,融合后的图像通常会削弱显著目标,导致行人目标检测效果往往低于红外图像.U2Fusion与SDNet虽然较好地提高了检测效果,但U2Fusion融合结果与源图像视觉效果相差过大,SDNet整体偏暗缺少细节信息,本文方法能够在视觉效果接近可见光图像的同时行人检测性能仅稍逊于红外图像.00209D中红外图像由于信息不够丰富,导致其将车身反光检测为行人,并且忽略了图像中间位置站在车前的行人,融合后图像通过信息互补获得丰富的纹理细节信息与高对比度,有助于提高行人检测的精度,而本文方法相较其他方法对00209D右侧的行人具有更好的检测效果.

本文进一步用定量指标来衡量行人检测任务,如表3所示,其中加粗指标为最优指标,加了下划线的指标为次优指标.精确率(Precision)P表示所有预测为正的样本都是真实样本的概率,精确率越大,检测到的正样本越多.召回率(Recall)R用于衡量从实际的正样本预测为正样本的概率,召回率越大,漏掉的检测结果越少.mAP@0.50、mAP@0.75分别表示置信度阈值为0.5和0.75时的平均精度(mAP)值.mAP@[0.5:0.95]表示IoU阈值从0.5到0.95,步长为0.05,所有mAP的平均值.平均精度(mAP)越接近1,行人检测效果越好.本文方法在精确率和mAP@0.75上取得了最优,在其他各项指标取得了次优.综上所述,本文方法显著提高了行人检测性能,表明本文方法的融合结果具有更丰富的语义信息,适用于高级计算机视觉任务.

4 结 论

本文提出了一种基于TransNeXt的图像融合方法,对源图像通过卷积神经网络CNN进行浅层特征提取后,通过对红外图像进行信息补偿使后续TransNeXt能够更好地进行深层特征提取,然后通过基于交叉注意力的融合模块进行特征融合,以保留更多的细节信息.在网络训练部分采用基于VGG19显著区域掩膜的损失函数更好地保留源图像中更重要的信息.实验结果证明,本文方法细节信息丰富并且不易产生伪影,对夜间场景的灯光具有更好的融合效果,更符合人眼视觉特性.为了进一步提升红外与可见光图像融合的效果,将继续改进网络的具体架构,以更好地适应不同的融合场景和需求,提高融合图像在计算机视觉高级任务中的性能.

参考文献

[1]

LEI JLI JLIU Jet al .GALFusion:multi-exposure image fusion via a global-local aggregation learning network[J].IEEE Transactions on Instrumentation and Measurement202372:1-15.

[2]

RAO D YXU T YWU X J .TGFuse:an infrared and visible image fusion approach based on transformer and generative adversarial network[J].IEEE Transactions on Image Processing2023.

[3]

LI HQI XXIE W .Fast infrared and visible image fusion with structural decomposition[J]. Knowledge-Based Systems2020204:106182.

[4]

MA J YMA YLI C .Infrared and visible image fusion methods and applications:a survey[J]. Information Fusion201945:153-178.

[5]

ZHANG HXU HTIAN Xet al. Image fusion meets deep learning:a survey and perspective[J]. Information Fusion202176:323-336.

[6]

MA J YXU HJIANG J Jet al .DDcGAN:a dual-discriminator conditional generative adversarial network for multi-resolution image fusion[J]. IEEE Transactions on Image Processing202029:4980-4995.

[7]

LI HWU X JKITTLER J .RFN-Nest:an end-to-end residual fusion network for infrared and visible images[J]. Information Fusion202173: 72-86.

[8]

ZHANG HMA J Y. SDNet:a versatile squeeze-and-decomposition network for real-time image fusion[J]. International Journal of Computer Vision2021129(10):2761-2785.

[9]

SHEN SLI DMEI L Yet al .DFA-net:multi-scale dense feature-aware network via integrated attention for unmanned aerial vehicle infrared and visible image fusion[J].Drones20237(8): 517.

[10]

VASWANI ASHAZEER NPARMAR Net al. Attention is all you need [J]. Advances in Neural Information Processing Systems201730(1): 261-272.

[11]

WANG Z SCHEN Y LSHAO W Yet al .SwinFuse:a residual swin transformer fusion network for infrared and visible images[J].IEEE Transactions on Instrumentation and Measurement202271:1-12.

[12]

LIU ZHU HLIN Y Tet al .Swin transformer V2:scaling up capacity and resolution[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.2022: 12009-12019.

[13]

TANG WHE F ZLIU Yet al .DATFuse:infrared and visible image fusion via dual attention transformer[J].IEEE Transactions on Circuits and Systems for Video Technology202333(7):3159-3172.

[14]

DOSOVITSKIY ABEYER LKOLESNIKOV Aet al. An image is worth 16x16 words: Transformers for image recognition at scale[J/OL].arXiv preprint arXiv:2020.

[15]

SHI D .TransNeXt:robust foveal visual perception for vision transformers[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.2024:17773-17783.

[16]

SHAZEER N .GLU variants improve transformer[J/OL].arXiv preprint arXiv2002.05202, 2020.

[17]

LI HWU X J .CrossFuse:a novel cross attention mechanism based infrared and visible image fusion approach[J/OL].Information Fusion2024,103:102147.

[18]

SIMONYAN KZISSERMAN A .Very deep convolutional networks for large-scale image recognition[J/OL]. arXiv preprint arXiv:2014.

[19]

LIU YCHEN XWARD R Ket al .Image fusion with convolutional sparse representation[J].IEEE Signal Processing Letters201623(12):1882-1886.

[20]

XU HMA J YJIANG J Jet al. U2Fusion:a unified unsupervised image fusion network[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence202044(1):502-518.

[21]

TANG L FYUAN J TMA J Y .Image fusion in the loop of high-level vision tasks:a semantic-aware real-time infrared and visible image fusion network[J].Information Fusion202282:28-42.

[22]

TANG L FYUAN J TZHANG Het al .PIAFusion:a progressive infrared and visible image fusion network based on illumination aware[J].Information Fusion202283:79-92.

[23]

TANG WHE F ZLIU Yet al. DATFuse:infrared and visible image fusion via dual attention transformer[J]. IEEE Transactions on Circuits and Systems for Video Technology202333(7):3159-3172.

[24]

ZHAO Z XBAI H WZHANG J Set al .CDDFuse:correlation-driven dual-branch feature decomposition for multi-modality image fusion[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2023:5906-5916.

[25]

TANG L FZHANG HXU Het al .Rethinking the necessity of image fusion in high-level vision tasks:a practical infrared and visible image fusion network based on progressive semantic injection and scene fidelity[J]. Information Fusion202399:101870.

[26]

REDMON JDIVVALA SGIRSHICK Ret al. You only look once:unified,real-time object detection[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition.2016: 779-788.

基金资助

国家自然科学基金资助项目(62462043)

国家自然科学基金资助项目(62067006)

National Natural ScienceFoundation of China(62462043)

National Natural ScienceFoundation of China(62067006)

甘肃省重点研发计划项目(25YFGA047)

Key Research and Development Project of Gansu Province(25YFGA047)

甘肃省自然科学基金项目(23JRRA847)

Natural Science Foundation of Gansu Province(23JRRA847)

AI Summary AI Mindmap
PDF (7346KB)

450

访问

0

被引

详细

导航
相关文章

AI思维导图

/