基于多尺度频空层级注意力的红外小目标检测网络

刘仲民 ,  毕研鑫 ,  胡文瑾

湖南大学学报(自然科学版) ›› 2026, Vol. 53 ›› Issue (6) : 59 -70.

PDF (2604KB)
湖南大学学报(自然科学版) ›› 2026, Vol. 53 ›› Issue (6) : 59 -70. DOI: 10.16339/j.cnki.hdxbzkb.2026272
计算机科学

基于多尺度频空层级注意力的红外小目标检测网络

作者信息 +

Infrared small target detection network based on multi-scale spatial-frequency hierarchical attention

Author information +
文章历史 +
PDF (2665K)

摘要

针对复杂背景下红外小目标由于信号微弱易被干扰淹没,以及目标深层特征在逐层处理过程中逐渐衰减等问题,提出一种多尺度频空层级注意力网络.首先,设计多尺度感知增强模块,结合多分支空洞卷积与高频方向滤波,在空间域与频域协同增强不同尺度目标的局部对比度.其次,构建层级特征金字塔模块,利用深度可分离卷积与自适应池化实现跨尺度上下文交互,保持高维空间特征的一致性与完整性.最后,提出双域协同注意力模块,融合全局注意力与局部卷积的互补特性,在全局语义建模与局部细节保真之间实现协同表达,有效抑制辐射噪声干扰.在公开数据集SIRST和IRSTD-1k上进行实验验证,结果显示网络针对红外小目标检测具有更高的识别精度和泛化能力.

Abstract

To address the problems that infrared small targets in complex backgrounds are easily submerged by interference due to weak signals, and the deep features of targets gradually attenuate during layer-by-layer processing, a multi-scale spatial-frequency hierarchical attention network is proposed. Firstly, a multi-scale perceptual excitation module is designed, which combines multi-branch dilated convolution with high-frequency directional filtering to collaboratively enhance the local contrast of targets of different scales in the spatial and frequency domains. Secondly, a hierarchical feature pyramid module is constructed, and cross-scale contextual interaction is achieved by using depthwise separable convolution and adaptive pooling to maintain the consistency and integrity of high-dimensional spatial features. Finally, a dual-domain collaborative attention module is proposed, which integrates the complementary characteristics of global attention and local convolution, realizes collaborative expression between global semantic modeling and local detail fidelity, and effectively suppresses radiation noise interference. Experimental verification is carried out on the public SIRST and IRSTD-1k datasets. The results show that the network has higher recognition accuracy and stronger generalization ability for infrared small target detection.

Graphical abstract

关键词

红外小目标检测 / 多尺度特征融合 / 频空联合分析 / 注意力机制 / 层次特征金字塔

Key words

infrared small target detection / multi-scale feature fusion / frequency-spatial joint analysis / attention mechanism / hierarchical feature pyramid

引用本文

引用格式 ▾
刘仲民,毕研鑫,胡文瑾. 基于多尺度频空层级注意力的红外小目标检测网络[J]. 湖南大学学报(自然科学版), 2026, 53(6): 59-70 DOI:10.16339/j.cnki.hdxbzkb.2026272

登录浏览全文

4963

注册一个新账户 忘记密码

红外小目标检测(infrared small target detection, ISTD)旨在对红外图像中尺寸微小、显著性不足的目标实现高精度检测、识别与定位.红外成像依赖目标自发或反射的红外辐射,无需外部光照,因此具备全天候、全天时观测能力,已广泛应用于军事领域1.然而,相较于可见光图像,红外图像普遍缺乏纹理信息,且对比度低、成像易模糊;在远距离场景中,小目标仅占少量像素,显著特征极弱,极易被复杂背景噪声淹没.如何在低信噪比条件下实现鲁棒且高效的小目标检测,仍是计算机视觉领域亟待突破的关键问题2.
为了实现对红外小目标的检测,研究者们提出了许多基于模型的方法.根据实现原理,可以将这些方法大致分为3类:基于滤波器的算法3、基于人类视觉的方法4和基于图像结构的方法5.基于滤波器的算法包括空间域滤波和变换域滤波.空间域滤波方法指假设图像背景呈现缓慢变化,而小目标的存在打破了像素之间的相关性,典型算法有最大中值滤波器6和双边滤波器7,但在复杂背景下性能会显著下降.变换域滤波方法如双树复小波变换8和二维经验模式分解(BEMD)9,此种方法通过频域分析图像,计算复杂度较高,实时性较差.基于人类视觉的方法通常模仿人眼在发现目标时的处理机制,主要通过局部对比度信息进行检测.这种方法适用于目标与背景对比强烈的场景,但在背景边缘或强噪声干扰下容易出现误检.基于图像结构的方法通过利用目标的稀疏性和背景的低秩特性,将目标检测问题转化为凸优化问题.代表性方法包括红外面片图像模型(IPI)10、低秩稀疏表示模型(LRSL)11等.尽管这些方法能够有效地分离目标与背景,但对背景中的强边缘干扰较为敏感,且实时处理能力较差,限制了其在实际应用中的效果,这使得其在处理背景复杂的图像时效果不佳.
随着深度学习技术的不断发展,利用深度学习在数据分析与建模方面的强大能力,红外小目标检测任务的性能得以显著提升,能够更有效应对复杂场景中的检测挑战.例如:Zhao等12提出了一种轻量级卷积神经网络,结合目标提取模块和语义约束模块,通过联合损失函数进行训练,解决了小目标特征学习困难的问题,实现了实时检测.Wang等13提出了一种漏检-误报权衡对抗学习框架(miss detection vs false alarm,MDvsFA),旨在平衡漏检和误报,通过条件生成对抗网络生成高质量的检测结果,提高了检测性能.Wu等14提出了一种U-Net中嵌套U-Net的网络(U-Net in U-Net, UIU-Net),将小型U-Net嵌入大型U-Net主干中,实现多级和多尺度的表示学习.然而,现有的目标检测方法往往未能充分利用深层语义信息,导致特征传递过程中受到限制,进而引发小目标信息的丢失或模糊.并且这些方法在建模长距离依赖特征时存在局限,导致它们在捕捉小目标方面的能力不足.为解决这一问题,王潇等15提出了一种基于多层多向Transformer的红外图像弱小目标检测算法.该算法通过设计U形深度神经网络和多特征层融合网络,巧妙地融合了局部特征和全局特征,从而有效提高了目标检测的精度.此方法克服了卷积神经网络感受野有限的问题,并增强了特征提取能力.Pan等16提出了一种基于变换器的注意力双线性相关模型(attention with bilinear correlation, ABC),通过设计卷积线性融合变换器模块和U形卷积-膨胀卷积模块,ABC有效地结合了卷积和变换器在局部与全局特征提取方面的优势.薛雅丽等17提出了一种基于级联嵌套U-Net的红外小目标检测方法.该方法通过多层U-Net网络的级联嵌套,有效解决了不同场景下小目标尺寸差异较大的问题,并结合对比度信息抽取模块,显著抑制了背景噪声的干扰,从而提升了检测精度.该算法在多种场景下表现优异,且在与其他主流算法的对比中,具有明显的优势.尽管上述方法融合了局部和全局特征,但在复杂背景下,它们仍难以有效区分小目标与噪声,且在特征融合能力上相对较弱.尤其是在捕捉低维特征细节和处理复杂背景方面,仍然存在明显不足.特别是在多次下采样的过程中,信息丢失问题未得到有效解决.对此,Xu等18通过结合多分支特征提取、自适应特征融合和多尺度特征精炼提出一种分层上下文融合网络(hierarchical context fusion network, HCF-Net),有效缓解了红外小目标检测中信息丢失和背景干扰问题.然而,HCF-Net更注重全局上下文,难以精细化捕捉小目标的局部对比特征,并且局部细节在融合过程中易被全局或大尺度特征覆盖.此外,现有主流方法普遍缺乏对高频分量的显式加权增强,导致在多尺度特征融合过程中,高频细节易被低频背景噪声淹没,深层小目标的细粒度信息难以充分呈现,从而削弱了目标识别的精度.
针对以上问题,本文设计了一个基于多尺度频空层级注意力的网络框架(multi-scale spatial-frequency hierarchical attention network, MSFHA-Net),结合频-空域联合分析、多粒度注意力聚集和自适应特征融合,构建了一种多尺度融合网络架构.能够在抑制复杂背景噪声的同时,保持小目标的精细结构,从而提升红外小目标的检测性能.本文主要贡献如下.
1)设计了多尺度感知增强模块(multi-scale perception enhancement module, MSPE),通过基于多卷积核与多扩张率的多分支结构,在特征提取与融合过程中实现了多尺度信息的协同建模,有效建立了局部细节与全局语义之间的联系,从而增强了模型在复杂背景下的小目标感知能力与鲁棒性.
2)设计了层次化特征金字塔模块(hierarchical feature pyramid module, HFPM),通过将自适应池化与深度可分离卷积相结合,该模块实现了跨尺度语义特征的高效聚合,有效平衡了采样效率与空间细节保真,使网络在多尺度空间中具备更精确的小目标定位能力和更完整的特征表征.
3)设计了双域协同注意力模块(dual-domain synergistic attention module, DDSM),将局部卷积算子的空间建模优势与全局注意力的长程依赖表征能力相结合,实现了局部与全局特征的有机融合.在此基础上,模型既能强化局部上下文的细节表达,又能保持全局语义的一致性,从而显著提升红外小目标的辨识精度与抗噪性能.

1 本文方法

1.1 整体框架

本文提出了一种多尺度频空层级注意力的网络框架,并采用U-Net网络的编码器-解码器结构.U-Net通过像素级分割精细建模图像,能够精准捕捉极小目标的细节,特别在处理点目标和粘连目标时,有效抑制背景干扰,突出目标信息,展现出显著优势.首先,输入图像Fin在编码器阶段依次经过一系列并行化感知注意力模块(parallelized patch-aware attention module, PPA)18和双域协同注意力模块,以提取多尺度空间语义特征.每一阶段的特征在提取后通过最大池化操作进一步下采样,以获得更深层次的上下文语义信息.与此同时,引入维度感知选择性集成模块(dimension-aware selective integration module, DASI)18,在编码器各层之间构建高效的多尺度特征融合路径,有效加强了跨层级、跨尺度的上下文信息传递与整合.在最深层的语义特征处理中,网络进一步采用多尺度感知增强模块以增强对远程依赖的建模能力,并引入离散小波变换(discrete wavelet transform, DWT),对图像的不同频率子带进行加权建模,从而在频域层面提升前景目标与背景之间的可分性.进入解码阶段后,网络通过四级反卷积逐步恢复特征图的空间分辨率.在每一级解码过程中,进一步引入层次化特征金字塔模块与双域协同注意力模块模块,融合高层语义与底层细节信息,有效提升小目标区域的响应能力.最终,每一级解码阶段经过一层卷积操作生成不同尺度的目标预测图(Out1, Out2, Out3, Out4),并通过上采样恢复至与原始输入图像相同的分辨率.将主输出图Fout最大池化以保留小目标,避免被平均化稀释.池化后的主输出图作为真实标注与其他预测图进行多尺度深度监督,让网络在各层都获得直接、充分的监督信号,提升收敛速度与稳定性.网络框架如图1所示.

1.2 多尺度感知增强模块

在红外小目标检测任务中常遇到复杂背景难以检测,从而影响目标识别精度的情况.对此,现有方法常利用多尺度信息融合和特征感知处理这一难题.然而,这些方法在捕捉图像中不同方向的高频特征方面存在不足,导致一些细小特征在检测过程中被忽略.为了解决这一问题,设计一种多尺度感知增强模块.该方法对不同尺度的小目标进行有效建模,增强了网络对小目标的细节感知,强化对红外图像在不同方向上的高频信息捕获,进一步提高了对目标的显著性检测能力.模块结构图如图2所示,由多尺度局部关系学习(multi-scale local relational learning, MLRL)、多方向特征感知(multi-directional feature perception, MDFP)以及压缩激励(squeeze-and-excitation, SE)注意力19组成.

1.2.1 多尺度局部关系学习

多尺度局部关系学习有助于提升网络对不同尺度小目标的适应能力,能够学习不同尺度下局部区域的上下文关系,捕捉目标细节与其周围环境之间的对比差异,从而实现对目标更全面、细致的信息提取.该模型通过融合多尺度卷积与扩张卷积,有效建模不同尺度下局部区域之间的关联关系,增强特征表达的丰富性与辨别能力.

首先,模型采用5×5卷积提取覆盖5×5像素区域的局部特征;随后,通过扩张率为5的3×3扩张卷积进一步建模该区域与其周围8个相邻区域块之间的关系,从而获得包含局部关联信息的特征图Fb3.如公式(1)所示:

Fb3=DConv5(Conv5×5(Fin))

同时,采用3×3卷积提取覆盖3×3像素区域的局部特征,通过3×3且扩张率为3的扩张卷积进一步提取得到特征图Fb2.如公式(2)所示:

Fb2=DConv3(Conv3×3(Fin))

其次,模型采用1×1卷积提取覆盖1×1像素区域的局部特征,随后,通过扩张率为1的3×3扩张卷积进一步提取特征图Fb1,同时仅用1×1卷积提取覆盖1×1像素区域的特征图Fb0.如式(3)式(4)所示:

Fb1=DConv(Conv1×1(Fin))
Fb0=Conv1×1(Fin)

最后,利用1×1卷积将通道拼接后的多尺度关系特征图进行融合,实现通道降维,得到输出Er.如式(5)所示:

Er(Fin)=Conv1×1(Fb0Fb1Fb2Fb3)

式中:Fb0Fb1Fb2Fb3表示每个分支后对应的特征图;DConv n 表示卷积核为3×3的扩张卷积,n表示扩张率.

1.2.2 多方向特征感知模型

为了使网络能够同时捕捉红外图像在尺度空间中的方向特征与整体特征,引入多方向特征感知模型对特征图Er进行处理,强化高频信息.具体地,通过引入离散小波变换,提取水平、垂直、对角及低频方向的不同频率子带,模拟人类视觉系统对方向性特征的敏感性,强化高频细节特征,从而提升小目标与背景的区分度.变换后为保持输出特征图与输入分辨率一致,采用双线性上采样恢复尺寸,使输出保持不变.

首先,输入为由多尺度局部学习模型生成的特征图Er.通过设计水平、垂直、对角及低频四类滤波器,提取特征图在各个方向上的分量,并分别构建对应方向的高频特征图.随后,对各方向的特征分量分别进行全局平均池化与全局最大池化操作,在通道维度上进行拼接,进而通过卷积运算与Sigmoid激活函数生成各方向的权重图,以实现方向特征的有效建模与增强.如式(6)~式(9)所示.

Fh=S(C(GAP(fh(Er))GMP(fh(Er))))Er
Fv=S(C(GAP(fv(Er))GMP(fv(Er))))Er
Fd=S(C(GAP(fd(Er))GMP(fd(Er))))Er
FL=S(C(GAP(fL(Er))GMP(fL(Er))))Er

式中:Fh表示水平方向的特征图;Fv表示垂直方向的特征图;Fd表示对角方向的特征图;FL表示低频方向的特征图;C表示Conv;S表示Sigmoid激活函数;GAP表示全局平均池化;GMP表示全局最大池化;fhfvfdfL分别对应离散小波变换中的水平、垂直、对角和低频方向二维卷积核,定义为Daubechies基函数的小波滤波器组;分别表示逐元素相加和逐元素相乘.最后将得到的来自四个不同方向的特征图进行融合,得到输出Fo.如公式(10)所示.

Fo=FhFvFdFL

在多方向特征感知模块之后,进一步引入了SE注意力模块.通过通道加权抑制冗余的背景特征,增强与目标相关的通道响应,有效提升目标区域的显著性,使网络能够更加聚焦于当前任务中的关键特征,从而进一步增强检测性能.最终,将该模块的输出特征图与原始输入特征图进行逐元素相加,生成最终的输出特征图FxRB×C×H×W.如公式(11)所示:

Fx=SE(Fo)Fin

1.3 层次化特征金字塔模块

现有主流特征融合策略普遍依赖多轮下采样-上采样流程,并配合固定尺度的感受野及稀疏空洞卷积采样以扩展感知范围.此类设计虽能增加全局上下文,但对细粒度纹理的保留能力不足,尤其削弱了对小尺度目标的显著性建模,进而易导致其特征表示模糊化甚至信息丢失.对此,设计了一种层次化特征金字塔模块.该模块首先在通道维度上进行降维映射,引入多尺度池化结构对局部区域进行多尺度感知,再通过非线性变换与上采样操作,实现跨尺度语义信息的有效融合.最终结合残差连接,使输出特征既保留了空间结构的细粒度信息,又具备跨尺度的全局感知能力,从而有效提升小目标在多层解码过程中的响应强度与检测精度.层次化特征金字塔模块结构如图3所示.

首先将输入特征进行通道压缩激活(channel compression activation, CCA)来降低特征维度.通道压缩激活以线性可学习投影实现逐像素对齐的降维,不破坏空间布局,利于小目标的显著性保持.CCA包含重塑、线性投影以及GELU激活函数,如 式(12)所示:

Fs=τ(GELU(Widown(τ(Fx))))

式中:τ(·)表示重塑操作,将输入特征FxRB×C×H×W重塑为FxRB×H×W×C.WidownRC×d 表示线性投影的参数,通过线性矩阵将特征维度从C降至dd=C/rr为降维因子).随后应用GELU激活函数以及重塑操作τ(·)将特征重塑回FsRB×d×H×W.

为了提升网络对目标的表达能力,采用四个平均池化层分别来获得多尺度特征,四个平均池化层分别为3×3、6×6、9×9、12×12.池化结束后通过深度 卷积来捕捉局部细节信息分别得到四个特征图.同时,仅用DWConv来获取一个特征图F0.如式(13)~式(14)所示:

F0=DWConv(Fs)
Fj=
US(DWConv(Conv(AP(Fs)))),j{3,6,9,12}

式中:DWConv表示具有3×3的内核的深度卷积层;US表示上采样,采用双线性插值将每个尺度的特征上采样至原始分辨率.

其次将池化分支得到的四个特征图与F0进行拼接并融合,得到FcatRB×2d×H×W,通道数变为2d.如式(15)所示.

Fcat=F0F3F6F9F12

式中:||表示将4个尺度的特征与原始降维特征(经深度可分离卷积处理后的结果)进行通道拼接.

之后通过1×1卷积将这些融合后的通道数2d 压缩至原始维度d,得到输出特征FdRB×d×H×W.如式(16)所示:

Fd=Conv(Fcat)

随后,将Fd进行线性逆投影通道扩展(linear inverse-projection channel expansion, LIPCE),将维度从d恢复到C.如式(17)所示.

Fu=τ(Wiup(τ(Fd)))

式中:第一次特征重塑将FdRB×d×H×W重塑为FdRB×H×W×d;之后使用线性投影WiupRd×C将特征维度由d恢复为C;第二次特征重塑特征图重塑回FuRB×C×H×W.

最后,将重塑好的特征图与输入特征图进行残差相加得到最终输出FcRB×C×H×W.如式(18)所示:

Fc=Fx+Fu

层次化特征金字塔模块区别于传统的跨层特征融合方法,在同一层级内部先进行语义对齐,再实现特征融合.该设计既保留了检测小目标所需的高分辨率空间信息,又有效增强了特征的高层语义表达,同时兼顾精度与效率.

1.4 双域协同注意力模块

在红外小目标检测任务中,目标通常呈现出低信噪比、小尺寸与弱纹理等特点,使得传统卷积特征在提取局部显著性与保持全局一致性之间面临挑战.尤其在深层语义建模阶段,背景干扰信息易被误强化,进一步加剧了检测结果的不稳定性.针对上述问题,提出了一种双域协同注意力模块,从空间域与上下文信息层面共同建模小目标特征.在该模块中,局部卷积分支通过动态卷积强化目标区域的空间响应,有效抑制背景噪声干扰;而全局注意力分支则对整图范围内的语义关系进行建模,提升小目标在上下文中的辨识能力.两者协同作用,缓解了红外图像中小目标因尺度细微与背景复杂所带来的检测困难,实现了更稳定、准确的跨层特征融合与目标感知.双域协同注意力模块结构如图4所示.

首先将输入2D特征图FcRB×C×H×W通过维度扩展生成3D特征图FcRB×C×1×H×W,然后进行逐点卷积操作,将通道维度由C转化为3C,得到特征图FRB×3C×1×H×W,同时划分全局注意力分支和局部卷积分支.如式(19)所示:

F=Conv1×1×1(Fc)

对于全局注意力分支,将特征图F沿通道维度分割成3部分,并进行多头排布,生成查询( Q )、键( K )、值( V ),如式(20)所示:

Q,K,V=Rearrange(Split(F))

式中:Split表示将输入沿通道维度分割为3部分;Rearrange表示重排操作,将Q,K,VRB×C×H×W重排为Q,K,VRB×h×Ch×N,其中Ch=C/hN=HW.

然后,对 QK 进行归一化处理,让点积落在有限区间[-1,1],使梯度更稳定.同时加权可学习温度标量 ,实现动态调节注意力稀疏度,通过Softmax函数生成最终注意力值 A .如式(21)所示:

A=Softmax((Q^K^T)δh)

式中:δh表示第h头的可学习温度标量.

最后,将最终注意力值输出 AV 加权求和后进行线性映射,得到与输入同维度的输出特征图SA.如式(22)所示:

SA=Conv1×1×1(AV)

对于局部卷积分支,首先对特征图F进行重塑,得到特征图FrRB×N×3h×Ch,其中Ch=C/hN=HW.之后,对特征图Fr进行逐像素1×1×1卷积操作,将同一像素、同一注意力头的 Q/K/V 三向量线性融合,得到对应3×3九宫格九个方向的9通道权重.同时把方向维度并入通道,形成每头9×Ch 通道的特征图Fm.如 式(23)所示:

Fm=Conv1×1×1(Fr)

随后,对特征图Fm进行局部3×3聚合,对生成的9个方向特征在空间领域整合,得到输出特征图FlcRB×C×H×W.如式(24)所示:

Flc=DWConv3×3(Fm)

最终,将局部与全局特征逐元素相加,得到最终输出FoutRB×C×H×W,使模块同时拥有精细纹理感知能力与长程语义整合能力.如式(25)所示:

Fout=SA+Flc

1.5 损失函数

为缓解红外小目标在下采样过程中信息丢失的问题,MSFHA-Net引入深度监督机制,并联合采用二值交叉熵(binary cross entropy, BCE)和交并比 (intersection over union, IoU)20损失函数,以提升分割精度.同时,结合多尺度加权策略,引导模型在不同层级聚焦目标区域,进一步增强小目标检测能力.其中,BCE用于衡量预测图与真实标签的像素级差异,强化前景与背景的区分.IoU则直接优化预测与真实区域的重叠程度,提高目标定位精度.损失函数如公式(26)所示:

li=BCE(y,y^)+IoU(y,y^),=i=05li×li

式中:li表示多个尺度下的损失;y^为真实掩码;y为预测掩码;i表示不同尺度;表示总损失函数.通过多尺度监督,缓解因多次下采样导致的小目标信息丢失问题,提升模型对多尺度目标的敏感性.浅层权重高,深层权重低,符合小目标检测需依赖细节信息的特性.

2 实验结果与分析

2.1 数据集和评价指标

为验证所提出的MSFHA-Net模型的有效性,在SIRST20和IRSTD-1k21两个典型的红外小目标检测数据集上开展实验.SIRST是专为红外小目标检测任务构建的数据集,其图像选自多个红外视频序列,覆盖多种应用场景,共包含427幅图像,涵盖短波、中波和近红外(950 nm)等多个波段,具有复杂背景与低对比度目标等特点.IRSTD-1k数据集包含1 000幅分辨率为512×512像素的灰度图像,涵盖天空、海面、地面等典型背景,目标尺寸通常小于图像面积的1%,具备典型的小目标特征.该数据集具有目标尺寸小、背景干扰强、目标数量不确定等特点,显著提升了检测任务的难度.实验采用交并比(IoU)、归一化交并比 (normalized IoU, nIoU)、F1分数、正检测率(positive detection, Pd)以及假警报率(false alarm, Fa)作为性能评价指标.其中,IoU用于衡量预测区域与真实区域的重叠程度,nIoU则通过归一化处理进一步提升其在不同数据集上的可比性.F1分数综合了精度与召回率,评估分割结果的整体表现; Pd评价了算法正确识别真实目标的能力,而Fa反映了算法在目标检测中的误报情况.

2.2 实验设置

本文模型在NVIDIA RTX 3090 GPU上进行实验,图像尺寸设置为512×512像素、具有三个颜色通道的输入图像.在训练中,将初始学习率设置为5×10-4,采用Adam优化器进行网络优化,Batch_size设置为4,共运行300个epoch.

2.3 消融实验

为了评估中MSPE模块、HFPM模块、DDSM模块对于红外小目标检测精度的影响,在数据集SIRST上进行消融实验,实验结果如表1所示.

由实验结果可得,在基准模型中加入各模块性能指标均有提升.在基准模型上引入MSPE模块,利用不同膨胀率的卷积层捕获目标的多尺度上下文,强化目标特征抑制噪声,在增强表征能力的同时保持计算效率,模块使IoU提升了0.96个百分点、nIoU提升了1.04个百分点.在基准模型引入HFPM模块,增强小目标在网络中的表达能力,保护细节机制,防止在采样过程中丢失.模块使IoU提升了0.6个百分点、nIoU提升了0.9个百分点.在基准模型上引入DDSM模块,增强小目标边缘响应,抑制背景热噪声.模块兼顾红外图像中需要的全局线索和局部细节,使IoU提升了0.25个百分点、nIoU提升了0.72个百分点.

在基准模型上引入HFPM和DDSM两个模块,使IoU提升了1.01个百分点、nIoU提升了1.07个百分点,F1提升至85.36%,Pd为95.47%,Fa为15.86×10-6.这表明二者相互协同,DDSM的注意力抑噪比更稳,HFPM有效缓解上采样过程中的细节衰退.在基准模型上引入MSPE和DDSM两个模块,使IoU提升了1.64个百分点、nIoU提升了1.21个百分点,F1提升至85.89%,Pd为95.91%,Fa为15.63×10-6.这表明DDSM对MSPE模块产出的方向高频图进行选择性加权,更易区分目标和背景.在基准模型上引入MSPE和HFPM两个模块,使IoU提升了2.06个百分点、nIoU提升了1.87个百分点,F1提升至86.13%,Pd为96.11%,Fa为15.51×10-6.这表明在空间-频域联合优化时,HFPM能够放大MSPE的细节增益,可以更好地提高对高频信息的关注度.在基准模型上引入MSPE、HFPM和DDSM三个模块,使IoU提升了2.27个百分点、nIoU提升了2.7个百分点,F1提升至86.31%,Pd为96.32%,Fa为15.15×10-6.三个模块的协同作用显著提升了小目标的检测精度,尤其在F1分数和Pd上的提升,进一步增强了模型的整体性能和鲁棒性.

为了验证MSPE模块中MLRL、MDFP和SE对红外小目标检测精度的影响,在SIRST数据集上进行消融实验.各组数据所得数据如表2所示.由实验结果可知,各组数据中F1PdFa指标变化较小.与同时缺失其他模块相比,MDFP组件对模块的影响最大,去除MDFP组件时,导致IoU下降0.88个百分点,nIoU下降0.70个百分点,说明多方向特征感知对于检测精度尤为关键;SE组件相对影响最小,缺少SE时,IoU下降0.24个百分点,nIoU下降0.23个百分点,说明SE注重通道加权,与其他两个组件形成互补;MLRL组件对模块的影响适中,缺少MLRL时,IoU下降0.40个百分点,nIoU下降0.45个百分点,表明多尺度局部关系建模能够改善边界一致性并增强上下文依赖.综上所述,MSPE模块通过多方向特征增强、跨尺度关系建模与通道选择性加权实现了对小目标特征的充分表征,其设计对提升网络整体性能具有核心意义.

为了验证HFPM中不同降维方法对模型性能的提升,本文在实验中分别引入了1×1 Conv(无激活函数)、SE-Squeeze和PCA以及本文所引入的CAA(线性投影+GELU激活)方法,并在SIRST数据集上进行对比实验.实验结果如表3所示.由实验结果可知,CAA降维方法的性能明显优于其他方法.表明CAA作为一种自适应降维方法,能够根据数据的特点进行学习,并得到最优的投影矩阵,从而更好地将数据映射到任务相关的子空间.通过线性投影与GELU激活函数的结合,CAA保持了逐像素的对齐,避免了全局池化方法可能导致的信息丢失和过度平滑,有效地保留了更多细粒度的特征.与之相比,尽管PCA在降维过程中能够去除冗余信息,但由于其无法根据训练数据的任务特性进行动态调整,导致其在精度和灵活性上逊色于CAA.而1×1 Conv和SE-Squeeze降维方法虽然具有一定的学习能力,但由于降维过程缺乏深度自适应调整,未能有效捕捉复杂背景中的细粒度特征,因此其性能和精度均低于CAA.综上所述,CAA降维方法在红外小目标检测任务时展现出更强的优势.

为了验证HFPM中不同池化尺度组合对MSFHA-Net模型性能的影响.本文在实验中分别使用3/5/7/9,3/7/11/15以及本文所使用的3/6/9/12,并在SIRST数据集上进行实验.各组实验结果如表4所示.由实验结果可知,组合为3/6/9/12的性能最好,IoU达到了82.36%,相较于3/5/7/9和3/7/11/15组合,分别提升了2.27个百分点和1.67个百分点.nIoU达到了81.01%,相较于3/5/7/9和3/7/11/15组合,分别提升了2.7个百分点和1.8个百分点.说明与其他池化组合相比,3/6/9/12配置能够更均匀地覆盖近场、中场和远场的不同尺度,进而增强了模型对小目标的细节感知能力和全局上下文建模能力.此配置通过合理的尺度设计,有效避免了过度平滑,保留了更多的细粒度信息,从而提升了对小目标的精准定位.而3/5/7/9组合未能与解码层级的上采样倍数完全对齐,这种不对称的池化方式可能导致重要图像信息的丢失,使得目标的特征表示不完整.尽管3/7/11/15组合能够增加感受野,但其池化层之间的跨度过大,未能有效保持不同层级之间的细节传递,可能导致特征信息的丢失.综上所述,3/6/9/12配置在红外小目标检测任务中展现出较为优异的性能.

为了验证DDSM注意力模块对MSFHA-Net模型性能的提升,本文在实验中分别引入了SE注意力19、ECA注意力[22]、ViT注意力23和BAM注意力24,并在SIRST数据集上进行对比实验.各组实验所得的IoU和nIoU结果如表5所示.结果表明,BAM注意力机制的指标与DDSM注意力相近,而其余注意力机制的性能均明显低于DDSM注意力.具体而言,相较于SE注意力,引入DDSM注意力后IoU提升了1.16个百分点,nIoU提升了1.51个百分点.这说明虽然SE注意力通过调节通道权重提升了对关键信息的关注,但在捕捉局部细节和全局上下文信息方面仍不及DDSM注意力.相较于ECA注意力,引入DDSM注意力后IoU提升了0.76个百分点,nIoU提升了1.21个百分点,说明ECA作为一种轻量级通道注意力机制,虽具备一定平衡性,但其性能仍逊于DDSM注意力.相较于ViT注意力,引入DDSM注意力后IoU提升了0.51个百分点,nIoU提升了0.91个百分点.这表明ViT依赖全局注意力机制,在长距离依赖建模上表现突出,但计算开销较大.值得注意的是,BAM注意力机制与DDSM相似,能够通过局部与全局特征的加权融合增强目标感知能力.综上所述,实验结果充分验证了DDSM注意力机制中局部卷积、全局注意力以及协同融合设计在红外小目标检测任务中具有显著的性能提升作用.

2.4 对比实验

为了进一步验证本文算法的泛化性,在两个红外小目标数据集SIRST、IRSTD-1k上与多种先进的红外小目标检测算法进行比较,实验结果如表6所示.

实验结果表明,MSFHA-Net在SIRST数据集上取得了82.36%的IoU和81.01%的nIoU,较HCF-Net分别提升2.27个百分点和2.70个百分点,较ABC-Net提升1.35个百分点和2.01个百分点,相较MiM-ISTD,IoU提升1.44个百分点,nIoU仅提升0.88个百分点.在IRSTD-1k数据集上,MSFHA-Net分别获得72.15%的IoU和68.55%的nIoU.虽然nIoU略低于ABC-Net(68.81%),但IoU仍达最高值,体现了其对整体目标区域的精确分割能力.综上,MSFHA-Net 在SIRST上显著提升小目标细节保持能力,在IRSTD-1k上虽nIoU略逊于ABC-Net,但更高的IoU表明其在整体区域分割上更具优势.

为了更直观地验证本方法的优势,进行可视化实验分析,从红外图像数据集中随机选出3幅背景复杂、干扰较大的图像进行测试.可视化实验结果如 图5所示,红色框表示正确预测,蓝色框表示遗漏检测,黄色框表示错误检测.实验结果表明,与其他算法相比,MSFHA-Net成功地检测到了每一个目标,而其他方法会导致漏检或错误检测.

3 结 论

本文针对红外小目标检测任务中存在的背景干扰和小目标易丢失两个问题,提出了一种多尺度频空层级注意力网络.网络集成了多种功能模块,采用多尺度感知增强模块提升了目标与背景的区分度,抑制了背景干扰;结合逐步上采样和层次化特征金字塔模块,进一步增强了细节恢复能力,通过引入双域协同注意力机制有效缓解了下采样过程中小目标特征的丢失,从而提升了网络的整体性能.在SIRST数据集上,IoU和nIoU分别达到82.36%和81.01%;在IRSTD-1k数据集上,IoU和nIoU分别达到72.15%、68.55%.该网络在保持参数规模可控的前提下,优于当前最新的方法,能够更准确地识别红外小目标的方位.然而,所设计的MSFHA-Net仍存在一定局限性.一方面,模块间串联增加了部分推理延迟,使其在超实时应用场景中的适用性受到一定限制;另一方面,模型在极低信噪比环境下仍存在目标过度平滑的问题.后续工作将从模型压缩与高频显著性增强方向开展优化研究,以进一步提升检测速度与鲁棒性.

参考文献

[1]

查月,汤晔 .红外海面小目标检测算法综述[J].宇航计测技术202242(6): 57-65.

[2]

ZHA YTANG Y .Review of infrared sea surface small-target detection algorithm[J].Journal of Astronautic Metrology and Measurement202242(6):57-65.(in Chinese)

[3]

LIN F ZGE S MBAO K Xet al. learning shape-biased representations for infrared small target detection[J]. IEEE Transactions on Multimedia202326: 4681-4692.

[4]

DESHPANDE S DER M HVENKATESWARLU Ret al. Max-mean and max-median filters for detection of small targets[C]//Signal and Data Processing of Small Targets 1999. SPIE, 19993809: 74-83.

[5]

WEI Y TYOU X GLI H.Multiscale patch-based contrast measure for small infrared target detection[J].Pattern Recognition201658:216-226.

[6]

DAI Y MWU Y Q.Reweighted infrared patch-tensor model with both nonlocal and local priors for single-frame small target detection[J].IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing201710(8): 3752-3767.

[7]

ARCE GMCLOUGHLIN M. Theoretical analysis of the max/median filter[J]. IEEE Transactions on Acoustics, Speech, and Signal Processing198735(1): 60-69.

[8]

TOMASI CMANDUCHI R. Bilateral filtering for gray and color images[C]//Sixth International Conference on Computer Vision. IEEE, 1998: 839-846.

[9]

LI J FGONG W GLi W Het al. Robust pedestrian detection in thermal infrared imagery using the wavelet transform[J]. Infrared Physics & Technology201053(4): 267-273.

[10]

CHEN ZLUO SXIE Tet al. A novel infrared small target detection method based on BEMD and local inverse entropy[J]. Infrared Physics & Technology201466: 114-124.

[11]

GAO C QMENG D YYANG Yet al. Infrared patch-image model for small target detection in a single image[J]. IEEE Transactions on Image Processing201322(12): 4996-5009.

[12]

HE Y JLI MZHANG J Let al. Small infrared target detection based on low-rank and sparse representation[J]. Infrared Physics & Technology201568: 98-109.

[13]

ZHAO M XCHENG LYANG Xet al. TBC-Net: a real-time detector for infrared small target detection using semantic constraint[J/OL]. arXiv preprint, 2019.DOI:1048550/arXiv.2001.05852 .

[14]

WANG HZHOU L PWANG L .Miss detection vs.false alarm:adversarial learning for small object segmentation in infrared images[C]//2019 IEEE/CVF International Conference on Computer Vision (ICCV),October 27-November 2,2019.Seoul,Korea.IEEE,2019:8508-8517.

[15]

WU XHONG D FCHANUSSOT J. UIU-Net: U-net in U-net for infrared small object detection[J]. IEEE Transactions on Image Processing202232: 364-376.

[16]

王潇,刘贞报 .基于多层多向Transformer的红外弱小目标检测[J].航空学报202445(14):1-13.

[17]

WANG XLIU Z B .Infrared small target detection based on multi-layer multi-direction transformer[J].Acta Aeronautica et Astronautica Sinica202445(14):1-13.(in Chinese)

[18]

PAN P WWANG HWANG C Yet al .ABC:attention with bilinear correlation for infrared small target detection[C]//2023 IEEE International Conference on Multimedia and Expo (ICME),July 10-14,2023.Brisbane,Australia.IEEE,2023:2381-2386.

[19]

薛雅丽,俞潼安,崔闪, .基于级联嵌套U-Net的红外小目标检测[J].吉林大学学报(工学版)202555(5):1714-1721.

[20]

XUE Y LYU T ACUI Set al .Infrared small target detection based on cascaded nested U-Net[J].Journal of Jilin University (Engineering and Technology Edition)202555(5):1714-1721.(in Chinese)

[21]

XU S BZHENG S CXU W Het al .HCF-net:hierarchical context fusion network for infrared small object detection[C]//2024 IEEE International Conference on Multimedia and Expo (ICME),July 15-19,2024.Niagara Falls,ON,Canada.IEEE,2024:1-6.

[22]

HU JSHEN LSUN G .Squeeze-and-excitation networks[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition.June 18-23,2018.Salt Lake City,UT,USA.IEEE,2018:7132-7141.

[23]

DAI Y MWU Y QZHOU Fet al .Asymmetric contextual modulation for infrared small target detection[C]//2021 IEEE Winter Conference on Applications of Computer Vision (WACV).January 3-8,2021.Waikoloa,HI,USA.IEEE,2021:949-958.

[24]

ZHANG M JZHANG RYANG Y Xet al .ISNet:shape matters for infrared small target detection[C]//2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR),June 18-24,2022.New Orleans,LA,USA.IEEE,2022:867-876.

[25]

WANG Q LWU B GZHU P Fet al.ECA-net:efficient channel attention for deep convolutional neural networks[C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR),June 13-19,2020.Seattle, WA, USA.IEEE,2020: 11534-11542.

[26]

DOSOVITSKIY ABEYER LKOLESNIKOV Aet al. An image is worth 16×16 words: Transformers for image recognition at scale[J]. arXiv preprint arXiv:2020.

[27]

PARK J, WOO S, LEE J Yet al. BAM: block attention module for fine-grained feature enhancement[C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), Seattle, WA, USA: IEEE, 2020: 967-976.

[28]

ZHANG L DPENG Z M .Infrared small target detection based on partial sum of the tensor nuclear norm[J].Remote Sensing201911(4):382.

[29]

XIE E ZWANG W HYU Zet al. SegFormer: simple and efficient design for semantic segmentation with transformers[J]. Advances in neural information processing systems202134: 12077-12090.

[30]

ZHANG M JYUE KZHANG Jet al .Exploring feature compensation and cross-level correlation for infrared small target detection[C]//Proceedings of the 30th ACM International Conference on Multimedia.Lisboa Portugal.ACM,2022:1857-1865.

[31]

FAN L YWANG Y YHU G Let al .Diffusion-based continuous feature representation for infrared small-dim target detection[J].IEEE Transactions on Geoscience and Remote Sensing202462:1-17.

[32]

LI B YXIAO CWANG L Get al. Dense nested attention network for infrared small target detection[J]. IEEE Transactions on Image Processing202332: 1745-1758.

[33]

ZHANG M JBAI H CZHANG Jet al .RKformer:Runge-Kutta transformer with random-connection attention for infrared small target detection[C]//Proceedings of the 30th ACM International Conference on Multimedia.Lisboa Portugal.ACM,2022:1730-1738.

[34]

王培超,王家宝,寇人可,.边缘信息增强的轻量化红外小目标检测方法[J].计算机工程与应用202662(18): 255-269.

[35]

WANG P CWANG J BKOU R Ket al. A lightweight infrared small target detection method with enhanced edge information [J]. Computer Engineering and Applications202662(18): 255-269. (in Chinese).

[36]

CHEN T XTAN Z TCHU Qet al. TCI-former:thermal conduction-inspired transformer for infrared small target detection[J].Proceedings of the AAAI Conference on Artificial Intelligence202438(2):1201-1209.

[37]

CHEN T XYE ZTAN Z Tet al. MiM-ISTD: Mamba-in-Mamba for efficient infrared small-target detection[J]. IEEE Transactions on Geoscience and Remote Sensing202462:1-13.

[38]

ZUO J YPEI S WLI Q .DENet:dual-path edge network with global-local attention for infrared small target detection[EB/OL].2025arXiv:2509.20701.

基金资助

国家自然科学基金资助项目(62061042)

National Natural ScienceFoundation of China(62061042)

中央引导地方科技发展资金项目(25ZYJN001)

Central Guidance for Local Science and Technology Development Fund(25ZYJN001)

甘肃省自然科学基金资助项目(23JRRA796)

Natural Science Foundation of Gansu Province(23JRRA796)

AI Summary AI Mindmap
PDF (2604KB)

221

访问

0

被引

详细

导航
相关文章

AI思维导图

/