基于多注意力特征融合的SAR图像目标分类算法

许丽龙 ,  王春柳 ,  侯宇超 ,  王鹏

中北大学学报(自然科学版) ›› 2025, Vol. 46 ›› Issue (05) : 561 -573.

PDF (5860KB)
中北大学学报(自然科学版) ›› 2025, Vol. 46 ›› Issue (05) : 561 -573. DOI: 10.62756/jnuc.issn.1673-3193.2025.03.0012
智能图像处理技术专栏

基于多注意力特征融合的SAR图像目标分类算法

作者信息 +

Target Classification Algorithm for SAR Images Based on Multi⁃Attention Feature Fusion

Author information +
文章历史 +
PDF (6000K)

摘要

针对SAR图像目标分类问题提出了一种新的多注意力特征融合网络(Multi-Attention Feature Fusion Network, MAFNet)分类模型。该模型首先对初始图像使用多头自注意力机制来捕获全局信息; 其次, 通过引入协方差注意力机制进一步增强通道特征和空间特征的表达; 然后引入浅层鲁棒特征下采样模块, 以更高效地提取原始图像的有效信息; 最后对前述获得的三个注意力特征进行融合, 获取了更有表征能力的SAR图像特征。本文模型克服了传统卷积神经网络仅在局部范围进行特征提取的问题, 对深层特征进行通道和空间两个维度的信息筛选和增强, 同时融合包含全局信息的特征, 有效提升了模型的分类准确性和鲁棒性。在SOC条件下的MSTAR数据集上的实验结果表明, MAFNet的分类准确率达99.96%, 明显优于其他算法。

Abstract

A novel classification model for SAR image target classification, named Multi-Attention Feature Fusion Network (MAFNet) was proposed. Firstly, a multi-head self-attention mechanism was applied to the original image to capture global information. Secondly, a covariance attention mechanism was introduced to further enhance the representation of channel and spatial features. Thirdly, a shallow robust feature downsampling module was incorporated to more efficiently extract effective information from the raw image. Finally, the three attention-based features were fused to obtain more representative SAR image features. This approach overcomes the limitation of traditional convolutional neural networks, which only extract features within a local receptive field. By enhancing deep features in both channel and spatial dimensions and integrating features containing global information, the model significantly improves classification accuracy and robustness. Experimental results on the MSTAR dataset under the SOC condition show that MAFNet achieves a classification accuracy of 99.96%, outperforming other existing algorithms.

Graphical abstract

关键词

雷达图像目标分类 / MSTAR数据集 / 注意力机制 / 特征提取

Key words

SAR image classification / MSTAR dataset / attention mechanism / feature extraction

引用本文

引用格式 ▾
许丽龙,王春柳,侯宇超,王鹏. 基于多注意力特征融合的SAR图像目标分类算法[J]. 中北大学学报(自然科学版), 2025, 46(05): 561-573 DOI:10.62756/jnuc.issn.1673-3193.2025.03.0012

登录浏览全文

4963

注册一个新账户 忘记密码

0 引 言

合成孔径雷达(Synthetic Aperture Radar, SAR)作为一种主动微波成像传感器, 能够不受光照条件的限制全天候获取目标的结构、 大小以及散射信息, 可拍摄高标称分辨率图像, 在地形测绘、 地质勘探、 海洋观测等领域应用广泛, 尤其在国防安全、 农业估算和地质勘测中作用突出。合成孔径雷达自动目标识别(Synthetic Aperture Radar Automatic Target Recognition, SAR ATR)是SAR图像解译的关键环节, 它可以对输入的目标区域进行类别判断, 在民用和军事等众多领域都有着极其重要的应用价值。正因为如此, SAR ATR受到了世界各国的高度关注, 取得了丰硕的研究成果。

SAR ATR方法主要分为基于模板的方法1、 基于模型的方法2和基于机器学习312的方法。基于模板的方法通过匹配待分类图像与预定义模板确定类别, 计算匹配度(如欧几里得距离), 但受成像条件的影响较大, 泛化能力弱, 计算复杂。基于模型的方法利用先验知识构建目标或场景的数学模型, 并通过匹配分类, 具有较强的解释性, 但依赖先验知识, 计算资源需求高。

随着支持向量机(Support Vector Machine, SVM)等稳健分类器的发展, 机器学习范式逐渐被应用于SAR ATR任务3。近年来, 深度卷积神经网络(Deep Convolutional Neural Network, DCNN)凭借其强大的特征提取能力在图像识别领域取得显著突破, 并逐渐成为SAR图像目标分类的主流架构1319。然而, SAR图像对姿态变化敏感且存在相干斑噪声, 其获取成本高且标注困难(尤其在非合作目标场景下难以获取大量标注样本), 导致DCNN在实际应用中仍面临数据不足、 过拟合及对复杂成像条件鲁棒性不足等挑战。针对过拟合与数据不足的问题, Chen等4设计了全卷积网络(A-ConvNets)架构, 通过稀疏连接层替代传统卷积网络中的全连接层; Shang等5提出深度记忆卷积神经网络(M-Net), 为解决训练问题通过转移参数技术分两步进行训练, 通过添加信息记录器来记忆样本空间特征并利用其预测未知样本标签; Deng等6提出基于视觉转换器(Vision Transformer, ViT)模型的自监督对比学习模型(Sup-ConL), 在预训练阶段通过裁剪、 旋转、 高斯噪声和乘性噪声等SAR特异性增强策略模拟姿态变化与噪声干扰, 提升特征鲁棒性, 微调阶段结合对比损失与交叉熵损失, 融合标签信息与语义信息, 优化了分类能力; Fu等7采用深度残差网络, 引入dropout层缓解过拟合, 将新的损失函数center loss与softmax loss结合来训练网络; Wilmanski等8探讨了应用于SAR ATR的权重初始化、 随即池化、 自适应优化算法等现代CNN训练方法, 通过对训练方法的改进, 在小样本的MSTAR数据集上实现了比以往方法更高的分类准确率。Sun等9设计了SOIF-CycleGAN网络, 通过SAR光学图像双向翻译生成人工数据来解决特征提取难和数据集匮乏的问题, 同时解决了相干斑噪声的问题。针对姿态变化敏感问题, Banas等10将自然图像领域的3D图像识别技术应用于SAR, 并采用了多视图卷积神经网络(MVCNN)框架, 结合了A-ConvNets骨干网络及针对SAR数据的预处理和增强方法, 显著提高了SAR ATR性能; Ren等11提出类导向分层表示混合推理网络(HRNCHR)并将其应用于少样本SAR目标识别, 通过局部-全局信息并发细化机制(LGICRM)来提取多样特征, 在双曲空间建立层级表示空间以学习类别间的层级关系, 采用混合推理策略来融合实例和原型推理结果。针对多视图自动目标识别(Automatic Target Recognition, ATR)方法在输入图像数量变化时面临结构复杂和计算量大的问题, Zhang等12提出了基于图像注意力的自适应多视图融合网络(IA-AMF-Net), 通过深度可分离卷积提取特征, 利用挤压与激励操作生成图像注意力权重融合特征, 增强对目标分类特征的关注, 且融合特征维度与输入图像数量无关。这些算法都是针对SAR图像某些特点设计的, 并没有完全解决SAR图像目标分类存在的问题。

以上算法均在SAR图像目标分类领域取得了显著成效, 但仍存在一些不足。传统卷积神经网络(Convolutional Neural Network, CNN)仅在局部范围进行特征提取, 无法建模远距离依赖关系。针对这个问题, 不少网络引入了注意力机制来实现通道和空间维度的信息交互。例如, 孙靖森等13提出的ICBAM_CNN在传统CNN中融合了通道与空间注意力以增强全局信息捕捉, 但它仍难以建模长距离依赖关系。ViT模型的自注意力机制可以直接捕捉全局信息, 能建模长距离依赖关系20, 但它不像CNN那样在小数据集上也具有良好的泛化能力, ViT依赖大规模数据训练, 否则容易过拟合, 且缺乏CNN的局部特征提取能力, 收敛速度较慢, 需要更长的训练时间, 需要大量正则化技巧才能稳定训练。因此, 本文提出多注意力特征融合网络(Multi-Attention Feature Fusion Network, MAFNet), 引入浅层鲁棒特征下采样模块来处理初始图像, 融合协方差注意力机制和自注意力机制, 在增强局部信息提取的同时捕捉全局特征, 从而保证分类性能。

1 多注意力特征融合网络

尽管当前SAR图像的标称分辨率已显著提升, 但其数值仍普遍低于高分辨率光学图像。更为关键的是, SAR图像与光学数据存在本质特性差异: 1) SAR成像依赖主动微波散射机制, 导致图像受斑点噪声干扰且地物特征由散射特性主导(如金属目标强反射、 水面弱反射); 2) 侧视成像几何引发叠掩、 阴影等畸变, 进一步增加了目标解译的复杂性。因此, 在下采样时容易受干扰信息影响, 而且传统CNN局部特征堆砌导致整体语义碎片化, 不能很好地关注整体特征。为应对以上挑战, 本文提出了一种融合多种注意力特征的分类模型——MAFNet, 其结构如图 1 所示。当初始图像输入网络时, 往往包含大量的信息, 其中不仅有重要的目标特征信息, 还存在散斑噪声以及复杂背景环境所造成的干扰信息。本文提出的网络MAFNet一方面基于视觉转换器(Vision Transformer, ViT)模型捕获SAR图像全局信息, 获得包含长距离依赖关系的特征图(维度为256×8×8, 即通道数×高度×宽度, 其中高度和宽度的单位为像素); 另一方面采用浅层鲁棒特征下采样模块(Shallow Robust Feature Downsampling, SRFD)进行下采样, 在抑制原始图像中冗余信息的同时有选择地保留显著特征, 得到浅层特征图后再分别经过3×3卷积层、 协方差通道注意力模块、 协方差空间注意力模块获得深层特征图(256×8×8)、 协方差通道注意力(256×1×1)、 协方差空间注意力(1×8×8), 然后将深层特征图分别与通道注意力和空间注意力相乘, 实现通道和空间两个维度的信息筛选和增强, 得到通道信息增强的协方差通道注意力特征图和空间信息增强的协方差空间注意力特征图。最后, 将三种注意力特征图融合获得包含多维度注意力信息的多注意力融合特征图, 通过平均池化层对该特征图进行降维后展平(flatten), 再输入到全连接层, 最终输出SAR图像目标的分类结果。

SRFD模块和3×3卷积层用于提取局部细节, 提供高效的局部基础特征, 但通道间信息仅通过卷积核隐式学习, 缺乏对关键散射通道的显式筛选, 且局部感受野限制了对SAR目标空间分布模式的全局捕捉。协方差通道注意力模块通过建模通道间的二阶统计信息来增强SAR图像目标关键散射通道的表征能力, 弥补了CNN隐式通道交互的不足; 协方差空间注意力模块通过建模空间位置间的二阶统计信息来增强SAR图像核心区域的特征表达, 弥补了CNN局部感受野对空间全局分布建模的不足。尽管协方差注意力模块优化了通道与空间特征, 但仍未完全解决长距离依赖问题, 因此在引入基于ViT的SAR图像特征提取模块后, 通过多头自注意力机制(Multi-Head Self-Attention, MHSA)显式捕捉任意位置间的长距离依赖, 可以打破CNN局部感受野的限制, 增强模型对SAR图像中多尺度目标的表征能力。最后, 融合三种注意力特征图, 使得MAFNet既兼具CNN的高效局部特征提取和噪声抑制能力, 又融合了ViT对长距离依赖关系与全局信息的建模优势, 能够在噪声抑制、 特征表达能力和鲁棒性上实现多重优势互补, 形成“局部-全局-通道-空间”多维度的特征表达, 为SAR图像分类任务提供了更强的性能保障。

1.1 基于ViT的SAR图像特征提取

视觉转换器(Vision Transformer, ViT)模型是最早将多头自注意力机制(Multi-Head Self-Attention, MHSA)应用于计算机视觉的模型, 在对图像进行分块处理和位置编码后, 通过多头自注意力机制实现全局信息的直接建模。为解决传统CNN在捕捉长距离依赖和全局信息上的不足, 本文借鉴ViT的思路, 通过MHSA来提取SAR图像的整体特征。基于ViT的SAR图像特征提取流程如图 2 所示, 首先将输入的SAR图像划分为64个块(patch), 并将每个块投影为一个256大小的一维特征向量, 再加入位置编码保留位置信息。然后通过多头自注意力模块捕捉图像中不同子空间的上下文关联, 直接建模图像全局信息。将最终得到的特征序列重塑为256×8×8大小的特征图, 其中既包含了多维度特征信息, 也保留了长距离依赖关系, 为后续的特征融合与分类提供了丰富的语义基础。

本模型使用的多头自注意力模块计算流程如图 3 所示, 首先通过3个可学习的线性变换矩阵WQWKWV将输入特征分别映射为查询(Query, Q)、 键(Key, K)、 值(Value, V), 再将QKV沿通道维度分割为8个独立的头(Head), 对每个头i求单头注意力

Ai=SoftmaxQiKiTdkVi,

式中: QiVi表示第i个头的查询、 值; KiT表示第i个头的键的转置; dkKi的维度; Softmax为激活函数。最后整合多维度信息

A=Aconcat×W0,

式中: AconcatAi沿通道维度拼接得到; W0是可学习的线性变换矩阵。

1.2 鲁棒特征下采样

在图像处理领域, 特征下采样是一个关键步骤, 它涉及到在降低特征图空间分辨率的同时保留关键信息的问题。然而, 传统的卷积下采样方法往往会丢失对于目标至关重要的细节信息, 这限制了模型在SAR图像分类中的性能。针对这一问题, 本文引入了一种新型的浅层鲁棒特征下采样模块(Shallow Robust Feature Downsampling, SRFD)21, 用于处理网络输入的初始特征图。

在初始阶段, 特征图包含了大量的细节信息, SRFD的目标是在降低特征图维度的同时, 尽可能地保留这些细节, 在MAFNet中的实现步骤如图 4 所示, 其中切片下采样(CutD)层将输入特征图切成不重叠的块, 进行1×NN×1的卷积处理, 然后进行拼接。这种方法有效地减少了空间维度, 同时保留了原始数据信息。CutD的实现步骤如图 5 所示。

1.3 协方差注意力

协方差注意力机制(Covariance Attention Mechanism)通过挖掘特征张量的二阶统计特性建立注意力权重, 为注意力生成提供高阶统计依据, 能够充分表征特征通道和空间位置间的相关性, 并编码特征分布的几何结构信息22。具体而言, 该机制分别计算通道维度和空间维度的协方差矩阵, 以衡量通道间的相关性以及空间位置之间的依赖关系。通过轻量化矩阵运算实现特征交互建模, 具有计算高效、 几何可解释性强等特性。协方差注意力包含协方差通道注意力(Covariance Channel Attention, CCA)与协方差空间注意力(Covariance Spatial Attention, CSA), 其结构如图 6 所示。

2 实验及结果分析

2.1 数据集及环境介绍

本实验采用标准操作条件(Standard Operating Condition, SOC)下的 MSTAR(Moving and Stationary Target Acquisition and Recognition)数据集评估算法分类性能。该数据集由美国国防高级研究计划署(DARPA)和空军研究实验室(AFRL)提供, 包含通过聚束式合成孔径雷达(Spotlight SAR)采集的前苏联军事车辆的SAR图像, 分辨率0.3 m×0.3 m, 工作于X波段(HH极化)。SAR成像方位角覆盖0°~360°(间隔1°~2°), 经预处理后提取目标图像切片。SOC下MSTAR数据集包含10类地面目标: 自行榴弹炮2S1、 步兵战车BMP2、 装甲侦察车BRDM2、 装甲运输车BTR60/BTR70、 推土机D7、 坦克T62/T72、 卡车ZIL131、 自行高炮ZSU234(光学与SAR图像对比见图 7)。训练集(俯角17°)与测试集(俯角15°)采用相同目标序列号, 具体样本分布见表 1

本文的实验环境配置如下: Inter酷睿i5-13500处理器, 32G内存, NVIDIA GeForce RTX3060显卡, CUDA版本为11.8, 操作系统为win10。SOC下的MSTAR数据集的图像尺寸为128×128到192×193不等, 因此使用中心裁剪得到图像尺寸均为128×128的数据集。本文采取动态学习率(Dynamic Learning Rate), 每10轮进行一次学习率的迭代, 模型在训练时的超参数设置如表 2 所示。

2.2 评价指标

为充分验证MAFNet在SAR图像目标分类任务中克服散斑噪声、 复杂背景干扰等问题的有效性, 实验以准确率(Accuracy)、 精确率(Precision)、 召回率(Recall)、 F1Score、 ROC曲线和AUC值为评价指标来与其他网络进行对比, 以验证MAFNet的优越性。

2.2.1 Accuracy

Accuracy的计算公式为

Acc=NTP+NTNNTP+NTN+NFP+NFN

式中: NTP表示模型中正确识别的正样本数量; NTN表示模型正确识别的负样本数量; NFN表示模型错误地将正样本分类为负样本的数量; NFP表示模型错误地将负样本分类为正样本的数量; Acc是模型正确预测的样本在总样本中所占的比例, 反映全局判别能力。

2.2.2 Precision

Precision的计算公式为

Pre=NTPNTP+NFP

Precision是模型准确识别出的正样本在所有被模型判定为正样本的样本中所占的比例, 用于衡量正类预测的可靠性。

2.2.3 Recall

Recall的计算公式为

Rec=NTPNTP+NFN

Recall为模型正确识别出的正样本在所有实际为正样本的样本中的比例, 反映对正类的捕捉能力。

2.2.4 F1Score

F1Score的计算公式为

F1Score=2×Pre×RecPre+Rec

F1ScorePrecisionRecall的调和均值, 平衡两者的trade-off, 用于综合评估模型的性能。

2.2.5 ROC曲线

ROC曲线以假正率(False Positive Rate, FPR)为横轴, 以真正率(True Positive Rate, TPR)为纵轴。

TPR的计算公式为

RTP=NTPNTP+NFN

FPR的计算公式为

RFP=NFPNFP+NTN

ROC曲线可以直观展示模型对正负样本的区分能力。曲线下面积(Area Under Curve, AUC)是ROC曲线的量化指标, 取值范围为[0,1], 反映模型对正例和负例的整体区分能力。

更高的Accuracy、 Precision、 Recall、 F1Score和AUC值表示模型在分类任务中的性能更强, 越接近1说明模型的分类能力越优秀, 模型的ROC曲线越陡峭、 越靠近左上角, 表示模型的综合判别能力越强。

2.3 实验结果分析

2.3.1 MAFNet分类性能分析

在本实验中, 采用混淆矩阵作为评价MAFNet性能的工具, 结合十折交叉验证实验进行补充验证。

a) 混淆矩阵

MAFNet在MSTAR数据集上的分类混淆矩阵如图 8 所示。

图 8 可以看出, 10类样本中, 仅BMP2中有一例被错误分类为BTR70, 观察BMP2(见图 7(a))和BTR70(见图 7(b))的光学图像不难发现, 这两类目标较为相似, 2S1、 BRDM2、 BTR60、 BTR70、 D7、 T62、 T72、 ZIL131、 ZSU234的所有样本在分类任务中全部分类正确, 分类准确率达100%。这一结果验证了MAFNet在SAR图像目标分类中的优异性能, 为其在实际应用中的有效性提供了可靠支持。

b) 十折交叉验证

考虑到样本数量不多, 本实验将训练集和测试集按类别合并后打乱顺序得到新的数据集, 在此数据集上进行十折交叉验证实验, 为确保实验结果的可靠性, 进行了5次实验, 每次实验的准确率为100%, 取平均值作为最终结果, 如表 3 所示, MAFNet在每一折的准确率均达100%。

MAFNet在十折交叉验证实验中的表现优于在SOC下MSTAR数据集上的表现, 因为MSTAR数据集中训练集和测试集的图像存在一定区别, 如俯角不同(训练集俯角17°, 测试集俯角15°)、 背景干扰不同等, 十折交叉验证实验中将训练集和测试集混合以后, 训练集和测试集中均同时包含俯角为15°和俯角为17°的目标图像, 在一定程度上削减了对模型泛化能力的考查, 这说明了MAFNet的泛化能力存在一定的进步空间。受限于SAR图像获取难度, 现有数据集的样本多样性不足, 网络泛化能力难以得到充分验证。在实际应用中, 目标俯角差异会更大且面临更多干扰因素, 因而研究出更具泛化能力的网络将成为该领域未来的重要研究方向。

2.3.2 MAFNet与光学图像分类领域常用网络的对比

为验证本文提出的MAFNet模型在SAR图像目标分类任务中的性能优势, 本文将其与当前广泛使用的图像分类网络进行对比试验, 包括Mobilenet_V214、 Mobilenet_V3_large15、 Shufflenet_v2_×0_516, Efficientnet_b017, Resnet18、 Densenet12119

根据表 2 中的参数设置进行实验, 采用多维度指标(Accuracy、 Precision、 Recall、 F1Score、 AUC值和ROC曲线)对分类结果进行综合评估。分类精度对比数据见表 4, 细粒度分析结果如图 9图 10 所示。

这些DCNN在光学图像分类领域取得了很好的效果, 但是观察实验结果不难发现, 部分DCNN并不适用于SAR图像目标分类任务, 只有Resnet、 Densenet121取得了较高的准确率和AUC值。其中, DenseNet121在两类目标分类中的准确率达100%, 其ROC曲线在BRDM2(AUC=1.000 0)类别上与MAFNet完全重合, 在BTR70(AUC=0.999 5)和ZSU234(AUC=0.999 4)类别上也近乎重合。ResNet18与ResNet50在五类目标分类中准确率均达100%。具体而言, ResNet18在8个AUC值为1.000 0的类别中与MAFNet的ROC曲线完全重合, 在D7(AUC=0.999 6)和T62(AUC=0.999 9)类别上也基本与MAFNet的ROC曲线重合。ResNet50在多个类别上与MAFNet高度一致,在5个类别上AUC值为1且ROC曲线完全重合,在2S1(AUC=0.999 8)、T72(AUC=0.999 9)和ZSU234(AUC=0.999 8)类别上与MAFNet基本重合,仅在D7(AUC=0.999 1)和T62(AUC=0.999 2)类别上存在细微差异。

上述结果表明Resnet对SAR图像目标具有较强的区分能力, 可以正确识别出大部分类别, 这证明了残差结构提取SAR图像目标特征的有效性。相比之下, MAFNet在SAR图像分类任务中展现出显著优于表 3 中所列DCNN模型的性能, 其平均分类准确率达99.96%, 各类别目标的AUC值均达1, 且在Accuracy、 Precision、 Recall、 F1Score四项指标上均全面超越其他对比模型, 验证了其对SAR图像复杂散射特性的高效建模能力。

图 11 为各模型训练损失曲线对比, Resnet18在前几轮的损失最低, 但训练损失曲线不够平滑, 表明训练过程存在一定的不稳定性。MAFNet的训练损失下降过程高效且稳定, 在早期训练阶段即展现出快速收敛的特性, 且最早收敛至较低的损失值, 下降至低损失值后, 曲线保持平稳, 无显著波动, 说明模型在训练后期趋于稳定, 这体现了MAFNet对任务的适应性优势, 证明了其在设计上的合理性与有效性。

2.3.3 MAFNet与SAR图像目标分类网络对比

为进一步验证MAFNet在SAR图像目标分类领域的贡献, 采用Accuracy、 Precision、 Recall和F1Score作为评价标准, 将MAFNet与一系列在该领域表现优异的DCNN进行对比, 这些DCNN包括A-ConvNet4、 M-Net5、 Sup-ConL6、 CNN-A8、 ICBAM_CNN13。为公平对比各网络在理想条件下的最优分类能力, 本文采用原论文的实验结果进行对比, 实验设置以及分类结果对比如表 5 所示, 各类别分类精度对比如表 6 所示, Accureacy、 Precision、 Recall、 F1Score四类指标的对比如图 12 所示。

A-ConvNet4、 M-Net5分别将原始图像裁剪为88×88、 70×70来进行数据增强。从具体分类情况看, M-Net对三类目标的分类准确率达100%, A-ConvNet对一类目标的分类准确率达100%。从综合评估指标来看, Accureacy、 Precision、 Recall、 F1Score这四个指标均表现不错, 这两种方法总的准确率均达到了99%以上, 说明它们能准确分辨部分类别, 能正确分类大部分目标。Sup-ConL6是一种基于ViT的自监督对比学习模型, 经过数据增强后, 把所有图像调整为224×224的统一尺寸以满足ViT模型的输入要求, 但其对 BMP2(91.84%)、 BTR70(92.35%)的分类准确率较低, 四项指标整体落后于A-ConvNet、 M-Net, 但总准确率仍达99.06%, 说明该网络对SAR图像目标有较强的分类能力。CNN-A8、 ICBAM_CNN13、 MAFNet均使用128×128大小的SAR图像, CNN-A通过特定拓扑与训练方法实现98.50%的准确率, 对D7、 T72、 ZIL131的分类准确率达99%以上。

ICBAM_CNN将方差和中心坐标注意力机制集成到卷积神经网络来提高模型的性能, 对T72的分类准确率达100%, 对其他目标的分类准确率较低, Accureacy、 Precision、 Recall、 F1Score四个指标均表现均一般, 总准确率仅为95.59%, 这与网络设计有一定关系, 因为该论文的实验重在突出中心坐标注意力机制的作用, 没有使用特征提取能力较强的卷积模块。相较之下, 本文提出的MAFNet准确率为99.96%, Accureacy、 Precision、 Recall、 F1Score四个指标均表现优秀, 进一步说明了MAFNet在SAR图像目标分类任务中的性能较为出色。

2.4 消融实验

为验证MAFNet中加入协方差通道注意力机制、 协方差空间注意力机制和多头自注意力机制的有效性, 以分类精度为评价标准进行消融实验, 表 7 记录了在MSTAR数据集上的实验结果。

根据表 7 中的数据分析可知: 只加入协方差通道注意力机制时, 分类准确率为99.63%; 只加入协方差空间注意力机制时, 分类准确率为99.75%; 只使用多头自注意力机制时, 分类准确率为99.84%; 同时使用协方差注意力模块和多头自注意力模块时, 分类准确率达到99.96%, 比只使用协方差通道注意力模块提高了0.33百分点, 比只使用协方差空间注意力模块提高了0.21百分点, 比只使用自注意力模块提高了0.12百分点, 进一步验证了融合多种注意力机制在提高SAR图像目标分类精度方面的有效性。

3 结 论

本文提出一种融合多注意力特征的网络——MAFNet, 通过协方差注意力机制充分表征特征通道间和位置间的相关性, 增强了特征表达, 提高了鲁棒性; 同时, 通过自注意力机制直接捕捉全局信息, 更加有效地解决了SAR图像各类别难以有效区分的问题; 该架构通过跨尺度注意力机制动态整合不同分辨率的散射特征, 有效解决了SAR图像中目标尺寸变化大和背景杂波干扰强的难题。在MSTAR数据集上的实验结果表明, 其准确率高达99.96%, 混淆矩阵进一步证实了其对各类目标的精准分类能力。与其他代表性算法相比, MAFNet在分类精度上展现出显著优势, 这为SAR图像在目标侦察、 监视等实际应用中的自动目标识别提供了可靠技术的支撑。探索具备更强泛化能力的网络模型将成为该领域未来的重要研究方向。

参考文献

[1]

NOVAK L MOWIRKA G JBROWER W Set al. The automatic target-recognition system in SAIP[J]. The Lincoln Laboratory Journal199710(2): 187-202.

[2]

IKEUCHI KWHEELER M DYAMAZAKI Tet al. Model-based SAR ATR system[J]. Algorithms for Synthetic Aperture Radar Imagery III19962757: 376-387.

[3]

ZHAO QPrincipe J C. Support vector machines for SAR automatic target recognition[J]. IEEE Transactions on Aerospace and Electronic Systems200137(2): 643-654.

[4]

CHEN S ZWANG H PXU Fet al. Target classification using the deep convolutional networks for SAR images[J]. IEEE Transactions on Geoscience and Remote Sensing201654(8): 4806-4817.

[5]

SHANG R HWANG J MJIAO L Cet al. SAR targets classification based on deep memory convolution neural networks and transfer parameters[J]. IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing201811(8): 2834-2846.

[6]

DENG J PZHU Y YZHANG S Net al. SAR image recognition using ViT network and contrastive learning framework with unlabeled samples[J]. IEEE Geoscience and Remote Sensing Letters202421: 4000205.

[7]

FU Z ZZHANG FYIN Qet al. Small sample learning optimization for resnet based sar target recognition[C]//IGARSS 2018-2018 IEEE International Geoscience and Remote Sensing Symposium, 2018: 2330-2333.

[8]

WILMANSKI MKREUCHER CLAUER J. Modern approaches in deep learning for SAR ATR [C]//Proceedings of SPIE 9843,Algorithms for Synthetic Aperture Radar Imagery XXIII, 2016: 98430N.

[9]

SUN Y CYAN K JLI W Z. CycleGAN-based SAR-optical image fusion for target recognition[J]. Remote Sensing202315(23): 5569.

[10]

BANAS K MKREUCHER C. A multi-view CNN for SAR ATR[C]//2024 IEEE Radar Conference (RadarConf24), 2024: 1-6.

[11]

REN H HLIU SMIAO Let al. Hybrid reasoning network with class-oriented hierarchical representation for few-shot SAR target recognition[J]. IEEE Sensors Journal202424(16): 26091-26103.

[12]

ZHANG R LDUAN Y ZZHANG J Det al. An adaptive multiview SAR automatic target recognition network based on image attention[J]. IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing202417(1): 13634-13645.

[13]

孙靖森, 李宗豫, 杨森, .基于集成改进卷积注意力块的SAR图像目标分类算法[J].海军航空大学学报202439(4): 445-452.

[14]

SUN JingsenLI ZongyuYANG Senet al.SAR image target classification algorithm based on integrated improved convolutional block attention module[J]. Journal of Naval Aviation University202439(4): 445-452.(in Chinese)

[15]

SANDLER MHOWARD AZHU M Let al. MobileNetV2: Inverted residuals and linear bottlenecks[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2018: 4510-4520.

[16]

HOWARD ASANDLER MCHEN Bet al. Searching for MobileNetV3[C]//Proceedings of the 2019 IEEE/CVF International Conference on Computer Vision(ICCV), 2019: 1314-1324.

[17]

ZHANG X YZHOU X YLIN M Xet al. Shufflenet: An extremely efficient convolutional neural network for mobile devices[C]//IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2018: 6848-6856.

[18]

TAN M XLE Q. EfficientNet: Rethinking model scaling for convolutional neural networks[DB/OL].(2019-05-28)[2025-03-24].

[19]

HE K MZHANG X YREN S Qet al. Deep residual learning for image recognition[C]//2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2016: 770-778.

[20]

HUANG GLIU ZMAATEN Let al. Densely connected convolutional networks[C]//2017 IEEE Conference on Computer Vision and Pattern Recognition(CVPR), 2017: 2261-2269.

[21]

DOSOVITSKIY ABEYER LKOLESNIKOV Aet al. An image is worth 16×16 words: Transformers for image recognition at scale[DB/OL].(2021-06-03)[2025-03-24].

[22]

LU WCHEN S BTANG Jet al. A robust feature downsampling module for remote-sensing visual tasks[J]. IEEE Transactions on Geoscience and Remote Sensing202361: 4404312.

[23]

GAO Z LXIE J TWANG Q Let al. Global second-order pooling convolutional networks[C]//2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2019: 3019-3028.

基金资助

山西省留学回国人员科技活动择优资助项目(20240011)

山西省基础研究计划项目(202303021212164)

山西省基础研究计划项目(202103021224195)

山西省基础研究计划项目(202103021224212)

山西省回国留学人员科研项目(2021-108)

AI Summary AI Mindmap
PDF (5860KB)

647

访问

0

被引

详细

导航
相关文章

AI思维导图

/