基于大核卷积和密集目标细化的遥感图像多尺度特征增强网络

王占魁 ,  秦品乐 ,  曾建潮

中北大学学报(自然科学版) ›› 2024, Vol. 45 ›› Issue (05) : 628 -637.

PDF (3831KB)
中北大学学报(自然科学版) ›› 2024, Vol. 45 ›› Issue (05) : 628 -637. DOI: 10.3969/j.issn.1673-3193.2024.05.009
图像处理与计算成像

基于大核卷积和密集目标细化的遥感图像多尺度特征增强网络

作者信息 +

Multi⁃Scale Feature Enhancement Network Based on Large Kernel Convolution and Dense Object Refinement for Remote Sensing Images

Author information +
文章历史 +
PDF (3922K)

摘要

针对遥感图像中目标尺度变化差异大、 方向任意和分布密集, 现有检测方法较少直接关注密集边缘信息且目标无法获得合适的感受野, 遥感检测效果较差的问题, 本文提出了一种基于大核卷积和密集目标细化的多尺度特征增强网络(LKCSFP-NET)来进行遥感图像的检测。该网络首先在SKNET基础上增加了空洞卷积形成大核卷积块(LKB), 从而获得小目标的最佳感受野以及提升了网络对多尺度的适应性和准确度; 其次在FPN基础上增加了集中空间特征金字塔CSFP模块, 通过将全局语义信息与局部语义信息相结合, 解决了遥感图像因目标分布密集以及背景复杂导致的检测效率较低的问题。实验结果表明, 在DOTA和HRSC2016公开数据集上, 所提算法在2个数据集上的平均检测精度分别为75.96%和96.60%, 较基线网络提升了1.36百分点和0.63百分点, 优于现有大多数模型。所提出的LKCSFP-NET 在两个公开数据集中表现稳定, 对小目标和密集排列的目标都有较好的检测效果, 高于现有大多数模型的检测精度, 可以很好地应用于遥感目标的检测。

Abstract

Due to the large difference in the scale of the object, the arbitrary direction and the dense distribution of the object in the remote sensing image, the existing detection methods rarely pay direct attention to the dense edge information and the object cannot obtain a suitable receptive field, so it is difficult to have good detection results in remote sensing detection. In order to solve the above problems, this paper proposed a multi-scale feature enhancement network based on large kernel convolution and dense object refinement (LKCSFP-NET) for remote sensing image detection. Firstly, the network based on SKNET added a cavity convolution to form a large kernel convolution block (LKB) to obtain the best sensitivity field for small targets and improve the adaptability and accuracy of the network to multiple scales. Secondly, on the basis of FPN, the centralized spatial feature pyramid CSFP module was added to solve the problem of low detection efficiency of remote sensing images due to dense object distribution and complex detection background by combining global semantic information with local semantic information. The experimental results show that on the DOTA and HRSC2016 public datasets, the average detection accuracy of the proposed algorithm on the two datasets is 74.90% and 96.60%, respectively, which is 1.36 and 0.63 percentage points higher than that of the baseline network, which is better than most existing models. The proposed LKCSFP-NET has stable performance in the two public datasets, and has good detection results for small objects and densely arranged objects, which is higher than the detection accuracy of most existing models, and can be well applied to the detection of remote sensing objects.

Graphical abstract

关键词

目标检测 / 遥感图像 / 多尺度 / 大核卷积 / 密集检测 / 特征融合

Key words

object detection / remote sensing image / multi-scale / large kernel convolution / intensive detection / feature fusion

引用本文

引用格式 ▾
王占魁,秦品乐,曾建潮. 基于大核卷积和密集目标细化的遥感图像多尺度特征增强网络[J]. 中北大学学报(自然科学版), 2024, 45(05): 628-637 DOI:10.3969/j.issn.1673-3193.2024.05.009

登录浏览全文

4963

注册一个新账户 忘记密码

0 引 言

遥感图像(Remote Sensing Imagery, RSI)的获取和应用越来越多样化13, 其中遥感目标检测算法是遥感分析领域的研究热点之一, 它不仅针对RSI中感兴趣的目标区域进行定位, 还针对多目标进行分类, 已被广泛用于灾害响应4、 城市监测5、 交通控制6等领域。尽管已经有很多遥感检测的算法, 特别是有很多针对大规模RSI的检测算法, 但是对密集复杂的场景和多尺度目标的检测仍存在很多问题。

与自然场景图像不同, RSI通常是从高空卫星或无人机上获取的, 由于图像采集高度的变化, 不同RSI中的物体具有不同的尺度7。某些类别的物体通常密集分布在RSI中, 如船舶和车辆8。上述问题是RSI目标检测的主要障碍, 这使得大多数自然图像算法不能很好地适应RSI。

现有研究中给出了很多由自然场景图像方法演化而来的新方法, 其中基于RCNN系列框架的方法应用最广泛, 这些方法首先生成大量的水平边界框作为感兴趣区域(RoI), 然后根据区域特征预测分类结果和回归结果。但是, 水平RoI通常会受到边界框和定向目标之间严重错位的影响910。例如, 航空图像中的目标通常具有任意方向且密集排列, 也存在将多个目标当作单个目标作为水平RoI11, 从而导致特征不对齐问题。因此, 提取准确的视觉特征变得很困难。也有一些方法1012利用定向边界框作为锚来处理旋转目标, 但这些方法计算复杂, 因为其中包含许多精心设计的具有不同角度、 尺度和纵横比的锚。RoI-Trans11通过旋转RoI学习器并使用旋转的位置敏感RoI对齐模块提取旋转不变区域的特征, 将水平RoI转换为定向RoI。然而, 这种方法仍然需要精心设计锚, 并且不够灵活。

由于航空图像中的大多数物体尺寸较小且尺度变化差异大, 仅凭其外观难以识别。如果在识别这些物体时能够加入背景等先验, 可能会取得更好的效果, 因为周围的环境信息可以提供关于小物体的形状、 方向及其它重要特征, 从而有利于更好地获取上下文信息。因此, 准确检测任意方向的目标仍然面临以下挑战: 1) 不同图片中同一种目标的距离不同, 而且不同类型目标所需的上下文信息是不同的, 在单一尺度下无法很好地检测。2) 在单张图片中有大量目标且排列密集, 存在将多个密集目标检测为单个目标的问题, 使目标间的边界无法很好地分离。

为了解决上述问题, 本文提出一种基于大核卷积和密集目标细化的多尺度特征增强网络(LKCSFP-NET)进行遥感图像检测。LKCSFP-NET在SK-NET的基础上引入空洞卷积构建大感受野块(LKB), 并在聚集多尺度信息的同时添加空间选择机制来构造多尺度增强模块。目前基于任意方向的网络主流方法是加入角度分支并进行特征对齐, 但由于遥感图像的目标排列密集, 无法很好地将目标完全包围, 导致最终得到的旋转框不精确。因此, 为了进一步提升旋转框的准确性, 在CFP13结构的基础上进行了优化, 引入了CSFP来专注于密集检测, 可以在增加少量参数的基础上达到比较好的效果。该分支首先使用特征金字塔来提取图像的不同尺度特征, 然后通过全局级联模块和局部级联模块进行优化。全局级联模块通过轻量级MLP获得特征金字塔顶层的全局长距离依赖关系, 即全局特征; 局部级联模块则通过可学习视觉中心机制来获得局部信息, 即局部特征。其次, 为了能更好地提取遥感图像的密集特征, 使用带有空间信息的MLP结构来进行细化。最后, 对不同层之间的特征进行融合来获取多尺度信息。

为了验证LKCSFP-NET的性能, 本文分别在DOTA数据集和HRSC2016数据集上进行实验, 并进行了一系列的消融实验。在此之后将一些检测结果可视化, 以评估LKB与CSFP的有效性。通过定量指标以及可视化结果分析, 证明LKCSFP-NET可以准确地检测出目标。

1 相关工作

1.1 基于特征金字塔的遥感目标检测

Lin等14提出了一种特征金字塔网络, 该结构可以有效地获得多尺度特征。Liu等15添加了自下而上的路径, 以更好地集成多尺度特征图。Guo等16提出了3个模块来解决FPN的3个缺点, 并在检测性能上获得了明显的提高。这些FPN引入了复杂的模块来提高检测精度, 但无法保持运行速度。Li等17提出了一种动态特征选择模块, 用于根据新锚点的位置和大小来选择像素。这些方法的目的是在目标级别上选择合适的特征。为了提取细粒度特征, SKN18使用不同的核在每个位置选择具有不同感受野的特征。在遥感检测领域, 有关FPN的方法如GL Net19、 CANet20、 SB-MSN21、 FSoD-Net22、 CF2PN23和ASSD24, 给出了多种FPN方法来检测不同的遥感图像中的目标。但是, 由于特征混淆或结构复杂, 它们不能同时解决检测聚类目标和快速检测的问题。与之不同的是, 本文提出了一种改进的FPN, 增加了少量的参数以保持可观的检测速度, 它可以有效地检测多尺度和密集的物体。

1.2 旋转目标密集检测

得益于深度学习的优势, 遥感图像的研究在过去几年中取得了巨大进展, 特别是在定向目标检测方面2527。目前, 高性能的遥感目标检测器大多依赖于RCNN, 该框架由区域建议网络和区域CNN检测头组成。两阶段RoI transformer11在第一阶段使用全连接层来完成水平框到旋转框的转换, 然后提取框内的特征进行进一步的回归和分类。SCRDet28使用注意力机制来减少背景噪声, 并采用采样融合网络解决拥挤目标和小目标的检测精度低的问题。S2ANET29网络通过对齐卷积来解决特征不对齐的问题。DRN30利用动态精细化网络来调整神经元的感受野, 以实现更准确的预测。与定向RCNN相比, RSDet31通过引入调制损失来解决回归损失的不连续性。AOPG32和R3Det25采用渐进回归方法, 从粗粒到细粒度细化边界框。尽管上述方法在一定程度上提高了定向目标检测的性能, 但它们仍然存在边界框不对齐的问题。

1.3 大核卷积网络

大核卷积在自然场景下的检测已经证明了其有效性, 但是缺乏在遥感检测特定领域的研究。文献[3336]已经证明, 大的感受野是提升检测结果的一个关键因素。研究也表明, 设计良好的具有大感受野的卷积网络也可以与基于Transformer的模型具有同等的效果。ConvNeXt37在主干中使用7×7深度卷积, 从而显著提高了下游任务的性能。RepLKNet38通过使用31×31卷积核进行重参数化, 达到了自然场景下检测的最好性能。SLaK39通过核分解和稀疏群技术将核大小扩展为51×51。VAN40引入了大核的有效分解作为卷积注意力。SegNeXt41和Conv2Former42证明了大核卷积在利用更丰富的上下文调制卷积特征方面发挥着重要作用。由于航空图像具有独特的特征, 大内核特别适合遥感任务的检测。受以上工作的启发, 本文设计了自适应调整神经元的感受野模块, 可以为不同角度、 形状和尺度的各种物体重新组合适当的特征。

2 本文方法

本文将Oriented R-CNN作为基线网络, 分别介绍LKCSFP-NET网络结构、 大核卷积模块、 改进的集中空间特征金字塔和损失函数。

2.1 网络结构

LKCSFP-NET的具体结构由主干网络ResNet50、 金字塔FPN、 大核卷积模块(LKB)、 密集目标细化模块(CSFP)和定向检测头五部分组成, 如图 1 所示。其中, 主干网络ResNet50和金字塔FPN用于提取多尺度特征{P2、 P3、 P4、 P5}, LKB用于选取最佳感受野区域, CSFP用于细化目标的边界, 定向检测头用于得到分类与回归结果。

2.2 大核卷积模块

遥感图像不同目标之间尺度的巨大差异导致了检测效果不理想。通道注意力SE块使用全局平均信息来重新加权特征通道, 而GENet空间注意力模块通过空间掩码增强了网络对上下文信息建模的能力, CBAM将通道注意力和空间注意力结合起来利用了两者的优势。

ASPP并联使用多层空洞卷积或者池化层等稀疏采样的方法, 但会丢失像素之间的联系, 尤其空间位置关系。由于通道选择无法对图像空间中不同目标的空间方差进行建模, 而空间关系的编码信息对于遥感任务来说更直观、 更有效, 所以, 本文在SKNET的基础上进行了优化, 在空间维度上聚合了大内核的信息, 可以进一步增强不同感受野中的目标区域, 最终实现通过大内核获得最佳感受野以及通过空间选择机制来空间选择特征图。

图 2 所示, 首先将输入特征X通过标准卷积与空洞卷积分别获得两个不同的特征图, 并通过卷积核大小为1*1的卷积将二者的通道数转换为相同的大小, 即F1̃F2̃, 然后将来自不同感受野卷积核的特征拼接为F˜, 并通过平均池化Pavg和最大池化Pmax操作提取空间信息, 接着对不同空间的描述信息通过卷积操作将空间池化特征拼接, 并将2个通道的池化特征转换为N个空间注意力特征图SP̑, 之后通过Sigmoid函数应用到每一个空间注意力特征图, 可获得每个解耦的大卷积核所对应的独立的空间选择掩膜SP̑i, 最后将解耦后的大卷积核序列的特征与对应的空间选择掩膜进行加权处理, 获得注意力特征Y。具体操作如式(1)~式(6)

F0=X,Fi+1=TidkFi,
Fĩ=Ti1*1Fi, i1N,
F˜=F1̃Fĩ,
SP̑=S2NPavgF˜;PmaxF˜,
SP̑i=σSP̑i,
Y=Si=1NSP̑i·Fĩ,

式中: d为空洞率; k为卷积核大小; σ为sigmoid激活函数。

2.3 集中空间特征金字塔

针对遥感图像目标排列密集的问题, 现有基于水平框或者旋转框的方法都无法很好地将目标分离。本文对原结构中的通道MLP结构进行了改进, 提出了全新的CS-MLP结构, 该结构在第一个残差块中构建通道C-MLP, 在第二个残差块中构建空间S-MLP。其中C-MLP使用可变形卷积, 该卷积结构相对标准卷积加了一个偏移量, 添加偏移量后可以应对如目标移动、 尺寸缩放、 旋转等各种情况, 从而能够更好地检测遥感场景目标。然后, 将C-MLP的输出作为S-MLP的输入, S-MLP使不同空间位置之间的信息交互, 从而更好地获得遥感图像的空间信息。因此, 本文通过在FPN中加入CSFP模块, 不仅能够学习层间的信息, 更主要的是能够学习层内以及边缘的特征, 这对于遥感图像密集任务的检测非常重要。

在得到FPN输出的特征图时, 将特征图经过一个stem模块(由7×7卷积、 批量归一化、 ReLU激活函数组成)平滑处理, 对特征图上的噪声进行抑制, 从而保留特征图的具体细节, 之后输入到CSFP模块中, CSFP是由轻量级MLP与视觉中心LVC并行连接的模块组成的, 如图 3 所示。对于CSFP模块中的MLP而言, 其作用是捕获全局的长距离依赖关系, 使用该模块可以更全面、 更准确地获得遥感图像中尺度差异大的目标的特征表示, 从而提高目标分类和定位的准确性。该过程可以表示为

MLPout=SMLPGNY+Y,

其中, Y=DCNGNXin+Xin

Xin=BNConv7*7Xtop

式中: SMLP表示空间MLPGN表示组归一化; DCN表示可变形卷积; BN表示批归一化; top表示金字塔顶层P5

对于LVC而言, 该模块主要由卷积层、 全连接层以及字典编码器组成。通过卷积层对输入特征进行编码, 并使用具有归一化的卷积和Relu激活函数组成的CBR模块对编码进行处理并输送到字典编码器中, 使用编码器能够获得关于编码的整个图像的完整信息, 之后通过将编码器的输出馈送到全连接层和卷积层以预测突出关键类的特征。在遥感图像中使用LVC模块能够捕获图像的局部角落区域, 通过该模块可以更好地辨别出遥感图像中需要检测的目标以及与目标相似的背景和建筑, 而且对于遥感图像而言, 需要检测的目标不一定在图像的中心, 该模块还可以调整网络的关注区域, 避免出现漏检的现象, 从而提高目标检测的准确性。该过程可以表示为

Xall=Xin+Z

其中, Z=XinδConv1*1k=1Kϕek

ek=i=1Ne-sk||Xi-bk||2j=1Ke-sk||Xi-bk||2Xi-bk

最后通过并行连接MLP与LVC, 得到最终的CMLP输出结果, CSFP不仅从全局的角度出发获取了顶层特征图中目标的特征, 而且还考虑了特征图的局部信息, 从而使网络能够充分提取检测目标的特征信息, 提高对密集目标的检测精度。

2.4 损失函数

为了训练定向RPN, 对正样本和负样本进行定义。首先, 为每个锚点分配一个二进制标签p*∈{0, 1}, 其中, 0表示正样本, 1表示负样本。满足以下两个条件其一将视为正样本: 1) 与GT(地面真实)框的交并集(IoU)高于0.7, 2) 与GT框的IoU最高且IoU高于0.3。当IoU低于0.3时, 锚被标记为负样本。既不是正样本也不是负样本的锚被视为无效样本, 在训练过程中被忽略。上述GT框指定向边界框的外部矩形, 定义损失函数L1

L1=1Ni=1NFclspi,pi*+1Npi*i=1NFregδi,ti*,

式中: i为锚的索引; N为一个批量中的样本总数, 默认为256。分类分支中, Fcls为交叉熵损失; pi*为GT值标签; pi表示锚点为前景的概率, 是分类分支的输出。回归分支中, Freg为平滑L1损失; δi为输出建议相对于锚的偏移量; ti*为锚点的真实值偏移量, 分别用式(10)表示。

δi=δx,δy,δw,δh,δα,δβ,
ti*=tx*,ty*,tw*,th*,tα*,tβ*,
δα=Δα/w,δβ=Δβ/h,δw=log w/wα, δh=log h/hα,δx=x-xa/wa, δy=y-ya/ha,tα*=Δαg/wg, tβ*=Δβg/hg,tw*=log wg/wα, th*=log hg/hα,tx*=xg-xa/wa,  ty*=xg-xa/ha,

式中: (xgyg), wghg分别为外接矩形的中心点坐标、 宽、 高; ΔαgΔβg分别为顶部和右侧顶点相对于顶部中点和左侧中点的偏移量。

3 实验结果

在DOTA数据集和HRSC2016数据集中进行实验, 以验证本文所提方法的有效性。

3.1 数据集

1) DOTA数据集是一个大规模旋转目标检测数据集, 包含2 806张照片和188 282个带有定向边界框注释的实例。该数据集包含15个对象类: 飞机(PL)、 棒球场(BD)、 桥梁(BR)、 地面田径场(GTF)、 小型车辆(SV)、 大型车辆(LV)、 船舶(SH)、 网球场(TC)、 篮球场(BC)、 储槽(ST)、 足球场(SBF)、 环岛(RA)、 海港(HA)、 游泳池(SP)和直升机(HC)。DOTA数据集图像像素的变化范围为800×800到4 000×4 000。实验将训练集和验证集结合起来进行训练, 使用测试集进行测试, 最终提交到DOTA官网用于获得检测结果。

2) HRSC2016数据集是一个船舶检测数据集, 该数据集由1061张图像和2976个实例组成。图像像素范围为300×300到1 500×900。训练集、 验证集和测试集中分别有436, 541和444个图像。最终使用PASCAL VOC07和VOC12指标给出检测结果。

3.2 实施细节

本文方法通过在单个NVIDIA RTX 3090上使用PyTorch实现。选择带有FPN的ResNet50作为骨干网络, 使用与Faster R-CNN-O中相同的超参数, 批量大小设置为2。初始学习率为0.000 2, 动量为0.90, 权重衰减率为0.000 1, 选择SGD来优化模型。对于DOTA数据集, 所有模型都经过了12轮训练(多尺度下为36轮)。在第8轮和第11轮, 学习率除以10。对于HRSC2016数据集, 训练36轮, 在第24轮和第33轮, 学习率除以10。将DOTA数据集的图片裁剪成像素尺寸为1 024×1 024的新图片, 步长为824像素。在训练过程中, 两个数据集都使用了随机水平和垂直翻转。

3.3 各方法性能比较

在DOTA数据集和HRSC2016数据集上对本文方法与现有各方法的性能进行了评估。

DOTA数据集上的定性和定量结果分别如表 1图 4 所示。由表 1 可以看出, 使用ResNet50 FPN作为骨干网络, 本文的方法在单尺度下实现了74.90%的mAP, 多尺度下实现了75.96%的mAP(表中MS代表多尺度), 本文方法的性能超过了先进的RoI Transformer、 R3Det和S2Anet等方法。由图 4 的定性结果可以看出, 当检测高宽比密集物体时, 本文检测方法产生的错误更少。

HRSC2016数据集上的定性和定量结果如表 2图 5 所示, 该数据集包含大量在不同角度且具有大纵横比的船只。由表 2 可以看出, 本文的方法使用ResNet50 FPN分别实现了90.58%和96.60%的mAP, 该结果优于大多数的检测器。由图 5 可以看出, 本文的方法对于纵横比大的目标能产生准确的边界框。

3.4 消融实验

3.4.1 LKB模块的有效性验证

不同尺度的目标所需要的感受野大小是不同的, 为了验证LKB模块的重要性, 设计了验证实验。将大内核分解为一个普通卷积和空洞卷积内核, 如表 3 中第一行(仅基线)和第二行(基线+大核卷积模块) 所示, 在基线网络的基础上增加LKB模块后mAP达到了74.83%。

表 4 显示, 过小或过大的感受野会阻碍LKB模块的性能, 感受野为23时是最有效的。图 6 为LKB模块的可视化结果, 图 7 为不同感受野下的可视化结果。

3.4.2 CSFP模块的有效性验证

为了探究密集目标细化模块的作用, 设计了多个实验, 如表 4 中第 一行(仅基线)和第三行(基线+密集目标细化) 所示, 在基线网络的基础上增加CSFP模块后mAP达到了74.69%。当LKCSFP-NET没有LKB与 CSFP时, 对密集目标的检测会出现明显的误判(多个目标检测为一个), 图 8 为CSFP模块的可视化结果。定性和定量的实验表明, CSFP在密集排列下的情况下得到了较好的效果, 并且将它与LKB结合后的LKCSFP-NET可以获得更好的性能。

4 结 论

本文提出了一种多尺度特征增强和密集目标细化网络以用于检测遥感图像中的物体。所提出的LKCSFP-NET有以下优势: 1) LKCSFP-NET利用LKB获得最佳感受野并且使用空间选择机制以解决了小目标和多尺度检测的问题。2) 所提出的CSFP可以有效地提取密集目标的特征信息, 获得任意方向的目标特征。实验表明, 该方法在具有挑战性的DOTA数据集和广泛使用的HRSC2016数据集中取得了优于其他方法的结果。后续将研究最佳边界框的表示方法, 以对密集目标设计更加准确的包围框。

参考文献

[1]

WANG QGUO J YYUAN Y. Embedding Structured Contour and location prior in siamesed fully convolutional networks for road detection[J].IEEE Transactions on Intelligent Transportation Systems201819(1): 230-241 .

[2]

XIE W YLEI JFANG Set al. Dual feature extraction network for hyperspectral image analysis[J]. Pattern Recognition2021118: 107992.

[3]

XIE W YLEI JCUI Y Het al. Hyperspectral pansharpening with deep priors[J]. IEEE Transactions on Neural Networks and Learning Systems202031(5): 1529-1543.

[4]

GANCI GCAPPELLO ABILOTTA Get al. How the variety of satellite remote sensing data over volcanoes can assist hazard monitoring efforts: The 2011 eruption of Nabro Volcano[J]. Remote Sensing of Environment2020236: 111426.

[5]

XIE W YZHANG XLI Y Set al. Weakly supervised low-rank representation for hyperspectral anomaly detection[J]. IEEE Transactio- ns on Cybernetics202151(8): 3889–3900.

[6]

WANG QGAO J YYUAN Y. A joint convolutional neural networks and context transfer for street scenes labeling[J]. IEEE Transactions on Intelligent Transportation Systems201819(5): 1457-1470.

[7]

CEHNG GHAN J WZHOU P Cet al. Multi-class geospatial object detection and geographic image classification based on collection of part detectors[J]. ISPRS Journal of Photogrammetry and Remote Sensing201498: 119-132.

[8]

LI KWAN GCHENG Get al. Object detection in optical remote sensing images: A survey and a new benchmark[J]. ISPRS Journal of Photogrammetry and Remote Sensing2020159: 296-307.

[9]

XIA G SBAI XDING Jet al. Dota: A large-scale dataset for object detection in aerial images[C]//IEEE Conference on Computer Vision and Pattern Recognition, 2018: 3974-3983.

[10]

LIU Z KWANG H ZWENG L Bet al. Ship rotated bounding box space for ship extraction from high-resolution optical satellite images with complex backgrounds[J]. IEEE Geoscience and Remote Sensing Letters201613(8): 1074-1078.

[11]

DING JXUE NLONG Yet al. Learning roi transformer for oriented object detection in aerial images[C]//IEEE Conference on Computer Vision and Pattern Recognition, 2019: 2844-2853.

[12]

LIU Z KHU J GWENG L Bet al. Rotated region based cnn for ship detection[C]//IEEE International Conference on Image Procecssing, 2017: 900-904.

[13]

QUAN YZHANG DZHANG L Yet al. Centralized feature pyramid for object detection[J]. IEEE Transactions on Image Processing202332: 4341-4354.

[14]

LIN T YDOLLÁR PGIRSHICK Ret al. Feature pyramid networks for object detection[C]//IEEE Conference on Computer Vision and Pattern Recognition, 2017: 936-944.

[15]

LIU SQI LQIN H Fet al. Path aggregation network for instance segmentation[C]//IEEE Conference on Computer Vision and Pattern Recognition, 2018: 8759-8768.

[16]

GUO C XFAN BZHANG Qet al. AugFPN: Improving multi-scale feature learning for object detection[C]//IEEE Conference on Computer Vision and Pattern Recognition, 2020: 12592-12601.

[17]

LI SYANG L XHUANG J Qet al. Dynamic anchor feature selection for single-shot object detection[C]//IEEE International Conference on Computer Vision, 2019: 6608-6617.

[18]

LI XWANG W HHU X L Met al. Selective kernel networks[C]//IEEE Conference on Computer Vision and Pattern Recognition, 2019: 510-519.

[19]

TENG ZDUAN Y NLIU Yet al. Global to local: Clip-LSTM-based object detection from remote sensing images[J]. IEEE Transactions on Geoscience and Remote Sensing202260: 5603113.

[20]

SHI L KKUANG L YXU Xet al. CANet: Centerness-aware network for object detection in remote sensing images[J]. IEEE Transactions on Geoscience and Remote Sensing202260: 5603613.

[21]

HAN WFAN R YWANGL Zet al. Improv- ing training instance quality in aerial image object detection with a sampling-balance-based multistage network[J]. IEEE Transactions on Geoscience and Remote Sensing202159(12): 10575-10589.

[22]

WANG G QZHUANG YCHENG Het al. FSoD-Net: Full-scale object detection from optical remote sensing imagery[J]. IEEE Transactions on Geoscience and Remote Sensing202260: 5602918.

[23]

HUANG WLI G YCHEN Q Qet al. CF2PN: A cross-scale feature fusion pyramid network based remote sensing target detection[J]. Remote Sensing202113(5): 847.

[24]

XU TSUN XDIAO W Het al. ASSD: Feature aligned single-shot detection for multiscale objects in aerial imagery[J]. IEEE Transactions on Geoscience and Remote Sensing202260: 5607117.

[25]

YANG XYAN J CFENG Z Met al. R3Det: Refined single-stage detector with feature refinement for rotating object[C]//AAAI Conference on Artificial Intelligence, 202135(4): 3163-3171.

[26]

YANG XYAN J C. Arbitrary-oriented object detection with circu-lar smooth label[C]//European Conference on Computer Vision, 2020: 677-694.

[27]

YANG XHOU L PZHOU Yet al. Dense label encoding for boundary discontinuity free rotation detection[C]//IEEE Conference on Computer Vision and Pattern Recognition, 2021: 15814-15824.

[28]

YANG XYAN J CLIAO W Let al. Scrdet++: Detecting small, cluttered and rotated objects via instance-level feature denoising and rotation loss smoothing[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence202345(2): 2384-2399.

[29]

HAN J MDING JLI Jet al. Align deep features for oriented object detection[J]. IEEE Transactions on Geoscience and Remote Sensing202260: 5602511.

[30]

PAN XREN Y QSHENG K Ket al. Dynamic refinement network for oriented and densely packed object detection[C]//IEEE Conference on Computer Vision and Pattern Recognition, 2020: 11204 -11213.

[31]

QIAN WYANG XPENG S Let al. Learning modulated loss for rotated object detection[C]//AAAI Conference on Artificial Intelligence, 2021: 2458-2466.

[32]

CHENG GWANG J BLI Ket al. Anchor-free oriented proposal generator for object detection[J]. IEEE Transactions on Geoscience and Remote Sensing202260: 5625411.

[33]

Ranftl RenéBochkovskiy AlexeyKoltun Vladlen. Vision transformers for dense prediction[C]//IEEE International Conference on Computer Vision, 2021: 12159-12168.

[34]

YAN H TLI ZLI W Jet al. Contnet: Why not use convolution and transformer at the same time?[DB/OL]. (2021-05-10)[2024-01-03].

[35]

ZHENG S XLU J CZHAO H Set al. Rethinking semantic segmentation from a sequence-to-sequence perspective with transformers[C]//IEEE Conference on Computer Vision and Pattern Recognition, 2021: 6877-6886.

[36]

LUO W JLI Y JUrtasun Raquelet al. Understanding the effective receptive field in deep convolutional neural networks[C]//International Conference on Neural Information Processing Systems, 2016: 4905-4913.

[37]

LIU ZMAO H ZWU C Yet al. A convnet for the 2020s[C]//IEEE Conference on Computer Vision and Pattern Recognition, 2022: 11966-11976.

[38]

DING X HZHANG X YHAN J Get al. Scaling up your kernels to 31×31: Revisiting large kernel design in cnns[C]//IEEE Conference on Computer Vision and Pattern Recognition, 2022: 11953-11965.

[39]

LIU S WCHEN T LCHEN X Het al. More convnets in the 2020s: Scaling up kernels beyond 51x51 using sparsity[DB/OL]. (2023-03-03)[2024-01-03].

[40]

GUO M HLU C RLIU Z Net al. Visual attention network[J]. Computational Visual Media20239(4): 733-752.

[41]

GUO M HLU C ZHOU Q Bet al. SegNeXt: Rethinking convolutional attention design for semantic segmentation[C]//Annual Conference on Neural Information Processing Systems, 2022: 1140-1156.

[42]

HOU Q BLU C ZCHENG M Met al. Conv2former: A simple transformer-style ConvNet for visual recognition[DB/OL]. (2022-11-22)[2024-01-03].

基金资助

山西省科技重大专项计划“揭榜挂帅”项目(202101010101018)

AI Summary AI Mindmap
PDF (3831KB)

409

访问

0

被引

详细

导航
相关文章

AI思维导图

/