偏置余弦网络:用于遥感影像的语义分割网络

特日根 ,  李想 ,  刘欣悦

吉林大学学报(工学版) ›› 2026, Vol. 56 ›› Issue (4) : 1081 -1093.

PDF (3189KB)
吉林大学学报(工学版) ›› 2026, Vol. 56 ›› Issue (4) : 1081 -1093. DOI: 10.13229/j.cnki.jdxbgxb.20241023
计算机科学与技术

偏置余弦网络:用于遥感影像的语义分割网络

作者信息 +

BiasCosionNet:semantic segmentation network for remote sensing image

Author information +
文章历史 +
PDF (3264K)

摘要

针对在遥感影像中存在同类分割目标经常具有不同尺寸的问题,提出了偏置余弦网络,可从两个方面解决该问题,一是以输入影像在不同尺度间变化时产生的特征作为主体,二是通过突破上采样限制的方式保证不同尺寸分割目标拥有相同的尺度特征。通过实验证明:偏置余弦网络仅依托尺度间变化时产生的特征可以实现语义分割任务;平均交并比和平均边缘精度均优于现有经典网络0.2%以上;对不同尺寸的同类目标有着更为精确的分割能力。

Abstract

In remote sensing images, there was a problem that similar segmentation targets often had different sizes. So the BiasCosionNet was proposed to solve the above problems from two aspects: one was to take the features generated by the input image when it changed between different scales as the main body; the other was to ensure that segmentation targets with different sizes had same scale features by breaking through the upper sampling limit. Experiments show that the BiasCosionNet realizes the semantic segmentation task only by relying on features generated when scales change. The mIoU and the mBF of the BiasCosionNet are better than those of existing classical networks by more than 0.2%. And the BiasCosionNet has more accurate segmentation ability for similar targets of different sizes.

Graphical abstract

关键词

人工智能 / 遥感影像 / 语义分割 / 上采样 / 不同尺度 / 特征

Key words

artificial intelligence / remote sensing images / semantic segmentation / upper sampling / different sizes / feature

引用本文

引用格式 ▾
特日根,李想,刘欣悦. 偏置余弦网络:用于遥感影像的语义分割网络[J]. 吉林大学学报(工学版), 2026, 56(4): 1081-1093 DOI:10.13229/j.cnki.jdxbgxb.20241023

登录浏览全文

4963

注册一个新账户 忘记密码

0 引 言

高分辨率遥感影像是重要的国土信息资源,通过高分辨率遥感影像可以清晰地观测到各类地理空间对象,如农田、道路、建筑、船舶、车辆和飞机等。通过智能解译技术,从高分辨率遥感影像中自动提取感兴趣的对象,对城市管理、规划和监测等领域起着重要的作用1-4。地理空间对象分割作为遥感信息提取的重要任务之一,需要依托语义和位置信息对其进行分割提取,即将图像像素划分为前景对象和背景区域的两个子集,并进一步为前景对象区域中的每个像素分配一个唯一的语义标签。

与自然场景相比,高分辨率遥感影像中地理空间对象的语义分割更具挑战性,其重要的原因是,遥感影像中同类目标经常具有不同的尺寸56。在自然场景中,语义分割性能的提高,主要是针对几个特定尺度上的特征提取及融合方法进行研究7-9,且跨尺度大多是通过池化层实现的。但在高分辨率遥感影像中,这些方法存在两个问题:①忽略了分割目标在不同尺度间变化时产生的特征;②网络的降采深度过深时,会导致目标边缘特征和内部特征混淆。针对上述两个问题,本文分别建立了“余弦网络”和“偏置网络”。其中,“余弦网络”可充分利用不同尺度间变换时产生的特征,而“偏置网络”则是在“余弦网络”的基础上进行的改造,用来保证不同尺寸的分割目标在不同尺度特征上均可获得相同的待遇。再将多个“偏置网络”进行融合,建立了偏置余弦网络,并通过对比实验,探讨其解决此类问题的可能性及有效性。

1 相关工作

遥感影像语义分割的本质是通过有效的图像特征,构建遥感影像与分割目标之间的映射模型。因此特征空间的确立和映射模型的构建是实现建筑物高精度分割的关键。

在传统的遥感影像分割方法中(如分水岭算法10、主动轮廓模型11、统计区域融合12等),首先通过经验建立一个低秩的特征空间,并在此基础上应用数学工具建立一个具有显性代数表达式的分割模型。由于遥感影像中分割目标的特征往往呈现高维非线性的特点,因此难以用简单的代数关系进行描述。因此,神经网络13、支持向量机14等机器学习方法被用来代替人工建模过程,但由于此类方法有限的计算参数,导致最终的分割精度仍然不足。

近几年,由于深度学习15能自动提取所需的有效特征,并通过深层神经网络结构建立高维强非线性模型,使得图像处理的研究及应用发生了巨大飞跃16-18。卷积神经网络(CNN)作为深度学习中图像特征提取的基础框架,可利用其提取的特征实现区域级别的图像分割任务19-23。然而,区域级别的图像分割精度不足,无法支撑遥感的精细化应用。由此出现了像素级的分类网络——全卷积网络(FCN)24。FCN可以接受任意尺寸的输入图像,采用反卷积层对最后一个卷积层的特征图进行上采样,使其恢复到与输入图像相同的尺寸,进而实现对每一个像素的分类。

为进一步利用空间上下文信息进行语义分割,Chen等25提出了DeepLabv1,该网络利用空洞卷积扩大特征提取的感受野,获得更大尺度的上下文信息。同时,DeepLabv1采用密集条件随机场(CRF)作为后处理对预测结果进行平滑处理。之后的研究人员为了使网络可以学习多尺度特征,先后提出了金字塔池模块(PPM)26和空洞空间金字塔池化模块(ASPP)27。PPM是通过金字塔池化层生成金字塔特征图,该模块能够聚合不同区域的上下文从而达到获取全局上下文的目的。而ASPP是通过使用不同膨胀率的空洞卷积实现了空间金字塔特征提取的过程,该方法可以有效避免池化层带来的信息损失。为了进一步提高DeepLab的语义分割精度,文献[28]提出了DeepLabv3,该网络是将DeepLab中的浅层特征融合到ASPP中,并在ASPP中增加批量归一化(BN)操作实现的。但是,这些方法对于分割目标的边缘信息获取能力依然有限。

UNet29、SegNet30和RefineNet31采用了“编码器——解码器”的网络结构,增强了对浅层高分辨率特征的利用。而DeepLabv3+[32]也采用了“编码器——解码器”框架,该网络可以自主选择不同的主干网络(特征提取模块),并通过轻量级的解码器实现语义分割。而“编码器——解码器”框架存在一个明显的不足,即对高分辨率特征的利用不够充分,因此Sun等33提出了HRNet,该网络是通过并行连接高分辨率到低分辨率的卷积操作来保持高分辨率的特征。

但是,以上语义分割方法主要集中在多尺度上下文建模上,不仅忽略了分割目标在不同尺度间变化时产生的特征,也忽略了高分辨率遥感影像中同类目标经常具有不同尺寸的现象,例如,建筑物多尺寸现象,如图1所示。因此,需要研究一种能够解决上述问题的语义分割方法。

与此同时语义分割在遥感领域中的应用众多,大多都是针对某种特定的应用场景进行改进的,如土地利用、地物分类34-36、建筑提取37-41、道路提取42-45、车辆检测46等。但这些方法普遍忽略了一些共性问题,因此本文提出了偏置余弦网络用来解决这些问题。

2 偏置余弦网络

2.1 余弦网络

现阶段,各类特征提取网络均有尺度变化的过程,但其尺度变化的目的主要是为了提取不同尺度下的目标特征。而分割目标的特征很有可能存在于尺度变化的过程中。因此,本文通过建立一种以尺度往复变化为基本卷积操作的特征提取网络,探讨目标特征存在于尺度变化过程中的可能性。

定义1N表示一个卷积神经网络,则定义N中输入层、中间层及输出层的集合为Block_GN,并用Blocki,jN表示集合Block_GN的元素,即Blocki,jNBlock_GN,其中iBlocki,jNN中的尺度深度,jBlocki,jNN中的层级深度。

由定义1可知,若N的层级深度为n,则Block1,1N为输入层,Block1,nN为输出层。

定义2N,则N中使用的全部卷积及反卷积操作集合记为Conv_GN,并用Convi,jN表示集合Conv_GN的元素,即Convi,jNConv_GN,其中ij为经过Convi,jN操作后得到的Blocki,jNN的尺度深度和层级深度。即Blocki,jN是经过Convi,jN操作得到的。

图2所示,网络N的尺度深度为3,层级深度为7,Block_GN中共有7个元素,Conv_GN中共有6个元素。

定义3N,且Blocki,jNBlock_GN,则定义X×Y×CBlocki,jN的尺寸,其中XBlocki,jN的长度,YBlocki,jN的高度、CBlocki,jN的深度。

图3所示,网络N为二分类的语义分割网络,其输入层Block1,1N的尺寸为512×512×3。当Conv1,2N的卷积核大小为3×3,步幅大小为1×1,卷积核数量为64时,则Block1,1N经过Conv1,2N操作得到Block1,2N的尺寸为512×512×64;当Conv2,3N的卷积核大小为3×3,步幅大小为2×2,卷积核数量为64时,则Block1,2N经过Conv2,3N操作得到Block2,3N的尺寸为256×256×64;输出层Block1,7N的尺寸为512×512×2

定义4NConvi,jNConv_GN,且Convi,jN为卷积操作,其卷积核大小为3×3,步幅大小为2×2,卷积核数量为64时,则定义此Convi,jND_Conv

由定义2和定义4可知,若NConvi,jNConv_GNBlocki-1,j-1N,Blocki,jNBlock_GN,则Blocki-1,j-1N经过Convi,jNN操作后得到Blocki,jN,若Blocki-1,j-1N的尺寸为X×Y×C,且Convi,jND_Conv,则Blocki,jN的尺寸为X2×Y2×64

定义5NConvi,jNConv_GN,且Convi,jN为反卷积操作,其卷积核大小为3×3,步幅大小为2×2,卷积核数量为64时,则定义此Convi,jNU_Conv

由定义2、定义5可知,若NConvi,jNConv_GNBlocki+1,j-1N,Blocki,jNBlock_GN,则Blocki+1,j-1N经过Convi,jN操作后得到Blocki,jN,其中,若Blocki+1,j-1N的尺寸为X×Y×C,且Convi,jNU_Conv,则Blocki,jN的尺寸为X*2×Y*2×64

根据定义4和定义5可知,D_Conv是一个下采样的卷积操作,U_Conv是一个上采样的反卷积操作。因此,图3中的Conv2,3NConv3,4ND_ConvConv2,5NConv1,6NU_Conv,更名后的卷积神经网络如图4所示。

定义6NN的最大尺度深度为dN的最大层级深度为n时,且Convi,jNConv_GN满足公式(1)时,则称N为余弦网络,并记为NCos

Convi,jN=U_Conv   Convk,j-1NConv_GN,k=dConvk,j-1NU_Convk1D_Conv   Convi,jNU_Conv

定义7NCosNCos的最大尺度深度为dNCos的最大层级深度为n时,则定义freqNCos的频率,且freq=n-12d-1

根据定义6和定义7可知,余弦网络中的Conv_GN仅包含D_ConvU_Conv,且呈现往复震荡现象。同时,震荡频率与其最大尺度深度成负相关,与最大层级深度成正相关。不同震荡频率的余弦网络如图5所示,其中图5(a)、图5(b)和图5(c)的震荡频率分别是1、1.5和2。

综上所述,余弦网络所使用的卷积操作均为上采样或下采样,这使该网络计算出的特征均为跨尺度特征。同时,网络中每个中间层所在的尺度深度与层级深度构成的函数曲线与余弦曲线较为相似,由此将此类网络命名为余弦网络。

2.2 偏置网络

在语义分割领域,目标的特征提取主要依赖于边缘特征和内部特征。若特征提取过程中,网络的降采深度过深,会导致目标边缘特征和目标内部特征混淆的情况出现,进而干扰特征提取的有效性。而面对不同尺寸的同类目标,或边缘特征和内部特征作用力占比接近时,这种现象则更为突出。同时,大多数基于“编码器——解码器”原理的语义分割网络会不断地将不同尺度的特征进行累加操作,这会使得这样的特征混淆情况不断放大。

因此,在特征提取过程中,在余弦网络的基础上提出偏置网络,突破了网络上采样的尺度限制,使得不同尺寸的同类目标有了相同的特征获取尺度。

定义8NCos,且Blockk,1NCosNCos输入层时,若k可以不为1,则称NCos为偏置网络,记为NBiasCos-k,其中k为输入层所在的尺度深度。

图6所示,这3种网络均为偏置网络,其中图6(a)的输入层尺度深度为最小尺度深度;图6(b)的输入层尺度深度为最大尺度深度;图6(c)的输入层尺度深度介于最小尺度深度和最大尺度深度之间。

图6可知,当输入层的图像尺寸或待识别的目标尺寸不一致的情况下,偏置网络通过突破网络上采样的尺度限制,能够使得不同尺寸的同类目标可以在特征提取的全部尺度上获得相同的待遇,进而保证不同尺度的特征在全样本上的分布平衡性。

2.3 偏置余弦网络

在对遥感影像进行语义分割的过程中,需要对不同尺寸的同类目标同时进行训练和识别。为实现上述要求,将不同尺度的偏置网络进行融合,构成一个完整的语义分割网络,即偏置余弦网络。

定义9 当存在一个偏置网络集合NGNG=NBiasCos-1,NBiasCos-2,,NBiasCos-d,若NG在满足条件组1,则将根据规则组1构建的网络称为偏置余弦网络,记作NBiasCos

条件组:

(1)NG的元素个数为d

(2)NBiasCosNG,其最大尺度深度为d,最大层级深度为n

(3)NBiasCos-k,NBiasCos-mNG,当km时,NBiasCos-kNBiasCos-m

规则组:

(1)将尺寸为X×Y×C的图像作为NBiasCos的输入层。

(2)将输入层通过d个仿射变换(邻近插值法)分别获得d个不同尺寸的InputImgk,其尺寸分别为X2k-1×Y2k-1×C,其中k=1,2,,d

(3)将InputImgk作为NBiasCos-k的输入层。

(4)Blocki,jNBiasCosBlock_GNBiasCos,①若Blocki,jNBiasCos-kBlock_GNBiasCos-kBlocki,jNBiasCos-mBlock_GNBiasCos-m,且km,则Blocki,jNBiasCos=Blocki,jNBiasCos-kBlocki,jNBiasCos-m;②若Blocki,jNBiasCos-kBlock_GNBiasCos-k,且当kmBlocki,jNBiasCos-mBlock_GNBiasCos-m时,则Blocki,jNBiasCos=Blocki,jNBiasCos-k

(5)为网络能获得更好的训练效果,Convi,jNBiasCos-mConv_GNBiasCos-m,在Convi,jNBiasCos-m后面增加1个归一化操作(BN函数)、1个激活操作(ReLU函数)和1个池化操作(MaxPooling函数);(6)Blockk,nNBiasCos-mBlock_GNBiasCos-m,将Blockk,nNBiasCos-m通过仿射变换(邻近插值法)得到OutputImgk,其尺寸均为X×Y×64,其中k=1,2,,d

(7)将全部OutputImgk进行叠加,获得全部特征的融合特征矩阵FeatureMat

(8)对FeatureMat进行卷积操作得到Class_FeatureMat,其卷积核大小为3×3,步幅大小为1×1,卷积核数量为语义分割分类数Class_Num;(9)对Class_FeatureMat进行概率归一化操作(softmax函数)得到S_Class,操作过程如式(2)所示;(10)对S_Class进行像素级分类操作(pixelclassification函数)得到输出层Pixel_Class,即为语义分割结果。

S_Class=eClass_FeatureMati,ji=1,j=1X,YeClass_FeatureMati,j

式中:ijClass_FeatureMat中元素Class_FeatureMati,j的行列号。

根据定义9,若NBiasCos,其最大尺度深度为3,最大层级深度为5,输入图像尺寸为512×512×3,分类类别为2时,其网络结构如图7所示。图7(a)为NBiasCos的全局图片,图7(b)~(e)为局部放大图。

2.4 残差型偏置余弦网络

由于偏置余弦网络依然是一个卷积神经网络,因此随着层级深度d的增加,网络也会发生了退化的现象。即随着网络层数的增多,训练集的损失值会先下降,再趋于饱和,最后增大。因此偏置余弦网络也可以通过残差块的方式来解决此问题,其残差逻辑添加方式如定义10。

定义10NBiasCosBlocki,jNBiasCos,Blocki,lNBiasCosBlock_GNBiasCos,若k1<j<k<l,且Blocki,kNBiasCosBlock_GNBiasCos,或1<j=i-1时,则将Blocki,lNBiasCos更新为Blocki,lNBiasCosBlocki,jNBiasCos,由此构成的网络称为残差型偏置余弦网络,记为NR-BiasCos

根据定义10可知,将图7更新为残差型偏置余弦网络后的结构如图8所示,其中虚线框中内容为网络更新的部分。

3 实 验

3.1 实验数据及平台

3.1.1 数据集

为验证偏置余弦网络的有效性,在IAILD和JL1ILD两个数据集上展开实验研究。

数据集1——IAILD:

IAILD数据集的标签类型分为两类,分别是建筑物(Building)和背景(Background)。该数据集包含810 km2的遥感影像,分辨率为0.3 m,其中405 km2已经对建筑物做过精确标记,包括美国的奥斯汀、芝加哥和基特萨普,奥地利的蒂罗尔西部和维也纳等5个地区,其建筑风格差异较大。原始数据中单个样本为5 000×5 000像素,共计180个。由于受实验平台GPU存储单元的限制,本文将每个样本裁剪成512×512像素大小,对于尺寸不足的样本以0进行补充,共计获得样本18000个。训练过程中,将其中12 600个作为训练样本,3 600个作为验证样本,1 800个作为测试样本。

数据集2——JL1ILD:

由于现阶段全球商业遥感数据及各类免费的遥感数据分辨率以亚米级数据为主,因此本文针对吉林一号0.5~1 m分辨率的数据进行整理,并制作建筑物语义分割数据集JL1ILD。JL1ILD的标签类型分为两类,分别是建筑物(Building)和背景(Background)。JL1ILD包含12682 km2的遥感影像,包括了中国的上海、杭州、长春、宁波、绍兴等11个城市,城市级别覆盖了中国的一线、二线、三线及四线城市。JL1ILD中有3124km2已经对建筑物做过精确标记,包含像素大小为512×512的样本96757个。训练过程中,将其中68296个作为训练样本,19513个作为验证样本,9756个作为测试样本。

3.1.2 训练平台

实验平台采用Intel(R) Xeon(R) Gold 6254 CPU@ 3.10GHz处理器,132 GB内存,NVIDIA GeForce RTX 3090×4的GPU处理单元,操作系统为Ubuntu 18.04的服务器上运行,深度学习框架及运算平台使用MCR2021b。

3.2 实验结果及分析

3.2.1 分割性能评价指标

为量化评价各网络的语义分割能力,对每个类别分别采用平均准确率APi、交并比IoUi、轮廓精度BFi进行评价,其计算方法如下所示:

APi=Acc_NumiPixel_Numi
IoUi=Pixel_NumiAcc_NumiPixel_NumiAcc_Numi
BPi=B_Acc_NumiB_Pixel_Numi
BRi=B_Pixel_NumiB_Acc_NumiB_Pixel_Numi
BFi=2BPi*BRiBPi+BRi

式中:Class_Num为语义分割任务的分类数量;Pixel_Numi为输入图像中分类i的像素点数量;Acc_Numi为分类i中正确分类的像素点数量;B_Pixel_Numi为输入图像中分类i的轮廓像素点数量;B_Acc_Numi为分类i中足够接近正确轮廓的像素点数量。

AP越高,则表示分割中误识别的像素点越少;IoU越高,则表示分割中漏识别的像素点越少;而BF是反映轮廓识别精度的一个综合指标,其中BPi是轮廓识别精度,BRi是轮廓识别召回率,因此BF越高则表示轮廓识别能力越强。

同时,对全类别分别采用全局平均准确率gAP、平均准确率均值mAP、交并比均值mIoU以及轮廓精度均值mBF进行评价,其计算方法如下所示:

gAP=i=1Class_NumAcc_Numii=1Class_NumPixel_Numi
mAP=i=1Class_NumAPiClass_Num
mIoU=i=1Class_NumIoUiClass_Num
mBP=i=1Class_NumBPiClass_Num
mBR=i=1Class_NumBRiClass_Num
mBF=2mBP*mBRmBP+mBR

由于在语义分割的实际应用中,IoUmIoUBFmBF更具有指导意义,因此文中对AP仅进行计算,不进行过多讨论。

3.2.2 实验对比网络

实验中,对比的语义分割网络如表1所示。

3.2.3 评价指标对比及分析

针对数据集IAILD进行实验,其各类别的分割性能指标如表2所示,全局分割性能指标如表3所示。其中10组实验的学习率(Learning rate)均设置为0.01;U-Net、Seg+VGG16和Seg+VGG19的批量大小(Batch size)设置为16,其余均设置为8;迭代轮次(Epoch)均设置为50轮。

表2表3可得以下结论:①偏置余弦网络的建筑物分类IoU排名第7,BF排名第3,说明偏置余弦网络具有建筑物分割的能力;②残差型偏置余弦网络的建筑物分类IoU排名第1,BF排名第1,表现最佳;③在背景分类指标中,偏置余弦网络的IoUBF排名虽然不高,但并没有明显落后与其他网络;④残差型偏置余弦网络的IoUBF的排名均为第2;⑤偏置余弦网络的mIoU排名第8,mBF排名第4,具有一定的分割能力;⑥残差型偏置余弦网络的mIoUmBF均排名第1,表现最优。

针对数据集JL1ILD进行实验,其各类别的分割性能指标如表4所示,全局分割性能指标如表5所示。其中10组实验的学习率(Learning Rate)均设置为0.01;U-Net、Seg+VGG16和Seg+VGG19的批量大小(Batch Size)设置为16,其余均设置为8;迭代轮次(Epoch)均设置为50轮。

表4表5可得以下结论:①偏置余弦网络的建筑物分类IoU排名第4,BF排名第3,说明偏置余弦网络具有建筑物分割的能力,且不处于劣势;②残差型偏置余弦网络的建筑物分类IoU排名第2,BF排名第1,表现优异;③在背景分类指标中,偏置余弦网络的IoUBF排名也属于前列;④残差型偏置余弦网络的IoUBF的排名均为第1,表现最优;⑤偏置余弦网络的mIoU排名第4,mBF排名第3,不处于劣势;⑥残差型偏置余弦网络的mIoUmBF排名第1,表现最优。

由于偏置余弦网络和残差型偏置余弦网络提取的特征一致,因此综合两组实验可得结论:在高分辨遥感影像中,仅通过尺度变化过程中产生的特征是可以完成语义分割任务的,且在IoUmIoUBFmBF这4个指标上均有一定的优势。

3.2.4 分割效果对比及分析

为说明偏置余弦网络对不同尺寸同类分割目标的分割效果,在两类验证集中分别选取3张包含不同尺寸建筑物的影像做对比分析,对比结果如图9所示,可知,实验中的10个网络均有一定程度的建筑物轮廓不平滑、建筑物误识别和漏识别的现象。但相对而言,偏置余弦网络识别的轮廓更为细腻,且无论建筑物的大小差异有多大,其轮廓细腻程度一致。同时这也导致误识别的小碎块更多,但由于误识别的小碎块较小,可通过简单的后处理方法进行剔除。反观其他对比网络,较小的建筑物由于轮廓识别效果不佳,导致识别出的形状偏差较大,由此会给后处理增加较大的负担。并且针对亚米级分辨率的影像,偏置余弦网络以及残差型偏置余弦网络的视觉优势更为明显。

综上所述,从实验角度证明了网络中的降采深度过深会导致小目标边缘特征和内部特征混淆的情况出现。而偏置余弦网络通过突破网络上采样尺度限制的方式(偏置性),能够保证不同尺寸的同类目标在特征提取过程中获得公平的待遇。

4 结束语

针对高分辨率遥感影像中同类目标存在着不同尺寸的现象,本文提出了偏置余弦网络。由于经典语义分割网络深度的增加可以通过增加同尺度卷积层的数量来实现,而偏置余弦网络在相同频率下,其网络深度是由尺度深度决定的,同时尺度深度又受输入层尺寸的限制,因此其网络中的卷积层有限。通过实验证明,在有限的卷积层下,偏置余弦网络仍有着较优良的分割效果。这也充分的证明了不同尺度间变化时产生的特征相比于尺度不变时产生的特征在语义分割中更有意义。并且,偏置余弦网络通过突破网络上采样尺度限制的方式,能有效提高小目标的轮廓识别精度。因此,偏置余弦网络具有较好的泛化能力。

文中残差型偏置余弦网络的提出是为了避免偏置余弦网络在训练过程中的退化现象,虽然残差型偏置余弦网络的各项评价指标相比偏置余弦网络更有说服力,但其特征的提取过程与偏置余弦网络完全一致,因此可作为证明偏置余弦网络有效性的数据参考。

本文从理论及实验角度证明了偏置余弦网络对高分辨率遥感影像进行语义分割的作用,但对其尺度深度和层级深度,以及训练效率和识别效率未展开讨论,需在后续工作中进一步研究。同时,偏置余弦网络作为一个特征提取网络,能否应用到图像分类和目标识别领域,在未来工作中也值得分析探讨。

参考文献

[1]

Rottensteiner F, Sohn G, Jung J, et al. The ISPRS benchmark on urban object classification and 3D building reconstruction[J]. ISPRS Annals of Photogrammetry, Remote Sensing and Spatial Information Sciences, 2012, 13(1): 193-298.

[2]

Volpi M, Ferrari V. Semantic segmentation of urban scenes by learning local class interactions[C]∥The IEEE Conference on Computer Vision and Pattern Recognition,Boston, MA, USA, 2015, 1: 1-9.

[3]

Kampffmeyer M, Salberg A, Jenssen R. Semantic segmentation of small objects and modeling of uncertainty in urban remote sensing images using deep convolutional neural networks[C]∥The IEEE Conference on Computer Vision and Pattern Recognition, Honolulu, USA, 2016: 680-688.

[4]

Kemker R, Salvaggio C, Kanan C. Algorithms for semantic segmentation of multispectral remote sensing imagery using deep learning[J]. ISPRS Journal of Photogrammetry and Remote Sensing, 2018, 145(11): 60-77.

[5]

Deng Z, Sun H, Zhou S, et al. Multi-scale object detection in remote sensing imagery with convolutional neural networks[J]. ISPRS Journal of Photogrammetry and Remote Sensing, 2018, 145(1): 3-22.

[6]

Xia G S, Bai X, Ding J, et al. DOTA: a large-scale dataset for object detection in aerial images[C]∥IEEE/CVF Conference on Computer Vision and Pattern Recognition, Salt Lake City, USA, 2018: 3974-3983.

[7]

Chen L, Papandreou G, Kokkinos I, et al. DeepLab: semantic image segmentation with deep convolutional nets, atrous convolution, and fully connected CRFs[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2018, 40(4): 834-848.

[8]

Chen L, Zhu Y, Papandreou G, et al. Encoder-decoder with atrous separable convolution for semantic image segmentation[C]∥Proceedings of the European Conference on Computer Vision, Munich, Germany, 2018: 801-818.

[9]

Yang M, Yu K, Zhang C, et al. DenseASPP for semantic segmentation in street scenes[C]∥The IEEE Conference on Computer Vision and Pattern Recognition, Salt Lake City, USA, 2018: 3684-3692.

[10]

Xiao P, Feng X, Zhao S, et al. Segmentation of high-resolution remotely sensed imagery based on phase congruency[J]. Acta Geodaetica et Cartographica Sinica, 2007, 36(2): 146-151.

[11]

Li S, Wu J J, Di P. Panoramic sea-sky-line detection based on improved active contour model[J]. Acta Optica Sinica, 2016, 36(11): 189-196.

[12]

Jun W, Wang Y, Yue C, et al. Speckle reduction of ultrasound images with anisotropic diffusion based on homogeneous region automatic selection[J]. Optics and Precision Engineering, 2014, 22(5): 1312-1321.

[13]

Kaiming H, Georgia G, Piotr D. Mask R-CNN[J]. IEEE Transactions on Pattern Analysis & Machine Intelligence, 2020, 42(2): 386-397.

[14]

Yang A, Bai Y, Liu H, et al. Application of SVM and its improved model in image segmentation[J]. Mobile Networks and Applications, 2021, 21(8): 1-11.

[15]

Hinton G, Salakhutdinov R. Reducing the dimensionality of data with neural networks[J]. Science, 2006, 313: 504-507.

[16]

Zeng N, Zhang H, Song B, et al. Facial expression recognition via learning deep sparse autoencoders[J]. Neurocomputing, 2018, 273(17): 643-649.

[17]

Xu X, Pan J, Zhang Y, et al. Motion blur kernel estimation via deep learning[J]. IEEE Transactions on Image Processing, 2018, 27(1): 194-205.

[18]

Shao H, Jiang H, Zhang H, et al. Rolling bearing fault feature learning using improved convolutional deep belief network with compressed sensing[J]. Mechanical Systems and Signal Processing, 2018, 100(1): 743-765.

[19]

Ciresan D, Giusti A, Gambardella L, et al. Deep neural networks segment neuronal membranes in electron microscopy images[J]. Advances in Neural Information Processing Systems, 2012, 25(1): 2843-2851.

[20]

Farabet C, Couprie C, Najman L, et al. Learning hierarchical features for scene labeling[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2012, 35(8): 1915-1929.

[21]

Gupta S, Girshick R, Arbeláez P, et al. Learning rich features from RGB-D images for object detection and segmentation[J]. Springer International Publishing, 2014(1): 345-360.

[22]

Hariharan B, Arbeláez P, Girshick R, et al. Simultaneous detection and segmentation[C]∥Proceedings of the European Conference on Computer Vision,Zurich, Switzerland, 2014: 297-312.

[23]

Shuai B, Zuo Z, Wang G, et al. DAG-Recurrent neural networks for scene labeling[C]∥IEEE Conference on Computer Vision and Pattern Recognition, Las Vegas, NV, USA, 2016: 3620-3629.

[24]

Long J, Shelhamer E, Darrell T. Fully convolutional networks for semantic segmentation[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2015, 39(4): 640-651.

[25]

Chen C, Papandreou G, Kokkinos I, et al. Semantic image segmentation with deep convolutional nets and fully connected CRFs[J]. Computer Science, 2014, 1(4): 357-361.

[26]

Zhao H, Shi J, Qi X, et al. Pyramid scene parsing network[C]∥IEEE Conference on Computer Vision and Pattern Recognition, Honolulu, USA, 2017: 6230-6239.

[27]

Chen C, Papandreou G, Kokkinos I, et al. DeepLab: semantic image segmentation with deep convolutional nets, atrous convolution, and fully connected CRFs[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2018, 40(4): 834-848.

[28]

He K, Zhang X, Ren S, et al. Spatial pyramid pooling in deep convolutional networks for visual recognition[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2015, 37(9): 1904-1916.

[29]

Ronneberger O, Fischer P, Brox T. U-Net: convolutional networks for biomedical image segmentation[J]. Medical Image Computing and Computer-Assisted Intervention, 2015(1): 234-241.

[30]

Badrinarayanan V, Kendall A, Cipolla R. SegNet: a deep convolutional encoder-decoder architecture for image segmentation[J]. IEEE Transactions on Pattern Analysis & Machine Intelligence, 2017, 39(12): 2481-2495.

[31]

Lin G, Milan A, Shen C, et al. Refinenet: multi-path refinement networks for high-resolution semantic segmentation[J]. IEEE Transactions on Pattern Analysis & Machine Intelligence,2020, 45(2): 1228-1242.

[32]

Chollet F. Xception: deep learning with depthwise separable convolutions[C]∥IEEE Conference on Computer Vision and Pattern Recognition, Honolulu, USA, 2017: 1251-1258.

[33]

Sun K, Xiao B, Liu D, et al. Deep high-resolution representation learning for human pose estimation[C]∥IEEE Conference on Computer Vision and Pattern Recognition, Long Beach, USA, 2019: 1-12.

[34]

Zhang C, Sargent I, Pan X, et al. An object-based convolutional neural network (ocnn) for urban land use classifification[J]. Remote Sensing of Environment, 2018, 216(1): 57-70.

[35]

Bo H, Bei Z, Song Y. Urban land-use mapping using a deep convolutional neural network with high spatial resolution multispectral remote sensing imagery[J]. Remote Sensing of Environment, 2018, 214(1):73-86.

[36]

Zhang C, Sargent I, Xin P, et al. Joint deep learning for land cover and land use classification[J]. Remote Sensing of Environment, 2019, 221(1): 173-187.

[37]

Dickenson M, Gueguen L. Rotated rectangles for symbolized building footprint extraction[C]∥IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops, Salt Lake City, USA, 2018: 225-228.

[38]

Ji S P, Wei S Q, Lu M, et al. Fully convolutional networks for multisource building extraction from an open aerial and satellite imagery data set[J]. IEEE Transactions on Geoscience and Remote Sensing, 2019, 57(1): 574-586.

[39]

Xu Y Y, Wu L, Xie Z, et al. Building extraction in very high resolution remote sensing imagery using deep learning and guided filters[J]. Remote Sensing, 2018, 10(1): 144-162.

[40]

Yuan J. Learning building extraction in aerial scenes with convolutional networks[J]. IEEE Transactions on Pattern Analysis & Machine Intelligence, 2018, 40(11): 2793-2798.

[41]

朱冰, 李紫薇, 李奇. 基于改进SegNet的遥感图像建筑物分割方法[J].吉林大学学报: 工学版, 2023, 53(1): 248-254.

[42]

Zhu Bing, Li Zi-wei, Li Qi. Building segmentation method of remote sensing image based on improved SegNet[J]. Journal of Jilin University (Engineering and Technology Edition), 2023, 53(1): 248-254.

[43]

Bastani F, He S, Abbar S, et al. Roadtracer: automatic extraction of road networks from aerial images[C]∥IEEE/CVF Conference on Computer Vision and Pattern Recognition, Salt Lake City, USA, 2018: 4720-4728.

[44]

Batra A, Singh S, Pang G, et al. Improved road connectivity by joint learning of orientation and segmentation[C]∥IEEE Conference on Computer Vision and Pattern Recognition, Long Beach, USA, 2019: 10385-10393.

[45]

Yi F, Te R, Zhao Y, et al. EUNetMTL: multitask joint learning for road extraction from high-resolution remote sensing images[J]. Remote Sensing Letters, 2022, 13(3): 258-268.

[46]

谌华, 郭伟, 闫敬文, .基于深度学习的SAR图像道路识别新方法[J].吉林大学学报: 工学版, 2020, 50(5): 1778-1787.

[47]

Chen Hua, Guo Wei, Yan Jing-wen, et al. A new deep learning method for roads recognition from SAR images[J]. Journal of Jilin University (Engineering and Technology Edition), 2020, 50(5): 1778-1787.

[48]

Mou L, Zhu X X. Vehicle instance segmentation from aerial image and video using a multitask learning residual fully convolutional network[J]. IEEE Transactions on Geoscience and Remote Sensing, 2018, 56(11): 6699-6711.

基金资助

吉林省科技发展计划项目(20230201084GX)

吉林省科技发展计划项目(20240302093GX)

AI Summary AI Mindmap
PDF (3189KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/