基于协同注意力的RGB-D图像显著性检测

焦瑛霞 ,  张林 ,  朱荣

武汉大学学报(理学版) ›› 2023, Vol. 69 ›› Issue (1) : 88 -96.

PDF (2580KB)
武汉大学学报(理学版) ›› 2023, Vol. 69 ›› Issue (1) : 88 -96. DOI: 10.14188/j.1671-8836.2021.0142
信息处理和图像识别

基于协同注意力的RGB-D图像显著性检测

作者信息 +

Synergistic Attention Network for RGB-D Saliency Detection

Author information +
文章历史 +
PDF (2641K)

摘要

在RGB-D显著性检测视觉任务中,RGB彩色模态和深度模态的信息均被视为十分重要的特征线索。但现有的RGB-D显著性检测模型无法高效执行多尺度特征的交互和多模态特征的融合,因此在真实的开放场景下表现欠佳。针对上述问题,提出了一种基于协同注意力(synergistic attention)机制的RGB-D显著性检测算法模型(SANet),并引入多模态学习中通用的引导与教导策略(guidance and teaching strategy)。在编码器进行多尺度特征提取的阶段中进行隐式引导(implicit guidance),在解码器进行特征融合时进行显式的教导(explicit teaching),实现了编码、解码的分阶段学习。在4个显著性检测评测数据集上进行的综合实验表明,该算法在4个评测指标上均优于已有的18个前沿RGB-D显著性检测模型。

Abstract

RGB information and depth information are both crucial feature cues in RGB-D saliency detection. However, the current RGB-D saliency detection models are unable to handle the interaction of multi-scale features and the fusion of multi-modal features efficiently, so they are limited in understanding natural scenes. To alleviate such shortcomings, we propose a synergistic attention network for RGB-D saliency detection (SANet), and introduce a general multi-modal learning strategy, termed Guidance and Teaching Strategy. The implicit guidance strategy works in the multi-scale feature extraction stage of the encoder, while the explicit teaching strategy works in the feature fusion stage of the decoder, so as to realize the phased learning process of encoding and decoding stages. Extensive experiments are conducted on four saliency detection benchmarks, and the results verify the proposed method performs better than the 18 cutting-edge RGB-D saliency detection models in terms of four metrics.

Graphical abstract

关键词

视觉认知机制 / 协同注意力机制 / 显著性检测 / RGB-D显著性检测

Key words

visual perception mechanism; synergistic attention; saliency detection; RGB-D saliency detection

引用本文

引用格式 ▾
焦瑛霞,张林,朱荣. 基于协同注意力的RGB-D图像显著性检测[J]. 武汉大学学报(理学版), 2023, 69(1): 88-96 DOI:10.14188/j.1671-8836.2021.0142

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

在计算机视觉领域中,将建立计算模型来模拟人类感知视觉场景中最感兴趣物体的过程称为视觉显著性检测(visual saliency detection)。在三维立体视觉传感器日益普及的今天,由于立体场景中蕴含着丰富的深度信息,基于彩色图像和深度图像(RGB-D)的视觉显著性检测任务逐步受到学术界、工业界的广泛青睐。在RGB-D显著性检测视觉任务中,RGB彩色模态信息和深度模态信息均被视为十分重要的特征线索,被用于复杂场景下视觉内容的理解,准确定位感兴趣区域。由于多模态视觉任务中不同数据源具有一定程度上的异同性,即RGB彩色模态和深度模态两个模态的数据存在异同性,因此这种多模态数据的跨模态交互与融合能力成为了限制整体模型性能表达的关键所在。

早期的RGB-D显著性检测方法大多依赖于传统手工特征的提取[1~3],如:颜色特征、HOG特征和几何结构信息等。近年来,随着高性能计算工具和平台的快速发展,研究人员开始探索使用深度学习技术融合多模态数据,即融合RGB图像与深度图像来获取图像特征信息[4~7]。基于深度学习的模型可以学习到富语义性的高维特征表达,并用于RGB信息和深度信息之间的关联计算和差异去除,从而有效提高显著性检测性能。但是,挖掘到有效的RGB信息和深度信息十分困难,当前用于RGB-D显著性检测的模型在很多开放的自然场景下(例如:复杂背景、相似背景和较差的深度图质量等)表现欠佳,且跨领域的内容理解能力受限。

为了缓解上述痛点,本文提出了一种基于协同注意力机制的RGB-D显著性检测算法模型(synergistic attention Network,SANet),并引入了多模态学习中通用的引导与教导策略(guidance and teaching strategy)[8],实现了RGB彩色模态信息与深度模态信息之间的有效交互。在编码器进行多尺度特征提取的阶段中引入基于协同注意力机制的隐式引导(implicit guidance),在解码器进行特征融合的阶段中引入显式教导(explicit teaching),实现了编码、解码分阶段的学习过程。其中,隐式引导以一种深度协作的方式在高层多尺度金字塔特征之间执行,挖掘RGB彩色图像特征和深度图像特征之间的模态关联性,对RGB彩色图像的特征进行进一步的提纯增强。本文提出的SANet算法模型是RGB-D显著性检测任务中将基于协同注意力机制的隐式引导与显式教导进行有机融合的深度学习网络。

1  SANet框架

1.1 算法模型概览

与经典的U-Net[9]网络结构和常规的双流网络不同,本文提出了一个新颖的双流改良网络。如图1所示,SANet由双流编码器、教师部分解码器(teacher partial decoder,T-PD)和学生部分解码器(student partial decoder,S-PD)组成,其中双流编码器包括RGB信息编码器(也称为学生分支)和深度信息编码器(也称为教师分支)两个部分。对于输入的RGB彩色图像𝒳 R和其对应的深度图像𝒳 D,首先将其分别输入到基于ResNet-50[10]骨架网络的双流编码器之中,并产生一系列基于RGB信息和深度信息的多层次金字塔特征。在编码过程中,使用基于协同注意力机制的隐式引导模块,以深度协作的方式将深度特征线索传播到RGB信息编码器之中。接着针对多层次金字塔特征中高层深度图像特征使用教师部分解码器,并生成基于深度图像的初始预测图。最后将初始预测图𝒵 D传递给学生部分解码器,用于对高层彩色图像特征的显式教导,并在学生分支中生成最终的预测图𝒵 R

1.2 基于协同注意力的隐式引导

多模态数据包含了大量有关空间、结构和交叉语义等信息,因其复杂特性,现有深度模型不足以鲁棒地处理实际场景中多模态融合的相关任务。为了高效地融合输入数据中的RGB彩色图像和深度图像信息,需要在高维的特征嵌入空间中构建一种高效的多模态特征交互融合算法模型。

因此,为了保持跨模态场景下的语义一致性,本文引入了一种基于协同注意力(synergistic attention, SA)的多模态融合模块[11],用于挖掘细粒度化的彩色图像和深度图像信息内容,并对其进行融合。具体而言,在教师分支(teacher branch)和学生分支(student branch)之间使用协同注意力策略隐式地传递经过协同交互后的特征嵌入,该隐式引导过程能够以深度协作(deep collaboration)的方式在k={3,4,5}个金字塔层级上传递特征。该隐式引导函数被定义为

{fkdm,fkrm}=SA(fkR,fkD)

其中,SA()代表协同注意力函数; fkR代表基于RGB信息的第k层特征; fkD代表基于深度信息的第k层特征; fkdm,fkrm代表融合后的RGB特征和深度特征。

本文引入的协同注意力过程包含如下三个过程:

1) 计算仿射矩阵(affinity matrix)

首先,对于输入的基于彩色图像嵌入特征fkRRW×H×C和基于深度图像嵌入特征fkDRW×H×C(其中嵌入特征代表宽为W、高为H、通道数为C的三维张量)进行特征展平操作,展平为矩阵表达的形式,即fkR:RW×H×C𝒳R:RC×(WH)fkD:RW×H×C𝒳D:RC×(WH)。隐式引导首先使用协同注意力机制[12],在嵌入空间之中挖掘𝒳R𝒳D之间的关联性,也就是计算两者之间的仿射矩阵𝒜,即

𝒜=𝒳DTW𝒳RR(WH)×(WH)

其中,WRC×C是可学习的权重矩阵。仿射矩阵𝒜中的每一个元素代表了𝒳DT中每一行特征和𝒳R中每一列特征之间的相似程度。因此,权值矩阵W是一个方阵,将其对角化后,表示为

W=P-1DP

其中,P是可逆矩阵,D是对角矩阵。因此,仿射矩阵𝒜被重写为

𝒜=𝒳DTP-1DP𝒳R

通过(4)式,可以对每一个模态中输入图像所对应的特征表达,计算其自身任意两个位置之间的仿射距离矩阵(也称为相似度)。

进一步对权值矩阵W赋予限制条件。如果权值矩阵W为对称矩阵时,矩阵P会变成一个正交矩阵,即:PTP=I。其中I是一个C×C大小的单位矩阵(identity matrix)。因此,(4)式被重写为

𝒜=𝒳DTP-1DP𝒳R=(P𝒳D)TD(P𝒳R)

重写后的仿射矩阵简化了计算量,便于深度学习模型进行建模。

2) 表征归一化(representation normalization)

在得到仿射矩阵后,如图2中所示,针对仿射矩阵𝒜的每一行和每一列进行归一化

𝒜c=Softmax(𝒜),𝒜r=Softmax(𝒜T)

在(6)式中,𝒜c的第i列是长度为WH的向量,该向量反映了在𝒳R中每一个特征(1,,WH)𝒳D中第i个特征之间的相关性。

接着,对于特征嵌入𝒳R关于𝒳D的注意力值定义为

𝒴R=𝒳D𝒜c=𝒴R (1),𝒴R (2),,𝒴R (i),,𝒴R (WH)RC×(WH)

其中

𝒴R (i)=𝒳D𝒜(i)c=j=1WH𝒳D (j)𝒜(ij)cRC

符号𝒴R (i)代表注意力值𝒴Ri列元素,代表矩阵乘以向量,𝒜(i)c代表𝒜c的第i列向量,𝒳D (j)代表𝒳D的第j列向量,𝒜(ij)c代表𝒜(i)c中的第j个元素。

类似地,对于特征嵌入𝒳D,计算相对应的协同注意力增强特征

𝒴D=𝒳R𝒜r

3) 门控加权

考虑到输入特征嵌入对遮挡和背景噪声这些潜在的外观信息变化的适应性,本文对来自不同输入模态的信息分别进行门控加权。为此,引入了自门控机制(self-gated mechanism)[1314],为每个注意力值分配一个协同注意的置信度。自门控函数GA用于决定来自于参考特征中有多少信息将会被保留,并能够被自动学习到多少信息。自门控机制GA表达如下

GA(𝒴R)=σ(WGA𝒴R+bGA)[0,1](WH)
GA(𝒴D)=σ(WGA𝒴D+bGA)[0,1](WH)

其中,σ()代表Sigmoid函数,WGAbGA分别代表卷积核和偏置。

在计算门控的置信度后,注意力值就会被更新为

𝒴R=𝒴RGA(𝒴R),𝒴D=𝒴DGA(𝒴D)

其中代表的是基于通道维度的哈达玛积。然后,对输入的特征嵌入和协同注意力表征进行融合

fkdm=[𝒴R,𝒳R],fkrm=[𝒴D,𝒳D]

在得到{fkdm,fkrm}后,将其分别传入双流编码器中继续进行接下来的特征提取。

1.3 显式教导

本文引入了显式教导,将教师部分解码器(teacher partial decoder, T-PD)生成的深度预测掩膜𝒵D传递到学生部分解码器(student partial decoder,S-PD)之中,该深度预测掩膜中具有辨别性的深度特征,有助于指导高三层RGB彩色图像特征fkR,k{3,4,5}的解码过程。所提出的显式教导过程如下。

1) 计算基于深度图像的预测掩膜

对于两组来自跨模态和多尺度的彩色图像和深度图像特征,首先在单独的模态(即:基于彩色图像的分支和基于深度图像的分支)中生成精确的预测图。受RFBNet[15]启发,本文采用带有空洞卷积的感受野模块(receptive field block),针对来自深度分支的特征执行特征增强和通道压缩操作(默认设定为压缩至32通道数量)。具体地,该空洞通道压缩(dilated channel compression module, DCM)模块由4条空洞卷积组成的侧分支和一条残差连接组成,其中4条空洞卷积侧分支的最后一个卷积层的空洞率分别为{1,3,5,7}。因此,对于第k层级的输入特征fkD,使用空洞通道压缩算子DCMD,k进行多尺度感受野上的通道压缩,最终得到优化后的特征:rkD=DCMD,k(fkD)。采用这样的操作有两个原因:① 若具有较深特征通道的特征向量直接用于后续解码器中的操作,会造成内存冗余和计算开销代价增加;② 统一化之后的特征通道数易于后续进行各种逐元素操作算子。此外,与经典的U-Net网络结合所有层的特征做法不同的是,本文首次引入了教师部分解码器,仅聚合处于高三层基于深度图像的特征。该过程可以写成

𝒵D=PDT[r3D,r4D,r5D]

教师部分解码器PDT可以分解成Step 1与Step 2两个步骤:

Step 1: pkD=rkDi=k+15g<δ(riD);Wik>
Step 2: 𝒵D=U[p3D,p4D,p5D]

Step 1为特征传播阶段,能够传播富语义的特征到弱语义的特征之中。i=k+15代表针对i个输入特征图像执行逐像素特征相乘操作,这个过程是由可学习权值Wik来进行参数化的。δ()代表的是上采样操作,用于保证相乘的两个特征向量的分辨率尺度一致。在Step 2中,首先移除了U-Net形状的自顶向下-自底向上结构中低两层的跳层连接,然后经过教师部分解码器得到中间输出的基于深度图像的预测掩膜𝒵D

2) 基于深度图像的掩膜传递

为了更为有效地利用基于深度图像产生的掩膜𝒵D,本方案显式地将其传递到基于彩色图像的高三层的特征fkdm,k={3,4,5}之中,这些特征来源于学生分支。该显式教导操作过程可以被定义为

fked=fkdm(fkdm𝒵D)

其中k{3,4,5}分别表示逐元素相加和逐元素相乘操作。

3) 计算最终显著性预测图

与教师部分解码器定义一致,会进一步传播基于深度图像的掩膜𝒵 D到学生部分解码器之中,并在学生分支中生成最终的显著性预测图𝒵 R。这个过程可以被定义为

𝒵 R=PDS[f3ed,f4ed,f5ed]

1.4 损失函数

本方案采用了行业内广泛使用的二值交叉熵损失函数

(𝒵,G)=-mGmlog𝒵m+1-Gmlog1-𝒵m

其中,m表示像素索引,G表示真值图,而𝒵{𝒵 D,𝒵 R}。整体的损失函数可以被定义为

total=(𝒵 D,G)+(𝒵 R,G)

2  实验与分析

2.1 实验数据集

本文在4个公开的RGB-D显著性检测评测数据集上进行了实验,这4个数据集分别是:DES数据集[16](135组数据样本)、LFSD数据集[17](100组数据样本)、NLPR数据集[18](1 000组数据样本)和SIP数据集[19](929组数据样本)。参照文献[20~22],从NLPR和NJU2K[23]中分别选择了相同的700和1 500组数据样本来训练SANet算法模型。为公平起见,实验中将在该训练集上训练的模型应用于其他数据集上,所使用的测试集包含了同数据样本源(即:NLPR数据集)和异数据样本源数据(即:DES数据集、LFSD数据集和SIP数据集)。

2.2 算法模型参数

模型实现采用了PyTorch框架,并且在一块RTX TITAN显卡上做了相关的实验。模型加载了在ImageNet数据集[24]上的预训练模型,初始化基于ResNet-50的双流编码器的参数。同时,去除了ResNet-50网络中头部的池化层和全连接层,并且把中间5个卷积块的输出作为侧输出。RGB图像分支和深度图像分支是不共享权重的,这两个分支输入均有3个通道。其他的参数按照PyTorch工具箱的默认设置进行初始化(即:Kaiming初始化[25])。这里使用Adam优化器进行模型的参数优化。初始的学习率设置为1E-4并且每隔60轮下降10倍。输入图像统一调整为352×352的分辨率尺寸。所有的训练图像用随机翻转、旋转和边界裁减进行数据增强。批次大小设置为10,训练模型200轮大约需要10小时。

2.3 定量与定性结果

本文将SANet算法模型与6个具有代表性的RGB-D显著性检测算法模型进行了定性对比实验,这6个算法模型分别是:DANet[6],A2dele[4],TANet[21],DMRA[26],CPFP[20]和D3Net[19]。实验结果如图3所示,其中绿色虚线框内包含RGB图像、深度图像和真值图像,红色虚线框代表本文提出的SANet算法模型所生成的预测图。

在模型评测时,本文采用了4个评测指标,选取了结构指标[27] (structure measure,Sα)、最大F指标[28](maximum F-measure,Fβmax)、最大E指标[29](maximum Enhanced-alignment measure,Eϕmax)和平均绝对误差指标[30](mean absolute error,M)。其中Sα是一种基于结构相似性的指标,用于衡量显著性预测图与真值图之间的度量,其值越大预测效果越好;Fβmax是一个基于逐像素误差的评测指标,以一种综合准确率和召回率的角度来全面地衡量算法模型的性能,其值越大预测效果越好;Eϕmax从局部和全局两个角度衡量显著性预测图和真值图之间的相似性,其值越大预测效果越好;M用于描述显著性预测图与真值图之间逐像素级别的差异,其值越小预测效果越好。为了更为全面地评测所提出的SANet算法模型的有效性,本文选择RGB-D显著性检测领域内从2016年到2020年,具有代表性的18个模型与SANet比较,结果如表1。由表1可知,本文算法在4个评测指标上均有一定优势。

2.4 消融实验及分析

为了更进一步地验证SANet中各个模块设计的有效性,本节通过消融实验来逐步探讨说明。通过控制变量来解耦SANet中关键组件,包括如下4个变体模型:#1 在隐式引导过程中不使用协同注意力模块SA进行特征交互,而是使用相加的方式进行特征交互;#2 不使用隐式引导的过程;#3 不使用空洞通道压缩模块DCM,而是直接使用一个卷积进行通道缩减;#4 不使用显式教导过程。从表2可知:

1) 协同注意力模块的有效性: 对比实验序号#1和#OUR,可以看出采用协同注意力的跨模态交互策略之后,可以同时从RGB模态和深度模态中查询共性特征线索,评测指标均有一定的改善,这验证了协同交互过程的必要性。

2) 隐式引导过程的有效性: 对比实验序号#2和SANet,可以看出去除掉隐式引导的过程后,会在一定程度上降低模型的表征性能。特别是在DES数据集上,Fβmax指标从0.940下降到0.914。指标数值下降的可能原因是整个网络在特征提取阶段没有交互的过程,无法提取出具有鲁棒表达的特征,从而让整个网络偏向于学习单一模态的信息。

3) 空洞通道压缩模块DCM的有效性:对比实验序号#3和SANet,通过评测指标的改善,可以看出空洞通道压缩模块(DCM)可以有效增强特征在多种尺度感受野上的空间级别表征,有利于捕捉不同尺度的显著物体。

4) 显式教导过程的有效性: 对比实验序号#4和SANet,通过评测指标的改善,可以看出显式教导过程能够增强模型的性能,其潜在的原因可能是使用了监督后的图像进行教导,提供了更为可靠的显著线索,使整个模型捕捉到更鲁棒的场景理解能力。

3  结 语

本文提出了一种基于协同注意力机制的RGB-D显著性检测算法模型SANet,并引入了多模态学习中通用的引导与教导策略,实现了RGB彩色模态信息与深度模态信息与彩色模态信息之间的有效交互和融合。在这种多模态信息交互和融合策略的促进下,网络学习到更具表征性的跨模态显著性线索,有利于改善最终的显著性预测结果。实验结果表明,SANet在一个由18个RGB-D显著性检测领域内前沿的算法模型和4个数据集所组成的基准测评上取得了最佳的性能表现。上述深入分析将持续推动领域的发展,并激发研究人员针对交互和融合策略进行更为广泛的研究。

参考文献

[1]

郭迎春, 袁浩杰, 吴鹏. 基于Local特征和Regional特征的图像显著性检测[J]. 自动化学报201339(8):1214-1224. DOI: 10.3724/SP.J.1004.2013.01214 .

[2]

GUO Y CYUAN H JWU P. Image saliency detection based on local and regional features[J]. Acta Automatica Sinica201339(8):1214-1224. DOI: 10.3724/SP.J.1004.2013.01214 (Ch ).

[3]

ZHU C BLI GWANG W Met al. An innovative salient object detection using center-dark channel prior [C]// Proceedings of the IEEE International Conference on Computer Vision Workshops. Piscataway: IEEE Press, 2017: 1509-1515. DOI: 10.1109/ICCVW.2017.178 .

[4]

LIANG F FDUAN L JMA Wet al. Stereoscopic saliency model using contrast and depth-guided-background prior [J]. Neurocomputing2018275: 2227-2238. DOI: 10.1016/j.neucom.2017.10.052 .

[5]

PIAO Y RRONG Z KZHANG Met al. A2dele: Adaptive and attentive depth distiller for efficient RGB-D salient object detection [C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2020: 9057-9066. DOI:10.1109/CVPR42600.2020.00908 .

[6]

ZHANG MREN W SPIAO Y Ret al. Select, supplement and focus for RGB-D saliency detection [C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2020: 3469-3478. DOI:10.1109/CVPR42600.2020.00353 .

[7]

ZHAO X QZHANG L HPANG Y Wet al. A single stream network for robust and real-time RGB-D salient object detection [C]// European Conference on Computer Vision. Cham: Springer International Publishing, 2020: 646-662. DOI: 10.1007/978-3-030-58542-6_39 .

[8]

袁野, 和晓歌, 朱定坤, . 视觉图像显著性检测综述[J]. 计算机科学202047(7): 84-91. DOI:10.11896/jsjkx.190900006 .

[9]

YUAN YHE X GZHU D Ket al. Survey of visual image saliency detection [J]. Computer Science202047(7): 84-91. DOI:10.11896/jsjkx.190900006(Ch ).

[10]

JIAO Y XWANG XCHOU Y Cet al. Guidance and teaching network for video salient object detection[C]//2021 IEEE International Conference on Image Processing. New York: IEEE Press, 2021: 2199-2203. DOI:10.1109/ICIP42928.2021.9506492 .

[11]

RONNEBERGER OFISCHER PBROX T. U-net: Convolutional networks for biomedical image segmentation[C]//Medical Image Computing and Computer-Assisted Intervention — MICCAI 2015. Cham:Springer, 2015: 234-241. DOI:10.1007/978-3-319-24574-4_28 .

[12]

HE K MZHANG X YREN S Qet al. Deep residual learning for image recognition[C]//2016 IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2016: 770-778. DOI:10.1109/CVPR.2016.90 .

[13]

LU J SYANG J WBATRA Det al. Hierarchical question-image co-attention for visual question answering[J]. Advances in Neural Information Processing Systems201629: 289-297.

[14]

XIONG C MZHONG VSOCHER R. Dynamic Coattention Networks for Question Answering[EB/OL]. [2018-03-06].

[15]

DHINGRA BLIU H XYANG Z Let al. Gated-attention readers for text comprehension [C]// Proceedings of the 55th Annual Meeting of the Association for Computational Linguistics. Stroudsburg: Association for Computational Linguistics, 2017: 1832-1846. DOI: 10.18653/v1/p17-1168 .

[16]

LAI TTRAN Q H, BUI T, et al. A Gated Self-Attention Memory Network for Answer Selection[EB/OL]. [2019-09-13]. DOI: 10.18653/v1/D19-1610 .

[17]

LIU S THUANG DWANG Y H. Receptive field block net for accurate and fast object detection [C]// Proceedings of the European Conference on Computer Vision (ECCV). Berlin: Springer, 2018: 385-400. DOI: 10.1007/978-3-030-01252-6_24 .

[18]

CHENG Y PFU H ZWEI X Xet al. Depth Enhanced Saliency Detection Method[EB/OL]. [2014-07-10]. DOI: 10.1145/2632856.2632866 .

[19]

LI N YYE J WJI Yet al. Saliency detection on light field[C]//2014 IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2014: 2806-2813. DOI:10.1109/CVPR.2014.359 .

[20]

PENG H WLI BXIONG W Het al. RGBD salient object detection: A benchmark and algorithms[C]//Computer Vision―ECCV 2014. Berlin: Springer, 2014: 92-109. DOI:10.1007/978-3-319-10578-9_7 .

[21]

FAN D PLIN ZZHANG Zet al. Rethinking RGB-D salient object detection: Models, data sets, and large-scale benchmarks [J]. IEEE Transactions on Neural Networks and Learning Systems202132(5): 2075-2089. DOI:10.1109/TNNLS.2020.2996406 .

[22]

ZHAO J XCAO YFAN D Pet al. Contrast prior and fluid pyramid integration for RGBD salient object detection[C]//2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2019: 3922-3931. DOI:10.1109/CVPR.2019.00405 .

[23]

CHEN HLI Y F. Three-stream attention-aware network for RGB-D salient object detection [J]. IEEE Transactions on Image Processing201928(6): 2825-2835. DOI: 10.1109/TIP.2019.2891104 .

[24]

ZHU C BCAI XHUANG Ket al. PDNet: Prior-model guided depth-enhanced network for salient object detection[C]//2019 IEEE International Conference on Multimedia and Expo. New York: IEEE Press, 2019: 199-204. DOI:10.1109/ICME.2019.00042 .

[25]

JU RGE LGENG W Jet al. Depth saliency based on anisotropic center-surround difference[C]//2014 IEEE International Conference on Image Processing. New York: IEEE Press, 2014: 1115-1119. DOI:10.1109/ICIP.2014.7025222 .

[26]

DENG JDONG WSOCHER Ret al. ImageNet: A large-scale hierarchical image database[C]//2009 IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2009: 248-255. DOI:10.1109/CVPR.2009.5206848 .

[27]

HE K MZHANG X YREN S Qet al. Delving deep into rectifiers: Surpassing human-level performance on ImageNet classification[C]//2015 IEEE International Conference on Computer Vision. New York: IEEE Press, 2015: 1026-1034. DOI:10.1109/ICCV.2015.123 .

[28]

PIAO Y RJI WLI J Jet al. Depth-induced multi-scale recurrent attention network for saliency detection[C]//2019 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2019: 7253-7262. DOI:10.1109/ICCV.2019.00735 .

[29]

FAN D PCHENG M MLIU Yet al. Structure-measure: A new way to evaluate foreground maps[C]//2017 IEEE International Conference on Computer Vision. New York: IEEE Press, 2017: 4558-4567. DOI:10.1109/ICCV.2017.487 .

[30]

ACHANTA RHEMAMI SESTRADA Fet al. Frequency-tuned salient region detection[C]//2009 IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2009: 1597-1604. DOI:10.1109/CVPR.2009.5206596 .

[31]

FAN D PGONG CCAO Yet al. Enhanced-alignment measure for binary foreground map evaluation[C]//Proceedings of the 27th International Joint Conference on Artificial Intelligence. California: International Joint Conferences on Artificial Intelligence Organization, 2018: 698-704. DOI:10.24963/ijcai.2018/97 .

[32]

PERAZZI FKRÄHENBÜHL PPRITCH Yet al. Saliency filters: Contrast based filtering for salient region detection[C]//2012 IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2012: 733-740. DOI:10.1109/CVPR.2012.6247743 .

[33]

FENG DBARNES NYOU S Det al. Local background enclosure for RGB-D salient object detection [C]//2016 IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2016: 2343-2350. DOI:10.1109/CVPR.2016.257 .

[34]

GUO J FREN T WBEI J. Salient object detection for RGB-D image via saliency evolution[C]//2016 IEEE International Conference on Multimedia and Expo. New York: IEEE Press, 2016: 1-6. DOI:10.1109/ICME.2016.7552907 .

[35]

CONG R MLEI J JZHANG C Qet al. Saliency detection for stereoscopic images based on depth confidence analysis and multiple cues fusion[J]. IEEE Signal Processing Letters201623(6): 819-823. DOI:10.1109/LSP.2016.2557347 .

[36]

QU L QHE S FZHANG J Wet al. RGBD salient object detection via deep fusion[J]. IEEE Transactions on Image Processing201726(5): 2274-2285. DOI:10.1109/TIP.2017.2682981 .

[37]

HAN J WCHEN HLIU Net al. CNNs-based RGB-D saliency detection via cross-view transfer and multiview fusion[J]. IEEE Transactions on Cybernetics201848(11): 3171-3183. DOI:10.1109/TCYB.2017.2761775 .

[38]

SONG H KLIU ZDU Het al. Depth-aware salient object detection and segmentation via multiscale discriminative saliency fusion and bootstrap learning [J]. IEEE Transactions on Image Processing201726(9): 4204-4216. DOI: 10.1109/TIP.2017.2711277 .

[39]

CHEN HLI Y F. Progressively complementarity-aware fusion network for RGB-D salient object detection[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2018: 3051-3060. DOI:10.1109/CVPR.2018.00322 .

[40]

WANG N NGONG X J. Adaptive fusion for RGB-D salient object detection [J]. IEEE Access20197: 55277-55284. DOI: 10.1109/ACCESS.2019.2913107 .

[41]

CHEN HLI Y FSU D. Multi-modal fusion network with multi-scale multi-path and cross-modal interactions for RGB-D salient object detection [J]. Pattern Recognition201986: 376-385. DOI: 10.1016/j.patcog.2018.08.007 .

基金资助

湖北省技术创新专项重大项目(2018AAA062)

AI Summary AI Mindmap
PDF (2580KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/