Point-GAT:图注意力机制与关键点检测的融合

王天晓 ,  刘俊 ,  刘茂福

武汉大学学报(理学版) ›› 2023, Vol. 69 ›› Issue (6) : 767 -776.

PDF (3520KB)
武汉大学学报(理学版) ›› 2023, Vol. 69 ›› Issue (6) : 767 -776. DOI: 10.14188/j.1671-8836.2021.0327
算法与应用

Point-GAT:图注意力机制与关键点检测的融合

作者信息 +

Point-GAT: The Fusion of Graph Attention Mechanism and Key Point Detection

Author information +
文章历史 +
PDF (3603K)

摘要

针对以往基于关键点的目标检测存在小尺度上的检测结果不太理想,忽略关键点之间的类别语义信息的问题,提出了一种新的关键点检测算法Point-GAT。该算法通过在Hourglass和ResNeXt主干网络上加入快捷连接,解决网络深度增加带来的学习退化问题;使用反卷积和特征融合增强小尺度目标的检测效果;同时算法使用了图注意力机制,通过构建有向有权重图映射类别之间的语义关系,获得关键点之间的类别语义信息;在优化定位和回归函数的同时,加入分类损失函数分支来反映类别语义信息。在COCO数据集上实验结果表明,该算法平均精度达到了48.3%,在PASVAL VOC 2007和PASVAL VOC 2012数据集上平均精度均高于其他算法。

Abstract

This paper proposes a new key point detection algorithm, Point-GAT, addressing the challenge of suboptimal key point detection results at a small scale and the oversight of category semantic information between key points in previous methods. This algorithm joins fast connections to solve the learning degradation problem caused by a too deep network.It enhances the detection effect of small-scale objects by using deconvolution and feature fusion on Hourglass and ResNeXt backbone networks. Simultaneously, the algorithm employs the graph classification method to depict the semantic relationship between categories. This is achieved by constructing a directed weighted graph to capture the category semantic information among key points. During the optimizatipon of the positioning and regression function, the branch of the classification loss function is incorporated to reflect the category semantic information. The experimental results indicate that the average accuracy of this algorithm on the COCO dataset reaches 48.3%, and the average accuracy on the PASVAL VOC 2007 and PASVAL VOC 2012 datasets is higher than that of other algorithms.

Graphical abstract

关键词

关键点检测 / 特征融合 / 小尺度目标 / 类别语义 / 图注意力机制

Key words

key point detection / feature fusion / small-scale targets / category semantics / graph attention mechanism

引用本文

引用格式 ▾
王天晓,刘俊,刘茂福. Point-GAT:图注意力机制与关键点检测的融合[J]. 武汉大学学报(理学版), 2023, 69(6): 767-776 DOI:10.14188/j.1671-8836.2021.0327

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

目标检测[12]为近年来理论和应用的研究热点,它主要分为一阶段和二阶段的目标检测,一阶段中又以关键点检测为主要代表。关键点本质上是一种特征,描述的是一定邻域范围内的组合或上下文关系。关键点检测有两种方法:点回归的方法,点分类的方法。

目标检测分为两个子问题,即确定对象的中心和预测四个边界框。当预测对象的中心时,中心预测被集成到类别预测的目标中,并且还可以预测一个中心度得分。对于四个边界的预测是预测像素点与真实框的四个边之间的距离。具体的实现算法分为以下两种。 1)基于多关键点联合表达的方法:CornerNet-Lite使用左上角点和右下角点作为关键点进行目标检测;ExtremeNet[3]使用上下左右4个极值点和中心点作为关键点进行目标检测;CenterNet:Keypoint Triplets for Object Detection[4]使用左上角点、右下角点和中心点作为关键点;RepPoints[5]使用9个学习到的自适应跳动的采样点作为关键点;FoveaBox[6]使用中心点、左上角点和右下角点实现无anchor操作;PLN使用4个角点和中心点实现检测。2)基于单中心点检测的方法:CenterNet:Objects as Points使用中心点、宽度和高度作为检测的关键点;CSP[7]使用中心点和高度进行检测;FCOS[8]使用中心点和到框的2个距离实现关键点检测。

以上的关键点检测算法在图像分类阶段没有考虑到类与类之间的语义关系,仅仅做了一个简单的二分类,缺少对关键点之间的类别语义分析推理。

为了获得关键点检测网络中的类别语义信息,本文引入图神经网络[9~12]中的图注意力机制来表征各个标签之间的相互依赖性,通过图中边的权重反映关键点之间的语义关系,实现更精准的分类。

以往的关键点检测算法得到的只是主干网络卷积后一个特征图上的关键点信息,偏向于对大尺度和中尺度目标的检测,会遗漏很多的小尺度目标,在小尺度目标的检测上缺乏一定的精度。

本文把图像中的每一个目标类别视为一个关键点,把得到的关键点集合之间的语义关系通过图注意力机制加以关联,利用有向有权重图生成语义互相关矩阵体现了关键点类别之间的语义关系强弱,在图像的分类阶段可以实现更好的分类效果;同时在关键点检测网络中加入反卷积和特征融合操作能够检测到更多的小尺度目标。本文在此基础上提出了一种新颖的关键点检测算法Point-GAT。

1  本文方法

本文将关键点检测网络中的Hourglass[13]和ResNeXt[14]作为主干网络,在其中加入快捷连接,解决网络过深带来的学习退化问题;关键点网络生成的特征图和其对应的热图通过反卷积操作生成一个分辨率更大的热图,可以得到更多小尺度的目标信息;然后取这两种热图分辨率的平均值进行特征融合,通过特征融合可以在较高分辨率的热图中恢复在较低分辨率的热图中丢失的小尺度目标的关键点信息,提高小尺度目标的检测精度。在特征融合后的热图上进行定位与回归,定位分支采用图注意力机制获取关键点之间的语义关系,生成语义互相关矩阵,实现对检测到的关键点进行更好地分类,回归分支使用高斯函数对损失函数进行优化改进,采用与原图像映射的方法回归出检测框。Point-GAT算法示意图如图1所示。

1.1 快捷连接(shortcut connection)

目前的关键点检测算法基本都采用Hourglass型沙漏网络,先通过不断卷积提取特征,然后上采样到相同尺度来融合语义信息。为了使本文提出的Point-GAT算法更加适用于ResNeXt网络结构,本文对ResNeXt网络加以改进,将这两种网络改为在统一的框架下。其中ResNeXt先进行可变形卷积和上采样操作,然后加上批量归一化以及ReLu激活函数,使得改进后的网络符合Hourglass网络需求。同时在主干网络的第2、3和4层增加快捷连接操作,其中每个快捷连接是由3×3卷积层实现,在第2、3和4层设计不同的卷积层数,且快捷连接的每一层(除去最后一层)后都需要加上激活函数。快捷连接的引入是为了解决网络深度的增加带来的学习退化问题,使其能够学习到更多的目标信息,进一步提升检测的精度。

图2是ResNeXt网络中一个模块改进后的图,可以看出改进后的网络与Hourglass中Residual模块构造大致相同,即能够把Hourglass网络与ResNeXt网络相关联,提升模型的适用性。快捷连接的这种设计把不同阶段的特征图相关联,构成一个残差块,通过提升训练集的效果对网络作进一步优化。快捷连接在网络每个阶段个数的不同也会导致残差学习的效果不同,影响网络优化的同时会导致检测精度发生改变,设置最优的快捷连接个数能够提升检测精度。

1.2 反卷积模块

本文在改进后的主干网络上添加了反卷积模块,用于生成更高分辨率的特征图。因为特征图和其对应热图的分辨率越高,越能预测到更多的小尺度关键点信息;同时考虑到不增加额外的计算量,仅仅使用了一层反卷积来进行上采样,得到分辨率是输入特征图两倍的关键点特征图。使用Batch Normalization和Relu进行进一步特征学习。将Hourglass或ResNeXt网络生成的特征图和热图作为反卷积模块的输入,通过反卷积生成分辨率更大的特征图,这样能得到更多小尺度的目标信息。

1.3 特征融合

本文借鉴HRNet[15]中的热图聚合策略,设计了基于级联的多层特征融合策略,将具有丰富细节信息的浅层特征图和具有抽象语义信息的深层特征图进行通道叠加,解决小尺度目标在深层特征图中特征信息缺乏的问题。使用双线性插值法将具有不同分辨率的所有预测热图上采样到输入图像的分辨率,并取这两种热图分辨率的平均值进行特征融合。

HRNet仅使用单个尺度的热图进行预测,不足以获得不同尺度的关键点,且会丢失很多小尺度的关键点。本文的方法首先是从不同分辨率的特征图上获得不同尺度的关键点信息,然后采用上采样和HigherHRNet[16]中的热图融合方法实现特征融合,在较高分辨率的热图中恢复在较低分辨率的热图中丢失的小尺度关键点,进一步提高小尺度关键点的检测效果。该方法流程如图3所示。

1.4 图注意力机制(GAT)

图注意力机制的输入:

h=h1,h2,,hN,hiRF

其中,N为节点的个数,F为特征的个数,这表示输入为N个节点的每个节点的特征个数。

图注意力机制的输出:

h'=h1',h2',,hN',hi'RF'

该式表示这N个节点的F'个输出,每个节点有F'个特征。注意,N个节点是按照其输入的特征预测输出的特征,输入F与输出F'不一定相等,这是由于预测出的特征个数前后结果可能不同。

为了得到相应的输入与输出的转换,需要根据输入的特征至少进行一次线性变换得到输出的特征。对所有节点训练一个权值矩阵:WRF'×F,这个权值矩阵能反映输入与输出特征之间的对应关系。针对每个节点实行自注意力机制,自注意力机制为a:RF'×RF'R。注意力互相关系数eij表示节点j对于节点i之间的关联程度,其计算如下式所示:

eij=aTWhi,Whj

其中,hihj分别是节点ij的表示。

通过屏蔽注意力将这个注意力机制引入图结构之中,屏蔽注意力的含义:只计算节点i的相邻的节点j,节点jNi,其中Ni为节点i的所有相邻节点。实验中,注意力机制αij 是一个单层的前馈神经网络,为了使互相关系数更容易计算和便于比较,引入了softmax对所有的i的相邻节点j进行归一化,具体操作是加入了斜率为0.2的Leaky ReLu非线性激活函数。注意力机制αij计算如下:

αij=exp LeakyReLu aTWhiWhjkNiexp LeakyReLu aTWhiWhk

图注意力机制的示例图如图4所示。

1.5 GAT的语义互相关矩阵的构建

本文提出的算法使用的是关键点检测网络,可以把类的关键点视为GAT图中的顶点,把类与类之间的上下文语义强弱视为图中有权重的边,有向图可以更好地表达出类之间语义的指向性关系。

为了把注意力机制引入有向图中,构建节点之间的互相关矩阵 A 至关重要。很多情况下,互相关矩阵是预先定义好的,采用通过对类别标签的二值化方法构建互相关矩阵。GAT是有向、有权重的,在卷积时不会对所有邻居节点一视同仁,能根据节点重要性分配不同的权重,即能对顶点之间的语义关系进行正确表达。

通过条件概率定义标签之间的相互依赖性,如P(Lj|Li ),表示标签Li 出现的情况下,Lj 出现的概率。

1) 标签互相关矩阵

为了构建这样一个互相关矩阵,本文列出所有的标签对,即一个标签与另一个标签之间的对应关系。C为类别的个数,也就是标签的个数。构建示意图如图5所示。

2) GAT语义互相关矩阵

为了进一步反映出GAT中的有向、有权重特征,对以上标签互相关矩阵进行改进。利用图注意力机制αij重新定义关键点之间的类别标签,更新条件概率,对所有的条件概率利用图注意力机制加权求和,得到GAT语义互相关矩阵A,表示如下:

Aij=σjNiPLj|LiaijWhj

定义一个重新加权的语义互相关矩阵A'如下

Aij'=p/j=1ijCAij,if ij1-p,if i=j

其中,p代表的是分配给自身和其他节点的权重,为预先定义好的。引入p的目的是固定节点自身的权重,相邻节点的权重依旧由图注意力机制进行分配。p趋于1时,节点自身的特征更容易被忽视,p 趋于0时,相邻节点的特征更容易被忽视。

将关键点视为图中的顶点,关键点之间的连线视为图中的边,边的权重可以反映类别之间的语义关系,其大小对应于类别之间语义关系的强弱。本文利用图注意力机制构建语义互相关矩阵,提高分类效果,达到提升检测精度的目的。

1.6 损失函数

本算法的损失函数包括:分类损失、定位损失和回归损失。总损失函数等于这三个损失之和。

分类损失函数设计如下

Lcls=c=1Cyclogσy^c+1-y^log1-σy^c

假设图像的真实标号为yRC,其中yi={0,1}表示标号i是否出现在图像中;σ()是sigmoid函数。

y^=Wx

W从标签层次表示通过基于GAT的映射函数的权值信息;x代表的是利用CNN获得的图像特征,计算如下

x=fGMPfCNNI;θCNNRD

I代表的是输入图像。

设预测目标为H^,定位目标为H,定位损失函数

Lloc=1Mxyc1-H^ijcαflogH^ijc,H^ijc=11-HijcβfH^ijcαflog1-H^ijc,H^ijc1

其中,αfβf是focal loss中的超参数,按CenterNet中的参数设置,在本文中,设αf=2,βf=4;M是标注框量。

Lreg是回归损失函数,其作用是正确回归出需要检测的目标框。公式如下:

Lreg=1Nreg(i,j)AmGIoU B^ij,Bm×Wij

B^ij代表的是解码框x^1,y^1,x^2,y^2ijBm=x1,y1,x2,y2m是图像比例尺上对应的第m个标注盒,Wij是输入样本的权重,用于平衡每个样本造成的损失,(i,j)在第m个带注释的方框的Am子区域内权重构造如下:

Wij=log am×Gm(i,j)(x,y)AmGm(x,y),(i,j)Am0,(i,j)Am

其中,Gm(i,j)(i,j)处的高斯概率,am是第m个方框的面积。该方案可以很好地利用大对象中包含的标注信息,同时保留小对象的标注信息。

总的损失函数由以上三个损失函数经过标量加权得到:

L=wclsLcls+wlocLloc+wregLreg

本文设wcls=2.0,wloc=1.0,wreg=5.0。

2  实 验

2.1 实验环境

本文的实验是在笔记本电脑上进行的,具体的实验环境的配置如表1所示。

2.2 数据集及评估标准

本文实验在COCO数据集上评估了目标检测性能,该数据集包含118 000张训练图像(train2017),5 000张验证图像(val2017)和20 000张保留测试图像(test-dev)。报告了所有Intersection over Union(IOU)阈值的平均检测精度(AP)、IOU阈值为0.5时的检测精度(AP50)和阈值为0.75时的检测精度(AP75)的平均精度,因为需要评测该算法的多尺度检测的需求,需要同时报告小尺度(APS)、中尺度(APM)和大尺度(APL)的平均精度,用FPS表示算法的速度。

本文使用关键点检测网络ResNeXt和Hourglass作为实验的主干网络。对于ResNeXt,初始学习率为0.016,批处理大小为128。对于Hourglass,初始学习率为0.015,批处理大小为96。主干网络使用SGD训练了24个epoch。1个epoch等于使用训练集中的全部样本训练一次,设定权重衰减为0.000 4,动量为0.9。对于网络中的偏差参数,它们的权值衰减为0,学习率翻倍,warm-up在前500个steps使用。使用ImageNet上预先训练的权重初始化本文的主干网络。本文的实验是基于开源检测工具箱mmdetection。

2.3 与其他算法的比较

本文算法与其他算法在COCO数据集上的检测结果如表2表2中前3个为两级检测器,其他为单级检测器。实验结果表明Point-GAT算法使用Hourglass网络AP的最高精度能够达到48.3%,优于所有现有的单级检测器。在Point-GAT算法使用Hourglass和ResNeXt主干网络时,在多尺度上达到最优,且在小尺度上提升明显;在中尺度的检测上达不到两级检测器的精度,可能是为了减少计算量,设计的模型分辨率层数太少,缺乏对中尺度目标有效检测。由表2还可以看出Point-GAT算法使用Hourglass网络FPS达到35,明显快于两级检测器;精度略低于两级检测器是因为单级检测器自身框架缺少了RPN提取特征阶段,导致样本不均衡。

为了更直观地表现本文提出的Point-GAT算法对小尺度目标的检测精度和分类准确性的提升,图6给出了Point-GAT与CornerNet、CenterNet的检测结果。由图6可以看出,Point-GAT成功移除了CornerNet中的一些错误分类。相较于CenterNet,本文提出的算法有两大优势:第一,利用添加的反卷积和特征融合方法,能够检测出更多的小尺度目标;第二,提升了分类的准确率。

2.4 消融实验

2.4.1 快捷连接

本文考虑在主干网络的不同阶段加入不同数量的快捷连接解决这个问题,从而进一步提升检测的精度。表3列出了使用不同设置时的结果,第一列的数据表示这两个主干网络未加入快捷连接时的检测精度。对于阶段2、3、4,本文选择了3、2、1的组合,这里3、2、1分别表示每一阶段使用快捷连接的个数。经过实验可以看到此组合在ResNeXt上AP的最大值达到45.3%,在Hourglass上AP的最大值达到45.8%。

2.4.2 反卷积模块

反卷积模块能够对提取到的特征图像进行放大分辨率的操作,从高到低输出每个分辨率的特征图。实验前后训练了ResNeXt和Hourglass网络和加入反卷积之后的网络分辨率的变化,利用ImageNet进行预训练,然后对这两个网络进行初始化工作,最后输出大、中、小这三个尺度上的响应映射。表4中报告了在每个特征图上的AP(平均检测精度)结果。实验结果表明,分辨率确实影响了关键点预测的精度,可以看出加入反卷积模块后各个尺度上的检测精度都有增加,尤其是在小尺度上精度有明显提升。加入反卷积模块后,在ResNeXt网络上,AP在小尺度目标上由27.0%提高到28.7%;在Hourglass网络上,AP在小尺度目标上由28.3%提高到29.5%,证明加入反卷积模块对小尺度目标检测精度的提升有明显效果。

2.4.3 特征融合

3.4.2小节实验结果表明,加入反卷积模块能够提升图像中各个尺度的检测精度,在小尺度上的提升最明显。考虑到进行反卷积后会生成两个分辨率不同的特征图,需要使用特征融合来合并这两个特征图,进一步解决小尺度目标在深层特征图中特征信息缺乏的问题。在加入反卷积模块的基础上,加入特征融合方法,能够提升小尺度目标的检测精度。表5实验结果表明,在加入反卷积模块的前提下,融入特征融合方法后,在ResNeXt网络上, AP在小尺度目标上由28.7%提高到29.7%;在Hourglass网络上,AP在小尺度目标上由29.5%提高到30.1%,说明加入特征融合方法对小尺度目标检测精度的提升有明显效果。

2.4.4 GAT对关键点分类效果的影响

按照常规,将平均每类的精度(CP)、查全率(CR)、F1(CF1)和平均总体精度(OP)、查全率(OR)、F1(OF1)用于性能评估。对于每个图像,如果IOU阈值大于0.5,标签被预测为正。一般情况下,总体F1平均值(OF1)、单级F1平均值(CF1)和所有类别的平均检测精度(mAP)对性能评价比较重要。为了表明文本提出的图注意力机制能够提升分类效果,本文利用改进后的ResNeXt和Hourglass主干网络,不加入图注意力机制时进行图像分类,简称NO-GAT和加入图注意力机制构建一种新的基于图的分类网络用于图像分类,简称MS-GAT。结果如表6所示,可以看到,在分类效果上,使用MS-GAT后所有类别的平均检测精度最高可以达到84.0%,且在其他标签分类效果上的CP、CF1、OP、OR和OF1也可以达到最好的精度,表明MS-GAT网络能够明显提升对检测目标分类的效果。

2.4.5 不同注意力机制的关键点检测结果对比分析

为了验证提出的图注意力机制的有效性,本文把改进后的主干网络作为关键点检测网络,分别融入基于CNN的注意力机制(RA-CNN),基于RNN的注意力机制(RAM),基于空间的注意力机制(SAM)和基于图注意力机制(GAT)对比分析,得到结果如表7。从表7可以看到,将GAT与通用的关键点检测网络融合后,AP的最高值达到48.3%,证明GAT在关键点检测网络上的有效性。

2.4.6 验证Point-GAT算法各阶段有效性

采用消融实验证明本文添加的各个模块是有效且合理的。采用控制变量法对算法的有效性进行分析,如表8所示,在添加快捷连接、反卷积、特征融合及GAT后AP的最高值能够达到48.3%。

2.5 拓展实验

本文提出的算法除了在COCO数据集上进行了实验,还在PASVAL VOC 2007和PASVAL VOC 2012数据集上进行测试与验证。

利用PASVAL VOC 2007数据集可以进行分类、检测和分割等任务。该数据集一共有20个类别的目标,包括人、交通工具、动物和室内用品等对象,同COCO数据集一样,将之划分为训练集、验证集与测试集三个部分。在本文的实验中,将训练集和验证集合并作为训练样本,测试集保持不变。利用Point-GAT算法进行检测时,得到该算法在该数据集上各类别AP、所有类别最终mAP,检测结果如表9所示。

PASVAL VOC 2012数据集在PASVAL VOC 2007数据集上进行了数量上的扩充,在实验时采取与PASVAL VOC 2007数据集上相同的训练与测试设置。利用Point-GAT算法进行检测时,得到该算法在该数据集上各类别的AP、所有类别最终的mAP,检测结果如表9所示。

为了能够更直观地表现本文提出的Point-GAT算法在PASVAL VOC 2007数据集和PASVAL VOC 2012数据集上的检测结果,图7图8给出了直观检测效果,可以看出本算法对这两个数据集上的每个类别均能准确地检测,图中每一种颜色的框代表一种不同的类别。

本文将Point-GAT算法与其他的目标检测算法在PASVAL VOC数据集上进行对比实验,其中VOC 0712 trainval表示VOC 2007 trainval和VOC 2012 trainval数据集合并后的数据集。检测结果如表10所示,结果表明Point-GAT算法在PASVAL VOC数据集上所有类别的mAP最高能够达到79.1%。

3  结 语

本文提出了一种基于图注意力机制的关键点检测算法Point-GAT,在主干网络上加入快捷连接,解决网络过深带来的学习退化问题,利用反卷积和特征融合方法使检测网络能够检测到更多的小尺度特征。在定位分支上加入图注意力机制可以达到很好的分类效果,能够更高效地定位出关键点的位置。在COCO数据集上实现了比以往的关键点算法更好的检测精度,该算法还可以移植到人脸关键点检测和人体关键点检测领域。

由于实验环境的限制,得到的结果无法拟合到最佳状态;同时本文提出的算法是单阶段检测算法的改进,仅适用于关键点检测网络,为了能体现Point-GAT算法对目标检测算法的通用性和可移植性,将对此算法加以改进,让其进入新的领域。

参考文献

[1]

LIU LOUYANG W LWANG X Get al. Deep learning for generic object detection: A survey [J]. International Journal of Computer Vision2020128(2): 261-318. DOI:10.1007/s11263-019-01247-4 .

[2]

JIAO L CZHANG FLIU Fet al. A survey of deep learning-based object detection [J]. IEEE Access20197(3): 128837-128868. DOI:10.1109/ACCESS.2019.2939201 .

[3]

LAW HTENG YRUSSAKOVSKY Oet al. CornerNet-lite: Efficient keypoint based object detection[EB/OL]. 2019arXiv: 1904.08900.

[4]

ZHOU XZHUO J CKRÄHENBÜHL P. Bottom-up object detection by grouping extreme and center points [J]. Proceedings of the IEEE Computer Society Conference on Computer Vision201915(5): 850-859.

[5]

DUAN K WBAI SXIE L Xet al. CenterNet:Keypoint triplets for object detection [J]. Proceedings of the IEEE International Conference on Computer Vision201967(2): 6568-6577.

[6]

YANG ZLIU S HHU Het al. RepPoints: Point set representation for object detection[C]//2019 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press,2020: 9656-9665. DOI:10.1109/ICCV.2019.00975 .

[7]

KONG TSUN F CLIU H Pet al. FoveaBox: Beyound anchor-based object detection[J]. IEEE Transactions on Image Processing202029: 7389-7398. DOI:10.1109/TIP.2020.3002345 .

[8]

WANG C YLIAO HWU Y Het al. CSPNet: A new backbone that can enhance learning capability of CNN[C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops(CVPRW). New York: IEEE Press, 2020: 390-391. DOI:10.48550/arXiv.1911.11929 .

[9]

TIAN ZSHEN C HCHEN Het al. FCOS: Fully convolutional one-stage object detection [C]//2019 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2020: 657-666. DOI: 10.48550/arXiv.1904.01355 .

[10]

WU Z HPAN S RCHEN F Wet al. A comprehensive survey on graph neural networks [J]. IEEE Transactions on Neural Networks and Learning Systems202132(1): 4-24. DOI:10.1109/TNNLS.2020.2978386 .

[11]

LI JRONG YCHENG Het al. Semi-supervised graph classification: A hierarchical graph perspective [C]//WWW'19: The World Wide Web Conference. New York: ACM, 2019: 972-982. DOI:10.1145/3308558.3313461 .

[12]

LI S DGUO B HYANG X B. Study on financial credit information based on graph neural network[J]. Computer Science202148(4): 85-90.

[13]

MORRIS CRITZERT M, FEY M, et al. Weisfeiler and leman go neural: Higher-order graph neural networks[J]. Proceedings of the AAAI Conference on Artificial Intelligence201933: 4602-4609. DOI:10.1609/aaai.v33i01.33014602 .

[14]

GIRSHICK RDONAHUE JDARRELL Tet al. Rich feature hierarchies for accurate object detection and semantic segmentation[C]//2014 IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2014: 580-587. DOI:10.1109/CVPR.2014.81 .

[15]

XIE S NGIRSHICK RDOLLÁR Pet al. Aggregated residual transformations for deep neural networks[C]//2017 IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2017: 5987-5995. DOI:10.1109/CVPR.2017.634 .

[16]

SUN KXIAO BLIU Det al. Deep high-resolution representation learning for human pose estimation[C]//2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press,2019 : 5686-5696. DOI:10.1109/CVPR.2019.00584 .

[17]

CHENG B WXIAO BWANG J Det al. HigherHRNet: Scale-aware representation learning for bottom-up human pose estimation [C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press,2020 : 5385-5394. DOI:10.1109/CVPR42600.2020.00543 .

[18]

HE K MGKIOXARI GDOLLÁR Pet al. Mask R-CNN[C]//2017 IEEE International Conference on Computer Vision. New York: IEEE Press, 2017: 2980-2988. DOI:10.1109/ICCV.2017.322 .

[19]

LIU SQI LQIN H Fet al. Path aggregation network for instance segmentation[C]// 2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2018: 8759-8768. DOI:10.1109/CVPR.2018.00913 .

[20]

LI Y HCHEN Y TWANG N Yet al. Scale-aware trident networks for object detection[C]//2019 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2019: 6053-6062. DOI:10.1109/ICCV.2019.00615 .

[21]

REDMON JFARHADI A. YOLO9000: Better, faster, stronger[C]//2017 IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2017: 6517-6525. DOI:10.1109/CVPR.2017.690 .

[22]

LIN T YGOYAL PGIRSHICK Ret al. Focal loss for dense object detection [C]//2017 IEEE International Conference on Computer Vision. New York: IEEE Press,2017 : 2999-3007. DOI:10.1109/ICCV.2017.324 .

[23]

LAW HDENG J. CornerNet: Detecting objects as paired keypoints[C]//Computer Vision―ECCV 2018. Cham: Springer International Publishing, 2018: 765-781. DOI:10.1007/978-3-030-01264-9_45 .

[24]

ZHU C CHE Y HSAVVIDES M. Feature selective anchor-free module for single-shot object detection[C]//2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2020: 840-849. DOI:10.1109/CVPR.2019.00093 .

[25]

KE WCHEN JJIAO J Bet al. SRN: Side-output residual network for object symmetry detection in the wild[C]//2017 IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press,2017 : 302-310. DOI:10.1109/CVPR.2017.40 .

[26]

HE K MZHANG X YREN S Qet al. Identity mappings in deep residual networks[C]//Computer Vision―ECCV 2016. Cham: Springer International Publishing, 2016: 630-645. DOI:10.1007/978-3-319-46493-0_38 .

[27]

GE W FYANG S BYU Y Z. Multi-evidence filtering and fusion for multi-label classification, object detection and semantic segmentation based on weakly supervised learning[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2018: 1277-1286. DOI:10.1109/CVPR.2018.00139 .

[28]

FU J LZHENG H LMEI T. Look closer to see better: Recurrent attention convolutional neural network for fine-grained image recognition[C]//2017 IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2017: 4476-4484. DOI:10.1109/CVPR.2017.476 .

[29]

LIU WANGUELOV DERHAN Det al. SSD: Single shot MultiBox detector[C]//Computer Vision-2016. Cham: Springer International Publishing, 2016: 21-37. DOI:10.1007/978-3-319-46448-0_2 .

[30]

REDMON JDIVVALA SGIRSHICK Ret al. You only look once: Unified, real-time object detection[C]//2016 IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press,2016: 779-788. DOI:10.1109/CVPR.2016.91 .

基金资助

国家自然科学基金(31201121)

AI Summary AI Mindmap
PDF (3520KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/