基于轻量型高分辨率网络的被遮挡人体姿态估计

罗梦诗 ,  徐杨 ,  叶星鑫

武汉大学学报(理学版) ›› 2021, Vol. 67 ›› Issue (5) : 403 -410.

PDF (3373KB)
武汉大学学报(理学版) ›› 2021, Vol. 67 ›› Issue (5) : 403 -410. DOI: 10.14188/j.1671-8836.2020.0270
计算机科学

基于轻量型高分辨率网络的被遮挡人体姿态估计

作者信息 +

Human Pose Estimation of Occlusion Based on Light⁃Weight High⁃Resolution Network

Author information +
文章历史 +
PDF (3453K)

摘要

针对人体姿态被遮挡导致图像部分目标信息丢失使得估计结果不精确的问题,以高分辨率网络HRNet-32为基本网络架构,构建了一种轻量型高分辨率级联金字塔网络模型对被遮挡人体姿态进行估计。将对GhostNet进行改进的Gaff模块引入HRNet-32第一阶段,对网络进行轻量化,对特征进行初提取并进行多尺度特征融合训练。在HRNet-32中加入级联金字塔网络(cascaded pyramid network,CPN)进行二次特征提取,获取人体被遮挡部分的关键点,采用回归热图进行人体姿态估计。在公开数据集MPII和3DOH50K上进行测试,实验结果表明本文提出的网络对人体姿态估计的精确度比HRNet-32有所提升。

Abstract

Aiming at the problem that the target occlusion leads to the loss of some target information of the image in human pose estimation, a light-weight and high-resolution cascaded pyramid network model was constructed based on HRNet-32 to estimate the occlusion body pose. The improved Gaff module of GhostNet is introduced into the first stage of high-resolution network (HRNet-32). The network is light-weight, features are extracted initially and multi-scale feature fusion training is carried out. A cascaded pyramid network (CPN) was added to HRNet-32 for secondary feature extraction to obtain the key points of the occluded part of the human body, and a regression heat map was used to estimate the body posture. Experimental results on public data sets MPII and 3DOH50K show that the accuracy of the proposed model is better than that of HRNet-32.

Graphical abstract

关键词

人体姿态估计 / 遮挡 / 高分辨率网络 / 注意力特征融合 / 级联金字塔网络

Key words

human pose estimation / occlusion / high-resolution network / attention feature fusion / cascaded pyramid network

引用本文

引用格式 ▾
罗梦诗,徐杨,叶星鑫. 基于轻量型高分辨率网络的被遮挡人体姿态估计[J]. 武汉大学学报(理学版), 2021, 67(5): 403-410 DOI:10.14188/j.1671-8836.2020.0270

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

人体姿态估计是计算机视觉领域的一个重要任务,也是计算机理解人类动作、行为不可缺失的一步。从一张图片中识别并估计出其中的2D人体姿态则是一项重要的基础性工作。然而现实生活中环境的复杂性常常导致图片中的人体被不同程度遮挡,被遮挡的图像会丢失部分关键信息。在人体姿态估计的任务中,图结构模型匹配1和K均值聚类2等传统算法易受背景复杂和遮挡因素的干扰,存在提取图片特征难、识别精度低等问题,结果往往不理想。因此,如何在人体处于严重遮挡时仍能得到较好的估计精确度是人体姿态估计面临的一个问题,针对此问题进行深入的研究具有重大意义。

文献[3]提出了深度姿态(deep pose)估计网络,针对人体关键点进行深度神经网络(deep neural networks,DNN) 回归学习。卷积神经网络是人体关键点检测使用的主要网络,其优点是卷积层权重的参数较少且当图片中的目标平移到图片的另一个位置时卷积神经网络仍能很好地识别出这个目标,缺点在于难以检测到精确的小目标。文献[4]提出的特征金字塔网络(feature pyramid networks,FPN)则可以改善卷积神经网络的这一缺点。但因上下文信息的缺乏,导致检测性能达不到较好的效果,对于人体姿态估计而言,遮挡部位的关键点难以被识别。文献[5]提出的堆叠沙漏网络(stacked hourglass networks,SHN)通过将网络按高分辨率到低分辨率,再从低分辨率到高分辨率的方式进行串联,从而以热图检测的方式学习到人体关节点信息。但从高到底和从低到高的过程会丢失部分特征信息导致估计结果不够精确且难以检测到被遮挡的关键点。文献[6]提出的级联金字塔(cascaded pyramid network,CPN)方法使网络对人体被遮挡的关键点的检测性能得到改善。文献[7]提出了高分辨率网络(high-resolution network,HRNet),从输入到输出始终保持高分辨率特征图,一定程度上解决了中、低分辨率人体关键点检测准确率低的问题。在人体出现轻微重叠或遮挡时可以检测出关键点信息,但若出现严重的遮挡,HRNet网络的估计结果会出现较大误差,并且始终保持的高分辨率在提高了准确率的同时也增加了网络的复杂度和网络参数量。文献[8]提出的线性变换生成冗余特征图方法(GhostNet),在减少网络模型参数的同时仍能达到较高的网络精确度。为了解决多尺度融合时尺度变化和小目标带来的问题,文献[9]提出注意力特征融合模块(attentional feature fusion,AFF),解决了上下文聚合和初始整合问题。

基于以上研究,本文以高分辨率网络HRNet-32作为人体姿态估计的基础网络框架,提出一种轻量型高分辨率级联金字塔网络(ghost high-resolution cascaded pyramid network,GHRCPN)。将AFF融入到GhostNet的bottleneck模块替换HRNet-32的bottleneck模块以及basicblock模块,对网络进行轻量化并为输出特征分配不同权重,从不同的接受域中聚合上下文信息;然后在改进的轻量化高分辨率网络增加了级联金字塔网络。在减少网络的部分复杂度和参数的同时提高了姿态估计的精确度。

1  本文模型

1.1 模型流程

本文提出的轻量型高分辨率级联金字塔网络(GHRCPN)人体姿态估计模型流程如图1所示。该模型的目标是定位并识别出人体关键点,将关键点按照关节顺序相连,得到人体的躯干,从而实现人体的姿态估计。

本文在HRNet-32网络的第一阶段引入Gaff模块,对网络进行轻量化;第二阶段、第三阶段和第四阶段通过不同分辨率的子网络进行特征提取和融合;融入级联金字塔网络(cascaded pyramid network,CPN)作为第五阶段,对第四阶段输出的特征图进行二次特征提取,检测人体被遮挡的关键点,最终实现人体姿态估计。

对于人体关键点的检测,本文使用深度卷积神经网络方法中的关键点热图估算10方法进行估算。通过对每张图像中人体的每个像素点的概率值进行估算,把与人体关节点最接近的像素点处的概率值记为1,与关节点距离最远的像素点处的概率值记为0。检测到的像素点的概率值越接近1,则表明所检测的点越接近目标关键点。通过对图像进行训练,将像素点的概率值最接近1的点作为关键点,得到人体16个关键点,最后将所得到的热图结果映射到原图像,实现关键点的检测,如图2所示。

1.2 高分辨率网络

本文的主干网络是高分辨率网络HRNet-32,高分辨率网络结构摒弃了以往传统的串联结构,通过并行连接将高分辨率卷积和低分辨率卷积连接起来,如图3所示。并行连接的方式可以使网络随时保持高分辨率表征,高分辨率表征可以通过重复跨并行卷积执行多尺度融合来增强。此时,网络在保持高分辨率信息的同时也能更好地融合低分辨率信息,提升姿态估计的效果。

反复多尺度融合单元以第三阶段为例,如图4所示。F为融合单元,F可以分为 f1f2f3三部分,特征融合从高分辨率到低分辨率进行,上采样使用最近邻插值方法进行,下采样使用步长为2且卷积核为3×3的卷积层进行。f3中虚线方块第一次下采样得到一个特征图,目标特征图通过对得到的特征图进行第二次下采样得到。

HRNet-32使用自顶向下的方式对人体姿态进行估计,分为两个步骤:人体目标检测和人体关键点检测。HRNet-32以与其输入特征图相同的分辨率输出特征图,关键点位置通过回归器估计,然后将估计出的关键点位置转换为全分辨率的热图,热图的回归通过在HRNet-32模型最后一层添加卷积层来实现。

1.3 线性变换注意力特征融合模块Gaff

针对HRNet-32网络参数多、运算复杂度高的问题,引入线性变换生成冗余特征图(GhostNet)。该方法由华为诺亚方舟实验室所提出8,其主要思想是将原始卷积层拆解为两部分:首先使用普通卷积方式用较少的卷积核来生成原始特征图,再通过已经生成的通道特征图进行简单的线性变换生成剩余的通道特征图。

本文对基于GhostNet的bottleneck模块进行改进,提出模块Gaff,该模块分为Gaffblock模块和Gaffneck模块两部分,分别如图5图6所示。Gaff模块可以降低网络的参数量和网络的运算复杂度。

网络的参数量与运算复杂度的计算如下11

rp=CoutSCinkk+(S-1)CoutSkkCoutCinkk=
S+Cin-1SCin1S
rc=CoutSHWCinkkHWCoutCinkk+
(S-1)CoutSHWkkHWCoutCinkk=
S+Cin-1SCin1S

其中,Cin为输入通道数,Cout为输出通道数量,k为卷积核尺寸,S为缩放系数,rp为降低的参数量比率,rc为降低的运算复杂度比率,HW分别是该层网络输入特征图的高与宽。

为了给输出特征分配不同权重,从不同的接受域中聚合上下文信息,本文将GhostNet网络中的bottleneck模块的结果相加部分替换成AFF模块,AFF模块的结构如图7所示。

将Gaff模块输入的特征信息当作X,通过卷积操作输出的结果f(X)当作Y,则X,YC×H×W为feature map,将feature map作为AFF的输入。其中:C是特征的通道数,HW分别是特征的高和宽。AFF的核心模块为多尺度通道注意模块M(MSCAM),其核心思想是通过改变空间池的大小,在多个尺度上实现通道注意融合。其计算如下式

Z=MXYX+1-MXYY

式中,ZC×H×W,为通道注意力权重矩阵;M是多尺度通道注意模块;是指将向量扩展成相同的维度后再进行加法运算;是指将对应向量进行乘法运算。

为了使网络结构尽可能轻量化,只在注意力模块中将局部上下文添加到全局上下文中。选择点向卷积(PWConv)作为本地通道上下文聚合器。它利用输入特征的每个空间位置的点式通道交互作用,计算如下式

LX=BPWConv2δBPWConv1Z'

其中,B代表BatchNorm2d()函数,δ代表激活函数Relu,PWConv1的内核大小是Cr×C×1×1PWConv2内核大小是C×Cr×1×1

1.4 级联金字塔网络

采用以上方法对HRNet-32网络改进后可以有效定位人体简单可见的关键点,但不能轻易识别复杂环境下被遮挡的人体关键点。要定位复杂环境下被遮挡的人体关键点,需要更丰富和详细的特征信息。因此,本文在改进的HRNet-32网络融入CPN,其结构如图8所示。

将高分辨率输出的feature map作为CPN的输入。由CPN的GlobalNet去学习得到一个较好的特征信息;然后由CPN的RefineNet整合来自GlobalNet部分的特征,进一步推断出被遮挡的关键点。RefineNet通过上采样的方式整合不同层之间的信息,用bottleneck模块来处理更深的特征,这样做的目的在于让网络在较小的空间尺度使效率和性能得到较好的平衡。

2  实验结果及分析

2.1 实验环境

本实验使用的框架是PyTorch1.1.0,系统是Ubuntu18.04,显卡是NVIDIA GeForce GTX 1080Ti。

2.2 数据集

两个公开基准数据集:文献[12]提出的3D Occlusion Human 50K(3DOH50K)和MPII13数据集。3DOH50K包括51 600张图片,其中大部分目标是被遮挡场景中的人,将50 310张图片作为训练集,1 290张图片作为测试集;MPII包括了24 984张图片,每张图片有16个注释关节点。3DOH50K中每张图片都有一个精确的2D和3D注释,本文用的是2D注释,每张图片有14个注释关节点。以遮挡的人体关键点的多少来划分被遮挡的比例,遮挡10%、20%、30%、40%、50%、60%、70%时遮挡关键点个数分别为1~3、4、5、6、7、8、9。3DOH50K数据集中人体被不同比例遮挡图片数量的分布如图9所示。

2.3 图像预处理与实验设置

在训练之前,对于MPII数据集,以人体髋部为中心进行裁剪,将图像的分辨率归一化为固定的256×256,便于网络训练。

对于3DOH50K数据集,由于图片都是固定的2 048×1 536像素,通过两层步长为2的卷积层对图像进行多次降维处理,减少训练所需要的计算时间:将像素为2 048×1 536的图像经过一次步长为2的3×3卷积,将其降维成像素为1 024×768的图像,通道数变为256;再通过一次步长为2的3×3卷积将像素为1 024×768的图降维成像素为512×384的图像,通道数变为64;最后通过一次步长为2的3×3卷积将像素为512×384的图像降维成像素为256×192的图像,此时通道数仍然为64。

在本文实验中,训练周期为200,训练批量设置为20。选用Adam优化器进行模型优化,学习率为 0.001。

2.4 实验结果与分析

表1是本文方法与其他方法的参数量和运算复杂度的结果比较。HRNet-32作为基础框架网络,在模型参数设置上采用了线性变换缩放系数s=2来进行冗余特征图的生成,根据(1)式和(2)式计算,HRNet-32 with Gaff module相比CPN方法6,运算复杂度降低1.1%,参数量降低31.5%;相比HRNet-32 without Gaff module,运算复杂度降低13.6%,参数量降低35.1%;相比SimpleBaseline6方法,运算复杂度降低31.1%,参数量降低45.6%。本文的网络模型相较于HRNet-32 without Gaff module+CPN,网络运算复杂度和参数量分别降低了2 GB和9.8 MB。

表2展示了在MPII数据集上,将以头部作为归一化参数的关键点正确估计的比例PCKh (percentage of correct keypoints based on head)作为评估标准,评估的关键点为头部(Head)、肩部(Sho.)、肘部(Elb.)、腕部(Wri.)、髋部(Hip)、膝部(Knee)、踝部(Ank.),在不同的网络上训练的实验结果。相比于文献[14]提出的CPMs、文献[15]的对抗性PoseNet、文献[16]的PRMs、文献[17]的多尺度结构感知神经网络、文献[18]的DLCM(deeply learned compositional models)和文献[7]的DHRRL(deep high-resolution representation learning)方法,本文提出的GHRCPN网络在MPII数据集上对大部分关键点能获得最好的识别结果,并且平均精度达到了93.4%。这是由于对HRNet-32改进后融入CPN提取了被遮挡部分的关键特征。

表3为在MPII数据集上进行消融实验的结果。将改进得到的Gaff模块融入GhostNet,其平均估计精确度相对于GhostNet without AFF module有0.8%的提升。将改进得到的Gaff模块融入到高分辨率网络HRNet-32,平均估计精确度比无Gaff 模块的HRNet-32平均估计精确度提高了0.6%。而在HRNet-32 with Gaff module 上融入CPN后所得到的网络的平均估计精确度比HRNet-32 without Gaff module和HRNet-32 with Gaff module分别有1.1%和0.5%的提升。

表4为不同遮挡比例下不同网络在3DOH50K数据集上的平均估计精确度(mAP)19。实验结果表明,GHRCPN相比于HRNet-32、CPN、SimpleBaseline-506、文献[20]、文献[21]以及文献[22]中的网络,在不同遮挡比例的情况下mAP都有所提高。这是由于本文网络模型不仅对所提取的特征进行了多尺度融合,而且对被遮挡的关键点进行提取,获得了更丰富和详细的特征信息。

本文提出的网络及文献[6]和[7]的网络在3DOH50K数据集上测试的可视化结果如图10所示。在训练过程中,对人体14个关键点进行检测,分别为头部、颈部、左肩、右肩、左肘、右肘、左手腕、右手腕、左髋、右髋、左膝盖、右膝盖、左脚踝、右脚踝。从图10中可以看到,遮挡比例为60%时,本文的网络才开始出现偏差,而文献[67]中的网络在遮挡比例为10%时,就出现不同程度的偏差。整体来说,本文提出的网络模型具有较高的准确度。

3  结 语

人体姿态估计已经成为当前计算机视觉领域中一个重要的研究领域,然而环境的复杂性使得人体常常面临不同程度的遮挡。本文以高分辨率网络(HRNet-32)作为优化目标网络,提出一种轻量型高分辨率级联金字塔网络。相比于其他的人体姿态估计网络而言,本文提出的网络模型在目标被遮挡下姿态估计精度明显提高,且网络复杂度和参数量有所下降。下一步将会在3D人体姿态估计上对该方法进一步研究,并对模型的性能进行更加深入的评估。

参考文献

[1]

蒲婷婷. 基于骨架结构的三维人体模型检索算法研究[D]. 天津:天津大学,2015. DOI: 10.21698/simi2015 .

[2]

PU T T. Research on 3D Human Model Retrieval Algorithm Based on Skeleton Structure [D]. Tianjin: Tianjin University,2015 (Ch). DOI: 10.21698/simi2015 .

[3]

陶莹, 杨锋, 刘洋, . K均值聚类算法的研究与分析[C]//广西计算机学会2016年学术年会论文集. 南宁:广西计算机学会, 2016: 2-6. DOI: 10.21436/inbom.12382432 .

[4]

TAO YYANG FLIU Yet al. Research and analysis of K-means clustering algorithm [C]// Proceedings of the 2016 Academic Annual Meeting of Guangxi Computer Society. Guangxi: Guangxi Computer Society,2016: 2-6 (Ch) . DOI: 10.21436/inbom.12382432 .

[5]

TOSHEV ASZEGEDY C. DeepPose: Human pose estimation via deep neural networks [C]//2014 IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2014: 1653-1660. DOI:10.1109/CVPR.2014.214 .

[6]

LIN T YDOLLÁR PGIRSHICK Ret al. Feature pyramid networks for object detection[C]//2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2017: 936-944. DOI:10.1109/CVPR.2017.106 .

[7]

NEWELL AYANG K YDENG J. Stacked hourglass Networks for human pose estimation[J]. European Conference on Computer Vision.Cham:Springer2016:483-499. DOI:10.1007/978-3-319-46484-8_29 .

[8]

CHEN Y LWANG Z CPENG Y Xet al. Cascaded pyramid network for multi-person pose estimation[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR). New York: IEEE Press, 2018: 7103-7112. DOI:10.1109/CVPR.2018.00742 .

[9]

SUN KXIAO BLIU Det al. Deep high-resolution representation learning for human pose estimation[C]//2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2019: 5686-5696. DOI:10.1109/CVPR.2019.00584 .

[10]

HAN KWANG Y HTIAN Qet al. GhostNet: more features from cheap operations[C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2020: 1577-1586. DOI:10.1109/CVPR42600.2020.00165 .

[11]

DAI YGIESEKE FOEHMCKE Set al. Attentional Feature Fusion[EB/OL].[2020-09-10].DOI: 10.1109/wacv48630.2021.00360 .

[12]

CHU XOUYANG W LLI H Set al. Structured feature learning for pose estimation[C]// 2016 IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR),2016:4715-4723. DOI: 10.1109/CVPR.2016.510 .

[13]

刘鹏坤, 朱成杰, 张越. 轻量型高分辨率人体关键点检测改进研究[J]. 计算机工程与应用202157(2): 143-149. DOI:10.3778/j.issn.1002-83 31. 2007-0276 .

[14]

LIU P KZHU C JZHANG Y. Research on improved lightweight high resolution human keypoint detection [J]. Computer Engineering and Applications202157(2): 143-149. DOI:10.3778/j.issn.1002-83 31. 2007-0276(Ch ).

[15]

ZHANG T SHUANG B ZWANG Y G. Object-occluded human shape and pose estimation from a single color image[C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) New York: IEEE Press, 2020: 7374-7383. DOI:10.1109/CVPR42600.2020.00740 .

[16]

ANDRILUKA MPISHCHULIN LGEHLER Pet al. 2D human pose estimation: New benchmark and state of the art analysis[C]//2014 IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2014: 3686-3693. DOI:10.1109/CVPR.2014.471 .

[17]

WEI S HRAMAKRISHNA VKANADE Tet al. Convolutional pose machines [C]//2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2016: 4724-4732. DOI:10.1109/CVPR.2016.511 .

[18]

CHEN YSHEN C HWEI X Set al. Adversarial PoseNet: A structure-aware convolutional network for human pose estimation[C]//2017 IEEE International Conference on Computer Vision (ICCV). New York: IEEE Press, 2017: 1221-1230. DOI:10.1109/ICCV.2017.137 .

[19]

YANG WLI SOUYANG W Let al. Learning feature Pyramids for human pose estimation[C]//2017 IEEE International Conference on Computer Vision (ICCV). New York: IEEE Press, 2017: 1290-1299. DOI:10.1109/ICCV.2017.144 .

[20]

KE LCHANG M CQI Het al. Multi-scale structure-aware network for human pose estimation [C]//European Conference on Computer Vision. Cham: Springer,2018:731-746. DOI:10.1007/978-3-030-01216-8_44 .

[21]

TANG WYU PWU Y. Deeply learned compositional models for human pose estimation [C]// European Conference on Computer Vision. Cham: Springer,2018:197-214. DOI:10.1007/978-3-030-01219-9_12 .

[22]

VINYALS OTOSHEV ABENGIO Set al. Show and tell: Lessons learned from the 2015 MSCOCO image captioning challenge[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence201739(4): 652-663. DOI:10.1109/TPAMI.2016.2587640 .

[23]

LI JSU WWANG Z F. Simple pose: Rethinking and improving a bottom-up approach for multi-person pose estimation [J]. Proceedings of the AAAI Conference on Artificial Intelligence202034(7): 11354-11361. DOI:10.1609/aaai.v34i07.6797 .

[24]

NIE Y LLEE J HYOON Set al. A multi-stage convolution machine with scaling and dilation for human pose estimation [J]. KSII Transactions on Internet and Information Systems201913(6):3182-3198. DOI:10.3837/tiis.2019.06.023 .

[25]

LI J FWANG CZHU Het al. CrowdPose: Efficient crowded scenes pose estimation and a new benchmark[C]//2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2019: 10855-10864. DOI:10.1109/CVPR.2019.01112 .

基金资助

贵州省科技计划项目(黔科合 LH字[2016]7429号)

AI Summary AI Mindmap
PDF (3373KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/