多尺度特征融合的轻量化二维人体姿态估计方法

刘鑫 ,  刘峰 ,  封宗寰 ,  郭一娜

吉林大学学报(工学版) ›› 2026, Vol. 56 ›› Issue (5) : 1418 -1429.

PDF (8705KB)
吉林大学学报(工学版) ›› 2026, Vol. 56 ›› Issue (5) : 1418 -1429. DOI: 10.13229/j.cnki.jdxbgxb.20241045
计算机科学与技术

多尺度特征融合的轻量化二维人体姿态估计方法

作者信息 +

A lightweight two-dimensional human pose estimation method with multi-scale feature fusion

Author information +
文章历史 +
PDF (8913K)

摘要

针对目前现有的人体姿态估计方法处理复杂场景时为了达到较高检测准确性而忽略终端设备计算负载的问题,提出一种轻量化的双路径多尺度特征融合姿态估计网络模型。首先,该模型以Litepose为基础网络结构,增加高分辨率分支,结合多重扩张瓶颈卷积(Multi-dilated block,MDBlock)构成瓶颈块进行特征提取,尽可能保留原有的细节信息。其次,通过构建轻量高效的特征提取单元,在此过程中提出了多支路有效多尺度注意力机制(Multi-branch efficient multi-scale attention,MEMA),增强网络对于不同区域的信息关注。最后,在最终反卷积上采样操作后设计了一种双池化注意力融合机制,能同时关注全局和局部通道特征信息,实现通道间特征的强融合。实验结果证明:在COCO2017和更具挑战的CrowdPose数据集上,本文方法相较于Litepose方法仅增加少量的计算量和参数量,平均预测准确度(mAP)分别提高了7.6%、4.4%。

Abstract

The existing human pose estimation methods ignore the calculation load of terminal device to achieve high detection accuracy when dealing with complex scenes and multi-objective tasks. To address the issues, this paper proposes a lightweight dual-path multi-scale feature fusion pose estimation network model. The model adds a high-resolution branch to the Litepose network and combines multiple dilation-based bottleneck convolutions (Multi-dilated Block, MDBlock) to form a bottleneck block for feature extraction, while preserving as much detail information as possible. Secondly, by constructing a lightweight and efficient feature extraction unit, a multi-branch efficient multi-scale attention mechanism (MEMA) is proposed, which enhances the network's attention to different regions. After the final up-sampling operation, a dual pooling attention feature fusion mechanism is designed. It can simultaneously pay attention to global and local channel feature information and achieve strong feature fusion. Experimental results show that the proposed method, compared with the Litepose method, only incurs a small increase in computational cost and parameter count on the COCO2017 database and a more challenging database CrowdPose. The average mAPs on these two databases are improved by 7.6% and 4.4%, respectively.

Graphical abstract

关键词

信号与信息处理 / 人体姿态估计 / 轻量化 / 多分辨率 / 多尺度 / 注意力机制

Key words

signal and information processing / human pose estimation / lightweight / multiple resolution / multiscale / attention mechanism

引用本文

引用格式 ▾
刘鑫,刘峰,封宗寰,郭一娜. 多尺度特征融合的轻量化二维人体姿态估计方法[J]. 吉林大学学报(工学版), 2026, 56(5): 1418-1429 DOI:10.13229/j.cnki.jdxbgxb.20241045

登录浏览全文

4963

注册一个新账户 忘记密码

0 引 言

近年来,姿态估计任务作为计算机视觉领域的研究热点之一12,其目标主要是获取场景中的人体关节点坐标信息,在人机交互、视频监控、动作识别、动画制作和自动驾驶等领域有着广泛的应用。在人体姿态估计任务中,与坐标回归方法相比3,热图回归方法考虑多个关节点之间的位置依赖关系生成人体关键点热图45,对于复杂场景中存在遮挡、相似动作等情况通常能提供更可靠的姿态估计结果。其中,基于热图回归的姿态估计算法中应用最广泛的有OpenPose6,HRNet7等模型。OpenPose是一种自底向上的热图回归方法,是一种基于caffe框架的神经网络开源库,通过计算图像中每个关节热图对应的亲和域和置信度构成对应人体的关节连接向量。HRNet是一种自顶向下的并行多分辨率分支网络架构,通过不同分支特征之间交换融合增强了网络对于位置信息的感知,实现姿态估计的高分辨率热图表示。

对于复杂场景,如小目标估计、不同光照环境以及存在遮挡,目前现有的基于深度学习的姿态估计方法8在保证识别精度情况下模型参数量大、网络模型结构复杂,这对于计算资源有限的工程应用,尤其是模型训练和算法部署都提出了更大的挑战。Kim等9提出一种通过OpenPose获取的三维人体骨骼数据对人体工学姿态进行RULA/REBA打分的评估方法,该方法对于实验室条件下正面姿态有较好的效果,但在非正向人体和图像分辨率较低的情况会影响检测效果;Xu等10提出了一种基于置信度的多视角人体姿态识别方案,通过OpenPose提取人体图像关键骨骼点,采用YOLOv5识别系统识别人体姿态;孟彩霞等11提出一种融合注意力机制的OpenPose人体跌倒检测算法DSC-OpenPose,借鉴稠密网络思想,实现特征复用。通过引入注意力机制或置信度分析能在一定程度上提高姿态检测准确性,但对于多目标检测、存在遮挡以及不同光照环境等复杂场景下OpenPose模型精度不高,并且识别准确率严重依赖高算力设备。

近年来备受关注的HRNet7采用高分辨率特征表示和多分支并行结构虽然能获得比较出色的检测结果,但同时也显著增加了模型参数的数量,导致将它们直接部署在资源受限的终端设备上变得极具挑战性。针对这一问题,一些研究者已开展了相关的模型轻量化的优化研究。Wang等12提出的Small HRNet减小了网络的深度和宽度,但平均检测准确度降低了将近20%;Yu等13提出Lite-HRNet模型,通过应用ShuffleBlock14实现通道分组和混洗操作,降低计算量,并逐层融合不同分辨率的特征图以保持多尺度特征表示能力。虽然Lite-HRNet在轻量化方面表现出色,但相比于原始的HRNet,在一些诸如小个体、遮挡、背景干扰等复杂任务中会出现精度下降的情况。Wang等15提出的LitePose使用MobileNetV216中的倒残差结构(Inverted Residuals)和线性瓶颈层(Linear Bottleneck)替换标准卷积层,减少计算量和参数量。但该模型在下采样过程由于卷积核大小固定和分辨率降低等原因会使得高分辨率检测任务中位置信息和局部细节信息丢失,而降低检测准确率。现有的轻量化方法通常是使用轻量化模块替换标准卷积层,或者使用通道剪枝和权重量化等方法,虽然达到了减少参数和降低复杂度的目的,但特征信息的丢失导致轻量化网络无法有效地捕捉到远距离的上下文依赖关系和小目标关键坐标信息,模型的预测精度也随之降低。

为解决目前复杂场景下人体姿态估计存在模型复杂度和检测准确率之间失衡的问题,本文以LitePose为基础框架提出了一种轻量级双路径多尺度特征融合人体姿态估计模型。该方法在充分考量降低计算量与复杂度的前提下,致力于保证识别的准确性。(1)模型结构增加一条结合坐标注意力(Coordiate attention)17的高分辨率分支,以解决在下采样过程中的位置信息和局部细节信息丢失问题,同时引入多重扩张瓶颈卷积(Multi-dilated Block,MDBlock)18和多个卷积层串联以获取更深层全局特征。(2)在多分辨率分支各阶段下采样过程中,构建一个新的多重关注模块(Multi-attention block,MABlock)。通过引入多重扩张的有效多尺度注意力机制(Multi-dilated efficient multi-scale attention,MEMA),可以掌握长短距离特征信息交互和通道间特征信息交互,对通道信息进行编码获得权重信息以动态调整各通道的重要性,而且将精确的空间结构信息保留到通道中。(3)双路径特征提取结束后构建一个双池化注意力特征融合机制(Dual pooling attention feature fusion,DP-AFF),DP-AFF通过内部两个不同池化核分支自适应分配权重并聚合为高分辨率输出,通过提升重要特征在融合过程中的权重,抑制低质量特征或冗余特征的影响,让模型更关注重要的特征信息,从而获得更准确的高分辨率特征图用于预测像素级关键点坐标位置,增强模型的泛化性和鲁棒性。

1 本文方法

1.1 网络模型

为兼顾不同场景下人体姿态检测准确性与模型复杂度,本文提出的网络模型以LitePose作为基础网络结构,在加入高分辨率分支的同时对输入数据进行预处理后主要进行4个阶段。第1阶段仅存在一个最高分辨率分支,后续的3个阶段中在每个阶段的初始会由当前阶段内最低分辨率分支进行下采样生成一个新分支,第4阶段结束后生成的最低分辨率特征图与第3阶段所得到的分辨率特征图合并后经过反卷积再与前一阶段分支得到的特征图合并,连续执行3次后,得到的特征与高分辨率分支特征共同输入双池化注意力特征融合模块(DP-AFF)输出最高分辨率特征图,用于预测关键点,其整体网络结构如图1所示,图中各阶段bottleneck具体组成如表1所示。

阶段1~4由一个MABlock和多个倒残差结构组成,每个阶段分别进行下采样,深度特征提取等工作。输入图片经预处理后输出初级特征,经过MABlock进行下采样,特征图分辨率减少1/2,通道数增加,再由多个MobileNetV2的倒残差结构提取更深层次特征,在上采样阶段采用反卷积融合不同分辨率的特征图,使得融合后特征图分辨率与上一阶段特征图分辨率一致,在获得最高分辨率后与最高分辨率分支得到的特征通过DP-AFF得到最终的特征图。本文方法保留最高分辨率特征分支并引入多重扩张瓶颈模块捕获全局和局部特征从而能更准确表征关键点坐标的像素级位置信息,在实验中也体现了这一设计对检测性能的影响。

1.2 数据预处理模块

HRNet结构中数据预处理模块仅通过串联两层3×3的卷积对特征图进行变换,在一定程度上会导致细节信息的模糊化。在LitePose方法中通过在Stem模块中串联一层3×3的卷积和一层深度可分离卷积,该方法使用深度可分离卷积替换HRNet中第二层3×3卷积,降低了模型的参数量和计算复杂度,但这可能会导致信息通道间的交互受限,无法充分捕捉到复杂的细节特征,从而导致模型的准确性下降。本文设计了一个结合多重扩张瓶颈卷积的数据预处理模块,如图2所示,其中的多重扩张瓶颈卷积模块MDBlock通过具有不同空洞率(分别为0,1,2)的三个并行支路进行深度可分离卷积,提取不同感受野的特征信息,将特征合并后可得到完整的全局信息,MDblock具体结构如图3所示。本文基于模型轻量化设计同时兼顾姿态估计的准确性,添加的多重扩张瓶颈卷积在卷积过程中通过扩大感受野关注更丰富的局部细节和更大范围的上下文信息,通过多尺度感受野学习到更具鲁棒性的特征表示以更好地保留图像中的细节和结构信息,提高特征的丰富度和准确性,网络可以更好地理解图像的内容,从而提升模型在人体姿态估计任务中的性能。

1.3 多分辨率结构

针对Litepose结构中存在的位置信息丢失、细节特征模糊以及忽略全局上下文信息的问题,本文设计了一个多尺度多分辨率网络结构,其由高分辨率分支和次分辨率分支组成。其中,高分辨率分支由4组瓶颈块(Bottleneck)串联而成,每组Bottleneck构成如图4所示。高分辨率分支解决了下采样操作带来的细节信息模糊化问题,并且通过加入MDBlock扩大感受野以关注不同尺度的全局和局部信息,为后续的特征融合模块实现较好的特征信息补充。

次分辨率分支主要在提取深度特征方面为模型提供强大基础,本文方法构建一个新的MABlock替换原先的下采样Basic Block,结构如图5所示。Basic Block是在MobileNetV2的基础上,由下采样操作,3×3深度可分离卷积和1×1点卷积构成。本文提出MABlock能在兼顾模型轻量级的情况下获取更多尺度特征信息。首先,通过点卷积和深度卷积对特征图进行通道压缩降低所需的计算量和参数量,随后将特征输入MEMA注意力,先经过特征分组,再将分组后的特征输入并行子分支结构进行跨通道间的信息交互和跨空间学习以尽可能减少下采样过程中的特征丢失问题,输出的跨空间特征图具有更强的局部和全局的信息捕获能力。

1.3.1 MEMA注意力机制

MEMA注意力由特征分组、并行子结构和跨空间学习组成,结构如图6所示。特征分组后每组只需关注部分通道,不仅减少了每个卷积所需的参数量,还能学习分组特征支路通道间的关联信息。并行子结构有助于网络避免更多的顺序处理以及深度卷积,从而达到节省计算资源的目标。跨空间学习将不同空间维度方向的跨空间信息聚合,达到特征增强的作用。MEMA注意力主要是通过将分组后的特征图输入并行子分支,再经过跨空间学习获得不同尺度的空间信息交互特征。

特征分组。输入特征图XRC×H×W,MEMA首先将X在通道维度划分成G个子特征,划分后的通道数为c=C/G,特征分组可定义为X=X0,X1,Xi,,XG-1,XiRc×H×W,用于学习不同的语义特征。在一般情况下分组数G<<C,实验中将G设置为3。

并行子分支。在MEMA中并行子分支可分为1×1卷积分支和多重扩张瓶颈卷积分支,1×1卷积分支通过全局平均池化层,分别沿着水平和垂直方向生成两个一维向量。两个一维向量分别表示特征图在水平、垂直方向上的全局信息,通过一个共享的卷积层,生成两个新的特征图。使用两个非线性Sigmoid函数拟合线性卷积上的二维二项分布,分别得到水平和垂直方向上的注意力权重,采用逐元素相乘的方式,将注意力权重应用到分组后的输入特征图上。多重扩张瓶颈卷积分支通过不同空洞率的深度可分离卷积聚合多尺度空间结构特征信息和扩大多层次感受野。具体步骤如下,通过合并改变扩张率的3×3内核捕获扩大感受野的多尺度特征表示,多重扩张瓶颈卷积分支通过3个并行的3×3深度可分离卷积,膨胀因子分别为1、2、3,该分支能有效构建短期和长期的依赖关系且能保留更多重要细节特征信息。在并行子分支后,通过将两分支所得到的特征输入跨空间学习提高特征表征能力。

跨空间学习。近年来,得益于跨空间学习在通道和空间位置之间建立相互依赖关系的能力,因此本文未使用传统的聚合方法,而是采用了将不同空间维度方向的信息聚合的方法,以获取更丰富的特征。在跨空间学习过程中,引入两个张量,其中一个是1×1分支的输出,另一个是多重扩张瓶颈卷积分支。然后,利用二维全局平均池化在1×1分支的输出中编码全局空间信息,二维全局平均池化公式为:

zc=1H×WjHiWxci,j

式中:xci,j为输入特征图中位置i,j的值;HW分别为特征图的高度和宽度;zc为池化后的输出值。

多重扩张瓶颈卷积分支的输出在通道特征的矩阵乘法操作之前转换为相应的维度形状R11×c×R3c×H×W。通过并行处理得到的输出做矩阵乘法,得出第一个空间注意力图,它在同一阶段收集不同尺度的空间信息。此外,同样利用2D全局平均池化对多重扩张瓶颈卷积分支中的全局空间信息进行编码,并且1×1分支在通道特征的矩阵乘法操作之前转换为相应的维度形状R31×c×R1c×H×W,之后,得到第二个空间注意力图,它保留了准确的全局空间位置信息。最后,各分支的输出特征图被计算为两个生成的空间注意力权重值的聚合,经过Sigmoid函数赋值给最初输入的特征张量。经过MEMA得到的最终输出与输入特征图 X 尺寸大小相同,通过两个分支之间的跨空间学习,捕获像素级成对关系并突出显示所有像素的全局上下文信息,促使模型学习到更丰富、更有区分性的特征表示。

提出的MEMA注意力机制通过按通道进行特征分组降低了计算量和参数量,同时提升网络效率。通过不同空洞率增强特征的表达能力,更好地捕捉到不同通道特征间的内在联系和依赖关系。并行子分支结构模型可以同时学习多个特征表示,并将它们进行组合或融合,以实现跨通道间的信息交互,从而提取更丰富的特征表示。再通过采用跨空间信息聚合方法,增强特征的语义一致性和上下文感知能力,并将精确位置信息嵌入注意力模块中。

1.4 双池化注意力特征融合模块(DP⁃AFF)

相比于简单的求和操作方法,本文提出了一种多颗粒度聚合的注意力特征融合机制DP-AFF,结构如图7所示。受注意力特征融合AFF19启发,使用双池化注意力模块(Dual pooling attention model,DPAM),对融合的两个输入特征计算全局和局部通道特征,聚合后得到多尺度通道权重,计算公式如下:

M1=PWConv(PWConv(GAP(F)))
M2=PWConv(PWConv(GMP(F)))
Mc=Sigmoid(M1+M2)

式中:M1M2分别为全局和局部通道权重;Mc为最终输出权重,3种权重均是0到1范围内的实数;PWConv()为逐点卷积;GAPGMP分别为全局平均池化和全局最大池化。

考虑到场景中小个体目标所带来的难识别问题,在双池化注意模块中使用不同大小池化核的两个分支提取通道注意力权重,其核心思想是通过改变空间池化大小适应目标大小及场景变化,其中全局平均池化支路提取全局特征信息,全局最大池化支路提取局部特征信息,可以在更细粒度的层次上进行权重分配。通过点卷积沿通道维度聚合多尺度上下文信息,提高网络在多场景下目标识别的泛化能力。

具体融合过程如图7所示,特征图X,YRC×H×WX 为具有较大感受野的高分辨率分支输出特征, Y 为次分辨率分支反卷积聚合特征。DP-AFF可以表示为:

Z=McXYY+1-McXYX

式中:Z为融合特征;表示元素求和,融合双池化注意力输出权重McXY取值范围在0和1之间,同理1-McXY也是如此。

融合网络能在 XY 之间进行软选择(帮助创建更平滑的特征过渡,提高模型的整体性能)或者加权平均。

3 实验设计

3.1 评估数据集

COCO201720人体姿态估计数据集由16.4万张图像组成,包含25万个人体样本,每个样本按照指定顺序标注17个关键点,包括5个面部标志和12个身体关节,其中所有关键点都标注了3个值:x坐标、y坐标和可见性标志。数据集划分训练/验证/测试集,分别包含118 000、5 000和41000张图像。COCO2017数据集中的图像场景丰富,人体目标的大小存在差异,遮挡和复杂背景,是目前主流的人体姿态估计数据集。

CrowdPose21由2万张图像组成,包含约8万个人体样本,并标记有14个关键点,其中所有关键点都标注了3个值:x坐标、y坐标和可见性标志,与COCO2017数据集不同,CrowdPose包含更多拥挤的场景,对姿势估计方法提出了更多挑战。数据集分别包含10 000、2 000和8 000张图像作为训练集,验证集和测试集。

数据预处理包括数据增强和归一化操作。其中,数据增强包括随机旋转[-30°,30°]、随机缩放[0.75,1.5]、随机平移[-40,40]和翻转。由于数据集中的图像大小不同,在数据增强操作后统一将数据集图像尺寸裁剪为256×256。

本文使用的实验平台为Ubuntu18.04LTS,CPU为i9-10850k,GPU为RTX3080,深度学习框架为Pytorch1.10.1,软件平台为Python3.8。在CrowdPose和COCO2017数据集上,batchsize为32,模型训练epochs设置为500。在整个训练过程中,学习率动态可调,初始学习率设置为10-3,在第350和480 个epoch对学习率分别降至10-4和10-5

3.2 实验与分析

在人体姿态估计领域所使用的评价指标是关键点相似度(Object keypoint similarity,OKS):

OKS=iexp-di/2s2ki2δ(vi>0)iδ(vi>0)

式中:di为检测到的关键点与其对应真实标记位置之间的欧氏距离;vi为关键点i的可见性标志;s为目标尺度;ki为归一化参数,通常是给出一个常数;δ(*)为一个二元变量,如果条件*为真,则取值为1,否则取值为0,表示关键点是否被标记。

OKS指标采用0~1间的值,值为1时表示完美的预测,根据OKS的取值,可以得到标准平均精度mAP(OKS=0.5,…,0.95等10个预测准确度均值)、AP50(OKS=0.50时的预测准确度)和AP75(OKS=0.75时的预测准确度)作为检测指标。

mAP=110t=0.500.95AP(t)

为验证本文方法的性能,分别在CrowdPose、COCO2017两个数据集上与当前主流的人体姿态估计方法进行对比分析,采用参数量、计算量以及由关键点相似度计算得到的平均准确度等指标衡量算法性能。衡量轻量化指标有GFlops、乘法累加(MACs)以及参数量,GFlops用于衡量模型在浮点运算方面的计算复杂度,MACs是数学计算中的基本运算,包括矩阵乘法、卷积和深度学习中常用的张量运算。

在COCO2017数据集上展开实验,其结果如表2所示。当输入图像尺寸为256×256,本文方法展现出了61.2%的检测精度。与当前现有的轻量级网络进行对比,本文方法在参数量与检测准确率这两个关键指标上,均呈现出良好的性能表现。与经典的YOLOv5相比,其输入尺寸为960×960,尽管本文方法的平均检测准确率略有降低,幅度为2.6百分点,但在参数量与计算量方面却实现了显著优化,其参数量降低约82%。与经典HRNet相比,在其输入尺寸为512×512情况下,本文方法参数量与计算量均成倍下降,检测准确率控制在可接受范围内。

与OpenPose相比,本文方法与其检测准确率相当,但MACs下降了近69%。与模型DEKR相比,本文方法在参数与计算量上分别降低了将近91%与94%。本文方法与LitePose-s计算成本相当且检测准确率提升4.4百分点。而与性能表现出色的DEKR和YOLOv5方法相比,本文方法在降低计算成本方面成效显著,彰显出其在平衡计算资源与性能表现上的独特优势。一般来说,GFLOPs指标下降有利于模型部署在资源受限,且对实时性要求高的场景。较低的MACs表明模型在运行过程中与内存的交互次数较少,降低功耗,减少散热,以便更好地适应内存带宽受限的环境。参数量少的模型所需的训练时间少,成本也更低。

图8是本文方法与HigherHRNet和YOLOv5这两种具有代表性的方法在不同场景下的可视化检测结果,可以看出,在小目标检测任务中,YOLOv5在小臂部位存在关键点漏检问题;在图像中有遮挡情况下,HigherHRNet对有遮挡的手腕关节出现误检。本文方法在弱光照场景下,相较于另外两种方法存在头部细节关键点检测缺陷。在光照不均匀场景下,3种方法检测效果无明显差别。

此外,在CrowdPose数据集还开展了拥挤场景性能分析,分别记录参数量、GFLOPs、MACs和检测准确率,结果如表3所示。当输入尺寸为256×256时,本文方法mAP为56.2%。相较于输入尺寸为512×512的Scaled-HigherHRNet-W16与输入尺寸为416×416的EfficientHRNet-H-3这两种轻量化方法,平均检测准确率分别提升5.8百分点和10.1百分点。计算量(GFLOPs)仅为Scaled-HigherHRNet-W16的十分之一,模型参数量分别减少5.49M和3.59M,内存访问次数(MACs)分别降低约11.13G与2.93G。与RTMPose-m26、SRPose27等输入图像尺寸256×192的最新轻量化方法相比,本文方法的平均检测准确率虽略有下降。然而,对于GFlops和MACs,均优于上述方法,同时,本文方法的参数量相较于上述方法,分别降低近87%、93%。在输入尺寸大致相同的情况下提出方法检测准确率虽低于HRNet近11百分点,但参数量仅为其百分之六,GFlops和MACs均下降了80%以上。

3.3 消融实验

为验证提出网络架构各模块间组合对模型整体性能的影响,在CrowdPose数据集上对4种模型结构进行消融实验。从表4可以看出,添加各功能模块后,整体参数量较基线模型没有明显增加,其中模型1在原LitePose基础网络上添加一条结合坐标注意力的高分辨分支后,检测准确率提高了2.6,MACs以及GFlops指标略有增加。模型2在模型1的基础上采用MABlock作为Basic block,通过扩大感受野和增强跨空间信息交互,模型2的检测准确度比模型1提高2百分点,运算复杂度没有明显增加。模型3在Stem模块中加入MDBlock对数据进行预处理,mAP提升0.4百分点。模型4在模型3的基础上,用DP-AFF融合模块替代简单的直接求和操作。在仅增加少量计算量和复杂度的前提下,准确率提升了0.8。通过对这一系列模型的分析可知,本文方法中每个模块都对模型性能提升起到了积极作用。当将这4个模块相结合后,评估指标mAP达到了56.2%,充分证明了各模块协同工作对提升模型整体性能的有效性。

3.4 可视化结果

图9为本文模型在拥挤、遮挡、小目标人物以及不同光照背景等具有挑战性场景下的可视化效果图。通过对这些结果的深入分析可知,模型的泛化性能得到了有力验证。具体而言,在上述多种复杂场景中,模型均能精准定位人体关键点,进而准确推断出正确的姿势信息。这表明模型在面对多样化且具有挑战性的场景时,展现出了良好的适应性和有效性,为其在实际应用中的可靠性提供了重要支撑。

3 结束语

本文针对复杂场景下姿态估计任务中如何在有限的资源条件下达到更高检测精度的问题,设计一种轻量级双路径多尺度特征融合人体姿态估计模型。通过保留高分辨率分支信息和提取多尺度特征,并在不同分辨率特征提取支路中设计具有跨通道特征学习的MABlock解决下采样过程中细节特征丢失严重的问题。在特征图输出阶段融合具有自适应权重的细颗粒度特征信息,最终输出语义信息更加丰富的高质量热图,从而实现更加精准的人体姿态估计效果。通过在COCO2017和CrowdPose两个公开数据集上进行验证,实验结果表明:本文方法在轻量级人体姿态估计中取得了较好的结果,模型的参数量、复杂度相比目前轻量化模型具有较大优势的基础上网络仍能获得较为准确的关键点位置信息。

参考文献

[1]

Liu W, Bao Q, Sun Y, et al. Recent advances of monocular 2D and 3D human pose estimation: a deep learning perspective[J]. ACM Computing Surveys, 2022, 55(4): 550480.

[2]

孙志勇, 李宏友, 叶俊勇. 基于弱监督迁移网络的3D人体关节点识别[J]. 吉林大学学报: 工学版, 2024, 54(1): 251-258.

[3]

Sun Zhi-yong, Li Hong-you, Ye Jun-yong. 3D human joint point recognition based on weakly supervised migration networks[J]. Journal of Jilin University (Engineering and Technology Edition), 2024, 54(1): 251-258.

[4]

Geng Z, Sun K, Xiao B, et al. Bottom-up human pose estimation via disentangled keypoint regression[C]∥Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, Nashville, USA, 2021: 14676-14686.

[5]

Qi Y F, Zhang H R, Liu J. More accurate heatmap generation method for human pose estimation[J]. Multimedia Systems, 2024, 30(4): 180.

[6]

王宇, 赵凯. 基于亚像素定位的人体姿态热图后处理[J]. 吉林大学学报: 工学版, 2024, 54(5): 1385-1392.

[7]

Wang Yu, Zhao Kai. Post-processing of human posture thermograms based on sub-pixel localization[J]. Journal of Jilin University (Engineering and Technology Edition), 2024, 54(5): 1385-1392.

[8]

Cao Z, Simon T, Wei S, et al. Realtime multi-person 2d pose estimation using part affinity fields[C]∥Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, Honolulu, USA, 2017: 7291-7299.

[9]

Sun K, Xiao B, Liu D, et al. Deep high-resolution representation learning for human pose estimation[C]∥Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, Long Beach, USA, 2019: 5693-5703.

[10]

郝鹤菲, 张龙豪, 崔洪振, . 深度神经网络在人体姿态估计中的应用综述[J]. 计算机工程与应用, 2025, 61(9): 41-60.

[11]

Hao He-fei, Zhang Long-hao, Cui Hong-zhen, et al. Deep neural networks in human pose estimation: a systemic review[J]. Computer Engineering and Applications, 2025,61(9): 41-60.

[12]

Kim W, Sung J, Saakes D, et al. Ergonomic postural assessment using a new open-source human pose estimation technology(openpose)[J]. International Journal of Industrial Ergonomics, 2021, 84: 103164.

[13]

Xu M, Guo L, Wu H. Robust abnormal human-posture recognition using openpose and multiview cross-information[J]. IEEE Sensors Journal, 2023, 23(11): 12370-12379.

[14]

孟彩霞, 薛洪秋, 石磊, . 融合注意力机制的OpenPose人体跌倒检测算法[J]. 计算机辅助设计与图形学学报, 2024, 36(12): 2040-2050.

[15]

Meng Cai-xia, Xue Hong-qiu, Shi Lei, et al. Openpose human fall detection algorithm based on attention mechanism[J]. Journal of Computer-Aided Design & Computer Graphics, 2024, 36(12): 2040-2050.

[16]

Wang J, Sun K, Cheng T, et al. Deep high-resolution representation learning for visual recognition[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2020, 43(10): 3349-3364.

[17]

Yu C, Xiao B, Gao C, et al. Lite-hrnet: a lightweight high-resolution network[C]∥Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, Nashville, USA, 2021: 10440-10450.

[18]

Ma N, Zhang X, Zheng H T, et al. Shufflenet v2: practical guidelines for efficient cnn architecture design[C]∥Proceedings of the European Conference on Computer Vision, Munichi, Germany, 2018: 116-131.

[19]

Wang Y, Li M, Cai H, et al. Lite pose: efficient architecture design for 2d human pose estimation[C]∥Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, New Orleans, USA, 2022: 13126-13136.

[20]

Howard A G. Mobilenets: efficient convolutional neural networks for mobile vision applications[J]. Arxiv Preprint, 2017,arXiv:

[21]

Hou Q, Zhou D, Feng J. Coordinate attention for efficient mobile network design[C]∥Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, Nashville, USA, 2021: 13713-13722.

[22]

Samadh J H A, Khatib S K A. To perceive or not to perceive: lightweight stacked hourglass network[J]. Arxiv Preprint, 2023,arXiv:

[23]

Dai Y, Gieseke F, Oehmcke S, et al. Attentional feature fusion[C]∥Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision, Waikoloa, USA, 2021: 3560-3569.

[24]

Lin T, Maire M, Belongie S, et al. Microsoft coco: common objects in context[C]∥13th European Conference on Computer Vision, Zurich, Switzerland, 2014: 740-755.

[25]

Li J, Wang C, Zhu H, et al. Crowdpose: efficient crowded scenes pose estimation and a new benchmark[C]∥Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, Long Beach, USA, 2019: 10863-10872.

[26]

Cheng B, Xiao B, Wang J, et al. Higherhrnet: scale-aware representation learning for bottom-up human pose estimation[C]∥Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, Seattle, USA, 2020: 5386-5395.

[27]

Xu Y, Zhang J, Zhang Q, et al. Vitpose: simple vision transformer baselines for human pose estimation[J]. Advances in Neural Information Processing Systems, 2022, 35: 38571-38584.

[28]

Geng Z, Sun K, Xiao B, et al. Bottom-up human pose estimation via disentangled keypoint regression[C]∥Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, Nashville, USA, 2021: 14676-14686.

[29]

Maji D, Nagori S, Mathew M, et al. Yolo-pose: enhancing yolo for multi person pose estimation using object keypoint similarity loss[C]∥Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, New Orleans, USA, 2022: 2637-2646.

[30]

Jiang T, Lu P, Zhang L, et al. Rtmpose: real-time multi-person pose estimation based on mmpose[J]. Arxiv Preprint, 2023, arXiv:

[31]

Wang H, Liu J, Tang J, et al. Lightweight super-resolution head for human pose estimation[C]∥Proceedings of the 31st ACM International Conference on Multimedia, Ottawa, Canada, 2023: 2353-2361.

[32]

Lu P, Jiang T, Li Y, et al. Rtmo: towards high-performance one-stage real-time multi-person pose estimation[C]∥Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, Seattle, USA, 2024: 1491-1500.

基金资助

国家自然科学基金项目(62271341)

山西省高等学校教学改革创新项目(J20240994)

AI Summary AI Mindmap
PDF (8705KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/