基于改进机器学习的人体运动姿态精准估计

张翔 ,  孙婷婷

吉林大学学报(工学版) ›› 2026, Vol. 56 ›› Issue (5) : 1399 -1406.

PDF (1844KB)
吉林大学学报(工学版) ›› 2026, Vol. 56 ›› Issue (5) : 1399 -1406. DOI: 10.13229/j.cnki.jdxbgxb.20241162
计算机科学与技术

基于改进机器学习的人体运动姿态精准估计

作者信息 +

Accurate estimation of human motion posture based on improved machine learning

Author information +
文章历史 +
PDF (1887K)

摘要

针对人体非刚体运动姿态估计易陷入局部最优、估计准确率偏低的问题,提出了一种基于改进机器学习的人体运动姿态精准估计方法。该方法将人体三维坐标及各个方向关键点作为关键特征,确定人体运动姿态特征,从而在更高层次中对人体姿态进行估计与识别;采用粒子群优化算法优化机器学习中卷积神经网络的各层权值和偏置,同时引入免疫机制避免寻优陷入局部最优;依据得到的最优权值和偏置实现卷积神经网络改进,将人体运动姿态特征输入改进后的卷积神经网络,得到精准的估计结果。实验结果表明,该方法提取的特征具有良好的代表性和可靠性,最终实现的人体运动姿态估计关键点能够全面覆盖姿态图像,整体估计准确率高,实际应用效果好。

Abstract

Aiming at the problems that local optima are easily trapped in and low estimation accuracy is achieved in the pose estimation of human non-rigid body motion, an accurate human motion pose estimation method based on improved machine learning was proposed. Three-dimensional coordinates and multi-directional key points of the human body were adopted as core features to characterize human motion postures, and high-level estimation and recognition of human postures were realized. The weights and biases of each layer of the convolutional neural network in machine learning were optimized via the particle swarm optimization algorithm, and an immune mechanism was introduced to prevent the model from falling into local optima.With the acquired optimal weights and biases, the convolutional neural network was modified. The features of human motion postures were fed into the improved network, and accurate estimation results were obtained. The experimental results show that the features extracted by the proposed method are representative and reliable, and the key points of human motion pose estimation can comprehensively cover the pose image. The accuracy of human motion pose estimation is high, and the practical application effect is good.

Graphical abstract

关键词

改进机器学习 / 人体运动姿态 / 精准估计 / 卷积神经网络 / 粒子群优化算法 / 免疫机制

Key words

improving machine learning / human movement posture / accurate estimation / convolutional neural network / particle swarm optimization algorithm / immune mechanism

引用本文

引用格式 ▾
张翔,孙婷婷. 基于改进机器学习的人体运动姿态精准估计[J]. 吉林大学学报(工学版), 2026, 56(5): 1399-1406 DOI:10.13229/j.cnki.jdxbgxb.20241162

登录浏览全文

4963

注册一个新账户 忘记密码

0 引 言

人体运动姿态估计作为计算机视觉领域的一个重要研究方向,近年来在学术界和工业界均受到了广泛关注。其核心任务是从图像或视频中解算人体运动空间、时间上的姿态变化,在游戏设计的动作捕捉、体育训练分析等过程中具有重要的应用价值1。通过精准估计人体运动姿态,能够有效评估人体的运动能力,通过分析人体运动技术动作,能够发现姿态存在的潜在问题,对于推动人体运动识别技术的发展具有重要意义2

当前人体姿态估计技术已经取得了显著进展,例如朱丽萍等3构建了多样化的运动场景和姿态的人体姿态数据集,通过图像缩放、归一化、标注处理等流程实现人体姿态数据预处理,通过深度学习模型提取图像多尺度特征。在识别模型中引入改进的并行注意力模块,增强模型对人体关节点的关注度,减少背景或遮挡物的干扰,通过并行计算优化模型性能,结合目标检测算法对多个人体运动姿态进行精准估计。但是该方法主要获取的仅是低层次特征信息,导致后续估计结果与实际差距较大。吕衡等4从视频序列中提取每一帧的人体运动姿态图像数据,并对图像中的关节点进行定位,从而确定其空间位置信息。应用编码器分析每个关节点的空间位置及在时间序列中的变化,引入注意力机制学习关节间复杂交互关系,将单帧内关键点的空间信息与时间序列上的动态变化信息相结合,形成关节点的时空特征表示,结合学习到的时空特征,对未来帧中的人体姿态进行估计。但是时空特征属于低层次特征信息,因此该方法不能利用更高级别的特征进行姿态估计。马骁等5对采集的人体运动图像进行标准化处理,利用多尺度时空关联特征和Transformer模型捕获人体图像在时序上的动态变化。采用可形变卷积构建空间特征残差融合模块,增强对人体复杂外形的适应性。结合所提取的时空特征进行人体关键点的检测和定位,以此得到相关的姿态估计结果。但是该方法所使用的特征层次比较低,难以确定目标的关键特征,导致后续的姿态估计精度下降。Cui等6利用毫米波雷达采集人体运动姿态数据,先通过滤波、去噪等预处理操作优化数据质量,再从处理后的数据中提取关节候选位置、运动轨迹等姿态特征。研究首先借助神经网络完成人体关节位置的初步估计,再结合关节间的相对距离、夹角等空间关联特征对结果进行优化;同时引入帧间时间相关性分析,利用连续视频帧信息平滑姿态输出,有效提升了模型的实时性和检测精度。但该方法仅选用关节候选位置、运动轨迹这类简单特征,特征维度较为单一,导致最终人体姿态估计的精度存在局限。

为解决上述方法由于特征层次比较低导致算法容易陷入局部最优的问题,本文提出了一种基于改进机器学习的人体运动姿态精准估计方法。改进机器学习模型在处理海量人体运动姿态数据中具有良好优势,通过有效降低数据维度,提取人体运动姿态数据中的关键信息,通过自适应判断能够提高人体运动姿态估计的准确性78,以期为人体运动姿态研究领域提供良好的技术支持。

1 人体运动姿态精准估计方法

1.1 人体运动姿态特征提取

人体运动姿态数据具有多样性,包括不同的运动类型(如跑步、跳跃、舞蹈等)、不同的着装风格(紧身衣、宽松衣等)和不同的身体形态(高矮胖瘦等),有效的特征提取能够从这些多样化数据中提取出稳定、与姿态相关的特征,从而使得姿态估计模型能够应对数据多样性的情况,准确地估计人体运动姿态。

针对人体运动图像构建人体姿态模型,主要通过粗粒度和细粒度模型的组合模型实现。

(1)在人体运动姿态细粒度模型中,实体是人体运动姿态图像中构成姿态序列的最小单位,通过构建人体空域部件之间的时域关系,实现人体时空部件模型的构建。由于人体运动姿态存在由体型、穿着等造成的多样性,构建的人体时空部件模型难以表征人体运动姿态所有变化,在后续的人体运动姿态估计中,易出现较大的估计误差。

(2)在人体运动姿态粗粒度模型中,实体是人体运动姿态中人体关节部件的运动轨迹,依据人体运动姿态关键部件中的最优轨迹构建最终姿态序列,通过长时一致性在时域上的约束,有效降低了后续人体运动姿态估计中的误差累计9。但该模型对于人体运动关键部位的剧烈运动、遮挡等情况跟踪效果较差。

综上所述,本文模型实体为人体运动姿态部位的轨迹片段,覆盖了人体运动姿态图像若干帧。提取模型中每个关键点的特征,用于后续人体运动姿态估计。对于t时刻的第c个人体运动姿态关键节点,其主要特征内容为:①人体运动姿态关键节点的x轴坐标xtc;②人体运动姿态关键节点的y轴坐标ytc;③人体运动姿态关键节点的z轴坐标ztc;④人体运动姿态关键节点的合加速度atc;⑤人体运动姿态关键节点的x轴加速度axtc;⑥人体运动姿态关键节点的y轴加速度aytc;⑦人体运动姿态关键节点的z轴加速度aztc。则t时刻提取的第c个人体运动姿态关键节点特征通过向量形式可表示为:

ktc=xtc,ytc,ztc,atc,axtc,aytc,aztc

t时刻提取的人体运动姿态关键节点特征可表示为:

Kt=kt1,kt2,,ktn

式中:n为人体运动姿态关键节点总数量。

1.2 人体运动姿态估计模型构建

依据1.1节中提取的人体运动姿态特征和卷积神经网络构建人体运动姿态估计模型。卷积神经网络作为一种前馈神经网络,可以自动挖掘人体运动姿态特征中的关键部分,并通过多层卷积池化操作,全面提取人体运动姿态中的不同层级特征10,从而有效提升人体运动姿态估计的准确性。本文构建的用于人体运动姿态估计的卷积神经网络结构图如图1所示。卷积神经网络各个层的具体作用为:

(1)输入层

主要负责将提取的人体运动姿态特征Kt输入,作为后续人体运动姿态估计的基础。

(2)卷积层

通过卷积核对输入层中的人体运动姿态特征进行卷积操作,从而实现对输入的人体运动姿态特征进行深层次提取11,可表示为:

D=ReLUωfhKt+δf

式中:为卷积运算操作;ωfh为第f卷积层第h卷积核所对应的权值矩阵;δf为第f卷积层的偏置;ReLU为ReLU激活函数。

(3)池化层

主要负责降低卷积层输出的内容维度,并对上一层的输出内容进行整合12,具体为:

P=ReLUωijD+δi

式中:ωij为第i池化层第j神经元的权值向量;δi为第i池化层的偏置。

(4)全连接层

主要负责对人体运动姿态进行估计,并输出到卷积神经网络的输出层。

(5)输出层

将最终得到的人体运动姿态估计结果输出,实现人体运动姿态估计,通过Softmax函数实现,最终输出结果可表示为:

Y=ePιτ=1θPePτ

式中:Y为模型输出;ιτ分别为池化层输出的第ιτ个元素;θ为输出人体运动姿态的总类总量。

1.3 人体运动姿态估计模型优化

在1.2节利用卷积神经网络估计人体运动姿态过程中,通过梯度下降的方式实现各个层之间的权值向量和偏置更新,更新速度较慢,且易陷入局部最优情况,导致最终人体运动姿态估计效果较差,因此在模型中引入改进粒子群优化算法,优化权值向量和偏置的更新过程,以提升卷积神经网络对人体运动姿态估计的精度13

基于改进卷积神经网络的人体运动姿态估计流程如图2所示。

粒子群优化算法主要通过构建速度-位置模型对姿态估计卷积神经网络的权值和偏置参数进行优化14。在优化过程中,将卷积神经网络权值和偏置作为随机粒子,并对其进行初始化处理,然后对u维空间中的第q个粒子n时刻的位置和速度进行更新,具体公式为:

vqun+1=χ1ε1pubestn-squn+1+χ2ε2gubestn-squn+1
squn+1=squn+vqun+1

式中:pubestngubestnsqun分别为u维空间中n时刻的局部最优解、全局最优解、第q个粒子的位置;ε1ε2为随机数,ε1,ε20,1ε1+ε2=1χ1χ2为不同的学习因子。

χ1=χstart-χendnmax-nκ/nmax+χend
χ2=4-χ1

式中:nmaxnκ分别为粒子进行更新的最大迭代次数和当前迭代次数;χstartχend分别为学习因子χ1的初值和终值,0<χend<χstart4

n+时,分析粒子速度可知:

vqun=0vqun+1=0

依据式(10)可得:

sκ=vqunχ1ε1pbest+χ2ε2gbest/vqun+1χ1ε1+χ2ε2

式中:pbestgbest分别为局部最优解、全局最优解;ε1ε2均满足均匀分布条件。

式(11)的数学期望进行计算,表达式为:

Esκ=vqun+1χ1pbest+χ2gbest/χ1+χ2

在粒子群优化算法中,粒子进行速度、位置更新寻优过程中,收敛极值通过局部最优解pbest和全局最优解gbest共同决定15,粒子群算法对于卷积神经网络的权值和偏置参数进行优化过程中,可能出现寻优过程陷入局部最优的情况,导致最终寻优的卷积神经网络权值和偏置并非最佳,影响最终人体运动姿态估计结果。

在传统粒子群优化算法中引入免疫机制,能够有效改善算法陷入局部最优解的情况,提升粒子群优化算法对于卷积神经网络最优权重和偏置的寻优能力,即在粒子速度和位置更新过程中引入惯性权重,计算公式为:

ϖ=ϖstart-ϖendnmax-nκ/nmax+χend

式中:ϖstartϖend分别为惯性权重的初始权重值和最终权重值。

采用改进粒子群优化算法对卷积神经网络进行参数优化,动态更新网络权值和偏置,进一步提升人体运动姿态估计精度。本文结合实际估计值与理想值的偏差,定义损失函数L如下:

L=α=0μλα-Y2/2

式中:λα为卷积神经网络中第α层输出节点;μ为有数据的组数。

最终,通过优化后的卷积神经网络权值和偏置,实现更精准的人体运动姿态估计,得到最终结果并输出,具体计算公式为:

Y'=ePιτ=1θP'ePτ

式中:P'为优化后权值和偏置的池化层输出。

P'=ReLUωij'D+δi'

式中:ωij'为优化后的权值;δi'为优化后的偏置。

2 实验及分析

为验证本文方法对人体运动姿态精准估计的有效性,以跳远项目为例进行验证。通过相机对跳远过程的人体运动姿态进行采集,将采集到的人体运动图像进行人体运动姿态估计,采集运动图像的实际场景如图3所示。

在图像采集场景中主要通过相机进行运动图像采集,相机的相关型号及详细参数如表1所示。依据该相机对人体运动姿态进行采集,通过本文方法对采集到的人体运动姿态图像进行估计,以验证本文方法的有效性。

本文结合粗粒度和细粒度模型构建人体运动姿态模型,结合该模型识别人体运动姿态特征,人体运动姿态特征点如图4所示。

图4可知,所提取的人体运动姿态特征点均匀分布在人体运动姿态图像内,不仅覆盖了人体的主要关节如肩、肘、腕、髋、膝、踝等,还细致入微地延伸至手指、脚趾等细微部位,从而实现了对人体运动姿态图像内每一个重要动态变化点的完整覆盖,这种高精度的关键点定位技术极大地提升了对人体运动姿态的分析和理解能力,为运动科学、康复训练等多个领域的研究和应用提供了强有力的支持,为后续人体运动姿态估计提供了良好的基础。

为验证各个特征在人体运动姿态估计中的代表性,选取x轴、y轴、z轴加速度进行研究,对比每项特征的误差以及最终实现人体运动姿态估计的误差变化趋势,特征对姿态估计的分析结果如图5所示。

图5所示,选取的3种特征误差与最终人体运动姿态估计误差变化趋势基本一致,表明所选特征在描述人体运动姿态中的关键性和代表性,进一步验证了这些特征在估计过程中的稳定性和可靠性。

为验证改进粒子群优化算法中学习因子取值对人体运动姿态估计结果的影响,本文设置多组不同学习因子,并结合不同训练样本量开展对比实验,实验结果如表2所示。

表2可知:不同学习因子取值,最终实现的人体运动姿态估计结果存在较大差异。依据分析结果可知,当两个学习因子分别取0.3和0.7时,最终实现的人体运动姿态估计准确数量较高,保持在99%以上,且实现估计的误差较小,在±0.45%以内,验证了本文方法的有效性。

为验证基于改进机器学习方法对人体运动姿态估计的有效性,采用本文方法对图4所示连续帧图像的后续运动姿态进行估计,将其与基于深度学习模型的方法、基于时空运动信息交互建模的方法的估计结果进行对比,结果如图6所示。

图6可知,3种方法的姿态估计效果差异显著。相较于循环神经网络和长短期记忆网络,本文方法检测出的关键点可完整覆盖人体姿态区域。这些关键点定位准确、分布均匀,紧密贴合人体轮廓,能够有效表征人体肢体结构,最终得到的姿态结果自然且精度更高。

利用其余图像进行人体运动姿态估计正确率验证实验,实验结果如表3所示。由表3可知,基于深度学习模型的方法人体运动姿态估计正确率均值为71.11%;基于时空运动信息交互建模的方法人体运动姿态估计正确率均值为81.71%;本文基于改进机器学习的方法人体运动姿态估计正确率均值为96.15%,远高于其他对比方法,表明本文方法估计精度更高,实际应用效果更好。

3 结束语

人体运动姿态估计在多个领域中具有重要作用,通过对人体运动姿态进行估计,能够有效识别用户动作和意图,为游戏领域提升交互能力,为医疗领域提供更可靠的治疗方案等。本文提出了一种基于改进机器学习的人体运动姿态精准估计方法,经过实验测试证明该方法能够实现高精度的人体姿态估计,估计误差较低,能够在相关领域发挥重要作用。

参考文献

[1]

蔡敏敏, 黄继风, 林晓, . 基于人体姿态估计与聚类的特定运动帧获取方法[J]. 图学学报, 2022, 43(1): 44-52.

[2]

Cai Min-min, Huang Ji-feng, Lin Xiao, et al.Motion frame acquisition method based on human pose estimation and clustering[J]. Journal of Graphics, 2022, 43(1): 44-52.

[3]

付惠琛, 高军伟, 车鲁阳. 健身行为的人体姿态估计及动作识别[J]. 液晶与显示, 2024,39(2):217-227.

[4]

Fu Hui-chen, Gao Jun-wei, Che Lu-yang.Human posture estimation and action recognition of fitness behavior[J]. Chinese Journal of Liquid Crystal & Display, 2024, 39(2): 217-227.

[5]

朱丽萍, 唐亮, 朱凯杰, .运动场景下的多目标人体姿态估计[J].计算机工程与设计, 2023, 44(7): 2156-2162.

[6]

Zhu Li-ping, Tang Liang, Zhu Kai-jie, et al. Multi-objective human pose estimation in Motion Scenario [J]. Computer Engineering and Design, 2023,44(7):2156-2162.

[7]

吕衡, 杨鸿宇.一种基于时空运动信息交互建模的三维人体姿态估计方法[J].图学学报, 2024, 45(1):159-168.

[8]

Lv Heng, Yang Hong-yu. A 3D human pose estimation method based on spatiotemporal motion information interaction modeling[J].Journal of Computer Graphics, 2024, 45(1): 159-168.

[9]

马骁, 闫育东. 基于多尺度时空特征的篮球场景中人体姿态估计[J].中南民族大学学报: 自然科学版,2023, 42(1): 95-102.

[10]

Ma Xiao, Yan Yu-dong. Human pose estimation in basketball scene based on multi-scale temporal and spatial characteristics[J]. Journal of Central South University for Nationalities (Natural Science Edition), 2023, 42(1): 95-102.

[11]

Cui H, Dahnoun N.Real-time short-range human posture estimation using mmwave radars and neural networks[J].IEEE Sensors Journal, 2022, 22(1):535-543.

[12]

陈扬, 刘勤明, 梁耀旭. 小样本不平衡设备数据下的机器学习策略研究[J]. 上海理工大学学报, 2022, 44(4): 407-416.

[13]

Chen Yang, Liu Qin-ming, Liang Yao-xu. Research on machine learning strategies based on small sample unbalanced device data[J]. Journal of University of Shanghai for Science and Technology, 2022, 44(4):407-416.

[14]

刘一松, 高含露, 蔡凯祥. 融合时空图卷积网络与非自回归模型的三维人体运动预测[J].计算机应用研究, 2024, 41(3): 956-960.

[15]

Liu Yi-song, Gao Han-lu, Cai Kai-xiang.3D human motion prediction based on spatio-temporal graph convolutional network and non-autoregressive model[J]. Applied Research of Computers,2024, 41(3): 956-960.

[16]

赵威, 李毅. 基于Kinect的人体姿态估计优化和动画生成[J]. 计算机应用, 2022, 42(9): 2830-2837.

[17]

Zhao Wei, Li Yi. Human pose estimation optimization and animation generation based on Kinect[J].Journal of Computer Applications, 2022, 42(9): 2830-2837.

[18]

云涛, 潘泉, 郝宇航, .基于HRRP时频特征和多尺度非对称卷积神经网络的目标识别算法[J].西北工业大学学报, 2023, 41(3): 537-545.

[19]

Yun Tao, Pan Quan, Hao Yu-hang, et al. Target recognition algorithm based on HRRP time-frequency feature and multi-scale asymmetric Convolutional neural network[J].Journal of Northwestern Polytechnical University, 2023, 41(3): 537-545.

[20]

彭锦佳, 王辉兵. 基于异构卷积神经网络集成的无监督行人重识别方法[J]. 电子学报, 2023, 51(10): 2902-2914.

[21]

Peng Jin-jia, Wang Hui-bing.Unsupervised person re-identification method based on heterogeneous convolutional neural network ensemble[J]. Acta Electronica Sinica, 2023, 51(10): 2902-2914.

[22]

司念文, 张文林, 屈丹, . 卷积神经网络表征可视化研究综述[J]. 自动化学报, 2022, 48(8): 1890-1920.

[23]

Si Nian-wen, Zhang Wen-lin, Qu Dan, et al.Convolutional neural network representation visualization: a review[J]. Acta Automatica Sinica, 2022, 48(8):1890-1920.

[24]

吴大飞, 杨光永, 樊康生, .多策略融合的改进粒子群优化算法[J]. 计算机应用研究, 2022, 39(11):3358-3364.

[25]

Wu Da-fei, Yang Guang-yong, Fan Kang-sheng, et al. Improved particle swarm optimization algorithm with multi-strategy fusion[J].Application Research of Computers, 2022, 39(11): 3358-3364.

[26]

李周姿, 冯跃, 林卓胜, .基于改进PSO算法优化SVM模型的面色识别[J].计算机仿真, 2022, 39(4):241-247.

[27]

Li Zhou-zi, Feng Yue, Lin Zhuo-sheng, et al.Face recognition optimization of SVM model based on improved PSO algorithm[J]. Computer Simulation, 2022, 39(4): 241-247.

[28]

郭鑫, 李立君. 基于人工免疫-改进粒子群优化算法的机械臂轨迹规划研究[J].机械传动, 2024, 48(5): 33-40.

[29]

Guo Xin, Li Li-jun. Trajectory planning of robotic arm based on artificial immunity-improved particle swarm optimization algorithm[J].Journal of Mechanical Transmission, 2024, 48(5): 33-40.

基金资助

国家自然科学基金项目(51874267)

AI Summary AI Mindmap
PDF (1844KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/