基于EMD-PSO-LSTM组合模型的人体运动姿态识别

徐继超 ,  王欢

吉林大学学报(工学版) ›› 2026, Vol. 56 ›› Issue (5) : 1430 -1436.

PDF (861KB)
吉林大学学报(工学版) ›› 2026, Vol. 56 ›› Issue (5) : 1430 -1436. DOI: 10.13229/j.cnki.jdxbgxb.20241205
计算机科学与技术

基于EMD-PSO-LSTM组合模型的人体运动姿态识别

作者信息 +

Human motion attitude recognition based on EMD-PSO-LSTM combination model

Author information +
文章历史 +
PDF (881K)

摘要

人体运动姿态识别场景较为复杂,难以提取到多类别间可分性较好的特征信息,导致人体运动姿态识别正确率下降,为此提出了基于EMD-PSO-LSTM组合模型的人体运动姿态识别方法。运用经验模态分解(EMD)算法提取出人体运动姿态在不同时间维度上的细微特征,保证所提取到的特征具备多类别间可分性。搭建长短期记忆网络(LSTM)模型,引入粒子群优化(PSO)算法优化调整LSTM模型中的参数,结合优化后的模型搭建EMD-PSO-LSTM组合模型,将提取到的特征输入到该模型中,该模型的输出即为人体运动姿态识别结果。实验结果表明,该算法在关节识别和整体姿态识别方面都展现出了出色的性能,在面对规模较大的人体姿态数据样本时,依然能够保持较高的识别正确率。

Abstract

The scene of human motion posture recognition is relatively complex, making it difficult to extract feature information with good separability between multiple categories, resulting in a decrease in the accuracy of human motion posture recognition. Therefore, a human motion posture recognition method based on the EMD-PSO-LSTM combination model is proposed. Using EMD algorithm to extract subtle features of human motion posture in different time dimensions, ensuring that the extracted features have multi class separability. Build an LSTM model, introduce PSO algorithm to optimize and adjust the parameters in the LSTM model, and combine the optimized model to build an EMD-PSO-LSTM combination model. Input the extracted features into the model, and the output of the model is the human motion posture recognition result. After experimental verification, the algorithm has demonstrated excellent performance in joint recognition and overall posture recognition. At the same time, it can still maintain high recognition accuracy when facing large-scale human posture data samples, and can be widely applied in practice.

Graphical abstract

关键词

人体运动识别 / 征模函数 / 粒子群优化 / LSTM模型 / 时间序列 / 记忆单元

Key words

human motion recognition / symbolic function / particle swarm optimization / LSTM model / Time series / memory unit

引用本文

引用格式 ▾
徐继超,王欢. 基于EMD-PSO-LSTM组合模型的人体运动姿态识别[J]. 吉林大学学报(工学版), 2026, 56(5): 1430-1436 DOI:10.13229/j.cnki.jdxbgxb.20241205

登录浏览全文

4963

注册一个新账户 忘记密码

0 引 言

人体运动姿态识别是一个技术过程,它涉及在图像或视频中定位人体的关键点,并基于这些关键点构建出人体的姿态图1,从而实现对人体姿态的识别和理解。同时该技术能够自动检测图像或视频中的人体,并识别其姿态和动作,无需人工干预。在实时应用场景中,如健身、运动训练等23,该技术可以实时反馈人体的姿态信息,帮助用户或教练及时调整动作。同时通过对人体姿态的识别和分析,该技术可以为用户提供详细的数据分析报告,评估其运动效果和健康状况。人体运动姿态识别技术应用领域广泛,在运动领域可以实时监测运动员的动作,增强训练效率并保障训练安全;在医疗领域用于康复治疗,通过监测患者的动作评估其康复进展;智能家居系统中,用户可以通过手势或身体动作控制设备的开关和调节。因此,人体运动姿态识别技术具有广泛的应用前景和重要的社会价值,也成为各领域专家共同研究的课题。

国内学者在人体运动姿态识别技术上取得了显著的进展。邓平等4首先利用多信息融合进行特征提取,并对错误的姿态识别利用连贯性识别修正,然后建立多分类器监测特征数进行人体运动姿态识别。但该方法将多种模态数据经过提取后拼接成一个特征集,通常会导致特征维数过高。当特征维数达到一定规模后,会使模型性能下降,这增加了处理的计算密集度和对数据存储空间的需求。杨艺等5首先利用惯性传感器采集姿态数据并进行去噪,计算数据方差作为特征向量,然后利用支持向量机进行姿态识别。但该方法中方差不能提供关于数据分布形状、峰值、偏度或峰度等更详细的信息。因此,仅使用方差作为特征向量可能会忽略数据中的其他重要特征,导致信息的不完整性。赵威等6首先利用Kinect设备获取姿态数据,然后基于单目人体姿态估计算法进行骨骼数据组合,最后实现人体姿态识别。但该方法中单目人体姿态估计只能提供二维图像中的关节点位置,而无法直接获取三维空间中的深度信息。这导致在将二维关节点组合成三维骨骼数据时,存在深度信息的模糊性。Xiao等7将粒子群优化(PSO)算法结合长短期记忆(LSTM)算法识别关节点并建立扭矩识别模型,完成人体运动姿态识别。但粒子群算法和长短期记忆网络算法都对数据的质量及数量要求比较高。若数据中存在噪声、数据缺失或数据不平衡等,模型性能会受到很大影响,进而影响输出效果。

为解决上述因难以提取到多类别间可分性较好的特征信息从而导致识别正确率低的问题,提出基于EMD-PSO-LSTM融合模型的人体运动姿态识别方法。首先经验模态分解(EMD)算法将人体运动姿态时间序列信号分解为一系列具有不同频率特性的本征模态函数,即人体运动姿态信号在不同时间尺度上的局部特征,因此其特征具备多类别间可分性。然后利用LSTM算法建立人体运动姿态识别模型,通过PSO算法优化模型中的参数组合,使模型能够紧密贴合EMD算法提取的人体运动姿态特征,同时在面对未见过的人体运动姿态信号数据时仍能保持良好的识别表现。

1 人体运动姿态识别研究

1.1 基于EMD的人体运动姿态特征提取

人体运动姿态复杂而且多变,它涉及到多个关节、肌肉和骨骼的协同作用8。在时间序列上,人体运动姿态信号呈现出多种复杂特性,包括非线性、多尺度性、非平稳性等9,这些特性使得传统的信号处理方法难以有效捕捉和分析人体运动姿态的细微变化和动态特征。EMD算法能够将复杂的人体运动姿态信号分解为一系列具有不同频率特性的本征模态函数1011,即人体运动姿态信号在不同时间尺度上的局部特征,从而为后续的人体运动姿态识别奠定坚实的基础。

假设人体运动姿态原始信号时间序列数据为ϕ(t),先计算出ϕ(t)的局部最大和最小值。将所得数值进行插值逼近计算,得出ϕ(t)的上边界ϕu(t)序列和下边界ϕd(t)序列,求得上述两个序列的平均值,得到人体运动姿态原始信号时间均值序列如下:

AV(t)=12ϕu(t)+ϕd(t)

用人体运动姿态原始信号时间序列扣除均值序列,即去掉低频的新序列如下:

ϕ'(t)=ϕ(t)-AV(t)

若得到的新序列不符合本征模态函数定义的关键条件时,重新定义其为人体运动姿态原始信号时间序列,重复计算n次直到函数平均曲线接近0才停止。即α1(t)=ϕn'(t)α1(t)定义为本征模态函数分量的判断条件表示如下:

SM=t=0Tϕn-1'(t)-ϕ1'(t)2/ϕ'(t)2

式中:SM为筛分阈值,取值通常为0.2~0.3。除去最高频成分的人体运动姿态信号时间残差序列为β1(t)=ϕ(t)-α1(t)。重复上述描述,可以得到人体运动姿态时间序列本征模态函数分量,若筛选进行k次,且预定误差大于αk(t)βk(t)为单调函数时,停止模态分解,因此其特征具备多类别间可分性,此时人体运动姿态特征提取结果为:

ft=i=1kαi(t)+βk(t),SM>0

1.2 基于PSO-LSTM的人体运动姿态识别

1.2.1 LSTM模型构建

LSTM算法能够处理2.1小节人体运动姿态原始信号时间序列数据中的长期依赖问题12。其结构包括记忆单元和三个门控机制,如图1所示,这种结构使得LSTM算法能够捕捉人体运动姿态原始信号时间序列数据中的人体运动姿态变化特征,适合用于人体运动姿态识别。

假设输入门输入人体运动姿态原始信号时间序列ϕ(t)=ϕ1(t),ϕ2(t),,ϕT(t),隐藏层状态为h1,h2,,hT,记忆单元为cm,那么在时间点m有下式:

im=σahihm-1+axixm+bifm=σahfhm-1+ahfxm+bfcm=fmcm-1+imgahchm-1+axcxm+bcom=σahohm-1+aoxxm+acoct+bohm=omgcm

式中:im为输入门,fm为遗忘门,om为输出门,σ为Sigmoid函数,ax为输入层到隐藏层连接参数,bibfbcbo为各函数的阈值,ah为递归连接的系数,g为tanh函数。

为了使LSTM网络能够顺利进行人体运动姿态识别,需要添加一个线性回归层进行最终的人体运动姿态识别输出。线性回归如下式:

ym=ayohm+by

式中:ym为人体运动姿态识别最终结果的输出;by为线性回归层的阈值。

1.2.2 用于人体运动姿态识别的EMD-PSO-LSTM组合模型

由于人体运动姿态的多样性和复杂性,1.2.1小节中基于LSTM算法的人体运动姿态识别模型的参数设置对人体运动姿态识别起着至关重要的作用。PSO算法能够搜索模型中的连接参数以及阈值的最优组合,通过不断优化这些参数,LSTM模型能够更好地拟合训练数据,并具备较好的泛化能力。将人体运动姿态特征输入EMD-PSO-LSTM组合模型中,从而得到精准的人体运动姿态识别结果。

将LSTM人体运动姿态识别模型的参数优化视为在一个多维搜索空间中进行探索的任务,其中每一种参数配置都对应成一个在空间中移动的粒子,这些粒子在不断地寻找最优解,旨在找到使LSTM模型在人体运动姿态识别上表现最佳的参数组合13。在这个过程中,PSO算法被用来引导这些粒子的运动。PSO首先生成一组随机的参数配置(即粒子),这些配置构成了初始的解空间。然后,算法开始迭代,每个粒子都根据个体极值pibest和全局最优解qbest调整其位置和速度14。在第s次迭代中,第i个粒子根据特定的公式调整其速度和位置,公式如下:

Vi,s+1=ω*Vi,s+c1*rand*pibest-Xi,s
+c2*rand*qbest-Xi,s
Xi,s+1=Xi,s+λ*Vi,s+1

PSO优化LSTM具体流程如下:

(1)参数初始化。包括设定种群的大小(即LSTM人体运动姿态识别模型参数组合解的集合规模)、迭代的次数(即算法运行的总轮数)、学习因子(这些因子决定了LSTM人体运动姿态识别模型参数组合解如何根据历史信息进行更新)以及位置和速度(LSTM人体运动姿态识别模型参数的搜索空间和更新步长)的取值范围。

(2)粒子初始位置与速度的设定:随机生成一个由多个LSTM人体运动姿态识别模型的参数(即粒子)构成的种群Xi,0h1,h2,ζ,s。其位置由四个关键参数定义:模型中第一层和第二层隐含层的神经元数量h1h2,LSTM人体运动姿态识别模型的学习率ζ以及LSTM人体运动姿态识别模型的参数训练迭代次数s。同时,每个粒子设定了一个初始速度,这个速度将指导参数在搜索空间中的动态调整过程。

(3)确立粒子的性能评估标准:为每个粒子设定一个性能评估标准,即评价函数。首先,将粒子Xi,0的参数(包括LSTM人体运动姿态识别模型参数如隐含层神经元数、学习率等,以及训练迭代次数)赋值给LSTM网络。接着,将人体运动姿态信号数据分为训练集、验证集和测试集。然后,使用训练集训练LSTM网络,直至完成预设迭代,由此得到网络的输出值y^tj,并同时计算验证集通过该网络得到的输出值y^vk,此时粒子Xi的适应值fiti为:

fiti=12*j=1Jy^tj-ytj/ytj*100+12*y^vk-yvk/
yvk*100

(4)评估每个粒子所在位置Xi的适应度值,依据这些初始粒子适应度值的评估结果,确定每个粒子自身的最优解和整个粒子群的最优解。同时,记录下每个粒子在探索历程中达到的最高性能点,作为其历史最佳状态。

(5)迭代,用式(7)和(8)更新粒子速度和位置,评估新位置的适应度值,据此更新个体和群体的最优解15

(6)当PSO算法达到预设的最大迭代次数后,采用最优粒子所训练得到的LSTM模型处理人体运动姿态时间序列数据,从而输出人体运动姿态识别结果。

采用1.1小节EMD算法进行人体运动姿态特征提取,该过程能够依据人体运动姿态信号本身的特性实现自适应分解,无需预先定义基函数,有效减少了因主观判断所带来的误差。PSO算法能够科学处理无约束及约束条件下的全局优化难题。而LSTM神经网络,凭借其独特的内部结构,擅长捕捉和学习长时间依赖的信息,将EMD、PSO与LSTM三者结合形成组合模型应用于人体运动姿态识别研究中,从而构建EMD-PSO-LSTM组合模型,将人体运动姿态特征输入该模型中,从而得到精准的人体运动姿态识别结果,具体的公式如下:

ymft=Xi,s+1ayohmft+by,fiti>0

2 实验分析

为了验证本文人体运动姿态识别中的应用效果,进行了实验测试。实验环境如图2所示。

利用通过上述过程所收集的人体运动姿态动作图像集作为实验研究对象。关于这个动作图像数据集的基本概况如表1所示。

利用本文算法进行人体运动姿态特征提取,结果如图3所示。

分析图3可知,本文方法可以提取到人体运动姿态特征点,且无错误情况,能够为后续的人体运动姿态识别提供坚实的基础。

利用EMD-PSO-LSTM组合模型对于人体运动姿态识别,结果如表2所示。

根据表2提供的信息,对于10种不同的人体运动姿态,本文算法准确地识别了其中的9种姿态。仅在编号为3的姿态识别中,于154个样本里出现了微小的偏差,仅有一个样本未被正确识别,其余153个样本均被成功识别。说明本文算法展现出了极高的准确率,能够正确识别出绝大多数的人体运动姿态,同时具备实时处理能力和良好的泛化能力,能够轻松应对各种人体运动姿态的识别需求。

为了进一步验证EMD-PSO-LSTM模型在人体运动姿态识别中的有效性,本文选择基于机器学习的方法、基于改进MEMS惯性传感器的方法对人体运动时关节变化进行识别,结果如图4所示。

图4中红线描绘了关节实际的屈曲与旋转角度变化,绿色虚线则展示了本文方法在人体运动姿态关节识别过程中关节角度的变化情况。紫色线条反映了文献[5]的识别结果,而蓝色线条则代表了文献[6]的识别效果。由图4可以明显看出,MD-PSO-LSTM模型所得到的关节偏离角度与实际关节偏移角度之间的吻合度最高,同时,关节位置的变化趋势也与实际情况最为一致。

在此基础上,对比了不同方法的人体运动姿态识别正确率,结果如表3所示。

分析表1中的数据可知,基于机器学习的方法的人体运动姿态识别正确率最大值为82.1%,最小值为71.6%;基于改进MEMS惯性传感器的方法的人体运动姿态识别正确率最大值为87.6%,最小值为81.2%;EMD-PSO-LSTM模型的人体运动姿态识别正确率最大值为98.9%,最小值为95.7%。经过对比可知,EMD-PSO-LSTM模型应用下的人体运动姿态识别正确率最高,可以实现对于人体运动姿态的精准识别。

3 结束语

人体运动姿态识别的精确度对于医疗、体育等多个领域的发展至关重要。为此,本文研究了基于EMD-PSO-LSTM组合模型的人体运动姿态识别方法,旨在为这些领域面临的挑战提供有力的解决方案。该方法通过EMD算法细致捕捉人体运动姿态在不同时间点上的局部特征,随后构建LSTM模型进行姿态识别。为了进一步提升识别效果,引入了PSO算法优化LSTM模型中的关键参数。借助这一算法,在医疗领域提高诊断的准确性,同时为体育运动的科学训练和评估提供有力的支持。

参考文献

[1]

马璿, 张会庆. 基于BEMD-MTS算法的肢体动作轮廓智能捕捉方法[J]. 计算机仿真, 2023, 40(10):224-227.

[2]

Ma Xuan, Zhang Hui-qing. Intelligent capturing method of limb motion contour based on BEMD-MTS algorithm[J]. Computer Simulation, 2023, 40(10): 224-227.

[3]

朱丽萍, 唐亮, 朱凯杰, . 运动场景下的多目标人体姿态估计[J]. 计算机工程与设计, 2023, 44(7): 2156-2162.

[4]

Zhu Li-ping, Tang Liang, Zhu Kai-jie, et al. Multi-target human pose estimation in sports scenes[J]. Computer Engineering and Design, 2023, 44(7): 2156-2162.

[5]

付惠琛, 高军伟, 车鲁阳. 健身行为的人体姿态估计及动作识别[J]. 液晶与显示, 2024, 39(2): 217-227.

[6]

Fu Hui-chen, Gao Jun-wei, Che Lu-yang. Human posture estimation and movement recognition in fitness behavior[J]. Chinese Journal of Liquid Crystals and Displays, 2024, 39(2): 217-227.

[7]

邓平, 吴明辉. 基于机器学习的人体运动姿态识别方法[J]. 中国惯性技术学报, 2022, 30(1): 37-43.

[8]

Deng Ping, Wu Ming-hui. Human motion attitude recognition method based on machine learning[J]. Journal of Chinese Inertial Technology, 2022, 30(1):37-43.

[9]

杨艺, 贺晓阳. 基于改进MEMS惯性传感器的人体动作智能捕捉[J]. 计算机仿真, 2024, 41(1): 247-250.

[10]

Yang Yi, He Xiao-yang. Intelligent human motion capture based on improved MEMS inertial sensor[J]. Computer Simulation, 2024, 41(1): 247-250.

[11]

赵威, 李毅. 基于Kinect的人体姿态估计优化和动画生成[J]. 计算机应用, 2022, 42(9): 2830-2837.

[12]

Zhao Wei, Li Yi. Kinect-based human pose estimation optimization and animation generation[J]. Journal of Computer Applications, 2022, 42(9): 2830-2837.

[13]

Xiao W, Fu Z, Wang S, et al. Joint torque prediction of industrial robots based on PSO-LSTM deep learning[J]. Industrial Robot, 2024,51(3): 501-510.

[14]

吕衡, 杨鸿宇. 一种基于时空运动信息交互建模的三维人体姿态估计方法[J]. 图学学报, 2024, 45(1): 159-168.

[15]

Heng Lyu, Yang Hong-yu. A 3D human pose estimation approach based on spatio-temporal motion interaction modeling[J]. Journal of Graphics, 2024, 45(1): 159-168.

[16]

杨刚, 王超, 王丽芳, . 基于TENG的人体运动监测及其在跌倒检测中的应用[J]. 微纳电子技术, 2023, 60(9): 1464-1472.

[17]

Yang Gang, Wang Chao, Wang Li-fang, et al. Human motion monitoring based on TENG and its application in fall detection[J]. Micronanoelectronic Technology, 2023, 60(9): 1464-1472.

[18]

孔繁苗, 高鹭, 李鹏程, . EMD-LSTM-LB分频时序预测算法[J]. 计算机工程与设计, 2023, 44(10): 3021-3030.

[19]

Kong Fan-miao, Gao Lu, Li Peng-cheng, et al. EMD-LSTM-LB frequency-divided time series prediction algorithm[J]. Computer Engineering and Design, 2023, 44(10): 3021-3030.

[20]

李霞, 李守伟. 基于EMD与DVG的非线性时间序列预测模型及其应用研究[J]. 中国管理科学, 2022, 30(9): 275-286.

[21]

Li Xia, Li Shou-wei. Non-linear time series prediction model based on EMD and DVG and its application[J]. Chinese Journal of Management Science, 2022, 30(9): 275-286.

[22]

孙彦玺, 陈继斌, 武东辉. 基于卷积神经网络-双向长短期记忆网络的人体活动识别方法[J]. 科学技术与工程, 2022, 22(4): 1517-1525.

[23]

Sun Yan-xi, Chen Ji-bin, Wu Dong-hui. Human activity recognition method based on convolutional neural network-BiLSTM[J]. Science Technology and Engineering, 2022, 22(4): 1517-1525.

[24]

李新春, 曾仕豪. 基于改进粒子群算法的UWB雷达人体动作识别研究[J]. 重庆邮电大学学报: 自然科学版, 2024, 36(2): 268-276.

[25]

Li Xin-chun, Zeng Shi-hao. UWB radar human action recognition based on improved particle swarm optimization[J]. Journal of Chongqing University of Posts and Telecommunications (Natural Science Edition), 2024, 36(2): 268-276.

[26]

李国森, 闫李, 朱小培, . 基于最小生成树的粒子群优化算法[J]. 计算机工程与设计, 2022, 43(7): 1972-1980.

[27]

Li Guo-sen, Yan Li, Zhu Xiao-pei, et al. Particle swarm optimization algorithm based on minimum spanning tree[J]. Computer Engineering and Design, 2022, 43(7): 1972-1980.

[28]

Qiu Wan-qing, Zhang Qing-miao, Zhao Jun-hui, et al. Improved PSO-extreme learning machine algorithm for indoor localization[J]. China Communications, 2024, 21(5): 113-122.

基金资助

安徽省教育厅高校人文社会科学研究重点项目(SK2021A0497)

江苏省高等学校自然科学研究项目(21KJB580005)

AI Summary AI Mindmap
PDF (861KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/