基于多特征融合的人体运动姿态信息捕捉方法

李艳 ,  马俊

吉林大学学报(工学版) ›› 2026, Vol. 56 ›› Issue (4) : 1119 -1127.

PDF (1429KB)
吉林大学学报(工学版) ›› 2026, Vol. 56 ›› Issue (4) : 1119 -1127. DOI: 10.13229/j.cnki.jdxbgxb.20240955
计算机科学与技术

基于多特征融合的人体运动姿态信息捕捉方法

作者信息 +

Capturing method for human motion posture information based on multi feature fusion

Author information +
文章历史 +
PDF (1463K)

摘要

针对人体运动图像的采集容易受到环境变化(如光照、遮挡、背景复杂度等)的影响,导致姿态特征提取困难、姿态捕捉精度降低的问题,本文基于多特征融合的人体运动姿态信息捕捉方法,设计了双分支架构的人体运动姿态信息捕捉模型,上层分支以当前帧及其与之相邻的前后两帧视频作为基于Transformer的视频帧时序特征提取网络输入,学习帧间时序特征的同时,并捕捉姿态变化信息;下层分支通过OpenPose获取视频帧的骨架数据,以骨盆区域中心为原点,转换至球面坐标系,构建球面关节描述符(SDJ)矩阵,作为基于卷积神经网络(CNN)的运动姿态特征网络输入,提取运动姿态特征,将其与时序特征一起输入到互补特征融合网络中,实现人体运动姿态特征的互补整合,通过Softmax层预测人体运动姿态概率,实现人体运动姿态信息捕捉。实验结果表明:视频帧序列长度为5时,F1 score指标可达到0.94左右;该方法可实现人体运动姿态信息捕捉,PCK指标始终高于对比方法;MPJPE为28.5,AUC为0.923。

Abstract

To address the issue that human motion image acquisition is susceptible to environmental variations (such as illumination, occlusion, and background complexity), which can lead to difficult pose feature extraction and reduced pose capture accuracy, a human motion pose information capture method based on multi-feature fusion is proposed. A dual-branch architecture is designed for the human motion pose information capture model. In the upper branch, the current frame together with its two adjacent preceding and subsequent frames is taken as the input to a Transformer-based video frame temporal feature extraction network, by which inter-frame temporal features are learned and pose variation information is captured. In the lower branch, skeleton data of video frames is obtained using OpenPose, and with the center of the pelvic region as the origin, the data is transformed into a spherical coordinate system to construct a spherical descriptor of joints (SDJ) matrix. This matrix is then used as the input to a CNN-based motion pose feature network, where motion pose features are extracted. These features, together with the temporal features, are subsequently fed into a complementary feature fusion network to achieve complementary integration of human motion pose features, and human motion pose probabilities are predicted through a Softmax layer, thereby enabling human motion pose information capture. Experimental results show that when the video frame sequence length is set to 5, an F1 score of approximately 0.94 is achieved. The proposed method effectively captures human motion pose information, consistently achieving higher PCK values than the compared methods, with an MPJPE of 28.5 and an AUC of 0.923.

Graphical abstract

关键词

多特征融合 / 姿态捕捉 / Transformer / 姿态变化 / 球面关节描述符 / 姿态特征

Key words

multi feature fusion / attitude capture / transformer / posture change / spherical joint descriptor / attitude features

引用本文

引用格式 ▾
李艳,马俊. 基于多特征融合的人体运动姿态信息捕捉方法[J]. 吉林大学学报(工学版), 2026, 56(4): 1119-1127 DOI:10.13229/j.cnki.jdxbgxb.20240955

登录浏览全文

4963

注册一个新账户 忘记密码

0 引 言

随着计算机视觉与人工智能技术的快速发展,人体运动姿态的识别与捕捉技术已成为计算机视觉领域的重要研究方向,并在智能视频监控、智能家居、医疗康复、运动分析以及娱乐体感游戏等多个领域展现出了广泛的应用前景1-3。由于人体运动姿态的复杂多变和高度个性化特征,实现其信息的精准捕捉成为了一项极具挑战性的任务45。因此,探索并研究高效、精确的人体运动姿态捕捉方法,对于推动相关领域的技术革新、提升用户体验和促进健康管理与智能交互等领域的发展具有重要意义6

近年来,已经有很多学者对人体运动姿态信息捕获方法进行了研究。例如,邓平等7从惯性传感器提取多姿态运动场景下的特征数据,通过特征筛选,减少冗余信息并保留关键特征,通过姿态修正避免姿态误判,通过多分类器实现姿态识别,该方法受传感器噪声、漂移、校准误差以及复杂的人体运动模式等因素影响,导致姿态识别效果不理想;Kumar等8基于视频中的人体骨架数据建立时空图,作为图卷积神经网络输入,捕获骨架的空间布局和时间动态,通过Softmax分类器预测行为。该方法仅依靠人体时空骨架特征进行动作识别,特征单一性限制了算法在复杂多变场景下的全面性和泛化能力;王瀛等9利用稀疏光流法学习视频帧图像中的运动信息,将得到的光流直方图输入到卷积神经网络(CNN)中,得到原始输入的深层特征,将其与生成的方向梯度直方图作互补整合后,通过K最近邻分类器输出动作识别结果,该方法提取的特征虽具有互补性,但存在极大的特征冗余问题,这可能导致模型复杂度增加且不易于优化;雷永升等10利用基于Transformer的行为识别模型分别对光流与RGB流特征进行表示学习,采用决策融合层对其进行融合。该方法在视频帧时序特征学习方面表现出色,但缺乏对人体运动姿态特征的学习10

多特征融合技术通过整合来自不同维度、不同层面的特征信息,能够更全面地描述人体运动姿态的复杂特性11。为了解决上述方法存在的问题,本文提出基于多特征融合的人体运动姿态信息捕捉方法,旨在通过综合利用不同特征在姿态识别中的独特作用及其互补性,有效应对人体运动姿态的复杂性和多样性挑战。

1 人体运动姿态信息捕捉

1.1 人体运动姿态信息捕捉模型框架

为了打造一个高效、准确且鲁棒的技术平台,提高姿态捕捉的精确度和适应性。通过优化数据处理和算法,模型旨在实现实时的人体运动分析,且支持复杂动作的识别,并能够适应不同用户的个性化需求。此外,该框架还致力于降低成本,提高系统的可用性,从而推动其在虚拟现实、增强现实、人机交互、运动科学和医疗康复等领域的广泛应用,促进相关技术的创新和发展。构建这一模型是为了提供一个强大的工具,以支持对人体运动姿态的深入理解和应用,进而提升用户体验和推动技术进步。具体的人体运动姿态信息捕捉模型结构如图1所示。

图1所示的人体运动姿态信息捕捉模型采用双分支架构,上层分支通过分帧与多帧融合策略,利用基于Transformer的视频帧时序特征提取网络学习帧与帧间的时序特征,细腻捕捉人体运动姿态变化,提升信息提取的精度和连贯性;下层分支通过OpenPose技术从运动视频帧中获取人体运动骨架数据,以骨盆为中心将其从笛卡尔坐标系转换到球面坐标系,构建球面关节描述符(SDJ)矩阵,通过基于CNN的运动姿态特征网络进行运动姿态特征学习,增强相似动作的辨识能力。上下分支提取的特征通过互补特征融合网络进行智能整合,输出更为全面、精确的人体运动姿态信息表征,通过Softmax层预测人体运动姿态概率,实现人体运动姿态信息捕捉。

1.2 基于Transformer的视频帧时序特征提取网络设计

在多目标人体运动场景中,人体的快速移动以及不同目标之间的相互遮挡,会降低人体运动视频帧的整体质量。单帧信息不足以准确捕捉人体运动姿态信息12。因此,本文通过整合相邻视频帧中的视觉信息,补充和优化因运动模糊和遮挡造成的信息缺失,提高运动信息的连贯性和完整性,最终实现人体运动姿态的精确捕捉。设计基于Transformer的人体运动视频帧时序特征捕捉模块,旨在解决传统线性映射在处理多帧图像序列时,难以捕捉局部时序特征的问题。该模块利用多头注意力机制识别并关注于那些对人体运动姿态变化具有重要影响的关键帧或帧内区域,以便从中提取丰富的时空信息。为了控制模型复杂度,本文将人体运动视频帧图像切割成若干个3×3图像块进行处理,以实现局部时序特征的精准捕捉和整合。

为深度挖掘并丰富当前视频帧Ini中人体运动细节信息,选取与该帧紧密相连的前后各两帧视频In-1:n-2iIn+1:n+2i,构成一个综合的视频帧补充序列,根据时间顺序对邻近帧视频作拼接处理,得到Fni=In-2i,In-1i,Ini,In+1i,In+2i后,将其传输到基于Transformer的时序特征提取网络中,通过多头注意力机制确保网络能够并行地在不同的表示子空间里捕捉帧与帧之间的局部时序依赖关系,获取视频序列中更为充分和细致的人体运动局部时序信息。每个自注意力头对输入序列的处理流程具体为:

首先通过网络对输入的连续帧进行深入学习,提炼出蕴含丰富信息的特征向量序列,将其映射到Transformer中的自注意力机制中,转化查询、键、值矩阵组件,分别通过QKV表示;在自注意力机制计算时,为了避免因点积计算结果过大造成梯度消失问题,引入比例系数d-1/2作归一化调整,表明出现梯度消失问题,特征向量维度表示为d,自注意力头捕捉到的视频帧序列特征通过下式确定:

H=AttentionQ,K,V=SoftmaxQKTd-1/2V

式中:K的转置表示为KT,其与Q的点积结果表示为QKT

Q=EniWQK=EniWKV=EniWV

式中:利用Embedding层中的多层感知机对拼接后的视频帧序列Fni=In-2i,In-1i,Ini,In+1i,In+2i进行处理后,可完成局部序列特征的提取,即Eni,利用线性转换函数WQWKWV分别对其处理,即可完成QKV的确定。

利用注意力层对各个自注意力头输出结果作融合处理,得到基于Transformer的时序特征提取网络的最终输出,计算公式为:

MAFni=attH1,,Hn

式中:n1,2,,hh表示自注意力头数量。

1.3 人体运动姿态特征提取

1.3.1 球面关节描述符矩阵的生成

为了更好地理解、分析和捕捉人体运动姿态信息13,采用OpenPose技术从运动视频帧中获取人体运动骨架数据。利用20个骨骼关节构建人体运动骨架模型,该模型可划分为5个部分,依次为人体躯干段、左右上肢段和左右下肢段。人体运动骨架模型如图2所示。

在对人体动作进行识别时,通常是在笛卡尔坐标系下对人体骨架关节数据进行描述,以便直观地获取人体运动的空间位置信息。然而,在该坐标系下,即使关节发生了微小的偏移或旋转,也可能导致其在坐标系中的表示出现显著差异,甚至可能被误识别为不同的动作。这种敏感性增加了相似动作的辨识难度,从而降低了人体运动姿态信息捕捉的精度。为了解决这一问题,将人体骨架数据转换到球面坐标系中被认为是一个有效的方法。人体生理结构和运动机制的复杂性严格限制了关节在三维空间中的移动范围。骨盆区域在人体运动中相对稳定,并且处于人体的中心位置,因此以其为坐标转换的参照点能够更好地反映物理约束对运动的影响。通过r表示骨盆区域中心点与其他关节点之间的直线距离,关节点相对于骨盆区域中心点在三维空间中的仰角、方位角分别表示为θϕ。在笛卡尔坐标系下,通过JC=HC,J1,J2,,J19描述人体关节,将其向球面坐标系转换后,则对应表示为JS=r,θ,ϕr的计算公式描述为:

r=MAFnix2+y2+z212MAFnixHC-xi2+yHC-yi2+zHC-zi212

式中:骨盆区域中心点表示为xHC,yHC,zHC;笛卡尔坐标下编号为i的人体关节点位置坐标表示为xi,yi,zii[1,19]

参数θ通过下式计算得到:

θ=arccosz/r

参数ϕ通过下式确定:

ϕ=arctany/x

球面关节描述符SJD主要用于描述关节在三维空间中的位置和朝向。它将关节的位置视为球面坐标系中的一个点,通过该点的坐标表示关节的空间位置。对每一个人体运动视频帧中的关节点进行坐标转换,根据得到的各关节信息构建SJD矩阵,矩阵行数量与视频帧数保持一致,列数量等于人体运动骨架模型中的关节数,计算公式描述为:

SJD=Js1,1Js1,2Js1,19Js2,1Js2,2Js2,19JsN,1JsN,2JsN,19

式中:对于第i个视频帧,其中第j个关节的球面关节描述符保存在位置Jsij处。

1.3.2 基于CNN的运动姿态特征提取网络设计

在生成SJD矩阵后,将其输入到基于CNN的运动姿态特征网络中,以捕捉人体运动姿态特征。基于CNN的运动姿态特征网络结构如图3所示。

球面关节描述符刻画了人体关节在三维空间中的位置和朝向信息,类似于图像数据中的多维通道,其初始尺寸设定为(20,12,3),反映了关节数量、视频帧以及每个关节的关键参数。将其输入到基于CNN的运动姿态特征提取网络中,通过多层卷积并结合适当的padding策略,以保持特征图的空间分辨率,逐步提取和抽象人体运动的复杂特征。在卷积层之间穿插池化层(设计(2,2)的池化核),进一步降低特征图的维度,同时保留关键信息。最终,经过全连接层的处理,网络输出一组高维特征向量,这些向量精准地捕捉了人体在不同运动姿态下的关键特征,为后续的姿态识别与预测提供强有力的支持14

(1)卷积层。基于生物视觉系统中局部感知机制的启发,CNN运用一系列局部过滤器在球面关节描述符输入数据上执行卷积操作。即选取球面关节描述符输入数据的局部区域(即子矩阵),并与对应的过滤器进行逐元素相乘后求和,从而得到输出矩阵相应位置的元素值。为了丰富数据表示并提取不同维度的特征,CNN中包含一些过滤器,每个过滤器都独立执行上述卷积操作并生成一个输出矩阵,其维度由输入尺寸减去过滤器尺寸加一确定,共同构成了下一层处理的输入,有效实现了对复杂数据特征的分层抽象与提取。具体计算公式为:

Yli,j,k=fblk+0P-10Q-1Wlk,p,qSJDl-1i+p,j+q,c

式中:Yli,j,k表示对于第l个卷积层,其输出特征图在第k个数据通道i,j位置上的值;f表示非线性激活函数;Wlk,p,q表示该层中第k个过滤器p,q位置上的权重值;过滤器尺寸由P×Q确定;SJDl-1i+p,j+q,c表示l-1层的输出特征图在i+p,j+q上,且属于第c个通道的值;blk表示l层中第k个过滤器的偏置项。

球面关节描述符矩阵经过第一个卷积层的处理后,可通过下式得到输出特征图在位置(0,0)上的处理结果:

Y10,0,0=fb10+W10,0,0SJD00,0,0

(2)池化层。该层用于处理卷积层的处理结果,通过对其输入进行局部求平均,达到对其输入降维的目的,计算公式描述为:

Y'li,j,k=n-20n-10n-1Yl-1i+p-n2,j+q-n2,c

式中:池化窗口尺寸为n

1.4 互补特征融合与分类

在获取视频帧时序特征MAFni和人体运动姿态特征Y后,将其作为互补特征融合模块的输入,能够智能地引导注意力机制聚焦于人体运动姿态中的关键特征,确保关键特征在最终的特征表示中占据主导地位。这一过程不仅极大丰富了特征表达的内容与精度15,还显著增强了人体运动姿态捕捉任务的执行效能。互补特征融合模块原理图如图4所示。

视频帧时序特征MAFni和人体运动姿态特征Y经过拼接后,利用1×1卷积层处理拼接后的特征图,输出初步特征融合结果z后,在其各个通道上,分别执行最大、平均池化计算任务,从不同角度捕捉初始融合特征图中的重要信息,然后通过7×7卷积层处理这两种池化方式生成的特征图,通过学习不同特征之间的复杂关系,输出一个增强的注意力表示zatt,再通过计算ZYzatt1-zatt的点积之和,确定互补特征融合模块的最终输出Z。实现公式具体为:

z=Conv1×1Y;MAFni
zatt=σConv7×7AvgPoolz;MaxPoolz
Z=zattY+1-zattMAFni

式中:z表示初步特征融合结果;Convi×i表示卷积处理函数,卷积核大小为i×iσ表示Sigmoid激活函数。

最后通过Softmax层预测人体运动姿态概率,实现人体运动姿态捕捉。计算公式描述为:

softmaxZi=eZi/j=1neZj

2 实 验

2.1 实验准备

以自主采集和网络下载两种方式获取人体运动视频数据,利用高清摄像机对15位运动爱好者的日常锻炼场景进行捕捉,得到500段运动视频数据,完成数据集A的构建;数据集B、C是从某专业体育视频网站获取的篮球、网球运动视频资源,分别由25 000帧、18 000帧高质量图像构成,不仅展现了专业运动员的高强度运动姿态,还包含了复杂多变的运动场景和背景。根据4∶1比例进行样本分配,得到训练、验证样本数据。在Pytorch深度学习框架下进行人体运动姿态捕捉模型的搭建,以10-3作为学习率初值进行模型的训练,并按照10%步长进行衰减,循环迭代总轮数为1 000。将研究方法应用到人体运动姿态信息捕捉中,分析其可行性和应用性。实验现场如图5所示。

2.2 实验参数

本文使用的高清摄像机参数如表1所示。

2.3 实验结果分析

视频帧序列长度是影响人体运动姿态信息捕捉的一个重要影响因素,将其值分别设定为3、5、7、9,不同视频帧序列长度下的F1 score指标差异分析结果如图6所示。

分析图6得出,随着迭代轮数的不断增大,反映人体姿态信息捕捉效果的F1 score指标值呈不断增大规律变化。当视频帧序列长度为3时,F1 score指标虽然能够逐步提升,但受限于较短的序列长度,模型难以捕捉到足够丰富的动态信息,因此其最大值仅能达到0.85左右,这使得模型在捕捉复杂或快速变化的人体姿态时存在一定局限性;当视频帧序列长度为5时,F1 score指标最高为0.94左右,这充分说明增加序列长度有助于模型捕获更多的时间上下文信息;继续增大序列长度,会使视频帧中包含更多的冗余信息,这是F1 score指标值不断减小的根本原因。

为分析研究方法在人体运动姿态信息捕捉上的性能优势,以基于HRNet的姿态捕捉方法、基于LSTM-PM的姿态捕捉方法作为对比,在三个数据集上,三种不同方法在不同关节处的正确关节点百分比(PCK)如表2所示。

分析表2得出,本文方法在人体运动姿态信息捕捉上表现出显著性能优势。在三个数据集上,本文方法在人体关键节点上的PCK指标值均高于对比方法,特别是在手腕、脚踝等较难捕捉的关节点上,其优势更为明显。这说明本文方法在处理复杂人体姿态变化、提高姿态捕捉精度方面均取得了突出成果,为人体运动分析、动作识别等领域提供了更加可靠的技术支持。

本文通过设计消融实验进一步验证研究方法中各个组件对姿态捕捉性能的具体贡献,设定方案一为本文方法所用模型;方案二在方案一的基础上减去特征融合模块;方案三、四分别对应方案一中的上、下分支网络。不同设计方案下的平均每关节位置误差(MPJPE)、AUC指标差异如表3所示。

通过消融实验对比发现,方案一的MPJPE、AUC指标值均高于其他方案,这充分验证了研究方法在人体运动姿态信息捕捉上表现出最优性能;方案二在去除特征融合模块后,MPJPE指标显著增加,AUC指标值下降,表明特征融合模块对于提升姿态捕捉的准确性和模型的整体性能具有关键作用;对于方案三、四而言,单分支网络性能低于完整模型,说明两个分支网络的协同工作对于优化姿态捕捉效果至关重要。综上所述,消融实验进一步证实了本文方法中各个组件的重要性和相互间的协同效应,为人体运动姿态信息捕捉技术的发展提供了有力支持。

图7中的人体运动视频图像为例,应用本文方法对其进行人体运动姿态信息捕捉,实验结果如图8所示。

分析图7图8得出,本文方法可实现人体运动姿态信息的捕捉,清晰地展示了运动过程中关节的精确位置变化及姿态的动态演变,这种高精度的姿态捕捉能力,不仅有助于深入理解人体运动的内在机制,还为运动科学、康复训练、人机交互等多个领域的研究和应用提供了强有力的技术支持。

3 结束语

本文构建了双分支人体运动姿态信息捕捉模型,利用基于Transformer的时序特征提取网络揭示人体姿态的变化,通过构建球面关节描述符矩阵并通过CNN网络对其进行学习,获取运动姿态特征,通过对提取的特征作互补融合,成功实现了对复杂环境中人体运动姿态信息的精准捕捉。

未来,将进一步优化模型结构,探索更多特征融合方式,以期在实时性、精确度和泛化能力上实现更大突破,推动人体运动分析技术在更多实际应用场景中的普及与深化。

参考文献

[1]

杨天金, 侯振杰, 李兴, . 多聚点子空间下的时空信息融合及其在行为识别中的应用[J]. 自动化学报, 2022, 48(11): 2823-2835.

[2]

Yang Tian-jin, Hou Zhen-jie, Li Xing, et al. Recognizing action using multi-center subspace learning-based spatial-temporal information fusion[J]. Acta Automatica Sinica, 2022,48(11):2823-2835.

[3]

马亚彤, 王松, 刘英芳. 融合多模态数据的人体动作识别方法研究[J]. 计算机工程, 2022, 48(9):180-188.

[4]

Ma Ya-tong, Wang Song, Liu Ying-fang. Research on Human Action Recognition Method by Fusing Multimodal Data[J]. Computer Engineering, 2022, 48(9):180-188.

[5]

肖志涛, 张曌, 王雯. 基于运动学动态图的人体动作识别方法[J]. 天津工业大学学报, 2021, 40(1): 53-59.

[6]

Xiao Zhi-tao, Zhang Zhao, Wang Wen. Human.action recognition based on kinematic dynamic image[J]. Journal of Tianjin Polytechnic University, 2021,40(1): 53-59.

[7]

马骁, 闫育东. 基于多尺度时空特征的篮球场景中人体姿态估计[J]. 中南民族大学学报: 自然科学版, 2023, 42(1): 95-102.

[8]

Ma Xiao, Yan Yu-dong. Multiscale spatio-temporal correlation feature learning for human pose estimation [J].Journal of South-Central University for Nationalities (Natural Science Edition), 2023, 42(1): 95-102.

[9]

冯心欣, 李文龙, 何兆, . 基于调频连续波雷达的多维信息特征融合人体姿势识别方法[J]. 电子与信息学报, 2022, 44(10): 3583-3591.

[10]

Feng Xin-xin, Li Wen-long, He Zhao,et al.Human posture recognition based on multi-dimensional information feature fusion of frequency modulated continuous wave radar[J]. Journal of Electronics & Information Technology, 2022, 44(10): 3583-3591.

[11]

苏本跃, 张鹏, 朱邦国, . 投影子空间下基于骨骼边信息的人体动作识别[J]. 系统仿真学报, 2024, 36(3): 555-563.

[12]

Su Ben-yue, Zhang Peng, Zhu Bang-guo, et al. Human action recognition based on skeleton edge information under projection subspace[J]. Journal of System Simulation, 2024, 36(3): 555-563.

[13]

邓平, 吴明辉. 基于机器学习的人体运动姿态识别方法[J]. 中国惯性技术学报, 2022, 30(1): 37-43.

[14]

Deng Ping, Wu Ming-hui. Human motion attitude recognition method based on machine learning[J].Journal of Chinese Inertial Technology, 2022, 30(1):37-43.

[15]

Kumar R, Kumar S. Survey on artificial intelligence-based human action recognition in video sequences[J]. Optical Engineering, 2023, 6(22): 1-21.

[16]

王瀛, 徐奔, 左方. 基于HOF-CNN和HOG特征的视频动作识别系统[J]. 计算机仿真, 2022, 39(6): 179-182+318.

[17]

Wang Ying, Xu Ben, Zuo Fang. A video action recognition system based on HOF-CNN and HOG features[J]. Computer Simulation, 2022, 39(6):179-182, 318.

[18]

雷永升, 丁锰, 沈尧, . 基于改进双流视觉Transformer的行为识别模型[J]. 计算机科学, 2024, 51(7): 229-235.

[19]

Lei Yong-sheng, Ding Meng, Shen Yao, et al. Action recognition model based on improved two stream vision transformer[J]. Computer Science, 2024, 51(7): 229-235.

[20]

曹建荣, 吕俊杰, 武欣莹, . 融合运动特征和深度学习的跌倒检测算法[J]. 计算机应用, 2021, 41(2): 583-589.

[21]

Cao Jian-rong, Lv Jun-jie, Wu Xin-ying, et al. Fall detection algorithm integrating motion features and deep learning[J]. Journal of Computer Applications, 2021, 41(2): 583-589.

[22]

吴子依, 陈泯融. 融合时空域注意力模块的多流卷积人体动作识别[J]. 华南师范大学学报: 自然科学版, 2023, 55(3): 119-128.

[23]

Wu Zi-yi, Chen Min-rong. Multi-stream convolutional human action recognition based on the fusion of spatio-temporal domain attention module[J]. Journal of South China Normal University (Natural Science Edition), 2023, 55(3): 119-128.

[24]

田志强, 邓春华, 张俊雯. 基于骨骼时序散度特征的人体行为识别算法[J]. 计算机应用, 2021, 41(5): 1450-1457.

[25]

Tian Zhi-qiang, Deng Chun-hua, Zhang Jun-wen. Human behavior recognition algorithm based on skeletal temporal divergence feature[J]. Journal of Computer Applications, 2021, 41(5): 1450-1457.

[26]

吉晨钟, 次旺晋美, 张伟, . 改进2D CNN时空特征提取的动作识别研究[J]. 小型微型计算机系统, 2024, 45(1): 168-176.

[27]

Ji Chen-zhong, Ci Wang jin-mei, Zhang Wei, et al. Research on action recognition based on improving 2D CNN spatial-temporal feature extraction[J]. Journal of Chinese Computer Systems, 2024,45(1):168-176.

[28]

张聪聪, 何宁, 孙琪翔, . 基于注意力机制的3D DenseNet人体动作识别方法[J]. 计算机工程, 2021, 47(11): 313-320.

[29]

Zhang Cong-cong, He Ning, Sun Qi-xiang, et al. Human motion recognition method based on attention mechanism of 3D DenseNet [J]. Computer Engineering, 2021, 47(11): 313-320.

基金资助

国家自然科学基金项目(72374154)

AI Summary AI Mindmap
PDF (1429KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/