GMambaScanX:基于双流并行的三维人体姿态估计

汤昊霖 ,  袁煜麟 ,  卢笑 ,  汪鲁才 ,  吴成中 ,  王耀南

武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (4) : 463 -472.

PDF (2705KB)
武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (4) : 463 -472. DOI: 10.14188/j.1671-8836.2024.0143
人工智能与深度学习

GMambaScanX:基于双流并行的三维人体姿态估计

作者信息 +

GMambaScanX: A 3D Human Pose Estimation Method Based on Dual-Stream Parallelism

Author information +
文章历史 +
PDF (2769K)

摘要

基于Transformer的模型通过编码所有的关节点之间的连接关系,捕获全局视野的数据依赖关系,因而在三维人体姿态估计任务中取得了优秀性能。然而这类方法无法对关节局部依赖关系进行建模,且存在模型计算复杂度随序列长度平方增长的计算资源浪费问题。为了解决上述问题,本文将人体运动过程定义为状态空间模型的序列输入和输出过程,提出基于GCN(Graph Convolutional Network)和Mamba双流并行的人体结构扫描三维姿态估计方法GMambaScanX,GCN模型对人体运动序列时空邻接关系进行建模,增强模型的局部依赖关系捕获能力。Mamba模型对人体运动序列时空长程关系进行建模,增强模型的全局依赖关系捕获能力,提出两种MambaScan扫描策略,针对人体运动状态转移特征的时序关节扫描,增强模型在时间维度对人体运动特征的理解能力;针对人体关节结构特征的人体结构先验引导的空间关节扫描,增强模型在空间维度对人体结构特征的理解能力。GMambaScanX在Human3.6M数据集上进行训练验证,平均关节位置误差为39.8 mm,参数量仅为MotionBERT的12.4%(5.3×106)。相比于进行全连接建模,GMambaScanX能够更好地提取人体结构特征,高效使用参数,提高模型的有效性与效率。

Abstract

Transformer-based models have excelled in 3D human pose estimation tasks by effectively encoding the interconnections among all joints, thus capturing the global dependencies inherent in the data. However, such methods often fail to adequately model the local dependencies of joints and suffer from a quadratic increase in computational complexity with sequence length, leading to a waste of computational resources. To address these issues, this study defines the human motion process as a sequence of input-output processes of a state-space model and proposes a 3D human pose estimation method, GMambaScanX, based on the fusion of GCN and Mamba. The GCN model captures the spatiotemporal local dependencies of human motion sequences, thereby enhancing the model's ability to capture local relationships. The Mamba model captures the spatiotemporal long-range dependencies of human motion sequences, thereby improving the model's ability to capture global relationships. We present two MambaScan scanning strategies: a sequential joint scan for temporal motion state transitions, which enhances the model's comprehension of human motion features within the temporal dimension, and a spatial joint scan informed by human structural prior knowledge, which augments the model's understanding of human structural features in the spatial domain. GMambaScanX was trained and validated on the Human3.6M dataset, achieving an average joint position error of 39.8 mm with only 12.4% (5.3×106) of the parameters of MotionBERT. Compared with fully connected models, GMambaScanX better extracts human structural features, utilizes parameters more efficiently, and improves the model's effectiveness and efficiency.

Graphical abstract

关键词

三维人体姿态估计 / 状态空间模型 / 图卷积网络 / 人体结构关节点扫描

Key words

3D human pose estimation / state-space model / graph convolutional network / human joint structure scanning

引用本文

引用格式 ▾
汤昊霖,袁煜麟,卢笑,汪鲁才,吴成中,王耀南. GMambaScanX:基于双流并行的三维人体姿态估计[J]. 武汉大学学报(理学版), 2025, 71(4): 463-472 DOI:10.14188/j.1671-8836.2024.0143

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

当前,智慧教育技术的应用已经从文化教育扩展到综合教育体系中,在人工智能赋能的综合素质评价中,不仅要评估学生对各门课程知识掌握情况以及运用知识解决问题的能力,还要对学生生活方式、体育锻炼习惯、身体机能、运动技能等进行评估。三维人体姿态估计技术是智慧教育技术应用场景中的下游任务,能够对在运动场景中学生多样和自遮挡的运动姿态进行估计。但智慧体育教育中,传统的三维人体姿态估计方法难以理解人体结构的内在关联。一旦遇到关节遮挡的情况,便很难准确地对姿态进行估计,从而无法为学生运动姿态提供正确指导。

三维人体姿态估计任务目标是从单目二维图像或视频序列输入中预测人体关节变化的三维坐标。该任务可以分为两个步骤,第一步使用现有的2D关键点检测器,如CPN[1]、OpenPose[2],估计人体关节的2D坐标,第二步将这些2D坐标映射到对应的3D坐标。在本工作中,模型使用单目视频作为输入[3],采用CPN二维姿态检测器[1]提取2D坐标,重点关注二维姿态提升到三维姿态步骤。

现有三维人体姿态估计广泛采用基于Transformer[3]和图卷积网络(Graph Convolutional Network,GCN)[4]的架构。Transformer架构的优势在于采用了注意力机制捕获全局依赖关系,但局部依赖捕获能力不足。图神经网络架构优势在于利用图中的节点及边进行消息传递捕捉局部依赖关系,但全局依赖捕获能力不足。

状态空间模型[5](State Space Model,SSM)是一种用于描述动态系统行为的数学模型,不同于Transformer采用注意力机制获取不同时序状态的全局依赖关系,SSM用一组一阶微分方程(连续时间系统)或差分方程(离散时间系统)表示系统的内部状态的演化,同时用另一组方程描述系统状态和输出之间的关系。这些方程可以表示为矩阵和向量的形式,将系统离散化后,使用离散卡尔曼滤波器对系统状态进行估计,实现网络的推理与训练。Gu等[6]在此基础上提出了选择性状态空间模型(Mamba)。Mamba模型是一种基于状态空间模型(SSM)的新型深度学习架构,能够在保持线性计算复杂度的同时,有效建模长程依赖关系,这一特性使其在处理长序列数据时表现出色,其架构设计独特,引入时变参数动态调整模型的状态,允许模型根据输入数据选择性地传递或遗忘信息,从而能够更有效的处理离散和长序列数据。

在人体姿态估计[7]中,Mamba模型的长序列建模[8]能力具有巨大的应用潜力,它能够处理人体运动的时间序列数据,捕捉到人体姿态在时间维度上的变化和依赖关系[9]。例如,在分析一段连续的人体运动视频时,Mamba模型将人体视为系统,通过系统状态转移方程对人体时间尺度运动进行建模,理解动作的时序变化,从而更准确地估计人体在不同时刻的姿态。然而,单向Mamba模型推理当前帧时无法获取序列后向的信息,因此,文献[10]对矩阵进行研究,提出一种以半可分矩阵为基础的双向Mamba框架,为双向Mamba提供了数学理论支撑。然而现有的Mamba模型仍面临一些挑战,如针对复杂关系单元扫描顺序设计。在三维人体姿态估计任务中,对人体空间结构依赖关系十分重要,因此本文提出时序关节扫描与人体结构先验引导的空间关节扫描,分别提取人体运动序列全局的时间与空间信息。

GCN近年来在三维人体姿态估计领域取得了显著进展。GCN能够直接处理不规则的图结构数据,这对于处理人体骨架的拓扑结构尤为重要。人体的姿态通常由多个关节点组成,这些关节点之间存在复杂的空间关系,且这种关系可以通过图的形式建模。不同于Transformer对数据进行全局的相互索引,GCN利用图中的节点及链接节点的边进行消息传递,捕捉局部的关节间依赖关系。

基于GCN的方法在骨架动作识别任务[11]中取得了显著的成果,其在三维人体姿态估计任务中表现出了较高的计算效率,相较于Transformer方法,GCN能够更有效地处理局部关联信息[12]。然而,传统GCN通常侧重于建模相邻关节之间的关系,这使得其在表达全局依赖时存在不足。为了解决这一问题,Modulated-GCN[13]通过引入权重调制和关联调制,克服了传统GCN方法依赖固定人体骨架图结构的局限性,从而能够捕捉到更广泛的关联关系,超越了骨架连接的局部限制,进而提升了全局信息的表示能力。这一改进使得GCN方法在处理复杂人体动作时表现得更为精准。在此基础上,GLA-GCN[14]进一步引入了自适应GCN机制,通过跨步设计减轻长序列处理中的计算负担,并通过更轻量级的内存需求提高其可扩展性,使基于GCN的方法能够在捕捉局部依赖关系时更高效,但在面对人体运动序列的时序信息提取能力不足。因此本文提出时序GCN与空间GCN,分别提取人体运动序列的局部时间与空间信息。

人体运动序列有时间和空间两个维度的信息,人体的姿态是由关节点组成,关节间存在简单相邻与复杂联动关系,本文提出基于GCN和Mamba双流并行的人体结构扫描三维姿态估计方法,利用Mamba的低复杂度解决Transformer模型的计算困难问题,利用GCN补充Mamba在捕获局部关节间关系时能力不足的问题;还提出了一种人体结构先验引导的扫描策略,以使Mamba适应人体关节序列的空间维度输入。

1  本文方法

1.1 方法原理

在状态空间模型(SSM)中,假设用时间跨度t表示动态系统的状态。使用两个方程定义动态系统状态的演变:

h'(t)=Ah(t)+Bx(t)
y(t)=Ch(t)+Dx(t)

其中,h(t)RD表示隐状态;x(t)R代表输入信号即人体二维姿态;y(t)R表示输出信号即人体三维姿态;ARD×DBRD×1CRD×DDR是可学习的参数。SSM学习如何将输入信号x(t)转换为潜在状态h(t),用于对系统动力学建模并预测其输出y(t)。通过设置步长Δ,将状态空间模型离散化,以递归形式定义的状态空间模型能够实现顺序推理,从而高效地捕捉时间依赖关系,并通过卷积形式实现并行训练,提高计算效率。在此基础上,Gu等[6]提出Mamba以解决SSM模型缺乏选择性和序列建模的效率瓶颈问题。它集成了一个选择机制,允许可学习的参数与输入序列动态交互,因此可以选择性地回忆或忽略已输入的信息序列,同时保持序列长度的线性可扩展性。

1.2 算法整体框架

图1所示,给定带有置信度评价的2D姿态坐标序列XRB×T×J×3,GMambaScanX模型输出其对应的三维姿态坐标序列P^RB×T×J×3,其中B为批处理大小,T为帧数,J为关节数(本文中J=17)。GMambaScanX首先将每个时间帧中的每个关节映射到D维特征FRB×T×J×D,随后将关节未知编码输入网络进行处理。网络由n个GMambaScanX块组成,以有效捕获骨骼序列的深层三维结构,经由网络处理后的特征F通过全连接层映射到更高维度,进一步提取特征,最后使用表征头估计三维姿态坐标序列P^。整体网络采用位置损失L3D和速度损失LΔP进行训练,定义如下:

L3D=t=1Tj=1jP^t,j-Pt,j
LΔP=t=2Tj=1jΔP^t,j-ΔPt,j

式中,P^t,jR3表示模型输出的第t帧第j个关节的坐标;Pt,jR3序列第t帧第j个关节的真实坐标;ΔP^=P^t-P^t-1表示模型输出序列的帧间差值,ΔP=Pt-Pt-1表示真实序列的帧间插值。总损失定义如下:

L=L3D+λΔPLΔP

其中,系数λΔP用于平衡位置精度和运动平滑度比例。

1.3 GMambaScanX模块

GMambaScanX模块由时空GCN与时空MambaScan两条通路以及自适应融合模块组成。其中,时空GCN通路由时序GCN模块和空间GCN模块组成;时空MambaScan通路由时序MambaScan模块和空间MambaScan模块组成,双路是由先空间模块后时间模块串联构成。时空GCN通路利用GCN提取序列间的邻接关系;时空MambaScan通路利用Mamba处理数据的长程依赖关系。这种双流架构能够使模块聚合不同结构网络的优势,进行全面且精准的三维姿态估计。在时序MambaScan/GCN中,网络将运动序列的不同帧进行不同标记处理,捕获动作间的帧间长程/短程运动关系。在空间MambaScan/GCN中,网络将单个身体关节视为不同标记,高效捕获单个帧内的远距离/相邻关节关系。GCN流具有更强的捕获细节能力,而MambaScan流具有对全局关系的联接能力,最后将两条通路得到的不同特征进行自适应融合,得到了两种关注不同信息的融合特征。

1) 时空MambaScan模块

图2(a),在单向MambaScan流程中,输入为FRB×T×J×D,单向MambaScan的输出表示为:

FMamba=SSMf(σ(Norm(F)BC))

其中,Norm(·)表示层归一化,BCRD×D为可学习矩阵。单向的MambaScan有应用实时估计任务的潜力,但无法获取序列后向的信息。因此一些工作采用双向扫描后进行融合的方法,使模型能够兼顾前后方向的信息。与简单的元素加法不同,Hydra Mamba[10]通过对结构化矩阵的探索,为Mamba模型提供了一种基于准可分矩阵定义的Mamba模型双向扩展。与使用两个不同的SSM后进行融合相比,这种双向MambaScan模块仅需要一半的参数量。

图2(b)所示,双向MambaScan的输入为FRB×T×J×D,SS()表示半可分矩阵处理;b,c为参数共享的前向与后向矩阵;Y表示经半可分矩阵处理的前向与后向特征。双向MambaScan的输出表示为:

FMamba=shift(SS(F))+flip(SS(flip(F))+DF

其中,shift()表示将序列进行右移,并以0填充开头,flip()表示将输入序列反转操作。公式第一项shift(SS(F))构成拟可分矩阵的下三角部分,实现与前向特征的依赖关系,第二项flip(SS(flip(F))构成拟可分矩阵的上三角部分,实现与后向特征的依赖关系,DF为拟可分矩阵的对角线部分,表示当前元素的自相关关系。这种双向MambaScan模块可以将序列前后特征融合在一个矩阵中。为了分别提取时间与空间信息,本文设计了时序关节扫描与人体结构先验引导的空间关节扫描。

时序关节扫描在空间维度将不同关节作为独立特征处理,沿时间维度对F进行扫描,以分析时间维度上单个关节随运动变化的帧间关系,如图3(a)。

空间关节扫描将每帧的姿态作为独立特征处理。由2D姿态检测器得到的17个关节在空间上不连续排序,使得MambaScan模块难以对复杂的人体关节连接关系进行建模。针对此问题,本文根据人体的对称特征与沿躯干的运动传导特征,提出人体结构先验引导的MambaScan扫描方法,采取左脚→髋骨→颈部→右手的沿躯干扫描顺序,相比默认排序的髋骨→左脚→右脚的默认顺序跳跃扫描,这种沿躯干的扫描顺序能够基于人体结构先验知识更好的提取关节坐标依赖关系,如图3(b)。

2) 时空GCN模块

GCN方法关注的是信息局部连接关系。本文使用两种GCN模块,时序GCN和空间GCN,分别提取人体运动的空间信息与时序信息,以此获取关节间与运动间的局部连接关系(如图4)。GCN的输入为人体17个关节特征数据FRB×T×17×D,GCN模块定义为[4]

GCN(F)=σ(F+Norm(D˜-12A˜D˜-12FW1+FW2))

其中,A˜=A+IN表示添加了自连接的邻接矩阵,IN表示单位矩阵,D˜ii=jA˜ij定义为沿对角线的元素之和,W1W2表示特定于每层的可训练权重矩阵,σ()为sigmoid激活函数,Norm()表示批处理归一化。GCN模块的输出经过全连接层和残差层后的输出表示为:

XG'=X+GCN(Norm(X))
XG=XG'+MLP(Norm(XG'))

空间GCN和时间GCN的区别在于它们的邻接矩阵。如图4(a)所示,在空间GCN中,邻接矩阵根据人体关节拓扑关系设置,矩阵表示17个关节的相邻属性。通过这种方式构建的邻接矩阵针对人体相邻关节的连接特征进行提取。

图4(b)所示,在时序列GCN中,首先计算第p帧任意单个关节(Xpi)TXpj的相似性,如下所示:

Sim(Xpi,Xpj)=(Xpi)TXpj

随后在时间图中选择K个相近的关节作为连接节点,关节点的特征是通过时序输入计算得到的,此时时序GCN根据节点特征构成动态的时间邻接矩阵,其中每个关节点仅连接相似性最高的K个节点。通过这种方式构建的时序GCN模块能针对不同输入灵活构建不同邻接矩阵,为模型提供面对复杂运动情况的适应能力。

2  实验结果与分析

2.1 实验设置

本文在三维人体姿态估计任务的公开数据集Human3.6M[7]和MPI-INF-3DHP[15]上进行了实验,并与7种最新3D人体姿态估计方法进行了比较,它们分别是:MHFormer [16],MixSTE[17],STCFormer[18],PoseFormerV2[19],GLA-GCN[14],MotionBERT[20],HDFormer[21]。其中:MHFormer[21]和PoseFormerV2[19]仅生成序列中心帧;MixSTE[17]、STCFormer[18]和HDFormer[21]是基于Transformer的方法;GLA-GCN[14] 是基于GCN网络的方法;MotionBERT[20]是一种融合方法,应用于多种下游任务。

Human3.6M是一个被广泛应用于三维人体姿态估计的室内数据集,因其数据丰富和多样性而备受研究者青睐。该数据集包含360万帧视频,记录了11名不同受试者在执行15种日常活动时的动作,为三维人体姿态估计相关研究提供全面的姿态数据。本工作遵循三维人体姿态估计研究的标准流程。在训练阶段,选择了受试者1、5、6、7和8的数据训练模型;在测试阶段,使用受试者9和11的数据进行模型的性能验证。避免模型对特定动作或人体的过拟合,更准确地评估其在各种动作与人体上的泛化能力。采用平均关节位置误差(MPJPE)与Procrustes平均关节位置误差(P-MPJPE)作为评估指标。这两个指标越小,表示算法越好。通过这两种评估方法的综合使用,可以更全面地了解模型在不同情况下的性能,从而为进一步的改进提供参考。

MPI-INF-3DHP(3DHP)是一个在多种室内和室外环境中收集的大型数据集,包括超过130万帧视频数据,记录了8位演员执行8种不同的动作。在评估方法上,在该数据集上的评估遵循Mehraban等[22]的工作,采用了MPJPE、150 mm范围内的正确关键点百分比(PCK)和曲线下面积(AUC)作为评估指标。

2.2 实验环境和设置

本文所提出的GMambaScanX使用pytorch框架实现,并在单个Nvidia 4090 GPU上进行训练和测试。训练过程中,batchsize设置为8个序列,使用AdamW优化器对网络参数进行优化,权重衰减为0.01,初始学习率设置为5E-4,采用指数学习率衰减,衰减参数为0.99。初始过程的二维姿态检测结果通过CPN网络获得。

为了在准确性与计算成本之间取得平衡,实验在基于243帧的模型上进行,使用时可根据不同的需求更换不同的参数,例如修改序列长度T和模型深度n,实现在长时序处理或更精确的估计之间进行调整。

2.3 实验结果

本文方法在Human3.6M数据集上的定量实验结果如表1所示,其中T表示输入运动序列帧数,Params表示网络参数量,MACs表示计算量。目前在Human3.6M上取得较好结果的模型大多是基于Transformer构建,但这些模型通常具有很高的计算复杂度与计算资源需求,本文的GMambaScanX基于Mamba模型构建,既明显提高了精度,又显著降低了对计算资源的需求。对比仅生成中心帧的PoseformerV2,本文方法能对序列每一帧生成对应三维姿态,同时MPJPE降低11.9%。对比引入自适应GCN方法的GLA-GCN,本文全局-局部融合的方法帧间连续性更佳且MPJPE降低了10.3%。对比MotionBERT,本文方法仅使用其12.47%(5.3×106)的参数量,MPJPE误差仅相差0.6 mm,展现出模型的参数使用高效性。

本文方法在MPI-INF-3DHP数据集上的实验结果如表2所示。由于该数据集的视频序列较短,本文使用了81帧序列进行模型训练。由表2可知,本文方法AUC为87.5%,MPJPE为17.4 mm;相比于MotionBERT,AUC低了0.5个百分点,但PCK高出0.1个百分点,且MPJPE降低了0.8 mm。这表明,尽管AUC稍低,但本文方法在其他指标上表现更好,尤其在低遮挡情况下,能够更精确地估计关节坐标。综上所述,本文方法不仅在模型参数量较低的情况下达到了接近MotionBERT的性能,而且在不同场景中都展现了良好的鲁棒性,证明了其在室内和室外环境中的有效性。

图5展示了本文所提出的GMambaScanX在Human3.6M数据集上三种不同姿态的可视化实验结果。由图5可见,坐姿状态下的身体主干部分,GMambaScanX能够实现高精度三维人体姿态估计,而对高遮挡左臂部分,GMambaScanX展现出优于一般模型的人体空间比例认知与位置判断能力。

2.4 消融实验

在Human3.6M数据集上进行了消融实验研究,以探索GMambaScanX的不同结构设计效果。

2.4.1 模型深度与宽度

表3所示,在同为128维度条件下,6层模型的参数量约为12层模型的1/2。6层、128特征维度模型在计算资源与精度之间达到了平衡。

模型显存占用6.7 GB,与基于Transformer的模型同参数对比,显存需求仅为1/3。

2.4.2 扫描方式

对不同扫描方式进行消融实验,结果如表4所示。仅进行单向帧间顺序扫描的MPJPE为44.1 mm,使用双向帧间顺序扫描模型MPJPE下降到42.2 mm;参数量为60.1×106,将双向帧间顺序扫描修改为时序关节扫描+空间关节扫描后,MPJPE降低到39.8 mm,同时参数量下降为5.3×106,极大地降低了参数量。表明本文采用的时序关节扫描+空间关节扫描是有效的。

2.4.3 时间/空间位置编码的消融实验

表5可以看出,在空间位置编码的基础上加入时间位置编码,会导致MPJPE增加。这是由于GCN流的非置换等变性以及Mamba流推理过程的时间连续性质所致。与基于Transformer的方法不同,基于Mamba的网络通过结构自然保留序列的时间关系,因此不需要额外的时间位置编码。

2.4.4 GCN流与MambaScan流消融实验

在Human3.6M数据集上对GCN流和MambaScan流与双流融合进行消融实验,结果如表6所示。只训练GCN的MPJPE为54.2 mm,只训练MambaScan的MPJPE为44.7 mm。结果显示GCN仅关注局部依赖关系,在捕捉相邻关节局部依赖关系有优势。MambaScan网络仅关注长程依赖关系,在捕捉长时序运动与不相邻关节远距离依赖关系有优势。双流架构的GMambaScan 能够兼顾时空远近依赖关系的能力,MPJPE为39.8 mm,能够融合两种网络的优势。

2.5 在智慧教育场景中的应用

本文提出的方法作为人工智能赋能教育领域的基础问题和上游任务,能广泛应用于学生多场景运动数据的伴随式采集的动作评价、运动过程分析、运动健康挖掘等领域。例如在对学生的体育测验评分中,可精确识别引体向上手臂与躯干的收缩位置,帮助判断训练时动作程度,测验动作是否达到计分标准。有助于对学生日常活动数据的采集,如行走步幅、课堂脊柱姿态采集等。帮助分析学生活动时的运动隐患,如常见于青少年群体的走路膝关节超伸,踮脚导致膝关节压力过大,驼背导致隐性体态问题与视力问题等。

图6展示了GMambaScanX在运动训练场景中的应用。GMambaScanX在对青少年体能心肺训练部分的深蹲内侧抬腿碰脚动作的姿态估计中展现出对深蹲时下肢正确发力支撑的姿态估计能力。对比GLA-GCN和PostFormerV2方法,本文提出的GMambaScanX对部分遮挡的上肢长度比例估计与无遮挡的下肢支撑姿态估计最优。

3  结 语

本文提出的GMambaScanX是一种能够聚合GCN与Mamba网络模型各自优点对人体三维姿态进行全面准确估计的模型,GMambaScanX同时获得对2D序列中3D人体结构的理解能力与人体运动的帧间动态分析能力,有效地提升了已有方法在三维人体姿态估计任务中的性能。通过将GCN的图结构建模能力与Mamba模型的选择性状态空间机制相结合,GMambaScanX不仅能在人体骨架拓扑结构的建模中充分利用关节点之间的依赖关系,还能够有效捕获人体运动的时空动态变化,获得了更好的姿态估计性能。

实验结果表明,GMambaScanX避免了Transformer模型在处理长序列数据时的计算复杂度问题,与GCN融合提升了模型捕获骨架关节间远近依赖关系的能力。针对Mamba模型在序列关系复杂的情况下难以应用问题,GMambaScanX结合人体结构先验知识,设计一种针对人体三维姿态估计任务的扫描方式。结果显示,模型在理解人体结构方面有其独有的优势。

未来的研究可以进一步探索如何将该方法应用在更复杂的场景下,例如多模态数据融合或在遮挡、多人时的人体姿态估计。此外,还可考虑将该方法推广应用于其他时序建模任务,如视频行为分析和运动捕捉领域,以探索其更广泛的应用潜力。

参考文献

[1]

CHEN Y LWANG Z CPENG Y Xet al. Cascaded pyramid network for multi-person pose estimation[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2018: 7103-7112. DOI: 10.1109/CVPR.2018.00742 .

[2]

OSOKIN D. Real-time 2D multi-person pose estimation on CPU: Lightweight OpenPose[EB/OL]. 2018: 1811.12004. DOI: 10.5220/0007555407440748 .

[3]

VASWANI ASHAZEER NPARMAR Net al.Attention is all you need[EB/OL]. [2024-02-15]. DOI: 10.1007/978-3-031-84300-6_13 .

[4]

KIPF T NWELLING M. Semi-supervised classification with graph convolutional networks[EB/OL]. 2016: 1609.02907. DOI: 10.48550/arXiv.1609.02907 .

[5]

SMITH A CBROWN E N. Estimating a state-space model from point process observations[J]. Neural Computation200315(5): 965-991. DOI: 10.1162/089976603765202622 .

[6]

GU A, DAO T. Mamba: Linear-time sequence modeling with selective state spaces[EB/OL]. 2023: 2312.00752.

[7]

IONESCU CPAPAVA DOLARU Vet al. Human3.6M: Large scale datasets and predictive methods for 3D human sensing in natural environments[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence201436(7): 1325-1339. DOI: 10.1109/TPAMI.2013.248 .

[8]

DAO T, GU A. Transformers are SSMs: Generalized models and efficient algorithms through structured state space duality[EB/OL]. 2024: 2405.21060.

[9]

ZHU L HLIAO B CZHANG Qet al. Vision Mamba: Efficient visual representation learning with bidirectional state space model[EB/OL]. 2024: 2401.09417.

[10]

HWANG SLAHOTI A, DAO T, et al. Hydra: Bidirectional state space models through generalized matrix mixers[EB/OL]. 2024: 2407.09941.

[11]

CHEN Y XZHANG Z QYUAN C Fet al. Channel-wise topology refinement graph convolution for skeleton-based action recognition[C]//2021 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2021: 13339-13348. DOI: 10.1109/ICCV48922.2021.01311 .

[12]

CI H, WANG C YMA X Xet al. Optimizing network structure for 3D human pose estimation[C]//2019 IEEE/CVF International Conference on Computer Vision (ICCV).New York: IEEE Press, 2019: 2262-2271. DOI: 10.1109/ICCV.2019.00235 .

[13]

ZOU Z MTANG W. Modulated graph convolutional network for 3D human pose estimation[C]//2021 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2021: 11457-11467. DOI: 10.1109/ICCV48922.2021.01128 .

[14]

YU B X BZHANG ZLIU Y Xet al. GLA-GCN: Global-local adaptive graph convolutional network for 3D human pose estimation from monocular video[C]//2023 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2023: 8784-8795. DOI: 10.1109/ICCV51070.2023.00810 .

[15]

MEHTA DRHODIN HCASAS Det al. Monocular 3D human pose estimation in the wild using improved CNN supervision[C]//2017 International Conference on 3D Vision (3DV). New York: IEEE Press, 2017: 506-516. DOI: 10.1109/3DV.2017.00064 .

[16]

LI W HLIU HTANG Het al. MHFormer: Multi-hypothesis transformer for 3D human pose estimation[C]//2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2022: 13137-13146. DOI: 10.1109/CVPR52688.2022.01280 .

[17]

ZHANG J LTU Z GYANG J Yet al. MixSTE: Seq2seq mixed spatio-temporal encoder for 3D human pose estimation in video[C]//2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2022: 13222-13232. DOI: 10.1109/CVPR52688.2022.01288 .

[18]

TANG Z HQIU Z FHAO Y Bet al. 3D human pose estimation with spatio-temporal criss-cross attention[C]//2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2023: 4790-4799. DOI: 10.1109/CVPR52729.2023.00464 .

[19]

ZHAO Q TZHENG CLIU M Yet al. PoseFormerV2: Exploring frequency domain for efficient and robust 3D human pose estimation[C]//2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2023: 8877-8886. DOI: 10.1109/CVPR52729.2023.00857 .

[20]

ZHENG CZHU S JMENDIETA Met al. 3D human pose estimation with spatial and temporal transformers[C]//2021 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2021: 11636-11645. DOI: 10.1109/ICCV48922.2021.01145 .

[21]

CHEN H YHE J YXIANG W Met al. HDFormer: High-order directed transformer for 3D human pose estimation[EB/OL]. 2023: 2302.01825. DOI: 10.24963/ijcai.2023/65 .

[22]

MEHRABAN SADELI VTAATI B. MotionAGFormer: Enhancing 3D human pose estimation with a transformer-GCNFormer network[C]//2024 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV). New York: IEEE Press, 2024: 6905-6915. DOI: 10.1109/WACV57701.2024.00677 .

基金资助

国家自然科学基金(62007007)

国家自然科学基金(62277004)

湖南省自然科学基金(2023JJ30415)

湖南省自然科学基金(2022JJ30395)

江西省重大专项(20232ACC01007)

江西省重大专项(20232ABC03A09)

吉安市科技计划“揭榜挂帅”项目(20233TGV06020)

湖南省学位与研究生教学改革研究重点项目(2022JGZD026)

湖南省研究生科研创新项目(CX20240547)

AI Summary AI Mindmap
PDF (2705KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/