基于多尺度与多级语义融合Transformer的人体姿态估计

李俊, 袁通达, 陈黎

武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (4) : 473 -484.

PDF (3270KB)
武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (4) : 473 -484. DOI: 10.14188/j.1671-8836.2024.0094
人工智能与深度学习

基于多尺度与多级语义融合Transformer的人体姿态估计

    李俊1, 2, 袁通达1, 陈黎1, 2
作者信息 +

Human Pose Estimation Based on Multi‑Scale and Multi‑Level Semantic Fusion Transformer

    Jun LI1, 2, Tongda YUAN1, Li CHEN1, 2
Author information +
文章历史 +
PDF (3347K)

摘要

针对人体姿态估计任务中视觉Transformer模型存在的尺度多样性受限和近距离信息忽视问题,提出多尺度与多级语义融合Transformer(MMSF)模型。该模型通过引入关键点标记作为代理的交叉Transformer操作,实现了不同分辨率视觉信息的相互学习,提高了估计精度。同时,利用深度卷积和稠密连接复用标记技术,有效提取了含有多级语义信息的交叉标记,减少了编码器层堆叠,降低了模型复杂度。通过交叉标记与标准标记的交叉融合注意力操作,整合了多级语义信息,进一步增强了姿态估计效果。实验结果表明,在相同的条件下,MMSF模型在COCO数据集上达到了78.1%的平均精度,比TokenPose基准模型高2.3%;在MPII数据集上验证了其有效性,与近几年经典的基于Transformer的人体姿态估计方法相比取得了更好的性能。

Abstract

To addressthe issues of limited scale diversity and neglect of close-range information in visual Transformer models for human pose estimation tasks, this sutdy proposes a multiscale and multi‑level semantic fusion transformer (MMSF) model. This model realizes the mutual learning of visual information at different resolutions through the introduction of keypoint tokens as proxy cross-Transformer operations, thereby improving the estimation accuracy. Meanwhile, by utilizing deep convolution and DenseNet’s token reuse technique, it effectively extracts cross tokens containing multi‑level semantic information, reducing the stacking of encoder layers and model complexity. The integration of multi‑level semantic information is achevied through the cross-fusion attention operation involing cross tokens and standard tokens, thereby further enhancing the performance of pose estimation. The experimental results show that, under the same conditions, the MMSF model achieves an average precision of 78.1% on the COCO dataset, which is 2.3% higher than the TokenPose baseline model, and has also demonstrated its effectiveness on the MPII dataset, outperforming classical Transformer-based human pose estimation methods in recent years.

Graphical abstract

引用本文

引用格式 ▾
李俊, 袁通达, 陈黎. 基于多尺度与多级语义融合Transformer的人体姿态估计[J]. 武汉大学学报(理学版), 2025, 71(4): 473-484 DOI:10.14188/j.1671-8836.2024.0094

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

人体姿态估计(Human Pose Estimation, HPE)是对图像或视频中人体目标的姿态进行推理或预测,在动作识别[1-3]、人机交互[4]、行人识别[5]、虚拟现实[6]等领域都有广泛应用。然而,人体在不同环境下的差异化表现以及遮挡等复杂场景导致的识别困难,一直是该领域面临的重大挑战。

早期的研究方法,如基于模板匹配或机器学习技术(基于轮廓[7]和特征[8]的方法等),虽取得了一定进展,但受手动定义特征的限制,难以有效应对姿态变化和遮挡情况。随着深度学习技术的兴起,卷积神经网络(Convolution Neural Network, CNN)以其强大的特征提取能力,逐渐成为人体姿态估计的主流方法。基于CNN的分类方法能够生成关键点热图,有效处理部分遮挡和姿态变化,显著提升了姿态估计的精度,但其对计算资源的需求较高,且在复杂场景下的鲁棒性仍有待提升。

为了进一步提升姿态估计的准确性和鲁棒性,研究者们探究了循环神经网络(Recurrent Neural Network, RNN)[9]、长短期记忆网络(Long Short-Term Memory, LSTM)[10]以及注意力机制[11-12]等深度学习技术。这些技术通过引入时间维度的建模能力或对特征进行更为精细的调整,在一定程度上增强了模型处理复杂姿态和遮挡情况的能力。然而,它们仍然面临计算复杂度较高、对全局信息捕捉能力不足等问题,特别是在处理高分辨率图像和长时间序列时表现受限。

Transformer网络作为一种全新的深度学习架构,因其强大的全局特征提取能力和灵活的注意力机制,开始受到广泛关注。特别是在计算机视觉领域,视觉Transformer应运而生,它通过将图像分割为多个小块(patches)并应用自注意力机制进行特征提取,实现了对图像全局信息的有效捕捉。相比传统CNN,视觉Transformer在处理遮挡、复杂姿态变化等场景时展现出显著优势,能够更好地应对人体姿态估计中的挑战。

然而,当前多数视觉Transformer模型主要面向通用计算机视觉任务设计,对于人体姿态估计这类需要精细特征提取的任务,其适用性尚待提升。尤其是视觉Transformer的核心自注意力机制仅能处理分辨率固定的特征,使得这些模型在处理不同尺度的人体目标时存在局限。此外,模型在拟合近距离特征方面的不足也影响了其在人体姿态估计中的精度。

为了使视觉Transformer模型能够更好地应对人体姿态估计中的尺度变化和近距离特征提取需求。本文结合视觉Transformer与CNN,提出了基于多尺度与多级语义融合Transformer的人体姿态估计方法(Multi‑scale and Multi‑level Semantic Fusion Transformer,MMSF)。本文采用的两种交叉注意力机制均是对通用视觉Transformer架构应用在人体姿态估计时进行的针对性优化,与CNN领域长期探索发现的人体姿态估计需要多尺度、多层次的图像特征的特点相吻合。

本文的主要贡献如下:

1) 多尺度的产生与交互:在预处理时生成多分辨率的标记,以多分支形式存在于编码器中,解决分辨率受限问题。引入交叉注意力机制,促进不同分支标记间信息交互,增强多尺度处理能力。

2) 多级语义的生成与融合:在编码器模块中嵌入交叉标记处理模块,提升信息整合能力。利用稠密连接生成多层次的交叉标记,采用交叉融合注意力模块将交叉标记信息融入标准标记,丰富标记序列语义表示。

1  相关工作

1.1 基于传统CNN的人体姿态估计方法

基于传统CNN的人体姿态估计方法大多是为了从原始图像或特征图中更好地提取与人体姿态估计相关的关键点信息,从而提升姿态估计性能。DeepPose是首个基于深度学习的人体姿态估计模型[13],它采用了基于(Deep Neural Network,DNN)的姿态级联预测器,并通过级联思想串联模块,以实现对人体姿态的细化和优化。Hourglass采用多个堆叠的沙漏模块组成姿态估计网络[14],从不同尺度获取图像信息,在多个分辨率上采样并组合特征,最终输出高分辨率的热图来精确定位人体关键点[15],这种堆叠的方法使模型更好地处理遮挡和尺度变化问题。HRNet则强调在姿态估计中保持高分辨率[16],该模型设计了多阶段并行子网络共享不同尺度信息,以获取更丰富的语义信息。Simple baseline[17]和CPN[18]等模型在人体姿态估计中也是将重心放在提高分辨率或者增加多尺度信息上面。总而言之,基于CNN的人体姿态估计方法通过引入深度卷积、残差连接、多尺度特征融合等策略,在提升姿态估计性能方面取得了显著成效。本论文将在此基础上,探索如何将这些较为成熟且有效的策略与视觉Transformer相结合,以进一步优化基于视觉Transformer的人体姿态估计方法,为后续工作奠定基础。

1.2 视觉Transformer

视觉Transformer的产生与发展建立在Transformer在自然语言处理(Natural Language Processing, NLP)领域取得巨大成功的基础上[19]。受Transformer在NLP领域成功的启发[20-22],研究者们开始将其引入计算机视觉领域。传统的CNN受限于卷积核大小,捕获图像中的长距离信息的能力有限。因此,引入基于自注意力机制的Transformer架构为处理图像的相关任务提供了新的范式。通过自注意力机制与位置编码,模型能够捕获图像中长距离的依赖关系,从而更好地理解图像内容。

ViT模型[23]首次将标准Transformer范式应用于计算机视觉的图像分类任务,它将图像拆分为特征块,并将其转化为一维序列向量,利用自注意力机制学习特征块间的关联,同时引入分类标记以学习图像的整体信息,最终通过分类标记进行图像分类预测。

为了更适应计算机视觉任务中广泛存在的密集型预测任务,研究者们对视觉Transformer进行了大量基于多尺度和多级语义方向的探索。Swin Transformer模型[24]采用移动窗口策略,增强了相邻窗口的信息交互能力。CrossVit模型[25]实现了基于分类标记代理的交叉注意力方法,并且在图像分类任务中取得了不错的效果。FcaFormer模型[26]利用深度卷积生成不同分辨率的标记,并与标准标记进行交叉注意力操作,实现了融合学习,提升了模型对多尺度、多层次信息的学习能力。这些探索不仅丰富了视觉Transformer的架构体系,也为人体姿态估计领域提供了更为高效、准确的启示方案。

1.3 基于视觉Transformer的人体姿态估计方法

在人体姿态估计领域,研究者们迅速将视觉Transformer引入算法设计。ViTPose模型是基于视觉Transformer范式的纯Transformer模型[27],通过庞大的模型层数堆叠,消耗大量的计算资源捕捉人体关键点的位置和姿势信息,这一模型将人体姿态估计精度提升到了新的高度,充分证明了Transformer架构在人体姿态估计上的有效性。TokenPose模型[28]将关键点检测当做分类问题,提出关键点标记和视觉标记的概念,视觉标记来自目标图像特征,与原ViT中的嵌入序列相对应,而关键点标记是原ViT中分类标记的扩充,用来预测关键点热图,这种基于两种标记的标准视觉Transformer模型展现了与传统CNN模型相比的竞争性能,并实现了传统CNN模型难以实现的关键点注意力可视化功能。TFPose模型[29]将人体姿态估计看作序列预测问题,利用Transformer的自注意力机制自适应地关注关键点特征,极大地提高了基于回归的姿态估计方法的性能。TransPose模型[30]则充分利用Transformer在显示捕捉关键点之间原始空间关系的优势,设计了一个人体姿态估计器,在较低层使用卷积提取低级特征,在较高层则使用Transformer捕获全局依赖性,同时通过自注意力中的得分矩阵可视化具体的图像线索以定位关键点。HRFormer模型[31]则遵循HRNet保持高分辨率的设计,使用了Swin Transformer的移动窗口策略,利用不同的窗口尺寸生成类似HRNet的不同分辨率的特征信息。CAPose模型[32]在TokenPose模型基础上探索了多尺度交叉注意力Transformer,并取得了较好的效果。

综上所述,混合CNN和Transformer的架构有效地结合了局部特征提取和全局关系建模的优势,为人体姿态估计任务带来了创新性的解决方案。在此基础上,本文将进一步探讨如何优化Transformer的结构从而获取更丰富图像特征来提高人体姿态估计的性能。

2  MMSF方法

MMSF模型的整体结构如图1所示,该模型遵循Transformer的经典架构,包括预处理、编码器和解码器3大模块。预处理模块利用骨干网络从原始图像中提取特征图,并按预设的3种不同尺寸切分特征图,形成多尺度特征块。这些特征块经过线性映射和位置编码处理后,转化为视觉标记序列,同时结合任务特定的关键点标记,共同构成编码器的输入。编码器模块针对多尺度标准标记序列设计了相互独立的分支结构,并在交叉Transformer层实现信息交互,以充分利用不同尺度的特征信息。解码器模块则负责将编码器输出的关键点标记序列转化为热图表示,通过MLP head将多尺度标记转换为二维热图,每个热图对应一个关键点的坐标,最终整合成完整的人体姿态估计结果。

其中,编码器模块是MMSF模型的核心。该模块主要由以下几个关键组件构成:

1) 在交叉Transformer层中引入了基于交换标记的交叉注意力机制(Cross-used tokens based Cross-Attention,CCA)。这一机制使得不同尺度分支的标记之间能够实现高效的多尺度信息交互,从而丰富了每个标记所承载的特征信息。

2) 在每个Stage都设置了交叉标记处理模块。这一模块负责接收并处理该Stage每一层级的标记信息,为后续的注意力操作提供不同层级的交叉标记信息,确保了不同层级信息的流动和整合。

3) 采用基于交叉标记的交叉注意力机制(Multi-Head Cross-Attention,MHCA)来替代大部分原有的标准多头注意力机制(Multi-Head Self-Attention,MHSA),从而进一步提升模型的语义表达能力。该机制通过互相学习与信息融合将交叉标记的信息融入标准标记中,使得标记包含了丰富的多级语义信息,从而显著提升了标记的语义表达能力和信息含量。

2.1 标准多头注意力机制MHSA

本文的主要改进工作是基于MHSA展开的。为方便对比,本节介绍Transformer中标准的MHSA。MHSA是标准视觉Transformer的核心模块[33],与传统的注意力机制关注如何将输入序列与输出序列相关联的任务场景不同,基于自注意力机制的MHSA主要学习自身序列的元素与其他元素之间的关系,是一种无监督的自由迭代学习的方法。

图2展示了标准多头注意力操作中标记序列的流动情况。自注意力操作的一般做法是将一个长度为L、维度为D的输入序列 x 通过Linear层进行线性变换,得到三个维度为N×D的加权矩阵 Q, K, V,注意力得分的公式如下:

AttentionQ,K,V=ScoreQ,KV

其中,得分函数Score常采用softmax函数,再结合缩放因子,就能得到标准的自注意力公式,也叫SPD(Scaled-Dot Product Attention),即:

AttentionQ,K,V=softmaxQKTDKV

其中,缩放因子DK是为了增大得分差异,从而利于学习特征;使用softmax进行激活然后与 V 相乘得到输出矩阵利用了加权平均的思想。而多头注意力操作(Multi-Head Attention,MHA)通过并行地运行多个自注意力机制(即“头”),并将它们的输出拼接起来,以增强模型捕获不同位置间信息交互的能力。如图2所示按维度D在Linear层之后将输入分成H个头部,而且每个头部单独计算注意力,公式如下:

headQ,K,V=softmaxQKTD/HV

这样就会并行生成HD/H维的输出矩阵headi(i=1,2,…,H)。最后,将H个输出矩阵concat拼接起来,并通过一个Linear层恢复到原始维度D,公式如下:

MultiHeadQ,K,V=concat(head1,,headH)V

为了简化图形表示和便于描述,本文在后续的图示中采用“单头”注意力的形式来示意多头注意力机制。这里需要强调的是,尽管图示上可能只展示了一个“头”的计算过程,但实际上本文提出的方法均基于完整的多头注意力机制进行改进。

2.2 交叉Transformer与CCA

在交叉Transformer层中,两分支间的标记交互过程如图3(a)所示。MMSF模型通过预处理,产生xlxs两种尺度标记输入,经由各Stage学习,关键点标记在吸纳相应视觉特征后,与另一尺度的视觉标记执行交叉注意力融合多尺度信息,随后回归原尺度继续下阶段处理。此策略在增强标记多尺度信息的同时,保持了其一致性。本节聚焦两分支间交叉操作,该交互在三分支体系中将两两实施,确保信息全面交流。

CCA更精准的解释是基于关键点标记交换的交叉注意力机制,具体实现如图3(b)所示,这里以较小尺度的关键点标记xks与较大尺度的视觉标记xvl进行交叉注意力计算为例。较大尺度的标记序列记为xl=[xvl||xkl],较小尺度的标记序列记为xs=[xvs||xks],上标l,s分别表示较大尺度和较小尺度,下标v,k分别表示视觉标记和关键点标记。具体的实现过程为:将xs的关键点标记xks以较大尺度为目标进行维度对齐之后得到x*s向量,x*s向量直接作为查询向量 Q,生成查询矩阵WQ;同时x*sxl的视觉标记xvl进行组合得到组合向量xc,将xc作为键向量 K 和值向量 V,生成键矩阵WK和值矩阵WV,之后进行常规的多头注意力操作。具体的注意力操作计算如下所示:

Q=xlWQK=xsWKV=xsWV
y=SoftmaxQKTD/H
MCAxl,xs=yV

其中,WQ,WK,WV表示可学习的参数矩阵,尺寸为D×D/HD表示标记的维度,H表示多头注意力的头的数量。

可以看到CCA与MHSA原理相似,CCA只将输入标记序列中的关键点标记作为 Q,其时间复杂度为ONvl2+2Nks2D2H+NvlNksDH+NksD2,其中,N表示一组标记序列的数量;而MHSA的 Q, K, V 是直接使用全部的输入标记序列,其时间复杂度为OND2H+N2DH+ND2。所以实际上此处CCA操作对计算资源的消耗并不大。从整体上看,CCA本质上是以较小的资源消耗使关键点标记学习组合后的标记序列中的视觉标记的信息,从而达到多尺度信息交互的效果。

2.3 交叉标记处理模块

图4展示了Stage的内部结构,包含n个block和一个交叉标记处理模块。每个block由多头注意力模块和前馈网络构成,而首个block使用标准的MHSA,后续block则采用MHCA以融合交叉标记的信息。交叉标记处理模块采用稠密连接策略,确保每个交叉标记包含了同一Stage内所有block的注意力输出,从而将多级语义信息融入交叉标记中。同时稠密连接的操作通过复用标记信息,减少了模型堆叠,降低了复杂度。

图5展示了交叉标记产生的细节,利用深度卷积分别产生了标准标记序列和交叉标记序列。从图4可以看到,深度卷积不仅存在于交叉标记处理模块中,还在block中有所应用。深度卷积增强了本文基于Transformer的模型对特征信息的归纳偏置能力[34]

在交叉标记处理模块中,采用较大的卷积核提取并转化为低维交叉标记,这些标记被用于交叉融合注意力机制中。每个block接收的交叉标记融合了前面所有block产出的标记,通过可学习融合因子动态处理通道数量,确保满足MHCA模块的输入要求。这一设计在保持较低资源消耗的同时,显著增强了模型的语义信息获取能力,进而提高了模型的准确性。

在block中,模块还通过一系列尺寸为3×3的标准卷积核组成的深度卷积对输入的标准标记进行进一步提取,该过程旨在精炼特征信息而不改变标记的维度,从而有效地利用了深度卷积在特征表示学习上的优势。

2.4 基于交叉标记的交叉注意力机制MHCA

图6展示了MHCA的具体实现示意图。同样是对MHSA的改进,MHCA与2.2节介绍的CCA在实现原理上完全不同。MHCA不区分视觉标记与关键点标记,实现了更高效的信息融合。

图6所示,MHCA接收尺度相同的标准标记 x 和交叉标记 s 作为输入,在进行注意力操作前,标准标记通过线性变换产生xq,xk,xv三种输入矩阵,交叉标记通过线性变换产生sk,sv两种输入矩阵。xqxkT相乘得到中间矩阵y1xqskT相乘得到中间矩阵y2,将矩阵y1y2相加即可得到融合的交叉注意力中间矩阵 y,再对 y 进行相应的缩放和softmax操作,就能得到交叉注意力得分矩阵attn,与之对应的将xvsv相加得到融合的值矩阵 v,再将矩阵attn与 v 相乘进行注意力值的加权计算,得到最终的融合标记,这些融合标记将作为后续模型操作的标准标记。具体的操作过程用公式表示如下:

xL(dim,3×dim)xq,xk,xvsL(dim,3×dim)_,sk,sv
y1=xqxkT,y2=xqskT
y=y1y2,v=vqvs
attn=softmaxyD/H
x'=attny

其中,L表示线性映射函数,分别代表矩阵加法和矩阵乘法,DH分别代表标记维度和注意力头数,x'表示输出结果。

值得注意的是,MHCA在计算过程中基本遵循了MHSA的步骤,但通过引入交叉标记,实现了额外的注意力计算,从而在标准标记中有效地融入了交叉标记的信息。由于采用的是矩阵加法操作进行融合,MHCA在保持注意力得分计算维度不变的同时,也限制了实际增加的计算量,使得模型在保持高效性的同时,能够获取更丰富的语义信息。表1列举出了本文中出现的三种注意力对比。

表1可知,CCA与MHCA均超越了MHSA原有的单尺度自主学习框架,不仅在输入输出维度上,而且在作用对象上均展现出与MHSA的显著差异。这一转变显著增强了不同类别标签之间的相互作用,进而丰富了模型的特征表达能力,使得模型能够捕捉更为复杂和全面的数据特性。

3  实 验

3.1 实验环境与参数配置

本文实验使用的平台均是Ubuntu18.0下基于python 3.8.10的编程环境,基于pytorch框架搭建模型,pytorch版本为1.5.1,cuda版本为10.1,计算资源为NVIDIA的RTX-3080。

实验采用HRNet-W48作为特征提取的骨干网络,对比的基准模型包括基于热图的HRNet及新兴的基于Transformer的方法(如TransPose-H-A6[30]、TokenPose-L/D24[28]、HRFormer[31]和PCT[35]等)。实际训练中,输入图像尺寸为256×192,经放缩、切分处理,特征图转化为不同分辨率的特征块,并通过线性映射统一维度至192。具体的参数设置如表2所示。

3.2 性能对比

3.2.1 在COCO数据集下的对比

COCO test-dev数据集[36]是目标检测领域的经典数据集,包含超过200 000张图片和250 000个人体实例,其中每个实例标定17个关键点(5个面部,12个身体)。该数据集人体遮挡多、尺寸分布广,评估具有挑战性。

本文采用目标关键点相似度(Object Keypoint Similarity, OKS)作为评价指标,根据检测的关键点与标注关键点的距离大小来度量相似程度,计算公式如下:

OKSp=ie-dpi22Sp2σi2δvpi>0iδvpi>0

其中:p表示标注中的某个人;pi 表示某个人p的关键点;dpi2表示某个人pi个关键点检测位置与对应的标注关键点位置坐标的欧氏距离的平方;Sp2表示某个人p的检测框占图像的面积;σi表示第i个关键点的归一化因子,即标注关键点位置与真实关键点位置存在的标准差,可看作常量;vpi表示关键点的可见性,vpi=1表示关键点pi 无遮挡并且已标注,vpi=2表示关键点有遮挡但已标注。

根据OKS评价指标计算平均精度AP(Average Precision),表示每个关键点在整个测试数据集上检测结果的评价准确率,具体公式如下:

AP=pδOKS>Sp1×100%

其中,p表示标注中的某个人;S表示OKS指标的阈值。AP50AP75为交并比IoU(Intersection over Union)分别取0.5、0.75时的AP的值,APMAPL分别为中等目标和大目标的AP的值。

本文在基于COCO test-dev数据集的实验中,基本遵循HRNet中的数据处理与数据增强方法,在姿态估计结构上大体遵循两阶段的自上而下的方法,即先检测目标人体所在区域,再估计关键点位置。训练时从初期开始采用10-3的学习率,根据不同的训练轮次在特定位置将学习率降低到10-4和10-5,MMSF(300)在第240轮和第280轮降低学习率,MMSF(200)在第140轮和第180轮降低学习率。

表3所示,在COCO test-dev数据集的测试中,MMSF(300)方法在保持相对较低参数量的同时,成功将AP提升至78.1%,这一成绩优于同参数级别的HRNet、Tranformer等方法。与基准模型TokenPose相比,MMSF在减少约3×106参数量和降低12.58 GFLOPs计算量的情况下,AP仍实现了提升,显示出其有效的模型优化和特征提取能力。与PCT、ViTPose等参数量更大的方法相比,MMSF以较少的参数量达到了相近的AP水平,体现了其参数效率的优势。同时,在AP50和APL等评估指标上,MMSF也表现出色,综合性能优越。

3.2.2 在MPII数据集下的对比

MPII数据集[37]是2D人体姿态估计的经典数据集,包含超过25 000张图像,标注了超过40 000个人体的16个关键点(如头、膝盖、手腕等)。

本文在使用MPII数据集进行模型评估时,采用正确检测到的关键点的百分比作为评价指标,表示检测到的关键点位置与真实位置间的归一化距离小于设定阈值的比例。选取参数量规模相差不大的模型在MPII数据集下的检测效果对比如表4所示。由表4可知,本文提出的MMSF在参数量最低的情况下达到了最好的平均精度(90.3%),虽然不能对所有部位的关键点都具有最好的检测性能,但最优的平均精度表示本文方法的综合性能更好。具体对比来看,本文方法对肘、腕、脚踝的检测效果更好,在所列方法中均达到了最优。

3.3 消融实验

本文核心思想是在TokenPose基准模型的基础上使用了两种交叉注意力机制,且在编码器部分采用了3branch结构。为了深入分析交叉注意力机制对于模型检测精度的影响,以及为何采用3branch结构而非2branch结构,本文分别设计了消融实验进行分析。消融实验重在体现不同组件构成的不同模型的整体检测精度和召回能力,故主要采用AP和AR作为评价指标,此外还采用了参数量和计算量作为指标从模型规模的角度评价不同模型的效果。

本实验对关键轮次的精度数据和关键精度的轮次数据进行了记录,如表5所示,通过对比其达到指定轮次或者特定精度的情况来判断各模块对模型检测效果的影响。

表5可知,MMSF-C1与MMSF-C2在200轮的AP分别比TokenPose-L/D24在300轮的AP高,表明CCA与MHCA均对模型性能有较大提升。同时,完整的MMSF模型仅用110轮左右的训练就达到了基准模型的效果,并在200轮的完整训练下与MMSF-C1、MMSF-C2相比取得了更高的AP,表明结合两种注意力方法的完整MMSF模型的性能最佳。

从模型编码器结构上看,本文方法考虑了3branch结构与2branch结构。由于实验使用的骨干网络均为HRNet-W48,因此实际构成模型规模大部分参数来自骨干网络。若采用传统的编码器层数的方式来比较,与完整的24层Tokenpose-L/D24基准相比,本文方法中的编码器部分减少了三分之二的层数设置。3branch实际增加的计算量是来自多出分支的部分,这一部分的参数量相对于整个模型来说较小。2branch、3branch的对比情况如表6所示。

表6所列的数据也说明编码器部分的改动对模型整体参数量影响并不大,仅对计算量有较大的影响,而3branch与2branch在计算量上几乎相同,说明在实际训练中花费的时间也相差不大。而实际观察模型的训练效果,3branch优势明显,如图7所示。故采用3branch的模型是以牺牲较小的参数量的情况下实现了模型精准度的较大提升。

3.4 图片样例效果

本小节采用样例图片直观展示模型在人体姿态估计任务中的实际效果,对前文的对比实验提供更加全面、深入的性能评估信息。

样例图片使用MMSF(300)模型训练完成后的最好权重进行推理,采用的图片样张均来自COCO test-dev数据集中与人体图像相关的图片,标记的关键点由头部5个和身体12个组成,头部由红色线条连接关键点,身体由不同颜色线条分别连接四肢与躯干,具体效果如图8所示。

由样例图片可以看出,本文模型对较大和较小人体都有不错的检测效果,对于遮挡问题处理也较为合理,漏检误检情况极少,面对复杂环境下的多人估计也能处理,具有较好的鲁棒性。

4  结 语

本文提出一种基于多尺度与多级语义融合Transformer的人体姿态估计方法,核心思想是利用两种交叉注意力机制充分提取和利用标记信息,提高模型的检测性能,减小模型的规模。在整体结构上采用多分支结构处理不同尺度下的标记序列,通过基于交换标记的交叉注意力操作实现不同尺度标记之间的交互,解决了标准视觉Transformer框架下尺度单一的问题,有利于提升姿态估计的精度。同时将大部分原视觉Transformer中的自注意力模块替换为基于交叉标记的交叉注意力模块,加入了相应的交叉标记与标准标记的处理模块,通过标准标记与交叉标记的自主与互相学习传递丰富的语义信息,并引入稠密连接来处理交叉标记,极大地提高了标记的复用效率,减少了Transformer模块的堆叠,而减小了计算量。在COCO和MPII数据集上的对比结果显示,与最新的基于视觉Transformer的人体姿态估计方法相比,我们的模型性能具有相当甚至更好的表现。这一结论在COCO数据集上进行的消融实验中也得到了验证,其中加入的两种注意力机制对模型精度均有较大提升。未来我们将探索更加精细和动态的跨尺度融合方式,以更好地捕捉和利用不同尺度下的互补信息,进一步提升姿态估计的鲁棒性和准确性。

参考文献

[1]

毛国君, 王一锦. 融合内外依赖的人体骨架动作识别模型[J]. 计算机工程与应用202359(21): 132-140. DOI: 10.3778/j.issn.1002-8331.2207-0198 .

[2]

MAO G JWANG Y J. Human skeleton action recognition model integrated internal and external dependences[J]. Computer Engineering and Applications202359(21): 132-140. DOI: 10.3778/j.issn.1002-8331.2207-0198(Ch ).

[3]

BOUALIA S NESSOUKRI BEN AMARA N. Pose-based human activity recognition: A review[C]//2019 15th International Wireless Communications & Mobile Computing Conference (IWCMC). New York: IEEE Press, 2019: 1468-1475. DOI: 10.1109/IWCMC.2019.8766694 .

[4]

刘宝龙, 周森, 董建锋, . 基于骨架的人体动作识别技术研究进展[J]. 计算机辅助设计与图形学学报202335(9): 1299-1322. DOI: 10.3724/SP.J.1089.2023.19640 .

[5]

LIU B LZHOU SDONG J Fet al. Research progress in skeleton-based human action recognition[J]. Journal of Computer-Aided Design & Computer Graphics202335(9): 1299-1322. DOI: 10.3724/SP.J.1089.2023.19640(Ch ).

[6]

LIU HLIU T TZHANG Z Let al. ARHPE: Asymmetric relation-aware representation learning for head pose estimation in industrial human–computer interaction[J]. IEEE Transactions on Industrial Informatics202218(10): 7107-7117. DOI: 10.1109/TII.2022.3143605 .

[7]

ZHU X JLI QCHEN G H. APT: Accurate outdoor pedestrian tracking with smartphones[C]//2013 Proceedings IEEE INFOCOM. New York: IEEE Press, 2013: 2508-2516. DOI: 10.1109/INFCOM.2013.6567057 .

[8]

HERNHOLM M. A virtual reality pose estimation exercise game for post-stroke upper-limb motor function rehabilitation[D].Trondheim: Norwegian University of Science and Technology, 2023.

[9]

LIN ZDAVIS L S. Shape-based human detection and segmentation via hierarchical part-template matching[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence201032(4): 604-618. DOI: 10.1109/TPAMI.2009.204 .

[10]

WU Q QXU G HLI Met al. Human pose estimation method based on single depth image[J]. IET Computer Vision201812(6): 919-924. DOI: 10.1049/iet-cvi.2017.0536 .

[11]

CHO KVAN MERRIENBOER BGULCEHRE Cet al. Learning phrase representations using RNN encoder-decoder for statistical machine translation[EB/OL]. 2014arXiv: 1406.1078. DOI: 10.3115/v1/d14-1179 .

[12]

GERS F ASCHMIDHUBER JCUMMINS F. Learning to forget: Continual prediction with LSTM[J]. Neural Computation200012(10): 2451-2471. DOI: 10.1162/089976600300015015 .

[13]

WU J HZHENG HZHAO Bet al. AI challenger: A large-scale dataset for going deeper in image understanding[EB/OL]. 2017arXiv: 1711.06475.

[14]

MNIH VHEESS NGRAVES Aet al. Recurrent models of visual attention[EB/OL]. 2014arXiv: 1406.6247.

[15]

TOSHEV ASZEGEDY C. DeepPose: Human pose estimation via deep neural networks[C]//2014 IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2014: 1653-1660. DOI: 10.1109/CVPR.2014.214 .

[16]

NEWELL AYANG K YDENG J. Stacked hourglass networks for human pose estimation[M]//Computer Vision–ECCV 2016. Cham: Springer International Publishing, 2016: 483-499. DOI: 10.1007/978-3-319-46484-8_29 .

[17]

PFISTER TCHARLES JZISSERMAN A. Flowing ConvNets for human pose estimation in videos[C]//Proceedings of the 2015 IEEE International Conference on Computer Vision (ICCV). New York: IEEE Press, 2015: 1913-1921. DOI: 10.1109/ICCV.2015.222 .

[18]

SUN KXIAO BLIU Det al. Deep high-resolution representation learning for human pose estimation[C]//2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2019: 5686-5696. DOI: 10.1109/CVPR.2019.00584 .

[19]

XIAO BWU H PWEI Y C. Simple baselines for human pose estimation and tracking[C]//European Conference on Computer Vision. Cham: Springer, 2018: 472-487. DOI: 10.1007/978-3-030-01231-1_29 .

[20]

CHEN Y LWANG Z CPENG Y Xet al. Cascaded pyramid network for multi-person pose estimation[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2018: 7103-7112. DOI: 10.1109/CVPR.2018.00742 .

[21]

VASWANI ASHAZEER NPARMAR Net al. Attention is all you need[EB/OL]. 2017arXiv: 1706.03762.

[22]

DEVLIN JCHANG M WLEE Ket al. BERT: Pre-training of deep bidirectional transformers for language understanding[EB/OL]. 2018arXiv: 1810.04805. DOI: 10.48550/arXiv.1810.04805 .

[23]

RADFORD ANARASIMHAN KSALIMANS Tet al. Improving language understanding by generative pre-training[EB/OL]. [2023-10-26]. DOI: 10.4324/9781003267836-1 .

[24]

BROWN T BMANN BRYDER Net al. Language models are few-shot learners[EB/OL]. 2020arXiv: 2005.14165.

[25]

DOSOVITSKIY ABEYER LKOLESNIKOV Aet al. An image is worth 16×16 words: Transformers for image recognition at scale[EB/OL]. 2020arXiv: 2010.11929.

[26]

LIU ZLIN Y TCAO Yet al. Swin Transformer: Hierarchical vision transformer using Shifted windows[C]//2021 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2021: 9992-10002. DOI: 10.1109/ICCV48922.2021.00986 .

[27]

CHEN C F RFAN Q FPANDA R. CrossViT: Cross-attention multi‑scale vision transformer for image classification[C]//2021 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2021: 347-356. DOI: 10.1109/ICCV48922.2021.00041 .

[28]

ZHANG H KHU W ZWANG X Y. Fcaformer: Forward cross attention in hybrid vision transformer[C]//2023 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2023: 6037-6046. DOI: 10.1109/ICCV51070.2023.00557 .

[29]

XU Y FZHANG JZHANG Q Met al. ViTPose: Simple vision transformer baselines for human pose estimation[EB/OL]. 2022arXiv: 2204.12484.

[30]

LI Y JZHANG S KWANG Z Cet al. TokenPose: Learning keypoint tokens for human pose estimation[C]//2021 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2021: 11293-11302. DOI: 10.1109/ICCV48922.2021.01112 .

[31]

MAO W AGE Y TSHEN C Het al. TFPose: Direct human pose estimation with transformers[EB/OL]. 2021arXiv: 2103.15320. DOI: 10.1007/978-3-031-20068-7_5 .

[32]

YANG SQUAN Z BNIE Met al. TransPose: Keypoint localization via transformer[C]//2021 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2021: 11782-11792. DOI: 10.1109/ICCV48922.2021.01159 .

[33]

YUAN Y HFU RHUANG Let al. HRFormer: High-resolution vision transformer for dense predict[J]. Advances in Neural Information Processing Systems202134: 7281-7293. DOI: 10.48550/arXiv.2110.09408 .

[34]

王款, 宣士斌, 何雪东, . 基于交叉注意力Transformer的人体姿态估计方法[J]. 计算机工程202349(7): 223-231. DOI: 10.19678/j.issn.1000-3428.0065330 .

[35]

WANG KXUAN S BHE X Det al. Human pose estimation method based on cross attention transformer[J]. Computer Engineering202349(7): 223-231. DOI: 10.19678/j.issn.1000-3428.0065330(Ch ).

[36]

VOITA ETALBOT DMOISEEV Fet al. Analyzing multi-head self-attention: Specialized heads do the heavy lifting, the rest can be pruned[EB/OL]. 2019arXiv: 1905.09418. DOI: 10.18653/v1/p19-1580 .

[37]

DONG Y HCORDONNIER J BLOUKAS A. Attention is not all you need: Pure attention loses rank doubly exponentially with depth[EB/OL]. 2021arXiv: 2103.03404.

[38]

GENG Z GWANG C YWEI Y Xet al. Human pose as compositional tokens[C]//2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2023: 660-671. DOI: 10.1109/CVPR52729.2023.00071 .

[39]

LIN T YMAIRE MBELONGIE Set al. Microsoft COCO: Common Objects in Context[M]//Computer Vision—ECCV 2014. Cham: Springer International Publishing, 2014: 740-755. DOI: 10.1007/978-3-319-10602-1_48 .

[40]

GENG Z GSUN KXIAO Bet al. Bottom-up human pose estimation via disentangled keypoint regression[C]//2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2021: 14671-14681. DOI: 10.1109/CVPR46437.2021.01444 .

[41]

LI KWANG S JZHANG Xet al. Pose recognition with cascade transformers[C]//2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR). New York: IEEE Press, 2021: 1944-1953. DOI: 10.1109/CVPR46437.2021.00198 .

AI Summary AI Mindmap
PDF (3270KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/