摘要
针对人体动作迁移中骨骼比例差异导致的图像生成失真问题,提出了一种基于骨骼关键点的双标签混合Transformer(dual-label hybrid Transformer, DLHFormer)架构,以实现不同骨架间的直接动作迁移.首先,使用双标签混合Transformer编码器对目标人物骨骼关键点动作序列的动态标签和静态标签进行精确解耦与编码.其次,利用初始姿态预测器预测与动作序列相关联的目标骨骼关键点序列的骨架初始姿态,消除预定义姿态的限制.最后,根据编码后的源人物骨骼的静态标签与目标人物骨骼的动态标签,在框架中实现运动重定向.基于Mixamo构建的跨角色图像数据集进行实验,结果表明:将本研究方法集成到MagicPose后,L1平均损失由3.69降至3.42,PSNR由19.92 dB升至20.33 dB,SSIM由0.996 9升至0.997 5,LPIPS由0.195降至0.183,FID由75.5降至68.9;在骨骼关键点重定向任务中,联合空间与时间位置编码时PCK达到0.993,MPJPE降至2.95.研究验证了所提方法能够在跨骨架动作迁移中有效保持人体结构比例,提高关键点定位精度,并改善生成图像的质量.
关键词
Key words
刘子壮, 丁飞飞.
基于双标签混合Transformer的骨骼关键点重定向方法[J].
杭州师范大学学报(自然科学版), 2026, 25(4): 367-375 DOI:10.19926/j.cnki.issn.1674-232X.2025.05.272
基金资助
浙江省重点研发计划项目(2021c03131); 国家自然科学基金项目(62471170); 浙江省自然科学基金项目(LQN25F010014,LQN26F020072)