基于STN的服装扭曲网络动态虚拟试衣方法

胡新荣 ,  柯廷丰 ,  罗瑞奇 ,  张梓怡 ,  梁金星 ,  杨凯 ,  彭涛

武汉大学学报(理学版) ›› 2024, Vol. 70 ›› Issue (3) : 349 -357.

PDF (2950KB)
武汉大学学报(理学版) ›› 2024, Vol. 70 ›› Issue (3) : 349 -357. DOI: 10.14188/j.1671-8836.2023.0222

基于STN的服装扭曲网络动态虚拟试衣方法

作者信息 +

A Dynamic Virtual Try-on Method for Clothing Twisting Network Based on STN

Author information +
文章历史 +
PDF (3020K)

摘要

动态虚拟试衣的任务是在视频中以时空一致的方式将目标服装与人物进行匹配,目的是生成连贯流畅且真实的试衣视频。动态试衣过程中人物的姿态变化,导致试穿的服装出现自遮挡、印花模糊等问题。因此,本文提出基于空间变换网络(Spatial Transformer Network,STN)的服装扭曲网络动态虚拟试衣方法。在服装扭曲网络中,利用Transformer模块兼顾全局信息以及局部重点信息的优势强化数据特征区域,STN模块采用可学习的薄板样条插值(Thin Plate Spline,TPS)方法预测服装扭曲范围,获取扭曲图像及掩码;试衣网络利用自注意力机制的U-Net网络对齐扭曲图像掩码和人体表征信息,生成高质量试衣图像;最后,通过动态合成网络解决视频帧时间一致性问题,生成连贯高质量试衣视频。在VVT数据集上,与CP-VTON相比,本文的方法将平均结构相似性指数(SSIM)提高了0.076,平均感知图像块相似度(LPIPS)降低了0.420;与FW-GAN方法相比,其I3D和ResNeXt101分别降低了0.089和2.252。在VITON-HD数据集上,本文方法的SSIM指标也高于CP-VTON和FW-GAN,进一步表明该方法生成的图片质量高、失真低。

Abstract

Dynamic virtual try-on aims to generate coherent, smooth, and realistic fitting videos. Current methods often encounter issues such as clothing self-occlusion and blurry patterns due to changes in body posture.Therefore, this paper proposes a clothing distortion constraint and prediction method based on the Spatial Transformer Network (STN). In the clothing distortion network, the Transformer module takes advantage of both global information and local key information to strengthen the data feature region, and the STN module uses the learnable Thin Plate Spline interpolation (TPS) method to predict the clothing distortion range and obtain the distorted image and mask. The try-on network is conducive to the U-Net network of self-attention mechanisms to align the distorted image mask and human body representation information, and generate high-quality try-on images. Finally, a dynamic synthesis network was used to solve the temporal consistency problem of video frames, and a coherent high-quality fitting video was generated. On the VVT dataset, compared to CP-VTON, our proposed method achieved an improvement of 0.076 in the average Structural Similarity Index (SSIM) and a decrease of 0.420 in the average perceptual image patch similarity (LPIPS). Compared to the FW-GAN method, it reduced by 0.089 in the I3D metric and 2.252 in the ResNeXt101 metric. On the VITON-HD dataset, the SSIM index of the proposed method exceeds that of CP-VTON and FW-GAN, further indicating that the images generated by the proposed method exhibit high quality and low distortion.

Graphical abstract

关键词

动态虚拟试衣 / 空间变换网络 / U-Net网络 / 自注意力机制

Key words

dynamic virtual try-on / spatial transformer network(STN) / U-Net network / self-attention mechanism

引用本文

引用格式 ▾
胡新荣,柯廷丰,罗瑞奇,张梓怡,梁金星,杨凯,彭涛. 基于STN的服装扭曲网络动态虚拟试衣方法[J]. 武汉大学学报(理学版), 2024, 70(3): 349-357 DOI:10.14188/j.1671-8836.2023.0222

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

虚拟试衣利用图形处理和AI技术,允许在线消费者在虚拟环境中试穿衣物,提升购物体验,减少退货率。虚拟试衣方法离不开图像合成技术,近几年来图像合成领域的发展与生成对抗网络(GANs[1])息息相关,将GANs运用在图像合成上可有效降低所需的算力和时间资源。为了更好地实现基于图像[2~4]的试衣效果,文献[5]提出了经典两阶段管道方法VTON,其中第一阶段将目标服装扭曲变形为所需样式,在第二阶段将扭曲服装与目标图像中的人物对齐。VTON设计了一个从粗到细的框架,可以将目标衣物叠加到待换装的人体相应的地方,并使用薄板样条插值(Thin Plate Spline,TPS)使目标衣物产生与人体姿势相同的形变,从而得到换装效果。后续基于VTON提出的试衣方法中,许多研究都采用两阶段管道法,如CP-VTON[6]、CP-VTON+[7]、ACGPN[8]和VITON-HD[9]等方法。其中CP-VTON[6]在经典两阶段管道框架基础上,提出了一种可学习的TPS,得到更好的服装掩码和人体掩码,在生成图像中改进了人物和衣物的融合效果。VITON-HD[9]进一步提高了生成图像的分辨率,解决了现有图片清晰度不高的问题。针对简单纹理图案的服装,上述的试衣方法的确可以在不同的方面取得较好的试衣效果,但当服装具有丰富图案或复杂纹理时,现有的试衣模型大多直接采用卷积神经网络来建模输入数据之间的关系,忽视了输入数据中的一些重要特征,导致卷积核特征获取受限,无法捕捉待试穿服装的全局关系,最终试衣效果不尽人意。

基于图像的静态虚拟试衣方法存在观看角度单一、试穿服装图像不清晰等诸多不足,研究者们开始追求更好的方式来体验试衣效果,探索基于视频的动态虚拟试衣领域,并取得了一些进步,动态虚拟试衣可以更好地帮助用户从多个角度观察服装的试穿效果。目前动态虚拟试衣相关技术的研究还处于起步阶段,文献[10]提出了一种流导航翘曲生成对抗网络FW-GAN,它使用了文献[11]中提出的光流预测模块Video2Video扭曲过去的帧,生成合成帧,解决帧时间一致性问题。文献[12]提出的ShineOn网络在FW-GAN网络基础上进行了改进,该网络利用自下而上的方法处理试穿任务,同时给出了参数细节,旨在分析虚拟试穿视觉和定量效果。通过一系列的试验,筛选出虚拟服装试衣视频合成中有效的设计选择,提高了每个不同参数细节下的视觉效果。文献[13]提出了一种通用虚拟试穿方法(GP-VTON),通过解析服装局部扭曲特征,并利用服装全局信息组装局部扭曲结果,以此获取服装扭曲特征及具有完整语义信息的服装,该方法易扩展到多类别场景中,利用不用数据集进行联合训练;在高分辨率基准上验证了该方法的有效性。

然而,现有的动态试衣方法在处理由于服装纹理、人物动作所导致服装过度扭曲的情况时,会出现服装与人体无法对齐等情况,从而导致最终的试衣结果质量不高。

为了解决上述问题,本文提出了一种基于STN的服装扭曲网络动态虚拟试衣方法,实验结果从定性与定量上都验证了文中方法的有效性。

1  本文方法

动态虚拟试衣指在动态过程中,以时空一致的方式将目标服装与人物进行匹配。给定一个人物视频V=Iii=1N,一张目标衣物图片C;其中Ii为视频中某一帧的人物图像,N为视频总帧数。V,C为输入,通过动态虚拟试衣生成流畅且真实的试衣视频O。在视频O中,可以看到视频V中的人物穿着给定的目标衣物C做着与视频V中人物相同的动作与姿势。

1.1 服装扭曲网络

在服装扭曲网络中,本文采用了CP-VTON中的框架。为了更好地保持输入图像中的信息在整个网络中的连贯性,添加了Transformer模块,服装扭曲网络如图1所示。首先,将人物图像Ii与目标衣物C输入特征网络中提取人物特征PI和服装特征PC;然后,将PIPC组合,输入Transformer模块,利用Transformer提取人体姿态语义Sout1;最后,将人体姿态语义输入STN模块,按照所提取的人物动作姿态进行形变生成扭曲衣物C^和扭曲衣物的掩码C^M

Transformer模块对输入的人物特征PI使用了两个重塑操作来调整大小,使人物图像特征可以转换成类似序列形式的数据,以便后续的序列模型进行处理。在传统的卷积神经网络(CNN)中,感受野(receptive field,RF)的大小限制了模型处理长距离信息的能力。而在动态试衣任务中,对全局上下文的理解将影响试衣结果是否自然与合理。Transformer模块中的多头交叉注意机制允许模型在整个输入序列中学习和识别远距离的特征关联,这对于理解复杂姿态换衣场景中的上下文信息至关重要。同时,为了提取人物图像特征之间的局部结构信息,在对人物图像特征进行重塑调整大小后,本文还利用一维时间卷积获取特征之间的局部依赖关系。Transformer模块由两个传统Transformer和两个跨通道Transformer编码器组成,如图2所示。对于经过卷积操作后的FIFC进行以下运算:

FI'=TransFI
FC'=TransFC
Scross1=catTransFI',FC',catTransFC',FI'

其中,Trans()代表传统Transformer的操作符,cat()为跨通道Transformer操作符。经过上述的操作后,得到高匹配度的Scross1,再通过重构操作,最终的输出为Sout1

图2所示,本文的Transformer模块既有传统的Transformer模块又有跨通道的Transformer模块。传统Transformer模块是自注意力模块,有助于捕捉序列内部的依赖关系。这里通过两个传统的Transformer,能够更好地提取出当前特征关键部分。跨通道的Transformer为交叉注意力模块,交叉注意力模块更侧重于不同通道或不同特征之间的关系。本文的这种Transformer模块结构有助于模型学习特征中的局部和全局信息,以便更好地预测θ值。

图3所示,STN网络包括局部网络(Localisation Network)、Grid generator和Sampler三部分。Localisation net是一个回归网络,该模块是用来生成仿射变换系数的,Sout1通过卷积操作后经过全连接回归得出6个角度值。Grid generator是网格生成器,对参数化网格采样,通过目标位置及矩阵运算计算出目标图中的各个部分相对Sout1输入中的坐标位置,生成TθG。Sampler是一种采样器,能通过TθG中的坐标系数据,进行差分图像采样,将Sout1中的像素复制到目标图中,实现更加精确的处理。

STN模块先对目标服装扭曲的范围进行预测。STN内部的空间变换采用可学习的薄板样条插值(Thin Plate Spline,TPS)方法,该方法可以纠正各种类型的不规则图像。TPS由一组基准点决定,这些基准点的坐标由STN卷积神经网络回归生成提供。本文在这里没有用Appearance Flow(尽管Appearance Flow在该领域有良好的性能,并在许多应用中优于TPS),其主要原因是TPS对较大区域的平滑变形能更准确地维持服装的结构完整性,对于静态服装图像的变形,TPS提供了简单和高效的平衡,并且满足了后续处理对服装准确性的要求。由于Appearance Flow方法在动态合成中的优势,本文将它应用在后面的动态合成网络中。

1.2 试衣网络

试衣网络如图4所示。试衣网络将人物图像Ii、扭曲服装图像C^和扭曲服装的掩码图像C^M串联输入到U-Net网络,生成人物的渲染图像IR和合成掩码CM0;利用Transformer模块建立人物图像、扭曲服装图像和扭曲服装的掩码图像的全局依赖关系Sout2,强化特征区域,生成高质量的试衣图像IO

1.2.1 U⁃Net网络

试衣网络中的自编码模块采用U-Net网络。U-Net网络具有出色的泛化能力,能够巧妙地融合低层特征图和高层特征图;它采用完全对称的设计,其独特的U型结构,使得特征融合更加深入,从而在目标图像中充分表现出高分辨率和低分辨率信息的内容。在下采样过程中,U-Net通过低分辨率信息有效地还原出高分辨率信息,而融合操作,也就是跳跃连接,进一步提高了分割的精确性。本文使用了基于自注意力机制的U-Net网络结构,如图5所示。

在其结构中左边是特征抽取网络(编码器),右边是特征融合网络(解码器),图中数字表示图像的分辨率与通道数(例如16,12,1 024表示16×12分辨率和1 024通道数)。在特征抽取网络中,对高分辨率进行编码后可得到相应的低分辨率信息;特征抽取网络作用是捕捉图片中的局部特征,并将其进行特征分类;网络结构为两个3×3的卷积层(ReLU)再加上一个2×2的最大池化层组成一个下采样的模块。而在特征融合网络中,将低分辨率信息解码成高分辨率信息;该网络的目的是利用前面编码的抽象特征来回复到原来尺寸的过程;网络结构为一层反卷积、特征拼接concat和两个3×3的卷积层(ReLU)构成。与特征提取网络刚好相对应,最后接一层1×1的卷积,用作降维处理,减少通道数量,从而获得目标图。

1.2.2 Transformer模块

Transformer模块(图6)通过多头自注意自适应地关注有用的语义上下文,以增强特征表征。然后,跨模态注意模块同时接收它们自己和其他分支的特征向量,并通过多头交叉注意实现对两两特征图的融合,使该Transformer结构生成语义增强的Attention map,并将其用于优化由U-Net网络生成的试衣图。

图6所示,将经过预处理后的人物图像和扭曲服装图像PIPC^PC^M输入Transformer encoder中后分别得到其表征PI'PC^'PC^M';然后,经过Cross-modal Transformer encoder模块,得到基于PI'特征的效果评分SIcross,如(4)式所示:

SIcross=catTransPI',PC^',Trans(PI',PC^M')

PC^PC^M处理方式同上,同时综合上述三类得分,获取最终试衣效果评分Scross2

Scross2=catSIcross,SC^cross,SC^Mcross

图4所示,人物图像特征、扭曲服装图像特征以及掩码图像特征在经过自编码器模块编码后,可以更准确获取每个特征元素与其相邻特征元素之间的关系,通过引入Transformer结构(如图6),可以获得特征之间的全局信息。因Transformer允许不同位置之间的全局关系建模,使得模型能够更好地理解输入序列中的整体上下文。因此,本文通过Attention map优化试衣网络,提高试衣效果的真实感和一致性。模块的输出在经过线性投影和整体操作之后表示为Sout2。最后,强化特征区域,生成高质量的试衣图像结果如下:

IRall=sigmoidSout2×IR
IO=CM0×C^+(1-CM0)×IRall

1.3 动态合成网络

动态合成阶段中需要解决视频帧的时间一致性问题,生成连贯的试衣视频。视频帧的时间是指单独一帧的渲染时间。受文献[14]的启发,本文在模型中使用了光流损失法解决该问题。光流(optical flow)表达了图像的变化,由于它包含了目标运动的信息,因此可被观察者用来确定目标的运动情况。光流法是利用图像序列中像素在时间域上的变化以及相邻帧之间的相关性找到上一帧跟当前帧之间存在的对应关系,从而计算出相邻帧之间物体的运动信息的一种方法,在此基础上引入损失函数即为光流损失法,求得视频上一帧与当前帧之间的对应关系,解决视频帧时间一致性问题。动态合成网络的结构如图7所示。

在动态合成网络中,需要同时考虑当前帧和过去的帧。首先,从这些帧中通过有限元分析(Finite Element Analysis,FEA)计算获取光流信息。再利用光流信息的方向注释,通过1.1节中的服装扭曲网络将之前生成的帧扭曲(或调整)到当前时间段的位置。最后,使用一个掩码将扭曲后的帧与原始合成的结果融合,以生成最终的合成帧。接下来将IO等中间输出进行合成,最后生成试衣视频O

1.4 损失函数

服装扭曲网络的基础网络层由两个特征提取器组成,分别提取服装和人物图像的高级特征;关联层通过Transformer模块组合特征;回归层则通过STN模块进行空间变换并通过TPS变换来扭曲服装。基于TPS的STN结构的损失函数LSTN由扭曲衣物和真实数据C^t之间的像素级损失L1和VGG感知损失[15]Lvgg组成,计算方式如下:

LSTN=λ1L1C^,C^t+λvggLvggC^,C^t=λ1C^-C^t1+λvggi=15λiφiC^-φiC^t1

其中,Lvgg用来确保服装进行了足够的扭曲,1表示L1损失,φi为ImageNet上预训练的视觉感知网络VGG19[16]的第i层特征图,λi表示为计算出的每一层特征图中L1损失的权重超参数。

服装扭曲网络的总损失函数Lwarping表达式为:

Lwarping=LSTN+λregLreg

试衣网络的总损失函数为Ltry-on,主要由三个部分组成:试衣网络最后的试衣图像IO与其Ground Truth真实数据IGT之间的差异最小化的损失值;试衣图像IO与真实数据Ii之间的感知损失Lvgg;使合成掩码CM0能更倾向扭曲衣物掩码C^tM的损失值,计算如下:

Ltry-on=λ1IO-IGT1+λvggLvgg+λmaskCM0-C^tM1

其中,1表示为L1损失。

在动态合成网络中,利用光流损失法来解决视频帧时间一致性问题。即采用光流损失函数LF加权为λF=1.0×104进行约束。

2  实 验

2.1 数据集及评价指标

使用FW-GAN[10]提供的动态虚拟试穿(VVT)数据集进行动态虚拟试衣。VVT数据集包含661个训练视频和130个测试视频,其中每一个视频每秒30帧,分辨率192×256,视频的时间在8到10 s之间。每个视频大约有250~300帧,训练集和测试集分别包含159 170帧和30 931帧。该数据集还包含791张人物图片和791张衣服图片,每个人物图片都有一个对应的独立的衣服图像。VVT数据集只包含身着上衣的人物图像。

VITON-HD包含13 679对前视上半身女性和上半身服装的图像,进一步分为11 647/2 032个训练/测试对。此外,应用一个统一的解析估计器来预测人物/服装图像的人体/服装解析,该解析估计器使用80 000张手动注释的时尚图像进行训练。

从静态和动态两方面对本文的方法进行评价。在静态方面,采用结构相似性(SSIM[17])和学习感知图像块相似性(LPIPS[18])进行评价,SSIM值大表示效果好,LPIPS值小表示效果好;在动态方面,运用Video-based Fréchet Inception Distance(VFID)方法来测量时间一致性从而来评估视频的质量,使用了I3D[19]和ResNeXt101[20]从合成的视频片段和真实的视频片段中提取时空特征向量,并根据这些特征向量计算FID,再通过FID进行评估比较。

2.2 实验参数

在训练和测试阶段,服装扭曲模块、试穿模块都是分开的训练,然后再将它们组合最后生成试衣图像。同时,将VVT数据集中的视频分割成连贯的子视频进行训练和测试。在实验中,服装扭曲模块与试穿模块的训练数为2.0×105,batch-size为4;使用了初始学习率为0.000 1,β1=0.5β2=0.999的Adam优化器对每个模块各训练100个epoch,当迭代到100 000次后学习率开始线性衰减到零。此外,将训练调整到了16位精度,以提高训练速度和减少GPU的内存消耗。

2.3 实验结果

2.3.1 定量结果

将本文提出的网络与FW-GAN、CP-VTON和MV-TON网络进行了对比。为了更好地论证服装扭曲网络与试衣网络中的Transformer模块的有效性,本文还做了消融实验。表1中,Ours(w/o,LA)表示只添加装扭曲网络中的Transformer模块;Ours(w/o,LB)表示只添加试衣网络中的Transformer模块;Ours(full)表示同时添加装扭曲网络和试衣网络中的Transformer模块。

表1可知Ours(full)网络的SSIM值最大,LPIPS值最小,表明本文的网络表现最优。

本文网络采用TPS插值函数,避免了网格扭曲的问题,在一定程度上缓解了服装过度扭曲的状况,从表1也可以看出,本文网络效果优于CP-VTON和FW-GAN网络。MV-TON在动态合成模块中使用了一个记忆细化模块来储存过去帧的特征,虽然提高了时空一致性但会导致动态时空平滑度降低,同时还出现了视频闪烁的问题,其视觉效果并不佳。

将本文的网络与PFAFN,FS-VTON在数据集VITON-HD上进行比较。由表2可知,本文方法在VITON-HD数据集上表现良好,能够获得更精确的变形服装,在SSIM和LPIPS度量标准上取得良好效果。本文方法FID度量指标略差于FS-VTON方法,主要是因为本文方法更适合人体姿态复杂,试穿过程需要复杂变换的情况。

2.3.2 定性结果

图8为可视化结果。对比CP-VTON网络和本文方法的对于人体表征中的手臂以及服装的解析图,可以看出,本文方法可有效避免手臂和服装之间的交叉遮挡问题,手臂轮廓被正常标注。

为更好地论证STN结构中像素级损失L1和VGG感知损失Lreg有效性,将本文模块拆分为了Ours(w/o L1)和Ours(w/o Lvgg)与Ours(full)进行对比。其中Ours(w/o L1)表示只添加像素级损失;Ours(w/o Lvgg)表示只添加VGG感知损失;Ours(full)则表示同时添加像素级损失和VGG感知损失。如图9所示,若只添加像素级损失会导致服装的过度扭曲;若只添加VGG感知损失,会出现对头发和手臂的遮挡问题;而在同时添加像素级损失和VGG感知损失后,有效地避免了服装的过度扭曲和头发与手臂对扭曲的遮挡问题。

进一步将本文的方法与CP-VTON、FW-GAN网络进行效果对比,如图10。可以看出由于本文使用了约束函数,抑制了过度扭曲的问题的发生后使服装匹配阶段会输出更加自然的中间输出;在人体分割和颈部等细微方面,以及整体的动态视觉展现上更贴近真实的试衣效果。从图10中可以主观的评价,视觉上是有所改善的:有关颈部和领口的细节被更好地保留下来,服装上的图案更加清晰等。

3  结 语

本文对CP-VTON和FW-GAN网络进行了改进,提出了一个动态虚拟试衣方法。实验结果表明,本文方法较好地解决了上述网络中存在的信息缺失等问题;在基准网络上的效果有所提升,验证了其有效性。本文方法还有可优化之处。通过实验发现,动态合成网络中光流的产生虽然解决了视频帧时间一致性问题,但是同时也生成了一些不必要的结果导致试衣质量有所下降,后续可加以改进,进一步提高试衣的真实度以及动态虚拟试衣的观感。

参考文献

[1]

GOODFELLOW IPOUGET-ABADIE JMIRZA Met al. Generative adversarial nets[C]//Advances in Neural Information Processing Systems 27 (NIPS 2014). Cambridge: MIT Press, 2014:2672-2680.

[2]

GE C JSONG Y BGE Y Yet al. Disentangled cycle consistency for highly-realistic virtual try-on[C]//2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2021: 16923-16932. DOI: 10.1109/CVPR46437.2021.01665 .

[3]

HAN X THU X JHUANG W Let al. ClothFlow: A flow-based model for clothed person generation[C]//2019 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2019: 10470-10479. DOI: 10.1109/ICCV.2019.01057 .

[4]

ISSENHUTH TMARY JCALAUZÈNES C. Do not mask what you do not need to mask: A parser-free virtual try-on[C]//European Conference on Computer Vision. Cham: Springer, 2020: 619-635.10.1007/978-3-030-58565-5_37. DOI: 10.1007/978-3-030-58565-5_37 .

[5]

HAN X TWU Z XWU Zet al. VITON: An image-based virtual try-on network[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2018: 7543-7552. DOI: 10.1109/CVPR.2018.00787 .

[6]

WANG B CZHENG H BLIANG X Det al. Toward characteristic-preserving image-based virtual try-on network[C]//European Conference on Computer Vision. Cham: Springer, 2018: 607-623.10.1007/978-3-030-01261-8_36. DOI: 10.1007/978-3-030-01261-8_36 .

[7]

MATIUR R MTHAI T THEEJUNE Aet al. CP-VTON+: Clothing shape and texture preserving image-based virtual try-on[DB/OL].[2023-02-01].

[8]

YANG HZHANG R MGUO X Bet al. Towards photo-realistic virtual try-on by adaptively generating-preserving image content[C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2020: 7850-7859. DOI: 10.1109/CVPR42600.2020.00787 .

[9]

CHOI S WPARK S YLEE M Set al. VITON-HD: High-resolution virtual try-on via misalignment-aware normalization[C]//2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2021: 14131–14140. DOI: 10.1109/CVPR46437.2021.01391 .

[10]

DONG H YLIANG X DSHEN X Het al. FW-GAN: Flow-navigated warping GAN for video virtual try-on[C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. New York: IEEE Press, 2019: 1161-1170. DOI: 10.1109/ICCV.2019.00125 .

[11]

WANG T CLIU M YZHU J Yet al. Video-to-video synthesis[EB/OL]. 2018arXiv: 1808.06601.

[12]

KUPPA GJONG ALIU Xet al. ShineOn: illuminating design choices for practical video-based virtual clothing try-on[C]// Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision. New York: IEEE Press, 2021: 191-200. DOI: 10.1109/WACVW52041.2021.00025 .

[13]

XIE L ZHUANG Z YDONG Xet al. GP-VTON: Towards general purpose virtual try-on via collaborative local-flow global-parsing learning[C]//2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2023: 23550-23559. DOI: 10.1109/CVPR52729.2023.02255 .

[14]

BOOKSTEIN F L. Principal warps: Thin-plate splines and the decomposition of deformations[C]//IEEE Transactions on Pattern Analysis and Machine Intelligence. New York: IEEE Press, 1989: 567-585. DOI: 10.1109/34.24792 .

[15]

BROX TBRUHN APAPENBERG Net al. High accuracy optical flow estimation based on a theory for warping[C]//European Conference on Computer Vision. Berlin: Springer, 2004: 25-36.10.1007/978-3-540-24673-2_3. DOI: 10.1007/978-3-540-24673-2_3 .

[16]

HU JSHEN LSUN G. Squeeze-and-excitation networks[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2018: 7132-7141. DOI: 10.1109/CVPR.2018.00745 .

[17]

WANG X LGIRSHICK RGUPTA Aet al. Non-local neural networks[C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2018: 7794-7803. DOI: 10.1109/CVPR.2018.00813 .

[18]

WANG ZBOVIK A CSHEIKH H Ret al. Image quality assessment: From error visibility to structural similarity[J]. IEEE Transactions on Image Processing: A Publication of the IEEE Signal Processing Society200413(4): 600-612. DOI: 10.1109/tip.2003.819861 .

[19]

ZHANG RISOLA PEFROS A Aet al. The unreasonable effectiveness of deep features as a perceptual metric[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2018: 586-595. DOI: 10.1109/CVPR.2018.00068 .

[20]

CARREIRA JZISSERMAN A. Quo vadis, action recognition? A new model and the kinetics dataset[C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition.New York: IEEE Press, 2017: 4724-4733. DOI: 10.1109/CVPR.2017.502 .

[21]

HARA KKATAOKA HSATOH Y. Can spatiotemporal 3D CNNs retrace the history of 2D CNNs and ImageNet [C]// Proceedings of the IEEE conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2018: 6546-6555. DOI: 10.1109/CVPR.2018.00685 .

[22]

HE SSONG Y ZXIANG T. Style-based global appearance flow for virtual try-on[C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2022: 3470-3479. DOI: 10.1109/CVPR52688.2022.00346 .

基金资助

宁波市科技局重点研发专项(2021Z069)

AI Summary AI Mindmap
PDF (2950KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/