基于文本引导的人脸图像修复

廉敬 ,  张继保 ,  刘冀钊 ,  张家骏 ,  董子龙

吉林大学学报(工学版) ›› 2025, Vol. 55 ›› Issue (08) : 2732 -2740.

PDF (1320KB)
吉林大学学报(工学版) ›› 2025, Vol. 55 ›› Issue (08) : 2732 -2740. DOI: 10.13229/j.cnki.jdxbgxb.20240051
计算机科学与技术

基于文本引导的人脸图像修复

作者信息 +

Text-based guided face image inpainting

Author information +
文章历史 +
PDF (1351K)

摘要

针对目前人脸修复方法存在结构扭曲、纹理模糊以及不可控等问题,提出了一种文本引导的人脸图像修复方法。该方法通过融合图像特征和相应的文本特征来重建图像中的缺失区域。在网络训练中,设计了视觉-文本模态融合模块,用于关联图像和文本特征,使重建人脸缺失区域不仅以图像中可见的视觉语义为基础,还以具有丰富的文本语义为指导。在编码和解码特征之间添加了一个注意力感知层,以提高可见区域和生成区域外观的一致性。在CelebA-HQ人脸数据集上的实验结果表明:本文方法能够得到在纹理和结构上更自然且符合文本语义的修复结果,其视觉效果和评价指标均优于对比算法。

Abstract

A text-guided face image inpainting method is proposed to address the problems of structural distortion, texture blurring, and uncontrollability in current face inpainting methods. The method reconstructs the missing regions in an image by fusing image features and corresponding text features. In the network training, a visual-textual modal fusion module is designed for associating image and textual features so that the reconstruction of missing regions of the face is not only based on the visual semantics visible in the image, but also guided by textual semantics with rich text. An attention-aware layer is added between the encoded and decoded features to improve the consistency of the appearance of the visible and generated regions. Experimental results on the CelebA-HQ face dataset show that the method in this paper is able to obtain restoration results that are more natural and consistent with the textual semantics in terms of texture and structure, and its visual effect and evaluation metrics are better than those of the comparison algorithms.

Graphical abstract

关键词

图像修复 / 文本指导 / 跨模态融合 / 深度学习

Key words

image inpainting / textual guidance / cross-modal fusion / deep learning

引用本文

引用格式 ▾
廉敬,张继保,刘冀钊,张家骏,董子龙. 基于文本引导的人脸图像修复[J]. 吉林大学学报(工学版), 2025, 55(08): 2732-2740 DOI:10.13229/j.cnki.jdxbgxb.20240051

登录浏览全文

4963

注册一个新账户 忘记密码

0 引 言

随着人脸识别技术的迅速发展,人脸图像修复技术已经成为当前研究的热点问题12。然而,由于获取的人脸图像通常受到自然和人为因素的影响,增加了人脸识别的技术难度。人脸图像修复技术升级对于提高人脸识别准确率至关重要。

近年来,深度学习的发展推动了基于卷积神经网络和生成式对抗网络的广泛应用,许多先进适用的图像修复方法被提出。Pathak等3提出了上下文编码器方法,先行探索将编解码架构应用于图像修复。然而,这种方法无法应用于任意的修复掩膜。同时,由于自动编码器网络的生成能力欠缺,这一方法会产生不可信的结果。为了克服上述问题,Iizuka等4提出使用全局和局部判别器进行图像修复。该方法引入了全局和局部一致性的约束,在修复图像中大尺度缺失区域时,能够确保修复结果与原始图像在整体结构和细节上保持一致。然而,这是一种空间支持模型,无法填充大的孔洞。为了进一步细化全局结构和突出局部纹理细节,Yan等5提出了一种卷积神经网络优点和传统复制粘贴结合的方法。然而,该方法对每一个掩膜输入仅产生一个修复结果。为此,Liu等6提出了基于概率多样性的生成对抗网络方法,旨在解决图像修复中的多样性和不确定性问题,以生成具有多样化和真实感的修复图像;Wan等7提出了一种多样化的图像修复方法,以增加修复结果的多样性和可选性。然而,当关键的结构或细节被破坏,导致全局和局部特征不一致时,该方法不能有效应用。此外,Li等8利用Transformer中的多头注意力建模特征之间的非局部关系在全局上完成图像重建;Huang等9提出了一种基于U-Net的新型Transformer网络以降低多头注意力的计算成本;Lian等10从纹理和结构研究入手重建图像缺失区域。上述方法在人脸图像修复中,能够提取到图像深层语义信息,均为图像重建的有效方法,但在复杂背景或缺失区域较大的情况下,所修复出的图像尚存在伪影、结构扭曲和纹理模糊等问题。

基于此,本文提出了一种基于文本引导人脸图像修复的方法。该方法使用预训练的语言表征(Bidirectional encoder representation from transformers, BERT)模型11对文本描述进行编码,然后在解码过程中将文本语义特征转换成图像特征。在人脸图像重建过程中,设计了视觉-文本模态融合(Visual-textual modalities fusion, V-TMF)模块,利用丰富的文本特征来指导重建孔洞区域。

1 本文算法

1.1 网络框架与流程

本文算法的框架如图1所示,主要分为文本语义学习网络和人脸重建网络两个部分,图中Lrec、Lstyle、Lperc和Ladv分别为像素重建损失、风格损失、感知损失和对抗损失4种损失函数。

首先,文本语义学习网络通过BERT对真实图像Igt的文本描述编码,在解码阶段,通过卷积神经网络将文本特征转换成图像特征。其次,人脸重建网络对孔洞图像Im和掩码图像Imask编码。在解码过程中,通过视觉-文本模态融合(V-TMF)模块交互图像和文本特征完成图像重建。网络的详细结构如表1所示。

1.2 视觉-文本模态融合模块

文本描述作为一种重要参考,可以为图像修复提供丰富的信息。通过将文本特征与视觉特征融合,修复模型能更全面地理解图像内容。这确保了在修复过程中重建区域与掩码周围像素的一致性,同时也保证了填充部分在整个图像中的语义合理性。本文设计的视觉-文本模态融合模块如图2所示。

该模块采用了Transformer编码器,用于交互图像和文本信息。通过利用注意力机制,其能够捕捉输入序列中的全局依赖关系。在处理图像和文本特征时,它能够聚焦于彼此之间的重要信息,并通过注意力权重进行跨模态的信息传递和交互。这种方式使得模型能够更有效整合图像和文本信息,从而提高修复结果的准确性和一致性。

为了减少不同模态之间信息融合的损失,使用双向Transformer编码层,每个分支使用两个独立的编码器处理不同模态的输入数据,通过这种架构使文本和图像特征充分融合。为了捕捉不同模态特征的语义信息,引入了多头注意力(Multi-head attention, MHA)。这允许模型更好地关注不同特征,并学习到不同位置和特征之间的关联信息。多头注意力的结构如图3所示。

在MHA下,将每个头独立计算的结果拼接在一起:

MHA=Concat(head1,,headi)L
headi=Attention(Q,K,V)
A=FWQ,K=FWK,V=FWV

式中:Q∈R N×DK∈R N×DV∈R N×D 由输入特征F∈R N×C 得到,分别为查询向量(Query)、键向量(Key)和值向量(Value);N=H×W为输入特征的长度,HW分别为输入特征的高和宽;C为特征通道,D为变换后特征的维度;WiQWiKWiV∈R C×D 分别为第i个头QKV使用的线性变阵矩阵;i为MHA中头的数量,在本文中i设置为8,L∈Ri×D)×Z 为线性变换矩阵;Z为MHA最后输出特征的维度;Concat为通道拼接;Attention(·)为注意力计算函数,其表达式如下所示:

Attention(Q,K,V)=SoftmaxQKTdkV

式中:dkQK 矩阵的向量维度;通过Softmax函数计算特征之间的相似度权重;然后将权重系数与 V 相乘得到注意力输出。

第一层编码器将文本特征与图像编码层和解码层特征融合,使图像重建过程中不仅基于可见部分的视觉信息,还利用丰富的文本语义,其表达式如下:

FTE1=FT+MHA(FT,FE,FE)
FTD1=FT+MHA(FT,FD,FD)

式中:FT为文本特征;FE为图像编码层特征;FD为图像解码层特征;FTE1FTD1分别为融合后的特征。

第二层编码器将融合后的特征进一步细化,表达式如下:

FTE2=FT+MHA(FTE1,FTE1,FTE1)
FTD2=FT+MHA(FTD1,FTD1,FTD1)

为提高可见区域和生成区域外观的一致性,本文在编码和解码特征之间提出了一个新颖的注意力感知层(Attention-aware layer,AAL)如图4所示。该设计旨在更好地利用远距离相关的高频特征,自适应地平衡对可见内容和生成内容的注意力,从而实现语义上更优越的特征转换。

具体来说,本文通过式(9)计算解码层特征FTD2的注意力分数:

A=θ(FTD2)Φ(FTD2)

式中:A为特征的相似性;θΦ为1×1卷积。

接下来,通过以下方式获得长期依赖关系:

F=Concat(AFTE2),(AFTD2)

式中:F为包含编码层中的高频细节信息和解码层的自注意力特征;Concat为通道拼接。

最后,通过学习动态权重来组合FTD2FTE2

GE,GD=ChunkSoftmax(Mlp)(Maxp(F)
Z=(GEFTE2)(GDFTD2)

式中:Z为注意力感知层的输出;GEGD为特征的门控;Maxp为最大池化;Mlp为全连接层;Chunk为特征通道维度分割操作。

视觉-文本模态融合模块的输出O表达式如下:

O=Infer(FTE2ZFDE2)

式中:为逐元素相加操作;Infer为残差卷积操作。

2 损失函数

在网络训练过程中,采用了像素重建损失、感知损失、风格损失和对抗损失使模型重建结果尽可能地接近真实图像。

重建损失采用L1范数进行计算,用于计算生成图像和真实图像之间的差异,损失函数表达式如下:

Lhole=i(Iout(i)-Igt(i))Imask1
Lvalid=i(Iout(i)-Igt(i))(1-Imask)1
Lrecrec(Lhole+Lvalid

式中:Iout为图像的修复结果;Igt为图像的真实值;Imask为掩码图像(mask=1);Lhole为孔洞区域的重建损失;Lvalid为非孔洞区域的重建损失;i分别对应图像64×64、128×128和256×256这3个尺度;λrec为平衡因子,由经验设置为20。

感知损失12不局限于像素级的差异,可以捕捉到图像的结构信息且可以弥补重建损失难以捕获的高级语义。本文中使用在ImageNet13上预训练的VGG-1614网络作为特征提取器,提取生成网络中的特征表示,通过计算这些特征之间的差异来度量生成图像与目标图像之间的感知损失。感知损失定义如下:

Lpere=iϕi(Iout)-ϕi(Igt)1

式中:ϕi(·)为图像在预训练的VGG-16网络中的第i层特征。

对抗损失用于确保重建图像与文本描述以及纹理和结构的一致性。本文中的对抗损失函数采用LSGAN方法15。相比于传统GAN网络的对抗损失设置,该方法可以使生成器产生更真实的结果,降低了梯度消失或梯度爆炸的风险。对抗损失定义如下:

LD=12EIgt[(D(Ig)-1)2]+12EIout[(D(Iout))2]

(18)

LG=EIout[(D(Iout)-1)2]

风格损失用于使重建区域和图像可见部分保持一致。通过引入风格损失16可以使修复区域与周围环境在风格上融合,提高修复结果的自然度。风格损失定义如下:

Lstyle=i(ψi(Iout)-ψi(Igt))1

式中:ψi(·)为Gram矩阵,用于量化图像特征表示中的风格信息,通过比较Gram矩阵之间的差异来度量图像之间的风格差异。

综上所述,网络的总损失为:

Ljoint=LrecrecLpercstylcLstylegLGdLD

式中:λperc、λstyle、λg、λd为函数的平衡因子,由经验值设置。

3 实 验

3.1 实验介绍

为验证本文方法的有效性,在CelebA-HQ数据集上进行了定性分析和定量分析。除此之外,还设计了消融实验,并进行相应的定量分析,以验证引入的注意力感知层和视觉-文本模态融合模块在修复过程中的贡献。

3.2 实验设置

在实验中,使用了由Liu等17创建的大型不规则掩码数据集作为掩码图像。训练时,所有图像的尺寸被设置为256×256。根据掩码区域的占比率,将测试掩码分为6种,分别是10%、20%、30%、40%、50%和60%。模型的训练是在PyTorch框架下实现的,使用的GPU是NVIDIA 4090。Batch size被设置为8。在训练过程中,前100个epoch的初始学习率设置为固定值2×10-4,后100个epoch的学习率线性衰减到0,并使用Adam优化器对网络进行优化。这种设置在训练初期使用较小的学习率有助于稳定模型的训练,随着训练的进行逐渐减小学习率以更细致地调整参数,并选择Adam优化器以提高优化效率。

3.3 定性分析

为验证本文方法的有效性,在CelebA-HQ数据集上进行了实验,并将实验结果与当前6种具有代表性的方法进行比较,结果如图5所示。

RFR方法18是一种基于递归特征推理的图像修复方法,然而,该方法的修复结果存在纹理模糊问题。从图5中RFR的修复结果可以看出,在人脸重建部分存在较多模糊情况。RePaint方法19是基于扩散模型的图像修复方法,能够重建出在视觉效果上逼真的内容。然而,重建区域与人脸可见部分存在不一致的情况。从图5中RePaint的修复结果的眼睛部分可以看出,重建结果显示明显的结构失真,使图像整体看起来不太自然。CTSDG方法20将图像修复分为两个子任务:纹理生成和结构重建。然而,从图5中CTSDG的修复结果可以看出,第一张人脸的右眼存在结果扭曲和第三张图像中眼镜失真的情况。MIGT方法21和TDANet方法22是基于文本描述引导图像修复,但修复图像存在掩码区域与文本语义不一致和失真的情况。如图5中MIGT方法的第二张和第三张图像左右眼睛颜色不一样。TDANet方法的第二张、第三张和第五张图像存在结构扭曲和细节模糊的情况。综上所述,本文提出的方法能够重建出逼真的图像,并且与文本语义保持一致,没有明显修复痕迹,符合人眼的视觉特性。

3.4 定量分析

在6组不规则掩码(1%~10%、10%~20%、20%~30%、30%~40%、40%~50%和50%~60%)上,与当前先进算法进行了比较。本文方法使用了L1误差、Learned perceptual image patch similarity(LPIPS)、Structural similarity index(SSIM)和Peak signal-to-noise ratio(PSNR)这4种主要的评价指标进行定量分析。这些评价指标分为像素级(L1、SSIM、PSNR)和感知级(LPIPS)两类。像素级指标表现在重建图像和原图像之间的差异,图像修复任务是为缺失区域生成合理的纹理和连贯的结构而不是原始图像。为了客观评价图像重建的质量,感知评价指标可以模仿人类判断图像的视觉效果,从高级特征的信息出发而不局限于像素级信息。目前,感知和像素评价指标都已经被应用到图像修复工作中,以衡量图像的质量。表2展示了在CelebA-HQ数据集上的测试结果。从实验结果可以看出,虽然其他方法都能够重建出合理的内容,但在各项指标上,本文方法在整体上都优于其他对比方法。这表明本文方法修复的图像在视觉质量和与原图的相似度上都取得了较好的效果。

3.5 消融实验

为验证注意力感知层和视觉-文本模态融合模块在图像重建过程中的作用,进行了消融实验,以验证这两个模块的有效性。首先,进行一个基准实验,即使用完整的图像修复系统。在消融实验中,分别移除了注意力感知层和视觉-文本模态融合模块中的第二个编码器,然后使用同一组图像进行修复。对消融实验的测试结果进行定量比较分析,结果如表3所示,可以看出,本文模型在各项评价指标上都优于其他模型,验证了注意力感知层和视觉-文本模态融合模块在图像修复中的重要作用。

3.6 人为指定文本特征引导图像重建实验

本文方法采用了人为指定的文本描述,用于引导图像重建实验。这种方法在一定程度上可以控制修复过程,使得修复结果符合特定的要求,如图6所示。其中,图6(a)为掩膜图像,图6(b)为重建图像,图6(c)为原始图像。通过实验结果可以观察到,当图像中的目标被遮住时,该区域的上下文信息会受到破坏。然而,本文模型能够根据给定的文本描述对缺失区域进行合理的重建,使得重构后的图像看起来自然且与周围图像保持一致。这有助于改善图像的质量和视觉效果。通过引入人为指定的文本描述,使得图像修复更具可控性,能够满足用户特定需求。

4 结 论

(1) 提出了一种文本引导图像修复的方法,为图像重建提供了丰富的语义信息,解决了在遇到较大区域缺失时可利用的上下文信息不足的问题。

(2) 提出的视觉-文本模态融合模块和注意力感知层,通过融合图像和文本特征来指导图像修复。这使得修复网络能够重建出在整体结构上保持一致,并具有合理语义的内容。

(3) 在CelebA-HQ数据集上进行了定量和定性分析以及消融研究。实验结果证明了本文方法能够额外利用文本特征,指导生成更自然和上下文语义一致的修复结果。

(4) 本文方法在人脸识别、照片修复和医学影像处理等领域均具有参考和借鉴价值。除了针对RGB人脸图像的重建外,未来还将考虑其他类型的人脸图像重建任务,如红外图像、深度图像等。对于不同模态的图像修复,还需进一步深入探索。

参考文献

[1]

周大可, 张超, 杨欣. 基于多尺度特征融合及双重注意力机制的自监督三维人脸重建[J]. 吉林大学学报: 工学版, 2022, 52(10): 2428-2437.

[2]

Zhou Da-ke, Zhang Chao, Yang Xin.Self-supervised 3D face reconstruction based on multi-scale feature fusion and dual attention mechanism[J]. Journal of Jilin University (Engineering and Technology Edition), 2022, 52(10): 2428-2437.

[3]

王小玉, 胡鑫豪, 韩昌林. 基于生成对抗网络的人脸铅笔画算法[J].吉林大学学报: 工学版, 2021, 51(1): 285-292.

[4]

Wang Xiao-yu, Hu Xin-hao, Han Chang-lin. Face pencil drawing algorithms based on generative adversarial network[J]. Journal of Jilin University (Engineering and Technology Edition), 2021, 51(1): 285-292.

[5]

Pathak D, Krahenbuhl P, Donahue J, et al. Context encoders: feature learning by inpainting[C]∥Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, Las Vegas, USA, 2016: 2536-2544.

[6]

Iizuka S, Simo S E, Ishikawa H. Globally and locally consistent image completion[J]. ACM Transactions on Graphics (ToG), 2017, 36(4): 1-14.

[7]

Yan Z, Li X, Li M, et al. Shift-net: image inpainting via deep feature rearrangement[C]∥Proceedings of the European Conference on Computer Vision (ECCV), Munich, Germany, 2018: 1-17.

[8]

Liu H, Wan Z, Huang W, et al. Pd-gan: probabilistic diverse gan for image inpainting[C]∥Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, Nashville, USA, 2021: 9371-9381.

[9]

Wan Z, Zhang J, Chen D, et al. High-fidelity pluralistic image completion with transformers[C]∥Proceedings of the IEEE/CVF International Conference on Computer Vision, Nashville, USA, 2021: 4692-4701.

[10]

Li W, Lin Z, Zhou K, et al. Mat: mask-aware transformer for large hole image inpainting[C]∥Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, New Orleans, USA, 2022: 10758-10768.

[11]

Huang W, Deng Y, Hui S, et al. Sparse self-attention transformer for image inpainting[J]. Pattern Recognition, 2024, 145: 109897.

[12]

Lian J, Zhang J, Liu J, et al. Guiding image inpainting via structure and texture features with dual encoder[J]. The Visual Computer, 2024, 40: 4303-4317.

[13]

Devlin J, Chang M W, Lee K, et al. Bert: pre-training of deep bidirectional transformers for language understanding[J/OL]. [2023-12-16]. arXiv preprint arXiv:

[14]

Johnson J, Alahi A, Fei F L. Perceptual losses for real-time style transfer and super-resolution[C]∥14th European Conference, Amsterdam, The Netherlands, 2016: 694-711.

[15]

Russakovsky O, Deng J, Su H, et al. Imagenet large scale visual recognition challenge[J]. International Journal of Computer Vision, 2015, 115: 211-252.

[16]

Simonyan K, Zisserman A. Very deep convolutional networks for large-scale image recognition[J/OL].[2023-12-17]. arXiv preprint arXiv:

[17]

Mao X, Li Q, Xie H, et al. Least squares generative adversarial networks[C]∥Proceedings of the IEEE International Conference on Computer Vision, Venice, Italy, 2017: 2794-2802.

[18]

Gatys L A, Ecker A S, Bethge M. Image style transfer using convolutional neural networks[C]∥Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, Las Vegas, USA, 2016: 2414-2423.

[19]

Liu G, Reda F A, Shih K J, et al. Image inpainting for irregular holes using partial convolutions[C]∥Proceedings of the European Conference on Computer Vision, Munich, Germany, 2018: 85-100.

[20]

Li J, Wang N, Zhang L, et al. Recurrent feature reasoning for image inpainting[C]∥Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, Seattle, USA, 2020: 7760-7768.

[21]

Lugmayr A, Danelljan M, Romero A, et al. Repaint: inpainting using denoising diffusion probabilistic models[C]∥Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, New Orleans, USA, 2022: 11461-11471.

[22]

Chen L, Yuan C, Qin X, et al. Contrastive structure and texture fusion for image inpainting[J]. Neurocomputing, 2023, 536: 1-12.

[23]

Li A, Zhao L, Zuo Z, et al. MIGT: multi-modal image inpainting guided with text[J]. Neurocomputing, 2023, 520: 376-385.

[24]

Zhang L, Chen Q, Hu B, et al. Text-guided neural image inpainting[C]∥Proceedings of the 28th ACM International Conference on Multimedia, New York, USA, 2020: 1302-1310.

基金资助

国家自然科学基金项目(62061023)

国家自然科学基金项目(82260364)

甘肃省杰出青年基金项目(21JR7RA345)

甘肃省自然科学基金项目(23JRRA1485)

甘肃省自然科学基金项目(22JR5RA543)

甘肃省自然科学基金项目(22JRJ5RA166)

兰州市青年科技人才创新项目(2023-QN-109)

AI Summary AI Mindmap
PDF (1320KB)

520

访问

0

被引

详细

导航
相关文章

AI思维导图

/