MSFE-AF:多尺度特征提取与自适应融合的敦煌壁画修复

田瑞 ,  邬侗辰 ,  冯丹丹 ,  辛子昊

湖南大学学报(自然科学版) ›› 2026, Vol. 53 ›› Issue (6) : 14 -25.

PDF (5278KB)
湖南大学学报(自然科学版) ›› 2026, Vol. 53 ›› Issue (6) : 14 -25. DOI: 10.16339/j.cnki.hdxbzkb.2026268
计算机科学

MSFE-AF:多尺度特征提取与自适应融合的敦煌壁画修复

作者信息 +

MSFE-AF: multi-scale feature extraction and adaptive fusion for Dunhuang mural inpainting

Author information +
文章历史 +
PDF (5404K)

摘要

针对现存的敦煌壁画图像修复算法存在特征提取能力不足及语义信息难以捕捉的问题,提出一种多尺度特征提取与自适应融合(multi-scale feature extraction and adaptive fusion, MSFE-AF)的敦煌壁画修复模型.首先,构建由全局层与局部层组成的并行网络,在全局层使用多尺度并行卷积和并行注意力进行多尺度特征提取,在局部层结合感受野注意力卷积与残差密集网络对局部细节进行深度提取.其次,通过跳跃连接引导编码器-解码器的同时加入空间自适应特征调制模块提升高层特征与低层细节的融合,保证修复结果整体的一致性.最后,利用生成器与鉴别器之间的对抗性,完成敦煌壁画修复任务.在不规则随机掩码、模拟霉斑掩码数据集以及真实破损场景下进行实验,结果表明,该模型相较于对比算法在主观评价指标以及PSNR、SSIM、LPIPS、FID、L2损失等客观评价指标方面均具有显著优势.

Abstract

To address insufficient feature extraction and semantic information capture in the existing Dunhuang mural inpainting algorithms, this paper proposes a multi-scale feature extraction and adaptive fusion (MSFE-AF) model. First, we construct a parallel network comprising global and local layers: the global layer employs multi-scale parallel convolution and attention mechanisms for comprehensive feature extraction, while the local layer integrates receptive field attention convolution with residual dense networks for detailed refinement. Second, a spatial adaptive feature modulation module enhances feature fusion between encoder-decoder layers via skip connections, ensuring inpainting consistency. Finally, adversarial learning between the generator and discriminator optimizes mural inpainting. Experimental results demonstrate superior performance over the existing methods across irregular masks, simulated mildew patterns, and real damaged scenarios, with significant improvements in PSNR, SSIM, LPIPS, FID, and L2 metrics as well as visual quality assessments.

Graphical abstract

关键词

深度学习 / 敦煌壁画修复 / 多尺度特征提取 / 特征融合

Key words

deep learning / Dunhuang mural inpainting / multi-scale feature extraction / feature fusion

引用本文

引用格式 ▾
田瑞,邬侗辰,冯丹丹,辛子昊. MSFE-AF:多尺度特征提取与自适应融合的敦煌壁画修复[J]. 湖南大学学报(自然科学版), 2026, 53(6): 14-25 DOI:10.16339/j.cnki.hdxbzkb.2026268

登录浏览全文

4963

注册一个新账户 忘记密码

敦煌壁画堪称世界文化艺术领域的卓越典范,凭借其丰富多元的表现形态以及深邃厚重的文化内涵,在全球范围内声名远扬,是当今世界现存规模最为宏大、保存状况最为良好的石窟艺术宝藏.壁画光彩夺目、美不胜收,形成了独特的艺术魅力,具有极高的人文价值与学术研究价值1.然而,敦煌壁画已经历千载的风雨洗礼,西北地区恶劣的环境条件,加上人为破坏和颜料的自然剥落,现有的敦煌壁画保存状况形势危急,部分壁画遭受霉变、裂缝、微生物侵蚀等病害,亟待采用科学化的方法进行保护与修复.传统的修复技术能够实现壁画修复,但存在修复周期长、人工成本高等突出问题.因此,敦煌壁画的保护遭遇了前所未有的挑战,迫切需要借助现代科学技术来开展保护与修复工作.
图像修复旨在为损坏图像的缺失区域提供视觉上合理的重建2.现阶段,图像修复算法主要分为传统与基于深度学习的图像修复算法两类.传统方法通常借助已知区域推断未知区域,依据纹理结构一致性、样本相似性等构建算法.Bertalmio等3提出结合图像灰度级与向量场联合插值填充图像,以及运用流体动力学等将光线平滑传播至待修复区域的方法.但该方法在处理大尺度破损图像时,因未知区域过大,难以准确推断复杂纹理与结构信息,易导致修复图像结构扭曲、纹理不自然.面对复杂纹理图像,现有算法原理也难以精确匹配和还原,无法有效修复.焦莉娟等4在优先权计算中引入散度项,改进图像块修复顺序,并将协方差因子引入相似度计算,减少了图像块误匹配率.然而,该方法仍面临高计算复杂度问题,处理大规模图像时,计算效率显著降低.杨筱平等5采用Dempster-Shafer (D-S)证据理论的数据融合方法修复敦煌壁画的色变和人为污染破损.此方法能较好处理不确定性信息,但对图像细节恢复能力较弱,在复杂损伤区域,修复效果可能模糊,无法完全恢复图像细节.陈永等6针对敦煌壁画裂纹形状多样且不规则的特性,改进CDD算法中的扩散项,引入自适应控制策略,利用光滑函数进行角点扩散以实现壁画修复.但光滑函数的选择可能导致修复区域细节丢失,在细节丰富区域,修复结果过于平滑,影响壁画的真实还原效果.
上述方法虽在修复破损较小的图像时表现良好,但在修复包含大面积损坏区域或具有混合语义纹理及复杂结构的壁画图像时,生成的修复结果可能与原始图像存在显著差异7.近年来,基于深度学习的图像修复算法相比传统方法在修复大面积损失区域时表现出更优异的能力8,能够更有效地应对结构混乱和边缘模糊等问题.尤其是在处理壁画中的复杂结构和细腻纹理方面,这类算法展现出更佳的修复效果,从而显著提升壁画整体的一致性.Pathak等9最早提出基于深度学习的上下文编码图像修复法,其编码器与解码器通过通道全连接层相连,减少了模型参数量.You等10的上下文注意力机制结合编码器-解码器结构,虽能生成逼真的修复图像,但在捕捉区域内部特征关联上存在局限.刘仲民等11结合编码器-解码器与卷积神经网络,使修复图像结构和纹理更一致.Yan等12融入移位连接层优化特征传递,但在修复壁画复杂破损场景下效果欠佳.Li等13的循环特征推理网络以循环渐进的方式完善特征图,却在图像融合时丢失部分信息,影响壁画修复的准确性.Chen等14结合Transformer与传统卷积神经网络,改进窗口自注意力机制,但在捕捉壁画轮廓形状时存在关键轮廓特征修复不足的问题.Deng等15提出高效Transformer模型解决高分辨率图像计算成本问题,然而处理壁画的局部细节不够精准.Liu等16的CSA注意力层提升了修复质量,但细节修复缺少分辨率感知与精细纹理生成能力.王欢等17提出了一种结合全局一致性与局部连续性的壁画修复方法,却对深层次语义信息理解不足.Chen等18引入文本描述联合修复,但因依赖文本描述,在文本不完整或模糊时影响修复效果.
敦煌壁画复杂的色彩体系、非线性的退化特征、多尺度裂纹的破损区域及模糊边界,要求修复方法应兼顾局部细节重建与全局语义连贯性.现存的算法有时在面对部分复杂的语义信息、大面积破损、纹理特征深度还原时,会表现出特征提取不足及细节重构丢失等问题.针对以上问题,本文提出一种多尺度特征提取与自适应融合的敦煌壁画修复模型,主要工作如下.
1)提出多尺度卷积并行注意力transformer
(multi-scale convolutional parallel attention Transformer, MCPA Transformer)网络,该网络采用一个多尺度并行卷积模块和一个增强并行注意力模块,通过多次提取图像的全局特征信息,将信息传递到局部层,结合局部特征进行特征融合处理,实现更为精确的纹理细节的图像修复.
2)设计感受野残差密集注意力(receptive-field residual dense attention, RFRDA)网络,通过在网络中堆叠多个引入残差连接的融合感受野注意力卷积的残差密集块,在全局层与局部层之间采用并行处理策略,并配合共享注意力机制,使网络在首尾实现多尺度特征提取与融合,避免结构修复不完整与像素填补不一致等问题,能够显著提升敦煌壁画图像的纹理修复质量与结构一致性.
3)引入CoTAttention19模块,将全局层和局部层输出的特征输入到CoTAttention模块中进行处理,实现全局与局部信息的有效融合,使得模型既能保留细节信息,又能理解全局结构.
4)在编码器-解码器结构中,通过对每层卷积与反卷积之间添加跳跃连接并加入深度空间自适应特征(depthwise spatially-adaptive feature, DSAF)网络,将编码器的低级特性直接传输到解码器,跳跃连接保留图像的细节信息,缓解梯度损失问题,增加高级语义与低级空间细节的融合.而DSAF模块则通过多尺度特征提取和空间自适应调制,动态调整特征权重,帮助模型聚焦关键区域,提升全局结构和局部细节的修复效果.两者结合,不仅确保编码器与解码器之间高效的信息流动,还通过自适应调制机制加强对破损区域的修复,使模型在保持全局结构完整性的同时,能细致地恢复局部细节,显著提升修复效果.

1 本文方法

1.1 整体模型

敦煌壁画图像蕴含着大量丰富的纹理与结构信息.在对受损敦煌壁画进行修复时,极易忽视受损区域与完整区域特征信息之间存在的差异,进而对修复工作产生误导,致使不能理解壁画的深层语义信息.因此,本文提出一种多尺度特征提取与自适应融合的敦煌壁画修复模型,整体模型如图1所示,该模型的主干网络采用生成对抗网络架构,由生成器和鉴别器组成.

生成器采用编码器-解码器架构,主要由全局层MCPA Transformer网络和局部层RFRDA网络组成.首先,带有掩码的图像进入编码器,经过多次下采样卷积运算,将输入图像的特征分离出来.这些属性被转移到全局层和局部层分别进行处理,通过共享注意力机制实现全局层和局部层特征的融合.全局层MCPA Transformer采用一个多尺度并行卷积模块和一个增强并行注意力模块,多尺度并行卷积模块可以捕获大面积的图像信息并修复纹理细节,增强并行注意力模块可以并行提取原始特征的共享全局信息和位置依赖性局部信息.有助于修复远距离关联的纹理和结构,能够更好地处理复杂纹理以及深层次结构20.局部层RFRDA通过堆叠多个感受野残差密集注意力网络捕捉图像的细节信息,增强模型的特征提取能力,确保修复后的图像在保留全局结构的同时,具备丰富的细节和自然的纹理.为增强修复图像的一致性,本文引入CoTAttention模块,将全局层和局部层输出的特征输入到CoTAttention模块中,实现全局与局部信息的有效融合,使得模型既能保留细节信息,又能理解全局结构.此外,该模型在编码器的各层卷积与解码器的各层反卷积之间加入跳跃连接,图像特征输入到每层卷积后经过空间自适应特征DSAF模块输出到对应的反卷积中,能够保留壁画的空间细节与纹理信息,缓解梯度消失并加速训练,跳跃连接保留并传递浅层特征,帮助解码器恢复高分辨率细节.通过一系列上采样卷积操作得到修复后的图像.最后鉴别器采用谱归一化的马尔可夫判别模型进行对抗博弈,完成壁画修复任务.

1.2 全局多尺度特征提取与信息融合层

MCPA Transformer使用一系列不同大小卷积核的卷积层,能够在不同尺度上提取图像特征,较大的卷积核负责捕捉更大的全局上下文信息,而较小的卷积核用于捕捉局部细节21.通过设计增强并行注意力模块结合通道注意力和像素注意力,提升模型对图像重要特征的感知能力.该结构能够突出关键区域的局部特征,同时能够保留全局信息,有效地增强壁画修复过程中细节的恢复,确保修复后的图像既具备自然纹理特征,又保持全局一致性.其模型如图2所示,通过多尺度卷积核和并行注意力机制,在不同层次上捕获并融合图像的全局结构和局部细节,增强模型对复杂图像的特征提取能力.

首先,对输入特征进行归一化,经过逐点卷积与普通卷积后多尺度并行进入不同大小的扩张卷积中进行多尺度特征提取.其次,将并行分支输出在通道维度拼接后,输入到逐点卷积—GELU激活函数—逐点卷积中进行融合,与输入特征逐元素相加,然后再次对输入特征进行归一化,同时送入像素注意力和通道注意力两条并行分支:像素注意力提取位置相关的局部信息,通道注意力提取全局维度的通道信息,并在通道维度拼接后通过点卷积—GELU激活函数—逐点卷积进行融合,最后与原始输入特征逐元素相加,形成残差输出.

X^=BatchNorm(X)
X0=PWConv(X^),X1=Conv(X0),X2=Concat(DWDConv19(X1),DWDConv13(X1),DWDConv7(X1))
y=X+PWConv(GELU(PWConv(X2)))

式中:X为原始特征图;BatchNorm为批标准化;X^为经过批标准化的输出特征图;PWConv表示逐点卷积(point-wise convolution);DWDConv表示扩张卷积(dilated convolution);Concat表示在通道维度上连接特征;GELU表示激活函数.

PAp=Sigmoid(PWConv(GELU(PWConv(X^)))),  Fp=X^PAp
CAc=Sigmoid(PWConv(GELU(PWConv(GAP(X^))))),   Fc=X^CAc
F=ConcatFc,Fp,y=X+PWConv(GELU(PWConv(F)))

式中:PAp表示生成像素注意力图;CAc表示生成通道注意力图;Sigmoid(·)表示特征提取函数;GAP表示全局平均池化;FpFc为输出特征图;表示逐元素乘法.

总体而言,MCPA Transformer既能捕捉图像的全局结构和局部细节,又能有效地聚焦重要信息,抑制噪声,从而提高壁画修复的精度和鲁棒性.它综合多尺度特征提取与注意力机制,使修复过程更加智能和细致.

1.3 局部感受野残差密集注意力网络层

敦煌壁画由于受到时间推移、环境变化等多种因素的影响,常常出现颜色褪色、颜料层脱落、表面破损等现象.这些问题导致图像中的原始特征逐渐弱化甚至完全消失.为充分利用输入的相关信息,本文设计一种感受野卷积的残差密集注意力网络.该网络通过可学习的参数,能够有效区分壁画图像中的完整区域和受损区域,精准提取局部特征,从而更高效地完成图像修复工作.感受野注意力卷积残差密集网络由多个RFRDA模块组成,其结构如图3所示.为克服传统卷积在固定采样区域中存在的局限性,在RFRDA模块中引入感受野注意力卷积22.传统卷积无法顾及目标区域的位置和形状差异,导致采样不够精准.相比之下,感受野注意力卷积通过自适应调整采样位置,使得感受野更具灵活性,从而更好地处理不同形态的目标区域.通过堆叠多个感受野注意力卷积,模型不仅能够扩大感受野,还能增强灵活性和细致的局部修复效果,从而显著提升处理复杂、不规则图像结构的能力,最终恢复壁画的原始细节与风貌.此外,感受野注意力卷积残差块通过跳跃连接实现特征相加,能够有效缓解深层网络中的梯度消失问题,保证原始信息的传递,避免特征丢失,从而保留壁画的全局结构,确保修复后画面的风格一致性.

1.4 空间自适应特征调制跳跃增强网络

通过在编码器和解码器的卷积与反卷积层之间添加跳跃连接并在跳跃连接上加入DSAF模块,DSAF跳跃增强网络可以更好地保留图像的多尺度特征,增强局部与全局信息的交互,其结构如图4所示.这种增强的跳跃连接不仅能够避免在深层网络中信息丢失,还能通过空间自适应特征调制重要特征的表达,从而捕捉壁画图像中微小而复杂的细节23.具体而言,DSAF通过多尺度特征提取生成注意力图,实现空间自适应的特征调制机制,有助于更好地捕捉局部和全局特征之间的关系.在处理敦煌壁画图像时,DSAF通过特征金字塔结构提取多尺度特征,并利用深度卷积和上采样操作生成精细的特征表示.在此基础上,1×1卷积用于对多尺度特征进行聚合,从而增强局部和全局特征的交互能力24.在原模块的基础上加入通道注意力,对每个通道输出的特征进行加权,促进不同通道之间的信息交互,提升模型的鲁棒性.最后,通过ReLU激活函数生成注意力图,进而对输入特征进行逐元素调制,以实现自适应的空间特征重建.该机制在减少内存消耗的同时,显著提升图像重建的性能,适用于敦煌壁画图像中复杂纹理和细节的修复.DSAF跳跃增强网络通过跳跃连接的设计,进一步提升特征传递的效率,确保修复过程中信息的有效传递.

在DSAF模块中,应用特征金字塔来生成一个空间自适应的特征调制注意力图.为降低模型复杂度并获得金字塔特征表示,首先对归一化后的输入特征进行通道分割操作,生成四部分组件.3×3的深度卷积用于处理第一部分,其余部分则被输入多尺度特征生成单元.给定输入特征X,此过程可以表示为

X1,X2,X3,X4=SplitX,X^1=DWConv3×3X1,X^i=pDWConv 3×3p2iXi,2i4

式中:Split(·)是通道分割操作;DWConv3×3是带有3×3卷积核大小的深度卷积;p表示通过最近邻插值在特定级别上将特征上采样到原始分辨率pp2i表示将输入特征下采样到大小p2i,以此实现选择具有辨别能力的特征以学习非局部交互,输入特征通过自适应最大池化生成多尺度特征.然后将这些多尺度特征拼接起来,通过1×1卷积聚合局部和全局的特征.该过程可表示为

X^=Conv1×1ConcatX^1,X^2,X^3,X^4

式中:Concat()表示沿通道维度进行拼接操作;Conv1×11×1卷积,在获得精练的特征表示X^后,通过ReLU激活函数对其进行归一化,并以逐元素乘积的方式自适应地调制X.此过程可表示为

X¯=ϕ(X^)X

式中:ϕ()代表ReLU函数;是逐元素乘积.应用这种空间自适应调制机制,可以较小的内存和计算成本聚合壁画特征.这种多尺度形式在减少内存消耗的同时,性能优于直接使用深度卷积提取特征.

1.5 损失函数[25]

为实现高质量的敦煌壁画图像修复,本文设计并采用多种损失函数,确保模型在重建图像时能够保留尽可能多的细节、结构和风格信息.具体包括感知损失、对抗损失、风格损失、边缘损失.

1.5.1 感知损失

感知损失基于预训练的VGG19网络,它通过度量高层次特征空间中的差异来衡量图像质量.与像素级损失不同,感知损失能够捕捉到图像的内容和结构信息,从而提升图像的视觉效果.感知损失的公式如下:

perc =iλiϕiIpred -ϕiIgt1

式中:λi表示不同层特征映射的权重,用于控制不同层在总损失中的影响;ϕi()表示VGG19网络第i层的特征图;Ipred 表示生成的预测图像;Igt表示原始图像;1表示特征映射的逐元素差异的绝对值之和.

1.5.2 对抗损失

为提升生成图像的真实感,我们采用基于GAN(生成对抗网络)的对抗损失.生成器的目标是生成足够逼真的图像,以误导鉴别器.对抗损失的公式如下:

adv=EIgtϕDsnIgt+EIpred ϕ1-DsnGIin

式中:Dsn为谱归一化鉴别器;ϕ()为ReLU激活函数;E表示对图像的期望值;Iin为输入图像.

1.5.3 风格损失

为确保生成图像的风格与目标图像一致,采用风格损失.风格损失通过比较生成图像与真实图像的Gram矩阵来度量它们的风格差异,定义如下:

style=iGϕiIpred-GϕiIgt1

Gram矩阵用于捕获图像中的纹理和风格信息,通过在多个卷积层上计算Gram矩阵的差异,风格损失确保生成的图像在不同的层次上与目标图像在风格上具有相似的特征.计算公式为

  Gϕi(I)=ϕi(I)Tϕi(I)

式中:G()表示特征图的Gram矩阵.

1.5.4 边缘损失22

边缘信息对图像的结构化表示尤为重要.为增强生成图像的边缘质量,我们在损失函数中引入边缘损失.边缘损失主要用于保证生成图像的边缘与真实图像的边缘在结构上的一致性,公式如下:

edge=1Nl=1NIprededge(l)-Igtedge(l)2

式中:Iprededge Igtedge分别表示生成图像和真实图像的边缘图;N表示图像中的像素总数;l表示像素位置.

1.5.5 总损失函数

综上所述,本文的总损失函数可表示为

total =λperc perc +λadv adv +λstyle style +λedge edge 

式中:λperc λadv λstyle λedge 分别为感知损失、对抗损失、风格损失、边缘损失对应的权重,λperc =0.1,λadv =0.1,λstyle =250,λedge =10.设置较小的λperc λadv 可避免生成图像过于依赖感知与对抗损失函数造成细节损失或伪影.λstyle =250强调风格一致的重要性,尤其在处理复杂纹理和色彩一致性时表现尤为重要. λedge =10有助于提高生成图像的边缘锐度,提升整体修复效果.通过设计合理的损失函数,本文模型能够在保持风格一致性的同时,生成高质量、细节丰富的图像.

2 实验结果与分析

为验证本文方法的有效性与准确性,实验选用敦煌壁画图像数据集.该数据集中的图片均为未经修复的原始图像,局部信息存在较为严重的缺失,纹理较为模糊.敦煌壁画图像数据集涵盖多种图像类型,如山水、菩萨、字画、建筑与服饰等.本文实验运行环境为Windows 11操作系统,使用Python 3.11及Pytorch 2.1.2,硬件配置为Intel(R) Core (TM) i9-13900HK CPU @5.40 GHz,32.0 GB RAM,NVIDIA GeForce RTX 4070,对比实验均在相同配置环境下运行.

在模型训练阶段,学习率为10-3,批次大小为2,训练周期为300轮.使用8 000张图片作为训练集,使用1 000张图片作为测试集,输入图像大小均为256×256.为训练模型,使用公开掩码,覆盖率为10%~40%.为进一步验证有效性,绘制模拟霉斑掩码,掩码覆盖率为10%~40%,验证本文提出的网络模型.

为验证本文方法的有效性,选用敦煌壁画图像作为实验对象,采用人为随机破损及模拟霉斑掩码进行修复实验,对比实验选用近年来较流行的网络模型Shift-Net12、RFR13、SWMH14、T-former15、CSA16、Wang17、Chen18.同时使用峰值信噪比(PSNR)、结构相似度(SSIM)、学习感知图像块相似性(LPIPS)、图像相似度(FID)、L2损失5种评价指标对修复效果进行评价.

1) Shift_Net12:基于U-Net架构引入一个特殊的Shift-connection层,通过移动已知区域的编码特征来估计和填充缺失部分,同时使用指导损失优化解码特征.

2) RFR13:一种集成递归推理特征与知识一致性注意力模块的网络架构,能够从多个尺度高效提取特征,从而实现对图像细节和上下文信息的精准捕捉.

3) SWMH14:通过将特征图划分为条形窗口,并应用多头机制来减少计算量和提升图像修复效果.

4) T-former15:通过长程建模能力更好地捕捉图像中的全局依赖关系,利用注意力机制处理具有多样和复杂形式的破损图像.

5) CSA16:通过考虑图像已知区域和缺失区域之间的特征相似性,并在生成的修复区域内进行迭代优化,从而提高修复结果的连贯性和一致性.

6) Wang17:一种结合全局一致性与局部连续性的壁画修复模型,利用线性系统和图像修复间所蕴含的关系,构建具有全局过完备特性的相似块集合字典,同时构造弹性网正则化下的稀疏修复模型.

7) Chen18:一种通过引入文本描述的联合修复模型,通过文本解耦模块提取并解耦文本语义信息,利用注意力机制与受损壁画区域对齐;再经多模态融合模块,将增强后的文本与图像特征结合,引导缺失区域修复.

2.1 添加不规则随机掩码修复实验

本节使用不规则随机掩码模拟壁画不同程度的破损,掩码覆盖率为10%~40%,进行效果验证实验.抽样选取5张敦煌壁画图像作为实验样本,与上文提出的对比实验方法进行比较,实验结果如图5所示.通过对比发现,本文方法与上文提出的7种对比实验方法均可修复纹理结构较为简单的壁画图像,这些方法之间的差别主要体现在修复纹理信息与结构相对复杂的壁画图像.图5(b)Shift_Net网络在语义信息层面能较好地复原整体轮廓,但在部分区域的纹理细节处理上,易呈现不均匀分布与局部模糊的问题.图5(c)RFR网络修复后虽能在一定程度上维持色彩层次,但在修复人物结构与纹理时,会出现纹理模糊现象.图5(d)SWMH网络修复的图像在色彩分层方面较为平滑,但部分区域会出现伪影.图5(e)T-former网络整体修复效果较为稳定,然而在处理部分局部高细节区域时,可能出现纹理不够精细或边缘过渡不够自然的情况. 图5(f)CSA网络整体表现较佳,但在细节纹理修复时存在纹理模糊问题.图5(g)Wang提出的模型在修复后于保持全局与局部一致性方面表现良好,但在深层次语义信息理解上有所欠缺.图5(h)Chen提出的模型在修复模糊信息时,呈现出修复效果不清晰的状况.为验证模型在模拟霉斑掩码下的修复效果,本文采用PSNR、SSIM、LPIPS、FID和L2损失等评价指标展开有效性验证,对比实验的评价结果如表1所示.

对比实验结果与评价指标的分析验证了本文在修复效果方面的有效性.与其他方法相比,本文方法在PSNR、SSIM、LPIPS、FID指标上表现更优,L2损失更低,同时在视觉层面上,修复后的图像更接近原始壁画.针对不同对比实验情景,本方法展现出更高的准确度和鲁棒性,能够更好地还原图像中的纹理细节与结构信息.本文模型在人为添加不规则随机掩码时能够具备更为精确的纹理细节与结构信息,显著提升敦煌壁画图像的结构与纹理修复质量.

2.2 添加模拟霉斑掩码壁画修复实验

本节使用模拟霉斑掩码还原真实壁画受天气、环境等影响下的壁画破损场景,从而使模型适应真实破损壁画修复环境.实验结果如图6所示.与本文方法相比,图6(b)Shift_Net网络的修复结果表明,该网络无法准确理解像素之间的语义关系,导致修复效果较为模糊.例如,在佛像衣服与背景颜色的交界处,未能实现良好的特征区分.图6(c)RFR网络的修复结果未能还原图像的真实色彩,修复区域出现小面积的阴影及像素模糊等问题.例如,第二张图中佛像的衣服颜色还原不准确,该模型未能很好地捕捉纹理细节.图6(d)SWMH网络的修复结果在捕捉图像轮廓形状时未能有效修复关键的轮廓特征,修复后的壁画图像在结构特征上存在缺失、模糊等问题.图6(e)T-former网络的修复结果显示,虽然模型能够对缺失区域进行填充,但在色彩分布上仍然存在不均,部分结构衔接不合理.图6(f)CSA网络可以修复出整体轮廓,但在边缘修复的准确性仍不够理想.图6(g)Wang所提出的网络修复后会出现小面积的伪影和模糊的问题.图6(h)Chen所提出的网络可以对残缺位置进行填充,但没有建立起像素之间的连续性.为进一步验证模型在模拟霉斑掩码下的修复效果,本文采用PSNR、SSIM、LPIPS、FID和L2损失等评价指标展开有效性验证,对比实验的评价结果如表2所示.

对比实验结果和评价指标证明本文提出的算法在修复效果上的有效性,本文方法的PSNR、SSIM、LPIPS、FID评价指标均优于对比实验方法,L2损失低于对比实验方法,修复后的壁画图像在视觉上更接近原始图像.针对7种不同的对比实验情景,本模型展现了更高的精确度,能够更好地恢复图像中的纹理细节与结构信息.因此,对于敦煌壁画这类具有复杂结构和精细纹理的图像,本文方法显著提升其修复质量,使得修复后的图像在结构完整性和纹理准确性方面表现出色.

2.3 模拟真实破损壁画修复实验

为进一步验证本文方法对真实破损壁画修复的效果,本文选取真实破损壁画图像进行修复实验,包括人为划痕、颜料层粉化、部分区域结构性剥落.其结果如图7所示.图7(b)Shift_Net网络的修复结果无法理解缺失部分像素的语义信息,在部分区域存在修复不完全的问题.例如第一行中间黑色区域,网络未能对缺失部分进行有效的修复,并且未能正确判断该区域的修复需求.图7(c)RFR网络一定程度上能够填补缺失内容,但在纹理重构部分偶尔会出现伪影导致模糊,无法较好地还原细节特征.图7(d)SWMH网络在恢复图像整体结构方面存在一定优势,但在一些区域容易出现阴影或不连续的现象. 图7(e)T-former网络在一些复杂纹理场景中存在局限性,修复后的图像存在色彩偏差、结构不一致等问题.图7(f)CSA网络虽能对破损区域进行填充,但填充的效果并不理想.图7(g)Wang所提出的网络未能对破损区域进行填充,没有达到修复的目的.图7(h)Chen所提出的网络在修复破损区域时不能理解像素间的语义关系,存在修复不彻底的问题.相比上述模型,本文方法对整体结构和细节纹理的还原更为真实,既能准确捕捉局部纹理特征,又能保持色彩与背景的连贯性,视觉效果更加自然.

本文采用PSNR、SSIM、LPIPS、FID和L2损失等评价指标进行有效性验证,对比实验的评价结果如 表3所示.综上所述,本文方法在纹理与细节的重构方面更具优势,能够显著提升修复完整度与视觉连贯性.

2.4 消融实验

为验证本文提出的模型在壁画修复效果上的递进式提升,我们对测试集进行模块消融实验.实验结果显示,各个模块对修复效果的提升如图8所示,其中图8(a)为壁画原始图像,图8(b)为模拟壁画破损图像,图8(c)为加入CoTAttention模块的修复实验效果图,图8(d)为结合CoTAttention模块与RFRDA模块的修复实验效果图,图8(e)为加入CoTAttention模块与RFRDA模块和 MCPA模块的修复实验效果图,图8(f)为加入CoTAttention模块与RFRDA模块、MCPA模块和DSAF模块的修复实验效果图.表4为增删不同模块对修复结果评价指标的对比.

从实验结果图可以看出,基础模型加入CoTAttention模块后可以大致填充图像的结构,但无法还原图像的真实色彩,存在语义模糊等情况;CoTAttention模块与RFRDA模块结合有效缓解语义模糊的问题,图像的边缘更加清晰、结构更加完整,但由于过度依赖周围环境信息进行填充,导致部分区域出现视觉差异.加入CoTAttention模块与RFRDA模块和MCPA模块后,通过多尺度特征融合提高细节处理能力,但一些区域的非关键噪声面积被放大,关键细节被忽略.CoTAttention模块与RFRDA模块、MCPA模块和DSAF模块结合后,修复效果达到最优状态,在对全局结构的合理性重建和局部纹理细节的细化方面均具有效性,内容表达更加精确.通过对比表4的评价指标可以得出,本文模型修复效果更接近原始图像.

3 结 论

本文针对敦煌壁画修复过程中存在的纹理结构复杂、破损面积不规则以及语义信息难以捕捉等问题,提出一种多尺度特征提取与自适应融合的敦煌壁画修复模型.该模型通过设计MCPA Transformer 获取多尺度全局特征,结合RFRDA捕捉局部纹理细节信息,利用DSAF跳跃增强网络自适应调制提取关键特征,在保持整体结构合理性的同时,重构局部纹理,实现色彩一致性.实验结果表明,本文方法在不规则随机掩码、模拟霉斑掩码以及真实破损场景下均能取得较好的修复效果,与主流算法对比,PSNR、SSIM、LPIPS、FID等客观指标有明显提升,L2损失更低,修复效果的主观感受更真实.总体而言,本文方法在面向敦煌壁画的修复任务中表现出色.但敦煌壁画的保护与修复仍面临巨大的挑战,未来工作可进一步探索如何在高分辨率和更多样化的破损场景中提升修复的效率与精度,为数字化保护与修复敦煌壁画工作做出更大贡献.

参考文献

[1]

王玉芳, 徐超. 敦煌壁画色彩中的“五色观”探析[J] 丝绸之路2025(1): 34-44.

[2]

WANG Y FXU C .An exploration and analysis of the “five-color view” in the colors of Dunhuang frescoes[J]. The Silk Road2025(1): 34-44.(in Chinese)

[3]

XIANG H YZOU QNAWAZ M ALIet al. Deep learning for image inpainting:a survey[J]. Pattern Recognition2023134:109046.

[4]

BERTALMIO MSAPIRO GCASELLES Vet al. Image inpainting[C]//Proceedings of the 27th Annual Conference on Computer Graphics and Interactive Techniques-SIGGRAPH’00.Not Known. ACM, 2000: 417-424.

[5]

焦莉娟, 王文剑, 李秉婧, .改进的块匹配五台山壁画修复算法[J].计算机辅助设计与图形学学报201931(1):118-125.

[6]

JIAO L JWANG W JLI B Jet al .Wutai Mountain mural inpainting based on improved block matching algorithm[J].Journal of Computer-Aided Design & Computer Graphics201931(1): 118-125.(in Chinese)

[7]

杨筱平,王书文 .基于优先权改进算法的敦煌壁画复杂破损区域修复[J].计算机辅助设计与图形学学报201123(2):284-289.

[8]

YANG X PWANG S W .Dunhuang mural inpainting in intricate disrepaired region based on improvement of priority algorithm[J].Journal of Computer-Aided Design & Computer Graphics201123(2): 284-289.(in Chinese)

[9]

陈永, 艾亚鹏, 郭红光. 改进曲率驱动模型的敦煌壁画修复算法[J]. 计算机辅助设计与图形学学报202032(5): 787-796.

[10]

CHEN YAI Y PGUO H G .Inpainting algorithm for Dunhuang mural based on improved curvature-driven diffusion model[J].Journal of Computer-Aided Design & Computer Graphics202032(5): 787-796.(in Chinese)

[11]

罗海银,郑钰辉 .图像修复方法研究综述[J].计算机科学与探索202216(10):2193-2218.

[12]

LUO H YZHENG Y H. Survey of research on image inpainting methods[J]. Journal of Frontiers of Computer Science and Technology202216(10): 2193-2218.(in Chinese)

[13]

JAIDILERT SFAROOQUE G. Crack detection and images inpainting method for Thai mural painting images[C]//2018 IEEE 3rd International Conference on Image,Vision and Computing (ICIVC), June 27-29,2018,Chongqing,China. IEEE,2018:143-148.

[14]

PATHAK DKRÄHENBÜHL PDONAHUE Jet al .Context encoders:feature learning by inpainting[C]//2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), June 27-30,2016,Las Vegas, NV, USA. IEEE,2016:2536-2544.

[15]

YOU Y LXU W YTANNENBAUM Aet al. Behavioral analysis of anisotropic diffusion in image processing[J]. IEEE Transactions on Image Processing19965(11): 1539-1553.

[16]

刘仲民, 严梁. 融合动态特征与注意力的敦煌壁画修复模 型[J]. 计算机工程202450(5): 342-353.

[17]

LIU Z MYAN L. Inpainting model of Dunhuang mural fusing dynamic feature and attention[J]. Computer Engineering202450(5): 342-353.(in Chinese)

[18]

YAN Z YLI X MLI Met al .Shift-net:image inpainting via deep feature rearrangement[M]//Computer Vision-ECCV 2018.Cham:Springer International Publishing,2018:3-19.

[19]

LI J YWANG NZHANG L Fet al .Recurrent feature reasoning for image inpainting[C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), June 13-19,2020,Seattle,WA,USA. IEEE, 2020: 7757-7765.

[20]

CHEN B WLIU T JLIU K H .Lightweight image inpainting by stripe window transformer with joint attention to CNN[C]//2023 IEEE 33rd International Workshop on Machine Learning for Signal Processing (MLSP), September 17-20,2023,Rome,Italy. IEEE,2023:1-6.

[21]

DENG YHUI S QZHOU S Pet al .T-former:an efficient transformer for image inpainting[C]//Proceedings of the 30th ACM International Conference on Multimedia. October 10-14,2022, Lisboa, Portugal. ACM,2022:6559-6568.

[22]

LIU H YJIANG BXIAO Yet al .Coherent semantic attention for image inpainting[C]//2019 IEEE/CVF International Conference on Computer Vision (ICCV), October 27-November 2,2019.Seoul,Korea.IEEE,2019:4169-4178.

[23]

王欢,李利,李庆, .一种结合全局一致性与局部连续性的壁画修复方法[J].湖南大学学报(自然科学版)202249(6):135-145.

[24]

WANG HLI LLI Qet al. A global uniform and local continuity repair method for murals inpainting[J]. Journal of Hunan University (Natural Sciences)202249(6):135-145.(in Chinese)

[25]

CHEN YDU W JZHANG S L. A text guided cross modal joint inpainting algorithm for ancient murals[J]. Expert Systems with Applications2024258:125152.

[26]

LI Y HYAO TPAN Y Wet al. Contextual transformer networks for visual recognition[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence202345(2): 1489-1500.

[27]

WANG Y FGUO D SZHAO H Ret al .Image inpainting via multi-scale adaptive priors[J].Pattern Recognition2025162:111410.

[28]

LU L PXIONG QXU B Ret al .MixDehazeNet:mix structure block for image dehazing network[C]//2024 International Joint Conference on Neural Networks (IJCNN).June 30-July 5,2024,Yokohama,Japan.IEEE,2024:1-10.

[29]

ZHANG XLIU CYANG Det al. RFAConv: Innovating spatial attention and standard convolutional operation[J]. 2023.DOI:10.48550/arXiv.2304.03198 .

[30]

CHEN Y TXIA R LYANG Ket al .Dual degradation image inpainting method via adaptive feature fusion and U-Net network[J].Applied Soft Computing2025174:113010.

[31]

SUN LDONG J XTANG J Het al .Spatially-adaptive feature modulation for efficient image super-resolution[C]//2023 IEEE/CVF International Conference on Computer Vision (ICCV),October 1-6,2023,Paris,France. IEEE,2024:13144-13153.

[32]

SEIF GANDROUTSOS D .Edge-based loss function for single image super-resolution[C]//2018 IEEE International Conference on Acoustics,Speech and Signal Processing (ICASSP),April 15-20,2018,Calgary,AB,Canada. IEEE,2018:1468-1472.

基金资助

国家自然科学基金资助项目(62361035)

National Natural ScienceFoundation of China(62361035)

甘肃省教育厅高校教师创新基金项目(2023A-034)

The Innovation Fund Project for University Teachers of Gansu Provincial Department of Education(2023A-034)

AI Summary AI Mindmap
PDF (5278KB)

164

访问

0

被引

详细

导航
相关文章

AI思维导图

/