雪域慧眼:西藏壁画破损的轻量级智能检测模型

杨君楠 ,  姜军 ,  许帅 ,  彭秋云 ,  许磊

高原科学研究 ›› 2026, Vol. 10 ›› Issue (1) : 117 -128.

PDF (1728KB)
高原科学研究 ›› 2026, Vol. 10 ›› Issue (1) : 117 -128. DOI: 10.16249/j.cnki.2096-4617.2026.01.011
高原交通与信息处理

雪域慧眼:西藏壁画破损的轻量级智能检测模型

作者信息 +

Snowland Insight: A Study on the Lightweight Intelligent Detection Model for Damage on Wall Murals in Xizang

Author information +
文章历史 +
PDF (1768K)

摘要

文章提出一种融合轻量化(Ghost Transformer)结构与动态可变形卷积机制结合的西藏壁画破损检测模型,旨在解决传统方法在壁画裂缝、脱落等破损目标检测中精度低、实时性差的问题,提升壁画破损检测的智能化与高效化水平,为文物数字化保护提供技术支撑。该模型以Ghost Transformer 作为主干网络,搭配BiFPN特征融合结构,并集成Coordinate Attention(CA)与 Sim AM 无参注意力机制,同时引入TOOD动态标签分配策略,通过多技术融合增强模型对小目标与复杂背景的适应能力,实现对西藏壁画破损目标的精准识别与检测。实验结果表明,在检测精度维持稳定的情况下,网络深度缩短31.37%,参数规模下降33.98%,浮点计算量削减50.32%;模型体积压缩至原始体积的35.57%,整体压缩率达64.43%。改进后的GT-D-CA-S-B-T YOLOv8兼顾精度检测与轻量化水平,能有效助力西藏壁画数字化保护,显著提升传统保护修复工作中破损检测的效率和准确性。

Abstract

Aiming to resolve the problems of low accuracy and poor real-time performance in traditional methods for detecting damage, such as cracks and peeling, in ancient murals, this paper presents a model specifically designed for detecting damage on wall murals in Xizang. The proposed model integrates a lightweight Ghost Transformer architecture with a dynamic deformable convolution mechanism. To improve the intelligence and efficiency of mural damage detection and provide technical support for the digital preservation of cultural heritage, the model employs the Ghost Transformer as its backbone network and incorporates a BiFPN feature fusion architecture. Additionally, it incorporates both the Coordinate Attention (CA) and Sim AM parameter-free attention mechanisms, along with the TOOD dynamic label assignment strategy. Through the integration of these multiple technologies, the model enhances its adaptability to small targets and complex backgrounds, enabling more precise identification and detection of damage on wall murals in Xizang. Experimental results show that the improved model offers significant lightweight advantages. While maintaining stable detection accuracy, it reduces network depth by 31.37%, decreases parameter size by 33.98%, and cuts floating-point computations by 50.32%. The model size is reduced to 35.57% of its original volume, resulting in an overall compression rate of 64.43%. The improved GT-D-CA-S-B-T YOLOv8 effectively balances detection accuracy with lightweight performance, providing robust technical support for the digital preservation of Xizang’s wall murals and significantly improving the efficiency and accuracy of damage detection in traditional conservation and restoration work.

Graphical abstract

关键词

壁画破损检测 / 动态可变形卷积 / 注意力机制 / YOLOv8 / 轻量化

Key words

mural damage detection / dynamic deformable convolution / attention mechanism / YOLOv8 / lightweighting

引用本文

引用格式 ▾
杨君楠,姜军,许帅,彭秋云,许磊. 雪域慧眼:西藏壁画破损的轻量级智能检测模型[J]. 高原科学研究, 2026, 10(1): 117-128 DOI:10.16249/j.cnki.2096-4617.2026.01.011

登录浏览全文

4963

注册一个新账户 忘记密码

引 言

壁画是集艺术、历史与科学研究价值于一体的重要文化遗产,承载着区域历史文化、宗教信仰与民族记忆[1]。壁画广泛分布于我国西部及边疆地区的寺庙、洞窟等文物遗址中。西藏壁画作为藏族优秀传统文化传承的重要载体,不仅凝聚着古代工匠的艺术匠心与工艺智慧,更以图像史的形式记录了区域历史的发展脉络。然而,受自然风化、地震扰动、微生物侵蚀以及人为破坏等多种因素影响,壁画本体普遍出现裂缝、起鼓、剥落等破损现象。传统文物的检测与修复工作长期依赖人工经验判断,不仅效率低下,更受限于人力与时间成本的双重限制,难以支撑大规模文物普查与系统性保护工程的推进。鉴于此,构建一套高效、精准且智能化的壁画破损检测技术体系已成为亟待解决的问题,对于推动我国文化遗产保护工作向数字化、智能化方向发展具有重要意义。在此背景下,基于深度学习的图像检测技术为壁画破损的自动识别提供了可行路径。近年来以YOLO(You Only Look Once)系列为代表的单阶段检测网络在目标检测领域的效率与精度上取得显著进展,为构建实时、高性能壁画破损检测模型提供了技术基础。然而,传统YOLO结构在检测小目标(如壁画的细裂缝、局部脱落)及高纹理背景(如复杂壁画图案)目标时存在漏检和误检的问题。此外,标准卷积结构对不规则边缘和细微破损的表征能力有限。因此,如何将轻量化网络结构与多尺度、变形感知能力相结合,以提升模型对壁画破损目标的检测性能,已成为当前研究中亟待解决的关键问题。当前,国际文化遗产领域的数字化工作主要聚焦于几何结构与纹理信息的记录。如,欧洲的CHRESP项目与意大利的DigiArt项目,均侧重于文物的三维建模与重建[2],而对于壁画本体的破损检测方面仍以人工分析为主。近年来,卷积神经网络(CNN)等深度神经网络广泛用于工业检测与医学图像分割任务,并逐步扩展至文化遗产领域。例如,FasterR-CNN被用于裂缝定位[3],YOLOv5被尝试应用于西藏壁画脱落检测[4],但其对细节特征的建模仍然存在一定的局限性。

针对上述通用模型在壁画破损检测中特征表征能力不足的问题,国内学者陆续开展了针对性改进研究。如,陈安等[5]提出嵌套U型结构网络U2-DUANet,引入PCCA注意力机制提升像素级语义感知能力,其在古代壁画破损检测中F1值显著提升;吴利刚等[4]设计Ghost-SE-CA-BiFPN-YOLOv5框架,引入Ghost卷积与CA模块,实现了云冈西藏壁画数据的轻量化检测;李向宇[6]在敦煌壁画识别中通过U-Net实现破损区域的语义分割;杨筱平等[7]利用D-S证据理论进行数据融合,进一步改进壁画复杂破损区域的修复优先权计算。上述研究从注意力机制、轻量化结构、语义分割及数据融合等角度对壁画破损检测进行了有益探索,但仍存在小目标漏检、复杂背景干扰大以及卷积特征表达受限等问题。鉴于此,本文结合Ghost Transformer主干网络、BiFPN(Bidirectional Feature Pyramid Network)特征融合结构[8]和可变形卷积DCN(Deformable Convolutional Network)[9],并集成Coordinate Attention(CA)[10]与SimAM无参注意力机制[11],同时引入TOOD(Task-Aligned One-Stage Object Detection)动态标签分配策略[12],不仅实现了高效的多尺度特征表征,还借助双重注意力机制与标签自适应分配,有效提升了对壁画细微裂缝和局部脱落等复杂破损形态的检测性能。

1 数据集构建与增强处理

通过采集、标注与增强流程,本文构建了一个西藏壁画破损图像数据集。首先,开展了西藏地区典型寺庙壁画的图像采集与预处理工作。数据采集地点涵盖布达拉宫、大昭寺和白居寺等具有代表性的文物建筑,共获得高分辨率壁画原始图像303张。随后,使用 labelImg 工具对壁画中的裂缝、剥落等破损区域进行人工精细化标注,具体如图1所示,并设置标签类别为damaged和cracking。其中,训练集213张、验证集50张、测试集40张。

在完成初始标注后,基于训练集进一步实施了12种数据增强策略,包括裂纹模拟、光照扰动、局部扭曲、模糊、旋转、尺度缩放等操作。增强后的训练集规模扩展至3 200张图像,有效提高了模型在多场景、多退化形态下的鲁棒性和泛化能力。此外,为保证模型训练的稳定性,将所有图像统一调整至640 × 640尺寸,以减少输入尺寸差异对模型收敛的影响,也为后续对比实验提供统一的标准化数据基础。

2 模型设计方法

GT-D-CA-S-B-T YOLOv8模型的特征提取网络以轻量化卷积Conv和Ghost Conv[13]为基础,通过堆叠C3Ghost和Ghost Transformer卷积模块,逐步实现多层次特征。在此过程中,Ghost Transformer卷积模块通过基特征与衍生特征的分解设计,有效降低全局注意力机制计算开销的同时,保持了对长距离依赖关系的建模能力。之后,再引入自建MobileVTBlock模块与SPPF模块,进一步增强了局部与全局特征交互,形成了高质量的多尺度特征表示。具体来说,MobileVTBlock 采用轻量化的 MobileViT 思想,其结构由“局部卷积编码、轻量化全局建模、卷积重投影”三个子模块组成。首先,通过卷积核大小为 3×3,输入通道为16的深度可分离卷积提取壁画局部裂纹纹理特征,以较低开销捕获细粒度结构信息;随后,通过1×1卷积将特征映射投影至128维embedding,并划分为patch作为轻量化全局建模单元的输入,用于建模跨区域的长程依赖关系,以增强破损区域的结构一致性表达;最后,通过卷积重投影将Transformer输出还原至空间域,并与局部卷积编码结果进行融合,从而构建兼具“局部敏感性”与“全局依赖建模能力”的混合特征表示。

在融合特征网络部分,模型采用加权双向特征金字塔(BiFPN)替代传统特征拼接方式,实现多层特征的双向交互及自适应加权融合。同时,引入可变形卷积(DCN)以适应壁画裂缝等不规则形态,并增强模型对复杂几何结构的感知能力。

在特征提取阶段,模型将坐标注意力(CA)机制与无参数注意力(Sim AM)机制进行串联融合,构建了双注意力协同增强框架。其中,CA通过方向感知分解与位置编码策略,将二维空间注意力解耦为水平与垂直方向的特征交互,能够精准建模壁画表面裂缝、剥落等破损区域的空间位置关联性,有效抑制背景冗余信息干扰;而Sim AM 则基于能量函数优化理论,通过局部能量响应值,在不引入额外参数的前提下,增强模型对低对比度、小目标破损区域的特征响应灵敏度,从而有效缓解传统注意力机制在轻量化场景下对细微破损特征捕捉不足的问题。

在模型预测输出阶段,GT-D-CA-S-B-T YOLOv8进一步优化检测头结构,采用Rep Conv(Reparameterized Convolution)与TOOD动态检测头的协同架构。一方面,Rep Conv通过训练阶段的多分支卷积与推理阶段的参数重参数化操作,在保持轻量化模型推理效率(FLOPs与推理速度)不下降的前提下,提升检测头的特征表达能力;另一方面,TOOD动态标签分配策略突破传统基于交并比(IoU)的静态匹配逻辑,综合考虑分类任务的置信度与回归任务的位置偏差,实现正样本的动态筛选与分配,有效解决传统IoU匹配方法在小目标破损检测中存在的正样本分配不足、匹配精度低等问题,进而提升模型对小尺度、密集分布破损区域的召回率与检测精度。

综合来看,GT-D-CA-S-B-T YOLOv8模型(如图2)通过多维度技术优化,构建轻量化检测体系:在特征提取层,通过轻量化卷积与双注意力协同机制的结合,实现了破损特征提取有效性与模型轻量化的平衡;在特征融合层,借助BiFPN的跨尺度特征交互能力与DCN的自适应感受野调整功能,优化了模型对不同尺度破损目标的特征融合效果;在检测决策层,通过TOOD动态标签分配策略进一步改善小目标破损的检测性能。

从应用场景适配性来看,该模型在数字化文物保护任务中展现出显著优势:一方面,轻量化设计使其能够满足巡检中的实时破损检测需求;另一方面,模型在保证高效推理性能的前提下,通过多模块协同优化,显著提升了破损检测的精度与鲁棒性,能够有效适应壁画表面复杂纹理、光照变化等实际场景,为文物的破损自动识别、评估提供了可靠的技术支撑。

2.1 Ghost Transformer主干网络设计

针对传统多头自注意力机制(Multi-Head Self-Attention,MHSA)[14]在壁画图像处理中计算成本高的问题,本文提出了一种轻量化的Ghost Transformer模块作为主干网络的核心(图3)。

Ghost Transformer模块受到Ghost Net[15]启发,将输入特征XH×W×C分解为共享基特征XbaseH×W×m与衍生特征XghostH×W×(C-m),并通过共享权重生成衍生特征注意力响应,从而降低计算复杂度与参数量。为保持轻量化设计,本文设定mC。其注意力计算公式如下:

GhostAttn(X)=Softmax(XbaseWqs)(XbaseWks)d(XghostWvs)

式中,Wqs,Wks,Wvs分别为查询(Q)、键(K)、值(V)的共享线性变换矩阵,d为每个注意力头的特征维度。

传统MHSA[16]的参数量主要来自Q/K/V投影和注意力输出,总参数量为:

ParamsMHSA=4C2

对应计算量为:

FLOPsMHSA4HWC2+H2W2C

而Ghost Transformer模块的参数量与计算量分别为:

ParamsGhost=3Cm+m(C-m)=m(4C-m)
FLOPsGhost3HWCm+H2W2m+HWm(C-m)

得益于基特征与衍生特征的分解设计,Ghost Transformer在减少计算资源占用的同时,仍能维持全局注意力机制的建模能力,从而实现高效且精细的壁画特征提取。

2.2 Neck结构自适应特征提取与增强

为增强模型对壁画破损区域的表达能力,Neck结构引入了可变形卷积与多种注意力机制,实现对感受野的自适应调整与区域特征增强。

2.2.1 可变形卷积(Deformable Conv)

标准卷积受限于固定采样网格,难以适应壁画裂缝等不规则形变。为此,引入可变形卷积模块[17],通过轻量级子网络预测采样偏移量Δpk,卷积操作定义为:

y(p)=k=1Kwkx(p+pk+Δpk)

式中,wk为卷积核第 k 个权重,p2表示输出特征图上的整数网格坐标,pk2为卷积核的固定采样偏移位置,Δpk2是由偏移预测分支生成的连续位移向量。由于采样位置( p+pk+Δpk)一般不落在整数网格上,因此输入特征值 x() 采用双线性插值获得。相比标准卷积固定的规则采样点设置,可变形卷积能够根据局部纹理自适应调整采样位置,从而更有效地捕获裂缝、剥落等非规则破损特征。

为提升模型对空间位置信息的建模能力,本文采用坐标注意力机制。该机制沿水平与垂直方向进行全局池化,得到方向感知向量zhzv,经拼接、卷积与σ 激活生成空间权重图A,计算公式如下

A=σf[zh,zv]

式中,σ为函数,f()为卷积操作。通过加权原始特征,模型可更关注裂缝区域。

2.2.2 SimAM无参数注意力模块

基于能量函数理论的Sim AM模块[18]被引入本文,旨在进一步强化模型对壁画破损区域的感知响应,同时避免额外参数的引入。该机制为每个神经元t计算其重要性权重wt,计算公式如下:

et=(xt-μt)24(σt2+λ)+12
 wt=1et

式中,μtσt2分别为局部均值与方差,λ为调节因子。Sim AM无需训练参数即可有效提升模型对关键区域的关注能力。

2.3 多尺度特征融合与优化策略

2.3.1 BiFPN加权融合网络

传统的特征金字塔网络(FPN)[19]借助构建自上而下的特征传导路径实现多尺度特征融合,进而有效增强了目标检测模型对不同尺度目标的处理能力。然而,FPN在各层级特征融合时仅采用简单且无差别的加和操作,忽略了不同尺度特征对融合结果贡献度的不平衡性,容易导致包含细节信息的高分辨率特征在融合过程中被稀释,进而影响小目标对应特征表征能力不足问题,这一问题在壁画破损检测中表现尤为突出。壁画中细微裂纹、小片脱落等小尺度破损,其特征依赖浅层高分辨率信息,FPN的缺陷会直接导致模型“忽略”这类细微破损,同时无法实现深层语义(明确“破损”类型)与浅层细节(精准定位“破损”位置)的高效互补,最终影响文物保护中破损评估的完整性与准确性,这正是 BiFPN(结构如图4所示)需重点解决的核心问题,即通过技术改进显著提升模型对多尺度破损目标,尤其是细微破损的检测能力,并保持较高计算效率。

为解决上述问题,本文在FPN结构基础上引入了加权双向特征金字塔网络(Bi-directional Feature Pyramid Network,BiFPN)[20]。该结构是对传统FPN的扩展与深化,核心改进体现在以下两个方面:一是双向跨尺度连接。在FPN仅包含的自顶向下路径基础上,增加了自底而上的融合路径,形成双向信息流。该结构不仅能使深层语义特征向下传递,也支持浅层细节特征向上反馈,显著增强了两者的交互与互补,能够完美匹配壁画破损检测中“语义+定位”的双重需求。二是自适应加权融合。该方法摒弃了FPN的等权相加策略,为每个输入特征引入可学习的权重参数,使网络能动态调整不同分辨率特征在融合中的贡献比重,不仅在检测细微裂纹时自动提升高分辨率特征权重,且在检测大面积脱落时合理侧重深层语义特征。通过这种“按需分配”的优化,有效避免了小尺度破损特征被稀释,进一步强化了模型对多尺度破损的检测能力。

图4中,Piin是不同等级的输入特征,Pitd是不同等级的过渡特征,Piout是不同等级的输出特征,ωiωi'是不同路径上的特征权重,其融合过程可形式化定义为:

Piout=Conv(ω1Piin+ω2Resize(Pi-1out)ω1+ω2+ω3+ϵ+ω3Resize(Pi+1in)ω1+ω2+ω3+ϵ)

式中,其中,PinPout分别表示输入与输出特征图,ω1,ω2,ω30为可学习的权重参数,ϵ 为极小非零常数,用于保证数值稳定性。通过对各权重进行归一化处理,可获得各尺度特征在最终融合结果中的有效贡献占比,计算公式如下:

ωi*=ωij=1Nωj+ϵ

相较于传统FPN[21]所采用的固定权重(即实质上的ωi*=1N),BiFPN通过可学习的自适应权重机制,显著提升了对细节特征的响应与保留能力。该方法使模型能够根据输入内容的语义重要性,动态调整多尺度特征的融合比例,尤其提升了高频细节和微小目标的特征表达。在模型复杂度方面,BiFPN在维持与FPN相同量级计算复杂度𝒪(C×H×W)的前提下,仅引入极少量的额外参数(每融合结点约N个权重),就能实现特征融合效能的显著提升。

BiFPN是在FPN基础上通过增强连接性与引入可学习权重而发展起来的高效融合模块[22]。该结构通过双向路径和自适应加权机制,在基本不增加计算成本的前提下,有效解决了传统FPN融合策略僵硬的问题。它不仅支持自上而下和自下而上的双向信息流动,还通过跨尺度连接实现更充分的信息集成,显著增强了壁画图像中小尺度破损区域的感知能力与表征能力,为后续精准检测提供了更为鲁棒的特征基础。该结构使模型在保持高推理效率的同时,有效提升了模型对多尺度目标,尤其是微小缺陷上的检测性能。

2.3.2 TOOD动态标签分配策略

在壁画破损检测任务中,传统的正负样本分配策略在小目标检测中往往存在正样本不足的问题,进而影响模型对细粒度破损区域的召回率[23]。为此,本文采用TOOD(Task-aligned One-stage Object Detection)标签分配策略,在训练阶段增强模型对小破损目标的识别能力。该方法提出了任务对齐度(Task-aligned Score)作为样本筛选依据,将分类置信度u与边界框回归的IoU指标结合,定义为:

s=uα×IoUβ

其中,α β为平衡超参数,用于控制分类与定位在对齐度计算中的权重。训练过程中,TOOD根据任务对齐度 s 对候选样本进行排序,并在每个预测点中选择Top-k个样本作为正样本,计算公式如下:

P+=Top-k(s)

上述基于对齐度的分配方式避免了仅依赖几何匹配(IoU)的局限,将分类置信度与定位准确性统一在一个度量标准中,使得训练过程中更容易选择出兼顾分类可靠性和定位精度的候选框,从而提升小目标的学习效果。该策略充分考虑了目标检测中分类与定位任务之间的一致性,能够根据当前网络的学习状态自适应地调整正样本的选择标准。与传统的标签分配方式相比,TOOD策略能够动态平衡分类与定位目标,在不增加额外计算开销的前提下,显著提升了训练样本的质量与代表性。该模块尤其适用于小目标和复杂背景场景,能够有效提升模型对小尺度破损区域的召回率和整体检测性能[24]

3 实验设计与结果分析

实验基于UltralyticsYOLOv8框架,部署环境为Jetson Xavier。采用Python3.8.5与CUDA11.3,硬件配置包括IntelCorei9-10900K@3.7GHz、NVIDIAGeForceRTX3080(10GB显存)以及DDR43600MHz双通道内存。模型输入图像尺寸为640×640,批大小设为12,最大训练轮次为1 000,早停策略的耐心值设为150。优化器选用AdamW,初始学习率为3×10-4,最小学习率0.01,权重衰减为0.0005,并采用了固定学习率衰减策略。

为增强模型的泛化能力,本研究引入Albumentations库进行多种数据增强,包括随机旋转、平移缩放、颜色扰动、模糊、噪声、阴影模拟、随机裁剪、Cutout以及小目标随机缩放抖动,同时设计自定义裂纹增强算子以模拟西藏壁画裂纹。所有增强操作在保证标签有效性的前提下执行,并通过边界框可见性及面积阈值过滤不合理样本。

3.1 训练结果

西藏壁画破损检测模型的训练过程中,YOLOv8与本文提出的GT-D-CA-S-B-T YOLOv8算法的精度与损失曲线分别如图5A、5B所示。

从模型精度曲线可知,两种算法在整体上均呈现随训练轮次增加而提升的趋势,但在训练前期,YOLOv8精度增长较为缓慢且波动明显,而GT-D-CA-S-B-T YOLOv8精度提升更快且曲线平滑,显示出更稳定的学习过程。损失曲线进一步表明,YOLOv8在训练初期存在较大波动和多次突变,反映出模型在早期优化阶段的不稳定性。相比之下,GT-D-CA-S-B-T YOLOv8损失下降更为平滑,最终收敛值更低且稳定,表明其在特征提取与信息融合方面具有更强的鲁棒性。

整体来看,引入Deformable卷积、CA与SE注意力机制、BiFPN特征融合及TOOD动态标签分配策略,有效提升了模型的识别精度和定位能力,同时增强了训练过程的稳定性与可靠性。

3.2 消融实验

为评估各模块对壁画破损检测性能的贡献,本文基于YOLOv8进行了系统的消融实验,实验结果如表1所示。

结果显示,原始YOLOv8精度为50.4%,FPS为85,且浮点运算与模型体积均较大。引入Ghost Transformer结构(GT YOLOv8)后,模型计算量与参数量显著下降,体积由101.2 MB减少至34.5 MB,FPS提升至106,同时精度提高至61.2%,证明轻量化结构在高效性上的优势。

在此基础上引入CA注意力(GT-D-CA YOLOv8),精度进一步提升至69.1%,mAP@0.5:0.95提升至32.9,FPS增至115,说明CA能够有效增强特征关联。引入SimAM(GT-D-S YOLOv8)后,性能保持稳定(68.8%),FPS达到129,表明SimAM以极低成本带来稳健增益。

最终集成CA、SimAM、BiFPN与TOOD 的 GT-D-CA-S-B-T YOLOv8 综合性能最优:精度提升至78.6%,mAP@0.5:0.95 达39.4,FPS为128,模型体积仅36 MB。相比原始YOLOv8,该模型在精度、速度与轻量化之间取得最佳平衡,验证了多模块协同设计的有效性。

3.3 不同算法的对比分析

为全面评估本文所提模型的性能,将其与多种主流目标检测方法进行了对比,包括不同代次的 YOLO 系列(YOLOv5s、YOLOv8、YOLOv10、YOLOv12)以及模型 Ghost-SE-CA-BiFPN-YOLOv5 [5]和轻量化检测模型 RT-DETR-R18[25]。所有模型均在相同数据集和实验环境下进行训练与测试以保证公平性。

表2所示,本文提出的 GT-D-CA-S-B-T YOLOv8 在精度和轻量化方面取得显著优势。其检测精度达到78.6%,明显优于YOLOv5s、YOLOv8、YOLOv10、YOLOv12 等通用模型(48.9%~50.4%),也远远超过Ghost-SE-CA-BiFPN-YOLOv5(63.2%)和轻量化检测RT-DETR-R18(44.6%)。

以上结果表明,传统轻量化或通用模型在应对壁画复杂纹理与细微破损时存在局限,而本文的结构更能充分提取关键细节。在轻量化方面,本文模型体积仅36 MB,与Ghost-SE-CA-BiFPN-YOLOv5(36.4 MB)和RT-DETR-R18(101.1 MB)相比更具优势,且浮点运算量仅39.4 GFLOPs,远低于大部分YOLO系列模型(78.6~110.2 GFLOPs)。尽管采用了多模块融合设计,整体参数规模仍保持在轻量化范围内,充分体现了Ghost Transformer主干、双注意力机制及BiFPN融合在结构高效性上的价值。在速度上,本文模型达到 128 FPS,为所有对比方法中最高,不仅快于 YOLOv5/8 系列(85~97 FPS),也超越了主打轻量化结构的 RT-DETR-R18(108 FPS)。可见该模型在高精度与高速度之间实现了优异平衡。综上,GT-D-CA-S-B-T YOLOv8 在精度、模型规模与推理速度等方面均表现突出,是面向壁画破损检测的高效、轻量化方案。

3.4 实验结果与分析

通过实验结果对比分析了不同YOLOv8变体在西藏壁画破损检测任务中的表现,重点评估了模型在典型破损类型及复杂纹理背景下的检出率、误检情况及标签准确性,实验可视化结果如图6所示。图中前4行任务包括“小面积破损”“固定位置破损”“细微裂缝”等典型破损场景。原始YOLOv8在这些任务中存在明显漏检和误检,如遗漏小面积破损或细裂缝,并出现低置信度的错误检测框,显示其对破损与正常纹理的区分能力不足。GT YOLOv8在一定程度上缓解了漏检问题,但仍存在标签误检、边界不准确及冗余检测框等问题。GT-D-CA YOLOv8模型与GT-D-S YOLOv8模型进一步提升了检出率,能够稳定覆盖大区域破损,但在小目标和边界识别上性能仍然有限,检测框贴合度和标签分类精度仍有进一步提升空间。相比之下,GT-D-CA-S-B-T YOLOv8在前4行任务场景中表现最优,基本消除了漏检现象,检测框覆盖精准,标签分类与真实破损高度一致,并且识别结果具有较高的置信度。后两行图案场景贴近真实壁画复杂背景,包含多破损类型及相似纹理干扰,对模型识别能力提出更高要求。原始YOLOv8易将复杂背景误识别为破损,GT-D-CA YOLOv8与GT-D-S YOLOv8虽提升检出率,但标签精度仍不够。最终的GT-D-CA-S-B-T YOLOv8能够精准识别所有破损区域,检测框与边界高度吻合且几乎未出现误检现象,但在极复杂纹理条件下破损类型区分仍有进一步优化空间。

综上所述,前4行任务场景验证了模型在常见破损检测任务中的性能提升,而后两行图案场景则验证了模型在复杂背景下的适应能力。从YOLOv8到 GT-D-CA-S-B-T YOLOv8的逐步改进过程中,模型在漏检控制、误检抑制、标签精准度及复杂场景适应性等方面均实现持续提升,实现了从“能检出”到“精准检出”的跨越,为壁画破损检测提供了可靠的技术参考。

结 语

针对西藏壁画破损检测中存在的小目标尺度变化大、背景纹理复杂以及检测模型计算消耗较高等问题,本文提出一种轻量级智能检测模型“雪域慧眼”。该模型在YOLOv8框架基础上进行改进,引入Ghost Transformer作为主干网络以提升特征表达能力,并结合动态可变形卷积增强模型对不规则裂缝与脱落等破损形态的适应性。构建BiFPN多尺度特征融合结构,并融合Coordinate Attention与SimAM注意力机制,以强化关键区域特征表达并抑制复杂背景干扰。此外,通过TOOD动态标签分配策略,进一步优化了检测过程。综合来看,所提出的模型在保持检测精度稳定的同时,有效降低了参数规模、计算量和模型体积,在检测性能与模型轻量化之间取得了良好平衡。

本研究提出的GT-D-CA-S-B-T YOLOv8模型在西藏壁画破损检测任务中表现优异,但仍需从以下方面进行进一步优化和改进:

(1)优化模型结构,探索更高效的轻量化网络与卷积创新方法,减少模型计算复杂度与存储空间,满足壁画现场实时勘察与破损检测的实际需求。

(2)扩展数据集的规模与多样性,采集不同保存环境、年代及破损类型的壁画样本,并引入不同地域风格的壁画数据,以提升模型的泛化能力与适应性。

(3)引入时间序列特征建模,分析长期自然风化与环境变化对壁画破损形态的影响,提升模型在跨时期数据下的识别稳定性与预测能力。

综上所述,本文提出的GT-D-CA-S-B-T YOLOv8模型在壁画破损检测任务中实现了检测精度、鲁棒性与效率的协同提升,为西藏文化遗产的数字化保护与智能修复提供了高效的技术路径。

参考文献

[1]

马芳.中国古建筑传统壁画保护现状研究[J].建筑科学,2024,40(9):197.

[2]

Hou Y, Kenderdine S, Picca D, et al. Digitizing intangible cultural heritage embodied: State of the art[J]. Journal on Computing and Cultural Heritage (JOCCH), 2022, 15(3): 1-20.

[3]

Shaoqing R, Kaiming H, Ross G, et al.Faster R-CNN: Towards real-time object detection with region proposal networks[J].IEEE transactions on pattern analysis and machine intelligence,2017,39(6):1137-1149.

[4]

吴利刚,张梁.基于轻量化神经网络的石窟壁画破损检测方法[J].信息与控制,2024,53(1):108-119.

[5]

陈安,余映,赵辉荣,.基于嵌套U型结构网络的古代壁画破损区域检测[J].计算机工程与应用,2025,61(2):283-292.

[6]

李向宇.基于深度学习的敦煌壁画年代识别及破损检测[D]. 哈尔滨:哈尔滨工业大学,2019.

[7]

杨筱平,王书文.基于马尔可夫采样的敦煌壁画修复[J].计算机应用,2010,30(7):1835-1837+1840.

[8]

Tan M, Pang R, Le Q V. EfficientDet: Scalable and efficient object detection[C].Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition,2020:10778-10787.

[9]

Dai J, Qi H, Xiong Y, et al. Deformable convolutional networks[C]. Proceedings of the IEEE International Conference on Computer Vision, 2017:764-773.

[10]

Hou Q, Zhou D, Feng J. Coordinate attention for efficient mobile network design[C]. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2021:13713-13722.

[11]

Liu Q, Huang W, Duan X, et al. DSW-YOLOv8n: A new underwater target detection algorithm based on improved YOLOv8n[J]. Electronics, 2023,12(18): 3892.

[12]

Feng C, Zhong Y, Gao Y, et al. Tood: Task-aligned one-stage object detection[C]. 2021 IEEE/CVF International Conference on Computer Vision (ICCV). IEEE Computer Society, 2021:3490-3499.

[13]

Li L, Wang Z, Gbh-yolov T Z. Ghost convolution with bottleneckcsp and tiny target prediction head incorporating yolov5 for pv panel defect detection.[J].Electronics,2023,12(3), 561-576

[14]

Zhang J, Li X, Li J, et al. Rethinking mobile block for efficient attention-based models[C]. 2023 IEEE/CVF International Conference on Computer Vision (ICCV). IEEE Computer Society, 2023: 1389-1400.

[15]

Han K, Wang Y, Tian Q, et al. Ghostnet: More features from cheap operations[C]. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2020: 1580-1589.

[16]

Tan H, Liu X, Yin B, et al. MHSA-Net: Multihead self-attention network for occluded person re-identification[J]. IEEE Transactions on Neural Networks and Learning Systems, 2022, 34(11): 8210-8224.

[17]

Zhu X, Hu H, Lin S, et al. Deformable convnets v2: More deformable, better results[C]. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2019: 9308-9316.

[18]

吴磊,储钰昆,杨洪刚,.面向铝合金焊缝DR图像缺陷的Sim-YOLOv8目标检测算法[J/OL].中国激光,1-15. [2025-08-22].

[19]

向寅鸿,周恺卿, SARKHEYLI-H?GELE Arezoo,.基于可逆和动态分解机制的层次化FPN并行故障诊断(Parallel fault diagnosis using hierarchical fuzzy Petri net byreversible and dynamic -decomposition mechanism)[J].Frontiers of Information Technology & Electronic Engineering,2025,26(1):93-109.

[20]

宋巍,张光德.基于改进EfficientDet网络的疲劳驾驶状态检测方法[J].汽车安全与节能学报,2022,13(4):651-658.

[21]

Baojun Z, Boya Z, Linbo T, et al. Multi-scale object detection by top-down and bottom-up feature pyramid network[J].Journal of Systems Engineering and Electronics,2019,30(1):1-12.

[22]

李军,孟佳兵,李攀.利用优化的YOLOv7模型自动检测地震反演低频模型中的“牛眼”效应(Detecting the Bull's-Eye Effect in Seismic Inversion Low-Frequency Models Using the Optimized YOLOv7 Model)[J].Applied Geophysics,2024,21(4):766-776+880-881.

[23]

高小伟,吴合风,谭启昀,.基于YOLO框架的无锚框输电线多种缺陷检测[J].测控技术,2023,42(3):24-31.

[24]

陈忠杰.基于深度学习的多方向目标检测系统的研究与实现[D].北京:北京邮电大学,2022

[25]

卢承方,崔艳荣,胡蓉华,.基于改进实时检测Transformer的轻量级番茄果实检测算法[J/OL].山东农业科学,1-13.[2025-12-04].

基金资助

国家自然科学基金项目(62261051)

西藏自治区科技计划项目(XZ202501ZY0060)

西藏自治区科技计划项目(XZ202402ZY0002)

西藏自治区教育科学研究项目(XZEDUP240149)

西藏大学研究生高水平人才培养计划项目(2025-GSP-S142)

AI Summary AI Mindmap
PDF (1728KB)

21

访问

0

被引

详细

导航
相关文章

AI思维导图

/