基于改进YOLOv8的钢材表面缺陷检测

李昊璇 ,  孙宇翔

测试技术学报 ›› 2026, Vol. 40 ›› Issue (1) : 1 -9.

PDF (3666KB)
测试技术学报 ›› 2026, Vol. 40 ›› Issue (1) : 1 -9. DOI: 10.62756/csjs.1671-7449.2026002
故障诊断与无损检测

基于改进YOLOv8的钢材表面缺陷检测

作者信息 +

Steel Surface Defect Detection Based on Improved YOLOv8

Author information +
文章历史 +
PDF (3753K)

摘要

为应对钢材表面缺陷检测中存在的缺陷种类多元、 尺寸跨度大、 检测精度较低及模型泛化能力不足等挑战, 提出了一种钢材表面缺陷检测改进算法, 命名为CGP-YOLO。首先, 在Neck部分, 使用内容感知特征重组(Content-Aware Reassembly of Features, CARAFE)替换最近邻插值算子, 解决了上采样特征图出现的块状效应、 细节丢失严重等问题; 其次, 在Head前引入全局注意力机制(Global Attention Mechanism, GAM), 通过调控通道和空间特征的交互增强了模型的表征能力; 最后, 引入可编程梯度信息(Programmable Gradient Information, PGI)模块, 通过其多级辅助信息组件逐步整合不同尺度的特征, 有效提高了模型对不同尺度缺陷敏感性。与初始算法相比, 算法CGP-YOLO性能显著提升, 平均精度均值达到了80.8%, 高于原算法3.6百分点。

Abstract

To address the challenges of multiple defect types, large size span, low detection accuracy and insufficient model generalization ability in steel surface defect detection, an improved steel surface defect detection algorithm named CGP-YOLO is proposed in this paper. Firstly, in the neck part, content-aware reassembly of features (CARAFE) is used to replace the nearest neighbor interpolation operator, which solves the problems of the block-like effect and serious detail loss in the upsampled feature map. Secondly, the global attention mechanism (GAM) is introduced before head, which enhances the representation ability of the model through the interaction of regulatory channels and spatial features. Finally, the programmable gradient information (PGI) module is introduced to gradually integrate features at different scales through its multi-level auxiliary information components, effectively improving the sensitivity of the model to defects at different scales. Compared with the original algorithm, the performance of CGP-YOLO is significantly improved, and the mAP reaches 80.8%, which is 3.6 percentage points higher than the original algorithm.

Graphical abstract

关键词

YOLOv8 / 钢材表面缺陷检测 / 内容感知特征重组 / 全局注意力机制 / 可编程梯度信息

Key words

YOLOv8 / steel surface defect detection / content perception feature recombination (CARAFE) / global attention mechanism (GAM) / programmable gradient information (PGI)

引用本文

引用格式 ▾
李昊璇,孙宇翔. 基于改进YOLOv8的钢材表面缺陷检测[J]. 测试技术学报, 2026, 40(1): 1-9 DOI:10.62756/csjs.1671-7449.2026002

登录浏览全文

4963

注册一个新账户 忘记密码

0 引 言

随着全球工业化的快速推进, 特别是在航空航天、 建筑及汽车等领域, 钢材作为关键的结构材料, 其质量直接影响产品的安全和使用周期1。钢材表面的任何微小缺陷, 如氧化、 锈蚀、 气孔、 划痕、 裂纹及麻点等, 都会对钢材的耐腐蚀性、 强度和稳定性产生显著影响, 既增加了生产成本, 又带来了安全隐患, 同时也对终端产品的质量有着重大影响2。总之, 提高钢材表面缺陷的检测精度具有重大意义3

在传统的钢材缺陷检测领域, 人工抽检法存在抽样不均衡、 易受人为因素干扰及对工作人员健康不利等问题; 对于红外检测法4, 钢材对红外线的吸收能力会干扰检测并影响其精准度; 漏磁检测法5对细窄裂纹这类缺陷容易出现判别偏差。基于机器视觉6的检测方法虽然检测性能有所提升, 但是该方法依赖于人工标注数据且普遍存在对多种缺陷类型分类效果不佳的现象。

深度学习领域的目标检测方法主要分为单阶段和双阶段检测。单阶段检测算法YOLO7将目标检测简化为单一回归问题, 能直接实现图像像素到边界框坐标与类别概率的映射, 因其具有更强的环境适应性与对象普适性, 在实时缺陷检测任务中应用广泛。近年来, 许多研究基于YOLO系列模型进行改进。Ren等8采用可变形卷积替换YOLOv5部分常规卷积, 提升模型对钢材表面缺陷的检测精度至78.8%; Teng等9将YOLOv7检测头替换为高效解耦检测头, 增强了模型对钢材表面缺陷的分类和定位能力, 平均精度均值从74.9%提升到76.5%; Zhu等10提出了一种基于YOLOv7的带钢表面缺陷检测算法, 将C2f组件集成到特征金字塔网络, 加快了YOLOv7训练速度, 但模型体积较大; 刘昱等11提出的YOLOv8-RDP采用Pconv检测头减少计算量, 但对钢材表面缺陷的检测精度提升有限; Jiang等12提出的YOLOv8n-SDEC缺陷检测算法用SPPCSPC替换SPPF模块, 并用EIoU替代CIoU函数, 提升检测精度至76.7%, 但复杂背景下检测仍有不足。

综上所述, 本文以基线模型YOLOv8n为基础, 提出一种全新的钢材表面缺陷检测算法CGP-YOLO, 在提升检测精度的同时, 着重强化对复杂背景下多尺度目标特征的捕捉能力, 提高模型泛化能力, 有效降低漏检和误检率。

1 YOLOv8算法

YOLOv8是一种先进的单阶段目标检测模型, 以其在复杂多变的现实环境中快速且精准地识别各类目标的能力在工业中得到广泛应用。该模型包括Backbone、 Neck和Head 3个主要部分。其网络架构如图 1 所示。

Backbone负责特征提取, 采用深度卷积神经网络架构, 在减少计算量的同时有效捕捉图像的丰富语义信息。Neck部分采用PANet结构, 将骨干网络提取的不同层次的特征进行有效整合, 实现特征信息的互补与强化。Head运用解耦头结构, 使检测与分类任务的处理效率大幅提升。尽管YOLOv8在检测上表现优异, 但对钢材缺陷的检测精度仍有改进空间, 故本文提出改进方案以适应钢材表面缺陷检测的需求。

2 CGP⁃YOLO算法

CGP-YOLO的网络结构如图 2 所示。首先, 利用内容感知特征重组(Content-Aware Reassembly of Features, CARAFE)13替换最近邻插值算子, 其凭借内容感知重组策略实现自适应上采样, 保障了融合后特征图的完整性与信息丰富度。其次, 在Head前引入具有更强特征感知与信息筛选能力的全局注意力机制(Global Attention Mechanism, GAM)14, 使模型能够更好地捕捉到重要的缺陷特征信号。最后, 添加一个可编程梯度信息(Programmable Gradient Information, PGI)15模块, 通过多级辅助信息组件提升模型对不同尺度缺陷特征的敏感度, 从而提升检测精度。

2.1 CARAFE算子

CARAFE算子通过内容感知重组策略实现自适应上采样, 并在上采样过程中保留更多的细节信息, 有效地解决了初始算法中最近邻插值方法导致的块状效应和细节丢失等严重问题。该算子主要由上采样核预测模块和特征重组模块组成。其工作流程如下: 给定一张尺寸为C×H×W的特征图X和上采样倍率σ, 首先, 通过通道压缩器对特征图进行处理, 减少通道数以降低后续步骤的参数量和计算成本; 其次, 内容编码模块根据压缩后的特征图生成重组内核, 核归一化器利用softmax函数对预测所得的上采样核在空间维度进行归一化处理12; 最后, 特征重组模块根据重组内核重新组合特征, 实现特征上采样16。上述CARAFE的计算过程如图 3 所示。

2.2 GAM

GAM通过精细调控通道和空间特征的交互, 有效避免了传统注意力机制中信息弥散导致关键特征弱化或丢失的问题, 显著增强了模型的表征能力17

GAM主要由两个关键部分协同构成, 分别如图 4图 5 所示。通道注意力模块Mc通过三维张量重组, 确保特征图空间结构完整性, 利用多层感知器(Multi-Layer Perceptron, MLP)强化跨维度依赖关系, 增强特征表达能力。空间注意力模块Ms专注于空间特征的精细捕捉, 通过两个连续的卷积层来实现空间信息的深度融合。

GAM的整体计算过程如图 6 所示。F2F3的计算公式如下。

F2=McF1F1,
F3=MsF2F2

GAM通过结合通道注意力模块Mc和空间注意力模块Ms, 有效提升了YOLO网络对钢材表面缺陷关键特征的捕捉能力18

2.3 PGI模块

PGI模块通过辅助可逆分支生成可靠的梯度信息, 指导网络参数的更新方向和步长, 防止模型陷入错误的学习路径, 同时挖掘数据中的关键信息, 从而显著提升模型的准确性。PGI主要由3个部分构成, 分别是承担主体信息处理流程的主分支、 生成可靠梯度信息的辅助可逆分支和多级辅助信息。PGI模块的结构如图 7 所示。

主分支负责的信息处理流程借助辅助可逆分支提供的稳定梯度与多级辅助信息, 强化对钢材表面缺陷特征的提取。辅助可逆分支生成稳定的梯度信息, 增强模型反向传播的能力, 该分支在推理阶段可省略。多级辅助信息通过多尺度特征融合, 可有效分离缺陷与背景噪声, 解决原模型对不同尺度缺陷检测性能波动大的问题。

PGI设计确保了特征金字塔层能够全面接收钢材表面缺陷目标的信息, 避免了主分支学习偏向特定对象, 同时缓解了信息碎片化问题, 并解决了深度学习模型中的信息瓶颈问题。PGI模块使模型能灵活处理多尺度特征, 逐步提升对细微特征的敏感度, 从而实现更加精确的钢材表面缺陷检测。

3 实验设置

3.1 实验环境

实验参数如表 1 所示。其余软件参数为默认值。

3.2 数据集与评价指标

本实验选用东北大学公开的钢材表面缺陷(NEU-DET)数据集19, 共计1 800张图片。该数据集包含6种缺陷类型, 且每类缺陷图片数量相同, 各类样本如图 8 所示。本文随机选用80%的图片用于训练, 10%的图片用于验证, 其余用于测试。

使用计算量(GFLOPs)、 模型的参数量、 平均精度均值(mAP)和帧率(F)等作为性能评估指标。其计算公式为

R=TPTP+FN,
P=TPTP+FP,
AP=01P(R)dR,
F=NnumbersTspendtime,
mAP=1ni=1nAP(i),

式中: P为精确率; R为召回率; TP为真正例; FP为假正例; FN为假负例; n为数据集的类别数; P(R)为在特定召回率R下的精确率。

4 实验结果与分析

4.1 不同上采样方法实验

为了综合验证CARAFE算子的有效性, 本实验对比了初始模型的最近邻插值(Nearest)、 双三次插值(Bicubic)和双线性插值(Bilinear)20算子。实验结果如表 2 所示。

在特征金字塔网络中, CARAFE将低分辨率特征图上采样后与高分辨率特征图进行融合, 从而增强对小目标缺陷的特征表示能力, 克服了原模型对钢材表面的小缺陷(如麻点、 细小裂缝)因特征提取不足导致漏检或误检问题。引入CARAFE算子的模型在NEU-DET数据集上的mAP高达79.2%, 相比Nearest增加了2百分点。由于CARAFE算子运作机制基于特征重组与加权处理流程, 不可避免地导致模型参数量出现一定程度的增长。然而, 综合考量钢材缺陷识别这一特定任务所具备的固有特点, 如对缺陷特征精细度、 准确性的严苛要求等, 引入CARAFE算子的模型在检测速度方面仍处于合理区间内。鉴于此, 本文研究中选用CARAFE算子。

4.2 不同注意力机制实验

本文使用多种注意力机制进行了深入的实验比较, 以评估其在钢材缺陷检测任务中的性能。实验结果如表 3 所示, 其中, 选用GAM的模型的mAP达到了79.7%, 显著优于选用相似性感知注意力(Similarity-Aware Activation Module, SimAM)、 注意力选择性增强(Squeeze and Excitation, SE)和多尺度位置注意力(Multi-scale Position-aware Co-Attention, MPCA)的模型。

实验结果表明, GAM通过强调全局跨维度交互, 增强了模型对图像中关键信息的捕捉能力, 有效提升了模型在缺陷检测任务中的精度均值。且CARAFE的局部特征重组与GAM的全局特征强调相结合, 使得模型在处理图像时能够同时考虑局部细节和全局上下文, 从而提高缺陷检测的准确性。另外, 尽管在模型中添加GAM会带来更多的参数, 但该模块对模型检测速度所产生的影响并不明显。由于选用GAM的模型在保持相对适宜的参数量和检测速度的同时, 显著提升了模型的检测精度, 故选用GAM注意力机制。

4.3 消融实验

为系统评估改进算法的性能, 本文设置4组实验进行对比。实验以基础YOLOv8n模型为参照基准, 通过逐步添加各个改进模块, 探究各模块对整体模型性能的影响。实验结果如表 4 所示。

表 4 分析可知, YOLOv8n加入CARAFE算子后, mAP较基线模型提升了2百分点, 且RP都有提升, 这说明CARAFE有效地解决了使用最近邻插值导致上采样特征图出现的块状效应、 细节丢失严重等问题。随后, 将GAM融入后, 凭借其对通道与空间特征的精细调控, 促使二者间产生了更强的交互作用, 进而显著增强了模型的表征能力。在此基础上, 虽然加入GAM后的模型误将Cr类缺陷的背景纹理识别为重要特征, 干扰了Cr类缺陷的检测, 但CG-YOLO模型对Pa、 In、 Ps和Rs这4类钢材表面缺陷的检测精度均得到有效提升。同时, 相较于C-YOLO模型, mAP提升了0.5百分点。最后, 加入PGI模块后, 由于In类缺陷相近小尺度缺陷目标较多, 导致模型无法有效地利用多尺度信息来准确识别In类缺陷。但CGP-YOLO模型有效地提升了mAP, 达到了80.8%, 相较于YOLOv8n、 C-YOLO和CG-YOLO模型, mAP分别提升了3.6、 1.6和1.1百分点。综合来看, 历次针对算法所做的改进均得到了有效验证。

原算法和CGP-YOLO算法的检测效果如图 9 所示。对比可知, 相比于原算法, CGP-YOLO能更加精准地检测钢材缺陷, 且漏检情况有效减少。

图 10 展示了YOLOv8n算法和CGP-YOLO算法在NET-DET数据集上的精确率-召回率(P-R)曲线。

图 10 可知, 改进后CGP-YOLO模型的mAP提升了3.6百分点, 且每类缺陷AP值都有提升, 其中, 裂纹(Cr)和斑块(Pa)改善效果比较明显, 分别提升8和5百分点。P-R曲线下面积越大, 意味着算法在不同阈值下对精确率和召回率的平衡效果越好, 从而实现更优的分类和识别性能。显然, 图 10 中CGP-YOLO的P-R曲线下面积明显大于YOLOv8n的P-R曲线下面积, 从而证明CGP-YOLO模型更加优越。

4.4 不同目标检测算法对比实验

为充分验证CGP-YOLO算法的综合性能, 本文对比了当前一系列较为典型的目标检测算法, 实验结果如表 5 所示。

分析表 5 可知, 与其他模型相比, CGP-YOLO模型在钢材缺陷检测领域表现优异, 与Faster R-CNN、 SSD、 YOLOv3-Tiny、 YOLOv5s、 YOLOv8s、 YOLO10n、 YOLO11n23和YOLO11s相比, CGP-YOLO模型在mAP上分别提升22.5、 12.7、 29.9、 4.2、 3.6、 7.2、 3.6和2.2百分点。相比于文献[21]和文献[22]的钢材缺陷检测模型, 本文模型在检测精度、 参数量和计算量均取较好效果。虽然本文模型参数量和计算量不是最低的, 但该模型的mAP是最高的, 达到了80.8%, 且参数量和计算量仍处于较低水平。本文模型在检测精度、 参数量和计算量中取得了良好的平衡, 能更有效地执行钢材缺陷检测任务。

4.5 算法通用性实验对比

为了全方位考量CGP-YOLO算法在实际应用中的有效性和鲁棒性, 额外引入了GC10-DET钢材表面缺陷数据集, 此数据集采集自实际工业环境, 包含10种不同类型的金属缺陷, 图像总数达2 292张。通过对比各算法在召回率和准确率等关键性能指标上的表现, 得出结果如表 6 所示。

表 6 可知, CGP-YOLO模型相比于基线模型提升显著, 具体而言, 其准确率提升5.7百分点, 召回率提升1.6百分点, mAP提升3.5百分点。实验表明, 本文CGP-YOLO算法能更好地应对复杂实际情况, 具有较强的泛化能力。

5 结 论

本文提出了一种高检测精度的算法CGP-YOLO用于钢材表面缺陷检测。首先, 该算法利用CARAFE上采样算子自适应地生成上采样核的特点, 提高了上采样后特征图的质量和表达能力, 大幅降低了一些边缘缺陷的漏检和误检率。其次, 添加GAM模块, 通过精细调控通道和空间特征的交互来增强模型的表征能力, 突出了重要信息的表达。最后, 加入PGI模块, 其通过多级辅助信息组件, 进一步增强了模型在处理不同尺度目标时的性能。实验数据表明, 算法CGP-YOLO性能提升明显, 相较于原算法, R增幅达7.4百分点, mAP提升3.6百分点, 且具有更好的泛化能力。未来将进一步研究如何减少模型参数以及重点提升Cr和Sc这两类缺陷的检测精度, 实现检测速与精度双提升。

参考文献

[1]

LIU CCHENG H. Steel surface defect detection based on YOLOv8-TLC[J]. Applied Sciences202414(21): 9708.

[2]

ZAGHDOUDI RBOUGUETTAYA ABOUDIAF A. Steel surface defect recognition using classifier combination[J]. The International Journal of Advanced Manufacturing Technology2024132(7): 3489-3505.

[3]

XU WZHANG YJIANG Xet al. An efficient steel defect detection model based on multi-scale information extraction[J]. Robotic Intelligence and Automation202444(6): 817-829.

[4]

胡爽. 基于红外热像技术的钢管混凝土密实度缺陷检测探究[D]. 重庆: 重庆大学, 2016.

[5]

SINGH W SMUKHOPADHYAY C KRAO B P C. Development of a high sensitive magnetic flux leakage instrument for imaging of localised flaws in small diameter ferromagnetic steel tubes[J]. IET Science, Measurement & Technology, 201812(7): 932-936.

[6]

TANG BCHEN LSUN Wet al. Review of surface defect detection of steel products based on machine vision[J]. IET Image Processing202317(2): 303-322.

[7]

JIANG PERGU DLIU Fet al. A review of yolo algorithm developments[J]. Procedia Computer Science2022199: 1066-1073.

[8]

REN FFEI JLI Het al. Steel surface defect detection using improved deep learning algorithm: ECA-SimSPPF-SIoU-Yolov5[J]. IEEE Access202412: 32545-32553.

[9]

TENG W ZZHANG Y JZHANG H Get al. Surface defect detection of steel based on improved YOLOv7 model[J]. Metalurgija202463(3/4): 399-402.

[10]

ZHU GZHENG G. Improvement of defect detection for steel based on YOLOv7 algorithm[J]. Journal of Physics: Conference Series20242816(1): 012043.

[11]

刘昱, 彭龑. 基于 YOLOv8 的钢材表面缺陷检测算法[J/OL]. 重庆工商大学学报(自然科学版)2025: 1-10.[2024-12-18].

[12]

LIU YuPENG Yan. Steel surface defect detection algorithm based on YOLOv8[J/OL]. Journal of Chongqing Technology and Business University (Natural Science Edition)2025: 1-10.[2024-12-18].in Chinese)

[13]

JIANG XCUI YCUI Yet al. Optimization algorithm of steel surface defect detection based on YOLOv8n-SDEC[J]. IEEE Access202412: 95106-95117.

[14]

WANG JCHEN KXU Ret al. CARAFE: content-aware reassembly of features[C]//2019 IEEE/CVF International Conference on Computer Vision (ICCV), 2019: 3007-3016.

[15]

LIU YSHAO ZHOFFMANN N. Global attention mechanism: retain information to enhance channel-spatial interactions[EB/OL]. [2014-12-20].

[16]

WANG C YYEH I HMARK LIAO H Y. YOLOv9: learning what you want to learn using programmable gradient information[M]//Computer Vision-ECCV 2024. Cham: Springer Nature Switzerland, 2024: 1-21.

[17]

NOUAZE J CSIKATI J. YOLO-AppleScab: a deep learning approach for efficient and accurate apple scab detection in varied lighting conditions using CARAFE-enhanced YOLOv7[C]//The 2nd International Online Conference on Agriculture, 202330(1): 6.

[18]

WEI JWANG RWEI Set al. Recognition of maize tassels based on improved YOLOv8 and unmanned aerial vehicles RGB images[J]. Drones20248(11): 691.

[19]

李昊璇, 苏艳琼.基于改进YOLOv8的道路缺陷检测[J].测试技术学报202438(5): 506-512.

[20]

LI HaoxuanSU Yanqiong. Road defect detection based on improved YOLOv8[J]. Journal of Test and Measurement Technology202438(5): 506-512. (in Chinese)

[21]

HE YSONG KMENG Qet al. An end-to-end steel surface defect detection approach via fusing multiple hierarchical features[J]. IEEE Transactions on Instrumentation and Measurement202069(4): 1493-1504.

[22]

MASTYŁO M. Bilinear interpolation theorems and applications[J]. Journal of Functional Analysis2013265(2): 185-207.

[23]

ZZHAO ZXIA Ket al. Steel surface defect detection based on MobileViTv2 and YOLOv8[J]. The Journal of Supercomputing202480(13): 18919-18941.

[24]

LI JCHEN M. DEW-YOLO: an efficient algorithm for steel surface defect detection[J]. Applied Sciences202414(12): 5171.

[25]

KHANAM RHUSSAIN M. YOLOv11: an overview of the key architectural enhancements[EB/OL].[2014-12-15].

AI Summary AI Mindmap
PDF (3666KB)

370

访问

0

被引

详细

导航
相关文章

AI思维导图

/