面向重复性缺陷检测的钢材表面缺陷聚类方法

马博渊 ,  段智峰 ,  周鹏

东北大学学报(自然科学版) ›› 2026, Vol. 47 ›› Issue (6) : 143 -154.

PDF (2210KB)
东北大学学报(自然科学版) ›› 2026, Vol. 47 ›› Issue (6) : 143 -154. DOI: 10.12068/j.issn.1005-3026.2026.20259030
研究论文

面向重复性缺陷检测的钢材表面缺陷聚类方法

作者信息 +

Steel Surface Defect Clustering Method for Repetitive Defect Detection

Author information +
文章历史 +
PDF (2262K)

摘要

在钢材制造过程中,设备磨损或工艺波动易引发表面重复性缺陷,亟须依托智能检测与聚类方法实现高效识别与故障溯源.然而,实际生产中存在同类缺陷形态差异显著,同时受漏检、误检、空间漂移及定位误差等影响,缺陷并不总是呈现严格或稳定的周期分布.为此,提出了一种基于层级分布对齐正则化的两阶段广义类别发现方法,以适应生产中出现的新形貌缺陷,该方法利用已知聚类簇监督模型作为知识锚点,通过隐式平衡批次中已知类与未知类群组的边缘概率,并显式促进各自群组内部预测的均匀性,实现更结构化的预测分布控制,有效提升了缺陷聚类精度.结果表明,所提方法在钢材表面重复性混合缺陷数据集的所有类别的聚类精度较SimGCD*方法提高了4.54%,在未知类别的聚类精度提高了5.87%,展现出在类别间有效分离方面的显著优势.

Abstract

In the steel manufacturing process, surface repetitive defects are easily caused by equipment wear or process fluctuations, and intelligent detection and clustering methods are urgently required to achieve efficient recognition and fault source tracing. However, in practical production, significant morphological differences exist in the same type of defects. Meanwhile, affected by missed detection, false detection, spatial drift, and localization error, defects do not always present a strict or stable periodic distribution. Therefore, a two-stage generalized category discovery method based on hierarchical distribution alignment regularization was proposed to adapt to the new defect morphology appearing in production. In this method, the known cluster supervised model was utilized as a knowledge anchor. By implicitly balancing the marginal probabilities of known and unknown class groups in a batch and explicitly promoting the prediction uniformity within respective groups, a more structured prediction distribution control was achieved, and the defect clustering accuracy was effectively improved. The results show that compared with that of the SimGCD* method, the clustering accuracy of the proposed method on all categories of the steel surface repetitive mixed defect dataset is improved by 4.54%, and that on unknown categories is improved by 5.87%, which demonstrates a significant advantage in effective separation between categories.

Graphical abstract

关键词

钢材表面缺陷聚类 / 重复性缺陷检测 / 深度学习 / 广义类别发现 / 层级分布对齐正则化

Key words

steel surface defect clustering / repetitive defect detection / deep learning / generalized category discovery / hierarchical distribution alignment regularization

引用本文

引用格式 ▾
马博渊,段智峰,周鹏. 面向重复性缺陷检测的钢材表面缺陷聚类方法[J]. 东北大学学报(自然科学版), 2026, 47(6): 143-154 DOI:10.12068/j.issn.1005-3026.2026.20259030

登录浏览全文

4963

注册一个新账户 忘记密码

钢材生产过程中,由于轧辊磨损、异物压入轧辊等因素,常会产生具有重复性规律的缺陷(如重复性划痕、凹坑、辊印或异常纹理)1,这类缺陷在外观形貌上高度相似,并可能在生产过程中不断重复出现,一旦未被及时发现和聚类识别,可能引发整个批次的生产性质量问题,导致下游加工设备损耗甚至终端产品安全隐患2.因此,在钢材表面缺陷检测的基础上,亟须构建基于图像表征的聚类方法,从外观相似性角度识别重复性缺陷簇,并据此辅助定位潜在设备异常源(如特定轧辊的磨损或杂质干扰),减少非计划停产带来的经济损失.
在真实生产环境下,缺陷的空间分布与理论情况下的周期分布不同,其不再呈现规则的空间分布.漏检、误检、速度扰动、板材尺寸变化、轧辊偏移、图像拼接误差等因素会导致缺陷的空间间隔呈现高度不确定性,使得难以依赖缺陷位置信息或周期距离推断缺陷性质,削弱了基于几何周期的周期性建模的可行性.因此,相比“周期性缺陷”这一理想化定义,重复性缺陷是更合理的表述,其核心特征在于外观形貌近似但不强求固定空间节距.
随着人工智能技术在材料科学领域的发展3,通过高精度的机器视觉智能检测系统,已可实现钢材表面缺陷的实时智能检测4-5.图1展示了钢材表面重复性缺陷的出现场景:随着时间推移,异物磨损、环境变化等因素会导致钢材表面形成凹坑.这些凹坑在视觉纹理上具有一定一致性,但形态存在开放性变化,具体表现为旧类凹坑与新类凹坑的差异,这一特点使得检测过程中容易出现漏检和误检现象.对于形貌突变或弱纹理缺陷,仅依赖时空信息难以有效划分簇结构,需从图像相似度角度出发进行重复缺陷类别聚类和新类识别,进而计算聚类簇的空间重复性质(如重复间隔的均值、方差与重复数目等).
钢材表面重复性缺陷簇的发现与机器学习中聚类任务中的类别发现的设置相匹配.例如,在实际生产中出现与闭集中不同形态的凹坑簇,需要聚类识别成新的缺陷簇,在类别发现任务中可以视为潜在的新类别并对此进行聚类.本文重点探究广义类别发现(generalized category discovery,GCD),这是一个开放世界的任务,旨在用一组预先标注的已见类别的指导下,在未标注的数据集中发现新的类别6.与传统的半监督学习(semi-supervised learning,SSL)和新类别发现(novel category discovery,NCD)任务相比,GCD在学习设定上更具通用性和挑战性.具体而言,SSL通常假设标注数据与未标注数据共享相同的类别空间7-8,而NCD则假设标注数据的已知类别空间与未标注数据的类别空间完全不重叠9-10.相比之下,GCD打破了这一限制,允许未标注数据同时包含已知类和未知类,要求模型在保持已知类识别能力的同时,从中自动发现未知类.与多数仅依赖单阶段无监督优化的GCD方法不同,持续广义类别发现方法11与知识蒸馏方法12-13利用完全监督训练所获得的已知类模型,在精确编码已知类别的判别性知识的同时,还能在未知类别发现阶段将显著偏离已知类分布结构的预测特征作为潜在的未知类识别信号.此外,为了在新类别探索中偏向于某些特定类别,通常需要引入正则化项来鼓励预测的均匀性.其中熵正则化14通常用于避免聚类模型过早收敛到局部最优解.在大多数GCD工作15-17中,训练范式涉及使用一种无监督均值熵最大化方法来提升批次整体分布的不确定性,从而增强对未知类的发现.这一策略在无标签条件下构建了“弱监督”信号,但其对所有类别采用同质化处理,往往无法精细地调控所有类别群体间的学习动态以及各群体内部的类别区分度.
针对上述缺陷聚类的难题,本文提出了一种基于层级分布对齐正则化(hierarchical distribution alignment regularization,HDAR)的两阶段广义类别发现方法,以图像特征为基础对钢材表面重复性缺陷进行聚类.该方法不依赖缺陷的时空位置信息,而是利用已知聚类簇监督模型作为知识锚点,通过隐式地平衡批次中已知类与未知类群组的边缘概率、显式地促进各自群组内部预测的均匀性,辅助对已知簇和未知簇的发现,有效维持了全局类别平衡,在缓解旧类遗忘的同时强化了未知类辨识度,进而显著提升了缺陷聚类精度.本文的代码与示例数据集已公开至https://github.com/zhifeng-d/HDAR.

1 基于HDAR的两阶段广义类别发现方法

1.1 问题表述

在钢材缺陷聚类任务中,使用已标注数据集Dl=xi,yiXl×Yl在初始化阶段进行监督训练,标注数据集中仅包含已知类的样本,其中Yl是标注样本Xl的标签空间,即已知类别集合.在类别发现阶段中,给定已标注数据集并额外使用未标注数据集Du=xi,yiXu×Yu进行GCD设置的训练.在GCD设置中,Du包括已知和未知类样本,其中Yu是未标注示例Xu的标签空间,且YlYunYlnYu分别为YlYu的类别数,所有类别的总数为K=nYu,总数据集表示为D=DlDu.GCD旨在利用训练过程Dl中的知识去预测Du中样本的标签.此外,分类参数的一个常见假设是标注类别数目Kl和未知类别数目Kn是已知的918,或者可以使用文献[619]的方法进行估计.为了将钢材表面重复性缺陷簇的发现任务对齐GCD设置,本文设置已知类(或旧类)来表述已知簇,使用未知类(或新类)来表述未知簇.

1.2 网络整体架构图

本文的网络整体架构如图2所示.本文在SimGCD14基础上提出了两阶段广义类别发现框架.图2a展示了初始阶段的网络结构:该阶段采用完全监督的方式,在已知类别的标注样本上训练模型.该阶段的网络由1个编码器f和2个并行的头部组成:参数化分类头与投影头.编码器f使用经过DINO20预训练的ViT-B/16模型21,训练时仅微调编码器的最后一个块;参数化分类头由Kl个可学习的已知类别原型向量cold=c1,c2,,cKl构成,用于对已标注样本进行分类;投影头由一个2层多层感知机(multilayer perceptron,MLP)构成.该阶段的核心学习机制细节如图2d所示,通过增强视图间的特征一致性提升表示能力.

在类别发现阶段,如图2b所示,网络结构基本与初始阶段保持一致,区别在于分类头进行了维度扩展(图2b中扩展分类头的右侧区域),引入了Kn个可学习的未知类别原型向量cnew=cKl+1,cKl+2,,cKl+Kn,同时使用层级分布对齐正则化方法(第1.4节)平衡预测分布,其核心优化目标如图2c所示.除此之外,该阶段的参数初始化策略为:除cnew外的网络权重参数均继承自初始阶段的监督模型,而cnew采用聚类引导的方式进行初始化,其初始化方式可参见1.5节.

1.3 两阶段广义类别发现

不同于SimGCD以单阶段方式直接进入类别发现阶段,本文提出的两阶段广义类别发现框架包括初始阶段与新类发现阶段,并分别在DlD训练集中进行表征学习与分类学习,以充分建模新旧类别的内部表示结构.

表征学习旨在学习一种能有效区分各类别的特征表示.其中自监督对比损失可增强样本的特征表示一致性,其目标函数Lrepu

Lrepu=1nBxiB-lnexpz^iz˜i/tuxjBexpz^jz˜i/tu.

其中:B为给定训练集的批次训练数据;nBB的样本数目;设图像样本xi经主干编码器f得到表示特征vi=f(xi),再通过投影头映射为表征特征zi=g(vi);对每个样本xi构造两种数据增强视图x˜ix^i,并分别编码得到z˜iz^iz^j是与样本xi同批次下样本的表征特征;tu为温度,用于控制视图间分布的平滑度.

为了进一步利用已标注数据集Dl,引入监督对比损失,将同类样本视为正对,不同类样本视为负对.利用监督对比损失,通过最大化同一类样本之间的相似性,同时最小化不同类样本之间的相似性,使得模型学习到的特征表示更具判别性.其目标函数为

Lreps=1nBlxiBl1nNipNi-lnexpz^iz˜p/tcniexpz^iz˜n/tc.

其中:Ni是小批量中所有与xi具有相同标签的图像的索引;nNiNi的数目;Bl表示当前批次中的标注数据;nBlBl的数目;tc为一个额外的温度;z˜pz˜n分别代表与样本xi同类表征特征和除xi外的样本表征特征.最终的表征学习目标为两种损失的加权组合:Lrep=λLreps+1-λLrepu,λ是加权超参数.此阶段仅更新编码器与投影头参数,并为后续分类学习提供高质量特征表征.

分类学习的目的是学习一种可以为所有未标注数据分配标签的分类头.与SimGCD的参数化原型分类结构保持一致,本文同样为每个类别设置可学习原型c1,c2,,cK.但由于初始阶段已通过监督学习得到稳定的已知类原型,后续的类别发现便无需从随机初始化开始,而是直接在已有语义空间中进行新类结构的发掘与扩建,从而减少伪聚类扰动并提升开放类可分性.

对于每个样本的一个数据增强视图x^i,分类头的输出是一个概率向量p^i.更准确地说,p^i是通过使用Softmax函数对原型分类头的输出进行归一化而产生的,其在每个可学习原型ck对应的类别k上的概率p^i,k可表述为

p^i,k=exp1tsv^i/v^iTck/ckj=1Kexp1tsv^i/v^iTcj/cj.

其中:ts为温度,控制预测分布是否尖锐;v^i表示样本x^i经过编码器f的输出表征.对于标注数据,分类监督目标为真实标签与模型预测概率之间的交叉熵损失,旨在最小化二者之间的差异,从而有效提升模型对已知类别的判别能力.该目标函数Lclss表示为

Lclss=1nBliBlk-yiklnp^i,k.

式中,yik为第i个样本在第k个类别上的真实标签.

在无监督分类学习中,本文采用自蒸馏方法生成软伪标签p˜i,并将其作为“类概率分布”形式的监督信号,其中p˜i是由样本的另一个数据增强视图x˜i式(3)中以更低的温度tt(即更尖锐的预测分布)计算得到,与预测输出的概率向量p^i进行交叉熵学习.随后,使用交叉熵损失项Lclsuce与熵正则化项Hp¯组合构建无监督学习目标Lclsu.其中,交叉熵损失促使模型在不同视图间保持一致性;而熵正则化项通过最大化预测分布的熵值,鼓励模型学习更均匀且分散的类别划分,从而有助于增强未知类别的可分性.

Lclsuce=1nBxiBk-p˜i,klnp^i,k,
Hp¯=ϵkp¯kln p¯k,
Lclsu=Lclsuce+Hp¯.

其中:ϵ是熵正则化项的权重;下标k表示类别索引;p¯=12nBiBp^i+p˜i,为批次中每个类的平均预测概率.分类学习目标组合为Lcls=λLclss+1-λLclsu.

表征学习目标Lrep与分类学习目标Lcls联合构成基础训练目标:LSimGCD=Lrep+Lcls.为便于介绍本文的层级分布对齐正则化目标LHDAR,本文将熵正则化项单独记为Lreg,并将除熵正则化外的学习目标记为LSimGCD-.

Lreg=1-λHp¯,
LSimGCD-=LSimGCD-Lreg.

两阶段广义类别发现的总学习目标如式(10)所示,Linit为初始阶段的学习目标,Lcd为类别发现阶段的学习目标.当初始阶段训练完成后,类别发现阶段模型通过严格权重继承的方式,复制初始阶段监督模型的全部参数,并在此基础上按照既定策略继续训练.后续消融实验表明,初始阶段习得的精确旧类表征可实现高效迁移,显著提升类别发现任务的性能.

Linit=LSimGCD-+Lreg,初始阶段;Lcd=LSimGCD-+LHDAR,类别发现阶段.

与单阶段SimGCD相比,此结构化训练流程对先验原型约束进行简单初始化,显著减少了初始特征分布波动对新类拟合的干扰,并为后续引入层级分布对齐正则化奠定了可迁移的语义原型空间.

1.4 层级分布对齐正则化

在钢材表面重复性缺陷簇发现任务中,样本数量分布不均与类别间特征表达的高度相似性是两大显著挑战.一方面,不同缺陷类别在实际采集过程中样本数量悬殊,训练阶段模型更容易偏向于频次较高的已知类别,从而削弱对低频或未知类的建模能力22.另一方面,钢材表面缺陷的形成常受环境干扰及材料特性等因素共同影响,即使是不同类别的缺陷,在图像表现上亦可能呈现出高度相似的边缘结构、纹理模式和局部形态23.这种跨类相似性进一步加剧了模型在类别判断上的难度,尤其对未知类别的识别与分离提出了更高要求.如式(8)所示,这种对所有类别施加全局约束的策略在样本不均衡与类别间差异小的情况下反而会加剧强类主导的问题.为克服这些局限性,本文提出一种新的正则化框架——层级分布对齐正则化.具体而言,HDAR在两个不同的层级上引导模型的预测分布:在宏观层级上使用组间平衡,在已知类组与未知类组之间通过约束它们的边缘概率实现两者在模型整体关注度上的平衡;在微观层级上使用组内对齐策略,分别在已知类组内部和未知类组内部独立地促进预测概率的均匀化,以维持已知类的区分度并鼓励对未知类的充分探索.

通过这种层级化的设计,HDAR能够对模型的预测行为施加更精细、更具针对性的控制.本文提出的HDAR学习目标LHDAR由分别对应上述两个层级目标的组件构成,并仅在类别发现阶段执行,具体如下所述:

1) 组间平衡损失.为了解决类别发现阶段广义类别发现中模型可能出现的预测偏差和性能退化问题,需要对模型的预测分布施加明确的约束.考虑到模型在训练初期对已知类别具有较强的判别能力,将所有已知类别视为一个已知类组,并将所有潜在的未知类别视为未知类组.这样,可以在宏观层面将类别平衡问题简化为一个概念上的二分类问题.具体来说,计算批次中样本的边缘概率p¯RK=12nBiBp^i+p˜ip¯oldinR=kYlp¯kp¯newinR=kYnp¯k是标量,分别表示已知、未知类别群组内部的边缘概率和,并且p¯oldin+p¯newin=1.本文定义组间平衡损失Lgroup如下:

Lgroup=p¯oldinln p¯oldin+p¯newinln p¯newin+ln2.

该损失函数基于二元类别的熵形式构建,常数项ln2的加入确保了损失值非负.通过最小化该项,模型被鼓励在已知类别组与未知类别组之间做出更明确的区分,从而在利用已知知识的同时,保持对新类别潜在存在的敏感性.该设计在已知类别指导下实现了对新类别探索与分类边界清晰度之间的平衡.

2) 组内均匀损失.对于已知类别,期望模型不仅能区分它们,而且能稳定地识别所有已知类别,避免模型仅对少数几个容易或常见的已知类产生高置信度预测,而忽略或遗忘其他已知类(即“类内坍塌”或过拟合).保持已知类内部预测的相对均匀性,有助于维持模型对整个已知类别空间的判别能力.形式上,考虑在批次边缘概率p¯仅属于Kl个已知类别的输出神经元对应的平均预测概率向量p¯old=p¯1,p¯2,,p¯Kl,本文通过惩罚归一化后的旧类概率分布p¯old,norm=p¯old/p¯oldin与理想的均匀分布p¯oldu(每个旧类的概率为1/Kl)之间的显著偏离来实现这一目标.本文采用平方欧氏距离作为衡量这种偏离程度的度量,因为它能有效且计算简便地惩罚任何远离均匀状态的概率尖峰.本文定义已知类群组内平衡损失Lold如下:

Lold=k=1Klp¯k,old,norm-1/Kl2.

其中,p¯k,old,norm是归一化后的旧类概率分布p¯old,norm的第k类的概率值.

在处理潜在的未知类别时,需要鼓励模型进行广泛、均匀的探索,而不是过早地将所有新颖性信号汇聚到少数几个假设的新簇上.类似地,考虑在批次边缘概率p¯仅属于Kn个未知类别的输出神经元对应的平均预测概率向量p¯new=p¯Kl+1,p¯Kl+2,,p¯Kl+Kn,并将其归一化得到条件概率分布p¯new,norm=p¯new/p¯newin.通过最小化该分布与理想均匀分布p¯newu(每个未知类的概率为1/Kn)之间的平方欧氏距离,能够有效防止新类别的概率质量过度集中,鼓励模型在新类别空间中保持更广泛的感受野,为发现多样化的新类别模式奠定基础.本文定义未知类群组内平衡损失Lnew如下:

Lnew=k=Kl+1Kl+Knp¯k,new,norm-1/Kn2.

最终的层级分布对齐正则化学习目标是上述3个分量的加权和:

Lreg=1-λwgroupLgroup+woldLold+wnewLnew.

其中,wgroupwoldwnew为超参数,用于调整不同优化目标的相对重要性.后续实验展示了本文提出的层级分布对齐正则化方法替换熵正则化方法所带来的性能提升.

1.5 未知类原型初始化

随机初始化分类头的权重会导致未知类原型在初始阶段即偏离可行区域,引发训练震荡.为此,本文利用聚类结果为未知类别提供确定性起点.具体来说,利用初始阶段的监督模型对Du提取样本表征,在所有样本表征上执行K-means聚类算法计算K个归一化簇中心ci(i=1,2,,K).考虑到部分聚类中心可能与已知类别分布高度重合,通过余弦相似度筛选出最具“未知类代表性”的簇中心.具体而言,对于每个簇中心cj,计算其与初始阶段的已知类分类头权重ϕmold,m=1,2,,Kl的最大余弦相似度,并选取其中与已知类最不相似的Kn个簇中心索引,满足:

tj=topKn(-maxmcjϕmold),j=1,,Kn.

其中:tj为第j个被选中的簇中心索引;topKn()为取前Kn大的值所对应索引的操作,用于从所有簇中心中筛选出与已知类最不相似的Kn个;-maxmcjϕmold表示簇中心cj与所有已知类原型ϕmold的余弦相似度取最大值后再取负,值越大代表该簇中心与已知类的相似度越低.最终,将这些索引对应的簇中心ctj(即索引为tj的原始簇中心)作为分类头中未知类别原型cnewj的初始化:

cnewj=ctj,j=1,2,,Kn.

1.6 类别数量估计

在GCD任务中,未标注数据集Du的真实类别数量通常未知.本文采用文献[6]中的策略,通过已标注数据集Dl反向估计整体类别数量,并在不改变其核心思想的前提下将该方案应用于钢材表面缺陷聚类任务.由于拥有真实标签,可将其作为监督信号,用于评价不同聚类数的优劣.为对齐“聚类类别索引”与“真实类别标签”,本文采用Hungarian算法进行最优匹配.当候选所有类别总数K大于真实类别数量时,多余类别会被映射为“空标签集合”;若K小于真实类别数量,则部分真实类别也会被映射为空集合.在这两种情况下,模型的聚类精度都会下降.因此,文献[6]将聚类精度ACCK视作关于K的黑盒函数:ACCK=fK,D,并假设其在正确类别数附近取得峰值.

不同于穷举遍历所有K的方法9,本文使用Brent算法对ACCK进行一维黑盒优化搜索.具体实现如下,首先将全部样本组成数据集D=DlDu;其次在对应特征空间中,在类别数的约束区间Kmin,Kmax内,对每个K多次运行K-means并在Dl上计算映射后的聚类精度ACC;最后,以ACCK作为目标函数,使用Brent单峰优化寻找最优聚类数K^.该方法无需额外标签参与训练,仅通过Dl的部分标签结构引导类别数估计,具有较高的效率与可扩展性.

2 实验结果与讨论

本文通过客观和主观评估实验证明所提方法的有效性.

2.1 数据集介绍

为了验证本文所提方法的有效性,实验使用2个数据集:一是11类混合缺陷数据集,其中5类采集自某钢厂热轧棒材生产线产生的重复性缺陷,其余6类选自NEU-DET24热轧带钢数据;二是GC10-DET25数据集,收录的是钢板表面的10类缺陷图像,用于验证跨材质、跨工艺的泛化能力.选用上述钢材体系主要基于两点:第一,热轧工艺在工业生产中广泛存在,且易产生由轧辊磨损、氧化、物料嵌入等引发的重复性缺陷(如辊印、划痕、凹坑);第二,热轧棒材、热轧带钢与钢板三类缺陷数据在表面纹理、缺陷尺度和成因上既有共性也存在差异,可用于验证层级分布对齐方法在跨钢种表面图像中的鲁棒性与泛化能力.本文遵循SimGCD14的数据集设置方式:将所有类的50%作为标注(已知)类别,这些标注类别中50%的图像用于构建已标注数据集Dl,而数据集中剩余的图像被视为未标注数据集Du.表1为两种数据集的统计数据,分别介绍了标注类别数目nYl、已标注样本数目nDl、无标注类别数目nYu与无标注样本数目nDu.

因篇幅有限,本研究仅在混合缺陷数据集上进行了可视化展示,结果如图3所示,共展示11类缺陷的50幅图像.

2.2 实验参数设置

本文的实验参数与SimGCD14保持一致,使用768维的[CLS]token输出作为图像特征.训练时采用128的批尺寸(batch size),初始阶段进行30轮次完整训练,类别发现阶段进行200轮次完整训练.学习率从0.1开始,并使用余弦调度器(cosine scheduler)进行衰减.在类别发现阶段,平衡因子λ设置为0.35,温度tutc分别设置为0.07和1.0.对于分类学习目标,将ts设置为0.1,并将tt初始化为0.07,然后在类别发现阶段起始30轮次完整训练中使用余弦调度器将其预热到0.04.层级分布对齐正则化方法权重wgroupwoldwnew分别设置为3,1与1.为保证公平性,所有实验均使用NVIDIA GeForce RTX 3090 GPU完成训练.为了估计未标注数据集中的聚类数目,本文提取总数据集D中样本的表征特征,在聚类数目的约束域上运行类别估计方法36,其中约束域中的最小值Kmin=nYl,最大值Kmax=200.在类别发现的鲁棒性评估中:局部高斯模糊的模糊核半径设为3像素,模糊区域在整幅图像中随机选取以模拟服役过程中的局部磨损、污染模糊现象;在腐蚀类斑点扰动中,每张图像随机生成2~3处伪腐蚀区域,斑点半径4~8像素随机采样,为体现金属表面氧化、剥落或点蚀等服役缺陷的暗化特征,斑点灰度值从区间[40,120]内随机选取.

2.3 钢材缺陷数据集实验分析和讨论

2.3.1 客观评估指标

本文采用聚类精度(ACC)6评估模型对不同缺陷的聚类能力,聚类精度高表明模型能够更有效地识别不同重复下的缺陷表征结构,并将相似的结构分组在一起.在评估过程中,分别假设y^iyi作为未标注数据集Du中样本xi的预测类别和真实类别,ACC=1Ni=1NIyi=δy^i,其中:N=nDuδ为匹配预测聚类分配到真实类标签的最优排列;I为统计匹配成功的对数.此外,本文参照文献[6],列出了所有类别、已知类别和未知类别的聚类精度.

2.3.2 与先进方法比较

为了评估层级分布对齐正则化的性能,将本文方法与8个先进的GCD方法、2个传统聚类方法和2个正则化方法进行了比较.传统聚类方法通过HOG26提取整图梯度方向直方图作为全局特征,该方法通过在固定网格上统计局部梯度幅值与方向分布,并对块进行归一化拼接,从而形成定长的结构化向量,可反映缺陷的形貌结构.为提取缺陷形态的高阶特征,引入DINO特征向量,两种特征分别进行聚类并作为非深度学习(non-deep learning)方法基线;8个GCD方法包括4种非参数分类方法(GCD6,GPC27,DCCL28和CMS29)和4种参数分类方法(SimGCD14,PPC-DCR15,LegoGCD16和BPCL-GCD17).在正则化方法中,本文提取了SimGCD14和Happy11的正则化方法,在两阶段广义类别发现框架下进行应用,该方法命名为SimGCD*Happy*,以此构成不同正则化方法的核心验证基准.

需要指出的是,本文方法定位于“基于特征相似度的重复性缺陷检测”范式.表2显示,尽管非深度学习方法基线(HOG+K-means,DINO+K-means)已具备一定辨别力,但其仅依赖朴素聚类,缺乏对语义结构的显式建模,难以充分挖掘缺陷形态的高阶相似性;相比之下,GCD框架通过联合表征学习与伪标签自训练,能够更有效地提取并归纳同类缺陷的细粒度特征,从而在各评价维度上均显著超越传统聚类方案.

在正则化方法中,SimGCD*是在平均熵最大化的基础上发现未知类别;Happy*旨在通过结构化的方式约束模型的平均预测概率分布,以实现组间平衡和组内均匀,但其核心方案依旧基于信息熵最大化原理,模型更容易在训练中对未知类识别上出现偏好或过度集中.本文提出的HDAR方法改善了其预测偏差与强类主导问题,如表2所示,本文HDAR方法相比SimGCD*在混合缺陷数据集与跨工艺钢板缺陷数据集GC10-DET的所有类别的聚类精度分别提升了4.54%与6.17%,已知类别的聚类精度分别提升了1.09%与11.42%,未知类别的聚类精度分别提升了5.87%与2.75%.HDAR与Happy*都致力于通过分层策略解决类别平衡和均匀性问题,并在两个数据集中所有类聚类精度上分别取得最优与次优表现.本文在实现组内均匀损失时对模型偏好的强抑制能力,使其在促进群组内部有效分离方面更具优势,HDAR相比Happy*在混合缺陷数据集的未知类别聚类性能上提升了4.26%,在GC10-DET的已知类别聚类性能上提升了4.12%.

结果表明,在混合缺陷数据集与跨工艺钢板缺陷数据集GC10-DET上的所有类别聚类精度上,本文HDAR方法分别为94.88%与80.42%,优于其他先进方法.由于训练阶段仅使用表面图像,未引入任何冶金学先验知识,该结果说明HDAR方法对热轧棒材、带钢及钢板缺陷均具有可迁移的视觉表征能力.

两阶段广义类别发现相对于单阶段广义类别发现展现出更多优势.例如,在混合缺陷数据集中,SimGCD*相较SimGCD方法,在所有类别的聚类精度上实现了3.33%的提升,并超越了当前8种GCD方法.改进结果得益于初始阶段监督模型所提供的精确旧类知识.

2.3.3 类别发现鲁棒性评估

本文所采用的数据主要来源于轧制生产阶段形成的表面缺陷,而实际服役环境(如腐蚀介质、疲劳载荷、冲刷磨损)也会引发具有不同形貌特征的非生产性缺陷.由于现有数据集(包括现场棒材、NEU-DET与GC10-DET)并不包含工况信息,本文未对生产性缺陷与服役性缺陷进行显式区分.为此,本文在GC10-DET数据集预处理中叠加局部模糊、暗色腐蚀斑点扰动,以模拟腐蚀、冲刷磨损导致的形貌退化;同时随机选取折痕、冲孔、水斑、夹杂物4类典型缺陷样本进行扰动前后的可视化展示.其中,折痕为钢板轧制过程中形成的线性形变缺陷,冲孔为外力冲压导致的孔洞型缺陷,水斑由生产中的干燥产生,夹杂物通常表现为小斑点,不规则地分布在带钢表面,4类缺陷在形态、成因与视觉特征上存在显著差异.具体扰动效果如图4所示.

本文在不改变训练流程的前提下,对预处理后的GC10-DET数据集进行了类别发现鲁棒性验证.如表3所示,在正则化类型中,即使在服役缺陷形貌扰动下,本文HDAR方法仍保持最优性能,相比SimGCD*,在所有类别的聚类精度提升了2.70%,已知类别的聚类精度提升了6.70%,未知类别的聚类精度提升了0.09%,说明其对非生产性缺陷的特征扰动具有一定稳健性.

2.3.4 主观评估结果

本文提出的层级分布对齐正则化相比于平均熵最大化方法输出了更结构化的预测分布.为了更好地理解层级分布对齐正则化方法所带来的特征分布改进,本文利用 t-SNE30 进行了特征集群分布可视化.对混合缺陷数据集所有类别的评估结果如图5所示,整体上SimGCD*与本文提出的方法可以有效进行簇间划分.如图5a所示,可以观察到SimGCD*在未知类与未知类8,10,6,7、已知类与未知类1,9,2,6之间发生了纠缠;如图5b所示,本文HDAR方法生成了更紧凑的输出,有效地对属于同一类别的样本进行分组,形成了更清晰的类间决策边界.

2.3.5 估计聚类数目

本文采用文献[6]对未标注图像数据集进行类别数量估计,具体的估计方法可参见1.6节.表4为混合缺陷数据集与GC10-DET中类别数量的估计结果,可以观察到本文估计的类别数量非常接近未标注数据集中的真实类别数量,最大误差率为9%,GC10-DET能够准确地识别聚类数目.关于误差率,文献[36]指出,预测类别总数量受已知标注定义的影响,因此不同标注标准会导致不同的聚类类别数量估计结果.

2.3.6 训练开销与精度增益分析

为进一步验证两阶段策略在效率与性能上的实用价值,本文对比了单阶段SimGCD与两阶段的SimGCD*,HDAR 方法的训练时间与聚类精度.其中SimGCD*采用与SimGCD一致的正则化熵损失函数,仅将训练流程改为两阶段.尽管两阶段方法在初始阶段需额外进行已知类的监督预训练,但由于该阶段训练数据规模较小且训练轮次有限(具体可参见2.1节数据集介绍与2.2节实验参数设置),其时间开销占总训练时间的比例极低.如表5所示,两阶段方法在两个数据集中额外引入的初始阶段仅耗时约0.1 h,相对增幅小于4%.然而,在混合缺陷数据集与GC10-DET数据集上,SimGCD*在所有类别聚类精度相较于SimGCD分别提升了3.33%与4.83%,HDAR方法在所有类别的聚类精度相较于SimGCD分别提升了7.87%与11.00%.可以认为,在两阶段方法中,初始阶段步骤以可忽略的时间成本换取显著精度提升,验证了两阶段策略在钢材重复性缺陷簇发现场景下的高效性与实用性.

2.4 消融实验分析和讨论

针对混合缺陷数据集的损失函数组件消融实验结果如表6所示,本文研究了层级分布对齐正则化方法的各种组件的有效性,包括组件平衡损失Lgroup、已知类群组内平衡损失Lold和未知类群组内平衡损失Lnew.本文将基础组件定义为分类学习与表征学习的结合(不含熵正则化),即LSimGCD-.实验1~5的结果有力地支持了本文提出组件的有效性.

实验1中,在缺乏任何显式平衡约束的情况下,模型表现出较差的整体性能,无法有效保持对已知知识的判别能力,甚至发生了灾难性遗忘.额外引入组间平衡损失Lgroup后,如实验2所示,已知类别精度大幅提高,证明了其在平衡新旧类整体关注度、防止遗忘的关键作用.比较实验2和实验4时发现,模型对已知类和未知类的样本识别能力出现显著提升,这表明Lnew对于促进未知类内部的均匀探索、防止模式坍塌以及提升新类别的可分性至关重要.在广义类别发现任务中,有效区分未知类别通常是主要挑战,因此Lnew对整体性能的贡献尤为突出.同时,比较实验2和实验3显示,Lold有助于增强已知类别内部的区分度,揭示了其稳定已知类内部表示的积极影响.最终如实验5所示,在所有组件协同工作时,模型达到了最佳性能.

该消融研究清晰地验证了本文提出的层级分布对齐正则化方法中每一个损失函数组件的必要性和有效性.Lgroup对于建立新旧类别的基础平衡、防止对已知类别的遗忘起着决定性作用;Lold有助于稳定和精炼对已知类别的判别;Lnew则显著促进了对多样化新类别的探索和区分,对提升整体性能特别是新类别发现能力贡献巨大.实验结果表明,只有将这些组件结合起来,才能实现最佳的广义类别发现性能.

3 结 语

本文面向钢材表面重复性缺陷簇的识别与发现任务,提出了一种基于层级分布对齐正则化的两阶段广义类别发现方法.针对重复性缺陷簇中普遍存在的开放性缺陷形态、误检与漏检导致的分布不稳定,以及仅依赖传统时空信息造成的类别识别偏差、样本聚类不均和特征相似性高等问题,本文方法引入组间平衡与组内对齐相结合的正则化策略,有效提升了模型对已知类别的判别能力及对未知结构的探索能力.实验结果表明,该方法在钢材表面混合缺陷数据集上表现优异,实现了94.88%的整体聚类精度与93.81%的未知类别聚类精度.相较于采用全局熵调控的SimGCD*方法,上述两项指标分别提高了4.54%和5.87%,充分验证了该方法在实现缺陷类别有效分离方面的显著优势.

参考文献

[1]

吴昆鹏,石杰.基于孪生网络的带钢表面周期性缺陷检测方法[J].冶金自动化202044(6):93-98.

[2]

Wu Kun-pengShi Jie. Periodic defect detection method for strip steel surface based on Siamese network[J]. Metallurgical Industry Automation202044(6): 93-98.

[3]

李丰范,匡健隆,季佳浩,.机器学习在金属材料服役性能预测中的应用[J].工程科学学报202446(1):120-136.

[4]

Li Feng-fanKuang Jian-longJi Jia-haoet al. Application of machine learning in predicting the service performance of metallic materials[J]. Chinese Journal of Engineering202446(1): 120-136.

[5]

Jiang YLi J SYang Xet al. Applications of generative adversarial networks in materials science[J]. Materials Genome Engineering Advances20242(1): e30.

[6]

Xie Y FHu W TXie S Wet al. Surface defect detection algorithm based on feature-enhanced YOLO[J]. Cognitive Computation202315(2): 565-579.

[7]

马鸽,李洪伟,严梓维,.基于多注意力的改进YOLOv5s小目标检测算法[J].工程科学学报202446(9):1647-1658.

[8]

Ma GeLi Hong-weiYan Zi-weiet al. Improved small target detection algorithm based on multi-attention and YOLOv5s for traffic sign recognition[J]. Chinese Journal of Engineering202446(9): 1647-1658.

[9]

Vaze SHan KVedaldi Aet al. Generalized category discovery[C]//2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR). New Orleans,2022: 7492-7501.

[10]

Zheng M KYou SHuang Let al. SimMatch: semi-supervised learning with similarity matching[C]//2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR). New Orleans, 2022: 14451-14461.

[11]

Sohn KBerthelot DCarlini Net al. FixMatch: simplifying semi-supervised learning with consistency and confidence[J]. Advances in Neural Information Processing Systems202033: 596-608.

[12]

Han KRebuffi S AEhrhardt Set al. AutoNovel: automatically discovering and learning novel visual categories[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence202244(10): 6767-6781.

[13]

Zhong ZFini ERoy Set al. Neighborhood contrastive learning for novel class discovery[C]//2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR). Nashville, 2021: 10862-10870.

[14]

Ma S JZhu FZhong Zet al. Happy: a debiased learning framework for continual generalized category discovery[J]. Advances in Neural Information Processing Systems202437: 50850-50875.

[15]

Gu P YZhang C YXu R Jet al. Class-relation knowledge distillation for novel class discovery[C] //2023 IEEE/CVF International Conference on Computer Vision (ICCV). Paris,2024: 16428-16437.

[16]

Wang Y ZChen Z YYang D Ket al. Self-cooperation knowledge distillation for novel class discovery[C]//Computer Vision—ECCV 2024. Cham: Springer, 2025: 459-476.

[17]

Wen XZhao B CQi X J. Parametric classification for generalized category discovery: a baseline study[C]//2023 IEEE/CVF International Conference on Computer Vision(ICCV). Paris,2024: 16544-16554.

[18]

Hu Z YDuan YZhang Y Met al. Prototypical classifier with distribution consistency regularization for generalized category discovery: a strong baseline[J]. Neural Networks2025182: 106908.

[19]

Cao X ZZheng X YWang G Het al. Solving the catastrophic forgetting problem in generalized category discovery[C]//2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR).Seattle, 2024: 16880-16889.

[20]

Wang YZhao B CLu Y Cet al. Debiased prototypical learning improves generalized category discovery[C]//2024 IEEE International Conference on Multimedia and Expo (ICME).Niagara Falls, 2024: 1-6.

[21]

Fini ESangineto ELathuilière Set al. A unified objective for novel class discovery[C]//2021 IEEE/CVF International Conference on Computer Vision(ICCV).Montreal, 2021: 9284-9292.

[22]

Han KVedaldi AZisserman A. Learning to discover novel visual categories via deep transfer clustering[C]// IEEE/CVF International Conference on Computer Vision(ICCV).Seoul,2019: 8401-8409.

[23]

Caron MTouvron HMisra Iet al. Emerging properties in self-supervised vision Transformers[C]//2021 IEEE/CVF International Conference on Computer Vision(ICCV).Montreal,2021: 9630-9640.

[24]

Dosovitskiy ABeyer LKolesnikov Aet al. An image is worth 16x16 words: Transformers for image recognition at scale[EB/OL]. (2020-10-22)[2025-11-30].

[25]

白云鹍,张昊宇,邢宇翔.基于无监督学习的工业图像异常检测研究综述[J]. 中国体视学与图像分析202530(1):102-125.

[26]

Bai Yun-kunZhang Hao-yuXing Yu-xiang. A review of industrial image anomaly detection based on unsupervised deep learning [J]. Chinese Journal of Stereology and Image Analysis202530(1):102-125.

[27]

吴俊飞,顾新福.Ti2AlNb热轧板中反常轧制组织成因分析[J].中国体视学与图像分析202429(1):19-28.

[28]

Wu Jun-feiGu Xin-fu. Mechanism of abnormal rolling microstructure in Ti2AINb alloy hot-rolled plate[J]. Chinese Journal of Stereology and Image Analysis202429(1):19-28.

[29]

Bao Y QSong K CLiu Jet al. Triplet-graph reasoning network for few-shot metal generic surface defect segmentation[J]. IEEE Transactions on Instrumentation and Measurement202170: 5011111.

[30]

Lyu X MDuan F JJiang J Jet al. Deep metallic surface defect detection: the new benchmark and detection network[J]. Sensors202020(6): 1562.

[31]

Dalal NTriggs B. Histograms of oriented gradients for human detection[C]//2005 IEEE Computer Society Conference on Computer Vision and Pattern Recognition (CVPR). San Diego, 2005: 886-893.

[32]

Zhao B CWen XHan K. Learning semi-supervised gaussian mixture models for generalized category discovery[C]//2023 IEEE/CVF International Conference on Computer Vision(ICCV).Paris, 2023: 16577-16587.

[33]

Pu NZhong ZSebe N. Dynamic conceptional contrastive learning for generalized category discovery[C]//2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR).Vancouver, 2023: 7579-7588.

[34]

Choi SKang DCho M. Contrastive mean-shift learning for generalized category discovery[C]//2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR).Seattle,2024: 23094-23104.

[35]

Van der Maaten LHinton G. Visualizing data using t-SNE[J]. Journal of Machine Learning Research20089(11): 2579-2605.

基金资助

国家科技重大专项(2024ZD0608200)

AI Summary AI Mindmap
PDF (2210KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/