基于DINOv2到EfficientViT的多损失蒸馏Patch特征少样本异常检测

韩信 ,  邵星灵 ,  李秀源 ,  闫佳乐 ,  邓瑞祥

测试技术学报 ›› 2026, Vol. 40 ›› Issue (04) : 423 -434.

PDF (4138KB)
测试技术学报 ›› 2026, Vol. 40 ›› Issue (04) : 423 -434. DOI: 10.62756/csjs.1671-7449.2026060
智能感知与信息处理专栏

基于DINOv2到EfficientViT的多损失蒸馏Patch特征少样本异常检测

作者信息 +

Multi⁃Loss Distillation of Patch Features from DINOv2 to EfficientViT for Few⁃Shot Anomaly Detection

Author information +
文章历史 +
PDF (4236K)

摘要

针对少样本工业异常检测任务中大规模模型部署困难与轻量级模型性能不足的问题, 提出一种基于知识蒸馏的轻量化异常检测方法。以DINOv2作为教师模型, EfficientViT作为学生模型, 通过知识迁移实现在资源受限环境下的高性能检测。设计特征对齐适配器以弥合师生模型特征差异, 并构建结合Huber损失、 余弦相似度损失与Gram矩阵损失的多目标蒸馏函数, 从数值、 方向和空间统计关系多维度约束学生模型学习。在MVTec AD数据集上的实验表明, 仅使用正常样本训练即可显著提升学生模型性能: 蒸馏后的学生模型与未蒸馏基准模型相比, 图像级异常检测AUROC提升0.170; 与教师模型相比, 在保持相当性能的同时, 参数量减少约23%, 推理速度提升4倍。消融实验与可视化分析验证了模型各组件的有效性。

Abstract

To address the problem in few-shot industrial anomaly detection where large-scale models are difficult to deploy and lightweight models show limited performance, a lightweight anomaly detection method based on knowledge distillation is proposed. DINOv2 as the teacher model and EfficientViT as the student model, transferring knowledge are used to achieve high detection performance under resource constraints. A feature alignment adapter is designed to reduce the representation gap between the two models, and a multi-objective distillation loss combining Huber loss, cosine similarity loss, and Gram matrix loss guides the student from multiple dimensions of magnitude, direction, and spatial correlation. Experiments on the MVTec AD dataset show that the student model, trained only with normal samples, achieves a 0.170 improvement in image-level AUROC over the baseline model without distillation, while maintaining comparable performance to the teacher model with about 23% fewer parameters and 4 times faster inference. The effectiveness of the proposed framework is confirmed by ablation and visualization studies.

Graphical abstract

关键词

异常检测 / 知识蒸馏 / 轻量化模型 / 视觉Transformer / 少样本学习

Key words

anomaly detection / knowledge distillation / lightweight model / vision Transformer / few-shot learning

引用本文

引用格式 ▾
韩信,邵星灵,李秀源,闫佳乐,邓瑞祥. 基于DINOv2到EfficientViT的多损失蒸馏Patch特征少样本异常检测[J]. 测试技术学报, 2026, 40(04): 423-434 DOI:10.62756/csjs.1671-7449.2026060

登录浏览全文

4963

注册一个新账户 忘记密码

0 引 言

异常检测是指识别与预期模式或行为显著不同的数据点的过程, 其核心目标在于发现系统运行中潜在的不寻常事件、 异常行为或趋势1。作为机器学习和计算机视觉中的重要研究方向, 异常检测已被广泛应用于工业检测2-3、 视频监控4、 医疗诊断5, 以及网络安全6等领域。然而, 在大多数实际场景中, 异常数据往往稀缺、 分布多样且难以提前获取, 这使得传统依赖于有监督样本的检测方法面临挑战。

为应对异常样本不足的问题, 少样本异常检测逐渐受到广泛关注7。少样本异常检测的核心问题是如何建立能够泛化到未知异常模式的表征体系。近年来, Transformer架构的发展为计算机视觉领域的应用提供了重要启示8, 也为异常检测中的表征学习提供了丰富的技术思路。邹琦萍等9提出了基于多层级视频Transformer的视觉自动定位方法(MLVT), 通过多级标记划分与逐层可变形注意力机制, 在自建视频数据集上的分类准确率达88.9%, 有效实现了从模糊到清晰序列中精准选出最清晰帧。薛振华等10提出了SSMOD-Net, 借助视觉大模型架构, 设计了状态空间模型驱动的提示编码器, 为SAM生成动态提示, 实现了无需微调的高效工业异常检测, 提升了模型对未知异常的泛化能力。Zhu等11提出了一种基于双层路由注意力机制的视觉Transformer模型BiFormer, 在ImageNet-1K图像分类任务中达到83.2%的Top-1准确率。金泽辉等12提出了视觉语言模型CRM, 通过RGFormer将CLIP图像特征映射至文本空间, 在COCO Karpathy测试集上得到145.3的CIDEr分数, 性能优于基线方法, 兼具高效性与优异的跨模态生成能力。以上研究体现了一个趋势: 高质量的注意力机制设计、 有效的跨尺度/跨模态特征对齐, 以及大模型蕴含的强泛化先验, 是构建鲁棒异常检测系统的关键要素13

视觉大模型在异常检测中的应用主要基于其强大的特征表示能力和分布外检测潜力。基于Transformer架构的视觉大模型是通过自注意力机制实现全局感受野, 突破了传统卷积网络的局部性限制14。刘势杰等15提出了改进U-Net与跨模态自蒸馏的医学图像融合方法, 通过双分支编码和注意力门机制, 有效提升融合图像的细节保留与跨模态特征表达能力。Guo等16提出了一种结合视觉Transformer与自监督学习的皮肤病分类方法, 在ISIC 2018数据集上AUC、 F1分数等指标显著优于传统CNN模型, 特征空间呈现明显聚类, 训练收敛快、 稳定性高, 并且减少了对大规模标注数据的依赖。Yang等17提出了一种基于Vision Transformer自编码器的无监督工业图像异常检测方法, 通过引入全局上下文建模、 记忆模块和坐标注意力机制, 在MVTec AD和BeanTech AD数据集上图像级准确度平均提升约20%, 显著优于传统卷积编码器。当测试样本与训练分布存在偏差时, 模型会产生不一致的特征响应或注意力模式, 这些信号为异常识别提供了有效依据18。然而, 视觉大模型的巨大参数量和计算需求使其难以在资源受限的边缘设备上部署, 且模型的特征表示可能存在冗余19。因此, 如何有效提取和利用大模型中的异常敏感特征仍需深入研究。

知识蒸馏作为一种有效的模型压缩与迁移学习方法, 已成为实现轻量化少样本异常检测的重要途径20。宋建华等21提出了一种基于结构化知识蒸馏的轻量级伪装目标检测方法, 通过优化软硬标签损失和学习率策略, 提升了蒸馏效果与训练稳定性。王莉莉等22提出了一种基于轻量化ViT的面部疲劳监测算法, 在WiderFace数据集上3个难度等级的平均精度分别达到92.3%、 90.2%和81.3%, 检测速度为每帧68 ms, 兼顾高精度与实时性, 且提升了疲劳检测性能。崔智等23提出了一种基于多教师模型引导知识蒸馏的图像去雾算法, 在SOTS室外数据集上峰值信噪比达23.57 dB、 结构相似度达0.934, 提升了去雾图像的质量, 有效缓解了颜色失真问题。谢奕涛等24提出了面向目标类别的掩码蒸馏方法(MDTC), 在多个图像分类数据集上实现高效知识提取, 40%以上学生模型准确率超越教师模型, 且训练耗时更少。知识迁移主要包括3种形式: 响应知识25、 特征知识26和关系知识27。其中, 特征知识与关系知识能够更全面地传递教师模型的结构化表征能力, 因此在视觉任务中表现出更强的迁移效果28

通过联合优化多类型蒸馏损失, 学生模型能够在参数量大幅减少的情况下仍保持较高的表征能力2930。以自监督预训练模型为教师模型, 将其对正常样本的强判别特征作为监督信号, 借助特征级与关系级对齐损失, 将这种能力压缩至轻量化学生模型。最终, 学生模型可脱离教师模型独立执行高精度异常检测, 并在终端设备上实现检测性能与推理效率的有效平衡31

本研究针对轻量化模型在少样本异常检测中的性能不足问题, 以轻量化视觉Transformer——EfficientViT32为学生模型, 通过从大规模预训练模型蒸馏知识, 得到一种适用于少样本异常检测的高效检测模型。尽管EfficientViT作为一种轻量化视觉Transformer模型在参数规模和计算开销上具有显著优势, 但其在少样本甚至单一样本条件下的异常检测能力有限, 难以有效识别复杂场景中的异常。相比之下, 大规模预训练模型DINOv233在少样本异常检测中展现了优异的特征提取能力, 但其庞大的参数量使其难以在资源受限的场景中直接应用。基于上述内容, 本文的主要工作可分为以下4点:

1) 构建基于DINOv2与EfficientViT的知识蒸馏框架: 针对轻量化模型在少样本异常检测中的性能问题, 设计以冻结的DINOv2为教师模型、 可训练的EfficientViT为学生模型的蒸馏架构。

2) 设计特征对齐适配器用于解决特征不匹配问题: 针对教师与学生模型特征在空间分辨率和通道维度上的差异, 提出包含可学习位置编码、 基于内容的动态聚合机制和线性投影的三阶段适配器, 以实现跨模型特征的精细化空间与通道维度对齐。

3) 提出融合多维度对齐目标的复合损失函数: 设计结合Huber损失、 余弦相似度损失和Gram矩阵损失的复合目标函数, 分别从特征数值、 特征方向和空间关系3个维度约束学生模型, 全面学习教师模型的判别性表征。

4) 开展系统性实验验证该方法有效性: 在MVTec AD标准数据集上, 通过设置单样本和多样本, 全面评估验证本文所提方法的性能表现。消融实验进一步证实特征适配器和复合损失函数对各模块贡献的有效性, 使用可视化分析从定性角度展示方法在异常检测上的优化。

1 实验方法

1.1 少样本异常检测方法框架

少样本异常检测旨在解决工业质检、 医疗影像分析等领域中异常样本稀缺或获取成本高的问题。该任务的核心目标是仅利用极少量正常样本, 使模型能够快速适应新任务, 并对测试样本中的未知异常实现精准识别与定位。

本文提出一种基于预训练特征比对的异常检测方法, 其流程如图 1(a) 所示。该方法的有效性基于两个基本假设: 首先, 在大规模数据集上预训练的神经网络, 其提取的特征具有强大的通用表征能力, 能够捕获图像中与异常相关的判别性信息34; 其次, 在深度特征空间中, 正常样本的特征倾向于聚集在紧凑的子空间内, 形成正常原型, 而异常样本的特征则会因语义或纹理的未知性与多样性而显著偏离该子空间。该类方法包含两个主要步骤:

1) 构建特征内存库

对于特定的检测类别, 该方法首先利用一个或少量正常样本构建一个参考基准, 即将正常样本输入一个固定的预训练特征提取模型, 获取其多层级的深度特征图。这些特征图中蕴含从细微纹理到高级语义的丰富信息。随后, 通过对这些特征进行聚合, 构建一个特征内存库M=m1,m2,,mkmk为特征内存向量。该内存库代表了此类别正常模式在特征空间中的分布, 可作为后续比对的原型字典。

2) 异常检测与定位

在检测阶段, 待测样本经同一个预训练特征提取器, 获得其深度特征图Fq。异常检测的核心是通过计算查询特征与内存库中正常原型的差异实现的。对于Fq上的每一个局部特征向量fq(i,j), 计算其与内存库M中所有原型特征之间的最小距离为

di,j=minmkMfqi,j-mk

该距离d(i,j)可定量反映当前区域特征与正常模式的偏离程度。距离值越大, 该区域属于异常的概率越高。最终, 将所有空间位置的距离值汇总并上采样, 生成一张高分辨率的异常分数热力图, 通过设定阈值可实现像素级的异常区域分割与定位。

1.2 知识蒸馏流程

本文提出了一种基于知识蒸馏的轻量化特征提取器方法, 核心思想是以DINOv2作为教师模型, 从仅包含正常样本的训练集中提取高质量的特征, 并将该表征能力迁移到轻量化学生模型EfficientViT上, 使其兼顾检测性能与推理效率。知识蒸馏框架如图 1(b) 知识蒸馏所示, 训练时, 输入图像被同时送入教师与学生模型的编码路径: 教师模型采用其自身的预处理与编码器直接对原始图像进行特征提取, 学生模型则在其前端采用Overlap PatchEmbed对图像进行重叠分块以保留细粒度信息, 随后通过EfficientViT的若干高效Transformer Block逐层提取特征。

为缩小教师模型与学生模型在表征空间和维度上的差异, 本文引入了特征对齐适配器, 包含跨模态注意力对齐模块和特征空间投影器, 用于将教师特征映射到与学生特征可比较的表示空间, 并进行精细对齐。学生模型的训练目标由多项蒸馏损失共同约束: Huber Loss提升回归鲁棒性, 余弦相似度损失保持特征方向一致性, Gram Matrix Loss刻画并对齐特征分布的高阶统计特性。需要说明的是, 训练数据集中仅含正常样本, 蒸馏过程的目标是使学生模型在仅在正常样本的条件下尽可能复现教师对正常样本的判别性表征, 训练过程中仅更新学生模型参数, 教师模型保持冻结。

1.3 特征适配器

为了将来自学生模型的特征图有效地转换并对齐到教师模型提取特征的表示空间中, 本文设计了一个轻量级的特征对齐适配器模块。如图 2 所示, 该模型包含3个连续的数据变换阶段, 其核心目标是将具有特定空间分辨率和通道维度的输入特征适配为具有目标通道维度且空间信息被有效聚合的表示形式。

该适配器接收形状为[B,3 136,32]的输入特征, 对应于批大小为B, 56×56空间分辨率, 32通道的特征图, 输出形状为[B,1 024,384]的标准化特征表示。该适配器的核心设计包含3个连续的数据变换阶段:

首先, 为保留输入特征的相对空间关系, 引入可学习的位置编码。该过程定义为

X'=X+P,

式中: PR1×3136×32为位置编码参数; X'为通过广播机制与输入特征相加, 得到的空间信息增强的特征表示。

其次, 为实现自适应的空间维度压缩, 本文采用基于内容的动态聚合机制, 适配器在该机制中引入一组可学习的查询向量 QR1×1 024×32, 作为聚合的锚点。对于每个输入样本, 通过复制扩展得到QbRB×1 024×32。聚合过程通过注意力机制实现, 其核心是计算查询向量与所有空间位置间的相关性权重, 并据此进行加权汇总为

A=AttentionQb,X',X'

该操作将高维空间特征压缩至目标维度, 同时根据内容相关性保留最重要的空间上下文信息, 生成紧凑的中间表示A

最后, 通过线性投影完成通道维度的对齐,

Y=AWPT

式中: WpRCout×Cin为投影矩阵, CinCout分别为输入特征维度与输出特征维度, 可将特征从32维映射到目标维度384。该特征对齐适配器通过序列化的位置增强、 内容感知的聚合和线性投影, 实现了跨模态特征在空间和通道维度上的统一表示。输出特征Y可直接作为后续Transformer解码器等模块的输入。

1.4 特征对齐损失函数

为实现学生模型特征与教师模型特征在数值、 方向和空间关系上的全面对齐, 本文设计了一种复合损失函数。该函数通过加权整合3种不同目标的损失, 引导学生模型高效地蒸馏教师模型的知识。

1) 特征值对齐

为确保特征激活值的匹配, 本研究采用Huber损失。该损失函数结合了L1与L2损失的优点: 在误差较小时, 具备L2损失的光滑性, 有利于优化收敛; 在误差较大时, 则表现出L1损失对离群值的鲁棒性。这一特性使其能有效处理特征蒸馏中可能存在的尺度差异与异常激活, 有利于保障训练稳定性。该损失项定义为

Lvalue=1BNi=1Bj=1NLHuberAsi,j-Ti,j,

式中: Lvalue为Huber损失; T为教师特征; As为学生特征; B为训练批次; N为特征总数。Huber函数LHuber的具体形式为

LHuber(x)=0.5x2,        x<1x-0.5,otherwise

2) 特征方向对齐

特征向量的方向一般比其绝对值承载更丰富的语义信息。为约束学生特征与教师特征在高维空间中的朝向一致性, 如图 3 所示, 本文引入余弦相似度损失。该损失通过对特征向量进行L2归一化, 消除幅值差异的影响, 从而专注于学习特征空间中的语义分布模式, 这对于下游任务的语义理解至关重要。其计算公式为

Ldirection=1-1BNi=1Bj=1NAs(i,j)Αs(i,j)2T(i,j)T(i,j)2

式中: Ldirection为Cosine方向损失。

3) 空间关系对齐

为使学生模型不仅学习点对点的特征, 更能模仿教师特征中蕴含的高级空间结构关系, 本文采用基于Gram矩阵的损失。Gram矩阵通过计算特征通道间的内积来表征它们之间的空间相关性, 能够有效捕捉特征的纹理风格信息。最小化Gram矩阵的差异有助于保持特征图整体视觉结构的一致性。该损失定义为

Lrelation=1BD2i=1BGAsi-GTiF2,

式中: Lrelation为Gram关系损失值; D为特征维度; GF=FTFRD×D为特征 F 的Gram矩阵; F为Frobenius范数。

4) 复合损失函数

最终的训练目标由上述3种损失函数加权组合而成,

Lalign=Lvalue+Ldirection+λLrelation

由于LvalueLdirection分别基于逐元素差异和单位向量夹角计算, 具有较好的数值稳定性与尺度一致性, 因此无需额外权重调节。而Lrelation作为Gram矩阵损失, 反映的是特征通道间的二阶统计关系, 其值域较大且对特征激活强度敏感, 若直接加入可能导致训练过程中该项主导优化过程。为此, 式(9)引入可学习或可调的平衡系数λ控制其相对贡献, 确保多维度特征对齐的协同优化。本文通过实验确定权重系数λ=0.5, 该配置能有效平衡不同对齐目标的影响, 且该复合损失函数通过多层次约束, 共同确保了特征对齐的全面性与有效性, 适用于所有物体类别的异常检测。

2 实验结果与分析

2.1 数据集与评估指标

2.1.1 数据集

本研究基于MVTec AD数据集35-36进行验证, 该数据集由工业界领先的机器视觉公司MVTec构建, 是工业异常检测领域的权威基准数据集。数据集中共包含15个不同的工业产品与纹理类别, 图像总数超过5 000张。

本研究严格遵循数据集官方设定的协议, 仅使用各类别的训练集中仅含正常样本进行模型训练。为深入探究所提方法在复杂纹理与结构性缺陷上的检测能力, 本文选取了榛子与木材两个类别作为核心分析案例, 如图 4 所示。该选择基于以下考量: 榛子类别包含了表面纹理变化与微观划痕、 凹陷等挑战, 而木材类别则代表了具有天然不规则纹理背景下的结构性缺陷检测难题。

2.1.2 评估指标

为全面评估本文所提的异常检测方法的性能, 采用以下指标:

1) 图像级准确度(Area Under the Receiver Operating Characteristic Curve, AUROC): 评估模型区分正常与异常图像的整体能力, 值越接近1, 性能越优, 计算为ROC曲线下面积,

AUROCimage=01TPRFPRdFPR,

式中: TPRFPR分别为真阳性率和假阳性率, TPR=TPTP+FNFPR=FPFP+TNTP为异常且被模型正确预测为异常的样本数量, FP为正常但被模型错误预测为异常的样本数量, TN为正常且被模型正确预测为正常的样本数量, FN为异常但被模型错误预测为正常的样本数量。

2) 模型参数量(Parameter)是衡量深度学习模型复杂度的重要指标, 反映了网络中可训练参数的总数, 包括卷积核权重、 偏置项等。参数量越少, 通常意味着模型更轻量化, 所需的存储空间更小, 也更有利于在资源受限的设备上部署。因此, 在保证检测性能的前提下, 较低的参数量是模型设计的一个重要优化目标。

3) 推理速度(Frames Per Second, FPS) 指模型在单位时间内能够处理的图像帧数, 是评估模型推理效率的关键指标。较高的FPS值表明模型具有更快的前向推理速度, 适用于实时性要求较高的工业检测或在线监控场景。

2.2 训练设置

1) 环境配置

本研究所有实验均在统一的硬件与软件环境下进行, 具体配置如表 1 所示。该计算平台为模型训练与评估提供稳定的支持, 可提升实验结果的可靠性与可复现性。

2) 优化器与超参数

采用Adam优化器37-38进行模型训练, 其参数更新遵循

θt+1=θt-ηm^tv^t+ε,

式中: θt+1为第t+1步的模型参数; θt为第t步的模型参数; η为学习率; m^tv^t分别为经过偏差校正后的一阶矩估计与二阶矩估计; ε为防止分母为零的微小常数。

学生模型主干网络的学习率设置为1×10-4, 特征对齐适配器模块因其任务特性采用较高的学习率1×10-3, 以快速适应教师模型的特征分布。训练批大小设置为16, 总共训练150个周期。学习率调度采用步长衰减策略, 每10个周期乘以因子0.5进行衰减。

3) 数据增强策略

为EfficientViT能充分学习到DINOv2的特征提取能力, 并构建一个稳定且具泛化性的训练环境, 训练过程采用了以下数据增强策略:

① 多角度旋转增强: 对输入图像依次进行0°、 90°、 180°及270°旋转, 有效扩充训练数据量, 提升模型对空间变化的鲁棒性;

② 色彩空间转换: 将图像从BGR色彩空间转换至RGB色彩空间, 以适应预训练模型的输入要求;

③ 标准化处理: 使用ImageNet数据集的标准均值和标准差进行归一化处理, 确保输入数据分布的一致性。

2.3 实验结果与分析

为验证本文所提基于知识蒸馏的轻量化异常检测方法的有效性, 在MVTec AD数据集上进行了深入的实验评估与分析。本实验的核心在于评估不同模型作为少样本异常检测的特征提取器的性能, 使用本文方法蒸馏后得到的特征提取模型EfficientViT (本文方法)与教师特征提取模型DINOv2以及未经蒸馏的直接使用的EfficientViT (Baseline)进行了详尽的对比。

2.3.1 定量结果分析

表 2 展示了基于3种不同特征提取网络的单样本异常检测在AUROCParameterFPS上的性能对比。表 2 清晰地反映出不同模型在检测精度与推理效率之间的权衡关系, 为进一步分析蒸馏效果提供了直观支持。

相较于大型教师模型, 该方法在精度有差距但显著提升效率的前提下实现了有效蒸馏。成功地将教师模型DINOv2的部分知识蒸馏到了轻量化的EfficientViT中。

表 2 所示, 在榛子和木材类别上, 本文方法的特征提取模型在图像级检测精度上的AUROC为0.827, 仍低于教师模型DINOv2的0.912, 但显著优于直接使用的Baseline模型的0.655。与此同时, 模型Parameter约为DINOv2的77%, 推理速度是其4倍。这表明本文提出的蒸馏框架在保持较高检测性能的同时, 实现了显著的效率提升。相较于轻量基准模型, 在效率完全相当的前提下实现精度显著提升。与未经蒸馏的EfficientViT(Baseline)相比, 本文所提方法的网络结构未变, 因此, ParameterFPS保持在同一水平, 均为66 M和120 M。但通过本文设计的损失函数与适配器, 特征提取模型EfficientVit(本文方法)在图像级检测精度上的AUROC从0.655提升至0.827。

除单样本异常检测外, 本文还对2、 4、 8和10个样本分别进行了异常检测实验, 实验结果见表 3。同样, 为直观分辨不同样本数量对异常检测结果的性能差异, 将实验结果绘制了折线图(见图 5), 增加数据的可视化。

图 5 可知, 本文的方法在2、 4、 8和10个样本的异常测试性能均优于基线方法。本文方法的单样本的AUROC比基线方法高0.170, 10个样本的AUROC比基线方法高0.164。该多样本的异常检测实验结果证明了本文方法不依赖于特定样本数量的特性。

图 5 的性能曲线可以观察到, 本文方法从1个样本到10个样本实现了0.044的AUROC提升, 而基线方法提升0.050, 两者提升幅度相近, 但本文的方法始终保持在更高的性能水平。这种表现说明本文方法在样本增加时能够保持相对优势。图 5 清晰展示了3条性能曲线的对比关系: 本文的方法曲线始终位于基线上方, 且由于模型的轻量化使其和教师模型始终有差距, 但是该差距保持稳定。该结果说明了本文方法在任何样本数量下都优于基线, 同时在与高性能教师模型的比较中展现了良好的性能接近度。

2.3.2 消融实验

为了验证本文所提各模块的必要性, 在榛子、 木材、 皮革类别上分别开展了基于单样本学习的异常检测消融实验, 以AUROC为性能指标, 结果如表 4图 6 所示。

初始Baseline采用未经蒸馏的EfficientViT作为学生模型, 在木材、 皮革和榛子3类数据上的AUROC分别为0.652、 0.647和0.661, 表明轻量级网络难以有效捕捉复杂纹理中的异常数据。引入Huber损失后模型的AUROC略有提升, 分别达到0.665、 0.663和0.681, 说明Huber损失有助于稳定训练并缓解梯度震荡。

进一步加入余弦相似性损失(Cosine Loss)后, 模型性能显著提升, 在木材、 皮革和榛子3类数据上的AUROC分别达到0.718、 0.731和0.724。该结果表明, 通过增强特征结构对齐, 可更有效地迁移语义信息, 提升对细微差异的鲁棒性。然后, 再引入Gram矩阵损失, 其捕捉特征中的二阶统计特性, 此时模型在这3类数据的AUROC进一步提升至0.782、 0.767和0.773。该损失在方向性明显的纹理上表现突出, 有助于建模长程依赖和区分真实缺陷。

最终, 模型中加入可学习的Feature Adapter, 实现动态特征变换, 整体性能达到最优, 3类数据的AUROC分别为0.826、 0.818和0.834。说明该模块能有效缓解容量差异, 实现更高效的语义知识迁移。

2.3.3 可视化分析

图 7图 8 所示, 本文方法生成的连续值异常热力图, 未经过阈值二值化, 与真实异常区域的空间分布高度吻合, 其对齐程度优于Baseline特征的结果, 且与基于DINOv2教师网络的热力图效果非常接近。特别地, 图 7图 8 中距离分布直方图取所有特征距离中前1%为阈值, 用于凸显高异常响应区域的统计特性, 避免正常背景噪声主导整体分布。

这从视觉层面直接印证了经过知识蒸馏后, 轻量化的EfficientViT网络能够提取出与大型教师模型质量相当、 且显著优于其原始状态的判别性特征。

3 结 论

本文提出了一种基于知识蒸馏的轻量化异常检测方法, 旨在将大规模视觉模型DINOv2强大的表征能力高效地迁移至轻量级网络EfficientViT中, 以实现在资源受限场景下的高性能异常检测。通过在MVTec AD数据集的挑战性类别上进行实验, 验证了所提方法的有效性。

实验结果表明, 相较于庞大的教师模型, 本文方法在仅牺牲少量检测精度的情况下, 实现了显著的效率提升, 模型参数量降至教师模型的约77%, 推理速度提升至其4倍; 相较于未经蒸馏的轻量基准模型, 在模型结构与计算效率完全不变的前提下, 将检测性能提升了26%。消融实验进一步证实了设计的多目标损失函数与可学习的特征适配器模块均为性能提升做出了关键性贡献, 以及从不同维度有效地约束和增强了学生模型的特征学习能力。可视化分析表明, 蒸馏后的学生模型所产生的异常定位热力图与教师模型效果高度接近, 优于基线模型, 验证了其生成特征的高质量。

本文工作为在边缘计算等资源受限环境中部署高效、 准确的工业异常检测系统提供了一种有效的解决方案。

参考文献

[1]

Hojjati HHo T K KArmanfard N. Self-supervised anomaly detection in computer vision and beyond: a survey and outlook[J]. Neural Networks2024172: 106106.

[2]

解琳, 韩跃平, 翟倩, . 基于改进YOLOv7-tiny的PCB表面缺陷检测[J]. 测试技术学报202539(1): 81-87.

[3]

Xie LinHan YuepingZhai Qianet al. PCB surface defect detection based on improved YOLOv7-tiny[J]. Journal of Test and Measurement Technology202539(1): 81-87. (in Chinese)

[4]

Ren CLiu D. Anomaly detection and segmentation based on multi-student teacher network[J]. Journal of Measurement Science and Instrumentation202213(2): 235-241.

[5]

李石峰, 罗晰, 刘晓茹, . 基于Transformer架构的端到端视频异常检测方法[J]. 计算机技术与发展202535(6): 49-55.

[6]

Li ShifengLuo XiLiu Xiaoruet al. An end-to-end video anomaly detection method based on transformer architecture[J]. Computer Technology and Development202535(6): 49-55. (in Chinese)

[7]

Zhang XXu MQiu Det al. MediCLIP: adapting CLIP for few-shot medical image anomaly detection[C]//Medical Image Computing and Computer Assisted Intervention–MICCAI 2024. Cham: Springer, 2024: 458-468.

[8]

杨维荣. 基于智能边缘计算的网络安全防护与威胁检测分析[J]. 电子技术202453(10): 256-257.

[9]

Yang Weirong. Analysis of network security protection and threat detection based on intelligent edge computing[J]. Electronic Technology202453(10): 256-257. (in Chinese)

[10]

郭新茹, 宋丽娟, 朱文倩, . 面向低样本的工业图像异常检测综述[J]. 计算机工程与应用202561(13): 26-45.

[11]

Guo XinruSong LijuanZhu Wenqianet al. Review of low-shot industrial image anomaly detection[J]. Computer Engineering and Applications202561(13): 26-45. (in Chinese)

[12]

Han KWang YChen Het al. A survey on vision transformer[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence202345(1): 87-110.

[13]

邹琦萍, 李博涛, 陈赛安, . 基于多层级视频Transformer的视觉自动定位方法[J]. 工程科学与技术202456(6): 34-43.

[14]

Zou QipingLi BotaoChen Saianet al. Visual automatic localization method based on multi-level video transformer[J]. Advanced Engineering Sciences202456(6): 34-43. (in Chinese)

[15]

薛振华, 李强, 黄超. 视觉基础模型驱动的像素级图像异常检测方法[J]. 计算机应用202545(3): 823-831.

[16]

Xue ZhenhuaLi QiangHuang Chao. Vision foundation model-driven pixel-level image anomaly detection method[J]. Journal of Computer Applications202545(3): 823-831. (in Chinese)

[17]

Zhu LWang XKe Zet al. BiFormer: vision transformer with bi-level routing attention[C]//2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2023: 10323-10333.

[18]

金泽辉, 陈凯, 唐敦兵, . 基于改进Transformer的视觉语言模型[J/OL]. 北京航空航天大学学报, 2025-03-19.

[19]

Jin ZehuiChen KaiTang Dunbinget al. Visual language model based on improved transformer[J/OL]. Journal of Beijing University of Aeronautics and Astronautics, 2025-03-19. in Chinese)

[20]

Kaplan JMc Candlish SHenighan Tet al. Scaling laws for neural language models[PP/OL]. arXiv(2020-01-23)[2025-12-11].

[21]

Khan ARauf ZSohail Aet al. A survey of the vision transformers and their CNN-transformer based variants[J]. Artificial Intelligence Review202356(3): 2917-2970.

[22]

刘势杰, 王丽芳, 郁晓庆. 基于改进U-Net和跨模态自蒸馏的医学图像融合[J]. 测试技术学报202438(6): 686-694.

[23]

Liu ShijieWang LifangYu Xiaoqing. Medical image fusion based on improved U-Net and cross-modal self-distillation[J]. Journal of Test and Measurement Technology202438(6): 686-694. (in Chinese)

[24]

Guo FWu XZhang Let al. A self-supervised vision transformer approach for dermatological image analysis[EB/OL]. [2025-12-11].

[25]

Yang QGuo RYang Qet al. An unsupervised method for industrial image anomaly detection with vision transformer-based autoencoder[J]. Sensors202424(8): 2440.

[26]

Iqbal EKhan S UJaved Set al. Multi-scale feature reconstruction network for industrial anomaly detection[J]. Knowledge-Based Systems2024305: 112650.

[27]

张玉博, 杨帆, 郭亚, . 基于视觉大模型的垃圾分类轻量化算法研究[J]. 计算机工程202551(7): 140-151.

[28]

Zhang YuboYang FanGuo Yaet al. Research on lightweight algorithm for garbage classification based on visual large model[J]. Computer Engineering202551(7): 140-151. (in Chinese)

[29]

李通, 羊红光, 刘康, . 大模型知识蒸馏方法研究进展[J]. 河北省科学院学报202542(2): 94-96.

[30]

Li TongYang HongguangLiu Kanget al. Knowledge distillation methods for large models: a research review[J]. Journal of the Hebei Academy of Sciences202542(2): 94-96. (in Chinese)

[31]

宋建华, 刘淳, 张龑. 基于结构化知识蒸馏的轻量级伪装目标检测模型[J]. 计算机科学202653(4): 299-307.

[32]

Song JianhuaLiu ChunZhang Yan. Lightweight camouflaged object detection model based on structured knowledge distillation[J]. Computer Science202653(4): 299-307. (in Chinese)

[33]

王莉莉, 殷硕峰, 马也. 基于轻量化VIT的面部疲劳监测算法研究[J]. 计算机仿真202542(1): 317-322.

[34]

Wang LiliYin ShuofengMa Ye. Research on facial fatigue monitoring algorithm based on lightweight VIT[J]. Computer Simulation202542(1): 317-322. (in Chinese)

[35]

崔智高, 兰云伟, 王念, . 基于多教师引导的知识蒸馏图像去雾算法[J]. 火箭军工程大学学报2024(5): 35-43.

[36]

Cui ZhigaoLan YunweiWang Nianet al. An image dehazing algorithm based on multi-teacher guided knowledge distillation[J]. Journal of Rocket Force University of Engineering2024(5): 35-43. (in Chinese)

[37]

谢奕涛, 苏鹭梅, 杨帆, . 面向目标类别分类的无数据知识蒸馏方法[J]. 中国图象图形学报202429(11): 3401-3416.

[38]

Xie YitaoSu LumeiYang Fanet al. Data-free knowledge distillation for target class classification[J]. Journal of Image and Graphics202429(11): 3401-3416. (in Chinese)

[39]

Song LGong XZhou Het al. Exploring the knowledge transferred by response-based teacher-student distillation[C]//Proceedings of the 31st ACM International Conference on Multimedia, 2023: 2704-2713.

[40]

Yang ZLi ZZeng Aet al. ViTKD: feature-based knowledge distillation for vision transformers[C]//2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2024: 1379-1388.

[41]

Sun SRen WLi Jet al. Logit standardization in knowledge distillation[C]//2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2024: 15731-15740.

[42]

Yang CYu XAn Zet al. Categories of response-based, feature-based, and relation-based knowledge distillation[M]//Advancements in Knowledge Distillation: Towards New Horizons of Intelligent Systems. Cham: Springer International Publishing, 2023: 1-32.

[43]

王改华, 李柯鸿, 龙潜, . 基于知识蒸馏的轻量化Transformer目标检测[J]. 系统仿真学报202436(11): 2517-2527.

[44]

Wang GaihuaLi KehongLong Qianet al. Object detection of lightweight transformer based on knowledge distillation [J]. Journal of System Simulation202436(11): 2517-2527. (in Chinese)

[45]

杨文茵, 黄蔼权, 谭振林, . 融合相似交叉熵和知识蒸馏的人脸年龄估计方法[J]. 计算机技术与发展202535(4): 113-120.

[46]

Yang WenyinHuang AiquanTan Zhenlinet al. Age estimation of face images by fusing similarity cross entropy and knowledge distillation[J]. Computer Technology and Development202535(4): 113-120. (in Chinese)

[47]

钟锐, 王晨, 宋亚锋, . 基于样本均衡蒸馏的少样本人脸识别方法[J]. 计算机工程与设计202445(11): 3457-3462.

[48]

Zhong RuiWang ChenSong Yafenget al. Face recognition method with few samples based on sample balance distillation[J]. Computer Engineering and Design202445(11): 3457-3462. (in Chinese)

[49]

Liu XPeng HZheng Net al. EfficientViT: memory efficient vision transformer with cascaded group attention[C]//2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2023: 14420-14430.

[50]

Oquab MDarcet TMoutakanni Tet al. Dinov2: learning robust visual features without supervision[PP/OL]. arXiv(2023-04-14)[2025-12-11].

[51]

Damm SLaszkiewicz MLederer Jet al. Anomaly DINO: boosting patch-based few-shot anomaly detection with DINOv2[C]//2025 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2025: 1319-1329.

[52]

Bergmann PBatzner KFauser Met al. The MVTec anomaly detection dataset: a comprehensive real-world dataset for unsupervised anomaly detection[J]. International Journal of Computer Vision2021129(4): 1038-1059.

[53]

Bergmann PFauser MSattlegger Det al. MVTec AD: a comprehensive real-world dataset for unsupervised anomaly detection[C]//2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2019: 9584-9592.

[54]

闫佳乐. 基于EIS的退役锂离子电池SOH估计研究[D]. 合肥: 合肥学院, 2023: 22.

[55]

Yan Jiale. Research on State of health estimation of retired lithium-ion batteries based on EIS[D]. Hefei: Hefei University, 2023: 22. (in Chinese)

[56]

陈万强, 陆永华, 朱赟, . 基于深度学习图像配准的燃调表面缺陷检测算法[J]. 测试技术学报202438(6): 586-592.

[57]

Chen WanqiangLu YonghuaZhu Yunet al. Research on surface defect detection algorithm of fuel pump regulator based on deep learning image registration[J]. Journal of Test and Measurement Technology202438(6): 586-592. (in Chinese)

基金资助

国家自然科学基金资助项目(62203404)

AI Summary AI Mindmap
PDF (4138KB)

18

访问

0

被引

详细

导航
相关文章

AI思维导图

/