基于改进YOLOv8n模型的芯片点胶检测算法

潘安理 ,  范涛 ,  侯世维 ,  黄璞 ,  黄勃

武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (4) : 549 -559.

PDF (4594KB)
武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (4) : 549 -559. DOI: 10.14188/j.1671-8836.2024.0155
面向知识图谱和大模型的工业软件

基于改进YOLOv8n模型的芯片点胶检测算法

作者信息 +

Chip Dispensing Detection Algorithm Based on Improved YOLOv8n Model

Author information +
文章历史 +
PDF (4703K)

摘要

针对芯片点胶运动状态下外观不良检测中存在速度慢、精度低和推理能力不足问题,对原始YOLOv8n模型进行了改进;基于改进的YOLOv8n,提出一种融合知识图谱和改进YOLOv8n的检测算法SPA-KG(Self-Position Attention-Knowledge Graph)。对YOLOv8n的改进表现在:在坐标注意力(Coordinate Attention,CA)的基础上设计SPA注意力,SPA注意力能够更充分地学习小目标的细节信息;在主干网络与特征融合网络中分别引入轻量化卷积模块GHOSTConv与AKConv(Adaptive Kernel Convolution),并且使用SIMSPPF(Simplified Spatial Pyramid Pooling-Fast)改进空间金字塔池化,降低模型的参数量,提升检测速度,结合α-IoU与EIoU设计α-EIoU损失函数,提高算法的定位能力与识别精度。实验结果表明,SPA-KG的平均精度均值达到96.7%,精确率达到94.2%,召回率达到94.0%,参数量达到2.58×106,检测速度达到107.7帧/s。本文提出的SPA-KG达到了工业检测需求。

Abstract

To address the problems of slow speed, low accuracy, and insufficient inference ability in the detection of bad appearance under chip dispensing motion, the original YOLOv8n model was improved. Based on the improved YOLOv8n, a detection algorithm called Self-Position Attention-Knowledge Graph (SPA-KG), which fuses knowledge graphs and improves YOLOv8n, was proposed. First, SPA attention is designed based on coordinate attention (CA), and SPA attention can learn detailed information about small targets more fully. Second, lightweight convolution modules GHOSTConv and Adaptive Kernel Convolution (AKConv) were introduced into the backbone network and feature fusion networks, respectively, and spatial pyramid pooling was improved by using Simplified Spatial Pyramid Pooling-Fast (SIMSPPF). The number of parameters in the model was reduced to improve the detection speed, and the α-EIoU loss function was design by combining the α-IoU and EIoU to improve the localization ability and recognition accuracy of the algorithm. The experimental results showed that the average precision of the SPA-KG reached 96.7%, the precision rate reached 94.2%, and the recall rate reached 94.0%. The number of parameters reached 2.58×106, and the detection speed reached 107.7 frames/s. SPA-KG meets the industrial detection requirements.

Graphical abstract

关键词

外观检测 / 知识图谱 / YOLOv8n / 注意力机制 / 机器视觉

Key words

appearance inspection / knowledge graph / YOLOv8n / attention mechanism / machine vision

引用本文

引用格式 ▾
潘安理,范涛,侯世维,黄璞,黄勃. 基于改进YOLOv8n模型的芯片点胶检测算法[J]. 武汉大学学报(理学版), 2025, 71(4): 549-559 DOI:10.14188/j.1671-8836.2024.0155

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

芯片是工业产品的重要零部件,广泛应用在智能产品中,如手机、空调、机器人、电动汽车等领域。在芯片的生产过程中需要进行点胶,点胶的过程中常伴随着外观不良的产生,外观不良的种类主要包括撕裂、漏点胶、刮痕、凹坑。目前的检测方法主要是利用机器学习的技术检测目标,可分为两种,一是传统检测算法,这种方法使用图像处理技术,在复杂的工厂生产车间,线速、光照强度以及非目标图像等因素都会对结果产生较大影响,泛用性和鲁棒性较差;二是深度学习算法,它有强大的学习能力,提高了目标检测的准确性。自从R-CNN[1-4](Region-based Convolutional Neural Networks)提出以后,不少学者与研究人员在目标检测过程中使用深度学习算法,与传统检测算法相比,效果更好。

深度学习目标检测算法可分为单阶段和双阶段目标检测算法两种,单阶段算法是基于回归问题,不生成候选框,使用回归计算方法计算目标区域的具体位置,然后判断对应目标的种类信息及位置信息,单阶段目标检测算法的代表有SSD(Single Shot Detector)[5]网络、YOLO[6-9]系列模型。双阶段的目标检测算法主要基于候选区,在处理过程中,先去除候选框中的冗余信息,再进行回归,从而得到结果,算法模型有SPP-NET[10],R-CNN等。单阶段目标检测速度更快,双阶段目标检测定位精度更高,准确率更高。考虑到芯片点胶检测的实时性需求,轻量级的YOLOv8系列算法成为首选。在YOLOv8提供的N(Nano,超轻量版),S(Small,轻量版),M(Medium,中量版),L(Large,大量版),X(Extra Large,超大量版)等不同尺度模型中,本文选择参数量仅3.2×106、浮点运算数为8.7×109的YOLOv8n[11]作为目标识别的基础算法。尽管YOLOv8n算法实时性强,但其对小目标(如微裂纹、漏点)的检测能力仍有待提升,因此本文改进了YOLOv8n算法。本文的改进主要体现在以下4方面:

1) 针对小目标难检测的问题,将坐标注意力(Coordinate Attention, CA)与多头自注意力机制(Multi-Head Self-Attention,MHSA)融合设计了一种新的注意力机制SPA。

2) 为降低预测计算引起的复杂度,在主干网络中引入轻量化卷积GHOSTConv。为了扩大采集区域,改变采集图形的形状,在特征融合网络中引入AKConv模块,该模块具有各种采样形状和不同数量的参数。

3) 由于SIMSPPF可以保留更多的特征信息,在降低模型参数量的同时提高检测精度,本文在主干网络中使用SIMSPPF。

4) 为有效计算边界框重叠程度、大小及位置,对损失函数进行改进,在α-IoU基础上引入EIoU构成α-EIoU。这一改进加快了模型收敛速度。

此外,目前检测模型仅使用图像本身的特征,忽视了信息世界的相互关系。造成这种现象的原因主要是未充分利用先验知识对信息进行判断。为了提升模型推理能力,本文使用ConcepNet[12-14]知识库构建知识图谱,将知识图谱和改进YOLOv8n模型进行融合,设计了SPA-KG检测算法,以提高检测的性能。

1  YOLOv8n简介

YOLOv8是2023年所发布的YOLO系列目标检测模型,是YOLOv5的后继版本。

YOLOv8包含了N、S、M、L、X等尺度模型[15-16],具有良好的可扩展性,因此深受广大相关科研人员喜爱,并应用到不同的领域,其结构包括输入端、主干网络、特征网络和检测头。YOLOv8n具有参数量小、计算速度快的优点,结构如图1所示。在主干网络中,YOLOv8n使用最新的C2f结构替代了YOLOv5中的C3结构,C2f具有更多的梯度流,实现了轻量化的目标。相较于YOLOv5,YOLOv8n的检测头也进行了很大调整,使用解耦结构,并且摒弃了以往的Anchor的(Anchor-Based)检测方式[17-19],改用Anchor-Free[20-22]检测方式。YOLOv8n模型与YOLOv5等之前版本比较,相同图像分辨率,吞吐率更高。

2  改进YOLOv8n算法

YOLOv8n对小目标检测精度低,在复杂场景下的推理能力相对不足,所以本文对YOLOv8n进行了改进,改进后的YOLOv8n如图2所示。

2.1 SPA注意力机制

YOLO系列算法实现目标检测任务的方式主要是通过提取各种尺度的特征图,针对尺寸不同的目标检测使用不同的尺度,例如,使用20×20、40×40、80×80尺度实现小、中、大三种不同尺寸的特征提取。相较于大目标,小目标的像素信息更少,在提取特征的过程中特征图显得稀疏,信息有缺失。另外,小目标与其他图像中的信息相似度高,易造成程序错误判断,所以本文设计了注意力机制SPA。

SPA是将坐标注意力机制与多头自注意力(MHSA)[23]组合而成的,其结构如图3所示。为了对精准位置信息进行编码以及获取图像高度(H)和宽度(W)上的注意力,首先,SPA在对特征图进行全局平均池化时,将其分为X Avg pool和Y Avg pool两个不同方向;接下来,将具有全局视野的两个方向特征图进行拼接,将它们传至共享的卷积模块,将维度降至原来的C/rC:通道数,r是压缩比例);之后,将经过处理后的特征图传入Sigmoid激活函数[24],获得像1×(W+HC/r一样的特征图;然后,将特征图按原始尺寸进行卷积,使获得的特征图和原始图通道数一致;再使用Sigmoid函数对特征图像进行处理,获得注意力权重。通过以上操作,获取高度和宽度两个分量信息,在原始特征图上经过数学平均计算,得到分别包含宽度和高度两个方向注意力权重的最新特征图。

SPA将原始特征向量转为一维向量,再将通道进行压缩,经过连接和一系列计算操作后,对其在空间层面进行分解并进行特征向量堆叠。这样的方法可以增强感兴趣目标的表示,从而提高模型的性能。

2.2 GHOSTConv

为降低模型的复杂度,提高模型性能,本文使用轻量化卷积GHOSTConv[25],对输入数据进行 shuffle处理之后,将深度可分离卷积运算和密集卷积运算生成的信息融合。GHOSTConv通过进行全局稀疏卷积,限定各个位置的稀疏性并将其加入到特征图上,实现全局信息的高效聚合,与普通卷积相比,GHOSTConv尽可能多地保留了信息,利用了全局稀疏性,只对稀疏位置进行卷积,降低了参数量和计算量。堆叠卷积层能够获得丰富的特征信息,但其中也包含了一些多余信息。一定程度上,这些看似多余的信息有助于模型更全面地理解数据。所以,本文可以通过常规卷积操作获取丰富的特征信息,再利用较为简单且成本低的线性变换操作获取冗余特征信息。这种方式既能降低模型计算所需的资源,设计也相对简单,又易于实现。

GHOSTConv先使用少量的卷积核提取输入特征图的特征,然后再对这些特征图进行线性变换计算,最终通过Concatenation(拼接操作)生成特征图。通过这种方法降低了非关键特征的学习成本,不仅降低了对资源的需求,而且不影响模型性能。

2.3 AKConv模块

AKConv卷积核自由地获取参数,包括任意形状和数量,并且可以控制参数数量的高低。利用AKConv可以控制参数数量的特性,用3×3的卷积核替代原方案可以降低参数数量。标准卷积有其缺点:一是采样的形状是固定的,而且只能采样局部窗口,获取的信息较少;二是卷积核形状固定为正方形,随着待检测目标数量或复杂度的增加,卷积核只能通过增大正方形边长的方式来适应。对于不同的采样目标,固定的正方形卷积核很难适应,所以适当地调整卷积核的形状有利于算法对目标的捕捉。AKConv的卷积可以变形,采样数据和采样的形状可以适时地进行调整[26]。AKConv改变了以往固定采样方式,卷积操作可以获得不同位置,不同大小,不同形状的目标。由于目标的形状不同,AKConv通过改变卷积核获取参数的位置,从而提升对目标检测的精准度。AKConv线性改变参数量的大小,这种特性在硬件环境适配方面具有优势,较小卷积核可以轻量化算法,大卷积核利于提高算法性能。深度学习中常用的规则采样网络,采样网络的计算方法如(1)式所示,其中M是采样网络。

M=-1,-1,-1,0,,0,1,1,1

AKConv的采样网络与传统的网络不同,AKConv设计采样坐标的算法生成卷积核Tn。不规则的目标难以捕捉其中心点,所以设置(0,0)为采样原点用来适应卷积的大小。定义T0卷积运算如下:

ConvT0=ω x (T0+Tn)

其中,ω为卷积参数。通过相应的操作,对于不同采样坐标AKConv都可以使其匹配相应的卷积。AKConv通过卷积运算得到卷积核偏离量,根据偏移量决定采样形状,依据新的采样形状对特征图再次采样;然后将特征图经过一系列的计算输出最终结果。重采样后的采样形状都和原来的采样形状不同,AKConv可以调整计算方式,提升了算法的性能。

2.4 SIMSPPF

为了提升小目标的检测精度,本文引入SIMSPPF模块[27],结构如图4所示。SIMSPPF是一种空间金字塔池化方法,与SPPF(Spatial Pyramid Pooling Fast)相比有较高的推理速度。SIMSPPF使用的激活函数是ReLU(Rectified Linear Unit),而SPPF则使用的激活函数是SiLu。ReLU函数在输入值是正数时保持原值,而在输入值是负数时输出零,这种特性使得网络在训练中可以更快地收敛。SIMSPPF空间金字塔池化主要侧重于对空间信息的处理,首先将输入的特征图划分为大小不同的区域,然后分别将每个区域进行池化,最终将池化结果拼接后输出。SIMSPPF使得网络可以处理各种尺寸大小的图片,融合了输入的全局特征以及局部特征,提升了网络的感受野。这些特点使得SIMSPPF在处理小目标时能够更好地提取特征,有效提升了小目标的检测精度。

2.5 设计损失函数α-EIoU

为了更加精确地获得检测目标边界框重叠的范围,并计算边界框的位置和大小,本文在损失函数Lα-IoU基础上加入LEIoU,设计了损失函数Lα-EIoULα-EIoU不仅对目标定位情况的评估更加准确,而且对目标位置特殊情况的检测效果也有所改善[28]。此外,梯度更新也更加稳定,尤其在处理小目标时,有效降低了训练过程中出现的不稳定性问题。Lα-EIoU通过计算边界框的重叠程度和位置误差,使模型能更充分地获取对象特征,进而显著提升了模型的泛化能力和鲁棒性[29]Lα-EIoU计算如下:

Lα-EIoU=

iN(λ1jBi(LEIoUj+Lboxj)+λ2jSi×SjLobjj+λ3jSi×SjLclsj)

其中,N表示检测层数量;Bi 是先验框个数;Si ×Sj 是相应检测层分割网格数;λ1,λ2,λ3是权重;Lobj是目标损失函数;Lcls是分类损失函数;Lbox是边界框损失函数,计算公式如下:

Lbox=IOU-Distance2DistanceC2-V2I-IOU+VV=4π(arctanWgthgt-arctanwphp)

(4)式中,Wgthgt是真实宽高比,wphp是预测宽高比,IOU是重叠面积,Distance²反映了两个框中心点的绝对距离,DistanceC²反映了两个框的整体分布范围。

LEIoU由三部分构成,分别是重复度LIOU、中心距离Ldis以及高和宽Lasp损失。计算高和宽的损失使得锚框和目标框之间的差距尽可能小,在提高精度的同时也让收敛速度加快[30]LEIoU公式如下:

LEIoU=LIOU+Ldis+Lasp=1-IOU+ρ2(b,bgt)c2+ρ2(w,wgt)cw2+ρ2(h,hgt)ch2

其中,ρ(b,bgt)表示预测框中心点b和真实框中心点bgt之间的欧氏距离,c是同时包含预测框和真实框的最小外接矩形的对角线长度,ρ(w,wgt)ρ(h,hgt)分别表示预测框和真实框在宽度和高度上的绝对差值,cwch分别是最小外接矩形在宽度和高度方向上的最大可能差值。

3  改进YOLOv8n与知识图谱融合

3.1 构建知识图谱模块

随着人工智能和自然语言处理技术的飞速发展,科研人员和相关工作者建立了各种大规模知识库,包括Cyc、WordNet和ConceptNet。Cyc知识库由术语和断言组成,采用形式化的方法表示知识,WordNet定义了不同词性之间的相互关系,ConceptNet是一个足够大的免费知识库,重点关注自然语言词语的意义。鉴于此,本文使用ConceptNet建立知识图谱,知识图谱的结构如图5所示。在建立知识图谱的过程中需要将所有的信息进行数据处理,使其CSV文件中的信息是三元结构,可以描述类别之间的关系,语义相似程度较高的信息出现在同一张图像上的概率更大,以此提高算法模型的性能。

3.2 改进后的YOLOv8n与知识图谱融合

为了使模型更全面地捕获网络中的信息,提升网络的表征能力,本文将改进后YOLOv8n与知识图谱相融合,构建了SPA-KG目标检测模型,其结构如图6所示。SPA-KG首先通过目标识别算法获得原始分类权重,将分类权重进行卷积得到高级语义池,然后高级语义池和知识图谱进行融合,进而丰富图像特征信息,最终将特征传递至预测层进行预测。

通过本文提出的注意力机制Xx̃对特征重新校准,特征图通过压缩操作生成1×1×C信道,然后进行激活操作,控制每个信道的操作过程,最后对特征图X进行重新加权获得特征图x̃,并将此特征图融入后面主干网络中。卷积核提取X不同信道信号特征的方法如下式:

uC=vC*X=s=1CvCS*Xs

其中,第C个卷积核是vCU=u1,u2,,uCV=v1,v2,,vC,*是卷积操作,vCS表示2D卷积核。通过压缩空间维度H×W生成特征信息zzc 是第c个通道信息,计算方法如下式:

zc=Fsquc=1H x Wi=1Hj=1Wuc(i,j)

其中,sq表示压缩。激活函数使用sigmoid机制进行激活,计算公式如下:

S=Fexz,W=σsigmoidW2σReLUW1z

其中,σReLU为ReLU函数,W1是降维层,W2是增维层。

3.3 点胶检测算法流程

基于上述算法优化思路,构建了一套系统化的点胶检测算法流程(如图7)。首先,收集各类外观不良的点胶产品,依据缺陷特征进行分类,确保样本的多样性与代表性。随后,对收集到的不良产品使用LabelImg进行标记处理。将样本分为训练集、验证集与测试集。训练集用于模型参数的学习与优化,验证集辅助调整超参数、防止过拟合,测试集则用于评估模型的最终性能。接着,运用改进后的算法模型,对训练集数据进行多轮迭代训练。在训练过程中,实时监控损失函数与准确率等指标,通过调整不同改进方案,逐步获取高精度的训练模型。完成训练后,分别使用验证集与测试集对模型进行全面评估。验证阶段着重优化模型的泛化能力,测试阶段则模拟真实场景,检验模型在复杂环境下的检测效果。当模型通过严格测试,各项指标达到预期标准后,即可部署上线,实现对点胶生产过程的实时自动化检测,为产品质量把控提供可靠保障。

4  实验结果与分析

4.1 数据集

在工厂生产线运行的过程中,通过人工检测的方式,共收集到482个不良产品。随后,对这些不良产品的外观缺陷进行分类,主要涵盖划痕、凹坑、撕裂和缺胶等类型。点胶外观不良如图8所示。采用海康工业相机(MV-CA050-10GC)进行数据采集工作,相机固定在铝合金相机支架上,如图9所示。开启传送带,外观不良胶片随传送带移动,同时适时调整胶片位置,相机对其持续拍摄以收集图片。拍摄的数据集包含单目标、多个相同目标、多种不同目标混合等情况。采集图片共计1 532张,使用数据增强将图片翻转、平移、裁剪,得到数据集2 750张。在完成数据采集工作后,接下来对所收集的数据进行进一步处理,用LabelImg对所有点胶外观不良图片进行标注,包括不良类型和位置。最后按照8∶1∶1分为训练集、验证集、测试集,并将数据和ConceptNet数据集进行融合得到新的数据集。

4.2 实验环境

本文实验环境:Windows10操作系统;CPU为Intel Core i7-13700;32 GB运行内存;GPU为 NVIDIA RTX 4070;使用PyTorch作为深度学习框架;使用CUDA11.8进行加速计算。epoch(训练轮数)设置为200,其他参数设置使用默认设置。

4.3 评价指标

本文实验用准确率(A)、精确率(P)、召回率(R)与平均精度均值(mAP)等评估模型算法性能[31]。计算公式如下:

A=TP+TNTP+FP+TN+FN×100%
P=TPTP+FP×100%
R=TPFP+FN×100%
mAP=(1Ni=1NAPi)×100%

其中,TP(True Positive)表示实际为正例且被正确预测为正例的样本数量,TN(True Negative)表示实际为负例且被正确预测为负例的样本数量,FP(False Positive)表示实际为负例但被错误预测为正例的样本数量,FN(False Negative)表示实际为正例但被错误预测为负例的样本数量。

4.4 不同亮度各模型对比

亮度为400 lx时,将SPA-KG与不同检测模型进行对比实验。如表1所示,本文算法平均精度均值达到96.7%,精确率为94.2%,召回率为94.0%。模型参数量和浮点运算数(FLOPs)分别比YOLOv8n低0.62×106和0.69×109,检测速度比改进前的YOLOv8n提高了23.2帧/s,检测速度达到工业检测要求。结果表明SPA-KG不仅优化了检测精度,同时轻量化了检测模型,节约了运算资源,提升了计算速度。

考虑到生产车间不同位置亮度不同,改变实验环境的亮度,将亮度从400 lx降低到300 lx后再次进行实验(表1)。结果显示,在环境较暗时SPA-KG模型mAP、PR分别下降0.5、0.8、0.5个百分点,说明SPA-KG算法模型受光线影响,所以在生产检测的过程中为了提高检测效率,需要保证光线亮度。尽管如此,相对其他检测模型,本文模型还是保持了一定优势。

4.5 消融实验

消融试验结果如表2。通过消融试验发现,各改进策略对模型性能影响不同,部分组合实现综合提升。

在精确率P指标上,引入GHOSTConv+AKconv、SIMSPPF和Lα-EIoU后,P都有提升。这是因为轻量化卷积优化运算流程,SIMSPPF有效融合特征,Lα-EIoU合理优化边界框回归,三者均增强了模型对目标的准确识别能力。多方案组合时,协同效应进一步提升精确率,如同时引入SPA注意力、轻量化卷积与SIMSPPF后,P提升2.9个百分点。

mAP和R在部分方案下有所降低。加入SPA注意力后,mAP和R分别降低0.5和2.5个百分点;引入Lα-EIoU后,mAP和R分别下降0.2和1.6个百分点。这或是因SPA注意力干扰了原有特征提取,而Lα-EIoU在优化精确检测时牺牲了部分召回能力。

在效率方面,改进后模型参数量从3.43×106降至2.58×106,FLOPs从9.36×109降至8.01×109,检测速度从79.8帧/s提升至107.7帧/s。轻量化组件的应用大幅减少计算复杂度,显著提升了模型推理速度。

4.6 鲁棒性检测

使用测试集进行实验,检测结果如表3所示。结果显示,改进后的模型的mAP、PR与YOLOv8n模型相比,分别提升了1.6,2.6,2.8个百分点。检测速度相较于YOLOv8n也提升22.2帧/s。

4.7 不同型号胶片实验对比

为了评估模型在不同点胶上的检测能力,分别选取4种不同型号的胶片进行检测,检测结果如表4。通过对比发现,SPA-KG模型对不同胶片的检测能力比较稳定,mAP,RP浮动区间基本保持在±0.5个百分点内,总体表现良好。

4.8 实时目标检测

为评估模型的实时检测性能,搭建视觉检测系统,其硬件系统包括海康威视工业相机(型号是MV-CA050-10GC,500万像素,像元尺寸3.45 µm×3.45 µm,分辨率2 448×2 048),传送带(传送速度可以调节),装有64位Windows10操作系统的工控机以及显示器,如图10所示。

使用SPA-KG的算法模型和YOLOv8n进行实验对比,比较算法对小目标的捕捉能力。如图11所示,SPA-KG对小目标的捕捉能力显著提升,其中有一个小目标使用YOLOv8n未能检测到,而SPA-KG不仅成功识别出该不良目标,还实现了实时显示。

在完成算法对比实验验证SPA-KG对小目标捕捉能力的优势后,使用SPA-KG对数据集进行训练,得出训练模型,并将其应用于实时检测。使用训练模型进行实时检测的画面如图12所示,随着传送带的移动以及不同外观不良出现,检测系统会提示有不良产生,并且动态地显示不良信息。综上,实时检测系统进行实时检测效果良好。

5  结 语

为提高检测精度和检测效率,提升模型对语义信息的理解,本文对YOLOv8n模型进行了改进,将改进的YOLOv8n与知识图谱融合,提出了一种新的点胶检测算法SPA-KG。实验结果表明,SPA-KG和YOLOv8n相比,在检测性能和检测速度方面均有提升,小目标漏检、误检的几率下降,且SPA-KG可以满足现阶段的生产需求。

本文算法有效利用生产过程中的各种信息,并且可以平移到各种不同工厂的生产场景,有利于实现无人化生产,降低人为操作的失误率。未来的工作方向是继续优化算法,使得不同种类信息协同发挥作用,最大程度地利用不同信息,丰富知识库内容,提高生产效率。

参考文献

[1]

GIRSHICK RDONAHUE JDARRELL Tet al. Rich feature hierarchies for accurate object detection and semantic segmentation[C]//Proceedings of the 2014 IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2014: 580-587. DOI: 10.1109/CVPR.2014.81 .

[2]

GIRSHICK R. Fast R-CNN[C]//2015 IEEE International Conference on Computer Vision (ICCV). New York: IEEE Press, 2015: 1440-1448. DOI: 10.1109/ICCV.2015.169 .

[3]

REN S QHE K MGIRSHICK Ret al. Faster R-CNN: Towards real-time object detection with region proposal networks[C]//IEEE Transactions on Pattern Analysis and Machine Intelligence. New York: IEEE Press, 201739(6): 1137-1149. DOI: 10.1109/TPAMI.2016.2577031 .

[4]

HE K MGKIOXARI GDOLLÁR Pet al. Mask R-CNN[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence202042(2): 386-397. DOI: 10.1109/TPAMI.2018.2844175 .

[5]

LIU WANGUELOV DERHAN Det al. SSD: Single shot multibox detector[M]//Computer Vision — ECCV 2016. Cham: Springer International Publishing, 2016: 21-37. DOI: 10.1007/978-3-319-46448-0_2 .

[6]

REDMON JDIVVALA SGIRSHICK Ret al. You only look once: Unified, real-time object detection[C]//2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2016: 779-788. DOI: 10.1109/CVPR.2016.91 .

[7]

REDMON JFARHADI A. YOLO9000: Better, faster, stronger[C]//2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2017: 6517-6525. DOI: 10.1109/CVPR.2017.690 .

[8]

REDMON JFARHADI A. YOLOv3: An incremental improvement[EB/OL]. 2018: 1804.02767. DOI: 10.1109/cvpr.2017.690 .

[9]

WANG C YBOCHKOVSKIY ALIAO H M. Scaled-YOLOv4: Scaling cross stage partial network[C]//2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2021: 13024-13033. DOI: 10.1109/cvpr46437.2021.01283 .

[10]

HE K MZHANG X YREN S Qet al. Spatial pyramid pooling in deep convolutional networks for visual recognition[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence201537(9): 1904-1916. DOI: 10.1109/TPAMI.2015.2389824 .

[11]

刘雅洁,伊力哈木·亚尔买买提,席凌飞,.改进YOLOv5s的安全帽佩戴检测算法研究[J].计算机工程与应用202359(20):184-191.

[12]

LIU Y J, Yilihamu·Yaermaimaiti, XI L Fet al. Research on improved safety helmet wearing detection algorithm of YOLOv5s[J]. Computer Engineering and Applications202359(20):184-191 (Ch).

[13]

CHEN X LLI L JLI F Fet al. Iterative visual reasoning beyond convolutions[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2018: 7239-7248. DOI: 10.1109/CVPR.2018.00756 .

[14]

CHEN Z MWEI X SWANG Pet al. Multi-label image recognition with graph convolutional networks[C]//2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2019: 5172-5181. DOI: 10.1109/cvpr.2019.00532 .

[15]

XU HJIANG C HLIANG X Det al. Reasoning-RCNN: Unifying adaptive global reasoning into large-scale object detection[C]//2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2019: 6412-6421. DOI: 10.1109/cvpr.2019.00658 .

[16]

WEI WCHENG YHE J Fet al. A review of small object detection based on deep learning[J]. Neural Computing and Applications202436(12): 6283-6303. DOI: 10.1007/s00521-024-09422-6 .

[17]

YANG CHUANG Z HWANG N Y. QueryDet: Cascaded sparse query for accelerating high-resolution small object detection[C]//2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2022: 13658-13667. DOI: 10.1109/CVPR52688.2022.01330 .

[18]

周思瑜,徐慧英,朱信忠,.基于改进YOLOv8n的手机屏幕瑕疵检测算法:PGS-YOLO[J].计算机工程202551(5):326-339. DOI:10.19678/J.ISSN.1000.3428.0069259 .

[19]

ZHOU S YXU H YZHU X Zet al. Mobile phone screen defect detection algorithm based on improved YOLOv8n: PGS-YOLO [J].Computer Engineering202551(5):326-339. DOI:10.19678/J.ISSN.1000.3428.0069259(Ch ).

[20]

WANG J QCHEN KYANG Set al. Region proposal by guided anchoring[C]//2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2019: 2960-2969. DOI: 10.1109/CVPR.2019.00308 .

[21]

ZHU C CHE Y HSAVVIDES M. Feature selective anchor-free module for single-shot object detection[C]//2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2019: 840-849. DOI: 10.1109/cvpr.2019.00093 .

[22]

TIAN ZSHEN C HCHEN Het al. FCOS: Fully convolutional one-stage object detection[C]//2019 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2019: 9626-9635. DOI: 10.1109/iccv.2019.00972 .

[23]

KONG TSUN F CLIU H Pet al. FoveaBox: Beyound anchor-based object detection[J]. IEEE Transactions on Image Processing202029: 7389-7398. DOI: 10.1109/TIP.2020.3002345 .

[24]

LIU WLIAO S CREN W Qet al. High-level semantic feature detection: A new perspective for pedestrian detection[C]//2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2019: 5182-5191. DOI: 10.1109/cvpr.2019.00533 .

[25]

卞鹏程,郑忠龙,李明禄,. 基于注意力融合网络的视频超分辨率重建[J]. 计算机应用202141 (4): 1012-1019.

[26]

BIAN P CZHENG Z LLI M Let al. Attention fusion network based video super-resolution reconstruction[J]. Journal of Computer Applications202141 (4): 1012-1019 (Ch).

[27]

HOU Q BZHOU D QFENG J S. Coordinate attention for efficient mobile network design[C]//2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2021: 13708-13717.. DOI: 10.1109/cvpr46437.2021.01350 .

[28]

HAN KWANG Y HTIAN Qet al. GhostNet: More features from cheap operations[C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2020: 1577-1586. DOI: 10.1109/CVPR42600.2020.00165 .

[29]

DAI J FQI H ZXIONG Y Wet al. Deformable convolutional networks[C]//2017 IEEE International Conference on Computer Vision (ICCV).New York: IEEE Press, 2017: 764-773. DOI: 10.1109/ICCV.2017.89 .

[30]

杜铭辉, 吴林煌, 苏喆. 基于深度学习的轻量化车牌检测算法研究[J]. 电视技术202448(3): 50-54. DOI: 10.16280/j.videoe.2024.03.012 .

[31]

DU M HWU L HSU Z. Research on deep learning based lightweight license plate detection algorithm[J]. Video Engineering202448(3): 50-54. DOI: 10.16280/j.videoe.2024.03.012(Ch ).

[32]

杨超,李佳田,张泽龙,. YOLOv4-tiny算法的融合模块在卷烟小包外观缺失检测中的应用[J]. 中国烟草学报202228(2):59-64. DOI:10.16472/j.chinatobacco.2021.046 .

[33]

YANG CLI J TZHANG Z Letal.Application of fusion module of YOLOv4-tiny algorithm in cigarette packet appearance missing detectio[J]. Acta Tabacaria Sinica202228(2): 59-64. DOI:10.16472/j.chinatobacco.2021.046(Ch ).

[34]

孙俊,钱磊,朱伟栋,. 基于改进 RetinaNet 的果园复杂环境下苹果检测[J]. 农业工程学报202238(15):314-322.

[35]

SUN JQIAN LZHU W Det al. Apple detection in complex orchard environment based on improved RetinaNet[J]. Transactions of the Chinese Society of Agricultural Engineering(Transactions of the CSAE)202238(15):314-322 (Ch).

[36]

ZHENG Z HWANG PLIU Wet al. Distance-IoU loss: Faster and better learning for bounding box regression[J]. Proceedings of the AAAI Conference on Artificial Intelligence202034(7): 12993-13000. DOI: 10.1609/aaai.v34i07.6999 .

[37]

JIANG B RLUO R XMAO J Yet al. Acquisition of localization confidence for accurate object detection[C]//Computer Vision — ECCV 2018. Cham: Springer International Publishing, 2018: 816-832. DOI: 10.1007/978-3-030-01264-9_48 .

基金资助

湖北省重点研发计划(2024BBB052)

华中农业大学农业智能技术教育部工程研究中心开放课题(ERCITA-KF002)

AI Summary AI Mindmap
PDF (4594KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/