基于改进Faster-RCNN的多种类工件识别方法

梅旗振 ,  孙旋

中国机械工程 ›› 2026, Vol. 37 ›› Issue (5) : 1226 -1235.

PDF (3604KB)
中国机械工程 ›› 2026, Vol. 37 ›› Issue (5) : 1226 -1235. DOI: 10.3969/j.issn.1004-132X.2026.05.023
智能制造

基于改进Faster-RCNN的多种类工件识别方法

作者信息 +

A Method of Multi-type Job Identification Based on Improved Faster-RCNN

Author information +
文章历史 +
PDF (3689K)

摘要

针对传统机器视觉算法在工件检测任务中出现工件漏检、工件检测准确率低的问题,提出了一种改进的Faster-RCNN多种类工件识别方法。首先在骨干网络层面摒弃原有的VGG16,选用Res2Net101强化网络特征提取效能;其次在特征融合模块中将空间和通道重建卷积(SCConv)深度嵌入特征金字塔网络(FPN),进而构建全新的SCFPN 架构,并将其与Res2Net101有机整合,以实现对多尺度特征信息的充分提取与精炼;最后在后处理环节,以Soft-NMS 算法取代传统非极大值抑制(NMS) 算法,有效规避高重合度候选框的误删除现象,显著提高模型在工件遮挡场景下的适配能力,大幅降低漏检概率。研究结果表明:所提改进Faster-RCNN模型相比原算法在性能上有显著提高,平均精度达到93.2%,召回率达到91.8%,可在复杂环境下完成对各类工件的检测识别。

Abstract

To solve the problems of missing workpiece detection and low accuracy of workpiece detection in traditional machine vision algorithm, an improved Faster-RCNN multi-type job identification method was proposed. Firstly, at the backbone network level, the original VGG16 was discarded, the Res2Net101 was adopted to strengthen the efficiency of network feature extraction. Secondly, in the feature fusion module, the SCConv was deeply embedded into the FPN, and then a new SCFPN architecture was constructed, and the architecture was organically integrated with Res2Net101 to realize the full extraction and refinement of multi-scale feature information. Finally, in the post-processing link, Soft-NMS algorithm was used to replace the traditional non maximum suppression(NMS) algorithm, effectively avoiding the false deletion of high coincidence candidate box, significantly improving the adaptability of the model in the workpiece occlusion scene, and greatly reducing the probability of missing detection. The results show that the proposed improved Faster-RCNN model significantly improves the performances compared with that of the original algorithm, the average precision reaches 93.2% and recall rate is as 91.8%. It may detect and identify all kinds of workpieces in complex environment.

Graphical abstract

关键词

工件检测 / 改进Faster-RCNN / 特征金字塔网络 / 空间和通道重建卷积

Key words

workpiece detection / improved Faster-RCNN / feature pyramid network(FPN) / spatial and channel reconstruction convolution(SCConv)

引用本文

引用格式 ▾
梅旗振,孙旋. 基于改进Faster-RCNN的多种类工件识别方法[J]. 中国机械工程, 2026, 37(5): 1226-1235 DOI:10.3969/j.issn.1004-132X.2026.05.023

登录浏览全文

4963

注册一个新账户 忘记密码

0 引言

随着我国工业的快速发展,工业4.0时代加速推进。信息化技术推动产业升级,工业智能化已成主流1。智能制造作为全球工业制造热点与各国战略重点2,其核心环节之一的工件识别检测至关重要。从分类清点、种类筛选到智能装配,工业生产各环节均依赖精准的工件识别,尤其在自动装配分拣流水线中工件匹配识别定位是核心功能,如何实现更快速、精准的识别研究,成为工业智能制造迈向新高度的关键突破点。

传统工件分拣识别依赖人工,存在效率低、出错率高的问题,且对场地环境要求严苛,狭小空间、极端温度会影响分拣质量甚至威胁人员安全。为提高分拣的效率、合格率以及安全性,研究人员探索机器视觉技术,涵盖图像分割3-5、形状匹配、特征分析等多种方法,如角点检测结合霍夫变换6、图像色彩增强7、分割匹配融合及支持向量机(SVM) 组合矩算法等8-9。传统机器视觉算法依赖手动设计特征提取器,工厂实际场景中强光、弱光、反光及工件遮挡等干扰频发,致使传统算法特征提取失效,识别准确度大幅下降,导致鲁棒性差、误检率高,严重制约智能装配效率。

近年来,研究人员将深度学习相关技术应用于目标识别、图像标记等传统机器视觉在复杂场景难以完成的任务,表现出优秀的精确性和鲁棒性10。其中Faster-RCNN算法已被研究人员应用于工业、医疗、农业等多个领域。针对无人机目标检测在复杂多变场景下精度不高的问题,CUI等11利用可变性卷积替换Faster-RCNN网络中卷积并添加混合注意力机制模块,提高了无人机目标检测精度。为解决Faster-RCNN网络全局信息捕获能力的局限,KONG等12采用移动窗口Transformer替换骨干网络,通过引入增强的平滑损失函数Faster Rformer来提高网络在复杂背景下的检测性能。Faster-RCNN网络对与背景界限模糊的目标的检测精度较低,LIU等13在原有模型的基础上添加卷积块注意力模块(CBAM),以提高对边界模糊目标的特征提取能力。针对X光检测中物体种类多样、成像角度多变等因素影响Faster-RCNN识别精度的问题,ZHANG等14提出加入畸形注意力模块(MAM)并使用大核注意力(LKA)模块,可有效提取形状失真目标对象的区域特征,聚焦有效目标特征信息,提高模型的检测性能。

常规实验场景中,零件规整摆放、无遮挡且背景单一时,主流深度学习网络经标准数据集训练可实现高识别精度,但实际工业场景下存在零件的摆放、遮挡、背景、干扰以及零件在视场中比例变化等问题,零件识别难度增加,主流算法无法较好地完成生产过程中工业零件识别的任务。针对工业实际场景的识别难点,现有经典框架虽具备应用潜力但需针对性优化,Faster-RCNN作为经典目标检测框架,以其快速、准确和端到端特性备受关注,但它在复杂场景下的特征提取与目标识别能力仍有提升空间。本文提出改进的Faster-RCNN工件识别算法,选用Res2Net101 作为主干特征提取网络,通过融合改进后的特征金字塔网络得到SCFPN架构,并采用Soft-NMS算法对边界框回归进行优化。

1 多种类工件识别检测总体框架

本文提出改进Faster-RCNN种类工件识别检测模型是为了提高在复杂场景下工件识别检测的精确度,并尽可能地提高检测效率,总体框架如图1所示,主要包含数据处理、模型搭建、工件检测三个部分。

首先,将自主采集到的不同种类工件图像作为初始数据集,并对初始图像数据集进行数据增强和相关预处理;然后使用Res2Net101替换原始特征提取模块,结合特征金字塔网络(FPN)与空间和通道重建卷积(SCConv)模块进而构建SCFPN架构,使用Soft-NMS算法取代原有的非极大值抑制(NMS)算法;最后,将所采集的数据集输入至训练完成的模型中,以实现对工件的识别与检测。

2 Faster-RCNN网络及改进

2.1 Faster-RCNN

Faster-RCNN算法是双阶段检测算法15,主要分为卷积神经网络(convolutional neural network,CNN)、区域建议网络(region proposal network,RPN)以及区域卷积神经网络(region-based convolutional neural network,RCNN)三个部分。其中,CNN负责输入图像的特征提取,RPN负责在特征图上生成边界框并辨认边界框中是识别对象还是背景,RCNN负责分类器分类和利用回归器进行目标位置矫正。Faster-RCNN的整体结构如图2所示。

2.2 改进Faster-RCNN

考虑到在智能装配工件分拣过程中存在大量工件紧密排列,以及图像中工件较多时相互遮挡的情况,为减少密集目标和被遮挡目标被漏检错检的情况,并提高多种类工件检测的准确率,本文从网络结构和模型算法两个方面对原始Faster-RCNN进行改进,改进后Faster-RCNN的网络结构如图3所示。

网络结构方面改进了特征提取模块,使用Res2Net101特征提取网络代替原始主干网络;在FPN模块中融入SCConv模块来构建SCFPN模块,提高模型的特征提取能力并减少冗余特征;模型算法方面改进了模型的后处理算法——NMS算法,将其替换为Soft-NMS算法,目的在于提高被遮挡目标的检测精度。

2.2.1 特征提取模块

VGG16作为Faster-RCNN的初始特征提取网络,由13个卷积层、3个全连接层和5个池化层构成,含权重的网络层共有16层。由于梯度在反向传播中随网络层数增加而逐渐消失,导致图像细节丢失、模型退化,进而影响模型性能表现。MobileNet16使用大量深度可分离卷积进行特征提取,显著缩减了整体乘法和加法计算,可分离卷积都使用批量归一化层和线性校正函数,这有助于减缓梯度消失并加速收敛。ResNet17的提出是为了解决随着网络深度增大而出现的网络退化问题。ResNet在网络的层与层之间构成了残差模块,使得网络具有恒等映射能力,这样即使出现了梯度消失也可保证深层网络不会差于浅层网络,不影响网络后续训练学习。Res2Net18是ResNet的变体形式,该网络不仅提高了分类任务的准确性,还提高了检测任务的精度。Res2Net在原始残差块中再次构建了多个类残差结构,Res2Net模块与ResNet模块的对比如图4所示。

X为输入的特征,经过第一层1×1卷积后生成k个特征,i+1(i=0,1,2,…,k-1)个特征经过3×3卷积后以残差连接的方式融合到第i+2 个特征中,这种多层类残差结构可使多个不同大小感受野处理后的特征融合在一起,这样能够在更加精细的区域内描述多尺度特征信息,从而提高网络的特征提取能力。

为提高初始网络的特征提取能力,本文采用Res2Net网络作为特征提取网络,与Res2Net34、Res2Net50、Res2Net152等网络相比,Res2Net101网络能够在提取更为深层的特征信息的同时占用较少的计算资源,且训练和推理速度较快。

2.2.2 多尺度特征融合模块

原始Faster-RCNN网络对图像深层次信息的提取能力较强,但会忽略大量的细节特征,这将导致在网络训练过程中漏检特征不明显的目标,从而会降低部分目标的检测精度。针对原始Faster-RCNN网络细节特征提取能力较弱的问题,本文构建了改进后的特征金字塔网络(SC-FPN),使Faster-RCNN网络在特征提取时可获得更多的细节特征,从而提高对目标的定位与识别能力。

FPN19通过构建自底向上和自顶向下的特征融合路径将不同尺度的特征图进行融合,从而生成具有丰富多尺度信息的特征金字塔。该结构在不显著增加计算量的情况下,使模型能够同时处理不同大小的目标,显著提高了模型的检测性能,FPN的网络结构如图5所示。

由于引入了自底向上和自顶向下的特征融合路径以及横向连接,FPN提取出的特征信息变得丰富多样的同时也会包含较多的冗余特征。冗余特征会在模型训练时增加模型的训练难度使得模型的性能无法得到进一步提升。针对这一问题本文构建了SCFPN网络,即在FPN的基础上融入SCConv模块20,减少了网络中的冗余特征,在降低网络的复杂度和计算成本的同时实现了更好的性能。改进部分如图6所示。

2.2.3 空间和通道重建卷积模块

SCConv由空间重建单元(SRU)和通道重建单元(CRU)组成。SRU采用分离重构的方法来抑制空间冗余,CRU采用分离变换融合的策略来减少信道冗余21图7为SCConv的模块结构图。

在SRU单元中,输入特征图进行分离与重建操作。其中,分离阶段通过评估特征图信息含量,将高信息量特征图与低空间信息特征图分离。利用组归一化(GN)层的缩放因子对输入特征图进行标准化处理,其表达式如下:

Xout=GN(X)=γX-μσ2+ε+β

式中:Xout为处理后标准化特征;GN(·)表示组归一化操作;X为输入特征;μσ分别为X的均值和标准差;ε为一个稳定除法而添加的极小正数;γβ为可训练参数。

随后在GN层中使用可训练参数γRC来度量各批次与通道的空间像素方差,以此表征不同特征图重要程度的归一化相关权重,其表达式如下:

Wγ={wi}=γij=1Cγji,j=1,2,,C

式中:Wγ为可训练参数γ下一组归一化后的权重;wi为第i通道的权重;C为通道数;i为当前通道数;j为通道索引变量;γiγj分别为第i通道和第j通道下的可训练参数值。

Sigmoid函数通过设定阈值来分离出信息丰富的权重W1和信息匮乏的权重W2,将输入特征X分别与W1W2相乘,得到具有丰富信息、空间内容表现力强的特征X1w,以及几乎没有信息的冗余特征X2w

在重建操作中,将X1wX2w分组交叉相加生成更节省空间的高信息量特征X11wX12wX21wX22w。接着将交叉重建操作后的特征Xw1Xw2连接,获得空间细化特征图Xw。重建全过程可表示为

X1w=W1XX2w=W2XX11wX22w=Xw1X21wX12w=Xw2Xw1Xw2=Xw

式中:表示逐元素乘法;表示逐元素加法;表示拼接操作。

SRU单元将信息量不同的特征分离并对这些特征进行重建,增强了具有代表性的特征,减少了空间维度中的冗余。图8为SRU单元的结构图。

CRU单元利用“分割-转换-融合”的策略来限制特征的通道冗余,其结构如图9所示。

分割过程中,空间细化特征图Xw分成具有αC1-αC个通道的两部分,其中α为分割比,0<α<1。利用1×1卷积压缩特征通道,生成上部Xup和下部Xlow。转化过程中,Xup经过分组卷积(GWC)和逐点卷积(PWC)的高级卷积操作来提取高级代表信息Y1并减少计算量。Xlow经过1×1PWC操作生成具有浅层隐藏细节的特征图,与自身连接合并成补充特征图Y2。融合过程中首先应用全局平均池化(Pooling)收集全局空间信息,通道统计信息SmRC×1×1m=1,2)的计算表达式为

Sm=Pooling(Ym)=1HWa=1Hb=1WYj(a,b)

式中:HW分别为特征图的高度和宽度;Yja,b表示Yj的第j个通道在空间位置(a,b)的特征值。

接着将通道统计信息S1S2堆叠,使用通道注意力操作生成特征重要性向量β1β2,其表达式为

β1=exp(S1)exp(S1)+exp(S2)β2=exp(S2)exp(S1)+exp(S2)β1+β2=1

式中:β1β2RC

最后在通道维度上逐元素合并上特征Y1和下特征Y2,从而获得通道细化特征Y

相对于传统的卷积模块,SCConv模块的参数量更少,对特征的提取更精细且更全面。这使得FPN网络在融合SCConv后不仅性能得到了提高,而且参数量和计算量在一定程度上有所降低。

2.2.4 Soft-NMS算法

在工件检测场景下,两阶段目标检测算法会针对同一工件目标输出多个重叠的预测边界框,并赋予每个边界框对应的置信度分数。为从这些冗余的候选框中筛选出精准的目标框,传统NMS算法会先选取置信度最高的边界框A作为基准,然后计算其余边界框与A的交并比(IoU),删除IoU值超出阈值的边界框,仅保留与基准框重叠度较低或完全不重叠的边界框。由于抑制过度,传统NMS算法得到的边界框的置信度较低,而且存在被遮挡工件的候选先验框可能被删除的情况,从而导致检测精度低。

与传统NMS算法不同的是,Soft-NMS算法不会直接删除IoU值超出阈值的边界框,而是降低这些边界框的置信度,Soft-NMS算法的计算表达式如下:

Sk=Sk                                             IoU(M,bk)<NtSk(1- IoU(M,bk))        IoU(M,bk)Nt

式中:M为具有高得分的候选先验框;bk为待处理的第k个候选先验框;Nt为设置的IoU阈值,IoU(·)表示权重函数,用于衰减与具有最高分数的候选先验框重叠的相邻候选先验框的置信度分数,重合程度越高则得分的衰减程度越高;Sk为候选框对应的置信度分数集合中第k个候选先验框的置信度分数。

由此可知,在改进的Faster-RCNN模型中采用Soft-NMS算法代替原有的NMS算法,从而可提高模型的检测性能。

3 工件检测实验及结果分析

3.1 工件图像数据集的采集及制作

由于未发现关于装配工件的公开数据集,因此本文通过网上下载和个人自行拍摄收集数据集图像。通过人工筛选过滤掉模糊以及遮挡极为严重的部分,得到1624张工件图像作为工件图片初始数据集,部分图像见图10

针对初始数据集样本量不足及类别分布不均问题,本文通过平移、缩放、裁剪等几何变换扩充样本量,并结合亮度调节、随机饱和度变换及透明度调整模拟工业场景光照差异,以提高数据多样性。对每个原始样本进行数据增强操作生成多版本图像,经筛选去重后融入初始数据集,最终构建6000张图像的高质量数据集,有效避免了样本不均衡问题,为模型泛化能力的提升奠定数据基础。本研究图像数据集已上传至GitHub网站,网址为https:∥github.com/mei281/-.git。

数据集准备完成后,使用labeling软件对工件图像进行标注,选用labeling软件自带的矩形边界框标注图像中工件的位置以及类别标签,需要标注的零件有轴承、螺栓、凸盘、齿轮、螺母、弹簧这6类。各种类工件标注框数分布情况如表1所示。

3.2 实验环境

本实验中采用的硬件环境为:Windows11操作系统,32 G运行内存,处理器为Intel(R)Core(TM) i7-14650HX 2.20 GHz,GPU为RTX4060,实验使用的深度学习框架为PyTorch1.12.0,Python编程语言版本为Python3.9,拍摄数据集的相机型号为锐尔威视。

3.3 评价指标

为评价本文改进的Faster-RCNN模型在工件检测中的准确性和可靠性,本实验中采用召回率AR、精确率AP、平均准确率AAP、平均精度值AmAP作为评价指标。各指标计算公式如下:

AP=NTPNTP+NFP
AR=NTPNTP+NFN
AAP=01AP(AR)dAR
AmAP=icNclassAAPicNclass

式中:NTP为真正例,即模型正确预测为正类的样本数量;NFP为假正例,即模型错误预测为正类的样本数量;NFN为假反例,即模型错误预测为负类的样本数量;AAPic为第ic个类别的平均准确率;Nclass为样本的类别数。

3.4 模型训练和测试

在实验中,本文采集的6000张图片选择5000张作为训练集,500张作为验证集,500张作为测试集。模型网络整体损失函数如下:

L(Pi,Pi*)=1NclsiLcls(Pi,Pi*)+λ1NregiPi*Lreg(ti,ti*)
Lcls(Pi,Pi*)=-[Pi*log(Pi)+(1-Pi*)log(1-Pi)]
Lreg(ti,ti*)=iL1smooth(ti-ti*)

式中:i为锚框序号;Pi为预测边界框是前景的概率;Pi*为锚框的真实类别标签;ti为预测的边界框坐标修正量;ti*为与锚框对应的真实边界框的坐标修正量;Ncls为前景和背景锚框的总数;Nreg为候选框的数量;L为整体损失函数;Lcls为分类损失函数,使用交叉熵损失函数;Lreg为回归损失函数,使用平滑损失函数L1smoothλ为平衡分类损失和回归损失的权重参数。

在改进后Faster-RCNN模型的50个训练轮次中对每一轮次的总损失值进行实时记录,所生成的损失值变化折线图见图11

3.5 特征提取网络对比实验

为验证本文提出的采用Res2Net101网络代替原始特征提取网络VGG16的实用性和合理性,分别将特征提取网络VGG16Net、MobileV2、ResNet50、ResNet101和Res2Net101加入Faster-RCNN模型中进行训练和测试,测试结果如表2所示。其中,mAP@50表示IoU阈值取0.5时的平均精度值。

表2的数据中可以看出,与原始算法和加入轻量化特征提取网络的算法相比,带有残差结构的ResNet网络结构在工件检测中的性能更加稳定,且随着网络层数的增加,在多种类工件检测方面比原本的Faster-RCNN算法具有更高的精度和召回率。Res2Net网络在ResNet网络原有的残差结构内部进行改进,建立了多级残差网络连接,实现了在更加精细的区域里提取多尺度特征信息。实验结果表明,改进后的Faster-RCNN(Res2Net101)的平均精度达到86.9%,召回率达到85.5%,表明对Faster-RCNN的特征提取网络进行改进的操作具有有效性,改进后的Faster-RCNN更有利于多种类工件的检测。

3.6 消融实验

本文对原始模型的改进包含多个模块的改进与组合。设计消融实验对每个改进模块进行测试,分析不同改进策略下模型的检测效果,以验证每个模块改进的合理性与有效性。消融实验结果如表3所示。

为保证本文实验的完整性,在消融实验中引入原始Faster-RCNN模型作为对照组。在Faster-RCNN模型的基础上,分别仅加入Res2Net101网络(简称为“Faster-RCNN+1”),仅加入Soft-NMS算法(简称为“Faster-RCNN+2”),仅加入FPN特征金字塔模块(简称为“Faster-RCNN+3”),加入融入SCConv模块的SCFPN模块(简称为“Faster-RCNN+3+4”),加入Res2Net101网络和Soft-NMS算法(简称为“Faster-RCNN+1+2”),加入Res2Net101网络和FPN模块(简称为“Faster-RCNN+1+3”),加入Res2Net101网络、Soft-NMS算法和FPN模块(简称为“Faster-RCNN+1+2+3”),加入Res2Net101网络、融入SCConv模块的SCFPN模块(简称为“Faster-RCNN+1+3+4”),加入全部4个改进模块(简称为“Faster-RCNN+1+2+3+4”)。对上述10种方法进行对比,分析评价整体模型改进中每个改进模块的作用与效果。

表3数据可得,原始Faster-RCNN模型的平均精度为83.1%,召回率为78.6%,召回率相对较低,未达到80%,模型漏检率较高;“Faster-RCNN+1”模型的平均精度、召回率分别提高3.8%、7.9%,且帧率(FPS)提高,表明Res2Net101网络的特征提取能力更强,检测速率更快;“Faster-RCNN+2”的平均精度、召回率分别提高0.8%、1.2%,表明Soft-NMS算法可以降低模型漏检率;“Faster-RCNN+3”的平均精度、召回率分别提高1.4%、1.6%,表明FPN模块的多尺度特征融合可以提高模型的特征提取性能;“Faster-RCNN+3+4”中在原始模型中加入SCFPN模块,模型性能得到部分提升,但由于主干网络特征提取能力较弱,限制了模块后续对特征细节的处理;“Faster-RCNN+1+2”中,Soft-NMS算法不采用原始NMS算法粗暴地删除候选边界框的策略,降低了候选框误删情况,平均精度达到89.1%,召回率达到87.5%;“Faster-RCNN+1+3”中,FPN模块的加入使得模型增强了对各尺度特征图内细节特征的提取,对不同尺度的特征信息进行了更好的融合利用,平均精度达到90.6%,召回率达到88.3%,由于特征提取结构变得复杂,帧率稍低由16 帧/s降至12 帧/s;与“Faster-RCNN+1+3”相比,“Faster-RCNN+1+2+3”的平均精度提高0.8%,召回率提高1.9%,这是因为在算法特征提取性能提高时Soft-NMS算法对候选边界框的评分更加精准,进一步降低了模型的漏检率;与“Faster-RCNN+1+3”相比,“Faster-RCNN+1+3+4”的平均精度提高1.4%,召回率提高1.6%,性能得到进一步提升,这是由于融入SCConv模块的SCFPN模块在对多尺度特征信息融合的同时去除了冗余特征,优化了特征提取效果;最终改进方案的平均精度和召回率分别达到93.2%和91.8%,与原始模型相比,其平均精度提高10.1%,召回率提高13.2%,在改进模型结构的同时减少了模型中的冗余参数,帧率有略微提高。

总体来说,本文的各改进方式均使原始模型的性能得到了不同程度地提高,且本文模型的性能与原始模型相比有较大的提升,验证了每个模块改进的合理性与有效性。

3.7 与其他主流模型的对比实验

为展示本文改进的Faster-RCNN模型的检测效果,在多种类工件检测任务中将本文提出的改进算法模型与Faster-RCNN、SSD、YOLOV5、YOLOV8算法进行性能比较,结果如表4所示。

表4可知,SSD模型的性能相对最差,平均精度和召回率均未超过85%,对多种类工件的检测误差较大和漏检率较高;在多种类工件检测工作中YOLOV5和YOLOV8两种模型性能相仿,平均精度较高分别为89.1%和88.9%,但召回率分别为82.4%和83%均未达到85%,对工件检测的漏检率稍高,这是因为YOLO系列模型是单阶段检测模型,模型结构较为简单,且模型直接进行目标的类别和位置预测,没有候选区域生成等过程,无法保证对图像特征信息的充分利用;经过对比,改进Faster-RCNN模型的综合性能最好,在保证工件检测工作中误差和漏检率均较小的同时,对模型的速度作出一定妥协,在不影响模型应用的前提下模型精度和召回率都优于YOLO系列模型,与原始模型相比,平均精度提高10.1%,召回率提高13.2%,验证了本文改进模型的实用性和优越性。

不同模型算法在多种类工件检测中对各种类工件检测的平均精度值如表5所示。

表5可以看出,凸盘、轴承、螺母的检测平均精度值较高,均达到84%以上,螺栓、齿轮和弹簧的平均精度值相对较低。对Faster-RCNN模型进行改进后,改进Faster-RCNN对各类工件的检测平均精度值均有明显提高,凸盘的检测平均精度值最高,达到98.6%,螺栓的检测平均精度值最低,达到90.6%,其余各工件检测平均精度值均超过92%。

上述结果表明,改进后的Faster-RCNN模型对各种类工件的检测性能实现了显著提升。

3.8 改进模型检测效果

使用本文改进的模型对部分工件图像进行检测,这些图像用于模拟真实工业场景中存在的工业流水线上零件摆放杂乱、零件相互遮挡、工作背景纹理复杂、光线及零件异物干扰等情况。在零件杂乱摆放情况下,零件呈现不同角度的旋转、倾斜和堆叠姿态;在零件遮挡情况下,各零件间存在堆叠遮挡,部分零件的遮挡面积达到30%以上;在工作背景存在纹理干扰情况下,背景中存在大量与零件无关的纹理特征;在环境干扰的情况下,因光照影响视场中出现阴影与反光,存在因拍摄角度而导致的零件比例变化以及非零件的异物。测试结果如图12所示,结果表明本文模型检测效果优秀,零件的识别准确率高,错检漏检情况少,对在实际工业场景下的工件姿态凌乱、存在大量遮挡、检测背景纹理复杂、多种工件混杂、光照等干扰因素的抗性较强。

基于模拟真实工业场景的零件测试集图像测试结果表明,本文改进的模型在工业场景下的多种类工件检测工作中具有较高的应用价值。

4 结论

1)将Faster-RCNN网络中骨干架构VGG16替换为Res2Net101,增强了网络的特征提取能力,提高了网络对工件检测的准确度。

2)将空间和通道重建卷积(SCConv)模块融入特征金字塔网络(FPN)形成SCFPN结构,并将Res2Net101与SCFPN结合,使网络提取出多尺度内容丰富且精炼的特征信息,进一步提高了网络对各种尺寸大小工件的检测准确度。

3)使用Soft-NMS算法加入改进后的模型而代替原本的非极大值抑制(NMS)算法,有效减少了高重合率候选框被误删的情况,提高了模型在工件遮挡场景下的适用性,并降低了模型的漏检率。

4)经过实验测试,与原模型相比,本文模型的平均精度提高10.1%、召回率提高13.2%,模型性能得到了较好的提升,改进后的方法在多种类工件检测方面的效果更优,能够稳定完成对工件的识别和分类工作,为在工业流水线中的工件智能装配和工件智能分拣等环节提供了一种新的选择。

未来将以拓展复杂场景样本库、优化模型在真实工业生产场景的遮挡/干扰情况下应用的鲁棒性作为核心任务,并进一步优化模型结构,在保证精确率的同时降低模型的深度和复杂性,从而提高模型的检测速率。

参考文献

[1]

闫纪红,李柏林.智能制造研究热点及趋势分析[J].科学通报202065(8):684-694.

[2]

YAN JihongLI Bolin. Research Hotspots and Tendency of Intelligent Manufacturing[J]. Chinese Science Bulletin202065(8): 684-694.

[3]

齐二石, 霍艳芳, 刘洪伟. 面向智能制造的工业工程和精益管理[J]. 中国机械工程202233(21): 2521-2530.

[4]

QI ErshiHUO YanfangLIU Hongwei. Industrial Engineering and Lean Management for Smart Manufacturing[J]. China Mechanical Engineering202233(21): 2521-2530.

[5]

王耀南, 陈铁健, 贺振东, . 智能制造装备视觉检测控制方法综述[J]. 控制理论与应用201532(3): 273-286.

[6]

WANG YaonanCHEN TiejianHE Zhendonget al. Review on the Machine Vision Measurement and Control Technology for Intelligent Manufacturing Equipment[J]. Control Theory & Applications201532(3): 273-286.

[7]

车录锋, 周晓军, 徐志农, . 多传感器信息融合机器人工件识别[J]. 中国机械工程200011(11): 1266-1268.

[8]

CHE LufengZHOU XiaojunXU Zhinonget al. Multisensor Data Fusion for Robot Parts Recognition[J]. China Mechanical Engineering200011(11): 1266-1268.

[9]

韩博. 基于双目立体视觉的工件识别与定位关键技术研究[D]. 哈尔滨: 哈尔滨工业大学, 2018.

[10]

HAN Bo. Research on Key Technologies of Workpiece Recognition and Location Based on Binocular Stereo Vision[D]. Harbin: Harbin Institute of Technology, 2018.

[11]

OTSU N. A Threshold Selection Method from Gray-level Histograms[J]. IEEE Transactions on Systems, Man, and Cybernetics19799(1): 62-66.

[12]

RUTA ALI YLIU X. Real-time Traffic Sign Recognition from Video by Class-specific Discriminative Features[J]. Pattern Recognition201043(1):416-430.

[13]

KHAN J FBHUIYAN S M AADHAMI R R. Image Segmentation and Shape Analysis for Road-sign Detection[J]. IEEE Transactions on Intelligent Transportation Systems201112(1): 83-96.

[14]

黄山. 基于机器视觉的机械臂分拣系统的研究[D]. 镇江: 江苏科技大学, 2016.

[15]

HUANG Shan. Research on the Robot Arm Sorting System Based on Machine Vision[D]. Zhenjiang:Jiangsu University of Science and Technology,2016.

[16]

郭庆梅, 刘宁波, 王中训, . 基于深度学习的目标检测算法综述[J]. 探测与控制学报202345(6):10-20.

[17]

GUO QingmeiLIU NingboWANG Zhongxunet al. Review of Deep Learning Based Object Detection Algorithms[J]. Journal of Detection & Control202345(6): 10-20.

[18]

CUI GZHANG L. Improved Faster Region Convolutional Neural Network Algorithm for UAV Target Detection in Complex Environment[J]. Results in Engineering202423: 102487.

[19]

KONG XLI XZHU Xet al. Detection Model Based on Improved Faster-RCNN in Apple Orchard Environment[J]. Intelligent Systems with Applications202421: 200325.

[20]

LIU BZHAO XHU Het al. Detection of Esophageal Cancer Lesions Based on CBAM Faster R-CNN[J]. Journal of Theory and Practice of Engineering Science20233(12): 36-42.

[21]

ZHANG WZHU QLI Yet al. MAM Faster R-CNN: Improved Faster R-CNN Based on Malformed Attention Module for Object Detection on X-ray Security Inspection[J]. Digital Signal Processing2023139: 104072.

[22]

THOKE A, RAI S. Exploring Faster R-CNN Algorithms for Object Detection[C]∥2024 First International Conference on Software, Systems and Information Technology(SSITCON). Tumkur, 2024: 1-5.

[23]

MAO W LCHEN S HHUANG Y Tet al. Indoor Scene Recognition Using ARM-based MobileNets Architectures[C]∥2023 Fourteenth International Conference on Ubiquitous and Future Networks(ICUFN). Paris, 2023: 225-230.

[24]

YAN XZHANG YJIN Q. Chemical Process Fault Diagnosis Based on Improved ResNet Fusing CBAM and SPP[J]. IEEE Access202311: 46678-46690.

[25]

GAO SCHENG MZHAO Ket al. Res2Net: a New Multi-scale Backbone Architecture[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence202143(2): 652-662.

[26]

LIN T YDOLLÁR PGIRSHICK Ret al. Feature Pyramid Networks for Object Detection[C]∥2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). Honolulu, 2017: 936-944.

[27]

LI JWEN YHE L. SCConv: Spatial and Channel Reconstruction Convolution for Feature Redundancy[C]∥2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). Vancouver, 2023: 6153-6162.

[28]

刘罡, 侯恩翔, 黄孙港, . 多尺度特征融合增强的行人翻越护栏检测[J]. 电子测量技术202447(14): 127-138.

[29]

LIU GangHOU EnxiangHUANG Sunganget al. Multi Scale Feature Fusion Enhanced Pedestrian Crossing Guardrail Detection[J]. Electronic Measurement Technology202447(14): 127-138.

AI Summary AI Mindmap
PDF (3604KB)

29

访问

0

被引

详细

导航
相关文章

AI思维导图

/