基于YOLOv8的小目标检测方法研究

王晓雯 ,  常居泰 ,  于骐瑞

中北大学学报(自然科学版) ›› 2025, Vol. 46 ›› Issue (06) : 712 -725.

PDF (5991KB)
中北大学学报(自然科学版) ›› 2025, Vol. 46 ›› Issue (06) : 712 -725. DOI: 10.62756/jnuc.issn.1673-3193.2025.01.0005
智慧交通车路信息感知与智能分析专栏

基于YOLOv8的小目标检测方法研究

作者信息 +

Research on Small Target Detection Method Based on YOLOv8

Author information +
文章历史 +
PDF (6133K)

摘要

为了提升小目标检测的准确性和效率, 本文针对现有算法在小目标识别方面的不足, 提出了一种基于YOLOv8的改进型检测方法。该方法在YOLOv8的基础上, 融入了SPD(Space-to-Depth)模块, 有效避免了传统步长卷积和池化操作所导致的信息损失; 同时, 提出了改进的FT_Conv(Fractional Fourier Transform Convolution), 提高了模型对小目标的检测精度和计算效率; 此外, 通过C2f_BiLevel Routing Attention机制, 实现了动态稀疏注意力, 优化了特征融合和物体检测性能, 进一步提升了模型对小目标的识别能力; 最后, 引入了Powerful-IoU损失函数, 以改善现有的IoU锚框面积扩大问题, 增强了对锚框的聚焦能力。实验结果表明, 相较于原始YOLOv8模型, 改进后的模型在小目标检测任务中的平均精度(AP)提升了3.29百分点, 并且显著地降低了漏检率和误检率。这些成果证实了改进型YOLOv8模型在小目标检测领域具有明显的性能优势。

Abstract

In order to improve the accuracy and efficiency of small target detection, this paper proposed an improved detection method based on YOLOv8 to address the shortcomings of existing algorithms in small target recognition. Based on YOLOv8, this method integrated SPD (Space-to-Depth) module, which effectively avoided the information loss caused by traditional strided convolution and pooling operation. At the same time, an improvement of Fractional Fourier Transform Convolution (FT_Conv) was proposed to improve the detection accuracy and computational efficiency of the model for small targets. In addition, the C2f_BiLevel Routing Attention mechanism was used to realize dynamic sparse attention, optimize the feature fusion and object detection performance, and further improve the recognition ability of the model for small targets. Finally, the Powerful-IoU loss function was introduced to improve the area expansion of the anchor frame of the existing IoU and enhance the focusing ability of the anchor frame. The experimental results show that compared with the original YOLOv8 model, the average accuracy (AP) of the improved model in small target detection tasks is increased by 3.29 percentage points, and the false detection and missed detection rates are significantly reduced. These results confirm that the improved YOLOv8 model has obvious performance advantages in the field of small target detection.

Graphical abstract

关键词

小目标检测 / YOLOv8 / 分数阶傅里叶变换 / 模型评估 / 动态稀疏注意力 / Powerful-IoU损失函数

Key words

small target detection / YOLOv8 / FT_Conv / model evaluation / dynamic sparse attention / Powerful-IoU loss function

引用本文

引用格式 ▾
王晓雯,常居泰,于骐瑞. 基于YOLOv8的小目标检测方法研究[J]. 中北大学学报(自然科学版), 2025, 46(06): 712-725 DOI:10.62756/jnuc.issn.1673-3193.2025.01.0005

登录浏览全文

4963

注册一个新账户 忘记密码

0 引 言

目标检测作为计算机视觉领域的核心任务之一, 在自动驾驶、 视频监控、 医学影像分析等领域具有较高的应用价值。随着深度学习技术的快速发展, 基于卷积神经网络(CNN)的目标检测算法(如Faster R-CNN1、 YOLO系列2)取得了显著进展, 尤其是以YOLO(You Only Look Once)系列为代表的单阶段检测模型, 因其高效的检测速度成为实时目标检测的标杆。然而, 尽管目标检测算法在大中型目标上表现优异, 对于图像中尺寸较小的目标(通常定义为面积小于32像素×32像素的目标), 其检测性能仍存在显著不足。小目标由于分辨率低、 特征信息匮乏, 容易在检测过程中被忽视或误判3, 这一问题在复杂场景(如遥感图像4、 密集人群5、 医学图像6等)中尤为突出。因此, 提升小目标检测的准确性和鲁棒性对于推动目标检测技术的实际应用具有重要意义。

为提升小目标检测性能, 众多学者进行了深入的研究: Kisantal7增加了基于过采样的copy-paste(复制粘贴策略), 即将小目标粘贴到图像中的任何位置, 并生成新的注释, 该策略通过增加小目标的数量来提高小目标检测的性能, 并在实验中证明了其有效性。Akyon等8提出了一种结合切片辅助超推理(SAHI)和微调策略的创新方法, 通过多尺度切片处理和针对性模型优化, 显著提升了小目标检测任务中的识别精度和鲁棒性。Liu等9提出了多尺度contourlet知识引导学习网络, 有效捕获了小尺度目标的特征。Lin等10设计的特征金字塔网络(FPN)通过跨尺度特征融合缓解尺寸差异问题。然而, 传统FPN对小目标的浅层特征利用不足, 导致细节丢失。为此, Cao等11开发了一种注意力引导的上下文特征金字塔网络(Attention-Guided Context Feature Pyramid Network), 旨在解决高分辨率输入中特征图分辨率与接受域之间的矛盾。Jiang等12提出了一种名为GiraffeDet的新型目标检测架构, 采用独特的“重颈部”设计范式, 通过强化特征金字塔网络的表征能力, 显著提升了多尺度目标检测的精度和鲁棒性。此外, 生成对抗网络(GAN)被用于小目标特征增强, 如Li等13提出的通过对抗学习生成高分辨率特征图。Chen等14提出了一种基于可变形DETR和多级特征融合的白细胞检测方法, 通过改进注意力机制和特征融合策略, 显著提升了血液显微图像中白细胞的检测精度, 为血液疾病辅助诊断提供了有效解决方案。Xu等15提出了一种基于Haar小波的无参数下采样方法, 用于语义分割任务, 在降低计算量的同时保留了多尺度特征信息。

尽管已有研究在小目标检测领域取得了一定的进展, 但随着应用场景的日益复杂, 对小目标检测的准确性和鲁棒性提出了更高的要求。小目标经常在检测过程中被忽视或误判, 这在一定程度上限制了目标检测技术在实际应用中的效能。因此, 探索更为有效的小目标检测方法对于推动目标检测技术的发展和应用具有重要意义。本文的目的在于探索基于YOLOv8的小目标检测方法, 旨在优化检测网络结构, 增强模型对小目标特征的学习能力, 从而提高检测的准确性和鲁棒性。基于此, 本文提出一种改进的YOLOv8小目标检测算法, 通过融合SPD_Conv16(空间金字塔深度可分离卷积)增强多尺度特征提取, 结合Bi_Level Routing Attention17(双层路由注意力)实现高效区域特征筛选, 并引入FrFT(分数阶傅里叶变换)提升频域抗噪能力。相较于原始YOLOv8模型, 改进后的模型在小目标检测任务中的平均精度(AP)有显著的提升, 并且显著地降低了小目标的误检和漏检率。

1 改进的YOLOv8检测模型

YOLOv8算法在目标检测中一直是研究热点, 其保持了检测精度和检测速度的均衡, 但在小目标检测方面, 这些算法仍存在一定的局限性。小目标由于其尺寸小、 特征不明显, 常常在检测过程中被忽视或误判, 基于此, 提出了一种改进YOLOv8的小目标检测方法, 具体工作如下:

1) 针对传统的步长卷积和池化过程中的信息丢失, 在YOLOv8算法的主干部分添加SPD_Conv可以避免这种信息丢失, 有助于提高模型对小物体和低分辨率图像的处理能力。

2) 针对检测过程中的复杂度, 提出一种FT_Conv, 通过优化的频域处理, 可以在不显著增加计算负担的情况下提升性能, 通过结合分数阶变换和注意力机制增强了特征提取能力。

3) 针对注意力机制所带来的巨大计算负担和内存开销, 融合了C2f_Bi Level Routing Attention实现更灵活的计算分配和内容感知, 使其能够动态感知并聚焦于最相关的信息, 减轻了计算负担和内存开销。

4) 针对锚框面积扩大问题和收敛速度问题, 引入Powerful_IOU替代YOLOv8中的IoU来加速模型收敛, 从而提升模型的泛化性。

改进后的YOLOv8模型如图 1 所示, 改进模块用黑色边框突出显示。

1.1 SPD_Conv

小目标检测面临的挑战主要体现在信息丢失和尺度适应两个方面。在信息层面, 传统卷积神经网络的下采样操作会带来严重的信息损失问题。首先, 空间信息的压缩导致小目标特征逐渐消失, 这主要源于传统下采样方法的固有缺陷: 步长卷积的“跳跃采样”特性会“跳”过部分像素, 如stride=2卷积仅计算每隔一个像素的值, 导致边缘、 纹理等高频细节丢失; 池化操作则会造成不可逆的信息丢失, 例如, 最大池化仅保留局部区域的最大值而丢弃其他信息, 这可能会将小目标的特征信息直接丢弃; 平均池化会模糊特征, 降低局部特征的区分度。这些下采样方法使得原本特征信息较少的小目标丧失了可检测性。其次, 语义信息在深层网络中不断稀释, 由于大目标在梯度回传过程中占据主导地位, 小目标的特征响应会被逐渐淹没。在尺度适应方面, 现有方法难以应对实际场景中巨大的尺度差异, 特别是对于低分辨率图像中的小物体, 其本身包含的特征信息就比较少, 而传统的下采样方法则会进一步造成信息丢失, 导致模型更难以学习到有效的特征。

针对小目标检测的挑战, SPD_Conv(Space-to-Depth Convolution)通过重新设计下采样方法, 解决了传统方法导致的信息丢失问题。其中, SPD_Conv由两个关键组件构成: 空间到深度(SPD)层和非步长卷积(Conv)层。在空间处理维度上, SPD层将每个2×2的局部区域转换为4通道的子特征, 该操作避免了传统下采样方法的信息丢失问题。相比传统下采样方法仅有25%的位置参与梯度回传, SPD层能够实现100%位置的梯度更新, 从而有效缓解了深层网络中小目标可检测性差的问题。SPD_Conv使得模型在处理低分辨率图像和小目标时, 也能够保持空间信息的完整性, 大幅提升了网络对细粒度信息的处理能力。

图 2 为scale=2时的SPD_Conv示意图, scale表示空间下采样的缩放因子(Scaling Factor), scale=2指特征图的空间分辨率(高度和宽度)被缩小为原来的1/2。图 2 中 (a) 为输入特征图, 原始输入为三维张量XRS×S×C1, 空间分辨率S×S, 通道数C1; 标注的(ij)坐标表示特征图上的具体空间位置, 其中0≤ijS-1; 每个网格单元代表一个特征向量xijRC图 2 中 (b) 为特征图分解, 将原特征图划分为S/2×S/2个2×2块, 每个块内的4个像素[(x2i,2j), (x2i+1,2j), (x2i,2j+1), (x2i+1,2j+1)]被转变为深度维度, 如图 2 中 (c) 所示。对4C1个通道进行维度重排, 并利用1×1的卷积核进行线性变换。最后得到分辨率减半、 通道数可调的输出特征图 (e)。

1.2 FT_Conv

分数阶傅里叶变换(FrFT)18是对传统傅里叶变换的一种拓展, 它突破了传统傅里叶变换只能进行整数次变换的限制, 允许对信号开展非整数次的变换操作, 其核心优势在于能够在时域和频域之间实现任意角度的变换。

对于给定的一个信号f(x), 其p阶的FrFT可以通过积分形式定义为

Fpf(x)(u)=-fxKpx,udx,

式中: Kp(x,u)为FrFT的核函数; p为变换的阶数。

核函数Kp(x,u)的具体表达式为

Kp(x,u)=1-icot α·
exp iπx2cot α-2xucsc α+u2cot α,

式中: α=pπ2

FrFT具备周期性这一重要性质, 具体表现为

Fp+4{f(x)}=Fpfx

基于这一性质, 在实际计算过程中, 通常可以将p的取值范围限制在[0, 4)这个区间内来进行相关运算。

此外, FrFT还是一种线性变换, 满足线性关系

Fp{af(x)+bg(x)}=
aFp{f(x)}+bFpgx,

并且它是可逆的, 其逆变换对应的就是Fp

图 3 所示为FT_Conv模块的工作流程。FT_Conv模块是一种专为小目标检测设计的卷积神经网络模块, 它结合了FrFT的理论基础和传统卷积操作, 通过双分支并行结构强化小目标特征提取能力: 空间分支(SPU)采用多尺度卷积(3×3和5×5并行)捕捉局部细节, 频域分支(FPU)则利用FrFT优化高频特征表示并抑制背景干扰, 从而实现对高频成分的增强。该模块通过多尺度卷积适应不同尺寸目标, 并结合通道注意力和空间注意力机制动态调整特征融合的权重。同时, 通过残差连接和特征拼接策略保留多尺度信息, 并采用高频增强滤波器提升小目标的特征响应。在处理卷积神经网络的特征图时, FT_Conv将特征图从空间域转换到频域, 通过调整变换的频率参数灵活地强调或抑制某些特征, 从而提取和学习到小目标的细节和纹理特征。

SPU模块如图 4 所示, 输入32通道(32×H×W)的特征图, 首先通过通道分割分成两个16通道数据, 分别经过3×3卷积保留局部细节和5×5卷积捕获更大范围的上下文信息, 再将两路结果相加, 融合多尺度信息, 最后与原始输入的另外16通道的数据进行拼接, 恢复为32通道输出。整个模块通过并行多尺度卷积结合残差拼接, 在保持输入输出维度一致的同时, 整合了多种不同尺度的特征。

FPU模块如图 5 所示, 输入32通道(32×H×W)的特征图先被均等分割成4个8通道的子特征, 分别进行不同频率参数(f=0.25/0.50/0.75/1.00)的FrFT, 通过调整变换的频率参数来控制核函数的振荡频率, 最后将处理后的4个子特征重新合并为32通道输出。该模块利用不同频率参数进行频域分解与融合, 在保持特征图尺寸大小不变的前提下, 提取了不同频段的信息。

FrFT模块的卷积核由式(5)计算所得, 其中, xiyj 是网格坐标(归一化到[1, kernel_size]区间), f是频率参数控制核函数的频率范围, 通过f=0.25, 0.50, 0.75, 1.00生成不同频率的核, 共同实现多尺度特征提取。

Wi,j,f=cos-fxisin p+f2+xi22tan pcos-fyjsin p+f2+yj22tan p

1.3 C2f_BiLevel Routing Attention

小目标分辨率低、 特征弱、 遮挡率高, 因此, 小目标检测是计算机视觉中的经典难题。C2f_BiLevel Routing Attention是BiFormer模型中的核心组件, 通过动态稀疏注意力机制来解决小目标检测存在的问题, 动态筛选关键区域, 从而更加关注小目标所在的区域。该模型通过内容感知, 只关注与查询最相关的一小部分键值对。C2f_BiLevel Routing Attention包含两个主要步骤: 区域级路由(Coarse Region Level)和令牌级注意力(Token-Level Attention)。

区域级路由: 首先, 模型构建一个区域级关联图, 通过矩阵乘法计算区域间的语义关联度。然后, 对于每个区域, 模型保留与其他区域中最相关的前k个连接, 这可通过top-k操作来实现。这样, 每个区域只需要关注被路由到的top-k区域。

令牌级注意力: 确定了要关注的区域后, 模型在这些区域的并集中应用细粒度的令牌到令牌注意力。这一步涉及到从路由区域中收集键值对, 然后进行注意力计算。

通过区域级路由和令牌级注意力的结合, C2f_BiLevel Routing Attention保留了小目标区域, 增强了局部细节(边缘/纹理), 并通过双层路由来结合局部与全局信息, 同时保持了对长距离依赖的捕捉能力。

图 6 所示, 将特征图划分为S×S个非重叠区域, 每个区域包含HWS2个token。对每个token计算Query、 Key、 Value, 再对每个区域的Query和Key取平均值, 得到区域级表征, 然后计算区域间亲和度矩阵, 保留最相关的k个区域Top-k, 再进行Token级注意力(细粒度计算), 从特征图中收集Top-k的Key和Value, 对每个Query token, 仅计算已筛出的Key/Value的注意力, 整个过程通过粗粒度路由(区域筛选)+细粒度计算(Token级注意力)实现动态稀疏性。

1.4 Powerful⁃IoU

边界框回归(Bounding Box Regression, BBR)是目标检测中的核心任务之一, 而BBR的损失函数对其性能影响很大。为了解决这个问题, 先对不同的IoU进行理论分析, 常用的IoU包括GIoU、 CIoU、 EIoU以及SIoU。

图 7 所示为基于不同IoU的损失函数指导下的锚框回归过程。训练轮数(epoch)从左到右分别为20, 40和60 epochs, 图中的横纵坐标分别表示归一化的坐标, 用来表示target box和initial anchor box之间的相对位置关系, 填充彩色的框是在回归过程中由不同损失函数引导的锚框。由图 7 可以看出, 这些IoU引导的锚框都存在面积扩大问题, 且收敛速度缓慢。分析其原因是损失函数受到不合理的惩罚因素的影响, 如: 使用诸如锚框和目标框的最小外部边界框的对角线长度或面积等维度信息作为损失因子的分母, 虽然可以使得损失值在一个合理的范围内变化, 有助于模型的收敛, 也可以使损失函数对目标的尺寸变化具有一定的鲁棒性和平衡不同误差项的作用, 但是会导致锚框在回归过程中膨胀, 显著减缓收敛速度。

为解决该问题, 引入一种结合了目标尺寸自适应惩罚因子和基于锚框质量的梯度调节函数的Powerful-IoU (PIoU)损失函数。PIoU损耗仅使用目标框的边缘长度作为损耗因子的分母, 有效地解决了面积扩大问题。PIoU损耗引导锚框沿着有效路径回归, 从而可以比现有的基于IoU的损耗更快地收敛, 同时引入了一个非单调注意层, 将其与PIoU结合, 增强了对中等质量锚框的聚焦能力。

图 7 可知: 以PIoU损失为导向的锚盒最快回归到接近目标盒。同时, PIoU损失引导的锚盒不存在面积扩大问题, 而其他损失函数引导的锚框都存在面积扩大问题。

图 8 为PIoU的损失函数示意图, 损失函数计算如式(6)19所示。

LPIOU=LIOU+1-e-p2, 0LPIOU2,
P=14dw1wgt+dw2wgt+dh1hgt+dh2hgt

2 实验与分析

2.1 数据集

本文使用的数据集有两个, 分别为VisDrone2019数据集和自制的SmallDroneDataset数据集。

2.1.1 VisDrone2019数据集

该数据集由天津大学机器学习和数据挖掘实验室AISKYEYE团队收集。包括288个视频片段, 由261 908帧和10 209幅静态图像组成基准数据集, 由多种无人机摄像头捕获, 遵循了数据集的多维覆盖原则, 覆盖范围广泛, 包括不同位置(来自中国相隔数千公里的14个不同城市)、 不同环境(城市和农村)、 不同的天气(阴天、 晴天、 雨天等)、 不同的光照条件(白天、 黑夜、 黄昏等)、 不同物体(行人、 车辆、 自行车等)和不同密度(稀疏和拥挤)的场景。本数据集中一共标注了超过260万个日常目标, 比如行人、 汽车、 自行车和三轮车。官方提供的数据中, 训练集为6 471张, 验证集为548张, 测试集为1 610张。数据集共提供了12个类, 分别为忽略区域、 pedestrian、 people、 bicycle、 car、 van、 truck、 tricycle、 awning-tricycle、 bus、 motor和others, 其中忽略区域和others是非有效目标区域, 本实验中予以忽略。

由于VisDrone数据集的标注文件不是YOLO直接可以训练的格式, 所以需进行转换。转换步骤如下: 1) 读取原始数据集中的图像文件和对应的XML或JSON标注文件; 2) 将这些标注文件中的类别信息和bounding box坐标转换为YOLO所需的文本格式, 即每个图像对应一个.txt文件, 文件中每行包含目标的类别索引和归一化后的中心点坐标以及宽度和高度; 3) 创建类别映射, 将类别名称映射到连续的数字ID; 4) 根据需要调整图像尺寸以适应YOLO模型的输入要求; 5) 将数据集划分为训练集、 验证集和测试集; 6)生成YOLO配置文件, 指定数据集路径、 类别数量和图像尺寸等信息, 使其能够被YOLO框架直接用于训练。

2.1.2 自制的SmallDroneDataset数据集

该数据集共包括3 450幅静态图像, 采用DJI Mavic 3 Enterprise进行拍摄, 为了确保模型在真实场景中的泛化能力, 在数据采集阶段严格遵循了多维度覆盖原则, 具体体现在: 类别多样性(包括行人、 车辆、 巴士以及卡车等类别), 场景复杂性(包括不同光照条件、 不同天气、 不同时间段以及拍摄角度等), 数据的覆盖范围广。为避免单一设备拍摄的画面对模型泛化能力的影响, 从网络搜集了其他型号无人机拍摄的画面, 共同制成数据集。然后利用LabelImg对感兴趣的目标框进行标注, 包括pedestrian, people, bicycle, car, van, truck, tricycle, awning-tricycle, bus, motor。最后数据集划分为训练集2 588幅, 测试集644幅, 验证集218幅。

图 9 所示为SmallDroneDataset的部分图片, 遵循多维覆盖原则, 如左上角图片为低角度拍摄, 右上角图片为高角度拍摄, 左下角图片存在大面积遮盖, 右下角图片为夜间拍摄, 数据覆盖维度较广。

2.2 评估指标

小目标检测算法的性能评估主要有:

1) 均值平均精度(mAP): 这是衡量小目标检测精度的核心指标, 反映了模型对图像中小目标的识别能力。mAP值越高, 表明模型的检测精度越高, 对小目标的识别效果越好。

2) 查准率(Precision): 针对特定类别, 衡量识别出的目标中识别正确的数量占比。Precision表示所有被检测为正例的情况下, 实际为正例的比例。

3) 召回率(Recall): 表示在所有真实正例中, 能被模型正确检测到的比例。召回率反映了模型找到所有相关案例的能力。

4) 参数量(Params): 模型所有可学习参数(如卷积核权重、 全连接层参数)的总和, 用于衡量模型的复杂度, 通常以百万级或十亿级计。

2.3 实验配置

本次实验在win11操作系统环境下进行, 具体实验配置如下: 系统搭载了12个虚拟CPU核心, 采用Intel Xeon Platinum 8352V处理器, 主频为2.10 GHz, NVIDIA RTX 3080显卡, 20 GB显存。实验基于深度学习框架PyTorch 1.11.0进行模型训练。在开始模型训练之前, 对模型配置文件进行优化设置, 包括将输入图片像素的大小统一调整为640×640。训练过程中, 训练轮数设定为300轮, 批量处理大小设定为16。选用的优化器是SGD(随机梯度下降), 优化器动量参数设置为0.937。初始学习率设定为0.01, 同时, 为了正则化模型, 权重衰减系数设置为0.000 5。在上述实验配置下完成小目标检测算法的训练。

2.4 实验结果

2.4.1 训练结果分析

本文所改进的模型在目标检测任务中表现出了卓越的性能。如图 10 所示, 模型准确地识别出了包括行人、 自行车、 汽车在内的多种交通参与者, 且大多数检测框与目标轮廓重叠, 证明了本文改进算法的准确性; 在目标间存在遮挡或距离较远的情况下仍然能够识别, 证明了改进后模型的鲁棒性。综上证明本文模型在自动驾驶和交通监控等应用场景具有实际应用价值。

2.4.2 热力图

图 11 为本文所改进的模型在小目标检测时的热力图, 色彩的强度用于表示模型对行人存在的置信度。图中的高亮区域与图片中实际目标所在位置大部分重合, 证明了模型在小目标检测方面的准确性, 且原图片为夜间图片, 光线较差, 因此, 该检测结果也证明了本文改进模型在复杂场景下的鲁棒性和适应性。

2.4.3 消融实验

基于SmallDroneDataset数据集, 在环境配置和训练参数一致的情况下进行消融实验, 实验结果如表 1 所示。其中, 模型A是在YOLOv8算法的基础上引入了SPD(space to depth)模块, 模型B是在模型A的基础上融合了FT_Conv, 模型C是在模型B的基础上使用了C2f_BiLevel Routing Attention, 模型D是在模型C的基础上将原版IoU替换为Powerful-IoU。

表 1 可以看出, 相比YOLOv8, 模型A的mAP50值上升了1.804百分点, mAP50-95值上升了1.379百分点, 准确率和召回率分别提升了1.064百分点和0.728百分点。以上结果表明, 在YOLOv8算法的主干部分添加SPD_Conv有效地避免了传统的步长卷积和池化过程中的信息丢失, 可以提高算法对小物体和低分辨率图像的处理能力; 相比模型A, 模型B的mAP50-95值提升0.095百分点, 而参数量只增加了2.8×106个, 表明通过优化的频域处理, 可以在不显著增加计算负担的情况下提升性能; 模型C中用C2f_BiLevel Routing Attention代替了原版的C2f, 相比模型B, 其mAP50mAP50-95指标分别提升了0.988百分点和0.456百分点, 准确率提升了3.042百分点, 且参数量减少了4.6×106个, 在减轻计算负担和内存压力的同时实现了更灵活的计算分配和内容感知; 模型D用Powerful-IoU替换了原版的IoU, 相较于模型C, 其mAP50mAP50-95指标分别提升了0.751百分点和0.365百分点, 准确率提高了4.597百分点。最终, 改进版YOLOv8比原版YOLOv8的mAP50mAP50-95指标分别提升了3.287百分点和2.295百分点, 准确率和召回率分别提升了4.836百分点和1.027百分点, 证明改进YOLOv8算法的小目标检测性能有一定的提升。

图 12 可以看出, 所有模型的精确率随着训练轮数的增加而提高, 最终趋于稳定。模型C的精确率在大部分训练过程中高于其他模型; 各模型的召回率同样随着训练轮数的增加而提高。模型C在召回率上也同样表现优异, 显示出了较好的性能; 模型C在mAP@IoU=0.5指标上的表现优于其他模型, 其mAP50值明显高于模型A、 模型B和YOLOv8; 模型C在mAP50-95这个更严格的指标上也显示出了较好的性能, 其曲线在训练过程中始终位于其他模型之上。总体来说, 模型C在所有性能指标上都显示出了较好的性能, 这表明模型C具有较好的学习能力和收敛性, 在这次实验中的整体表现更优, 证明了改进的有效性。

表 2 为不同模型在SmallDroneDataset数据集上的实验结果。模型A是在YOLOv8中融合了SPD(space-to-depth)模块; 模型E是在YOLOv8的基础上结合了FT_Conv; 模型F是在YOLOv8的基础上引入了C2f_BiLevel Routing Attention来代替原版的C2f。

表 2 可以看出, 相比YOLOv8, 模型E的mAP50提升了0.71百分点, mAP50-95提升了0.829百分点, 参数量增加了2.4×106个, 以上结果证明, FT_Conv通过结合分数阶傅里叶变换和通道注意力机制, 增强了模型对多尺度和多方向特征的捕捉能力, 从而提高了目标检测的准确性。这种设计有助于模型在保持计算效率的同时提升对小目标和复杂背景中目标的检测性能。相比YOLOv8, 模型F的mAP50提升了0.794百分点, mAP50-95提升了0.892百分点, 参数量减少了5×106个。以上结果说明, YOLOv8结合C2f_BiLevel Routing Attention, 通过动态稀疏注意力和双层路由机制优化了计算分配和内容感知能力。

图 13 可以看出, 相比YOLOv8, 模型A、 模型E和模型F的各项性能指标均有显著提升。在准确率方面, 模型A、 模型E和模型F的曲线均略高于YOLOv8, 证明它们在识别正类样本方面具有微弱优势。模型A在召回率上的表现较为突出, 其曲线显著高于YOLOv8, 这表明模型A捕捉正类样本的性能有显著提升, 而模型E和模型F则在召回率上略有提升。在mAP@IoU=0.5指标上, 模型E和模型F的曲线同样略高于YOLOv8, 这在一定程度上反映了它们的平均精度有轻微提升; 模型A的曲线则显著高于YOLOv8, 这不仅证明了其在平均精度上的显著优势, 也突显了其在模型改进上的有效性。在更为严格的mAP50-95指标下, 模型E和模型F的曲线略高于YOLOv8, 显示了它们在更广泛IoU阈值范围内的性能提升, 而模型A的曲线则再次显著超越了YOLOv8。

综合上述指标可以得出结论, 模型A在所有测试的性能指标上均展现出了显著的改进效果, 而模型E和模型F虽然提升幅度较小, 但也在大多数指标上显示出了较好的改进效果, 证明了模型改进的有效性。

2.4.4 Powerful-IoU模块性能的验证实验

为了验证不同IoU对模块性能的影响, 在SmallDroneDataset数据集上开展了实验, 结果如图 14 所示。模型D是在模型C中引入Powerful_IoU, 模型G是在模型C中引入Inner_IoU20, 模型H是在模型C中引入Shape_IoU21, 模型I是在模型C引入Shape_Inner_IoU。

图 14 可以看出, 虽然模型D持续训练至120轮左右而其他模型(G/H/I)在90轮左右时就停止, 但这是正常现象。主要原因是不同模型的收敛速度存在自然差异: 模型D的各项指标在90轮后仍保持稳定提升趋势, 说明仍在有效学习阶段, 此时其他模型的评估指标已进入平台期, 触发了早停机制自动终止训练。这种差异完全符合深度学习训练规律, 所有模型都达到了各自的性能最优状态, 实验数据真实可靠, 不影响结果的有效性和可比性。

模型D在多个关键性能指标上展现出了卓越的性能。在准确率(Precision)方面, 模型D的曲线显著高于其他模型, 这表明其在预测正类样本时的准确性有显著提升。在召回率(Recall)指标上, 模型D同样表现突出, 其曲线的优越性证明了其在识别所有正类样本方面的高效率。此外, 在mAP50(平均精度均值在IoU阈值为0.5时)和mAP50-95(平均精度均值在IoU阈值为0.5~0.95时)这两个衡量模型整体性能的严格指标上, 模型D的曲线均显示出显著的领先优势。

这些性能指标的显著提升证明了Powerful-IoU在小目标检测中的有效性。Powerful-IoU作为一种改进的损失函数, 通过更加精确地衡量预测框与真实框之间的重叠程度, 可以使模型更好地学习和优化, 从而能在小目标检测任务中实现更高的准确率和召回率。这一点在模型D的性能表现中得到了明确的体现, 验证了Powerful-IoU的有效性。

2.4.5 不同算法的对比实验

为了进一步验证本文所提出的模型在小目标检测中的有效性, 将改进后的YOLOv8与目前主流的目标检测算法在VisDrone2019数据集上进行了对比实验, 其中包括一些无锚框的算法, 默认仅计算mAP指标, 为了增强比较的全面性和普适性, 仍然将相关数据列入表中, 空白数据用“—”表示, 实验结果见表 3

表 3 可以看出, 改进后的YOLOv8模型在目标检测任务中表现出色, 其精确率(P)达到了52.627%, 召回率(R)达到了41.915%。IoU为0.5时的平均精度(mAP50)为42.397%, 而IoU为0.5~0.95的平均精度(mAP50-95)为25.707%。与YOLOv5系列模型相比, 改进YOLOv8的性能有明显提升。YOLOv5系列的模型, n、 s、 m、 L、 x模型性能逐步增强, 但改进YOLOv8性能相较于YOLOv5x, 在mAP50mAP50-95两项指标中, 分别有0.012和0.01的提升; 与YOLOv4相比, 改进YOLOv8的mAP50mAP50-95也显示出更好的性能。与其他一些模型如Faster R-CNN、 Retina Net等相比, 改进YOLOv8的性能仍具有优势, 这进一步证明了改进YOLOv8在目标检测任务中的优越性能。综上所述, 改进YOLOv8模型在目标检测的关键性能指标上超越了许多现有的流行模型, 证明了其在小目标检测领域的实用性和有效性。

3 结 论

本文提出了一种改进的YOLOv8的小目标检测方法, 并在多个数据集上进行了实验。在VisDrone2019数据集上的实验结果表明, 本文改进的YOLOv8算法将准确率、 召回率、 mAP50mAP50-95分别提升至52.627%、 41.915%、 42.397%和25.707%, 性能相较于其他流行模型仍具有性能优势, 这证明了改进模型的有效性。在SmallDroneDataset数据集上的试验结果表明, 相较于YOLOv8, 改进YOLOv8算法的准确率、 召回率、 mAP50mAP50-95等指标分别提升了4.836百分点、 1.027百分点、 3.287百分点和2.295百分点, 并能够有效解决小目标检测过程中小目标的漏检问题和特征近似的目标的误检问题, 模型优势明显, 证明了改进的YOLOv8算法的泛化能力和有效性。

参考文献

[1]

REN SHE KGIRSHICK Ret al. Faster R-CNN: Towards real-time object detection with region proposal networks[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence201739(6): 1137-1149.

[2]

REDMON JDIVVALA SGIRSHICK Ret al. You only look once: Unified, real-time object detection[DB/OL]. (2015-05-09)[2025-01-06].

[3]

YANG JWANG T. Small object detection model for remote sensing images combining super-resolution assisted reasoning and dynamic feature fusion[J]. Journal of Applied Remote Sensing202418(2): 028503.

[4]

YIN QHU QLIU Het al. Detecting and tracking small and dense moving objects in satellite videos: A benchmark[J]. IEEE Transactions on Geoscience and Remote Sensing202260: 5612518.

[5]

ZHANG YZHAO HDUAN Zet al. Congested crowd counting via adaptive multi-scale context learning[J]. Sensors202121(11): 3777.

[6]

JIANG HDIAO ZSHI Tet al. A review of deep learning-based multiple-lesion recognition from medical images: Classification, detection and segmentation[J]. Computers in Biology and Medicine2023157: 106726.

[7]

KISANTAL MWOJNA ZMURAWSKI Jet al. Augmentation for small object detection[DB/OL]. (2019-02-19)[2025-01-06].

[8]

AKYON F CONUR ALTINUC STEMIZEL A. Slicing aided hyper inference and fine-tuning for small object detection[C]//2022 IEEE International Conference on Image Processing (ICIP), 2022: 966-970.

[9]

LIU MJIAO LLIU Xet al. Multi-scale contourlet knowledge guide learning segmentation[J]. IEEE Transactions on Multimedia202426: 4831-4845.

[10]

LIN T YDOLLÁR PGIRSHICK Ret al. Feature pyramid networks for object detection[C]//2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2017: 936-944.

[11]

CAO JCHEN QGUO Jet al. Attention-guided context feature pyramid network for object detection[DB/OL]. (2020-05-23)[2025-01-06].

[12]

JIANG YTAN ZWANNG Jet al. GiraffeDet: A heavy-neck paradigm for object detection[DB/OL]. (2022-02-09)[2025-01-06].

[13]

LI JLIANG XWEI Yet al. Perceptual generative adversarial networks for small object detection[C]//2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2017: 1951-1959.

[14]

CHEN YZHANG CCHEN Bet al. Accurate leukocyte detection based on deformable-DETR and multi-level feature fusion for aiding diagnosis of blood diseases[J]. Computers in Biology and Medicine2024170: 107917.

[15]

XU GLIAO WZHANG Xet al. Haar wavelet downsampling: A simple but effective downsampling module for semantic segmentation[J]. Pattern Recognition2023143: 109819.

[16]

SUNKARA RLUO T. No more strided convolutions or pooling: a new CNN building block for low-resolution images and small objects[DB/OL]. (2022-08-07)[2025-01-06].

[17]

ZHU LWANG XKE Zet al. BiFormer: Vision transformer with bi-level routing attention[C]//2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2023: 10323-10333.

[18]

陶然, 齐林, 王越. 分数阶Fourier变换的原理与应用[M]. 北京: 清华大学出版社, 2004.

[19]

LIU CWANG KLI Qet al. Powerful-IoU: More straightforward and faster bounding box regression loss with a nonmonotonic focusing mechanism[J]. Neural Networks2024170: 276-284.

[20]

ZHANG HXU CZHANG S J. Inner-IoU: More effective intersection over union loss with auxiliary bounding box[DB/OL]. (2023-11-14)[2025-01-06].

[21]

ZHANG HZHANG S J. Shape-IoU: More accurate metric considering bounding box shape and scale[DB/OL]. (2023-12-29)[2025-01-06].

基金资助

山西省基础研究计划资助项目(202403021221010)

AI Summary AI Mindmap
PDF (5991KB)

1206

访问

0

被引

详细

导航
相关文章

AI思维导图

/