YOLO十年演进:从实时检测先锋到多任务智能前沿

岑伟迪 ,  江佳玲 ,  黄勃 ,  倪福川 ,  李高健

武汉大学学报(理学版) ›› 2026, Vol. 72 ›› Issue (1) : 5 -20.

PDF (1799KB)
武汉大学学报(理学版) ›› 2026, Vol. 72 ›› Issue (1) : 5 -20. DOI: 10.14188/j.1671-8836.2025.0116
综述

YOLO十年演进:从实时检测先锋到多任务智能前沿

作者信息 +

Ten Years of YOLO Evolution: From Real-Time Detection Pioneer to Multi-Tasking Intelligence Frontier

Author information +
文章历史 +
PDF (1842K)

摘要

目标检测是计算机视觉的基石,在医疗成像、工业缺陷检测、自动驾驶和农业监测等领域有着广泛的应用。YOLO(You Only Look Once)作为单阶段目标检测的开创性算法,以其卓越的实时性和高效性成为计算机视觉领域的核心技术。从2016年YOLOv1的首次亮相到2025年YOLOv12的发布,YOLO通过持续优化网络架构、改进损失函数设计和创新数据增强策略,显著提升了检测性能和应用适配性。本文系统回顾了YOLO长达十年的发展历程,分析了其在不同领域的应用,并探讨了其快速发展背后的驱动力,包括深度学习技术的突破、开源社区的广泛协作以及对实时性和边缘计算的迫切需求。与双阶段算法(如Faster R-CNN)和基于Transformer的方法(如DETR)相比,YOLO在速度和工程部署上展现出显著优势,但在小目标检测、密集场景处理和复杂背景下的鲁棒性方面仍面临挑战。未来YOLO或可通过整合轻量级Transformer模块、优化多任务学习框架以及引入生成式AI增强数据多样性,有望进一步提升精度和场景适应能力。

Abstract

Target detection is the cornerstone of computer vision, with a wide range of applications such as medical imaging, industrial defect detection, autonomous driving and agricultural monitoring, etc. YOLO (You Only Look Once), a pioneering algorithm for single-stage target detection, has become a core technology in the field of computer vision due to its excellent real-time performance and high efficiency. From the debut of YOLOv1 in 2016 to the release of YOLOv12 in 2025, YOLO has significantly improved its detection performance and application suitability through continuous optimization of the network architecture, improvement of the loss function design and innovative data enhancement strategies. In this paper, we systematically review YOLO’s decade-long development history, analyze its applications in different domains, and discuss the driving forces behind its rapid development, including breakthroughs in deep learning technology, extensive collaboration in the open source community, and the pressing need for real-time and edge computing. Compared with two-stage algorithms (e.g., Faster R-CNN) and Transformer-based methods (e.g., DETR), YOLO demonstrates significant advantages in terms of speed and engineering deployment, but its limitation is that it still faces challenges in terms of small-target detection, dense-scene processing, and robustness in complex contexts. In the future, YOLO may be able to enhance data diversity by integrating a lightweight Transformer module, optimizing the multi-task learning framework, and introducing generative AI, which is expected to further improve accuracy and scene adaptation.

Graphical abstract

关键词

YOLO / 目标检测 / 计算机视觉

Key words

YOLO(You Only Look Once) / target detection / computer vision

引用本文

引用格式 ▾
岑伟迪,江佳玲,黄勃,倪福川,李高健. YOLO十年演进:从实时检测先锋到多任务智能前沿[J]. 武汉大学学报(理学版), 2026, 72(1): 5-20 DOI:10.14188/j.1671-8836.2025.0116

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

目标检测作为计算机视觉的核心技术,旨在从图像或视频中识别并定位物体,广泛应用于医疗影像分析、工业缺陷检测、自动驾驶和农业监测等领域。传统目标检测方法依赖手工设计的特征提取,受限于表达能力[1],难以应对复杂场景。2012年,AlexNet引入卷积神经网络(CNN)[2],凭借强大的特征学习能力开启了深度学习时代,显著提升了目标检测的性能。此后,目标检测算法逐渐分为双阶段和单阶段两大流派[3]。双阶段方法(如R-CNN系列)通过候选区域生成和精细回归实现高精度,但计算复杂度高,难以满足实时需求。相比之下,单阶段方法以速度见长,尤其以YOLO(You Only Look Once)为代表,通过一次前向传播同时预测边界框和类别概率,树立了实时检测的里程碑。

自2016年YOLOv1首次发布以来[4],YOLO系列通过持续优化网络架构、损失函数和数据增强策略,演进至2025年的YOLOv12,显著提升了检测性能和多任务适应性。YOLOv8和YOLOv10引入了解耦头和端到端检测设计,拓展了实例分割、姿态估计等任务;YOLOv11通过C3k2和C2PSA模块优化了多尺度特征融合;YOLOv12首次全面融入注意力机制,突破传统卷积网络局限,进一步平衡精度与效率。关于YOLO的综述研究已有积累,如毛少华等[5]聚焦网络结构改进,米增等[6]侧重通用检测应用。

与现有YOLO综述相比,本文剖析了YOLOv8/v10-v12的多任务框架(如实例分割、姿态估计等),补充了现有综述的分析不足;系统总结YOLOv5-v12的轻量化设计对边缘计算的适配性;对YOLOv10的端到端检测设计进行定量分析,为目标检测研究提供新参考。

1  YOLO发展历程与框架原理

目标检测作为计算机视觉领域的关键任务之一,最早可以追溯到20世纪90年代,其核心要义为从图像或视频序列中精准判定物体的存在性、所属类别以及空间位置。此项任务既涵盖分类问题,即将物体归置于预先设定的类别范畴,又涵盖回归问题,即明确物体的精准位置。目标检测算法能够获取目标物体的中心点坐标以及其宽度与高度,绘制出矩形选择框,同时对目标物体的类别予以识别。目标检测算法可划分为两大类:传统检测方法与基于深度学习的检测方法。由于早期缺乏有效的图像表示,因此传统检测方法不得不用手工设计特征提取方法构建可训练模型。它们的基本工作流程:首先在输入图像上滑动不同尺寸的窗口生成候选框,然后运用基于颜色、纹理、形状等特性的分类器展开分类,最终通过非极大值抑制算法剔除冗余的检测框。传统方法的特征表达能力十分有限,因此在模型的分类精准度和泛化能力上有很大的局限。2012年,AlexNet的出现让全世界见证了卷积神经网络强大的特征学习能力,这也是卷积神经网络首次被应用于大规模图像分类任务,标志着目标检测进入了深度学习时代。

作为深度学习目标检测算法中单阶段检测算法的代表YOLO算法从v1发展到v12,及其多个改进版本,已被广泛应用于医学、工业、农业等领域。以下分析YOLO系列算法的基本思想和框架及原理。

1) YOLO目标检测算法的基本思想

YOLO是一种开创性的单阶段实时目标检测方法[4]。在计算机视觉领域引起了一场技术革命,这种方法极大地提高了目标检测的速度,达到实时处理的水平,同时保持了较高的准确性。自YOLOv1问世以来,到目前为止,已经更新到了YOLOv12版本,图1展示了YOLO系列主流目标检测算法的演变历程[7-8]

YOLO系列算法的核心思想是把输入的图像划分成多个网格,每个网格负责检测中心点落在该网格内的目标。它将目标检测转化为回归问题,通过划分网格直接预测边界框和类别概率。在检测过程中,对每个网格进行预测,不仅包括边界框的坐标和尺寸,还涵盖了目标所属的类别信息。这种方式能够实现端到端的快速检测,同时通过引入不同尺度的特征图处理不同大小的目标,提高检测的准确性和全面性。从v1到v12,YOLO不断迭代优化。

2) YOLO系列各版本网络框架及原理

YOLO系列目标检测算法的整体网络由三部分组成:主干网络(Backbone)[9]、颈部网络(Neck)和头部网络(Head)[10]。主干网络提取多尺度特征,颈部网络融合特征,头部网络输出预测结果。主干网络是每一代YOLO的核心部分,通过多层卷积操作将输入图像转换为多尺度、多层次的特征图,用于提取图像特征;颈部网络负责将主干部分提取的特征进行进一步处理和融合,方便模型更好地理解图像特征,检测不同尺寸的目标;头部网络通过接收颈部网络的特征图实现目标分类和定位,其通常会输出一个多维数组,数组中包含每个网格单元的预测信息,包括类别和置信度分数等。图2为YOLO系列算法流程图[4]

1.1 YOLOv1:实时检测的奠基之作

YOLOv1(You Only Look Once)由Redmon等于2016年提出[4],受到GoogleNet[11]和Network in Network的启发,使用1×1的卷积层减少特征图数量并保持较低参数,将输入图像划分为S×S个网格,每个网格产生B个候选框和C个类别概率,最后输出一个多维数组包含上述信息。在VOC 2007数据集[12]上实现了63.4%的mAP(平均精度)。

YOLOv1中,没有显式的颈部网络部分,输入图像尺寸固定为448×448,不可改变。将输入图像划分为S×S个网格,网格中若包含图像中的某个物体的中心点,那么该网格就负责预测该物体;每个中心点会生成2个候选框,每个候选框包含5个值(x,y,w,h,c),其中xy代表候选框中心坐标,w代表候选框与整个图像的宽度之比,h代表候选框与整个图像的高度之比,c代表候选框的类别置信度,计算如下:

c=Pr(Object)IOUtruthpred

其中,Pr(Object)表示候选框是否包含待检测目标,当候选框里有物体时,Pr(Object)=1;当候选框里没有物体时,Pr(Object)=0IOUtruthpred表示候选框与真实框之间的交并比[13],反映两者重叠程度。每个网格还要预测C个类别的概率,因此YOLOv1输出S×S×(B×5+C)维的向量。其中,S表示划分网格的数量,S=7;B表示候选框数量,B=2;5表示为候选框包含的5个值,分别为(x,y,w,h,c)C=20,表示预测的类别数量;由于YOLOv1共有S×S个网格,每个网格产生2个候选框,因此YOLOv1共产生S×S×2个候选框,这些候选框通过非极大值抑制(Non-Maximum Suppression,NMS,一种通过比较置信度剔除冗余边界框的算法)剔除置信度较低的候选框,最终保留5~10个框,称为预测框,最后再通过损失函数计算预测框与真实框之间的差异,进行后续的优化训练。图3为YOLOv1的网络结构图[4]

在当时,YOLOv1仅通过单次前向传播就可以完成检测,避免了滑动窗口带来的冗余计算,大大提高了检测速度,适用于实时应用。但是,每个网格只能产生固定数量的候选框,导致模型对小目标和紧密排列的目标检测效果不佳。另外,YOLOv1无法合理解决图像内目标重叠问题,如果有多个目标落在同一个网格单元内,检测效果将大打折扣。

1.2 YOLOv2:精度与速度的初步优化

为了解决YOLOv1的弊端,YOLOv2的开发团队对YOLOv1做了部分改进[14],主要有以下几点。

1) 主干网络。主干网络使用DarkNet-19用于提取特征,它包含19个卷积层和5个最大池化层,在每一层卷积后使用批量归一化操作[15],并移除全连接层。这样做的好处有两方面:一方面由于卷积层中用到的卷积核尺寸为1×1和3×3,有助于在训练时减少产生的参数;另一方面由卷积层代替CNN网络中的全连接层,将网络结构变为完全卷积结构可以极大地提高模型的收敛速度。

2) 高分辨率分类器。在YOLOv1中,训练数据时使用的图像大小为224×224,而在测试时使用的图像大小为448×448,使模型在实际任务中的表现不佳。YOLOv2在训练开始之前,预定义一组不同的输入图像尺寸,这些尺寸通常是32的倍数,在每10次迭代后,随机选择一个预定义的输入尺寸。在这些迭代中,训练图像将被调整为该尺寸。由于移除了全连接层,模型可以处理不同大小的输入图像。这也是首次将多尺度训练加入YOLO系列网络中,极大提高了模型的泛化能力。

3) 先验框思想。由于双阶段检测器在精度上一直处于领先,为了弥补精度上的不足,YOLOv2借鉴faster-RCNN使用了9种不同尺寸的先验框的模式,对训练产生的框进行k-means聚类,得到一组有代表性的框尺寸[16],通常选取S×S×5个框作为候选框。

经过对YOLOv1的多处改进[17],YOLOv2可以适应不同尺寸的输入,使模型检测小目标的能力获得了很大的提升。

1.3 YOLOv3:多尺度检测的突破

YOLOv3于2018年提出[18],相较于前代版本,整体思想没有变化,因此在速度上依然是当时的检测领跑者。由于单阶段算法的精确度始终被诟病,因此YOLOv3着重优化了主干网络,更好地提取图像特征。YOLOv3借鉴Resnet网络[19],使用DarkNet-53作为主干网络,其网络不再是单一的浅层网络而是包含53个卷积层和残差连接的深层网络,有效缓解了深层网络中的梯度消失问题;其检测头部分借鉴了特征金字塔网络(Feature Pyramid Network, FPN)的思想,通过3个不同尺度的特征图预测目标,并使用更多的先验框尺寸(9种)以分别适配大、中、小物体;同时改进了分类层的逻辑,使用多个逻辑回归分类器来完成多标签分类任务。

1) DarkNet-53主干网络。该网络包含53个卷积层和残差连接。从19层开始,一直到53层,每一层都使用残差连接。在深层网络中,反向传播时会出现梯度消失的问题,导致网络难以训练。残差连接提供了一条允许梯度直接回流的捷径,有效缓解了梯度消失问题。也就是说,残差连接允许原始输入信息直接传递到后面的层,这意味着即使后面的层学习效果不佳,网络也能保留原始信息,不会变得更差。而对于这些学习效果不佳的层,网络赋予一个接近0的权重,忽略掉该层。所以对于残差连接通俗的解释便是“添加后至少不比添加前差”。

2) 特征金字塔网络。该网络旨在有效地处理多尺度的目标。其主要思想是生成多尺度的特征图,从而更好地检测不同大小的目标。特征金字塔网络主要通过自上而下的路径进行特征融合。它从主干网络的高层特征图开始,通过上采样将特征图逐层传递到较低层。这种结构增强了小目标检测能力,因为高层特征图具有较丰富的语义信息。在每个上采样步骤中,来自较高层的特征图与来自相邻较低层的特征图进行相加操作,从而生成更具语义信息的多尺度特征图。

3) 更多的先验框尺寸[20]。为了接受特征金字塔网络不同尺度的特征图,YOLOv3也产生了与之相匹配的不同尺寸的先验框,分别用于预测大、中、小物体。其原理和YOLOv2生成的先验框类似,都是通过聚类的方法,只是数量变成了9个。

4) SoftMax改进。在目标检测任务中,提取图像特征固然重要,但最终的分类任务对模型性能也有很大的影响。当数据集允许一个对象被同时分为多个类别时,由于传统的SoftMax[21]假设类别是互斥的,即一个对象只能属于一个类别,显然不适合多标签分类任务:所以YOLOv3通过使用二元交叉熵损失替代分类交叉熵损失,独立计算每个类别的概率,最终输出各类别概率,从而完成多标签分类任务。YOLOv3在保持高速度的同时,大大提高了多尺度下目标检测任务的精度。

1.4 YOLOv4:技术融合的性能巅峰

在YOLOv3出现后的一段时间,YOLO系列演化都处于停滞状态,直到两年后,Bochkovskiy团队提出了YOLOv4[21]。相较前几代版本,YOLOv4主要从两方面进行了改进,一是网络设计方面,二是数据处理方面。

在网络设计方面,YOLOv4选取CSPDarkNet-53作为主干网络,是将CSPNet(Cross Stage Partial Network)的思想[22]融合进了Darknet53的结构。也就是说,CSPDarkNet-53仍然保持53层卷积和残差连接的主体架构,但引入了CSP连接。CSP连接的核心思想是将特征图分成两部分[23]:一部分通过残差块进行处理,另一部分直接传递到后续层。设输入为x,特征图分割为x1和x2,x1通过残差块处理得到F(x1),然后将x2和F(x1)进行融合得到最终输出。虽然残差连接也能缓解梯度消失问题,但 CSPNet通过结构化的特征图分割和融合进一步优化了梯度流动,提高了网络的计算效率的同时还保留了未处理特征和处理后的特征的多样性,提高了特征表达能力。主干网络末端引入了SPP(Spatial Pyramid Pooling)模块,旨在通过在不同尺度上进行池化,捕捉特征图中的多尺度信息,提高模型的识别能力。其通过在特征图上应用不同尺寸的池化窗口,生成多个不同尺度的特征图,再将这些不同尺度的特征图拼接在一起,形成一个具有多尺度信息的特征图。YOLOv4还引入了路径聚合网络PAN,其包含一个自底向上的路径、一个自顶向下的路径和一个横向连接[24]。底层特征图包含更多的细节信息,适合检测小目标;顶层特征图包含更多的语义信息,适合检测大目标,不同尺度的特征图负责检测不同大小的目标;横向连接将自顶向下路径中的特征图与自底向上路径中相同尺度的特征图进行融合。通过双向路径实现更充分的多尺度和多层次特征融合,增强了整体检测性能,如图4所示[21]

在数据处理方面,YOLOv4引入了许多特殊的训练技巧,提出了BoF策略,其中比较出名的便是参考CutMix方法的一种新的数据增强技术[5]:Mosaic。它通过将四张不同的图片拼接在一起,形成一张新的训练图像。由于拼接后的图像使模型在训练时看到了更多样化的背景和目标,这种方式不仅增强了模型的鲁棒性,还在一定程度上缓解了数据集不足的问题。YOLOv4还采用了CIoU损失函数(Complete Intersection over Union Loss),考虑了边界框的中心点距离、面积比和长宽比等因素,从而更全面地评估预测框和真实框之间的差异,提高了边界框回归的精度。

YOLOv4一个突出的优点是所有实验都是由单GPU完成的,对没有高算力能力的研究人员非常友好,使更多普通人也可以轻松入门目标检测算法。

1.5 YOLOv5:轻量化部署的里程碑

YOLOv5是YOLO系列算法的里程碑之一,其首次将开发环境更换为PyTorch[6]。PyTorch由于易用性、强大的社区支持以及动态计算图的特性,在学术界和工业界都广受欢迎。如果说YOLOv4的亲民性在于硬件,那么YOLOv5的亲民性便是社区的成熟维护,方便研究人员进行二次开发。

YOLOv5是在YOLOv4基础上改进的[6](YOLOv5最新的7.0版本相较于1.0版本也有很大的不同,所以本节只概括最新的7.0版本),改进包括以下几点:

1) 自适应锚框计算和Mosaic数据增强。YOLOv5可进行自适应锚框计算,自动分析数据集并动态调整锚框尺寸和比例,更好地匹配不同目标尺度。在此过程中,用户无需干预,锚框调整过程全自动,减少了调参的复杂性。也对Mosaic进行了一些改进,模型将不再是随机拼接四张图片生成新的训练样本,而是在拼接后进行平滑处理,减少拼接边界对训练的干扰,大大增强了模型对边界目标的检测能力。

2) Focus模块的引入。6.0版本之前,YOLOv5使用Focus模块对图片进行切片操作,实现了输入图像尺寸的缩小,但并不是下采样操作,因为Focus会保留图像的原始信息,不会出现卷积下采样的特征丢失问题。之后YOLOv5使用一个6×6的卷积层取而代之,因为在某些硬件上Focus的操作不容易实现,并且普通卷积也可以使模型架构变得更加统一和简化,便于理解和部署。由于标准卷积是所有深度学习框架和加速库都高度支持的操作,这使得YOLOv5模型在不同的开发环境中更容易迁移和复用。

3) SPPF (Spatial Pyramid Pooling - Fast)模块的引入。SPPF和SPP目的和原理都相同,只不过SPPF通过减少池化操作的次数提高计算效率,只使用一个3×3的池化核,每次池化后的特征图被拼接起来,在保留多尺度特征提取能力的同时大大降低了计算量。

YOLOv5相较于YOLOv4的改进主要集中在轻量化操作上。YOLOv5也提供了不同规模的模型(如YOLOv5s,YOLOv5m, YOLOv5l,YOLOv5x),用户可以根据实际需求选择合适的模型规模,实现性能与速度之间的平衡。YOLOv5在不同硬件平台上的兼容性更好,尤其是在嵌入式设备和移动设备上,轻量化模型更易于部署。

1.6 YOLOv6:高效推理的再进化

YOLOv6于2022年9月由美团视觉团队发布[25]。该网络借鉴RepVGG结构的重参数化,提出EfficientRep的主干网络,使用一个PAN拓扑颈部网络,借鉴YOLOX[7]的检测头设计了一个高效的解耦头部,采用混合通道策略。另外,该团队还使用增强量化技术实现更快、更准确的检测器。

YOLOv6主干网络的设计灵感来源于RepVGG,核心思想是将复杂的多分支结构简化为单一卷积层的架构,在训练时,使用包含多个卷积和残差分支的复杂结构,以增强模型的学习能力;在推理时,将这些多分支结构的参数合并成一个等效的单一卷积层,以降低计算复杂度,提高推理速度。EfficientRep在训练阶段使用多分支卷积结构和不同的特征融合方式提取特征,其内部也包括了残差连接用于缓解深层网络中的梯度消失问题,使得网络更容易训练;在推理阶段,EfficientRep通过重参数化技术将多分支的卷积核参数合并成一个单一的卷积核。这一过程确保了合并后的单层卷积能够保留训练期间多分支结构所学到的特征,并且大幅减少了计算量。如果多分支结构中存在偏置项,这些偏置项也会在重参数化过程中进行合并,确保推理时的输出与训练时保持一致。

颈部网络的PAN和YOLOv5在设计原则上保持一致,只不过进行了一些优化,用于提升模型性能和效率。YOLOv6在PAN中广泛应用了更轻量的卷积操作和优化的卷积块,这些改进使得PAN在处理多尺度特征时能够以更高效的方式进行融合,从而减少计算负担。在特征融合时,特别注重特征图的对齐和尺度匹配,这种精细化处理有助于减少在不同尺度特征之间融合时的信息丢失,同时动态调整各层特征的权重,这种自适应性使得PAN能够根据不同的输入图像或场景,自主决定特征融合的策略,从而提高了检测的准确性和鲁棒性。

YOLOv6在设计检测头部时参考了YOLOX[7]的设计,采用了一个解耦头部结构。解耦头部将分类任务和定位任务分开处理,这样可以更好地优化每个任务的损失函数,提高检测的精度。

最后该团队使用了增强量化技术而不是简单的模型蒸馏,两者虽都有助于优化模型,但增强量化技术主要关注于在硬件部署时的效率和精度平衡,而模型蒸馏则更关注于压缩模型以减少其复杂度,同时尽量保持高性能。在当时的COCO数据集上达到了35%的精度,推理速度也大大提升。

1.7 YOLOv7:特征聚合的深度探索

YOLOv7的出现,再一次优化了YOLO系列模型的检测效率[26]。YOLOv7的主干网络采用了ELAN(Efficient Layer Aggregation Network)结构,这种设计旨在更高效地聚合不同层次的特征。在模型重参数化和动态标签匹配技术上也进行了提升和改进。

主干网络ELAN的设计目标是更高效地整合多层次的特征,特别是在深层网络中,能够在保持计算量可控的情况下,增强网络的特征提取能力。它通过一种新的特征聚合机制,在不破坏原来梯度路径的情况下不断地提高网络的学习能力,最大化不同层次特征的互补性,从而提高整体的特征表达能力。RepConv是一种重参数化技术模块,其设计思想依然源自RepVGG。YOLOv6的重参数化技术,主要作用在主干网络的卷积模块上,YOLOv7的RepConv模块则是被用在了包括主干网络和头部网络中。YOLOv5中使用的动态标签匹配是通过自动锚框分配实现的,这种方法主要作用于锚框的优化和匹配,而YOLOv7则通过对所有预测框排序,根据IoU和置信度动态选择正样本,更加关注全局的预测框与真实标签的匹配。

YOLOv7具备前两代的优点,依旧具有平民性,可以部署在普通单GPU和云平台上,设置了YOLOv7、YOLOv7-tiny/W6 3种模型。

1.8 YOLOv8:多任务能力的统一框架

YOLOv8由开发YOLOv5的Ultralytics团队发布[27],提供了统一的框架,可以解决目标检测、分割、跟踪、分类、姿态估计等各种计算机视觉任务,因此该框架在网络结构上类似于YOLOv5,使用C2f代替了CSP模块,使用效果更好的解耦头来代替原来的检测头。

C2f模块使用了类似于CSP的特征分块和跨阶段连接方法,与CSP不同的是,C2f模块强调特征的细粒度融合。引入分组卷积和密集连接机制,提供了更高的特征复用率,有助于在多尺度特征融合中实现更高的精度,因此C2f模块可以更高效地捕捉细节信息,提升网络的表达能力。YOLOv5使用耦合设计的检测头,这种设计将分类和回归任务的特征提取融合在同一个网络中。这意味着在检测头中,网络同时处理类别预测和边界框回归,虽然耦合设计可以减少计算量,提高检测速度,效率很高,但因为分类和定位任务的目标不同,耦合设计可能会在某些复杂情况下降低精度,尤其是类别分布不均衡或目标尺寸差异较大时。而YOLOv8的检测头将分类和定位任务的特征提取分成了两个独立的分支。这种解耦设计允许网络更专注于各自任务的特征提取和优化。

1.9 YOLOv9:梯度优化的智能创新

YOLOv9建立在YOLOv7基础上[28],具有两个创新点:可编程梯度信息(PGI)和新的特征聚合网络(Generalized Efficient Layer Aggregation Network,GELAN)。

YOLO系列的早期版本主要使用PAN结构,先自上而下进行特征提取,再自下而上进行特征聚合。这种做法存在如下弊端:当网络深度过大时,反向传播时特征信息丢失严重,无法保证模型对小目标和关键特征的有效捕获。后续有些版本加入了横向连接,但这样也只是以牺牲计算量为代价进行的改进。YOLOv9提出了一个新的概念,称为可编程梯度信息PGI。通过一种辅助可分离分支改进训练过程中的梯度传播,即在训练时多加一条路径用于梯度传播,最大程度地保留特征信息,推理时删除该分支,避免增加计算量。这种灵活的架构确保模型能够更有效地学习和更新权重。

此外,YOLOv9引入了一种新的轻量级骨干架构,广义高效层聚合网络GELAN。相较于YOLOv7的ELAN,GELAN通过梯度路径规划和灵活的计算块设计,提升了特征保留能力和任务适配性。ELAN依赖固定残差连接,适合快速推理但对复杂任务适配性较弱,而GELAN通过PGI辅助分支在训练时保留细粒度特征,推理时移除分支保持高效性。GELAN结合了ELAN和CSPNet的优势,基于梯度路径规划进行设计,减少了计算量和参数数量,在保持网络轻量化和高速度的同时,实现高精度的目标检测。GELAN的另一个好处就是它允许使用任意的计算块作为其基础模块,这使得网络架构更加灵活,可以根据不同的任务需求进行定制和优化。

1.10 YOLOv10:端到端检测的智能巅峰

YOLOv10是由清华大学开发的[29],是YOLO 系列首个实时端到端目标检测模型,其网络结构继承于YOLOv8。YOLOv10提出了YOLO无非极大抑制(Non-Maximum Suppression,NMS)训练的一致双重分配,降低了推理延迟,还提出了轻量级分类头、空间通道解耦下采样和大内核卷积等,以提高模型的效率和准确性。相较于前代版本,它提供了更多的预训练模型。

先前的YOLO系列算法在训练过程中通常利用任务分配学习为每个实例分配多个正样本,这种做法可以产生丰富的监督信号,促进了优化并使模型实现了卓越的性能。但是实时检测要求高效率,显然此前的系列无法满足,因此YOLOv10不依赖于NMS后处理,一对一只分配一个预测。YOLOv10还引入了另一种一对一Head结构,与原始的一对多分支相同,并采用相同的优化目标,使用一对一分配方式来确定标签分配,也就是说在训练时两个Head联合优化,但在推理时仍然利用一对一Head做出预测。这使得YOLO能够进行端到端部署,而不会产生任何额外的推理成本。

常规的YOLO使用步长为2的标准3×3卷积实现下采样操作,这存在一个问题:在下采样过程中会增加计算成本和参数。YOLOv10首先利用逐点卷积调制通道维度,然后利用深度卷积执行空间下采样,最大限度地保留了下采样过程中的信息,不仅减少延迟而且增加了竞争力。另外,在网络的布局上YOLOv10也更加合理,当前目标检测的一个难点就是小目标检测问题,而YOLOv10采用大核深度卷积达到扩大感受野和增强模型能力。相较于前代YOLO的“一对多”标签分配,YOLOv10的“一对一”策略通过一致双重分配消除NMS后处理,显著降低推理延迟。端到端设计和高效标签分配策略,标志着YOLO系列在实时性与精度平衡上的新高度。

1.11 YOLOv11:多任务实时检测的新里程碑

YOLOv11,由Ultralytics开发,并于2024年在YOLO Vision 2024(YV24)会议上发布。它的发布标志着多任务实时目标检测技术的重大突破[30]。基于YOLOv8的架构基础,YOLOv11通过引入C3k2块、SPPF(空间金字塔池化-快速)和C2PSA(并行空间注意力卷积块)等创新组件,显著增强了特征提取能力和模型效率,同时参数比YOLOv8m变体减少22%,实现了精度与计算效率的优异平衡。YOLOv11不仅支持传统目标检测,还扩展至实例分割、姿态估计、定向对象检测(OBB)、图像分类和对象跟踪等多种计算机视觉任务,展现出卓越的多任务适应性。其设计聚焦于实时性与实用性的融合,通过优化训练流程和架构改进,大幅降低推理延迟,同时保持高精度,适配从边缘设备到高性能云平台的多样化部署场景。在COCO数据集上,YOLOv11m变体展现出优异的平均精度(mAP),推理速度和每秒帧数(FPS)均优于前代,凸显其在实时应用中的竞争力。C3k2块增强了跨层特征融合,SPPF模块提升多尺度特征处理能力,C2PSA通过空间注意力机制有效聚焦图像关键区域,从而提升复杂场景和小目标检测的性能。YOLOv11进一步优化了标签分配策略,简化后处理需求,强化了端到端推理流程。相较于双阶段检测方法和基于Transformer的模型,YOLOv11在速度与精度的平衡上更具优势,尤其在小目标和复杂场景中的表现得到改善。模型系列涵盖从纳米(Nano)到超大型(Extra-Large)的多种规模,满足不同资源需求,其中纳米变体在速度和效率上的提升尤为显著,适合移动设备和嵌入式系统的实时应用。YOLOv11通过更灵活的数据增强和优化目标,提升了模型鲁棒性和泛化能力,其开源特性(支持AGPL-3.0和企业许可)促进了社区协作与商业应用的无缝整合,推动了YOLO生态的持续发展。这些进步对自动驾驶、监控系统、医疗成像和工业自动化等领域具有深远影响,YOLOv11的多任务支持和高效率使其成为解决复杂视觉挑战的综合解决方案。

1.12 YOLOv12:注意力驱动的实时检测新标杆

YOLOv12,由Ultralytics于2025年发布[31],是YOLO系列的最新迭代,首次将注意力机制全面融入实时目标检测框架,打破了传统卷积神经网络(CNN)在YOLO系列中的主导地位,显著提升了检测精度,同时保持了卓越的推理速度。YOLOv12基于YOLOv11的架构基础,通过引入区域注意力模块(Area Attention,A2)、残差高效层聚合网络(R-ELAN)以及多项架构优化,实现了精度与效率的优异平衡,适用于对象检测、实例分割、姿态估计、定向对象检测(OBB)和图像分类等多种视觉计算机任务。区域注意力模块通过将特征图均匀划分为多个区域(默认4个,水平或垂直方向),在保持大感受野的同时显著降低计算复杂度。R-ELAN在传统ELAN基础上引入残差连接和优化的特征聚合策略,解决了大模型训练中的收敛难题,同时减少计算量,YOLOv12-L的FLOPs降低31.4×109,展现了更高的计算效率。YOLOv12还通过一系列架构优化进一步提升性能:移除位置编码以简化模型结构,调整多层感知机(MLP)比例(从4降至1.2)以平衡注意力与全连接层的计算负载,采用卷积操作替代线性层以提升计算效率,并集成FlashAttention以优化内存访问,显著降低了推理过程中的内存开销。YOLOv12提供从纳米到超大型的5种模型规模,满足从资源受限的边缘设备到高性能云平台的不同需求,其中纳米变体的速度提升尤为显著,适合实时应用场景如移动设备和嵌入式系统。YOLOv12通过精炼的训练流程和多样化的数据增强技术,显著增强了模型在复杂环境下的稳定性和适用范围。其采用AGPL-3.0许可并支持企业定制,推动了学术界与产业界的深度合作,加速了YOLO生态的持续扩展。与YOLOv11的C2PSA模块不同,YOLOv12引入了自适应的区域注意力机制,特别优化了小目标和高密度场景的检测能力,通过动态特征优化和多层次信息整合,成功应对遮挡物体的识别难题。YOLOv12的多功能性使其在工业自动化等领域的应用前景广阔,凭借高效性与多任务处理能力,成为应对多样化视觉挑战的理想工具。

1.13 YOLO系列算法小结

数据增强对深度学习至关重要,尤其在目标检测中,它能显著提升模型的泛化能力。YOLO利用数据增强提升训练效果,包括旋转、裁剪、缩放、翻转等常见方法。YOLOv4首次引入Mosaic技术,通过拼接四张图像生成多样化训练样本,提高小目标检测能力;YOLOv5优化拼接边界平滑处理,减少噪声干扰。YOLOv7提出动态标签匹配策略,使数据增强能自动调整正负样本分配。YOLOv10进一步引入随机擦除(Random Erasing)和光照变换,增强复杂光照环境下的鲁棒性。

YOLO是一种经典的单阶段目标检测算法,注重速度与精度的平衡。YOLOv4、YOLOv5、YOLOv6等版本通过改进网络结构(如CSPDarknet、EfficientNet)提升性能。损失函数优化方面,YOLOv4采用CIoU损失,结合中心点距离与长宽比优化边界框回归;YOLOv8提出解耦头结构,独立优化分类与定位任务,COCO数据集AP50提升3.2%。非极大抑制(NMS)优化方面,YOLOv9引入软NMS,减少重叠目标误检。在多尺度检测任务中,YOLOv3通过特征金字塔(FPN)增强小目标检测能力,YOLOv5进一步优化自适应锚框匹配,提高检测稳定性。

目标跟踪要求模型在视频帧中识别并跟踪目标。YOLO结合ReID(行人重识别)与跟踪算法(如SORT、DeepSORT),提升目标跟踪精度和稳定性。YOLOv5输出检测框后,DeepSORT通过卡尔曼滤波与外观特征匹配,实现跨帧跟踪,在MOT17数据集上MOTA达68.5%。YOLOv6-N通过重参数化技术压缩模型至4.3×106参数,实现无人机视频实时跟踪,FPS达30。YOLOv9引入可编程梯度信息(PGI),减少长时跟踪中的特征退化问题,ID切换率降低18%。

YOLO不仅用于目标检测,还可拓展至多任务学习。YOLOv8集成Mask R-CNN分支(图5),实现实例分割。YOLOv7结合关键点检测头,支持人体姿态估计,可应用于安防与医疗监护。YOLOv10采用空间通道解耦下采样,优化语义分割。

从YOLOv1的单阶段检测到YOLOv12的注意力驱动架构,YOLO系列不断突破实时目标检测的边界,其演化为计算机视觉领域检测树立了新的标杆。本文对YOLOv1至YOLOv12在开发框架、主干网络、颈部网络和头部网络等方面的演进进行了总结并列于表1

2  YOLO目标检测算法数据集

2.1 目标检测常用数据集

在目标检测领域,数据集扮演着至关重要的角色。因其包含大量标注好的图像数据,模型可以学习如何识别图像中的不同目标,用于训练目标检测模型;除了训练数据集,还有验证和测试数据集。验证集用于在训练过程中调整模型的超参数以及评估模型的性能,而测试集则用于在训练完成后对模型进行最终评估。测试集应与训练集独立且分布相似,以确保模型的通用性和鲁棒性。高质量的大规模数据集推动了目标检测领域的发展。例如,COCO 数据集的复杂性促使了许多创新性模型的产生,这激励研究人员开发更先进的模型来提升性能。

常见的目标检测数据集[5-6]包含以下几种:

Pascal VOC数据集:它是目标检测领域中最早且最具影响力的数据集之一,最初用于PASCAL VOC挑战赛。常见版本包括VOC 2007和VOC 2012。它包含约20个类别的对象,每张图像中可能有多个目标,每个目标都带有边界框和类别标签。在早期的YOLO系列算法中,VOC数据集是最常用的测试模型性能的数据集。

COCO数据集:COCO数据集是目前目标检测领域中使用最广泛的数据集之一,它由Microsoft发布,具有更高的复杂性和多样性。它包含80个类别,图像中通常包含多个目标,且目标的尺度和姿态变化较大,背景也更加复杂。因此COCO数据集的多样性和复杂性使它成为训练和评估YOLO模型的理想选择,尤其是对模型的泛化能力有较高要求的任务。COCO被广泛用于YOLOv3及以后的版本的训练和测试。

ImageNet数据集:ImageNet是一个大规模的视觉数据集,最初用于图像分类任务。尽管如此,ImageNet也包含了用于目标检测的子集。它包含200个类别的对象,图像数量庞大,适合大规模训练。它通常用于模型的预训练,可以利用其大规模数据集的优势,提升模型的初始性能,这种预训练模型可以在COCO、VOC等数据集上进行进一步微调。

KITTI数据集:KITTI是一个专注于自动驾驶的视觉数据集,由卡尔斯鲁厄理工学院(KIT)和丰田技术研究院(Toyota Technological Institute at Chicago,TTI-C)合作创建。它包含多种任务的标注,如目标检测、立体视觉、光流等。该数据集主要关注自动驾驶场景中的物体,如车辆、行人、骑行者等,注释信息包括2D边界框和3D边界框。上述数据集为YOLO模型的训练和评估提供了数据支持,其多样性直接影响评价指标。以下将介绍YOLO常用的评估指标及其计算方法。

2.2 目标检测模型评价指标

YOLO 算法的评估指标采用目标检测算法最流行的单类平均准确率 AP(Average-Precision),AP的计算方式是计算精确率P(Precision)和召回率R(Recall)的曲线,并求取该曲线下的面积,PR 和AP 的计算方式分别如下式所示:

P=TPTP+FP
R=TPTP+FN
AP=(P×R1+R)dR

在AP指标基础上,更为精细的评估指标被研究者划分,mAP表示所有类别AP的平均值,APS、APM、APL分别表示数据集中物体尺寸小、中、大为预设标签,AP50表示预设的IoU阈值为大于50%时预测正确,IoU计算方式如下:

IOU=DRGTDRGT

其中,DR表示预测边界框;GT表示真实边界框。

此外,为了衡量模型复杂度,采用每秒传输帧数FPS、每秒浮点运算次数FLOPs、参数量Param、推理速度Speed评估YOLO。根据论文与开源平台发布的数据,本文整理了YOLO模型在PASCALVOC与MS COCO评估数据集的实验结果于表2表3表2在PASCAL VOC上主要通过mAP和FPS衡量早期的YOLOv1与YOLOv2性能;表3为使用AP、AP50、FPS等细分衡量指标对其余版本YOLO在MS COCO上进行评估。

3  与其他算法的比较

YOLO作为单阶段检测的代表,与双阶段算法和新兴方法相比,各有优劣,其独特定位在于高效性和工程适用性。

1) 与双阶段算法的比较。双阶段算法(如Faster R-CNN)通过候选区域生成(Region Proposal)和精细回归实现高精度。例如,Faster R-CNN在COCO上的AP约为40,AP50达60,但其两阶段流程导致推理速度慢,FPS通常低于10,难以满足实时需求。相比之下,YOLOv10-E的AP为54.4。然而,双阶段算法对小目标和复杂场景的处理更优,其候选区域机制可生成更多边界框,召回率高于YOLO。例如,Mask

R-CNN在小目标分割上的Dice系数可达0.9,而YOLOv8仅为0.89。这一权衡反映了YOLO优先考虑速度,牺牲部分精度以换取实时性。

复杂场景下的差异原因:在小目标检测任务中(如COCO中的AP指标),双阶段算法表现更优。例如,Mask R-CNN的AP可达40,而YOLOv10-N仅为38.5。这种差距源于双阶段算法的候选区域机制能生成更多边界框,覆盖小目标的可能性更高,而YOLO依赖网格划分和有限的预测框数量,可能遗漏未落入网格中心的微小目标。此外,密集重叠场景(如人群监控等)对算法的鲁棒性提出了更高要求。双阶段检测算法通过多阶段筛选机制,能够有效减少漏检情况,而单阶段检测算法如YOLO系列,由于依赖非极大值抑制(NMS)进行后处理,在高度重叠的目标检测中可能出现误删的情况。例如,在多目标跟踪任务中,双阶段检测器结合跟踪算法通常能取得更优的跟踪精度,而YOLO系列模型在相同场景下的表现稍逊,这反映了其在密集目标检测方面的局限性。YOLO可借鉴双阶段算法的区域提议思想,引入自适应网格划分或多阶段候选筛选机制,在不显著牺牲速度的前提下提升小目标和密集场景的召回率。例如,设计动态网格调整策略,根据目标密度自动增加预测框数量。

2) 与Transformer-based方法的比较。近年兴起的Transformer-based检测算法(如DETR)引入全局注意力机制,COCO AP约45,略高于YOLOv8-S的44.9。DETR通过自注意力捕捉目标间关系,对小目标和密集场景的处理优于YOLO,例如其APS可达40以上。然而,DETR的计算复杂度高(FLOPs超200×109),推理速度慢(FPS<20),且需要大规模预训练,部署难度较大。YOLOv10-E凭借端到端设计和轻量化优化(FLOPs仅160.4×109),在边缘设备上更具优势,但缺乏全局上下文建模能力,限制了其在复杂背景中的表现。在复杂低光照背景(如雾霾、夜间)下,DETR通过自注意力机制建模全局上下文,能有效区分目标与噪声,其误检率低于YOLO。例如,在KITTI自动驾驶数据集的夜间场景中,DETR的mAP可达65%,而YOLOv10达不到这个数值,反映了YOLO缺乏全局特征建模能力。在多目标交互场景(如体育比赛视频),DETR利用注意力机制捕捉目标间空间关系,MOTA可提升5%~10%,而YOLO依赖局部特征提取,易受遮挡干扰。YOLO可融合轻量化Transformer模块(如Swin Transformer的局部注意力),增强全局上下文感知能力,同时控制计算成本。针对复杂背景,可以引入背景抑制的预处理模块,或通过自监督学习提升模型对噪声的鲁棒性。

4  发展驱动力与局限性

4.1 发展驱动力

YOLO从2016年的v1迭代至2025年的v12,在短短的10年间实现快速演进,其背后有多种因素共同推动。这种快速发展不仅体现了深度学习领域的技术活力,也反映了算法设计与应用需求的紧密结合。

1) YOLO的快速迭代得益于深度学习核心技术的持续优化。首先,卷积神经网络(CNN)的改进为YOLO提供了更强的特征提取能力。例如,v3引入的DarkNet-53借鉴ResNet的残差连接,缓解深层网络中的梯度消失问题,使模型能提取更丰富的语义信息;v4和v5融合CSPNet,通过跨阶段特征分割优化梯度流,进一步提升性能。其次,损失函数的改进显著增强了检测精度,如v4采用的CIoU损失综合考虑边界框的中心距离、长宽比和重叠面积,相较v1的MSE损失,回归精度提高约10%。此外,数据增强策略的创新也至关重要。v4首次引入Mosaic增强,通过拼接四张图像生成多样化样本,增强模型对小目标和复杂背景的适应性,COCO AP提升约3%。与此同时,大语言模型(如DeepSeek)的兴起为YOLO的优化提供了新助力,其强大的代码生成与分析能力可辅助研究者快速验证网络结构、调试超参数并生成数据处理脚本,从而加速算法设计与实验迭代。这些技术进步共同为YOLO性能的持续跃升奠定了坚实基础。

2) 开源社区的活跃性和开发框架的易用性大幅加速了YOLO的迭代。v5转向PyTorch框架后,受益于其动态计算图和丰富API,降低了开发门槛,使研究者能快速实现新想法并测试改进。例如,YOLOv5的Focus模块最初通过切片操作优化输入分辨率,后因硬件兼容性问题改为标准卷积,这一调整得益于PyTorch的灵活性。此外,开源社区提供了丰富的预训练模型和工具链,如Ultralytics的YOLOv5/v8仓库,吸引了全球开发者参与优化。相比之下,v1-v3使用DarkNet框架时,社区支持较弱,迭代速度较慢。社区生态的繁荣使YOLO从v5起进入快速发展期,例如v6由美团团队开发,v10由清华大学贡献,体现了协作创新的力量。

3) 实时性与边缘计算需求的激增是YOLO快速发展的外部驱动力。在自动驾驶领域,车辆需在毫秒级内识别行人、障碍物等目标,推动YOLO不断优化速度,如v10通过端到端设计将推理延迟降至新低,FPS在嵌入式设备上仍超30。边缘计算的兴起也要求模型轻量化,v5提供的多规模模型(Nano到XLarge)和v6的重参数化技术显著降低参数量(如v6-N仅4.3×106),适配无人机、物联网设备等场景。此外,行业定制化需求促使YOLO适配特定任务,如医疗影像中的肿瘤检测需高精度分割,v8因此引入解耦头和实例分割分支。这些需求驱动YOLO从通用检测向多场景优化演进。

4.2 当前局限性

尽管进步显著,YOLO仍面临挑战:小目标召回率低、密集场景漏检率高、复杂背景下的鲁棒性不足。这些问题限制其在极端条件下的表现。

1) YOLO对小目标的检测能力不足,尤其在早期版本中表现明显。这主要源于网格划分机制:小目标可能未落在网格中心,导致漏检;此外,早期的浅层主干网络(如v1的GoogleNet)难以捕捉细粒度特征。虽然v3引入FPN、v9优化特征融合,但与双阶段算法相比仍有差距。这一问题在遥感图像或密集人群监控中尤为突出。

2) 在目标密集或重叠的场景中,YOLO易产生漏检。例如,当多个目标中心落入同一网格(如v1的7×7划分),模型只能预测有限数量的边界框,导致部分目标被忽略。尽管v2引入先验框、v10优化标签分配策略,缓解了部分问题,但密集场景(如拥挤街道或细胞显微镜图像)仍挑战其能力。NMS(非极大抑制)的冗余抑制也可能误删重叠目标,软NMS虽有改进,但计算成本增加。

3) YOLO在复杂背景或光照变化下的鲁棒性有限。例如,在强光、雾霾或夜间条件下,特征提取易受干扰,导致误检率上升。v3的DarkNet-53虽提升语义表达,但缺乏针对背景噪声的自适应机制。相比之下,基于Transformer的模型(如DETR)通过全局建模更具优势。数据增强(如v10的随机擦除等)缓解了部分问题,但未从根本上解决复杂环境下的泛化难题。

这些局限性表明,YOLO在极端条件下的表现仍有优化空间,需要通过结构创新或数据策略加以突破。

5  结 语

YOLO算法自v1问世以来,历经十年快速演进,已从实时目标检测的先锋演变为多任务智能的前沿代表。本文系统回顾了YOLO从v1到v12的技术演进历程,剖析了其网络结构优化、损失函数改进及数据增强策略的持续进步。YOLO以单阶段设计的简洁性和高效性为核心优势,在速度与精度的平衡上不断突破,逐步拓展至农业监测、工业检测、医疗影像分析等多领域应用,展现出强大的工程适用性与场景适配能力。

YOLO的快速发展得益于深度学习技术的革新、开源社区的协作以及实时性需求的推动。v1开创性的回归思想奠定了基础,后续版本通过DarkNet、CSPNet、GELAN等主干网络的迭代,以及FPN、PAN等特征融合结构的引入,显著提升了检测性能。Mosaic增强、CIoU损失及解耦头等创新进一步优化了模型的鲁棒性和精度。与双阶段算法(如Faster R-CNN)和Transformer-based方法(如DETR)相比,YOLO在实时性与轻量化上占据优势,但在小目标检测、密集场景处理及复杂背景适应性上仍有不足。YOLO的局限性也为其未来发展指明了方向。随着边缘计算和多任务需求的增长,YOLO有望进一步向轻量化与多功能集成方向演进,通过融合新兴技术提升在精度敏感任务中的潜力。轻量化Transformer模块的引入是重要趋势。例如,借鉴Swin Transformer的局部注意力机制,YOLO可增强全局上下文建模能力,同时通过优化计算复杂度适配边缘设备。生成式AI可生成多样化合成数据,增强YOLO在复杂场景(如夜间、雾霾等)的鲁棒性。此外,YOLO可参考RT-DETR的高效注意力机制,设计统一的端到端框架,整合目标检测、实例分割和关键点检测等任务,适配自动驾驶和增强现实(AR)等场景。开源社区的协作和深度学习技术的进步将继续推动YOLO在实时性、精度和场景适配性上的突破,为智能化目标检测提供更广阔的应用前景。

YOLO系列算法的十年演进不仅是目标检测领域技术进步的缩影,也反映了深度学习与实际应用深度结合的趋势。未来通过结构创新与应用定制化,YOLO有望在更多复杂场景中发挥关键作用,推动计算机视觉技术的智能化进程。

参考文献

[1]

FELZENSZWALB P FGIRSHICK R BMCALLESTER Det al. Object detection with discriminatively trained part-based models[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence201032(9): 1627-1645. DOI: 10.1109/TPAMI.2009.167 .

[2]

KRIZHEVSKY ASUTSKEVER IHINTON G.Imagenet classification with deep convolutional neural networks[DB/OL].[2025-01-02].DOI: 10.1145/3065386 .

[3]

吕璐, 程虎, 朱鸿泰, . 基于深度学习的目标检测研究与应用综述[J]. 电子与封装202222(1): 72-80. DOI: 10.16257/j.cnki.1681-1070.2022.0114 .

[4]

LCHENG HZHU H Tet al. Progress of research and application of object detection based on deep learning[J]. Electronics & Packaging202222(1): 72-80. DOI: 10.16257/j.cnki.1681-1070.2022.0114 (Ch ).

[5]

REDMON JDIVVALA SGIRSHICK Ret al. You only look once: Unified, real-time object detection[C]//2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2016: 779-788. DOI: 10.1109/CVPR.2016.91 .

[6]

毛少华, 王文东. 基于深度学习的YOLO系列物体检测算法研究综述[J]. 延安大学学报(自然科学版)202443(2): 88-95. DOI: 10.13876/J.cnki.ydnse.230044 .

[7]

MAO S HWANG W D. Research review of YOLO series object detection algorithms based on deep learning[J]. Journal of Yan’an University (Natural Science Edition)202443(2): 88-95. DOI: 10.13876/J.cnki.ydnse.230044 (Ch ).

[8]

米增, 连哲. 面向通用目标检测的YOLO方法研究综述[J]. 计算机工程与应用202460(21): 38-54. DOI: 10.3778/j.issn.1002-8331.2404-0130 .

[9]

MI ZLIAN Z. Review of YOLO methods for universal object detection[J]. Computer Engineering and Applications202460(21): 38-54. DOI: 10.3778/j.issn.1002-8331.2404-0130 (Ch ).

[10]

WANG L LLI J JKANG F. Crack location and degree detection method based on YOLOX model[J]. Applied Sciences202212(24): 12572. DOI: 10.3390/app122412572 .

[11]

WANG CYEH ILIAO H M. You only learn one representation: Unified network for multiple tasks[J]. Journal of Information Science and Engineering202339(3): 691-709. DOI: 10.6688/JISE.202305_39(3).0015 .

[12]

SIMONYAN KZISSERMAN A. Very deep convolutional networks for large-scale image recognition[C]//International Conference on Learning Representations. Sam Diego: Computational and Biological Learning Society, 2015.DOI:10.48550/arXiv.1409.1556 .

[13]

WANG C YBOCHKOVSKIY ALIAO H M. Scaled-YOLOv4: Scaling cross stage partial network[C]//2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2021: 13024-13033. DOI: 10.1109/CVPR46437.2021.01283 .

[14]

SZEGEDY CLIU WJIA Y Qet al. Going deeper with convolutions[C]//2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2015: 1-9. DOI: 10.1109/CVPR.2015.7298594 .

[15]

EVERINGHAM MVAN GOOL LWILLIAMS C K Iet al. The pascal visual object classes (VOC) challenge[J]. International Journal of Computer Vision201088(2): 303-338. DOI: 10.1007/s11263-009-0275-4 .

[16]

YU J HJIANG Y NWANG Z Yet al. UnitBox: An advanced object detection network[C]//Proceedings of the 24th ACM International Conference on Multimedia. New York: ACM, 2016: 516-520. DOI: 10.1145/2964284.2967274 .

[17]

REDMON JFARHADI A. YOLO9000: Better, faster, stronger[C]//2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2017: 6517-6525. DOI: 10.1109/CVPR.2017.690 .

[18]

IOFFE SSZEGEDY C. Batch normalization: Accelerating deep network training by reducing internal covariate shift[C]//Proceedings of the 32nd International Conference on International Conference on Machine Learning. Lille:PMLR,2015: 448-456. DOI: 10.5555/3045118.3045167 .

[19]

LIN T YMAIRE MBELONGIE Set al. Microsoft COCO: Common objects in context[C]//Computer Vision — ECCV 2014. Cham: Springer, 2014: 740-755. DOI: 10.1007/978-3-319-10602-1_48 .

[20]

LI ZYANG LZHOU F.FSSD: Feature fusion single shot multibox detector[DB/OL].[2025-01-03].

[21]

REDMON JFARHADI A. YOLOv3: An incremental improvement[EB/OL]. 2018arXiv: 1804.02767. DOI: 10.1109/cvpr.2017.690 .

[22]

HE KZHANG XREN Set al.Spatial pyramid pooling in deep convolutional networks for visual recognition[J].IEEE Transactions on Pattern Analysis and Machine Intelligence201537(9): 1904-1916.DOI:10.1109/TPAMI.2015.2389824 .

[23]

MIKOLOV TKOMBRINK SBURGET Let al. Extensions of recurrent neural network language model[C]//2011 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). New York: IEEE Press, 2011: 5528-5531. DOI: 10.1109/ICASSP.2011.5947611 .

[24]

BOCHKOVSKIY AWANG C YLIAO H M. YOLOv4: Optimal speed and accuracy of object detection[EB/OL]. 2020arXiv: 2004.10934. DOI: 10.48550/arXiv.2004.10934 .

[25]

LIU SQI LQIN H Fet al. Path aggregation network for instance segmentation[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2018: 8759-8768. DOI: 10.1109/CVPR.2018.00913 .

[26]

WANG C YLIAO H Y MWU Y Het al. CSPNet: A new backbone that can enhance learning capability of CNN[C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW). New York: IEEE Press, 2020: 1571-1580. DOI: 10.1109/CVPRW50498.2020.00203 .

[27]

YUN SHAN DCHUN Set al. CutMix: Regularization strategy to train strong classifiers with localizable features[C]//2019 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2019: 6022-6031. DOI: 10.1109/ICCV.2019.00612 .

[28]

LI C YLI L LJIANG H Let al. YOLOv6: A single-stage object detection framework for industrial applications[EB/OL]. 2022arXiv: 2209.02976.

[29]

WANG C YBOCHKOVSKIY ALIAO H M. YOLOv7: Trainable bag-of-freebies sets new state-of-the-art for real-time object detectors[C]//2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2023: 7464-7475. DOI: 10.1109/CVPR52729.2023.00721 .

[30]

SOHAN MSAI RAM TRAMI REDDY C V. A review on YOLOv8 and its advancements[C]//Data Intelligence and Cognitive Informatics. Singapore: Springer, 2024: 529-545. DOI: 10.1007/978-981-99-7962-2_39 .

[31]

WANG C YYEH I HMARK LIAO H Y. YOLOv9: Learning what you want to learn using programmable gradient information[C]//Computer Vision — ECCV 2024. Cham: Springer, 2025: 1-21. DOI: 10.1007/978-3-031-72751-1_1 .

[32]

WANG ACHEN HLIU Let al. Yolov10: Real-time end-to-end object detection[J]. Advances in Neural Information Processing Systems202437:107984-108011.DOI:10.48550/arXiv.2405.14458 .

[33]

KHANAM RHUSSAIN M. YOLOv11: An overview of the key architectural enhancements[EB/OL]. 2024arXiv: 2410.17725. DOI: 10.3390/solar5010006 .

[34]

TIAN Y JYE Q XDOERMANN D. YOLOv12: Attention-centric real-time object detectors[EB/OL]. 2025arXiv: 2502.12524.

基金资助

华中农业大学农业智能技术教育部工程研究中心开放课题(ERCITA-KF002)

中国移动浙江公司2023年B域数据应用研发项目

AI Summary AI Mindmap
PDF (1799KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/