GEIT-YOLO模型在智能驾驶中的研究与应用

钱志成 ,  周红志 ,  徐强

盐城工学院学报(自然科学版) ›› 2026, Vol. 39 ›› Issue (1) : 23 -30.

PDF (647KB)
盐城工学院学报(自然科学版) ›› 2026, Vol. 39 ›› Issue (1) : 23 -30. DOI: 10.16018/j.cnki.cn32-1650/n.202601006
计算机应用研究

GEIT-YOLO模型在智能驾驶中的研究与应用

作者信息 +

Research and Application of GEIT-YOLO Model in Intelligent Driving

Author information +
文章历史 +
PDF (661K)

摘要

为解决传统YOLO模型在复杂道路行驶环境中性能差等问题,提出一种基于改进YOLO11n的智能驾驶目标检测模型GEIT-YOLO。为了让边缘信息融合到各个尺度所提取的特征中,提出GEIT模块,其能够把浅层特征中提取到的边缘信息传递到整个backbone上,并与不同尺度的特征进行融合;同时引入门控注意力机制CGLU,通过门控特征调制联合建模通道依赖与空间上下文关系;最后引入LQE检测头通过显式地评估每个边界框的定位质量,优化NMS阶段并且优先选择更高质量的边界框。实验结果表明:与YOLO11n相比,本文所提出的模型GEIT-YOLO在Udacity数据集上Precision、Recall、mAP50、mAP50:95分别提升了5.6%、2.7%、4.2%、2.3%,改进模型在复杂驾驶环境中的表现更加优异,能显著提升模型检测能力。

Abstract

To address issues such as the poor performance of traditional YOLO models in complex road environments, this paper proposes GEIT-YOLO, an object detection model for intelligent driving based on an improved YOLO11n. To enable the integration of edge information into features extracted at various scales, the GEIT module is proposed. It propagates the edge information extracted from shallow features throughout the entire backbone network and fuses it with features at different scales. Concurrently, the CGLU gated attention mechanism is introduced to jointly model channel dependencies and spatial contextual relationships through gated feature modulation. Finally, the LQE detection head is incorporated to explicitly evaluate the localization quality of each bounding box, thereby optimizing the Non-Maximum Suppression (NMS) stage and prioritizing bounding boxes of higher quality. Experimental results show that, compared to YOLO11n, the proposed GEIT-YOLO model achieves improvements of 5.6% in Precision, 2.7% in Recall, 4.2% in mAP50, and 2.3% in mAP50:95 on the Udacity dataset. The improved model demonstrates superior performance in complex driving environments and can significantly enhance detection capability.

Graphical abstract

关键词

目标检测 / 复杂行驶环境 / 智能驾驶 / GEIT-YOLO / 检测头

Key words

object detection / complex driving environments / intelligent driving / GEIT-YOLO / detection head

引用本文

引用格式 ▾
钱志成,周红志,徐强. GEIT-YOLO模型在智能驾驶中的研究与应用[J]. 盐城工学院学报(自然科学版), 2026, 39(1): 23-30 DOI:10.16018/j.cnki.cn32-1650/n.202601006

登录浏览全文

4963

注册一个新账户 忘记密码

随着经济的快速发展,汽车已经成为人们出行的主要方式之一,但是随着汽车数量的增多,一系列的安全问题也随之而来,其中尤为严峻的问题之一就是在复杂的行驶环境中交通安全问题1。与此同时,智能技术也在迅猛发展,其在智能交通的应用前景日益广阔,故智能驾驶技术2便成为解决交通安全问题的关键技术之一。然而,智能驾驶技术的安全性和可靠性在很大程度上依赖于对周围环境的精准感知,其中目标检测技术作为核心组成部分,负责实时识别道路上的行人、车辆、障碍物等物体。目标检测的精度直接影响智能驾驶车辆的决策能力,因此,如何在复杂多变的驾驶场景中实现高效、准确的检测,成为当前研究的热点和难点。
目前深度学习目标检测算法3大致可分为单阶段目标检测算法4和二阶段目标检测算法5,其中,单阶段目标检测算法只需一次特征提取,检测速度快,实时检测能力强;而二阶段目标检测算法虽然精度良好但实时性较弱,且其框架限制导致检测速度难以满足要求,故这类算法在检测速度上不如单阶段算法。因此,智能驾驶目标检测常采用单阶段目标检测算法。
在众多单阶段目标检测算法中,YOLO系列模型凭借其单阶段检测框架和优异的实时性能,成为计算机视觉领域的标杆之一。李威6提出了基于YOLOv3的多尺度行人检测模型YV3-PD,该模型对三种尺度行人目标分别进行检测,通过特征重组实现图像的长方形网格划分,从而改变图像网格的宽高比,进而提高了智能驾驶检测的性能。陈钧等7基于YOLOv5进行智能驾驶目标检测,设计了一种自校正卷积网络,通过深层特征提取以及特征融合来提高检测精度以及对小目标的检测能力。龙小羽等8在YOLOv8的基础上改进主干网络(Backbone)、快速空间金字塔池化(SPPF)以及颈部网络(Neck)部分提升了智能驾驶目标检测的检测精度。董一兵等9基于YOLOv10提出了DPRT-YOLO模型,提升了智能驾驶目标检测的精度,同时实现了模型的轻量化。
2024年9月,Ultralytics公司发布了YOLO系列10的YOLO11版本。YOLO11继承了前代模型在速度与精度上的平衡优势,广泛运用于资源受限的实时检测任务,但依然存在密集目标的易漏检、误检的问题,以及对小目标检测精度不高等问题。针对这些问题,本文提出了GEIT-YOLO模型,主要创新如下:
1) 针对没有组件能够提高网络对物体边缘信息的关注度的问题,提出全局边缘信息传递(global edge information transfer, GEIT)模块,其核心是把浅层特征中提取到的边缘信息传递到整个Backbone上,并与不同尺度的特征进行融合;
2) 针对原始C2PSA模块上下文建模能力不足的问题,引入门控注意力机制(convolutional gated linear unit, CGLU),通过门控特征调制联合建模通道依赖与空间上下文关系;
3) 引入定位质量估计(localization quality estimation, LQE)检测头将质量预测与分类得分解耦,通过显式地评估每个边界框的定位质量,优化了非极大值抑制(NMS)过程,使其能优先选择高质量预测框。
基于上述创新设计,开发了面向智能驾驶汽车的实时目标检测模型GEIT-YOLO,通过在Udacity测试集上开展消融和对比实验,验证了算法的有效性和先进性;同时在BDD100K测试集上开展验证实验,验证了算法的泛用性。

1 YOLO11网络模型

YOLO11采用单阶段检测框架,通过一次前向传播即可同时预测目标的边界框和类别概率。相较于基于区域提议的两阶段方法,YOLO11计算效率更高。YOLO11网络结构如图1所示,其核心架构包括主干网络(Backbone)、颈部网络(Neck)和检测头(Detection head)。YOLO11的主干网络基于跨阶段部分结构(CSP),通过高效的特征提取模块捕获多尺度目标信息;特征金字塔网络(FPN)11则增强了对不同尺度物体的适应性,结合检测头进一步优化了边界框预测的精度。此外,YOLO11引入了改进的注意力机制C2PSA模块和CIoU损失函数,提升了模型对复杂场景的鲁棒性和定位精度。

YOLO11凭借其高效的架构设计和灵活的模型配置,为实时目标检测任务提供了强大的支持。在智能驾驶领域,YOLO11能够快速处理Udacity数据集中的多样化道路场景,检测行人、车辆等目标。然而,在复杂背景、多尺度目标和遮挡场景下的表现仍存在改进空间。YOLO11根据模型规模不同可分为n、s、m、l和x等版本,其中YOLO11n作为轻量级版本,特别适合资源受限的嵌入式设备和实时应用场景。因此,本文以YOLO11n为基线模型(baseline),通过针对性的改进,进一步提升其检测性能。

2 GEIT-YOLO模型的构建

2.1 GEIT模块

众所周知,物体框的定位非常依赖于物体的边缘信息,但是对于常规的目标检测网络来说,没有组件能够提高网络对物体边缘信息的关注度,因此需要一个模块能够让边缘信息融合到各个尺度所提取的特征中。为了解决这个问题本文提出了GEIT模块,该模块主要包含两个核心组成部分:多尺度边缘信息生成器(MSEIG)与边缘特征融合模块(CEF),主要作用是能够把浅层特征中提取到的边缘信息传递到整个Backbone上,并与不同尺度的特征进行融合。

由于原始图像中含有大量背景信息,因此从原始图像上直接提取边缘信息传递到整个Backbone上会给网络学习带来噪声,而且浅层的卷积层会过滤不必要的背景信息,因此在网络的浅层提出一个多尺度边缘信息生成器MSEIG模块。该模块主要作用是利用网络的浅层特征层去生成多个尺度的边缘信息特征图并投放到主干的各个尺度中进行融合,从而避免了直接从原始图像提取的边缘信息带来的背景噪声干扰。

而对于下采样12方面的选择,主要目标是为了保留并增强边缘信息,并同时进行下采样。由于平均池化(AvgPool)更适用于需要平滑或均匀化特征的场景,而且保留细节和边缘信息方面的表现并不如最大池化(MaxPool)。因此选择MaxPool会更合适,它不仅能够保留局部区域的最强特征,还可以更好地体现边缘信息。MSEIG的结构图如图2所示。

为了将MSEIG生成的多尺度边缘特征图有效注入到主干网络中,本文设计的CEF模块采用三步式融合结构,能够有效结合边缘信息与常规卷积特征,从而实现一种新的跨通道特征融合方式。首先,将边缘特征图与主干网络在对应尺度下的特征图进行通道维度上的拼接,为了帮助模型更好地整合不同来源的特征信息,使用conv_channel_fusion进行边缘信息与普通卷积特征的跨通道融合,确保信息交互的同时控制参数数量;接着引入一个conv_3×3_feature_extract的卷积层,用以进一步提取融合后的细节特征,增强模型对物体边缘的空间理解能力,该卷积操作在保持空间感受野的同时,更有效地聚焦于局部细节,提升目标边界的表征能力;最后通过conv_1×1卷积将通道数调整为与主干网络保持一致,以便后续网络结构的无缝衔接。跨通道特征融合方式如图3所示。

GEIT模块的核心创新在于其全局性与多尺度融合机制。不同于YOLO11n直接依赖常规卷积特征提取,GEIT通过专门设计的边缘信息生成与传递策略,使边缘特征能够贯穿整个骨干网络,增强模型在不同尺度下的边缘感知能力。这种设计不仅有效提升了物体框定位的精度与边界质量,还在复杂背景中有效减少了噪声干扰,为后续特征融合和检测任务奠定了坚实基础。

2.2 CGLU注意力机制

在目标检测任务中,特征的语义重要性在不同通道和空间区域间差异显著。与YOLOv8中使用的C2f模块相比,YOLO11n的C2PSA模块在注意力机制上进行了重大改进,引入PSA模块通过部分空间注意力增强了局部特征表达,但缺乏对通道维度特征的动态调节能力,导致对边缘信息等关键特征的关注不足。在原始YOLO11n架构中,像SE、CBAM等注意力机制13在一定程度上提升了模型的表达能力,但它们往往对特征选择进行统一加权,缺乏对不同空间位置、通道间细粒度交互的建模能力。为了针对这些不足,选择在原有的C2PSA模块基础上引入了一种更为高效和可解释的门控注意力机制CGLU14,进一步来增强特征选择与通道交互的能力。

该注意力机制是以门控机制为基础,引导不同通道的特征图在信息流动过程中进行加权控制,从而实现更加精准的特征重标定。与常规注意力模块相比,CGLU通过结合卷积操作和门控线性单元(GLU),旨在增强YOLO11n的C2PSA模块对关键特征的关注能力,其核心思想是通过动态调整特征图的权重,CGLU将输入特征图分为两组通道,一组通过3×3卷积和sigmoid激活生成注意力权重,另一组保留原始特征。GLU门控机制对权重进行调整后,通过逐元素乘法实现特征加权。CGLU模块无缝集成到C2PSA的空间注意力分支后,通过拼接或加法融合输出,并利用3×3卷积优化通道数。强化对目标区域的关注,抑制无关背景信息,使得模型在对目标边缘区域、细小目标及低对比度目标的识别上表现出更强的鲁棒性和适应性,在保留空间位置信息的同时引入非线性控制机制,显著提升了特征选择的灵活性,实现了更强的空间和通道特征表达能力。CGLU注意力机制如图4所示。

相较于YOLO11n原模型的C2PSA模块,CGLU通过通道维度的自适应加权和空间-通道联合建模,显著提升了模型对边缘信息和局部细节的感知能力,从而改善物体框的定位精度和整体检测性能。

2.3 LQE Head检测头

在目标检测任务中,边界框的定位精度对模型性能至关重要。YOLO11n的原始检测头通过分类和回归分支预测物体类别和坐标,但缺乏对边界框定位质量的显式估计,导致在复杂场景或小目标检测中定位精度受限。而在常规目标检测任务中,模型在回归预测框的同时,会给出一个分类分数。YOLO等模型通常将这个分类分数作为后处理中的排序依据,但这会带来一个关键问题:分类分数不能真实反映预测框的定位质量(即IoU质量),尤其是在重叠物体或遮挡严重场景下,容易导致高分类但定位差的框被错误保留。为了解决上述问题,在YOLO11n检测头的基础上引入一个新的分支,即定位质量估计检测头LQE Head15,旨在通过显式估计边界框的定位质量,优化YOLO11n的边界框选择过程。其核心目标是:提高边界框的定位精度,优化分类和定位任务的协同性,减少低质量框的影响。

LQE Head通过轻量级卷积网络从检测层特征图中提取定位质量相关特征,并通过sigmoid激活输出范围为[0,1]的定位质量分数。此外,通过显式预测每个边界框的定位质量分数,并将其融入损失函数和推理过程,从而引导模型优先优化高质量的边界框。该分数与真实IoU高度相关,用于指导训练和推理过程。在训练阶段,LQE Head引入定位质量损失(基于二元交叉熵),与分类和回归损失联合优化,确保模型优先生成高质量边界框。在推理阶段,定位质量分数与分类置信度相乘,生成综合得分,增强非极大值抑制(NMS)阶段的框选择逻辑,从而提升检测精度和鲁棒性。LQE Head结构如图5所示。

相较于YOLO11n的原始检测头,LQE Head能够更精确地评估边界框的定位可靠性,显著提升模型在复杂场景下的定位精度,尤其对小目标和密集场景表现出色。这一改进通过引入定位质量的显式建模,为YOLO11n提供了更鲁棒的检测能力。

2.4 GEIT-YOLO模型

针对YOLO11n在目标检测任务中对边缘信息关注不足、下采样细节损失和定位质量估计缺失的局限性,提出了GEIT-YOLO模型。首先,GEIT模块通过MSEIG和全局特征融合机制,将浅层提取的边缘信息高效传递到骨干网络的各个尺度,增强了模型对物体边缘的感知能力;其次,引入CGLU注意力机制,显著提升了特征选择的灵活性,实现了更强的空间和通道特征表达能力;最后,LQE Head通过显式预测边界框的定位质量分数,联合优化分类、回归和质量估计,显著提升了边界框的可靠性,尤其在小目标和密集场景中表现突出。

这3个改进协同作用,形成了GEIT-YOLO的核心优势:对边缘信息的深度挖掘、细节保留的优化以及定位质量的显式建模,在复杂场景和小目标检测中的鲁棒性和高效性,为实时目标检测任务提供了更优的解决方案。GEIT-YOLO模型的网络结构图如图6所示。

3 实验结果与分析

3.1 数据集

为验证本文提出的GEIT-YOLO道路目标检测模型的性能,使用智能驾驶领域的经典数据集Udacity和BDD100K16进行测试。其中Udacity数据集是一个用于智能驾驶汽车算法比赛的数据集,共15 000张城市道路采集图像,数据集标签有汽车、卡车和行人等共11类;数据集BDD100K是由加州大学伯克利分校于2018年发布,是目前样本规模最丰富的智能驾驶数据集之一,数据集中共标注184万个交通目标数据,包括行人、汽车、火车和司机等共10个类别。以上数据集均按6∶2∶2划分为训练集、测试集和验证集。

3.2 实验环境与参数设置

本文所有实验环境的配置均如表1所示。在训练过程中,为了保持实验数据的公平性,未使用预训练权重,并设迭代次数为100轮,batch_size为32,图像输入尺寸为640 px×640 px,使用随机梯度下降(SGD)优化器进行训练,其他超参数设置均为默认参数。

3.3 实验评价指标

为验证本文改进模型在智能驾驶目标检测任务中的有效性,选取准确率P、召回率R、平均精度AP以及平均精度均值mAP作为模型性能的评价指标。这些指标越大,说明模型的检测效果越好。各指标计算公式如式下:

P=TT+F×100%
R=TT+FN×100%
AP=01PRdR×100%
mAP=i=1nAPin

式中:T表示真正例数量,即目标位置和类别模型均检测为正确的数量;F表示假正例数量,即模型检测目标位置不正确或类别错误的数量;FN表示假负例数量,即模型未能检测到目标的数量;

PR)表示在不同召回率R下对应的准确率;APi表示第i个类别的平均精度;n表示目标检测类别总数。

3.4 消融实验

为了验证本文提出的改进智能驾驶检测方法所做的各项改进的有效性,对GEIT-YOLO模型的各项改进进行消融实验,实验之间严格控制模型参数的一致性,实验结果如表2所示。

GEIT-YOLO模型是在YOLO11n模型基础上,使用GEIT模块把浅层特征中提取到的边缘信息传递到整个backbone上,并与不同尺度的特征进行融合。由表2可知,与原模型YOLO11n相比,GEIT模块让改进模型的精确度、召回率、mAP50mAP50:95分别提升了2.1%、1.5%、2.5%、1.4%。显然,GEIT模块能够有效地提升模型在复杂驾驶场景中的检测精度。

针对原始C2PSA模块上下文建模能力不足的问题,引入门控注意力机制CGLU,通过通道维度的自适应加权和空间-通道联合建模,显著提升了模型对边缘信息和局部细节的感知能力,从而改善物体框的定位精度和整体检测性能。

表2可知,与原模型YOLO11n相比,GEIT+CGLU模块让精确度、召回率、mAP50mAP50:95分别提升了4.3%、1.5%、2.9%、1.8%。实验结果说明引入注意力机制CGLU能够有效提升模型的检测精度。

在智能驾驶目标检测中,缺乏对边界框定位质量的显式估计,导致在复杂场景或小目标检测中定位精度受限,引入LQE检测头将质量预测与分类得分解耦,通过显式地评估每个边界框的定位质量,从而优化了非极大值抑制(NMS)阶段能够优先选择更高质量的边界框。

表2可知,与原模型YOLO11n相比,GEIT+CGLU+LQE检测头让精确度、召回率、mAP50mAP50:95分别提升了5.6%、2.7%、4.2%、2.3%。显然,引入GEIT+CGLU+LQE模块能够有效提升模型的检测精度。

3.5 对比实验

为了进一步验证本文所提模型的改进程度,本文选择4个具有代表性的网络模型YOLOv5n、YOLOv8n、YOLOv10n、YOLO11n与GEIT-YOLO模型进行对照实验。所有模型使用相同的数据集进行训练且实验之间严格控制参数一致,对比实验结果如表3所示。

表3可知,从精确度、召回率、mAP50mAP50:95这4个评价指标看,GEIT-YOLO模型均优于选择的4个代表性网络,GEIT-YOLO模型的精确度、召回率、mAP50mAP50:95比YOLOv5n模型分别提升了4.2%、2.9%、3.5%、1.8%,比YOLOv8n模型分别提升了7.1%、4.5%、4.7%、2.1%,比YOLOv10n模型分别提升了9.6%、6.4%、7.0%、3.2%。

由此来看,本文所提出的GEIT-YOLO算法在智能驾驶检测中保持了较高的计算效率,在显著提升智能驾驶检测准确率的同时并大幅降低了漏检率,在现代智能驾驶系统中具有高准确性和高实时性等优点。

3.6 BDD100K数据集验证与分析

为了能够充分验证本文改进方法的适用性和鲁棒性,在BDD100K数据集上进行了验证。两个数据集虽为同一类型但是区别较大,可以很好地检验模型的泛化性能。实验设置与3.2节保持一致,实验评价指标与3.3小节保持一致,验证实验结果如表4所示。

表4可知,在BDD100K数据集上,改进模型GEIT-YOLO的精确度、召回率、mAP50mAP50:95相比基准模型YOLO11n均有所提升,提升幅度分别为4.9%、2.5%、3.8%、2.2%。该结果表明,GEIT-YOLO在此数据集上同样表现出了稳定的性能优势,验证了其良好的泛化能力。

4 结语

综上所述,针对智能驾驶场景对目标检测精度与鲁棒性的高要求,本文提出一种基于改进YOLO11n的智能驾驶目标检测模型GEIT-YOLO。通过设计GEIT模块实现边缘信息的多尺度融合,能够把浅层特征中提取到的边缘信息传递到整个Backbone上,并与不同尺度的特征进行融合,不仅有效提升了物体框定位的精度与边界质量,还在复杂背景中有效减少了噪声干扰;引入门控注意力机制CGLU,通过门控特征调制联合建模通道依赖与空间上下文关系,显著提升了特征选择的灵活性,实现了更强的空间和通道特征表达能力;采用LQE检测头将质量预测与分类得分解耦,优化了预测框的筛选过程。在公开驾驶数据集上的实验验证表明,本文方法有效提升模型对智能驾驶的检测能力,其综合精度优于YOLOv5、YOLOv8等多个代表性模型,在不同数据集和不同模型上都体现出较强的泛化能力。

参考文献

[1]

武彪, 任洪泽, 郑联庆, . 基于自然驾驶行为的智能驾驶复杂场景构建方法[J]. 华南理工大学学报(自然科学版)202553(2): 38-47.

[2]

严林志, 周瑛. 从社会诉求到政策因应: 基于文本挖掘的自动驾驶技术发展策略研究[J]. 情报理论与实践202548(8): 73-82, 92.

[3]

董甲东, 桑飞虎, 郭庆虎, . 基于深度学习的目标检测算法轻量化研究综述[J]. 计算机科学与探索202519(8): 2057-2084.

[4]

王宁, 智敏. 深度学习下的单阶段通用目标检测算法研究综述[J]. 计算机科学与探索202519(5): 1115-1140.

[5]

段立娟, 张子晨, 张广勇. 自监督的两阶段广义小样本目标检测算法[J]. 信号处理202541(2): 370-381.

[6]

李威. 面向智能驾驶的交通场景理解方法研究[D]. 长春: 吉林大学, 2021.

[7]

陈钧, 周井泉, 张志鹏. 面向小目标的自校正YOLOv5检测增强算法[J]. 计算机技术与发展202434(10): 140-147.

[8]

龙小羽, 南新元. 智能驾驶场景下的中小型障碍物检测方法[J]. 科学技术与工程202525(9): 3778-3787.

[9]

董一兵, 曾辉, 李建科, . DPRT-YOLO: 智能网联汽车复杂驾驶环境实时目标检测器[J]. 计算机工程与应用202561(14): 148-162.

[10]

徐彦威, 李军, 董元方, . YOLO系列目标检测算法综述[J]. 计算机科学与探索202418(9): 2221-2238.

[11]

LIU ZWU J HCAI Y Fet al. Dual-stage feature specialization network for robust visual object detection in autonomous vehicles[J]. Scientific Reports202515: 15501.

[12]

董华军,陈强,李籽骁,.基于机器视觉的轮毂检测联合算法优化研究[J].铁道科学与工程学报202522(6): 2340-2350. DOI:10.19713/j.cnki.43-1423/u.T20250624 .

[13]

傅鹏飞, 徐巍, 刘怀广, . 基于双重注意力校准机制的口罩遮挡人脸识别[J]. 电子测量技术202548(22): 177-186.

[14]

SHI D. TransNeXt: Robust Foveal Visual Perception for Vision Transformers[C]// 2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). Vancouver, Canada: IEEE, 2024: 17773-17783. DOI:10.1109/CVPR52733.2024.01683 .

[15]

LI XWANG W HHU X Let al. Generalized focal loss V2: learning reliable localization quality estimation for dense object detection[C]//2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). June 20-25, 2021. Nashville, TN, USA. IEEE, 2021: 11627-11636.

[16]

王坤, 冯康威. FFE-YOLOv8: 交通场景遮挡目标检测算法[J]. 计算机工程与应用202561(15): 156-166.

基金资助

安徽省高校自然科学研究重点项目(2022AH052821)

AI Summary AI Mindmap
PDF (647KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/