多层级特征融合与注意力交互的无人机视角图像目标检测算法

邬开俊 ,  魏鼎 ,  郑云琦 ,  武月莲 ,  杜娟娟

湖南大学学报(自然科学版) ›› 2026, Vol. 53 ›› Issue (6) : 71 -84.

PDF (5566KB)
湖南大学学报(自然科学版) ›› 2026, Vol. 53 ›› Issue (6) : 71 -84. DOI: 10.16339/j.cnki.hdxbzkb.2026273
计算机科学

多层级特征融合与注意力交互的无人机视角图像目标检测算法

作者信息 +

An unmanned aerial vehicle-view object detection algorithm based on multi-level feature fusion and attention interaction

Author information +
文章历史 +
PDF (5699K)

摘要

针对复杂背景下无人机航拍图像目标尺度分布不均匀导致检测精度低的问题,提出一种改进YOLOv11的无人机视角图像目标检测算法——MFAI-YOLO.首先,设计全新的颈部网络MBAFPN,融合多分支辅助结构与多尺度卷积模块增强特征融合与目标特征表达能力,并嵌入跨尺度空间注意力集成模块以突出复杂背景下的小目标判别特征,显著提高检测性能.其次,融合改进后的MambaOut结构,构建重参数化MU-C3k2强化模型对多尺度目标的学习能力.最后,为提升模型对不同输入分布的适应性,进一步提出结合动态激活函数与空间注意力机制的CTSA模块.在VisDrone2019-DET数据集上进行实验,改进后算法相较于基线方法YOLOv11s,AP、AP50、AP75、APs、APm、APl分别提高1.6、2.0、1.6、1.4、2.2、1.3个百分点.在UAVDT数据集上的泛化性实验表明,该算法在小尺寸目标和遮挡场景下的mAP@0.5提高3.2%.实验结果显示,MFAI-YOLO适用于无人机视角下的实际应用场景,在保持检测速度的同时,实现了不同尺度目标的高精度检测.

Abstract

To address the low detection accuracy caused by uneven target scale distribution in UAV aerial images under complex backgrounds, we propose an improved YOLOv11-based UAV-view object detection algorithm, MFAI-YOLO. First, we design a novel neck network, MBAFPN, which integrates a multi-branch auxiliary structure with a multi-scale convolution module to enhance feature fusion and target feature representation, and embeds a cross-scale spatial attention integration module to emphasize small-object discriminative features in complex backgrounds, thereby significantly boosting detection performance. Next, we incorporate an improved MambaOut structure to build the re-parameterized MU-C3k2 reinforcement module, strengthening the model’s ability to learn multi-scale targets. Finally, to improve the model’s adaptability to varying input distributions, we introduce a CTSA module, which combines a dynamic activation function with a spatial attention mechanism. Experiments on the VisDrone2019-DET dataset show that, compared with the baseline YOLOv11s, MFAI-YOLO achieves improvements of 1.6,2.0,1.6,1.4,2.2 and 1.3 percentage points in AP, AP50, AP75, APs, APm, and APl, respectively. Generalization experiments on the UAVDT dataset demonstrate a 3.2% increase in mAP@0.5 for small objects and occlusion scenarios. The results indicate that MFAI-YOLO is well-suited for real-world UAV-view applications, achieving high-precision detection for targets of different scales while maintaining detection speed.

Graphical abstract

关键词

目标检测 / 无人机图像 / 注意力交互 / 特征融合 / 重参数化

Key words

object detection / UAV imagery / attention interaction / feature fusion / re-parameterization

引用本文

引用格式 ▾
邬开俊,魏鼎,郑云琦,武月莲,杜娟娟. 多层级特征融合与注意力交互的无人机视角图像目标检测算法[J]. 湖南大学学报(自然科学版), 2026, 53(6): 71-84 DOI:10.16339/j.cnki.hdxbzkb.2026273

登录浏览全文

4963

注册一个新账户 忘记密码

近年来,随着人工智能和计算机视觉技术的迅猛发展,无人机(unmanned aerial vehicles, UAVs)在军事侦察、灾害救援、环境监测、城市管理等领域的应用日益广泛1.作为无人机感知系统中的关键任务之一,目标检测技术在提升无人机自主决策能力和任务执行效率方面发挥着重要的作用.相比于传统图像获取平台,无人机具备机动性强、视角灵活、覆盖范围广等优势,但其所获取的图像也存在视角变化大、尺度不一致、背景复杂和运动模糊等缺陷,在小目标检测方面这些问题尤其突出2,这对目标检测算法的鲁棒性和实时性提出了更高要求.因此,开展面向无人机场景的高效、精确、轻量级目标检测算法研究,具有重要的理论价值和应用前景3.先前研究4表明,多尺度特征在目标检测任务中对于有效表征尺度变化显著的目标至关重要.当前常见的多尺度特征提取策略是采用经典的自上而下与自下而上的特征金字塔网络.本文重点关注特征金字塔网络(feature pyramid network, FPN)的对比与优化.
随着深度学习技术的不断发展,基于卷积神经网络(convolutional neural network, CNN)的目标检测算法已成为无人机航拍图像处理的主流方法.目前,基于CNN的目标检测模型主要分为两类:两阶段检测器和单阶段检测器.两阶段检测算法如R-CNN5、FasterR-CNN6等.相较于两阶段检测算法,单阶段目标检测具有较高的实时性,包括YOLO系列7、SSD系列8、Efficient系列9等,其主要通过提取特征直接对物体进行识别和分类,网络结构简单、检测速度快,更能满足无人机航拍图像检测的需求10.最新的研究Mamba-YOLO11探索引入状态空间模型(state space model,SSM)来解决长距离依赖问题,并通过其线性时间复杂度优势减轻计算负担.最终得出结论:Mamba非常适合具有长序列和自回归特征的任务.Yu等12在移除核心SSM的同时堆叠Mamba模块构建一系列名为MambaOut的模型,在ImageNet图像分类中有效性超过了视觉Mamba模型.
FPN的引入显著提升了目标检测性能.然而,在检测微小目标方面仍存在巨大挑战,因为这些目标的特征在特征图中仅占据极小的比例.尽管FPN融合了多尺度特征,但它并未直接增强或丰富微小目标的特征.此外,FPN缺乏空间感知能力.针对无人机航拍图像中的目标检测问题,国内外学者展开了大量研究.Li等13针对高分辨率航拍图像中存在目标尺度变化、分布不均匀问题设计了一种密度图引导的目标检测网络.Zhu等14提出TPH-YOLOv5,通过集成Transformer编码器和卷积力注意力模块(CBAM模块),显著提升了目标检测性能.Sui等15提出改进的小目标检测模型BDH-YOLO,通过引入BiFPN9,使特征能在不同层级之间直接传递,采用动态检测头DyHead,显著提升检测精度.针对FPN式结构存在的问题,Wang等16设计了Gold-YOLO并在TopFormer理论的基础上提出了一种新的聚合-分发(GD)机制.通过融合多层特征并将全局信息注入到更高层,在YOLO中实现高效的信息交换.为解决高分辨率输入下协调特征图分辨率与感受野之间的矛盾需求,Cao等17提出了一种注意力引导的上下文特征金字塔网络(ACFPN).Yang等18提出了一种渐进特征金字塔网络(AFPN)来支持非相邻层的直接交互.AFPN通过融合两个相邻的低层级特征来启动,并渐进地将高层特征纳入融合过程.Wang等19提出了一种CGRFPN用于空间特征重建和金字塔上下文提取.Shi等20提出了一种新颖的高频与空间感知特征金字塔网络(HS-FPN),通过高通滤波器生成高频响应,并从空间和通道两个维度将这些高频响应用作掩码权重,以增强并突出原始特征图中微小目标的特征.Li等21提出多尺度特征提取与跨阶段特征融合网络(CFPN)用于小目标检测.通过多尺度特征提取模块(MSFE)获取丰富特征,借助跨阶段特征金字塔网络(CSFPN)融合特征.然而,上述方法从不同角度对特征金字塔网络特征融合的任务进行优化,但并未考虑到如何提升网络中不同层级之间特征交互的高效性.当下的分层模型通常采用特征融合技术,直接添加来自深层上采样粗特征和来自底层的高分辨率特征.YOLO系列算法的Neck结构采用传统PAFPN22,包含两个主要用于多尺度特征融合的主要路径.Yang等23提出了一种新的Neck结 构——多分支辅助特征金字塔网络(MAFPN),同时利用自顶向下和自底向上的双向路径,以实现更丰富的特征交互和融合.然而,这些方法在多尺度特征的并行异构融合方面仍存在一定的局限性.
为提升无人机视角图像检测效果,加强无人机视角下目标检测的应用,本文鉴于YOLOv11模型在精确度与计算开销之间的良好平衡,针对无人机视角下图像的特点和存在的问题,深入挖掘YOLO11模型的潜力,并在其基础上进行改进和优化,补充和增强模型中目标特征信息,提高模型检测性能.改进后的方法在各种复杂的场景下都能够更准确地识别定位目标.概括起来,主要贡献如下.
1)构建双向多分支辅助融合特征金字塔网络(multi-branch bidirectional auxiliary fusion feature pyramid network, MBAFPN).该网络构建了双向多分支信息流,通过多个感受野不同的分支获取物体多尺度特征信息.
2)提出跨尺度空间注意力集成模块(cross-scale attention integration module, CSAIM)嵌入MBAFPN中.CSAIM将高层特征图中的细节信息经过全局和局部的跨尺度特征加权融合后添加到特征融合自下而上传递路径中,补充高层特征图中的细粒度信息.
3)设计MU-C3k2模块,增强局部信息提取的多样性.有效结合局部感受野和门控机制,将门控机制加入深度可分离卷积,动态地控制卷积核的激活,从而带来更灵活的特征提取能力.
4)提出CTSA模块,该模块使用DynamicTanh和TSSA注意力机制的结合来增强特征的表达,并通过多层结构提升模型的深度表示能力.加入残差连接以加速训练过程,避免梯度消失问题.

1 本文方法

1.1 MFAI-YOLO整体网络架构

为了在无人机视角下实现高精度、实时的目标检测,本文提出一种基于YOLOv11的改进算法 MFAI-YOLO.整体网络架构如图1所示,主要由输入端(Input)、主干网络(Backbone)、颈部特征融合网络(Neck)以及检测头(Head) 四部分构成.

输入端采用多尺度输入策略,通过对输入图像进行自适应调整与增强,提升模型对不同尺度目标的鲁棒性.主干网络在YOLOv11的C2f与C2PSA结构基础上进行优化,通过引入更丰富的上下文信息,主干网络能够有效捕捉无人机图像中目标尺寸变化大、背景复杂等特点带来的弱特征.

颈部网络是本文的核心创新部分.为了解决传统特征金字塔在多尺度融合过程中细节丢失的问题,本文提出双向多分支辅助融合特征金字塔网络MBAFPN.在融合路径中嵌入CSAIM通道-空间注意力模块,对特征进行精细化校准,增强关键区域的响应.同时,设计多尺度统一卷积残差块MU-C3k2,实现不同尺度特征的统一学习与增强.此外,引入CTSA细粒度特征增强模块,对低层特征进行深度提取并向上传递,有效缓解高层特征细粒度信息缺失的问题.

检测头沿用YOLOv11的无锚框(anchor-free)结构,并结合深度可分离卷积进一步降低计算开销.

综上,本文方法通过在主干与颈部网络中引入多个创新模块,实现了特征提取能力、多尺度融合质量与检测效率的协同提升.整体架构在保持实时性的前提下,显著增强了对无人机视角下小目标和复杂背景目标的检测性能.

1.2 整体模型

图1所示,模型的核心改进集中在颈部网络,通过构建MBAFPN实现更高效的多尺度特征融合.MBAFPN在每个尺度上设置多条并行分支,使不同层级的特征能够进行多次交互,有效缓解传统FPN在深层特征融合过程中细节信息丢失的问题.

为了进一步提升特征的表达能力,在 MBAFPN的融合路径中嵌入CSAIM模块.该模块利用通道注意力机制动态调整各通道的权重,突出对目标检测更具判别性的特征;随后通过空间注意力机制聚焦于特征图中的关键区域,抑制背景噪声的干扰.通过这种“通道-空间”双维度的精细化校准,模型能够更有效地捕捉小目标的弱特征.同时,本文设计多尺度统一卷积残差块MU-C3k2,并将其嵌入MBAFPN中.该模块通过多尺度卷积核与残差连接的组合,实现对不同尺度特征的统一学习与增强,进一步提升模型对尺度变化的适应性.

此外,为了弥补高层特征中细粒度信息的缺失,本文引入CTSA模块,对低层特征进行深度提取后,通过自下而上的路径传递至高层,使高层特征同时具备丰富的语义信息与细粒度细节.通过上述模块的协同作用,MFAI-YOLO在提升特征融合深度与细节保留度的同时,并未显著增加模型的计算负担,为无人机视角下的目标检测任务提供了一个兼顾速度与精度的高效解决方案.

1.3 多分支双向辅助融合特征金字塔网络

为了实现高性能的实时目标检测,近年来已经开发了各种算法.其中从YOLOv1到YOLOv9的一系列YOLO算法,因其速度与准确性的平衡而发挥了越来越重要的作用.然而,YOLO系列算法的一个共同缺点是多功能尺度特征融合的限制.尽管路径聚合FPN(PAFPN)被广泛应用于YOLO检测器中,该机制采用双路径方法增强特征整合,在提高准确度的同时控制计算成本.然而,它不能同时高效且自适应地融合高级语义信息与低级空间信息.因此本文提出了一种双向多分支辅助融合特征金字塔网络,以实现更丰富的特征交互和融合.

1.4 多分支辅助跳跃连接

传统的FPN及其变体PAFPN虽然通过自顶向下和自底向上的路径促进了特征融合,但主要局限于相邻层级的信息交互,难以有效捕捉跨尺度的长距离依赖.随着YOLOv11骨干网络CSPDarkNet层数的加深,深层语义的特征虽然丰富,但细节信息往往被稀释.为了解决这一问题,本文提出MBAFPN.如图2所示,MBAFPN引入了多条辅助分支与跳跃连接(skip connection),在骨干网络与颈部网络之间构建了双向信息高速公路.在长距离特征注入中,通过辅助分支将P2、P3、P4层的高分辨率特征直接引入融合模块,弥补了深层网络对小目标边缘与纹理信息的丢失.在多维上下文捕获中,P3、P4特征一部分经过CSAIM模块参与颈部融合,另一部分经卷积下采样以捕获全文.同时,P5层特征结合SPPF与CTSA模块提取细粒度语义.这种设计打破了逐层传递的限制,实现了从浅层细节到深层语义的充分交互,显著增强了网络对多尺度目标的交互能力.

1.5 多级特征融合

为了进一步提升模型对复杂场景的适应性,本文在颈部网络中引入了多级特征融合策略.不同于单一尺度的特征处理,该策略在3级和4级特征层上构建了多条并行融合路径,使网络能够兼顾底层空间信息与高层语义信息.如图2所示,每条路径专注于特定的特征尺度,通过加权融合机制将不同层级的特征进行互补集成.此外,本文引入了选择性特征融合机制,使网络能够动态地增强显著特征的权重并抑制背景噪声.这种多路径、选择性的融合方式最大化了特征图的信息熵,确保输出特征在具备精确定位能力的同时,拥有鲁棒的语义判别力,从而有效提升了对大小不一目标的检测精度.

1.6 跨尺度空间注意力交互

本文在Neck部分加入了跨尺度空间注意力集成模块(CSAIM).针对传统空间注意力机制易忽略全局上下文的局限性,CSAIM通过跨尺度融合策略,在增强局部细节捕捉能力的同时,有效保留了全局语义关联.该模块采用双向多分支设计,利用上下文信息对前向特征进行修正,实现了注意力分布的自适应调整.在高层检测分支中应用CSAIM,能够有效抑制复杂背景下的噪声干扰并突出小目标特征,从而显著提升了模型的检测精度与场景适应性.

图3所示,输入特征图Fi经过通道拆分,分为上下两路:全局分支和局部分支.得到特征向量F1RH×W×C/2F2RH×W×C/2,保存分支特征向量后又经过特征融合得到Fi'RH×W×C使特征更好地交互.上下双分支通过1×1卷积在不改变特征图空间尺寸的前提下压缩双分支通道数并打乱,实现跨通道的信息融合.Split表示通道分离,Fi1表示进入全局分支,Fi2表示进入局部分支,在前向传播过程中先处理全局信息后处理局部信息.

Fi1,Fi2=Split(Fi)
Fi'=Concat(F1,F2)
Fi1'=S(Conv1×1(Fi'))
Fi1''=(Fi1'*Ri)F1
Fi1'''=Concat(Fi1'',F2*di)
F1out=Conv1×1(Fi1''')

式中:Conv1×1表示1×1卷积;S表示Sigmoid函数,它将输入值压缩到(0,1)区间,避免数值过大对模型训练产生不良影响;Fi1'表示暂时经激活函数得到的结果;*表示带有缩放意义的乘法;为了使Sigmoid激活函数的结果与分支特征向量的乘法相匹配,Ri表示自适应通道权重向量;表示矩阵乘法,逐元素相乘实现对信息的选择性保留得到Fi1''di为自适应通道权重向量,得到Fi1'''RH×W×C.最终,通过1×1卷积还原通道数降低整体计算的复杂度.得到F1outRH×W×C/2.Fi2进入局部分支ConvBranch.

复制Fi2得到Fi2'Fi2'进入空间注意力分支SpatialAttention.Fi2通过堆叠的1×1与3×3卷积层提取局部空间特征,并利用ReLU激活函数增强非线性表达,同时引入跳跃连接以促进梯度的有效传播与特征复用.

Fi2'=ReLU(Conv1×1(Fi2))Fi2''=ReLU(Conv3×3(Fi2'))Fi2'''=Fi2'+Fi2''

采用并行的最大池化与平均池化操作,分别捕捉图像的显著特征与背景上下文信息.Fi2'经过7×7深度可分离卷积保持大感受野并捕获大尺度上下文防止过拟合,Sigmoid激活函数引入非线性缓解梯度消失问题,后与原分支相乘.最后加回到初始残差上形成输出F2out.

Fi2''''=Sigmoid(Conv7×7([AvgPool(Fi2');MaxPool(Fi2')]))F2out=Fi2'''Fi2''''+Fi2

ConvBranch得到的输出最后分别经过Sigmoid乘不同的权重Ti1-Ti,分别经矩阵乘法,相加得到最终输出.

F1out'=F1out×eiF1out''=F1out'F2out'F2out'=Sigmoid(F2out)×TiF2out''=(Sigmoid(F2out)×(1-Ti))F2Output=F1out''F2out''

式中:ei同样表示自适应通道权重向量;表示矩阵乘法;表示特征聚合.

1.7 多尺度统一卷积残差块

针对YOLOv11中C3k2模块在无人机复杂场景下难以兼顾多尺度目标与背景干扰的问题,本文提出了多尺度统一卷积残差块(MU-C3k2).该模块在不增加推理成本的前提下,通过集成门控重参数化机制并行处理大核与小核卷积,有效扩展感受野并强化微小目标特征.

MU-C3k2采用双路并行策略:输入特征经通道分割后,一路通过恒等映射保留原始细节;另一路则进入核心的门控重参化模块(GURL)进行深度特征提取.GURL借鉴MambaOut的简化理念,摒弃了计算密集的SSM单元,转而利用堆叠的Gated CNN结构与膨胀重参数化模块(dilated reparam block),在平衡推理速度的同时实现参数的自适应调整.该设计通过深度可分离卷积与门控机制的结合,动态捕捉多尺度上下文信息.最终,深层语义特征与浅层细节特征经跨通道拼接与卷积融合,生成了兼具全局感知力与局部判别性的强健特征表达.

特征张量 X 进入GURL.首先,对输入张量 X 进行层归一化,得到 X' .

X'=LayerNorm(X)

输入张量经过1×1卷积层,通过通道分离split_indices得到隐藏张量gic.split_indices将输入分为三部分:g(hidden)i(hidden-conv_channels)c(conv_channels).

[g,i,c]=split(Conv1×1(X'),split_indices)

将张量c传入深度可分离卷积块得到c'.将输出ic'拼接在一起,然后应用激活函数.通过全连接层与另一个经过GeLU激活函数的分量 g 相乘.

c'=DWConv(c)X''=GeLU(g)Concat(i,c')

式中:DWConv为重参数化大核卷积模块UniRepLKNetBlock,kernel固定为7.

接着通过1×1卷积层恢复原通道数,应用DropPath技术来提高训练过程中的正则化效果,DropPath是一种正则化手段,其将多分支结构的子路径随即删除.

Y=DropPath(Conv1×1(X''))

最后,将原始输入X与处理后的张量相加得到最终输出Z.

Z=X+Y

上文提到的分量c进入UniRepLKNet Block24后,首先进入重参数化模块.该模块使用多个不同卷积核大小和扩张系数的卷积操作以及相应的批归一化操作对结果进行处理,最后将这些结果相加得到 D,流程如图4所示.

D=DilatedReparam(c)

经过批量归一化后形成两个分支,其中一个分支经过SE(squeeze and excitation)Block,自适应调整每个通道的权重,得到通道加权后的张量.另一个分支Z则保留原始特征,等待与处理后的分支进行矩阵相乘.

D'=σ(ReLU(Avgpool(S)))

式中:σ表示Sigmoid函数;Avgpool表示平均池化层.最后,对分离两分支得到的结果应用矩阵乘法,经过GeLU激活函数和批量归一化BN,再通过函数处理.处理后的分量与原特征分支相加,得到最终结果,最终的输出张量是前馈网络输出与输入张量的残差连接.

1.8 多尺度细节信息提取CTSA

随着骨干网络层数的加深,经过多次下采样操作,图像中的高频细节信息(如小目标的边缘与纹理)往往会被稀释甚至丢失,严重制约了模型对微小目标的定位精度.为了在深层特征中有效恢复并保留这些关键的细粒度信息,本文提出了CTSA模块.该模块利用堆叠的TSSAlock_DYT强化特征表达.针对复杂场景下特征分布的非线性表达,我们在注意力层前后集成了DynamicTanh25,实现了激活参数的输入自适应调整.针对信息传递,双重残差架构确保了特征在深层堆叠中的完整性,并在子层间建立了高效的耦合机制.此外,CTSA保持各层通道数C恒定,并通过规范化的注意力头数设置,实现了模块在不同量级模型的通用性与易扩展性.

具体来说,首先将TSSAlock_DYT中的输入特征向量YRH×W×C经过DynamicTanh后划分为两个分支YRH×W×C/2后,其中一个分支通过两次残差连接继续向前传输,另一分支在通道维度上则要再切分为4部分后得到Y1RH×W×C/8Y2RH×W×C/8Y3RH×W×C/8Y4RH×W×C/8经过多尺度卷积和通道压缩后再完成特征融合.

Yi'=DwConvki×ki(Yi)ki=3,5,7,9i=1,2,3,4

式中:DwConvki×ki()表示卷积核大小ki不同的深度卷积;i表示不同分支.然后对提取到的特征Yi'分别通过通道注意力单元建立通道依赖关系.

Yi''=Yi'SE(Yi')i=1,2,3,4

最后,在通道维度合并并行分支,经TSSA注意力处理后再经DynamicTanh,与另一分支进行矩阵乘法输出最终结果,整体流程如图5所示.

Output=Y×DynamicTanh(TSSA(Yi''))

2 实验

2.1 数据集与评价指标

本研究采用VisDrone2019数据集26作为模型训练及性能测试检测基准,并引入UAVDT数据集进行泛化性验证.VisDrone2019包含6 471张图像训练集、548张图像验证集和1 610张图像测试集,涵盖行人及多种车辆等十个类别.该数据集因视角多变、目标尺度差异大且包含大量尺寸小于32像素的小目标,使得在无人机图像目标检测任务领域中具有挑战性.为了验证模型的鲁棒性,我们在UAVDT数据集27上进行了额外测试.UAVDT包含约80 000帧复杂城市场景图像,标注了车辆目标及天气、高度等14种属性.本文在VisDrone2019训练集上训练,在验证集进行消融实验,并在测试集上报告最终性能.

2.2 实施细节

本文实验在NVIDIA RTX 5070 GPU硬件平台上进行,基于PyTorch 2.8.0深度学习框架搭建模型.为了保证对比的公平性,所有对比模型均采用原论文开源代码或MMDetection目标检测工具箱中的官方实现.模型输入图像尺寸统一调整为640×640,总迭代轮次(epoch)设定为300.使用随机梯度下降算法(stochastic gradient descent, SGD)优化器进行参数更新,批量大小(batch size)设为8,初始学习率设为0.01,其他超参数配置与基线模型保持一致.为了评估算法在真实无人机机载环境下的实用性,本文选取了 NVIDIA Jetson Orin Nano嵌入式计算平台作为部署测试环境.该平台因其低功耗与高算力的平衡,是当前工业级与消费级无人机的主流机载计算设备.我们将训练好的模型利用TensorRT推理引擎进行半精度(FP16)量化加速,在真实的资源受限硬件上对模型的推理延迟、吞吐量及显存占用进行实测,以验证MFAI-YOLO在实际飞行任务中的可行性.

2.3 消融实验

为了证明本文提出的各个模块的有效性,在VisDrone2019-DET-val数据集上进行了消融实验.表1中报告了以YOLOv11s为基线模型,在其中加入不同模块时的检测结果.消融实验的结果表明,当使用MBAFPN替换原颈部网络后,算法的参数量减少1.54 M,达到了模型轻量化的目的并且整体检测性能得到显著提升,AP、AP50、AP75、APs、APm、APl分别提升1.1、1.9、0.8、1.0、1.7、1.8个百分点.在MBAFPN网络的三个分支上加入CSAIM,实验结果表明在MBAFPN的基础上AP、AP50、AP75、APs、APm、APl分别提升0.5、0.6、0.4、0.6、0.7、1.1个百分点.参数量增加1.08 M,有着良好的效果,故选择在MBAFPN+CSAIM的基础上继续进行消融实验.

在基线模型中加入MU-C3k2时参数量增加1.39 M,AP、AP50、AP75、APs、APm、APl分别提升1.2、1.5、1.9、0.9、1.4、2.0个百分点.加入CTSA后参数量与基线方法相比减少0.36M,AP、AP50、AP75、APs、APm、APl分别提升0.8、1.1、0.6、0.8、0.9、1.5个百分点.整体检测性能有一定的提升,同时模型的参数量没有增加,一定程度上达到了轻量化的效果,实验表明CTSA模块对整体的检测有着积极的影响.

最终,本文所提出的方法与基线模型相比参数量减少0.18 M,AP、AP50、AP75、APs、APm、APl分别提升2.5、3.4、2.7、2.1、3.0、3.6个百分点.整体的检测性能显著提高,不同尺度目标检测效果也有明显提升.相较于单个模块与两两组合后的模块,在AP、AP50、AP75、APs、APm、APl六个评价指标方面达到最优,参数量相较于只添加MBAFPN后增加1.36 M,总体模型性能有良好的提升.

2.4 颈部网络对比实验

针对无人机视角下小目标检测的难点,本文对颈部网络进行了详细的对比实验,结果如表2所示.实验发现,虽然CSFPN(2025)21、CGRFPN(2024)19等先进网络在COCO等通用数据集上表现优异,但在处理无人机航拍图像时效果并不理想.相比之下,本文提出的MBAFPN结构在综合性能上优于主流方法.进一步引入CSAIM后,模型的检测性能得到了显著提升.与基准模型PAN-FPN相比,MBAFPN+CSAIM在mAP@0.5和mAP@0.5:0.95上分别提升了2.7和1.9个百分点,且在各项指标上均取得了最优结果.对比MBAFPN引入CSAIM前后的结果可知,单独的MBAFPN在不同尺度特征传递时,对关键区域的强化能力仍有提升空间,特别是在处理微小目标时存在不足.融合CSAIM后,网络能够更有效地聚合底层特征的边界信息与高层特征的语义信息,从而在保留边界细节的同时实现目标的精确定位(re-calibration).这种机制有效引导了网络关注无人机图像中的关键区域,显著增强了对小目标的捕捉能力,验证了本文所提颈部网络改进方案的有效性.

2.5 VisDrone2019及UAVDT数据集对比实验

为了全面验证 MFAI-YOLO在实际应用中的性能,我们在VisDrone2019测试集及NVIDIA Jetson Orin Nano边缘平台上进行了多维度对比实验,涵盖检测精度(AP)、模型轻量化程度(Params/GFLOPs)及边缘推理速度(FPS),实验结果如表3所示.

资源占用与轻量化:MFAI-YOLO的参数量为9.24 M,计算量为28.7 G.与同量级的YOLOv11s相比,参数量略有下降(减少0.18 M),计算量仅略微增加.这意味着改进后的算法并没有显著增加对无人机机载存储和算力资源的占用,保持了轻量级特性.

边缘推理速度(实用性评估):在 Jetson Orin Nano上的实测结果表明,MFAI-YOLO 的推理速度达到36.4 FPS.虽然相较于基线模型(38.2 FPS)有轻微的下降,但通过引入 TensorRT加速,该速度依然远高于实时检测通常要求的 30 FPS阈值,完全能够满足无人机在执行巡检或侦察任务时的实时处理需求.

精度与速度的权衡:在满足实时性的前提下,本文方法的 AP 达到了19.2%,显著优于YOLOv11s (17.6%)及其他主流轻量级模型.特别是对于无人机场景下至关重要的微小目标(APs),该模型达到了9.4%的最佳性能.

综上所述,MFAI-YOLO在未显著增加资源消耗且保持实时推理的基础上,大幅提升了检测精度,在精度、速度与资源占用之间取得了最佳平衡,具备极高的实际部署价值.

在UAVDT数据集的对比泛化实验(表4)中也可以看出,对于相同或不同主干的模型,MFAI-YOLO在mAP@0.5指标中相较次高模型RTMDet39高出1.3%,证明其检测中大目标也有良好的效果.综上所述,本文通过对比实验清楚的表明所提出方法在无人机视角图像检测中具有明显优势,在不同IoU阈值标准和不同尺寸物体方面实现优异的检测精度.

为了充分验证所提方法在无人机视角图像检测方面的优异性,本文在图6中提供了改进方法与其他主流算法(YOLOX29、Mamba-YOLO11、DINO-YOLO、Gold-YOLO16)的可视化对比示例.Mamba-YOLO引入状态空间模型SSM,有效减轻了自注意力机制的二次复杂性带来的计算负担.但针对无人机视角下的小目标检测效果,需要通过实验得到验证.如图所示,实验选取了四种具有代表性的极端挑战场景,分别为夜间弱光场景、高空阴影场景、密集城区场景、跨尺度桥梁场景.图6第一行展示的是夜间街道场景,在该场景下光照条件极差且存在霓虹灯眩光干扰.对比可以看出,YOLOX与Mamba-YOLO在暗光区域出现了明显的漏检现象,而MFAI-YOLO得益于增强的特征提取能力,能够更清晰地识别出路边的行人和车辆,展现了优异的抗干扰鲁棒性.图6第二行是在高空俯视视角下的建筑群场景,主要挑战在于目标尺度极小且被建筑物阴影遮挡.观察对比结果可知,DINO-YOLO与Gold-YOLO对阴影中的微小目标感知能力较弱,而MFAI-YOLO敏锐地捕捉到处于阴影边缘的微小目标,降低了漏检率.图6第三行是日间密集城区场景,背景包含复杂的树木与建筑物,且目标排列紧密.这种环境下易发生背景误检和目标重叠漏检.从检测结果来看,其他模型在树木遮挡区域容易丢失目标,而MFAI-YOLO不仅有效抑制了复杂背景的干扰,还能在密集排列的车辆与人群中实现精准定位,表现出更高的召回率.图6第四行是桥梁与水域场景,画面中包含了桥上的快速行驶车辆,属于典型的跨尺度检测任务.MFAI-YOLO准确检测到了桥面上细小的车辆目标,验证了该模型在处理多尺度目标和动态背景时的优越性能,证明了CSAIM与MU-C3k2模块在复杂场景下的有效性.

为了充分验证所提方法在无人机视角图像检测方面的优越性,在数据集UAVDT上进行泛化实验.从图7(a)左侧检测框可以看出白天街边十字路口这一车辆密度高、道路结构复杂的典型场景下MFAI-YOLO检测到更多远距离的目标,右侧检测框MFAI-YOLO在交警上方成功检测到汽车.图7(b)中,左侧检测框显示相较原模型MFAI-YOLO检测到了更密集的目标,并且提高了检测精度.右侧检测框中MFAI-YOLO比原模型多检测到两辆汽车.图7(c)中检测框不仅在道路场景下检测到更多目标,还检测到左侧一辆停靠的汽车.图7(d)中MFAI-YOLO对比原模型在道路旁、道路中、远端均检测到了更多的目标.结果表明模型在处理重叠遮挡时,相较原模型的表现,检测精度有一定的提高.综上所述,MFAI-YOLO在遥感、密集场景和小目标检测等 多个方面展现了优异的性能,并在检测指标上取得了明显改进,充分证明本文所提方法的有效性与实用性.

3 结 论

本文针对复杂背景下无人机航拍图像目标尺度分布不均匀导致检测精度低的问题提出一种多层级特征融合与注意力交互的无人机视角图像目标检测算法.

1)该算法提出了一种新的颈部网络MBAFPN替代原网络中的颈部网络,通过加入多尺度的特征融合与注意力交互模块CSAIM,更加精准地识别不同尺寸目标.另外,提出MU-C3k2模块增强了不同尺寸特别是小尺寸目标的检测效果.CTSA模块将低层特征图中丰富的细粒度特征信息传递到高层,有效提升整体检测性能.

2)在VisDrone2019 验证集上的实验证实了各改进模块的有效性.相较于YOLOv11s,所提方法在AP、AP50及APs等关键指标上均有显著提升,分别提高1.6、2.0、1.4个百分点.在Jetson Orin Nano真实嵌入式平台上的部署测试表明,MFAI-YOLO在实现高精度检测的同时,推理速度仍保持在36 FPS以上,成功克服了无人机机载端算力受限的瓶颈,在检测精度与硬件资源占用之间实现了良好的平衡.

3)在VisDrone2019和UAVDT测试集的实验表明改进后方法可以获得更好的检测效果.从可视化结果可以看出改进后的模型可以在白天、夜晚、遮挡以及小目标等场景下可以很好地应对无人机视角图像目标检测任务.从检测结果可知,所提出方法在遥感目标检测中存在少量漏检情况,后续研究可以进一步对小目标检测P2层进行研究.此外,虽然本研究已在嵌入式平台上验证了算法的实时性,但尚未在真实的闭环飞行控制系统中进行实地测试.未来的工作将致力于解决算法与飞行控制系统的集成问题,并在复杂的动态环境下开展实地飞行验证,以进一步评估算法在实际任务中的鲁棒性.

参考文献

[1]

李旻姝,周莫涵,支瑞聪 .基于多模态融合的无人机识别研究综述[J].计算机工程与应用202561(21):1-14.

[2]

LI M SZHOU M HZHI R C. Research review of UAV recognition based on multi-modal fusion[J]. Computer Engineering and Applications202561(21): 1-14.(in Chinese)

[3]

朱恩文,梁曌,肖进文, .基于MDS-YOLO模型的小目标检测问题研究[J].湖南大学学报(自然科学版)202451(12):78-86.

[4]

ZHU E WLIANG ZXIAO J Wet al .Research of small object detection problem based on MDS-YOLO model[J]. Journal of Hunan University (Natural Sciences)202451(12):78-86.(in Chinese)

[5]

张传深, 徐升, 胡佳, .基于巡逻无人机的轻量型安全帽佩戴检测方法与应用[J].集成技术202312(4):18-31.

[6]

ZHANG C SXU SHU Jet al .Research on safety helmet recognition method and application using patrol unmanned aerial vehicle[J].Journal of Integration Technology202312(4):18-31.(in Chinese)

[7]

贾星宇,李大鹏 .基于YOLO11的无人机航拍图像小目标检测算法[J].无线电工程202555(8):1560-1570.

[8]

JIA X YLI D P .Small target detection algorithm for UAV aerial images based on YOLO11[J].Radio Engineering202555(8):1560-1570.(in Chinese)

[9]

GIRSHICK RDONAHUE JDARRELL Tet al .Rich feature hierarchies for accurate object detection and semantic segmentation[C]//2014 IEEE Conference on Computer Vision and Pattern Recognition. June 23-28,2014,Columbus,OH,USA.IEEE,2014:580-587.

[10]

REN S QHE K MGIRSHICK Ret al .Faster R-CNN:towards real-time object detection with region proposal networks[J].IEEE Transactions on Pattern Analysis and Machine Intelligence201739(6): 1137-1149.

[11]

REDMON JDIVVALA SGIRSHICK Ret al. You only look once:unified,real-time object detection[C]//2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR),June 27-30,2016,Las Vegas,NV,USA. IEEE,2016:779-788.

[12]

LIU WANGUELOV DERHAN Det al. SSD:single shot MultiBox detector[C]//Computer Vision-ECCV 2016. Cham:Springer,2016:21-37.

[13]

TAN M XPANG R MLE Q V .EfficientDet:scalable and efficient object detection[C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR).June 13-19,2020,Seattle,WA,USA.IEEE,2020:10778-10787.

[14]

LI N XYE MZHOU L Het al .Self-prompting analogical reasoning for UAV object detection[J].Proceedings of the AAAI Conference on Artificial Intelligence202539(17):18412-18420.

[15]

WANG Z YLI CXU H Yet al .Mamba YOLO:a simple baseline for object detection with state space model[J].Proceedings of the AAAI Conference on Artificial Intelligence202539(8): 8205-8213.

[16]

YU W HWANG X C .MambaOut:do we really need Mamba for vision?[C]//2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR).June 10-17,2025,Nashville,TN,USA.IEEE,2025:4484-4496.

[17]

LI C LYANG TZHU S Jet al .Density map guided object detection in aerial images[C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW),June 14-19,2020,Seattle,WA,USA. IEEE,2020:737-746.

[18]

ZHU X KLYU S CWANG Xet al .TPH-YOLOv5:improved YOLOv5 based on transformer prediction head for object detection on drone-captured scenarios[C]//2021 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW),October 11-17,2021,Montreal,BC,Canada. IEEE,2021:2778-2788.

[19]

SUI J CCHEN D KZHENG Xet al .A new algorithm for small target detection from the perspective of unmanned aerial vehicles[J]. IEEE Access202412:29690-29697.

[20]

WANG C CHE WNIE Yet al. Gold-YOLO: efficient object detector via gather-and-distribute mechanism[J]. Advances in neural information processing systems202336: 51094-51112.

[21]

CAO J XCHEN QGUO Jet al. Attention-guided context feature pyramid network for object detection[EB/OL]. 2020arXiv:2005.11475.

[22]

YANG G YLEI JZHU Z Ket al .AFPN:asymptotic feature pyramid network for object detection[EB/OL]. 2023arXiv:2306.15988.

[23]

WANG GPAN Y H,JUN Y .The research focuses on enhancing the RTDETR model for improved detection of PCB defects[C]//2025 8th International Conference on Advanced Algorithms and Control Engineering (ICAACE).March 21-23,2025,Shanghai,China.IEEE, 2025: 1187-1191.

[24]

SHI Z CHU JREN Jet al .HS-FPN:high frequency and spatial perception FPN for tiny object detection[J].Proceedings of the AAAI Conference on Artificial Intelligence202539(7):6896-6904.

[25]

LI ZLANG C YLIEW J Het al .Cross-layer feature pyramid network for salient object detection[J].IEEE Transactions on Image Processing202130:4587-4598.

[26]

LIU SQI LQIN H Fet al. Path aggregation network for instance segmentation[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition.June 18-23,2018,Salt Lake City,UT,USA. IEEE,2018: 8759-8768.

[27]

YANG Z QGUAN QZHAO K Eet al. Multi-branch auxiliary fusion YOLO with re-parameterization heterogeneous convolutional for accurate object detection[M]//Pattern Recognition and Computer Vision.Singapore:Springer Nature Singapore,2024: 492-505.

[28]

DING X HZHANG Y YGE Y Xet al .UniRepLKNet:a universal perception large-kernel ConvNet for audio,video,point cloud,time-series and image recognition[C]//2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR),June 16-22,2024, Seattle, WA, USA. IEEE,2024: 5513-5524.

[29]

ZHU J CCHEN X LHE K Met al .Transformers without normalization[C]//2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), June 10-17,2025,Nashville,TN,USA. IEEE,2025:14901-14911.

[30]

ZHU P FWEN L YDU D Wet al .Detection and tracking meet drones challenge[J].IEEE Transactions on Pattern Analysis and Machine Intelligence202244(11): 7380-7399.

[31]

DU D WQI Y KYU H Yet al .The unmanned aerial vehicle benchmark:object detection and tracking[C]//Computer Vision-ECCV 2018.Cham:Springer,2018:375-391.

[32]

NI Z LCHEN X HZHAI Y Jet al. Context-guided spatial feature reconstruction for efficient semantic segmentation[M]//Computer Vision-ECCV 2024. Cham:Springer Nature Switzerland,2024:239-255.

[33]

GE ZLIU S TWANG Fet al .YOLOX:exceeding YOLO series in 2021[EB/OL].2021arXiv:2107.08430.

[34]

FENG C JZHONG Y JGAO Yet al .TOOD:task-aligned one-stage object detection[C]//2021 IEEE/CVF International Conference on Computer Vision (ICCV),October 10-17,2021,Montreal,QC,Canada. IEEE, 2022: 3490-3499.

[35]

ZHANG H YWANG YDAYOUB Fet al .VarifocalNet:an IoU-aware dense object detector[C]//2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), June 20-25,2021,Nashville,TN,USA. IEEE,2021: 8510-8519.

[36]

KHANAM RHUSSAIN M. YOLOv11:an overview of the key architectural enhancements[EB/OL]. 2024arXiv:2410.17725.

[37]

TIAN Y JYE Q XDOERMANN D .YOLOv12:attention-centric real-time object detectors[EB/OL]. 2025arXiv:2502.12524.

[38]

LI XWANG W HWU L Jet al .Generalized focal loss:learning qualified and distributed bounding boxes for dense object detection[C]//Proceedings of the 34th International Conference on Neural Information Processing Systems.December 6-12,2020,Vancouver,BC,Canada.ACM,2020:21002-21012.

[39]

XIAO YXU T FXIN Yet al .FBRT-YOLO:faster and better for real-time aerial image detection[J].Proceedings of the AAAI Conference on Artificial Intelligence202539(8):8673-8681.

[40]

HUANG S HLU Z CCUN X Det al. Deim: Detr with improved matching for fast convergence[C]//Proceedings of the Computer Vision and Pattern Recognition Conference. 2025: 15162-15171.

[41]

PENG Y SLI H BWU P Xet al. D-FINE: redefine regression task in DETRs as fine-grained distribution refinement[J]. arXiv preprint arXiv:2024.

[42]

LIU S LZENG Z YREN T Het al .Grounding DINO:marrying DINO with grounded pre-training for open-set object detection[C]//Computer Vision-ECCV 2024.Cham:Springer,2025:38-55.

[43]

LYU C QZHANG W WHUANG H Aet al. Rtmdet: an empirical study of designing real-time object detectors[J]. arXiv preprint arXiv: 2022.

基金资助

甘肃省重点研发计划项目(25YFGA047)

Key Research and Development Program of Gansu Province(25YFGA047)

鄂尔多斯市重点研发计划项目(YF20250245)

Key Research and Development Plan of Ordos City(YF20250245)

AI Summary AI Mindmap
PDF (5566KB)

150

访问

0

被引

详细

导航
相关文章

AI思维导图

/