基于改进YOLOv10和无人机影像的树种识别

韩誉 ,  刘浩然 ,  林文树

森林工程 ›› 2025, Vol. 41 ›› Issue (05) : 922 -935.

PDF (8517KB)
森林工程 ›› 2025, Vol. 41 ›› Issue (05) : 922 -935. DOI: 10.7525/j.issn.1006-8023.2025.05.006
森林可持续经营

基于改进YOLOv10和无人机影像的树种识别

作者信息 +

Tree Species Identification Based on Improved YOLOv10 and UAV RGB Imagery

Author information +
文章历史 +
PDF (8721K)

摘要

精准高效的森林树种识别是智慧林业实现的关键。传统的地面调查方法存在效率低、成本高等问题,而基于机器学习的树种识别方法通常依赖于大量的特征提取和先验知识。为解决这些问题,提出一种基于改进YOLOv10的无人机影像树种识别算法,通过轻量化网络设计和注意力机制增强,实现边缘设备的高效部署,为森林资源数字化管理提供技术支持。选取东北地区5种常见的树种落叶松(Larix gmelinii)、黄檗(Phellodendron amurense)、胡桃楸(Juglans mandshurica)、榆树(Ulmus pumila)和水曲柳(Fraxinus mandshurica)构建无人机影像数据集,通过采用轻量化卷积(Ghost)重构主干网络以降低计算复杂度。此外,在特征融合层引入卷积块注意力模块(Convolutional Block Attention Module,CBAM),通过通道和空间双维度的特征校准增强细粒度特征提取能力。通过双向跨尺度连接(BiFPN)优化多尺度特征融合,采用对称交并比损失函数(Symmetric Intersection over Union Loss,SIoU)改进边界框回归速度。最后于Jetson Nano嵌入式平台进行模型部署验证。改进后的YOLOv10模型在验证集上达到91.5%的查准率(Precision)和77.5%的mAP@0.5,分别较基线模型提升4.5%和3.8%。部署实测平均推理速度为43.5 FPS,较基线模型提升35.5%,mAP@0.5达75.7%。结果表明,YOLOv10改进算法通过轻量化架构和优化多尺度特征提取,在保持实时性的同时提升复杂林区场景的树种识别精度。该算法为无人机林业调查提供可嵌入式部署的解决方案,特别适用于林冠层重叠度高、光照条件多变的实际作业环境。

Abstract

Efficient and accurate tree species identification is critical for the realization of smart forestry. Traditional field survey methods are low efficiency and high cost, while machine learning-based tree species identification approaches often rely on extensive feature extraction and prior knowledge. To address these issues, a tree species identification algorithm based on improved YOLOv10 for UAV imagery is proposed in this paper. The improved architecture integrates lightweight network design and attention mechanisms to enable efficient edge device deployment, providing technical support for digital forest resource management. A UAV imagery dataset was developed for five common tree species (Larix gmeliniiPhellodendron amurenseJuglans mandshuricaUlmus pumila, and Fraxinus mandshurica) in Northeast China. The backbone network was reconstructed using lightweight convolution (Ghost) for computational complexity reduction. The convolutional block attention module (CBAM) was introduced in the fusion layer to strengthen fine-grained feature extraction through channel and spatial dual dimensional feature calibration. Multi-scale feature fusion was optimized through bidirectional cross-scale connections (BiFPN), while bounding box regression efficiency was improved using a structured intersection over union (SIoU) loss function. Final deployment validation was conducted on the Jetson Nano embedded platform. The improved YOLOv10 model achieved 91.5% precision and 77.5% mAP@0.5 on the validation set, showing improvements of 4.5% and 3.8% compared to the baseline model, respectively. In practical deployment, the model achieved an inference speed of 43.5 FPS, 35.5% faster than the baseline model, with mAP@0.5 of 75.7%. Results showed that, the improved YOLOv10 algorithm successfully balances identification accuracy and real-time performance in complex forest environments through lightweight architecture and multi-scale feature optimization. The solution demonstrates particular effectiveness in scenarios with dense canopy overlap and variable illumination, offering an embeddable solution for UAV forestry surveys.

Graphical abstract

关键词

树种识别 / 深度学习 / 无人机 / YOLO / 目标检测

Key words

Tree species identification / deep learning / UAV / YOLO / object detection

引用本文

引用格式 ▾
韩誉,刘浩然,林文树. 基于改进YOLOv10和无人机影像的树种识别[J]. 森林工程, 2025, 41(05): 922-935 DOI:10.7525/j.issn.1006-8023.2025.05.006

登录浏览全文

4963

注册一个新账户 忘记密码

0 引言

树种的精确识别可为林业管理和森林生态保护提供重要的数据支撑。传统树种分类方法依赖人工样地调查,存在效率低、成本高和难以覆盖复杂地形等问题。随着遥感技术的发展,卫星和机载遥感平台等被广泛用于大规模的林草监测。其中,无人机因具有低成本、高灵活性及能够提供更高分辨率影像的特点而被广泛应用1-3

在遥感数据类型中,高光谱影像虽然可以提供更丰富的光谱信息,但需要进行数据降维和波段优选等预处理,过程较为繁琐;激光雷达虽然能提供精确的三维结构信息,但受限于高昂的设备和处理成本4-5。相反,无人机影像(red green blue,RGB)仅需搭载常规的数字相机即可获得,并可利用现有的技术手段进行快速处理,使其成为树种分类中较为便捷、高效的遥感数据类型。目前,树种识别大多数依赖于机器学习算法,周湘山等6运用支持向量机进行树种识别,该方法的整体精度为60%。王俊杰等7运用随机森林进行无人机多光谱树种识别,总体精度为70.83%。姚扬8运用随机森林进行多源遥感数据树种识别,精度达到了77.96%。虽然取得了较高的识别精度,但需要具备大量的先验知识。

而近年来深度学习技术在图像处理和模式识别领域取得了显著的成就,相比于传统的机器学习方法,深度学习能够通过学习大量数据自动提取复杂的特征,无需手动设计特征提取器,这使得深度学习在树种识别上表现出更高的准确性和鲁棒性9。卷积神经网络(convolutional neural networks,CNN)10、深度残差网络(deep residual network,ResNet)11和深度信念网络(deep belief network,DBN)12等多种深度学习算法被应用于对森林树种进行高效、精确的分类与识别。Knauer等13采用混合卷积神经网络(CNN)和随机森林分类器对树种进行分类。尽管这种方法在准确性方面表现良好,但其对计算资源的要求较高,限制其在资源受限环境中的应用。周治煊14运用了无人机近地遥感影像结合深度学习算法FC-DenseNet模型,对长沙市的城市绿化进行了识别与分析,提出了不同飞行高度下的采集策略,但识别精度仍有很大提升空间。Chen等15则采用了一种结合传统图像特征与深度学习的混合算法进行树种识别。该方法虽然通过结合光谱和纹理特征提高了识别准确性,但在样本数量有限时,算法的性能提升仍然受限。

在众多深度学习算法中,单阶段检测算法如YOLO16(you only look once)因其实时性和高效性而被广泛应用。与R-CNN(region-based convolutional neural networks)17、SSD(single shot multiBox detector)18和FasterR-CNN(faster region-based convolutional neural networks)19等两阶段检测算法相比,YOLO通过单次前向传播即可完成图像中目标的定位和分类任务,显著提高了检测速度。Xu等20基于YOLO开发的无人机多光谱树种分类算法在树种识别任务中展现出显著优势,但在树冠密度高的地区仍存在单棵树边界分割不清楚的情况。黄丽明等21采用YOLO算法在无人机影像异常变色木识别中得到了良好的应用,但对于较小的异常变色木树冠,识别时容易产生漏检。Han等22提出的LUFFD-YOLO模型在无人机RGB影像的轻量级森林火灾检测中展现出较好的跨数据集泛化能力,但其网络轻量化设计存在特征表达能力受限的问题。随着YOLO算法架构的持续优化,YOLOv10通过引入效率与精度协同设计策略23,使其更加轻量化,展现了在精细树种识别方面的潜力。

综上,现有树种识别研究仍存在3方面局限。1)林区复杂背景下树冠纹理相似性导致特征区分度不足;2)无人机影像中树木尺度差异显著,现有特征金字塔难以有效融合多尺度信息;3)模型轻量化与精度难以平衡。针对上述问题,本研究提出基于YOLOv10的改进算法。1)采用Ghost卷积(ghost convolution,GhostConv)重构主干网络,通过特征重用机制降低计算复杂度;2)在特征融合层嵌入卷积块注意力模块(convolutional block attention module,CBAM),增强树冠纹理的细粒度特征提取;3)构建双向特征金字塔网络(bidirectional feature pyramid network,BiFPN),优化多尺度树冠的特征交互;4)引入对称交并比损失函数(structured intersection over union,SIoU)改进倾斜树冠的定位精度。通过算法轻量化设计和优化多尺度特征融合,在Jetson Nano嵌入式平台实现部署,为森林资源数字化管理提供可落地的技术方案。

1 数据与方法

1.1 研究区域与数据采集

研究区域位于黑龙江省哈尔滨市林业示范基地,如图1所示,地理坐标范围为45°43′05.83″—45°43′15.09″N、126°37′22.63″—126°37′28.49″E,海拔136~148 m24。本研究选取4块典型样地,总面积约为20 550 m²,占林场航拍区域(4.8 hm2)的42.8%,涵盖针阔混交林(样地1)、胡桃楸林(样地2)、黄檗林(样地3)、落叶松林(样地4),面积分别为4 550、5 250、3 750 、7 000 m²。主要研究树种包括落叶松(Larix gmelinii)、黄檗(Phellodendron amurense)、胡桃楸(Juglans mandshurica)、榆树(Ulmus pumila)和水曲柳(Fraxinus mandshurica)等。其中,样地1混交林包含落叶松、黄檗、榆树、胡桃楸和水曲柳等树种,其他样地均为纯林,仅包含少量其他树种。

采用大疆御2 RTK无人机(Hasselblad L1D-20c相机,28 mm焦距)于2023年9月1日夏秋季节更迭期间进行航拍,参数设置为相对航高130 m(地面分辨率1.2 cm/px)、航速5 m/s、航向207°、旁向/航向重叠率75%/80%。光照条件为晴天无云,太阳高度角52°,影像采集时间UTC+8 15:00。通过航拍整个林场矩形区域获取359张原始影像后,经Pix4Dmapper生成数字正射影像(DOM),并通过千寻RTK(平面精度1 cm)获取单木三维坐标(采样频率1 Hz,10历元均值),通过ArcGIS实现亚像素级地理配准(平面偏差均值1.2 cm)。

1.2 数据集制作

研究采用亚米级正射影像构建深度学习专用数据集,其制作流程涵盖空间裁剪、分层抽样、精准标注与增强优化4个阶段。通过ArcGIS对4块样地进行空间网格划分(单元尺寸7.68 m×7.68 m),以50%重叠滑动窗口生成640×640像素样本图像。为平衡模型泛化能力与空间独立性,实施双层抽样策略:第一层按样地类型(针阔混交林/黄檗林/胡桃楸林/落叶松林)进行7∶3比例划分,第二层在样地内部设置20 m空间缓冲带消除训练与验证集地理重叠。最终形成包含1 000张训练图像和500张测试图像的数据集,确保同一样木不会同时出现在2个子集(经空间坐标哈希验证)。

标注工作依托Roboflow协同标注平台,以千寻RTK定位数据为空间基准实施三级质量控制。首先由3名林业工程专业人员独立标注树冠矩形框(bounding box),随后通过交叉计算标注者间IoU值(0.89±0.03)筛选争议样本,最终结合RTK三维坐标反演(平面残差1.2 cm,高程残差2.8 cm)对重叠树冠进行空间拓扑仲裁。

在此基础上,通过多尺度数据增强策略提升模型泛化能力。首先对训练集随机施加±30°旋转和水平翻转(概率50%),模拟无人机不同航向角度的拍摄差异;随后在HSV色彩空间内调整亮度(±15%)、饱和度(±20%)和色调(±5%),以应对光照条件变化对树种色彩特征的影响。对增强后的数据集进行人工筛选,最终构建的数据集包含训练集2 000张、验证集500张、7 394个检测框,其中榆树(347框)和水曲柳(351框)样本量显著低于其他类别,仅占落叶松样本量的10.9%和11.0%,见表1。针对类别不平衡对模型训练的潜在偏倚,本研究提出自适应权重调整方法。在损失函数设计中,本研究采用自然对数函数对样本量进行非线性变换,构建类别权重,计算公式为

wc=lnNnc

式中:wc为权重;N为总检测框数;nc为c类别检测框数量;ln(⋅)为自然对数函数,用于压缩权重范围。

1.3 研究方法

1.3.1 YOLOv10算法改进

YOLOv10算法的核心架构基于单阶段目标检测的理念,通过将目标检测任务转化为回归问题,直接从图像中预测边界框和类别23。本研究以YOLOv10n为基线模型,采用GhostConv、CBAM注意力机制、BiFPN双向特征金字塔网络和SIoU损失函数进行改进,改进的模型网络结构如图2所示,图2中红色框线为改进部分。输入图像为640×640分辨率,RGB三通道。

1)Ghost卷积25。在无人机影像树种识别任务中,高分辨率图像处理与边缘设备部署需求之间难以平衡。传统卷积操作通过k×k卷积核生成Cout通道特征图,其复杂度计算公式为

OConv=H×W×Cin×Cout×k2

式中:HW分别为特征图尺寸的长和宽;OConv为计算复杂度;k为卷积核尺寸;CinCout分别为输入、输出通道数(维度)。

当处理无人机拍摄的4 000×3 000像素级影像时,YOLOv10原始主干网络的计算量达到32.7 GFLOPs,难以满足Jetson Nano等嵌入式设备的实时性要求。在YOLOv10的主干网络中引入GhostConv(图2)。通过特征重映射机制实现计算量压缩,具体分为2阶段。第一阶段为基础特征提取,采用深度可分离卷积生成内在特征;第二阶段为Ghost特征生成,先通过1×1卷积进行线性变换,扩展特征通道;最终输出通过通道拼接获得完整特征图。

2)CBAM注意力机制26。基于无人机影像中林冠层遮挡严重、小目标纹理模糊的特性,本研究在YOLOv10主干网络末端(Pre-SPPF阶段)嵌入改进的通道与空间注意力模块(CBAM)。由图2可知,CBAM模块位于主干网络SPPF层前,输入为C2f模块输出的1 024维高层特征,输出流向为校准后的特征依次输入SPPF(空间金字塔池化)和PSA(金字塔注意力模块),最终传递至BiFPN进行跨尺度融合。

3)BiFPN双向特征金字塔网络27。针对林区无人机影像中树种多尺度分布的特性,本研究在YOLOv10检测头前端设计双向跨尺度特征金字塔网络(BiFPN),通过自适应权重融合与双向信息流增强多层级特征的表征能力。由于BiFPN的跨层连接需要特征图在空间和通道维度对齐,故同时引入多个Conv将不同层级的通道数统一到相同维度,使多尺度特征可以逐元素相加或拼接。

4)SIoU损失函数28。针对林区无人机影像中树冠不规则、树木倾斜导致的边界框回归偏差问题,本研究采用SioU损失函数替代传统CIoU损失,通过引入角度惩罚项与动态形状约束,优化检测框的方向敏感性与几何匹配精度。

1.3.2 基于改进YOLOv10的嵌入式部署

为满足林区实时监测需求,本研究基于Jetson Nano嵌入式平台完成改进YOLOv10模型的部署优化。通过轻量化模型结构与硬件加速技术结合,实现无人机影像树种识别的边缘端高效推理。

具体技术流程如图3所示。首先,将PyTorch训练的改进模型通过开放神经网络交换(open neural network exchange,ONNX)中间表示格式进行标准化封装,消除框架依赖性。在Jetson Nano嵌入式平台部署TensorRT推理引擎,实施三级计算图优化策略。将Backbone网络中Conv-BN-SiLU复合结构合并为单节点计算单元,减少GPU内核调用次数。对BiFPN特征金字塔层保留FP16精度以防止小目标特征丢失,对Head检测层实施INT8量化29(校准算法采用基于KL(Kullback-Leibler)散度的熵最小化方法),生成校准表时通过500张验证集图片统计激活值分布。采用CUDA Graph固化计算图拓扑结构,消除动态形状推理的上下文切换开销,通过Zero-Copy内存管理器30建立CPU-GPU地址映射直通通道,使数据预处理阶段的内存拷贝延迟降低。

1.3.3 评价指标

本研究选择查准率(precision,式中记为P)、查全率(recall,式中记为R31、平均精度均值(mAP@0.5,式中记为mAP32和算法推理速度(frames per second,FPS)作为评价指标,查准率和查全率计算公式为

P=TPTP+FP
R=TPTP+FN

式中:TP为预测框与真实框IoU≥阈值,且分类正确;FP为预测框与真实框IoU<阈值,或分类错误;FN为未被检测到的真实框,阈值为0.5。

AP为平均精度,是对某一类别的查准率-查全率曲线下的面积计算。计算公式为

AP=01PrdR

式中:R为查全率;dR为积分变量。

mAP为平均精度均值(mean average precision,mAP),是所有类别AP的平均值,可以用来评估模型对所有类别的检测性能,mAP@0.5为交并比(IoU)阈值为0.5时的平均精度均值。计算公式为

mAP=1Ni=1N01APi

式中:N为类别数;APi为第i类的平均精度。

2 结果与分析

2.1 试验设置

本试验使用的工作站试验平台的软硬件环境为GPU NVIDIA RTX 3090、CPU intel W2295、Memory 64GB 、Windows11、Cuda 12.1、Python 3.11.5、Pytorch 2.2.0,对比试验和消融试验均在此环境下进行。试验期间工作站保持不间断状态。部署试验硬件平台选用Jetson Nano 4 GB Developer Kit,搭载128核NVIDIA Maxwell GPU及4核ARM Cortex-A57 CPU。软件环境部署JetPack 5.1.2 SDK,集成CUDA 11.4、cuDNN 8.6及TensorRT 8.6,支持PyTorch模型至TensorRT引擎的转换。

试验采用AdamW优化器,初始学习率设为3×10-4,配合余弦退火调度(cosine annealing)策略,最小学习率衰减至1×10-6。批量大小(batch size)设置为32,输入图像分辨率调整为640×640。训练过程持续400个epoch,前3个epoch进行线性热身(linear warm-up),权重衰减系数为0.05。损失函数由分类损失(BCEWithLogitsLoss)、定位损失(SIoU)和置信度损失(focal loss)加权组成,权重比为1∶0.7∶0.5。早停机制(patience)设置为50。

2.2 不同模型性能评估

为系统评估改进YOLOv10模型的综合性能,本研究在自建无人机树种数据集上对比了Faster R-CNN、SSD和YOLO系列等主流检测模型,并从精度、速度、轻量化及能效4个维度展开量化分析,不同模型性能数据见表2,Jetson Nano推理速度为部署环境下的指标,其余各项指标皆在工作站环境中得到,其中Faster R-CNN因显存占用过高(>4 GB),未能在Jetson Nano完成推理测试。

根据表2绘制不同模型平均检测精度与推理时间散点图,如图4(a)所示。改进模型在RTX 3090 GPU上mAP@0.5与推理速度(FPS)的散点图中显著位于右上方,表明其具有高精度与高实时性。改进模型较同家族的YOLOv8s分别提升4个百分点和60.6%的推理速度,同时超越YOLOv7-tiny和YOLOv5s等其他主流模型,体现了无NMS架构与轻量化设计的协同增效作用。图4(b)为不同模型能效比,能耗数据为基于3次重复试验标准差得到,误差范围为±5%,直线斜率为模型能效比(FPS/典型功耗)。改进模型在4.1 W的典型功耗下可稳定运行43.5 FPS,其能效比(10.6 FPS/W)优于YOLOv5s(6.0 FPS/W)和SSD(2.5 FPS/W)。从模型复杂度视角分析,改进YOLOv10以2.58 M参数量成为对比模型中最为紧凑的架构,较YOLOv5s和YOLOv8s分别减少64.2%和75.4%的参数规模。其参数量仅为两阶段模型Faster R-CNN的1.9%。综合试验结果表明,改进YOLOv10在精度、速度、轻量化及能效4个关键指标上均展现显著优势,更加适用于林业复杂场景的树种识别。

2.3 不同改进模块的效果分析

为验证各模块对模型性能的协同优化机制,本研究通过消融试验对比GhostConv轻量化卷积、CBAM注意力机制、BiFPN跨尺度融合三者的组合效应,见表3。由表3可知,原始YOLOv10基线模型(试验组1)在轻量化特性下达到73.7%的平均精度均值与225 FPS的推理速度,但多尺度的查全率存在瓶颈。

通过引入BiFPN(试验组2)改善多尺度特征的提取且不增加参数量,查全率较基线模型提升0.4%,参数量减少5.6%,但因其多尺度连接结构增加了计算流复杂性,在未配合轻量化设计时推理速度下降了13.2%。而单独添加CBAM(试验组3)虽增强特征选择能力(mAP@0.5提升1.5%),却因通道与空间注意力计算引入额外内存延迟,参数量提高2.2%导致FPS下降11.7%,表明注意力机制需与轻量化设计协同使用。同时为增强多尺度融合时的特征选择能力,将CBAM注意力机制与BiFPN融合(试验组8),进一步提高查全率,较基线模型提升1.5%,这种折中设计在保证特征表达能力的同时实现了轻量化,但推理速度仍然低于基线模型,需要进行轻量化改进。SIoU损失函数的单独试验表明(试验组5),其通过角度惩罚项与动态形状约束机制,提升了倾斜目标的定位精度,mAP@0.5提升0.4%,推理速度略微提升1.5 FPS。单独引入GhostConv提高轻量化特性时(试验组4),参数量减少8.5%,GFLOPs降低3.7%,mAP@0.5提升3.5%。GhostConv与CBAM的联合使用时(试验组6)在除推理速度以外各方面性能均有小幅度提升。GhostConv与BiFPN的联合使用时(试验组7),GFLOPs与基线模型相近,将Precision提高到90%以上,且FPS提高1.6%。集成GhostConv、CBAM与BiFPN时(试验组9),获得了全方位的性能提升。

对比改进模型与原始YOLOv10n的行归一化混淆矩阵可知,基线模型中落叶松查准率最高,主要误检为黄檗,如图5所示。榆树查准率最低,漏检率高达33%,这与样本量较少有关。改进模型使漏检样本总数减少41%。

全模块组合(Ours)通过集成GhostConv、CBAM与BiFPN和SIoU,以2.58 M参数量达到77.5%平均精度均值与253.8 FPS,较基线模型提升5.2%的平均精度均值与12.8%推理速度。结果表明,SIoU并非孤立提升单指标,而是通过几何约束重构与现有模块形成正向反馈。其角度与尺度联合优化特性,使GhostConv的轻量化优势、CBAM的注意力聚焦能力、BiFPN的多尺度适应性得到更充分释放。性能雷达图中清晰地展示了各模型在不同指标下的分布情况,如图6所示,图6中GFLOPS和参数量(parameters)的值越小,表示性能越好。因此,在雷达图中,对GFLOPS和参数量的坐标轴进行了反转处理。在误差允许范围内,全模块组合模型在PR、mAP@0.5和FPS 4个评价指标上全面领先,这一结果印证了模块协同设计的必要性:GhostConv降低卷积计算密度使模型轻量化,CBAM通过通道权重校准抑制复杂背景干扰筛选特征,而BiFPN则增强了对重叠目标的多尺度适应性,SIoU优化了角度与尺度特性。全模块模型的FPS-mAP能效比(FPS/GFLOPs=31.3)较基线(27.4)提升14.2%,证明多模块联合优化可突破轻量化模型的性能边界。

2.4 模型部署试验分析

为验证改进YOLOv10模型在林业边缘计算场景下的实用性,基于NVIDIA Jetson Nano 4 GB平台开展优化试验。试验结果见表4,通过TensorRT INT8量化(试验组3)和层融合技术(试验组4),最终实现推理速度41.2 FPS至43.5 FPS的提升,较FP32基线(试验组1)提升373.6%~400%,同时内存占用压缩79.2%,达成边缘设备实时检测的技术目标。INT8量化(试验组3)使模型内存占用从FP16(试验组2)的683 MB压缩至327 MB(降幅52.1%)。

为验证量化部署稳定性,由图7(a)可知,INT8量化策略使C2fCIB Stage5层的99.6%的激活值集中在[-0.5,0.5],形成显著截断效应。相较于FP32的正态分布(KS检验p=0.32),量化后的分布与原始分布重叠面积为35.7%,通过蒙特卡罗积分计算的信息熵损失率ΔH=4.2%。这种可控的信息损失提升硬件并行计算效率。图7(b)的检测框置信度分布进一步揭示模型优化效果。FP32模型置信度呈宽幅波动(0.65~0.91,标准差0.21),并出现2个0.48、0.53异常低值;而INT8模型置信度范围收窄至0.74~0.87(标准差0.17),异常值完全消除。通过图8分析发现,异常值主要源于2种场景,光照突变导致归一化误差(占85%,如图8(a)所示);树冠晃动引发纹理断裂(占15%,如图8(b)所示)。量化策略通过动态范围约束算法,使模型在复杂环境下保持稳定输出。

层融合与内存优化策略(试验组4)带来性能的进一步提升。由图9可知,通过Conv-BN-SiLU复合层融合,计算节点数量减少32.7%,最大延迟层C2fCIB Stage5的执行时间从11.2 ms压缩至3.7 ms,降幅66.9%。这种结构优化使FPS提升5.6%,同时峰值内存占用下降20.8%。图10的功耗监测曲线表明,优化后的推理过程功率波动范围从±1.2 W缩窄至±0.3 W,这是由于内存访问模式优化使DDR(double data rate)突发请求频率降低。最终在试验组4实现平均功耗4.1 W,较基线模型功耗降低39.7%,且设备温度稳定在48±2 ℃(持续运行1 h测试)。

表5可知,改进后的YOLOv10在NVIDIA 3090 GPU端达到77.5%的平均精度均值,优于主流检测模型。经过INT8量化及层融合优化后(试验组4),部署在Jetson Nano上的模型仍保持75.7%的平均精度均值,较原始YOLOv10n(73.7%)提升2.0%,且推理速度达到43.5 FPS,满足林业巡检实时性需求。

检测结果如图11所示,图中“luo”“huang”“qiu”“yu”和“shui”分别表示落叶松(L.gmelinii)、黄檗(P.amurense)、胡桃楸(J.mandshurica)、榆树(U.pumila)和水曲柳(F.mandshurica)。由图11可知,与基线模型相比,改进后的模型在胡桃楸树冠重叠较为严重的密集区域具有更好的检测效果,并且在黄檗、水曲柳和落叶松等树种的检测中也有更高的置信度。

3 讨论

1)对比试验中,双阶段算法Faster-RCNN其复杂的网络结构查准率高于所有算法,但其136.2 M的参数量与框架依赖性导致显存占用远超边缘设备极限,故难以满足部署要求。SSD的精度瓶颈是基于VGG16的特征提取层感受野固定,难以适应树木尺度多变、枝叶遮挡严重的复杂场景,导致对小目标的漏检率较高。而YOLO系列中早期版本(如v3、v4)通过引入CSPNet和多尺度预测提升检测精度,但参数量与计算成本限制了边缘部署能力,v5—v8系列逐步强化轻量化设计,直至v10版本引入通过端到端架构后,参数量在对比试验中达到最小。

2)消融试验中,BiFPN的跨尺度交互虽提升查全率,但其多分支融合结构导致特征图维度跃升,在未引入GhostConv时,特征通道的线性增长使计算流带宽需求骤增,引发GPU显存访问延迟,最终导致FPS下降。而GhostConv的稀疏卷积机制通过跨通道特征复用,以此降低主干网络的计算密度推动FPS增长。CBAM单独引入时,通道注意力通过动态校准通道特征提高了检测平均精度均值。但空间注意力模块应用于高分辨率特征图会产生较大计算开销,导致单帧推理时延增加。而在联合GhostConv后起到了轻量化卷积减少计算冗余的作用。全模块组合的性能大幅提升源于计算路径的深度协同,BiFPN在高层特征融合时依赖大感受野特征,而CBAM的空间注意力恰好强化了此类特征的边缘梯度,二者形成互补。GhostConv则通过动态通道剪枝,将BiFPN中冗余的低响应特征分支剔除,使跨尺度融合的计算流宽度减少,最终在参数量持平条件下实现FPS提升。

3)部署试验中,INT8量化将FP32的浮点运算替换为8bit整数运算,故单层计算密度提升从而提升FPS。量化与层融合的协同降低了平均功耗,是由于INT8运算将每个MAC操作的能耗降低,而层融合通过减少数据搬运次数,使DRAM功耗占比下降。

4)尽管模型总体表现良好,但在一些特定情况仍存在较大的误差。对于不同树种,落叶松mAP@0.5最高(为79.2%),主要是由于其树冠呈规则圆锥形,轮廓清晰。针叶排列紧密,形成均匀的纹理,在影像中边缘锐利、对比度高,便于算法识别。榆树mAP@0.5最低(为75.4%),则是其主要存在于混交林中,影像中边缘模糊纹理细节多变,增加了识别难度,且其叶片与水曲柳、黄檗等阔叶树相似,易导致分类混淆。对于不同样地,混交林的mAP@0.5最低(为72.1%),主要是多树种混杂导致树冠边界模糊,遮挡严重,目标检测困难。胡桃楸林的mAP@0.5较低(为76.3%)是单个树冠覆盖面积广,可能与其他树冠边缘重叠,导致检测框定位不精准。对于季节适应性,数据于温带气候地区的夏秋更迭期间采集,此时存在轻微叶绿素降解树木变色的情况。通过结合本研究的HSV色彩扰动数据增强策略使得模型在季节适应性上有一定的泛化能力,但模型对夏季完全叶色稳定期或深秋枯黄期的泛化能力仍需多时相数据验证。

4 结论

本研究对YOLOv10算法进行改进,提出一种高效、准确的无人机RGB影像树种识别方法,并进行边缘设备环境下的试验验证。通过对算法结构和训练策略的优化,改进后的算法在树种识别任务达到了91.5%的查准率和77.5%的平均精度均值,优于原版YOLOv10和其他主流目标检测算法。在NVIDIA Jetson Nano设备上部署时,算法的平均精度均值为75.7%,平均推理速度为43.5 FPS,虽然相比部署前性能有所下降,但仍然高于原版YOLOv10算法。这一研究结果提高了树种识别的自动化水平,增强了其在复杂自然环境中的适用性,具有潜在的应用前景,特别是在森林资源动态监测、生态监测和环境保护领域。但模型仍存在不足,这与训练数据的不平衡、树种数据季节泛化性不足以及图像质量等因素有关。为进一步提升模型的识别精度和鲁棒性,后续的改进可以着重于以下方面,比如,优化数据集、增加多时相数据验证以及改进图像预处理方法,将算法推广到其他林地类型。

参考文献

[1]

赵勋,岳彩荣.基于遥感数据的林地变化检测方法研究[J].林业资源管理2019(1):101-108,135.

[2]

ZHAO XYUE C R.Study on forest change detection method based on remote sensing data[J].Forest Resources Management2019(1):101-108,135.

[3]

吴雪琼,覃先林,周汝良,.森林覆盖变化遥感监测方法研究进展[J].林业资源管理2010(4):82-87.

[4]

WU X QQIN X LZHOU R Let al.Progress of study on forest cover change detection by using remote sensing technique[J].Forest and Grassland Resources Research2010(4):82-87.

[5]

陈龙伟,周小成,李传昕,.基于UNet-ResNet14半监督学习的无人机影像森林树种分类[J].农业工程学报202440(1):217-226.

[6]

CHEN L WZHOU X CLI C Xet al.Classification of tree species based on UNet-ResNet14 semi-supervised learning using UAV images[J].Transactions of the Chinese Society of Agricultural Engineering202440(1):217-226.

[7]

吴晓明.改进的混合空洞卷积神经网络高光谱影像树种分类算法[D].廊坊:北华航天工业学院,2023.

[8]

WU X M.Improved hybrid hollow convolutional neural network for tree species classification in hyperspectral images[D].Langfang:North China Institute of Aerospace Engineering,2023.

[9]

陈健昌,陈一铭,刘正军.激光点云深度学习的树种识别研究[J].遥感信息202237(2):105-111.

[10]

CHEN J CCHEN Y MLIU Z J.Tree species identification based on laser point cloud deep learning[J].Remote Sensing Information202237(2):105-111.

[11]

周湘山,朴虹奕,周杰,.基于机器学习算法的无人机高光谱树种分类方法研究[J].能源与环境2023(4):134-137.

[12]

ZHOU X SPIAO H YZHOU Jet al.Research on classification method of drone hyperspectral tree species based on machine learning algorithms[J].Energy and Environment2023(4):134-137.

[13]

王俊杰,张思媛,滕鹏程.基于无人机多光谱和HMLS的森林树种识别[J].黑龙江科技大学学报202333(5):774-778.

[14]

WANG J JZHANG S YTENG P C.Forest tree species identification based on UAV multispectral and HMLS[J].Journal of Heilongjiang University of Science & Technology202333(5):774-778.

[15]

姚扬.基于多源遥感数据的城市植被优势树种分类[D].昆明:云南大学,2022.

[16]

YAO Y.Classification of dominant tree species of urban vegetation based on multi-source remote sensing data[D].Kunming:Yunnan University,2022.

[17]

NEZAMI SKHORAMSHAHI ENEVALAINEN Oet al.Tree species classification of drone hyperspectral and RGB imagery with deep learning convolutional neural networks[J].Remote Sensing202012(7):1070.

[18]

KRIZHEVSKY ASUTSKEVER IHINTON G.ImageNet classification with deep convolutional neural networks[C]//Advances in Neural Information Processing Systems 25 (NIPS 2012.Curran Associates Inc.,2012.

[19]

HE KZHANG XREN Set al.Deep residual learning for image recognition[C]//2016 IEEE Conference on Computer Vision and Pattern Recognition(CVPR).Las Vegas,NV,USA,June 27-30,2016.IEEE,2016:770-778.

[20]

HINTON G ESALAKHUTDINOV R R.Reducing the dimensionality of data with neural networks[J].Science2006313(5786):504-507.

[21]

KNAUER UVON REKOWSKI C SSTECKLINA Met al.Tree species classification based on hybrid ensembles of a convolutional neural network (CNN) and random forest classifiers[J].Remote Sensing201911(23):2788.

[22]

周治煊.基于FC-DenseNet的无人机RGB影像城市树种识别[D].长沙:中南林业科技大学,2023.

[23]

ZHOU Z X.Identification of urban tree species in UAV RGB images based on FC-DenseNet[D].Changsha:Central South University of Forestry and Technology,2023.

[24]

CHEN CJING LLI Het al.Individual tree species identification based on a combination of deep learning and traditional features[J].Remote Sensing202315(9):2301.

[25]

REDMON JDIVVALA SGIRSHICK Ret al.You only look once:Unified,real-time object detection[C]//2016 IEEE Comference on Computer Vision and Pattern Recognition (CVPR).Las Vegas,NV,USA,June 27-30,2016.IEEE,2016:779-788.

[26]

GIRSHICK R.Fast R-CNN[C]//2015 IEEE International Conference on Computer Vision (ICCV),Santiago,Chile,December 07-13,2015.IEEE,2015:1440-1448.

[27]

WEI LDRAGOMIR ADUMITRU Eet al.SSD:single shot MultiBox detector[C]// Computer Vision - ECCV 2016.Springer,Cham,2016:21-37.

[28]

REN SHE KGIRSHICK Ret al.Faster R-CNN:Towards real-time object detection with region proposal networks[J].IEEE Transactions on Pattern Analysis and Machine Intelligence201739(6):1137-1149.

[29]

XU S CWANG R RSHI Wet al.Classification of tree species in transmission line corridors based on YOLO v7[J].Forests202315(1):61.

[30]

黄丽明,王懿祥,徐琪,.采用YOLO算法和无人机影像的松材线虫病异常变色木识别[J].农业工程学报202137(14):197-203.

[31]

HUANG L MWANG Y XXU Qet al.Recognition of abnormally discolored trees caused by pine wilt disease using YOLO algorithm and UAV images[J].Transactions of the Chinese Society of Agricultural Engineering202137(14):197-203.

[32]

HAN Y HDUAN B CGUAN R Xet al.LUFFD-YOLO:A lightweight model for UAV remote sensing forest fire detection based on attention mechanism and multi-level feature fusion[J].Remote Sensing202416(12):2177.

[33]

WANG ACHEN HLIU L Het al.YOLOv10:Real-time end-to-end object detection[J].arXiv preprint arXiv:2024.

[34]

汪永英,孟琳,韩冬荟,.城市森林物种多样性——以哈尔滨城市林业示范基地为例[J].东北林业大学学报201745(3):34-38.

[35]

WANG Y YMENG LHAN D Het al.Species diversity in urban forest-A case study of City Forestry Demonstration Base in Harbin[J].Journal of Northeast Forestry University201745(3):34-38.

[36]

HAN KWANG YTIAN Qet al.GhostNet:More features from cheap operations[C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR).Seattle,WA,USA,June 13-19,2020.IEEE,2020:1577-1586.

[37]

WOO S, PARK JLEE J Yet al.CBAM:Convolutional block attention module[C]//Computer Vision - ECCV 2018.Munich,Germany:Springer,2018:3-19.

[38]

TAN M XPANG R MLE Q V.EfficientDet:Scalable and efficient object detection[C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR).Seattle,WA,USA,August 05,2020.IEEE,2020:10778-10787.

[39]

ZHORA G.SIoU Loss:More powerful learning for bounding box regression[J].arXiv preprint arXiv:2022.

[40]

DETTMERS TLEWIS MBELKADA Yet al.LLM.int8():8-bit matrix multiplication for transformers at scale[J/OL].arXiv preprint arXiv:2022.

[41]

MCCANNE SJACOBSON V.The BSD packet filter:A new architecture for user-level packet capture[C]//Usenix Winter Conference on Usenix Winter Conference.USENIX Association,1993.

[42]

杨堃,范习健,薄维昊,.基于视觉加强注意力模型的植物病虫害检测[J].南京林业大学学报(自然科学版)202347(3):11-18.

[43]

YANG KFAN X JBO W Het al.Plant disease and pest detection based on visual attention enhancement[J].Journal of Nanjing Forestry University (Natural Sciences Edition)202347(3):11-18.

[44]

孙丰刚,王云露,兰鹏,.基于改进YOLOv5s和迁移学习的苹果果实病害识别方法[J].农业工程学报202238(11):171-179.

[45]

SUN F GWANG Y LLAN Pet al.Identification of apple fruit diseases using improved YOLOv5s and transfer learning[J].Transactions of the Chinese Society of Agricultural Engineering202238(11):171-179.

基金资助

黑龙江省自然科学基金联合引导项目(LH2020C049)

AI Summary AI Mindmap
PDF (8517KB)

1250

访问

0

被引

详细

导航
相关文章

AI思维导图

/