0 引言
树种识别是森林资源管理、生物多样性保护及木材贸易监管的重要基础环节
[1]。精准的树种识别不仅能为森林资源清查、生态监测和可持续经营提供关键数据支撑,还在珍稀树种保护与合法木材贸易监管中发挥核心作用
[2]。传统的树种识别方法多依赖人工观察和专家经验,过程耗时、主观性强,难以满足大规模与高频次调查的需求
[3]。随着计算机视觉与深度学习技术的发展,基于图像识别的自动化树种识别方法逐渐成为研究热点,为林业数字化管理提供了高效、智能的解决方案
[4],利用树木年轮径切图像并结合GoogLeNet模型进行识别,准确率可达96.7%。
近年来,深度学习模型在树种识别中的应用不断拓展。早期研究多关注树叶、年轮或木材纹理特征。例如,高欣等
[5]利用树木年轮径切图像并结合GoogLeNet模型,实现了96.7%的识别准确率;苏彤等
[6]将生成对抗网络与卷积神经网络(convolutional neural network,CNN)结合,通过扩充叶片样本提升模型泛化性,验证准确率达97.2%。然而,在木材交易过程中利用树叶和年轮进行树种识别存在很多不便的情况
[7],例如,木材交易的方式往往为原木或原条交易,这时的木材已没有树叶。此外,树叶和年轮特征受季节变化与采样条件影响较大,难以在各种生产环境下稳定获取
[7]。相比之下,树皮在森林资源调查、主要的木材生产和交易等环节都是稳定可靠的器官,其图像易于采集,纹理差异在种间具有高度特异性,适合构建高鲁棒性的识别模型,提高树种识别的便利性和准确性
[8]。
在树皮图像识别方向上,深度学习方法已体现出显著优势。Carpentier等
[9]通过收集和分析树皮图像数据集,展示了CNN在树种识别中的潜力和准确性。刘嘉政等
[10]首次将CNN应用于树皮与叶片混合数据的识别,准确率达96%;李滨等
[11]在Xception框架中引入混合注意力机制,有效缓解了过拟合问题,识别率达到98.9%。韩誉等
[12]与张政银等
[13]则分别将YOLOv10与YOLOv11应用于无人机影像与树皮纹理识别,实现了高精度与轻量化兼顾的检测性能,展示出深度学习在复杂林业场景下的实用潜力。
随着林业调查、木材贸易监管及森林智能监测等应用场景对实时性与便携性的需求不断提升,树皮图像识别研究正逐步从算法验证向工程化与实际应用阶段过渡。近年来,一些研究开始关注树皮识别模型在移动终端和现场作业环境中的应用可行性,通过引入轻量化网络结构、迁移学习及模型压缩等策略,在保证识别精度的同时降低计算开销,为基于智能手机或嵌入式设备的树种快速识别提供了技术路径参考。此外,已有研究表明,单一特征提取网络在面对纹理相似树种时仍存在判别能力不足的问题,促使相关学者尝试通过多分支结构或特征融合方式增强模型对细粒度纹理差异的表征能力。同时,注意力机制逐渐被引入树皮识别模型中,用以强化关键纹理通道响应,其中高效通道注意力(efficient channel attention,ECA)等轻量级注意力模块因其参数开销小、易于集成等特点,在兼顾精度与效率方面展现出良好应用潜力。
目前,通过树皮识别树种的技术仍面临三大挑战:1)卷积神经网络在识别纹理相似的树皮时容易出现特征混叠,导致模型聚焦不稳定
[14];2)受限于采集条件与数据规模,小样本训练易造成过拟合,影响模型的泛化能力
[15];3)识别设备要具有便利性,部分模型在引入注意力机制后结构复杂,计算开销大,不利于在资源有限的移动终端设备部署
[16]。
为解决上述问题,本研究以东北地区6种主要树种识别为研究目标,通过智能手机拍摄树皮图像自建数据集。在此基础上,构建一种结合深层特征复用与轻量特征提取的双分支融合模型—— DenseShuffle_ECA。该模型以DenseNet121为主干网络提取高层语义特征
[17-18],以ShuffleNetV2提取轻量纹理特征
[19-20],并在Dense分支中嵌入ECA模块以强化重要特征响应
[21]。通过特征拼接实现多尺度信息融合,并在融合阶段引入随机失活(dropout)正则化以增强模型泛化性。
1 数据与环境
1.1 试验数据
本研究以黄檗(Phellodendron amurense)、兴安落叶松(Larix gmelinii)、蒙古栎(Quercus mongolica)、黑皮油松(Pinus tabulaeformis var.mukdensis)、水曲柳(Fraxinus mandshurica)和樟子松(Pinus sylvestris var.mongolica)6种东北地区主要树种的树皮图像为研究对象建立数据集,所有图像均采集自东北林业大学试验林场。
本研究的树皮图像采用iPhone12标准版智能手机在自然光条件下拍摄,拍摄距离为50~80 cm,保证纹理清晰且无明显噪声。数据采集过程中考虑了不同树龄、拍摄角度、光照条件及背景复杂度,以提高数据的多样性与代表性。采集完成后,对图像进行筛选,去除模糊、过曝或阴影严重的样本。数据集中各类样本数量保持平衡,以避免模型训练偏向某一类别。每类样本数量为400~1 000张,数据集中图片总计为3 514张。原始图像的分辨率均高于1 000×1 000像素,为便于模型训练,统一缩放为224×224像素输入模型,各树种的树皮图像数量和特征描述见
表 1。
1.2 数据处理
为了增强模型的泛化能力并突出树皮的纹理特征,本研究采用多种图像增强与预处理方法。首先进行亮度归一化与白平衡校正,以减轻光照差异的影响。然后使用伽马(Gamma)校正、对比度受限的自适应直方图均衡化(contrast limited adaptive histogram equalization,CLAHE)以及灰度化操作,提升局部纹理细节
[22-23]。为强化纹理边缘信息,还引入高通滤波与Laplacian算子变换提取高频特征。此外,通过Mixup和CutMix这2种方式进行样本级数据增强,进一步扩大样本空间并缓解过拟合问题
[24],图像预处理前后对比见
图1。最后通过数据扩增将数据集图像总数扩增到35 140张。扩增后的数据集按照7∶2∶1的比例划分为训练集、验证集和测试集,确保各类别分布均衡。
1.3 试验环境
试验在Ubuntu 22.04操作系统下进行,编程语言为Python 3.12,深度学习框架为PyTorch 2.8.0。硬件环境包括NVIDIA RTX 4090 GPU(显存24 GB)、Intel Xeon Platinum 8352V CPU(16核,2.10 GHz)以及120 GB内存。优化器采用Adam算法,初始学习率设为0.001,并使用余弦退火策略自适应调整学习率。批量大小为32,训练轮数设为150。在训练过程中,对验证集准确率进行实时监控,当验证集精度连续10个epoch未提升时提前终止训练,以防止过拟合。
2 试验方法
2.1 模型设计
2.1.1 DenseShuffle_ECA模型总体架构
DenseShuffle_ECA模型采用双分支卷积神经网络架构,其包含DenseNet121分支和ShuffleNetV2分支,两者并行对输入的树皮图像进行特征提取。随后,在DenseNet121分支的卷积特征上应用ECA模块,增强具有判别力的特征通道。最后,将两分支提取的特征向量在通道维度拼接(concat)融合,经过Dropout正则化和全连接层输出树种类别。DenseShuffle_ECA模型结构见
图2。
2.1.2 DenseShuffle_ECA模型的双分支特征融合设计与实现
本研究设计的DenseShuffle_ECA模型结合了DenseNet与ShuffleNet各自的优点:DenseNet121具有密集连接和特征复用,能提取丰富的高层语义特征;ShuffleNetV2结构轻量高效,能在增加很少计算量的情况下提供互补的特征表示。2种特征的融合能够提高模型的判别性能并保持适当的模型复杂度。
DenseNet121分支:DenseNet121是一种经典的卷积神经网络,其特点是在每一层与后续层之间建立密集的特征连接,从而促进特征的复用和梯度传播。本研究利用预训练的DenseNet121作为树皮特征提取器,并截取其主干网络(去除原有的分类层),得到DenseNet的特征提取子网络。对于输入的树皮RGB图像(尺寸经过预处理为224×224×3),DenseNet分支经过若干卷积与池化层逐步提取高层次纹理特征,输出一个维度为1 024的特征图(特征图大小为7×7,通道数1 024)。然后,应用ECA注意力模块对DenseNet的输出特征图进行通道加权。ECA模块先对特征图做全局平均池化得到每个通道的全局描述,然后通过一维卷积在通道维度上滑动聚合局部跨通道信息,生成与原通道数相同的权重系数,经激活后作为通道注意力系数。这些系数与原特征图按通道逐元素相乘,增强重要特征通道、抑制次要通道,从而获得更具判别性的DenseNet特征。随后,本试验对加权后的DenseNet特征图进行ReLU激活,并采用自适应平均池化将其缩减为1×1×1 024的全局特征向量。
ShuffleNetV2分支:ShuffleNetV2是一种针对移动设备优化的轻量级卷积网络
[26]。本研究实现了一个简化的ShuffleNetV2结构,包括连续的卷积和下采样模块。首先,对输入图像应用一个步幅为2的3×3卷积和最大池化,实现初步特征提取和尺寸减半。接着,构建若干逐步增加通道数的BasicBlock模块,通过1×1卷积提取特征并在通道维度上混洗,实现特征高效融合。在本试验的实现中,设置了三级BasicBlock(stage2至stage4),通道数逐层从输入的24增加到116、232、464。然后使用1×1卷积将通道维度扩大到1 024。经过全局平均池化后,ShuffleNet分支同样得到一个1 024维的特征向量。与DenseNet分支类似,本试验在ShuffleNet提取的特征图经过最后一层卷积后,引入ECA通道注意力模块,其参数设置与DenseNet支路一致。通过ECA的作用,ShuffleNet分支的特征通道得到了自适应的权重调整,有效突出与树种有关的细粒度纹理模式。之后进行全局池化,将ShuffleNet分支输出压缩为1×1×1 024的特征向量。
特征融合与分类:DenseShuffle_ECA模型将上述2个分支得到的1 024维特征向量在通道维上直接拼接形成一个2 048维的融合特征表示。选择拼接作为融合方式是由于其能够保留2种网络特征的全部信息,相比元素相加等方式有更强的表示能力。为了降低过拟合风险,本试验在融合特征上使用Dropout正则化,随机丢弃一部分神经元(丢弃率0.5)以提高模型泛化性能
[14]。最后,经过一层全连接层(2 048→6)将融合特征映射到6个树种类别的输出,再通过Softmax函数得到各类别的概率分布。
综上,DenseShuffle_ECA模型通过DenseNet121分支提取深层语义特征及在ShuffleNetV2分支提取轻量纹理特征,ECA注意力在每个分支内增强了判别特征的表达
[21],最终融合实现准确的树种分类。在保持适度模型复杂度的同时,充分利用了多源特征和注意力机制。
2.2 试验设计
为进一步探究模型中各组件对性能的贡献,进行了系统的对比试验,重点分析了特征融合方式、注意力机制配置以及正则化策略对模型性能的影响。最后进行了多模型试验对比,验证了DenseShuffle_ECA融合模型在树皮图像树种识别任务中的有效性。为了保证结果的统计有效性,在每个试验组中设置3个不同的随机种子(2 025、2 026、2 027)来控制模型初始化和数据加载的顺序,以保持训练中随机操作的一致性。随机种子是初始化随机数发生器的固定值,使模型在相同的参数下可以重复产生连续的随机序列,从而提高试验的可重复性和结果的可比性。在此基础上,每个试验组进行独立训练与测试。评价指标包括准确率(accuracy rate)、加权F1分数(weighted F1 score)、训练时间(training time,s)及推理时间(inference time,ms)。
2.2.1 特征融合策略对比试验设计
特征融合方式是双分支网络性能发挥的关键因素,不同融合策略在特征信息保留能力、模型稳定性及计算效率方面存在差异。为系统评估不同特征融合方式对DenseShuffle_ECA模型性能的影响,本研究设计了特征融合策略对比试验。
在保持网络结构、训练参数及数据划分方式一致的前提下,比较拼接融合(concatenate fusion)、平均融合(average fusion)与加权融合(weighted fusion)3种融合方式对模型性能的影响,总计进行9组试验。
2.2.2 注意力机制配置分析试验设计
注意力机制能够通过自适应调整特征权重增强模型对关键信息的聚焦能力,但不同注意力类型及其嵌入位置对模型性能的影响存在差异。为探索注意力机制在双分支融合模型中的最优配置方式,本研究设计了注意力机制配置分析试验。
试验选取3种主流注意力机制:高效通道注意力(efficient channel attention,ECA)、压缩激励网络(squeeze-and-Excitation,SE)和卷积块注意力模块(convolutional block attention module,CBAM),并将其分别集成于DenseNet分支、ShuffleNet分支以及双分支同时集成等不同位置。通过比较不同注意力机制及其集成位置组合,系统分析注意力机制对模型的影响,总计进行30组试验。
2.2.3 正则化方法对模型泛化能力的影响试验设计
模型的泛化能力是指其在未见数据(如独立测试集)上的表现,一般通过测试集上的指标(例如准确率、精确率、召回率和F1分数等)来衡量。提高模型的泛化能力对实际应用至关重要,因此需要考虑正则化方法对模型的影响。正则化(regularization)方法旨在降低模型对训练数据的过拟合,从而提升其对新数据的预测性能。其中,随机失活(dropout)和标签平滑(label smoothing)是2个常用且有效的手段,其通过不同机制来增强模型的泛化表现
[25]。
鉴于上述两种正则化方法可能对模型泛化性能产生的影响,本研究构建了对比试验来量化其作用。试验以ECA_dense_only和拼接融合模型为基线,在训练过程中分别应用不同程度的Dropout和是否使用Label Smoothing这2种策略进行对比。同时设置3种Dropout比例,分别为0.0、0.3、0.5,2种损失策略分别为标准的交叉熵(Cross entropy,CE)和带有Label Smoothing的交叉熵(CE+LS),2个因素各水平交叉组合,见
表2,共进行18组试验。
2.2.4 多模型验证试验设计
为验证所提出的 DenseShuffle_ECA融合模型在树皮图像树种识别任务中的有效性,选取5种经典模型与本研究提出的DenseShuffle_ECA融合模型进行对比,对比模型包括AlexNet、DenseNet、GhostNet、MobileNetV3和ShuffleNetV2,这些模型在图像分类任务中具有代表性,涵盖了传统卷积网络与轻量化网络等不同结构类型。所有模型均在相同的数据集划分、训练参数和试验环境下进行训练与测试,总计进行 18 组试验。
3 结果与分析
3.1 特征融合策略对比
特征融合是双分支网络的核心环节。本试验比较了拼接融合、平均融合与加权融合3种融合方式的平均性能及效率指标,结果见
表3。
由
表3可知,拼接融合取得了最高平均准确率(97.59%)和加权F1分数(97.58%),并且其标准差(±0.13%)在3种方法中最小。这表明试验中拼接融合不仅性能最优,而且在不同随机初始条件下表现最为稳定。在推理速度方面,拼接融合也略有优势(9.96 ms),快于加权融合和平均融合。
综上所述,拼接融合策略综合表现最佳,平均准确率和加权F1分数高于其他方法,且模型在不同初始化和数据打乱条件下的性能波动最小。平均融合性能略逊一筹,但训练耗时稳定。加权融合在本试验中平均性能最低且训练时间最长。拼接融合的优越性在于其完整保留了来自DenseNet121分支的深层语义特征和来自ShuffleNetV2分支的轻量纹理特征,形成了一个信息更丰富的2 048维融合特征向量
[26]。相比之下,加权融合和平均融合在计算过程中损失了部分特征信息。因此,拼接融合被确定为最终模型的融合策略。
3.2 注意力机制配置分析
本试验评估了ECA、SE和CBAM这3种主流注意力机制及其在不同分支位置的集成效果,3种注意力机制在模型不同分支位置的集成效果见
图3。
当ECA模块仅集成于DenseNet分支(ECA_dense_only)时,模型性能达到最佳,准确率提升至98.06%,较基线模型提升0.43%。该配置在提高分类精度的同时维持了较低的模型复杂度,这表明在Dense分支后集成ECA注意力机制能最有效地提升模型对树皮特征的聚焦能力,显著提升分类精度。
与此同时,本试验也注意到集成位置对最终结果也有一定影响。ECA或CBAM同时集成于两分支(ECA_both和CBAM_both)并未进一步提升性能,反而因参数增加导致训练不稳定和轻微的性能波动。这与已有研究结论一致,即适度注意力可显著提高模型的聚焦能力,而过度注意力可能引入冗余特征,影响特征分布与模型泛化性能
[27]。因此,ECA_dense_only架构被确定为最优配置方案,在精度与计算效率间实现了良好平衡。
3.3 正则化方法对模型泛化能力的影响
模型的泛化性能主要通过测试集准确率和加权F1分数来评估,这2项指标能够全面衡量分类模型的性能,其中加权F1分数是精确率和召回率的调和平均,能将二者平衡后以单一数值反映模型整体表现
[28]。本研究侧重使用准确率和F1作为评价指标,以突出模型整体的判别能力与平衡性能,因此未单独列出精确率和召回率。
正则化方法对模型泛化能力的影响试验结果见
表4。总体来看,在所有Dropout设置下,引入Label Smoothing的模型都取得了比未使用Label Smoothing时更高的测试准确率,且性能更加稳定。尤其是在不使用 Dropout(Dropout为0)的情况下,结合Label Smoothing训练的模型达到了98.28%的最高测试准确率,表现优于其他组合。同时也注意到,使用Dropout确实在一定程度上降低了模型性能在不同随机种子下的波动。例如,当Dropout为0.3时,模型准确率的标准差仅约为0.04%,说明Dropout对模型训练的稳定性有所帮助,然而,与Label Smoothing所带来的显著增益相比,Dropout对提高模型准确率的效果相对有限。综上,在本研究的分类任务中,Label Smoothing是在不增加推理开销的前提下提升模型泛化性能的最有效策略。而对于更复杂、更容易过拟合的场景,适当结合一定比例的Dropout与Label Smoothing,有望在保持较高准确率的同时进一步提升模型性能的稳定性。
3.4 多模型验证
将本研究提出的DenseShuffle_ECA融合模型与AlexNet、DenseNet、GhostNet、MobileNetV3和ShuffleNetV2这5种经典模型进行对比试验,试验结果见
表5。
DenseShuffle_ECA在准确率与加权F1分数上均显著优于其他模型,比次优模型DenseNet提升约3.2%。DenseNet的深层特征复用、ShuffleNetV2的高效通道交互机制以及ECA注意力模块的联合作用能够有效增强模型对树皮纹理的判别能力,实现对关键区域的精确聚焦。
3.5 模型复杂度与轻量化特性分析
以推理时间和训练时间作为模型复杂度指标,对各模型的轻量化特性进行对比分析。DenseShuffle_ECA模型单次推理耗时6.37 ms,训练耗时1 779 s,显著低于DenseNet的8.62 ms和5 450 s,分别缩短约26%和67%。同时,DenseShuffle_ECA的识别准确率达到98.87%,较DenseNet提升约3.2%。尽管ShuffleNetV2、MobileNetV3和GhostNet等轻量化网络具有更快的推理速度(单次推理耗时仅约1.7~4.3 ms),但其准确率仅在90%左右,明显低于DenseShuffle_ECA。由综合训练时间与推理时间2项指标可以看出,DenseShuffle_ECA模型在计算复杂度上明显低于传统深层网络,同时在识别精度上保持显著优势。
综上所述,DenseShuffle_ECA模型在精度、效率与模型复杂度之间表现出良好的综合优势,在精度与推理效率之间取得了更优平衡,使其更适用于资源受限的移动终端和现场树种识别场景。
4 结论
本研究针对树皮图像树种识别任务中存在的特征表达不足与模型复杂度高的问题,提出了一种基于双分支融合与高效通道注意力机制的DenseShuffle_ECA模型。在自建的6种东北地区主要树种树皮图像数据集基础上进行验证,DenseShuffle_ECA模型的平均识别准确率达98.87%,较DenseNet和ShuffleNetV2分别提升约3.2%和9.3%。模型在保持较低计算开销的同时显著提升了特征判别能力与泛化性能,验证了双分支特征融合与注意力机制结合在上述6个树种识别中的有效性。
本研究的数据集规模较小,树种数量有限,模型在更大范围内的泛化能力仍需进一步验证。此外,DenseShuffle_ECA模型结构虽已优化,但在嵌入式设备上的实时推理仍有改进空间。未来将在3个方面继续深入研究:1)扩充数据集规模与树种类别,引入多时相、多光照条件样本以提高鲁棒性;2)结合模型剪枝、蒸馏等技术进一步降低计算复杂度;3)探索Transformer等新型架构在树种识别中的应用,以提升模型的全局特征建模能力。
综上所述,DenseShuffle_ECA模型为树皮图像智能识别提供了一种兼顾精度与效率的可行方案,为林业资源调查与木材贸易等领域的智能化发展提供了技术支持。
中央高校基本科研业务费专项资金项目(2572023CT14-02)