基于稀疏混合专家的优势树种分类方法

娄彤彤 ,  汪泽宇 ,  张文钧 ,  李超 ,  谷俊涛 ,  邹为涛 ,  景维鹏

森林工程 ›› 2026, Vol. 42 ›› Issue (03) : 637 -648.

PDF (5331KB)
森林工程 ›› 2026, Vol. 42 ›› Issue (03) : 637 -648. DOI: 10.7525/j.issn.1006-8023.2026.03.019
农林智能装备与技术

基于稀疏混合专家的优势树种分类方法

作者信息 +

Dominant Tree Species Classification Using a Sparse Mixture-of-Experts Framework

Author information +
文章历史 +
PDF (5458K)

摘要

森林优势树种分类是区域森林资源精细监测与生态评估的重要基础。在中等分辨率遥感场景下,像元混合与边界过渡效应显著,混交区域类别判别不稳定。同时,训练样本中不同树种类别的样本占比存在明显差异,样本占比偏低的类别更易出现漏分、空间破碎与边界漂移等问题。为此,面向光学数据、雷达数据和地形因子构建多模态输入,提出一种少数类增强多模态混合专家网络(minority-class mitigation mixture-of-experts network,M-MoENet)。该方法设计轻量层级融合模块,对不同模态进行专用卷积编码并逐级融合,获得统一特征表示。在编码器前馈子层引入稀疏混合专家多层感知机模块(mixture-of-experts multilayer perceptron,MoE-MLP),并结合置信度调节门控实现自适应专家激活。同时,引入面向低占比类别的训练约束,以缓解主导类偏置并提升少数类的有效学习能力。试验结果表明,M-MoENet总体性能最优,总体精度(overall accuracy,OA)、平均交并比(mean intersection over union,mIoU)和Kappa系数分别达到79.46%、60.08%和0.74,并在常绿松与椴树等少数类上取得更显著提升。该方法能够在多模态和类别样本比例不均衡条件下提升优势树种分类精度,为复杂林区优势树种分类提供有效方法。

Abstract

Dominant tree species classification is an important basis for fine-scale forest resource monitoring and ecological assessment at the regional scale. In medium-resolution remote sensing scenarios, mixed pixels and boundary transition effects are prominent, resulting in unstable class discrimination in mixed forest areas. Meanwhile, the training data exhibit substantial imbalance in the sample proportions of different tree species categories, and categories with lower sample proportions are more prone to omission errors, spatial fragmentation, and boundary drift. To address these issues, this study constructs a multimodal input framework integrating optical data, radar data, and topographic factors, and proposes a multimodal sparse mixture-of-experts network, termed M-MoENet. The proposed method designs a lightweight hierarchical fusion module to perform modality-specific convolutional encoding and progressive fusion, thereby obtaining unified feature representations. A sparse MoE-MLP is introduced into the feed-forward sublayer of the encoder, and confidence-adjusted gating is employed to achieve adaptive expert activation. In addition, a training constraint oriented toward low-proportion categories is incorporated to alleviate dominant-class bias and improve the effective learning of minority classes. Experimental results show that M-MoENet achieves the best overall performance, with OA, mIoU, and Kappa reaching 79.46%, 60.08%, and 0.74, respectively, and yields more pronounced improvements for minority classes such as evergreen pine and linden. These results demonstrate that the proposed method can improve the classification accuracy of dominant tree species under multimodal conditions and class-imbalance settings, providing an effective solution for dominant tree species classification in complex forest regions.

Graphical abstract

关键词

优势树种分类 / 语义分割 / 多模态 / 混合专家模型 / 少数类增强

Key words

Dominant tree species classification / semantic segmentation / multimodal data / mixture-of-experts (MoE) model / minority-class boosting

引用本文

引用格式 ▾
娄彤彤,汪泽宇,张文钧,李超,谷俊涛,邹为涛,景维鹏. 基于稀疏混合专家的优势树种分类方法[J]. 森林工程, 2026, 42(03): 637-648 DOI:10.7525/j.issn.1006-8023.2026.03.019

登录浏览全文

4963

注册一个新账户 忘记密码

0 引言

森林优势树种分类结果是森林资源监测、生态系统结构与功能评估、生物多样性变化分析及区域碳汇核算的重要基础信息1。在区域尺度应用中,该任务通常以像素级分类形式实现,用于分析林分空间异质性并保留边界细节。随着深度学习方法的发展,端到端表征学习成为优势树种精细分类的重要技术路径2。已有研究基于卷积神经网络(convolutional neural network,CNN)、残差网络(residual network,ResNet)等框架实现像元级树种分类3-4,但其特征学习主要依赖局部邻域信息,对全局空间关系的刻画相对有限。为提升全局上下文的建模能力,进一步引入视觉变换器(vision transformer,ViT)及其分割变体5,并将其用于森林树种的精细分类6。然而,现有研究仍多依赖单一或少量模态数据,在复杂地形与混交林区易出现边界模糊与细粒度空间异质性分析不足的问题。

随着遥感观测手段的丰富,多源信息在物理敏感性上具有互补性,融合多模态信息以提升复杂林区的树种可分性已成为重要发展方向7-8。Nezami等9融合无人机高光谱与红蓝绿三波段影像开展混交林优势树种分类,Chen等10融合光学与合成孔径雷达(synthetic aperture radar,SAR)等多源信息开展森林类型分类研究,均验证了多模态信息对分类性能的促进作用。然而,现有优势树种分类任务在融合策略上仍以简单通道拼接或固定加权为主11,难以针对不同模态物理含义和树种响应差异实现自适应互补,从而导致混交过渡区与边界细节的判别仍不稳定。

另一方面,在中分辨率区域优势树种分类任务中,训练数据常呈现类别样本分布不均衡的情况,即不同树种类别在有效监督样本中的占比差异较大。本研究将其中样本占比显著偏低的树种类别定义为少数类。该不均衡易导致模型偏向主导类别,从而削弱少数类判别能力12。针对上述类别不均衡导致少数类分类困难的问题,已有研究主要从样本分布调节与损失函数设计2个层面进行改进13。在样本层面通过欠采样、过采样、分层采样与数据增强等策略重构类别比例14-15,或基于置信度的伪标签扩充以增加少数类有效样本。Qi等16提出通过补丁重采样在扩充训练样本的同时重构补丁尺度的类别比例;Shaheen等17基于高光谱与激光雷达(light detection and ranging,LiDAR)采用高置信度伪标签逐步扩充少数类训练集,以缓解类别不平衡问题。但该策略易引入噪声并对阈值敏感,复杂林分下的少数类精度提升仍有限。在损失层面,通常通过在交叉熵中引入类别权重18-19或采用焦点损失函数(Focal Loss)等变体抑制多数类梯度主导、强化少数类与难样本贡献20-21。Martins等22在树种分类的多任务CNN中引入部分加权的Focal Loss,以抑制优势类损失贡献。然而,这类方法多局限于损失函数层面的再加权调节,对主干网络特征表征与判别机制的影响仍较为有限。

针对上述问题,本研究提出一种面向类别样本不均衡场景的少数类多模态混合专家网络(minority-class mitigation mixture-of-experts network,M-MoENet),该方法首先构建多模态异构特征的统一输入与融合框架,为后续联合建模提供一致的数据表示基础。随后在编码器中引入稀疏混合专家多层感知机模块(mixture-of-experts multilayer perceptron,MoE-MLP),并设置置信度感知门控(confidence-aware Softmax,CA-Softmax),从而提高少数类样本的专家参与度,并增强加权融合有效性。同时结合少数类增强损失与专家均衡正则,提升少数类分类稳定性。该网络可用于优势树种分类,以提升少数类在复杂林分背景下的识别能力、空间分类一致性及边界判别稳定性。

1 数据与方法

1.1 研究区域概况

研究区域位于黑龙江省东南部典型温带针阔混交林分布带,地理范围为43°25'—46°36'N,127°22'—133°56'E,地处张广才岭、老爷岭与完达山北支等山系过渡地带,地貌以中低山和丘陵为主,地形起伏明显。区域内森林类型多样,林分组成复杂,主要涉及落叶松、蒙古栎、桦树、杨树、椴树及松类等针阔叶树种,不同树种常呈块状、带状及镶嵌状混交分布,林分边界与过渡带广泛存在,空间异质性特征较为显著。在中等分辨率遥感条件下,这种复杂混交格局易导致混合像元比例升高,并增加类别区分与边界分析难度。为覆盖不同地形与林分结构情景,本研究选取东北虎豹国家公园(黑龙江片区)、虎林市与帽儿山3处典型样区。三者分别体现为山地森林、低山丘陵与平原过渡及低山丘陵区次生林与人工林交错等不同类型,能够较好表征黑龙江省东南部复杂林区优势树种分类的典型场景。

1.2 数据来源及处理

本研究以2016年基于时空融合算法23重建的30 m光学时间序列为基础,并结合Sentinel-1雷达观测和数字高程模型(digital elevation model,DEM)派生地形因子构建优势树种分类输入数据。所有数据统一进行质量控制,并完成投影一致化、空间配准与重采样,确保在同一30 m网格下可比。光学数据采用USGS Collection 2 Level-2 Surface Reflectance产品中的Landsat 8 OLI影像,该产品已在几何校正、辐射定标和大气校正基础上提供地表反射率数据,并结合中分辨率成像光谱仪(moderate resolution imaging spectroradiometer,MODIS)时序数据,通过时空融合算法生成2016年全年连续光学观测序列。Sentinel-1数据获取自哥白尼开放数据平台,并经过标准预处理后提取SAR散射特征。地形数据采用地理空间数据云提供的航天飞机雷达地形测绘任务数字高程模型(shuttle radar topography mission digital elevation model,SRTM DEM),原始空间分辨率为90 m,重采样至30 m后参与后续建模。

基于时间序列数据,对生长季多时相观测进行像元中位数合成,获取代表性生长季合成影像。在此基础上提取6个光谱波段特征即红、绿、蓝、近红外、短波红外1和短波红外2波段,并进一步计算归一化植被指数(normalized difference vegetation index,NDVI)、增强植被指数(enhanced vegetation index,EVI)、土壤调节植被指数(soil-adjusted vegetation Index,SAVI)。同时,基于逐时相指数序列逐像元提取物候指标生长季开始(start of season,SOS)、生长季结束(end of season,EOS)、生长季长度(length of season,LOS),并引入同期Sentinel-1 SAR散射特征,即垂直发射-垂直接收极化(vertical transmit and vertical receive,VV)和垂直发射-水平接收极化(vertical transmit and horizontal receive,VH)及其极化比值特征(VV/VH)与DEM派生地形因子海拔、坡度和坡向,共同构成模型输入的多通道特征集合。

1.3 数据集构建

以3处典型样区的林分经营单元矢量边界及其优势树种属性为监督来源,在森林掩膜约束下,经类别映射与栅格化构建像元级监督标签,非林地像元统一标记为 ignore,不参与模型训练与精度评价。为便于表述,将3处样地记为典型样区A、B、C。考虑小班边界混合像元及矢栅配准误差可能引入标签噪声,本研究以主导小班比例75%为阈值,对标签进行纯化处理。最终将落叶松(Larix gmeliniiLg)、蒙古栎(Quercus mongolicaQm)、杨树(Populus spp.,Pop)、桦树(Betula spp.,Bet)、椴树(Tilia spp.,Til)、常绿松(Pinus spp.,Pin)作为本研究的主要优势树种,对于未纳入上述树种清单的样本,统一归入其他类(others),作为非目标树种样本的归并类别,见表1

典型样区A、B、C在统一类别体系下合并用于训练与推理。本研究采用先空间分组、后滑窗裁剪的流程,以提高训练、验证和测试集之间的空间独立性。首先将研究区划分为384×384像元网格,并按7∶2∶1划分为训练、验证与测试掩膜,其中384像元为步长128像元的3倍,可对齐采样起点并保证256×256像元样本块落入单一网格。随后在各掩膜内分别执行滑动窗口裁剪,仅保留掩膜在样本块范围内取值一致的样本块。剔除标注覆盖不足样本后,最终保留1 043个有效样本块用于训练与评估。

1.4 M-MoENet模型构建

构建端到端分割框架M-MoENet,模型由多模态输入融合前端、M-MoE特征编码器和轻量级多尺度解码器组成,形成从多源特征到逐像元类别预测的整体网络结构。在此基础上,训练阶段进一步引入少数类增强损失和专家均衡正则,以提升少数类树种和混交区域的识别能力。该方法的整体流程见图1

1.4.1 多模态输入与特征融合

本研究将输入特征划分为三类模态:光学与物候特征模态(optical-phenological modality,OTP,记为O)、合成孔径雷达后向散射特征模态(synthetic aperture radar backscatter modality,SAR,记为S)以及地形因子模态(topographic factor modality,TF,记为T)。各模态数据经预处理后重采样至统一空间网格,实现像元对齐。为减弱不同模态在数值尺度与统计分布上的差异,在编码器前端为每一模态设计了轻量级ResNet浅层编码单元,分别进行1×1卷积归一化与残差块提取,得到浅层特征图分别记为HOHSHT,随后,将三类模态浅层特征沿通道维度拼接,公式为

Hcat=ConcatHO,HS,HTH×W×Ccat

式中:HW分别为空间尺寸;Ccat为通道数。随后通过3×3卷积、批量归一化与ReLU激活跨模态相关性进行建模,同时将通道数映射到与编码器首层一致的维度C0,得到统一融合特征,公式为

Z0=σ(BN(Conv3×3(Hcat)))H×W×C0

式中:Z0表示多模态输入在进入主干编码器前形成的初始统一融合表示;σ为ReLU激活函数;BN为批量归一化。

1.4.2 M-MoE特征编码模块

以统一融合特征图Z0作为编码器输入,编码器被划分为L个阶段(l=1,2,,L),并通过重叠块嵌入 (overlapped patch embedding,Patch Embedding)将二维特征映射为序列表示。阶段之间通过Patch Embedding实现下采样并同步增加通道维度,使得第1~4阶段的特征图的空间尺寸依次为H/4×W/4、H/8×W/8、H/16×W/16、H/32×W/32,通道维度则从C1逐步扩展到C4。为与解码器的像元级预测匹配,各阶段末输出按空间维度重排为二维特征图FlHl×Wl×Cl,其中,HlWlCl分别表示第l阶段输出的空间尺寸与通道维度,得到多尺度特征集合Fll=1L用于后续解码与分类。

1)MoE-MLP专家前馈模块

标准Transformer编码器模块中的前馈子层通常由两层全连接网络及非线性激活构成,对所有特征标记(token)在通道维度进行统一映射。考虑到本研究输入为多模态融合后的序列表征,不同空间位置与类别对应的判别需求存在差异。基于此,本研究在每个Block中将传统前馈子层替换为由多专家组成的MoE-MLP模块,并采用稀疏混合专家(sparse mixture-of-experts,sparse MoE)范式,使token能够按需激活少量专家进行非线性变换。

记第l阶段某Block经多头自注意力子层及残差连接更新后的中间特征序列为URN×Cl,其中,N为token数量,Cl为该阶段的通道维度。对任意token向量uRCl,MoE-MLP模块配置K个并行的前馈专家Ek()k=1K,对任意k1,2,,K,专家Ek采用两层全连接层构成的MLP结构,并在输出端引入受压缩-激励机制(squeeze-and-excitation,SE)启发的通道重标定机制,其映射形式为

Eku=SEkW2(k)ϕW1(k)u+b1(k)+b2(k)

式中:ϕ为GELU激活函数;W1kRdh×ClW2kRCl×dh为权重矩阵;b1(k)Rdhb2(k)RCl为偏置参数;dh为MLP的隐藏层维度;SEk为第k个专家对应的SE风格通道重标定算子,其计算形式为SEkz=akzzakz,表示由轻量瓶颈映射生成的通道注意力权重;表示逐通道乘法。

门控网络根据特征标记u生成专家权重,并在稀疏激活策略下得到最终稀疏门控权重g˜k(u)k=1K,其中g˜k(u)0k=1Kg˜ku=1,且仅在被激活的少量专家上取非零值,MoE-MLP对token u的输出可表示为

MoE-MLPu=k=1Kg˜kuEku

对特征序列U独立计算得到MoE-MLPURN×Cl。并与残差连接前馈更新形式为

X'=U+MoE-MLPLNU

式中:LN表示层归一化;X'为MoE-MLP更新后的输出序列,默认设置下每个MoE-MLP子层包含K=4个MLP-SE专家,见图2

2)置信度感知专家门控机制

在稀疏MoE结构中,门控网络为每个token选择激活专家并分配聚合权重,本研究固定采用Top-2稀疏路由以控制计算开销。类别不均衡条件下,少数类token预测概率更分散、置信度更低,固定温度的Softmax易导致门控权重过度集中,使Top-2权重高度不均衡,较小的门控系数趋近于0,并趋于单一专家主导,不利于少数类样本学习。为此,提出置信度感知Softmax(confidence-aware Softmax,CA-Softmax),利用token的预测不确定性自适应调节温度参数,以抑制门控权重的过度集中并提升多专家融合的有效性。给定输入特征标记uRCl,门控分支输出专家打分s(u)RK,同时,采用轻量级类别分支预测类别概率pu=p1u,,pMuT,并以Shannon信息熵分析不确定性:

u=-m=1Mpmulg pmu

式中:M为类别总数;lgM为在M类别均匀分布条件下的最大熵,据此定义样本自适应温度,公式为

τu=τmin+(τmax-τmin)ulogM

式中:τminτmax为温度上下界;τu为随不确定性u单调变化,从而对门控打分su实施缩放。当τu增大时,su/τu的相对差异被压缩,Softmax权重对单一高分专家的指数式偏置被抑制,从而降低权重分配的过度集中并缓解Top-2内的权重极化。由于少数类token往往对应更高的u,该机制更易在少数类样本上触发,使第二专家获得非退化权重与有效梯度更新,进而提升少数类样本的建模能力与分类精度。基于自适应温度得到门控的连续权重,公式为

gku=expsku/τuj=1Kexpsju/τu,k=1,2,,K

随后本研究采用Top-2激活策略,仅保留gku中最大的2个权重并在其上重新归一化,得到最终稀疏门控g˜ku,用于式(4)中MoE-MLP的专家加权聚合。

1.4.3 轻量级多尺度特征解码模块

为高效整合M-MoE编码器输出的多尺度特征并控制参数开销,本研究采用结构紧凑的轻量级解码模块。设编码器第l阶段输出的特征图记为FlRHl×Wl×Cl,首先,对各尺度特征通过1×1卷积、归一化和ReLU激活进行通道压缩,通道数统一为Cd,随后采用双线性插值将各尺度特征上采样到统一分辨率,并在通道维度进行级联以获得多尺度融合特征。在此基础上,通过一层3×3卷积结合归一化与非线性激活完成特征融合,得到解码器输出特征图Fdec。最后,通过卷积映射层将解码特征映射至优势树种类别空间,得到逐像元的未归一化类别预测得分(logits,式中记为logits),公式为

logits=Conv1×1(Fdec)Hd×Wd×M

1.4.4 少数类增强优化模块

考虑到优势树种样本呈长尾分布,且稀疏MoE训练过程中可能出现专家激活不均衡,本研究设计少数类增强优化模块(minority-class boosting,MCB)。该模块以基础像素级分割损失为主项,并联合引入少数类增强项与专家均衡正则项,整体目标函数定义为

=seg+λweakweak+λmoemoe

式中:为总损失;seg为基础分割损失;weak为少数类增强项;moe为专家均衡正则项;λweakλmoe为权重系数。

设解码器输出经Softmax后,像元i属于第m类的概率为qi,m,对应真实标签独热(one-hot)编码为yi,mNp为参与监督的像元数量,则基础分割损失采用标准像素级交叉熵,公式为

seg=-1Npi=1Npm=1Myi,mlg qi,m

为缓解长尾分布下交叉熵对主导类的梯度偏置,将类别重加权与焦点损失中的聚焦调制机制结合构造少数类增强项,以提高少数类与低置信度像元的优化权重。设第m类像元数为nm,则类别权重按1/nm归一化得到αm,并引入聚焦参数γ>0,得到少数类增强损失,公式为

weak=-1Npi=1Npm=1Mαm(1-qi,m)γyi,mlg qi,m

为抑制门控过度集中导致的专家塌缩,引入专家均衡正则以约束批次内的平均门控分布。设g¯k为第k个专家在一个批次内的平均门控权重,则moe定义为

moe=k=1Kg¯klgg¯k1/K

联合损失在保证整体分割精度的同时,加强了对少数类样本的关注,并抑制M-MoE编码器中专家塌缩现象。

1.5 试验设置与评价指标

1.5.1 试验参数

本研究中所有的试验均在配备NVIDIA A100 GPU (80 GB)的高性能计算服务器上完成。将多模态特征统一重采样至30 m分辨率,样本构建采用256×256(裁剪步长为128)像元对影像和标签同步剪裁。训练阶段选用AdamW优化器,初始学习率设为2×10-4,权重衰减系数为0.01,批次大小设置为16,整个训练过程共进行训练轮次为200轮。MoE-MLP采用4个专家,并使用Top-2路由策略,前馈层扩展比设为4.0,随机失活率为0.1,SE压缩率为4.0。CA-Softmax的温度参数τ取值范围为τ[0.5,2.0]。

1.5.2 评价指标

为定量评估M-MoENet在优势树种分类中的性能,本研究在测试集上构建混淆矩阵,并据此计算各类F1-score(F1)、总体精度(Overall Accuracy,OA)、平均交并比(mean intersection over union,mIoU)以及Kappa系数(Kappa)。F1用于衡量类别表现,OA反映整体正确率,mIoU衡量预测与真实分布的一致性,Kappa在随机一致性基础上修正整体精度。

2 结果与分析

2.1 对比试验结果

为验证M-MoENet在像元级优势树种语义分割任务中的性能优势,试选取ResUNet24、DeepLabv3+[25]、Swin-UMamba26、SwinUNet27与SegFormer285种代表性语义分割模型作为对比基线开展试验。为保证对比公平,所有基线模型均使用与本研究一致的多模态输入特征,采用通道维度堆叠的早期融合输入,并仅将各基线模型首层输入通道数适配为相应多通道,其余结构保持不变。试验结果见表2,M-MoENet在总体指标上取得最优表现,OA达79.46%,mIoU为60.08%,Kappa为0.74,均优于5种对比模型。相较SegFormer,M-MoENet的OA、mIoU提升4.39、7.11个百分点,Kappa提升0.05,体现出更稳定的整体判别能力。

从类别层面看,将训练数据中样本占比显著偏低的树种类别定义为少数类。根据数据集统计,椴树与常绿松属于少数类。M-MoENet在蒙古栎与其他类两类上获得最高F1,分别为85.24%与85.04%,并在少数类识别上表现更突出。相较SegFormer,椴树F1由53.73%提升至65.75%,常绿松由52.99%提升至65.00%。这表明,在30 m空间分辨率下,M-MoENet能在提升总体性能的同时,更有效缓解少数类学习不足与混交区域易混淆导致的漏分与破碎问题,从而实现更平衡的类别识别表现。

2.2 可视化对比分析

为保证可视化对比的客观性,本研究仅在测试集掩膜约束且与训练区域空间隔离的范围内,从3处典型样区选取包含典型混交格局与边界过渡特征的局部窗口进行展示。典型样区A试验结果见图3,蒙古栎与桦树构成主体背景,落叶松以条带状或斑块嵌入其中,椴树与常绿松多位于混交过渡区及斑块边界。对比结果显示,ResUNet与DeepLabv3+易出现椒盐噪声与边界侵蚀,导致少数类断裂、漏分或被优势类吞并。Swin-UMamba与SwinUNet在连片性上有所改善,但过渡带仍存在细碎镶嵌与类别跳变。SegFormer在窄带少数类与细小边界处仍可见局部破碎。相比之下,M-MoENet在红框区域对椴树等窄带结构的保留更稳定,连通性与边界一致性更高,并减少少数类被过度平滑覆盖,从而获得更清晰稳定的分割结果。

典型样区B结果见图4,该区域混交更强,类别边界密集且过渡带更复杂。可视化对比显示,ResUNet与DeepLabv3+在复杂过渡带中更易产生细碎误分与局部边界漂移,导致椴树与常绿松等少数类呈碎片化或被相邻类别覆盖。Swin-UMamba、SwinUNet与SegFormer虽在主体斑块轮廓保持与连片性方面有所改善,但红框区域仍可见类别跳变与镶嵌纹理,斑块形态稳定性不足。相比之下,M-MoENet在红框区域对少数类小斑块的连通性保持更稳定,边界位置与参考标签一致性更高。同时对中部狭长的其他类窄带也能更好地保持其连续形态,减少被相邻类别侵蚀或割裂的现象,从而呈现更一致的空间分割结果。

典型样区C结果见图5,该区域标签呈现显著的镶嵌化格局,整体边界密集、类别切换频繁。对比可见,ResUNet与DeepLabv3+在该类高破碎度场景下更易出现细碎误分与局部边界漂移,导致椴树与常绿松等小斑块类别发生断裂、形态被侵蚀或被周围优势斑块吞并。Swin-UMamba与SwinUNet对主体斑块的连片性有所改善,但在红框所示的过渡带与小斑块集中区域仍存在类别跳变与镶嵌噪声,落叶松与常绿松斑块的完整性保持不足。SegFormer整体格局上较为接近参考标签,但是对椴树分割结果不稳定,表现出局部漏分与形态破碎。相比之下,M-MoENet对椴树和常绿松的连通性与边界贴合度保持更为稳定,同时能够有效抑制过渡带的零散误分,使空间格局表达更一致。

2.3 消融试验结果

2.3.1 模型消融试验

为验证M-MoENet各关键设计的有效性,本研究在相同训练、测试划分与超参数设置下开展消融对比,包括以标准前馈替代MoE-MLP、去除CA-Softmax门控、去除少数类增强项MCB以及将本研究的轻量融合替换为直接通道拼接(concat)。完整模型取得最优整体性能,各模块均对性能提升具有正向贡献,且增益呈叠加效应,见表3。其中,去除MoE-MLP的性能退化最明显,OA从79.46%下降至75.23%,表明多专家前馈建模是提升像素级判别能力的主要来源。同时,常绿松的F1由65.00%回落至52.99%,椴树由65.75%回落至54.01%,表明多专家前馈对复杂混交像元的特征分解与细粒度表达是少数类提升的主要支撑。移除CA-Softmax后mIoU下降3.46%,同时OA与Kappa亦同步下降,常绿松F1下降至60.34%,说明基于置信度调节的自适应门控有助于稳定专家激活与类别选择,尤其在复杂混交与边界过渡区域能带来更稳健的分割收益。移除少数类增强时mIoU下降3.27%,在少数类上出现更明显的性能回落,体现少数类导向监督能够缓解类别不均衡带来的识别偏置。相比Concat对照,完整模型mIoU提升2.08个百分点,表明本文融合策略较直接拼接能够更有效地聚合多模态互补信息并提升区域重叠质量。总体而言,M-MoENet的性能优势来源于多专家表达与门控及少数类监督的协同,其中MoE-MLP决定了少数类能力上限,其余机制进一步提升了少数类学习的稳定性。

2.3.2 数据消融试验

为定量评估不同模态信息对优势树种分割的边际贡献与互补性,本研究在保持网络结构与训练策略一致的前提下,仅改变输入模态组合,进行对比试验分析,试验结果见表4。其中,O表示光学特征包含波段与植被指数,P表示物候特征,S表示Sentinel-1 SAR特征,T表示地形因子。总体而言,随着多模态特征逐步引入,模型分割一致性呈现稳定提升,在mIoU指标上表现最为清晰。仅使用光学特征O时,mIoU为55.08%,在此基础上加入物候特征(O+P)后提升至57.09%,其提升主要源于物候特征能够表征树种在生长季内的时序动态差异,补充单期光谱在混交背景下对类内差异与类间相似性的区分不足,从而降低阔叶树种之间以及阔叶与针叶过渡区域的混淆。在光学与物候特征的基础上进一步引入S与T,mIoU分别达到58.40%与58.56%。这表明,SAR与地形信息可提供与光学物候互补的结构与分布先验,从而改善混交区域的边界质量并提升少数类稳定性。在全模态(O+P+S+T)输入下,模型取得最佳总体表现,OA、mIoU与Kappa分别达到79.46%、60.08%与0.74,与仅光学输入相比,多模态带来的增益更集中体现在少数类上,椴树与常绿松的F1分别由56.55%与57.63%提升至65.75%与65.00%。这表明,在样本占比偏低与混合像元效应共同作用下,多源互补特征通过引入时序动态、结构散射与地形约束,有助于提升少数类在混交与过渡区域的判别稳定性,从而带动整体分割质量提升。

3 讨论

在30 m空间分辨率下,森林像元普遍存在混合特征,边界与过渡带的光谱、物候及结构线索重叠更强。叠加类别长尾分布后,模型训练更容易形成对优势类的决策偏置,常见表现为少数类与混交类别被优势类吸附、预测斑块破碎,以及边界处类别跳变加剧。已有像元级树种分类研究表明,在类别不均衡情境下,深度学习模型虽然能够较传统随机森林更好地改善少数类识别,但低占比类别仍然是性能提升最困难的部分29。相比之下,M-MoENet的改进意义不仅在于总体精度提高,更在于对少数类与混交过渡类别的系统性纠偏。其效果在表3中体现为总体指标的同步提升,并在常绿松与椴树等少数类别上呈现更显著的增益,说明模型在不确定样本占比更高的区域能够形成更稳健的类别判别与空间一致性。

进一步结合消融结果可知,M-MoENet的性能提升来源于表达能力增强与优化分配的协同作用。1)MoE-MLP为复杂样本提供了多子空间表达能力,使多模态证据能够在不同专家中进行分解建模,这一点区别于传统单路径前馈网络,也解释了去除该模块后低占比类别回落最明显的现象。2)CA-Softmax的贡献更侧重于混交与边界样本的稳定判别,其基于不确定性的温度调节能够避免对高不确定样本过度自信,减少错误决策在空间上的扩散,因此对mIoU与一致性指标形成稳定增益。与现有多源树种分类算法相比,该方法的改进不在于是否采用统一的多模态融合表示,而在于统一表示基础上进一步引入了面向样本差异的动态专家建模。已有多源融合方法通常通过预定义的特征组合实现多源信息整合,其优势主要体现为多模态互补带来的整体分类性能提升30。相比之下,M-MoENet在统一多模态表示之后,通过稀疏专家结构和CA-Softmax门控对不同样本实施差异化特征建模,从而为复杂样本提供更具针对性的表征路径。

已有针对类别不均衡的遥感分类方法,主要从损失函数设计、模型结构改进或数据组成优化等方面缓解决策偏置31。在此基础上,本研究进一步通过少数类增强项改善训练阶段的梯度分配与类别偏置,使类别纠偏不仅体现在优化约束层面,也与动态专家建模形成协同作用。需要指出的是,相较于单主干分割模型,M-MoENet额外引入了门控与多专家结构,训练复杂度有所增加,但通过Top-2稀疏激活策略可在控制计算开销的同时保留多专家协同建模优势。总体而言,该模型在保持优势类稳定识别的基础上,更有效提升了低占比类别及混交区域的可分性与预测一致性。

4 结论

面向优势树种分类任务,构建了融合光学数据、Sentinel-1与DEM信息的少数类增强多模态稀疏混合专家网络M-MoENet,并在统一训练测试划分与超参数设置下完成系统评估。结果表明,M-MoENet在总体性能与一致性指标上取得最优表现,并在常绿松、椴树等少数类上取得更显著的识别增益。综上,所提出方法能够在保持优势类稳定识别的同时有效缓解少数类数据长尾分布与混合像元带来的误分与破碎问题,可为复杂林区优势树种精细分类及相关资源监测与生态评估提供技术支撑。

参考文献

[1]

刘晟屹,温一博,武锦炜,.基于Sentinel-2多维特征融合的铁岭市优势树种分类[J].森林工程202541(6):1101-1115.

[2]

LIU S YWEN Y BWU J Wet al.Classification of dominant tree species in Tieling based on Sentinel-2 multi-dimensional feature fusion[J].Forest Engineering202541(6):1101-1115.

[3]

LIANG X LKUKKO ABALENOVIĆ Iet al.Close-range remote sensing of forests:The state of the art,challenges,and opportunities for systems and data acquisitions[J].IEEE Geoscience and Remote Sensing Magazine202210(3):32-71.

[4]

LIU X LGAO L HJIA Cet al.Classification of broad-leaved forest tree species based on HSFC-DeepLabV3+ in UAV multispectral images[J].IEEE Access202513:174517-174534.

[5]

XU S CYANG B HWANG R Ret al.Single tree semantic segmentation from UAV images based on improved U-Net network[J].Drones20259(4):237.

[6]

TAN JLI JMA T Yet al.Leveraging Sentinel-1/2 time series and deep learning for accurate forest tree species mapping[J].Frontiers in Forests and Global Change20258:1599510.

[7]

刘耀廷,刘正军,曹昌昊,.基于局部几何先验与Transformer的点云树种分类研究[J].测绘科学202550(8):92-100.

[8]

LIU Y TLIU Z JCAO C Het al.The study of point cloud tree species classification based on local geometric priors and Transformer[J].Science of Surveying and Mapping202550(8):92-100.

[9]

苗帆.基于多源遥感的城市行道树树种识别与应用[D].杨凌:西北农林科技大学,2024.

[10]

MIAO F.Urban street tree species identification and application based on multi-source remote sensing[D].Yangling:Northwest A&F University,2024.

[11]

蔡玉林,王兴路,高洪振,.融合3DCNN和Vision Transformer的多模态遥感数据树种分类方法[J].激光与光电子学进展202562(20):250-260.

[12]

CAI Y LWANG X LGAO H Zet al.Tree species classification method based on multi-modal remote sensing data combined with 3DCNN and vision transformer[J].Laser & Optoelectronics Progress202562(20):250-260.

[13]

NEZAMI SKHORAMSHAHI ENEVALAINEN Oet al.Tree species classification of drone hyperspectral and RGB imagery with deep learning convolutional neural networks[J].Remote Sensing202012(7):1070.

[14]

CHEN S DWANG X FSHI M Met al.Developing interpretable deep learning model for subtropical forest type classification using Beijing-2,Sentinel-1,and time-series NDVI data of Sentinel-2[J].Forests202516(11):1709.

[15]

GUO H YBOONPRONG SWANG S Het al.Dominant tree species mapping using machine learning based on multi-temporal and multi-source data[J].Remote Sensing202416(24):4674.

[16]

吴梦可.基于多源遥感影像的优势树种分类方法研究[D].哈尔滨:东北林业大学,2024.

[17]

WU M K.Research on dominant tree species classification method based on multi-source remote sensing images[D].Harbin:Northeast Forestry University,2024.

[18]

HUANG Y MOU B TMENG K Xet al.Tree species classification from UAV canopy images with deep learning models[J].Remote Sensing202416(20):3836.

[19]

ILLARIONOVA STREKIN AIGNATIEV Vet al.Tree species mapping on sentinel-2 satellite imagery with weakly supervised classification and object-wise sampling[J].Forests202112(10):1413.

[20]

SADAIYANDI JARUMUGAM PSANGAIAH A Ket al.Stratified sampling-based deep learning approach to increase prediction accuracy of unbalanced dataset[J].Electronics202312(21):4423.

[21]

QI TZHU HZHANG Jet al.Patch-U-Net:Tree species classification method based on U-Net with class-balanced jigsaw resampling[J].International Journal of Remote Sensing202243(2):532-548.

[22]

SHAHEEN LRASHEED BMAZZARA M.Tree species detection using hyperspectral and Lidar data:A novel self-supervised learning approach[J].Computer Research and Modeling202416(7):1747-1763.

[23]

MOURET FMORIN DPLANELLS Met al.Tree species classification at the pixel level using deep learning and multispectral time series in an imbalanced context[J].Remote Sensing202517(7):1190.

[24]

LEE HLEE C,WOO H,et al.Optimal training sample sizes for U-Net-Based tree species classification with Sentinel-2 imagery[J].Forests202516(11):1718.

[25]

WANG G YCHEN J HMO L Fet al.Lightweight land cover classification via semantic segmentation of remote sensing imagery and analysis of influencing factors[J].Frontiers in Environmental Science202412:1329517.

[26]

BELOIU MHEINZMANN LREHUSH Net al.Individual tree-crown detection and species identification in heterogeneous forests using aerial RGB imagery and deep learning[J].Remote Sensing202315(5):1463.

[27]

MARTINS G BLA ROSA L E CHAPP P Net al.Deep learning-based tree species mapping in a highly diverse tropical urban setting[J].Urban Forestry & Urban Greening202164:127241.

[28]

JING W PLOU T TWANG Z Yet al.A rigorously-incremental spatiotemporal data fusion method for fusing remote sensing images[J].IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing202316:6723-6738.

[29]

DIAKOGIANNIS F IWALDNER FCACCETTA Pet al.ResUNet-a:A deep learning framework for semantic segmentation of remotely sensed data[J].ISPRS Journal of Photogrammetry and Remote Sensing2020162:94-114.

[30]

CHEN L CZHU YPAPANDREOU Get al.Encoder-decoder with atrous separable convolution for semantic image segmentation[C]//Proceedings of the European Conference on Computer Vision (ECCV).2018:801-818.

[31]

LIU J RYANG HZHOU H Yet al.Swin-UMamba:Mamba-based U-Net with ImageNet-based pretraining[C]//International Conference on Medical Image Computing and Computer-Assisted Intervention.Cham:Springer Nature Switzerland,2024:615-625.

[32]

CAO HWANG YCHEN J Yet al.Swin-Unet:Unet-Like pure transformer for medical image segmentation[C]//Computer Vision - ECCV 2022 Workshops.Cham:Springer Nature Switzerland,2022:205-218.

[33]

XIE E ZWANG W HYU Z Det al.SegFormer:Simple and efficient design for semantic segmentation with transformers[J].Advances in Neural Information Processing Systems202134:12077-12090.

[34]

HEMMERLING JPFLUGMACHER DHOSTERT P.Mapping temperate forest tree species using dense Sentinel-2 time series[J].Remote Sensing of Environment2021267:112743.

[35]

WANG X LWANG JLIAN Z Zet al.Semi-supervised tree species classification for multi-source remote sensing images based on a graph convolutional neural network[J].Forests202314(6):1211.

[36]

CHEN P DLIU YREN Y Ret al.A deep learning-based solution to the class imbalance problem in high-resolution land cover classification[J].Remote Sensing202517(11):1845.

基金资助

中央高校基本科研业务费专项资金项目(2572022AW59)

黑龙江省杰出青年项目(JQ2023F002)

内蒙古揭榜挂帅项目(2024JBGS0014)

AI Summary AI Mindmap
PDF (5331KB)

355

访问

0

被引

详细

导航
相关文章

AI思维导图

/