0 引 言
植被地上生物量(Aboveground Biomass,AGB)是指在单位面积内全部地上植物的总重量,通常以鲜重或干重表示
[1],它能够反映植被的生长状况,同时也是研究陆地生态系统碳源与碳汇关系的重要依据
[2]。近年来,由于气候变暖和极端天气频发,中国干旱区面临严重的生态环境压力
[3]。区域内生长的荒漠植被根系发达、具有较强的防风固沙和抗旱能力,起到调节地表生态环境和改善小气候的作用,是评价荒漠生态系统稳定性的重要指标,因此估算干旱区植被AGB对碳储量评估和荒漠化监测具有重要意义。
传统的植被AGB估算主要采用基于地面实测的方法,存在工作量大、效率低、耗时耗力并对植被有一定破坏等缺点
[4]。遥感技术具备尺度宏观、数据动态和成本经济等优势,能够有效克服传统观测方法的局限性
[5]。其中,哨兵(Sentinel)数据具有多光谱10 m分辨率和13个波段,相较于MODIS和Landsat等开源数据具有更高的精度,红边波段为植被AGB建模提供了更多变量选择。
机器学习方法在解决非线性问题时具有较大优势,近年来,随着遥感技术的发展,机器学习算法在植被AGB估算方面应用日益广泛。其中,支持向量机(Support Vector Machine,SVM)、随机森林(Random Forest Regression,RF)、极端梯度提升(eXtreme Gradient Boosting,XGBoost)、
K最近邻(
K-Nearest Neighbors,KNN)等机器学习算法在植被遥感领域应用较多:如邢晓语等
[6]采用RF模型对内蒙古锡林郭勒盟草原AGB进行了遥感估算,结果表明该模型具有较好的适用性;谭雨欣等
[7]使用XGBoost模型基于最优变量组合估算了无瓣海桑红树林AGB;张慧春等
[8]利用SVM、RF、反向传播神经网络(Back Propagation Neural Network, BPNN)算法融合形态、纹理、颜色特征等数据变量构建了高粱AGB回归模型。较多学者将研究集中在森林、草地、农田等区域,相比之下对干旱区的研究较少
[9]。干旱区的绿洲-荒漠生态系统是陆地生态系统的重要子系统,生物量较森林和草原低,但面积大、分布广,固碳潜力不容忽视。同时绿洲-荒漠生态系统生境复杂,土地荒漠化严重,生态环境恶劣,植被低矮稀疏,易受到土壤背景信息的干扰,导致模型反演精度下降
[10-11]。如何尝试运用多种变量组合和建模方法提高干旱区植被地上生物估算精度是解决问题的关键所在。本研究对比了多种模型及变量组合在极端干旱区的适用性,以期为今后极端干旱区植被AGB估算提供参考和理论依据。
吐鲁番市绿洲核心区是典型的绿洲-荒漠生态系统,地处我国西北内陆极端干旱区,作为新丝绸之路和亚欧大陆桥的重要交通枢纽,在西北干旱区具有重要的特殊地位。吐鲁番市绿洲核心区具有独特的地理和气候特征,如地势低洼、极端高温干旱等,是吐鲁番市主要的人类居住区,受人类活动干扰影响较大,植被覆盖变化剧烈,吐鲁番市依托此地理环境存在和发展。近年来,该区域农业开发、城镇建设以及旅游业的发展等人类活动导致人工绿洲面积不断增加
[12],绿洲生态环境变化强烈,生态系统受人类活动影响显著增加,斑块较为破碎,人地矛盾尖锐。因此,本文以吐鲁番市绿洲核心区为研究区,基于多种植被指数和波段变量等特征参数,对比传统统计模型和不同机器学习模型性能,探索更适用于极端干旱区的植被AGB估算模型及变量组合,为区域可持续发展提供科学依据。
1 数据来源与研究方法
1.1 研究区概况
研究区位于吐鲁番市绿洲核心区。吐鲁番市位于新疆维吾尔自治区中东部(41°12′~43°40′ N,87°16′~91°55′ E),辖1个区、2个县:高昌区、鄯善县、托克逊县
[12]。属于典型的大陆性暖温带荒漠气候,热量丰富而又极端干燥,降雨稀少且大风频繁,年均降水量仅有16.4 mm,蒸发量则高达3 000 mm,极端最高温度达49.6 ℃,最大风速可达40 m·s
-1[13]。生态环境十分脆弱,自古有“火州”之称。该区的绿洲内部为建筑用地和耕地,主要作物为葡萄、西瓜等,绿洲外围以人工梭梭(
Haloxylon ammodendron)为主,荒漠植被主要包括柽柳(
Tamarix chinensis)、骆驼刺(
Alhagi camelorum)、盐节木(
Halocnemum strobilaceum)、芦苇(
Phragmites australis)、盐穗木(
Halostachys caspica)、黑果枸杞(
Lycium ruthenicum)等,是一个典型的绿洲荒漠生态系统。区域植被特征明显、群落片层结构简单,使用遥感方法精确估算AGB具有一定挑战性。
1.2 数据来源
1.2.1 地面样方调查
2024年6~7月,在吐鲁番市绿洲-荒漠区开展植被AGB野外调查工作。根据吐鲁番市植被分布状况,选择地表覆盖相对均匀、地势平坦、具有典型性的样地。野外调查共设置了271个采样点,其中58个30 m×30 m乔灌草样方、151个10 m×10 m灌草样方、62个10 m×10 m草本及农作物样方,每处调查3个1 m×1 m小样方。野外调查样地分布如
图1所示。
在调查时,记录样地的地形地貌特征、海拔高度、土壤性状、中心点GPS坐标及植被生长情况,测量并记录样方内出现植株的基径(
D/cm)、株高(
H/cm)、冠幅长轴(CL/cm)和冠幅短轴(CW/cm),选取大小不同的健康植株若干,并按标准株或标准直立枝采样。在有草本分布区的样方上,在任意一条对角线的中央及两端各选一块1 m×1 m的小样方,用收获法测量该样方内的草本植物。在生物量测定过程中,将采集的样品分器官放入牛皮纸袋中,称取鲜重后带回实验室,在80 ℃的烘箱内烘干48 h称重,得到植物样品的干重
[14]。运用SPSS22.0软件,对典型植物的实测数据进行统计分析,构建其AGB生长方程。
1.2.2 样方地上生物量估算
异速生长方程可以较准确地估算植被AGB,并能有效减少对生态环境的破坏
[15]。因此本研究结合野外调查实测数据,分别以植株的基径(
D)、株高(
H)、冠面积(
A=π×CL×CW
/4)、冠幅乘积(CL×CW)和植株体积(
V)等作为预测变量,建立梭梭、柽柳、盐节木、芦苇、盐穗木、黑果枸杞等6种典型灌草植被的AGB生长方程,并通过决定系数(
R2)及平均绝对误差(MAE)对模型精度进行检验。
R2值越接近1,表示拟合效果越好;MAE值越低,说明误差越小。计算公式如下:
式中:表示植被AGB估测值;表示植被AGB实测值;表示调查样地植被AGB平均值;n为样本数量。
经过回归分析和方程筛选,得到研究区典型植物的最优生物量生长方程,如
表1所示。从
表1可以看出,各植物生物量生长方程的
R2均大于0.80,拟合精度较高。根据样方调查数据,结合
表1中各植物的生物量生长方程,对样方内生物量进行计算,计算结果用于构建植被AGB估算模型。
1.2.3 Sentinel-2数据采集
Sentinel-2来自新版欧洲空间局网站(
https://browser.dataspace.copernicus.eu/),为L2A级数据,获取时间为2024年6月23日,与野外样方调查时间一致。此数据已经完成了几何校正等预处理,故本文只进行遥感数据的重采样过程。运用三次卷积法将各波段空间分辨率进行重采样至10 m,利用波段反射率计算各植被指数
[16]。
1.3 研究方法
1.3.1 光谱因子的提取
遥感影像的原始波段是地类划分的重要依据,能反映地物的光谱特征。基于以往学者对干旱区植被AGB反演的研究,选取与荒漠区植被AGB密切相关的光谱因子
[17]。本研究共选取植被指数10个、原始波段9个、自建光谱特征15个(波段和差、倒数、波段比等)作为候选建模变量。相关研究显示,在Sentinel-2影像的3个红边波段中,705 nm处的反射率与叶绿素具有更显著的相关性
[18]。因此,本文所有的红边指数均选用中心波长在705 nm处的B5波段作为红边波段。各光谱因子的计算公式如
表2所示。
1.3.2 植被地上生物量估测模型构建
植被AGB反演模型通常划分为参数模型和非参数模型两类
[19]。参数模型通常依赖于线性、指数、多项式等传统回归方程的既定目标函数,并通过训练样本的方法获取相应的函数参数。而非参数模型,特别是机器学习模型,较少依赖对目标函数的假设,可更为灵活地处理各数据间的复杂关系。通过多次实验和精度评估后,本研究使用5种传统统计方程(指数函数、线性函数、三次曲线函数、二次多项式函数和幂函数)和4种机器学习算法(RF、XGBoost、SVM、KNN,均用R语言实现)构建研究区植被AGB估测模型。
在机器学习模型构建中,变量因子过多会导致数据量太大,影响模型计算效率,因此要对特征变量进行筛选,以减少数据的冗余性,提高模型的计算效率及稳定性
[22]。研究使用S1:波段变量,S2:植被指数,S3:波段变量+植被指数3种变量组合,先通过相关性分析法初步筛选特征变量;再根据不同模型选用多种变量筛选方法,找到各模型各组合最优特征子集:对于RF模型和XGBoost模型采用随机森林重要性排序法筛选,SVM模型和KNN模型使用递归特征消除法(RFE)进行变量筛选,以探索更适合极端干旱区植被AGB估算的最佳变量组合及模型。
1.3.3 模型精度评价
为保证模型的可靠性,研究采用随机划分法选取AGB样方数据的70%用于建模,30%用于精度验证
[23]。在模型训练过程中使用十折交叉验证法计算决定系数(
R2)、平均绝对误差(MAE)和均方根误差(RMSE),用来评估各模型植被AGB估算精度和估算误差。RMSE越低,模型精度误差越小。
R2、MAE计算公式见1.2.2节,RMSE计算公式如下:
2 结果与讨论
2.1 植被AGB与各建模变量的相关性
将提取的各光谱因子与植被AGB进行Pearson相关性分析,选取达到显著水平的光谱因子(
P<0.05),各光谱因子与植被AGB之间的相关性系数如
图2所示。由
图2可知,植被指数因子相关性普遍优于波段因子变量,其中与植被AGB相关性最高的指数是RVI,为0.73,其次是SAVI和NDVI,相关性系数均为0.72。原始波段因子与植被AGB之间存在极显著的负相关关系,相关性在-0.51~-0.62之间;自建光谱中,1/B12与植被AGB之间相关性最高,达到0.64。
2.2 地上生物量建模变量筛选
不同的特征变量会对模型产生不同的估算效果
[24],本研究采用RF重要性评价和RFE筛选方法确定了在
R2最高、RMSE最小时所需的遥感特征变量个数和组合。
表3展示了最优变量筛选结果,结果显示SVM在S1情景下所需的遥感变量最少,仅为3个;RF模型和KNN模型在S1情景下均需要5个变量。而SVM模型在S3情景下需要的遥感特征变量最多,使用19个变量可达到最佳建模效果;RF模型和KNN模型在S3情景下均需要13个建模变量。
图3展示了在S3情景下,RF模型运用随机森林重要性排序法、KNN模型运用RFE筛选方法所得到的遥感特征变量个数。由
图3可知,在S3情景下,当变量个数在13时,RF模型取得了最高的
R2;KNN模型在变量个数为13时,RMSE最小,效果最好。
对各建模变量在模型中的使用次数进行统计,得到
图4。
图4结果表明,植被指数变量使用次数整体高于波段变量。在所有变量中,CI
re、RTVI、MSAVI、DVI、TVI、RVI
re是使用次数最多的变量,仅在1个模型中未被采用;其次是NDVI、RVI、1/B12,在6个模型中被采用;使用次数最少的是B2+B4和1/B2,仅2个模型使用。
2.3 传统统计模型的建立与结果分析
根据提取的相关变量因子建立5种传统统计模型,为确定最佳建模变量,对所有变量因子进行遍历操作,根据模型的精度验证结果进行选择
[19]。
表4详细展示了5种传统统计模型对植被AGB进行反演的结果。模型训练集
R2介于0.44~0.58之间,其中修正的土壤调节植被指数(MSAVI)、1/B12波段和土壤调节植被指数(SAVI)
R2在0.5以上,优于其他变量因子。验证集
R2介于0.32~0.45之间,MSAVI验证集
R2最高。综合来看,传统统计模型对植被AGB的解释能力处于中等水平,仍有较大上升空间,模型在训练集和验证集上的表现较为一致,表明其泛化能力较强,不存在过拟合现象。在5种传统统计模型中,以三次曲线方程表现最佳,该模型验证集
R2为0.45,RMSE为199.86 g·m
-2,MAE等于161.80 g·m
-2,取得了最好的估测效果。总体来看,单一的变量因子难以全面描述植被AGB与遥感变量因子之间的复杂关系,这进一步凸显了引入机器学习建模方法的必要性
[25]。
2.4 机器学习反演模型的构建与验证
利用随机森林重要性评价和递归特征消除法(RFE)筛选出三组变量,分别采用4种机器学习算法构建植被AGB反演模型。由
表5可知,模型整体测试集
R2位于0.49~0.72,表明不同变量组合对模型估算精度有一定影响,极端干旱区植被AGB估算建模时要充分考虑不同变量组合和模型之间的差异性问题。机器学习模型在数据处理及训练方面展现出巨大潜力,精度整体上优于传统统计模型。综合对比4种模型在3种变量组合下的估算效果发现,RF模型展现了最好的估测能力和稳定性,该模型在S3情景下测试集
R2为0.72,MAE为105.64 g·m
-2,RMSE为127.73 g·m
-2。其次是S3情景下的KNN模型,模型精度
R2为0.70,仅次于S3情景下的RF模型;模型精度最低的是由S1波段变量构建的SVM模型。
由变量组合分析可知,在S1波段变量情景下,各模型的MAE和RMSE相对较高,反演精度与稳定性均较差。各模型均在S3波段变量+植被指数组合时取得最好估算效果,相较于仅使用单一波段变量,4种模型测试集R2分别提高0.20、0.18、0.10和0.18。综合来看,RF模型表现出较好的精度和稳定性,而波段变量+植被指数的全变量组合进一步提高极端干旱区植被AGB的反演精度。
对研究区植被AGB反演的预测值与实测值进行拟合分析,得到
图5。由
图5可知,不同变量组合对模型精度的影响有一定差异性,4种模型均存在不同程度的低值高估、高值低估现象。其中XGBoost模型的离散程度较高,不稳定性明显。4种机器学习模型中RF的预测值与实测值表现出更好的拟合性,散点大多数分布在1∶1线附近,优于其他模型,说明RF算法可作为研究区植被AGB的最佳估测模型。
2.5 吐鲁番市绿洲核心区植被AGB的空间反演
采用估算效果最好的S3情景下的RF作为吐鲁番市绿洲核心区植被AGB反演模型,得到该区域的植被AGB空间分布图(
图6)
,结果表明:吐鲁番市绿洲核心区植被AGB整体处于较低水平,植被地上生物量总值约为1.599×10
6 kg。空间上存在明显的分异规律,呈“扇”字形分布,表现为绿洲大于荒漠,由绿洲向荒漠腹地逐渐减少的特征。植被AGB大部分集中在绿洲附近,绿洲内部高于绿洲外围,绿洲内部以种植葡萄为主,水源条件较好,人工灌溉对植被生长有明显促进作用,因此生物量更高。绿洲外围风沙地带以人工梭梭为主,植被AGB在50~800 g·m
-2之间。而在荒漠绿洲过渡带以及荒漠区以天然分布的柽柳、骆驼刺、盐节木、盐穗木居多,这些荒漠植被根系发达,具有较强的防风固沙和适应干旱、高温能力,起到调节地表生态环境作用,植被AGB小于300 g·m
-2,这是荒漠植被适应干旱环境的结果。南部和东部荒漠戈壁滩水资源匮乏,自然环境恶劣,土地极端干旱,植被覆盖率较低,以低矮灌木为主或寸草不生,植被AGB较低。
2.6 讨论
研究区处在吐鲁番市海拔最低、温度最高的地方,也是人类主要的活动区域。整体来看区域生物量水平较低,这是由于极端气候环境所致。研究区自然环境恶劣,气候极干、极旱、极热,年均降水量仅有16 mm。为适应干旱环境,荒漠植被在长期演化中形成了以耐旱、耐盐碱和根系发达为特征的群落结构,整体生物量较低
[26]。绿洲内部的生物量显著高于荒漠区,绿洲内部以人工种植灌溉的林木、葡萄为主,人工灌溉对植被生长有明显的促进作用,荣浩等
[27]研究显示荒漠草原的植被AGB与土壤含水量间呈正相关关系,因此植被地上生物总量更高。沙漠、戈壁滩、裸岩内部则寸草不生。由本文研究结果可知,RF模型估算的吐鲁番市绿洲核心区植被AGB的平均值为415.833 g·m
-2,与实地调查的平均值438.358 g·m
-2相近,这反映出RF模型在干旱区植被AGB估算方面具有一定优势。在本研究中,吐鲁番市绿洲核心区植被AGB野外调查的真实值范围为31.709~1 350.209 g·m
-2,RF模型的预测值范围为81.091~1 153.770 g·m
-2,由此可知,RF模型在估测植被AGB时出现了低值高估、高值低估现象。
为提高极端干旱区植被AGB估算精度,研究从变量选择与优化、模型选择及评价方面作出尝试,得出以植被指数+波段变量的全变量组合构建的RF模型更适用于干旱区的结论。建模变量可直接影响反演模型的预测效果,由于极端干旱区立地条件的特殊性,遥感变量和植被AGB之间的相关关系并不明确。研究以Sentinel-2影像为数据源,提取波段变量和植被指数作为候选变量。通过变量筛选方法,筛选出MSAVI、TVI、DVI、RTVI、RVI
re、CI
re共6个使用最多并且相关性较强的变量。在干旱区利用遥感方法估算植被AGB的研究中,也有不少学者使用了相关变量,如刘书田等
[28]基于Sentinel-2影像提取了RTVI、NDVI
re、NDVI、SAVI等植被指数变量,发现RTVI在不同机器学习方法中占据同样高的权重值。这与Nandy等
[29]的研究结果相同,说明Sentinel-2的红边波段更有利于AGB预测。许政勇等
[30]的研究结果显示在以灌丛植被为主的区域中,MSAVI表现最为敏感。由于引入了土壤调节系数
L,有效削弱了土壤背景值对植被指数的干扰,进一步提高了估算精度。本研究使用RFE和RF重要性评价两种变量筛选方法,针对不同模型分布进行筛选,筛选结果用于植被AGB模型构建,结果显示RFE筛选法可以保留对目标变量预测具有重要贡献的特征,同时减少冗余和噪声特征的干扰。RF算法的重要性评价可以通过衡量变量在建模过程中的贡献度,提供变量与植被AGB的非线性关系。熊向阳等
[31]使用随机森林重要性评价法进行变量筛选,筛选结果成功构建了高精度森林生物量估测模型。
研究显示,基于植被指数与波段变量相结合的全变量组合构建的模型可取得更高的生物量估测精度。这是由于仅依赖于单一的植被指数进行反演具有一定的局限性,在特定的场景下,加入波段因子不仅能够挖掘卫星遥感数据中的潜在信息,还能捕捉植被生长过程中的更多细节
[32],为植被AGB估测提供了更全面的数据支撑。宋珂馨等
[33]得出在反射率基础上增加植被指数变量后,RMSE降低了7.1%,
R2提高0.05的结果。颜辉等
[9]研究表明,波段变量分别与植被指数、纹理特征结合后,模型精度均有小幅度提升。李文雄等
[34]在对荒漠草地的研究中发现加入典型植被指数后,反演精度
R2提高超过15%。
研究结果表明,基于传统统计方程建立的参数模型精度有限。植被AGB的形成过程较为复杂,难以拟合特定的函数形式,仅采用单一变量构建函数模型易导致欠拟合现象。在比较多种参数模型后发现,三次曲线方程的估测精度最高,这与姚雨微等
[35]的研究结果相一致。杨可明等
[19]在对矿区的研究中同样发现多元函数模型可获得更高
R2。相较于传统统计方程,机器学习在生物量估算中能更好地分析遥感特征变量与AGB之间的非线性关系,取得更佳的拟合效果。目前已有文献发现非参数模型的预测精度优于参数模型
[27]。本研究对4种机器学习模型进行对比,分析发现不同机器学习算法在干旱区AGB估算方面的性能各不相同,其中RF算法可以有效训练高维样本,同时由于采用随机采样策略,有效降低了模型的方差,泛化能力更强
[25],在本研究中取得最佳估测效果。以往研究中,RF模型相比其他机器学习模型也占有优势,如王雪梅
[36]以Landsat影像为数据源,采用SVM模型、RF模型、XGBoost模型和BPNN模型对干旱区绿洲AGB进行估算,发现使用RF模型效果最佳,本研究结果与其一致,再次验证RF算法用于干旱区AGB的估算的可行性。XGBoost具有预算速度快、参数调节灵活和对大样本处理能力优越等优势,但由于本研究样本量相对较少,XGBoost模型在估算精度上未达到最优表现;SVM模型的关键在于核函数,目前核函数的选取主要依赖于经验
[23],同时对于所有样本使用相同的核函数,会进一步限制植被AGB估测精度,因此SVM模型在本研究中稳定性较强,但精度较低;KNN模型算法简单、易于实现,但当样本分布不均衡时,如一个类样本容量很大,可能导致该样本的
k个邻居中大容量类的样本占优势,进而影响预测结果的准确性,在本研究中并未取得最优估算效果。
本研究使用3种变量组合,2种变量筛选方法,对比传统统计模型和4种机器算法的性能,反演吐鲁番市绿洲核心区植被AGB,得出以植被指数+波段变量组合构建的RF模型更适用于极端干旱区的结论,为今后极端干旱区植被AGB估算提供部分经验。在机器学习建模过程中,如果样本量较小,会影响模型的预测效果,今后将尽可能多地增加地上样方数据样本量,从而取得更好的预测效果。
3 结 语
以Sentinel-2影像为数据源,提取波段因子和植被指数,结合地面样点数据,分成3个分组方案建立传统统计模型和4种机器学习模型,对吐鲁番市绿洲核心区植被AGB进行估算和空间反演,结果表明:
1) 在统计模型中,修正的土壤调节植被指数(MSAVI)建立的三次曲线函数取得最好估测结果,R2=0.45;
2) 机器学习模型估算精度整体上优于传统统计模型,以S3植被指数和波段变量构成的全变量组合构建的模型估算效果最好,RF模型在4种机器学习模型中预测精度最高,R2达到0.72,MAE为105.64 g·m-2,RMSE为127.73 g·m-2;
3) 吐鲁番市绿洲核心区植被地上生物量总值约为1.599×106 kg。空间上存在明显的分异规律,绿洲内部植被AGB较高,荒漠区植被AGB较低。与其他三种机器学习算法相比,RF模型具有更好的估测效果和稳定性,可用于干旱区植被AGB估测,本研究为极端干旱区植被AGB反演提供借鉴和参考。
中国沙漠气象科学研究基金(Sqj20240018)
中央财政林草科技推广项目(新[2022]TG09)