基于机器学习模型的张掖地区土壤有机碳与全氮估算

郑海清 ,  张美玲 ,  伊兰

水土保持学报 ›› 2026, Vol. 40 ›› Issue (03) : 412 -423.

PDF (2825KB)
水土保持学报 ›› 2026, Vol. 40 ›› Issue (03) : 412 -423. DOI: 10.13870/j.cnki.stbcxb.2026.03.021
技术方法

基于机器学习模型的张掖地区土壤有机碳与全氮估算

作者信息 +

Estimation of Soil Organic Carbon and Total Nitrogen in Zhangye Region Based on Machine Learning Models

Author information +
文章历史 +
PDF (2892K)

摘要

目的 为提高张掖地区0~30 cm土层土壤有机碳(SOC)与全氮(TN)的空间估算精度,并识别关键驱动因子及其作用方向。 方法 整合气候、地形、植被与土壤理化性质等多源协变量,结合实测样点(N=979)构建特征集;系统比较9类机器学习模型,并筛选XGBoost、梯度提升回归树(GBRT)与随机森林(RF)为代表性树基模型;进一步构建自适应加权(Auto-Weighted)、混合法(Blending)与自助聚合(Bagging)3类融合模型,采用10折交叉验证与独立测试集综合评估,并以SHAP量化变量贡献及作用方向。 结果 单模型测试集上,SOC估算中XGBoost、GBRT、RF的R²分别为0.768、0.773、0.729,RMSE分别为0.472、6.421、7.011,MAE分别为0.314、4.319、4.641;TN估算中三者R²分别为0.636、0.645、0.629,RMSE分别为0.602、5.381、5.498,MAE分别为0.360、3.225、3.265。融合模型整体优于单模型,其中Auto-Weighted最优(SOC:R²_test=0.879,RMSE=4.607 9,MAE=2.948 2;TN:R²_test=0.775 8,RMSE=4.330 8,MAE=2.418 6),Blending次之(SOC:R²_test=0.848 7,RMSE=5.107 2,MAE=2.991 9;TN:R²_test=0.734 6,RMSE=4.576 2,MAE=2.337 3)。SHAP解释表明,降水与植被指数呈稳定正向贡献,最低气温等温度因子呈负向贡献,阳离子交换量(CEC)及黏粒、粉粒比例等土壤性质贡献突出;空间上,高值区主要分布于水分相对充足、温度较低且植被覆盖较好的山地,低值区集中于绿洲边缘与荒漠过渡带。 结论 树基模型融合与SHAP解释相结合可实现SOC与TN高精度、稳健且可解释的区域化制图,为干旱-半干旱过渡带碳氮评估与分区管理提供定量依据。

Abstract

Objective This study aims to enhance the spatial estimation accuracy of soil organic carbon (SOC) and total nitrogen (TN) in the 0-30 cm soil layer in the Zhangye region and to identify the key driving factors and their directional effects. Methods Multi-source covariates, including climate, topography, vegetation, and soil physicochemical properties, were integrated to construct a feature set based on field sampling data (N=979). Nine types of machine learning models were systematically compared, from which XGBoost, gradient boosting regression trees (GBRT), and random forest (RF) were selected as representative tree-based models. Three ensemble strategies were adopted to establish ensemble models, including auto-weighted, blending, and bagging. Their performance was comprehensively evaluated using 10-fold cross-validation and an independent test set. SHapley Additive exPlanations (SHAP) values were applied to quantify variable contributions and their directional effect. Results For single models on the test set, SOC estimation yielded R² values of 0.768, 0.773, and 0.729, root mean square error (RMSE) values of 0.472, 6.421, and 7.011, and mean absolute error (MAE) values of 0.314, 4.319, and 4.641 for XGBoost, GBRT, and RF, respectively. For TN estimation, the single models produced R² values of 0.636, 0.645, and 0.629, RMSE values of 0.602, 5.381, and 5.498, and MAE values of 0.360, 3.225, and 3.265, respectively. Overall, the ensemble models outperformed the single models. The auto-weighted demonstrated the best performance (SOC: R²_test=0.887 9, RMSE=4.607 9, MAE=2.948 2; TN: R²_test=0.775 8, RMSE=4.330 8, MAE=2.418 6), followed by blending (SOC: R²_test=0.848 7, RMSE=5.107 2, MAE=2.991 9; TN: R²_test=0.734 6, RMSE=4.576 2, MAE=2.337 3). SHAP analysis revealed stable positive contributions from precipitation and vegetation indices, negative contributions from temperature factors such as minimum temperature, and prominent contributions from soil properties including cation exchange capacity (CEC) and the proportions of clay and silt. Spatially, areas with high SOC and TN values were mainly distributed in mountainous regions characterized by relatively sufficient moisture, lower temperatures, and better vegetation coverage. In contrast, low-value areas were concentrated at oasis margins and desert transition zones. Conclusion The integration of tree-based ensemble modeling and SHAP interpretation enables highly accurate, robust, and interpretable regional mapping of SOC and TN. This approach provides a quantitative basis for carbon and nitrogen assessment and zonal management in arid-semiarid transition zones.

Graphical abstract

关键词

土壤有机碳 / 全氮 / 机器学习 / 融合模型 / SHAP

Key words

soil organic carbon / total nitrogen / machine learning / ensemble model / SHAP

引用本文

引用格式 ▾
郑海清,张美玲,伊兰. 基于机器学习模型的张掖地区土壤有机碳与全氮估算[J]. 水土保持学报, 2026, 40(03): 412-423 DOI:10.13870/j.cnki.stbcxb.2026.03.021

登录浏览全文

4963

注册一个新账户 忘记密码

土壤有机碳(soil organic carbon,SOC)与全氮(total nitrogen,TN)是评价土壤质量与生态系统服务功能的核心要素,也是陆地碳氮循环的物质基础与关键“调节器”。SOC直接关系土壤肥力、作物产量与生态系统生产力,并在全球陆地碳库中占据重要地位;TN通过影响植被生长与微生物活性,进而调控土壤养分循环与生态系统结构稳定性。二者的协同变化对维系土壤健康与提升生产力具有基础意义。全球气候变化背景下,SOC作为重要陆地碳汇,对调节大气CO₂浓度与缓解变暖具有不可替代作用;与此同时,极端气候事件加剧、水热格局重塑与土地利用变迁,使土壤碳氮库的时空动态及其对气候系统的反馈更趋复杂与不确定。
西北干旱与半干旱区是全球气候变化敏感区域之一,生态环境脆弱,对水热变化响应显著。张掖地处河西走廊中部,属典型干旱-半干旱过渡区,地貌类型多样、农牧复合生态系统典型,草地与耕地资源对区域水源涵养、防风固沙与生态安全屏障建设具有重要意义。近年来,基于机器学习的SOC与TN空间估算研究快速发展。WADOUX等1研究指出,集成树模型因其对非线性、交互项与高维协变量的鲁棒性,已成为土壤属性预测的重要主力算法;POGGIO等2在SoilGrids 2.0的全球制图中进一步表明,基于大样本观测并结合多源环境协变量(气候、植被、地形等)可显著提升土壤属性空间制图能力。鉴于该类协变量通常呈现明显的非线性响应与多尺度交互特征,相较于线性回归等需要预设函数形式的传统方法,随机森林、梯度提升与XGBoost等树基集成模型能够在较少先验假设下自动学习复杂的非线性关系与高阶交互,因此在数字土壤制图(DSM)与土壤属性空间预测研究中往往表现出更高的预测精度与更强的适用性。
现有SOC、TN估算研究普遍采用实测样点和多源环境协变量的建模范式,其协变量配置并非任意堆叠,而是与成土因子及碳氮形成和周转过程存在明确对应关系。YU等3在SOC估算中发现,温度与降水长期位居关键驱动因子。其原因在于,气候因子通过改变区域水热条件与有效水分供给,进而影响植被生产力与微生物分解,最终共同调节SOC,并在很大程度上影响TN的积累。植被遥感指标可用于表征地表碳输入潜力。归一化植被指数(NDVI)反映植被覆盖度与生长活力的空间差异,可间接指示凋落物与根系周转等有机质输入强度的相对变化,因此常作为SOC数字制图的重要生态协变量4。植被净初级生产力(NPP)直接表征植被净生产力及其空间差异,可用于表征区域尺度生物量积累与潜在有机质输入规模,为SOC与TN的估算提供过程指向的协变量支撑5。WERE等6以南非地区为例开展SOC储量预测,将Mg、Ca、P、全氮与pH等土壤属性与遥感、地形及其衍生因子联合纳入模型,研究结果显示,土壤理化部分因子有助于提升SOC空间估算的稳定性与解释性。在具体应用层面,我国学者也在耕地、林地等不同地表类型上验证多源协变量与树模型的有效性,如周洋等7利用多源辅助变量与随机森林开展表层土壤全氮空间预测;刘尊方等8基于XGBoost实现对耕地土壤全氮的遥感反演并获得较高精度,二者均从应用层面支持上述“过程指向”的协变量组织方式。
基于此,本文以张掖地区0~30 cm土层为研究对象,整合气候(Tmin、Tmax、Tmean、Pre)、地形(ALT、SLP、ASP、TRI 等)、植被(NDVI、NPP)与土壤理化属性(质地、BD、pH、CEC等)等多源特征,系统评估9类常用机器学习模型对SOC与TN的估算能力;在此基础上构建自适应加权(auto-weighted)融合方案以提升泛化性能与稳健性,并引入基于SHAP的可解释性分析识别主控因子及其作用方向,阐明气候、植被生产力、土壤性质与地形过程对SOC与TN空间格局的共同影响,为干旱与半干旱区碳氮评估与区域生态管理提供方法支撑。

1 材料与方法

1.1 研究区概况

张掖位于甘肃省河西走廊中段(37°28′~39°57′N,97°20′~102°12′E),行政区划分包括甘州区、临泽县、高台县、山丹县、民乐县及肃南裕固族自治县。区域自南向北依次呈现“祁连山高山-山前冲洪积扇与绿洲平原-荒漠与戈壁”的地貌序列,属高原大陆性气候,降水随海拔升高而增加并主要集中于夏季。土壤类型以高山草甸土、栗钙土、灰钙土及盐渍化土为主;植被沿海拔梯度呈高山草甸-草原-荒漠的带谱更替,黑河为区域主要水系。在显著的地形-气候-植被-土壤性质梯度背景下,SOC与TN表现出高度的时空异质性,适宜借助机器学习模型开展高分辨率制图并识别主导驱动因子。研究区域见图1

1.2 数据来源

1.2.1 土壤数据来源

本研究SOC与TN实测值来源于2022—2023年野外实地采样并经实验室分析获得。为覆盖研究区主要环境梯度,在各气象站点周边采用典型样点布设与分层取样相结合的方式开展野外采样。野外采样前,基于ArcGIS预先设置候选采样点;外业阶段使用手持GPS导航到达样点,并记录样点的经纬度与海拔等信息。野外采样结束后,将坐标导入ArcGIS 10.8软件进行空间核验与统一管理,确保采样点位置与后续多源栅格因子匹配一致。采样点主要涵盖山地草原、绿洲农田及荒漠-戈壁裸地等。每个采样点设置3个标准样方以提高代表性与重复性,采用专用土钻分层取样,土层深度为0~10、10~20、20~30 cm。为保证测量精度,每份土样采集量不少于200 g;采集后置于密封袋并编号。样品运回实验室后自然风干,随后经0.15 mm筛网过筛以去除大颗粒杂质并保证均匀性;筛后样品质量均>100 g,以满足后续检测需求。SOC与TN含量采用全自动氮-形态碳分析仪(SKALAR Primacs SNC 100-IC-E)测定:试验前将仪器预热至1 100 ℃ 以稳定测量条件;测定时称取每份样品500 mg(称量误差控制在±1 mg),置于专用坩埚中进行高温燃烧分析(单样约8 min),获得SOC与TN含量数据。

土壤理化性质数据主要来源于国家青藏高原科学数据中心(TPDC,http://data.tpdc.ac.cn)。本研究从TPDC获取研究区尺度可用的土壤属性栅格数据产品,包括pH、阳离子交换量CEC、土壤体积质量BD、质地组分等定量理化参数;并对其进行统一投影、分辨率匹配与研究区裁剪。随后,基于采样点坐标在ArcGIS 10.8软件中采用栅格采样提取各点位对应的土壤属性值,实现与SOC、TN样点的一致空间匹配。所用土壤属性数据产品相关数据经过规范化的采集、处理与质量控制,可作为区域尺度土壤背景协变量用于提升SOC、TN估算的稳定性与解释性。

1.2.2 气象数据

本研究所用气象数据来源于国家青藏高原科学数据中心(TPDC,https://data.tpdc.ac.cn)。该数据集基于CRU全球0.5°气候数据集与WorldClim高分辨率气候数据,采用Delta空间降尺度方案在中国区域生成,并使用496个地面气象站观测数据开展独立验证。本研究提取2022—2023年逐月最高气温、最低气温、平均气温及降水,并在ArcGIS 10.8软件中完成研究区范围裁剪与栅格格式转换,以确保与研究区样点数据的空间精确匹配。

1.2.3 高程数据

研究区的高程数据来源于NASA Earth data平台下阿拉斯加卫星设施数据中心(ASFDAAC;https://search.asf.alaska.edu/#/)分发的ALOS数字高程模型(DEM,空间分辨率12.5 m)。基于ArcGIS 10.8的Spatial Analyst模块,首先由 DEM派生坡度(slope)、坡向(aspect)与地形粗糙度等地形因子,其中地形粗糙度以移动窗口内高程标准差(standard deviation,STD)表征。鉴于本文建模与制图以1 km目标网格作为统一支持尺度,上述地形衍生因子在12.5 m计算后进一步进行尺度聚合至1 km(与其他协变量保持一致),随后采用栅格采样提取至SOC、TN采样点用于建模。

1.2.4 植被指标数据

植被指数(NDVI)基于Sentinel-2卫星影像数据计算获得,本研究通过USGS EarthExplorer (https://earthexplorer.usgs.gov/)平台获取研究区2022—2023年影像。为保证数据质量,筛选云量低于10%的影像,并进行必要的质量控制与预处理。依托ArcGIS 10.8软件对影像数据依次开展镶嵌与裁剪等处理,统一坐标系统并获取研究区地表反射率,分别计算2022年与2023年NDVI以表征植被绿度,计算公式为:

NDVI=NIR-RNIR+R

式中:NIR为近红外波段反射率;R为红光波段反射率。

净初级生产力(NPP)数据来源于 NASA Earth data(LP DAAC)发布的 MODIS年尺度NPP产品MOD17A3HGF v061。该产品由给定年份内8 d尺度总初级生产力(GPP)产品MOD17A2H 的累积(总和)计算得到。本研究在ArcGIS 10.8软件中对NPP数据进行研究区裁剪、投影统一与其他环境因子一致处理,并与样点坐标叠加提取样点对应的2022年与2023年NPP值,作为模型输入变量之一。

1.2.5 数据汇总表格

综合气候(年最高气温、最低气温、平均气温及降水)、地形(海拔、坡度、坡向、地形粗糙度)、植被(NDVI、NPP)与土壤理化性质等要素,按统一空间分辨率与时间尺度整合形成特征集见表1

1.3 研究方法

1.3.1 机器学习算法

以张掖地区作为研究对象,选取生态与土壤研究中常用的九类机器学习模型用于SOC与TN的估算:线性回归(linear regression,LR)、支持向量回归(support vector regression,SVR)、多层感知机(multilayer perceptron,MLP)、随机森林(random forest,RF)、梯度提升回归树(gradient boosting regression tree,GBRT)、极端梯度提升(XGBoost)、light gradient boosting machine(LightGBM)、CatBoost(CatBoost)和 AdaBoost(AdaBoost)。在模型训练前,对连续特征在训练集上进行标准化处理,并将相同参数应用于验证和测试数据。为降低多重共线性干扰,结合相关性阈值与方差膨胀因子(VIF)对输入变量进行筛查。

1.3.2 变量筛选与共线性诊断

采用皮尔逊相关分析,探讨SOC和TN与主要环境因子的关系。整合气候、植被、地形和土壤属性等数据为特征变量,对SOC、TN显著相关的因子(p<0.05)纳入候选集;在此基础上进行方差膨胀因子(VIF,阈值10)共线性诊断,迭代剔除高共线变量,最终筛选出的特征变量用于建模估算SOC与TN含量。

1.3.3 模型优化

在单模型基础上进一步提升泛化性能,依据10折交叉验证5次重复的结果,从表现较优的LR、CatBoost、LightGBM、XGBoost、RF、SVR、GBRT、MLP等基学习器中遴选预测精度高的M个作为候选基模型。记第m个基模型在样本i上的预测为y^m,i

1) 自适应加权(auto-weighted)

在训练数据的折外预测上,采用带约束的最小二乘或岭回归求解权重w=(w1,,wm),并施加非负与和为1的约束以防过拟合:

minwiyi(yi-m=1Mwmy^m,i)2+λw22,s.t.wm0,mwm=1

得到的w固定后,最终融合预测为:

y^i(AW)=mwmy^m,i

2) 混合法(blending)

将训练集按比例划分为基学习器训练集和保留集。先在训练子集上拟合各基模型,并在保留集上产生预测y^m,i;再以保留集的这些预测为自变量、真实值为因变量,训练一个线性或岭回归元学习器得到融合系数,形成最终预测y^(BL)

3) 自助聚合(bagging)

以验证表现最优或方差较大的单一基模型为基底,进行B次自助采样训练,最终预测取平均值:

y^i(BG)=1Bb=1By^i(b)

1.3.4 模型验证与评估

将数据集按8∶2的比例随机划分为训练集与测试集,其中80%的样本用于模型训练与参数优化,剩余20%的样本作为独立测试集用于最终性能验证。为降低一次随机划分带来的偶然性并获得更稳健的模型比较结果,在训练集内部采用K折交叉验证进行参数优化与模型选择:将训练集划分为K份,每次用其中K-1份训练、1份验证,循环K次,使每份数据均作为验证集1次。交叉验证阶段的评价指标在每一折验证集上计算,并对各折结果取平均作为训练阶段模型性能的总体评价;最终模型的泛化能力以独立测试集上的指标结果为准。

模型性能评价采用平均绝对误差(MAE)、均方根误差(RMSE)和判定系数(R2)。设在验证集或测试集中共有 n个样本,观测值为 yi,模型预测值为 y^ii=1,2,,n),观测平均值为 y¯=1ni=1nyi。各指标计算公式为:

MAE=1ni=1nyi-y^i
RMSE=1ni=1nyi-y^i2
R2=1-i=1nyi-y^i2i=1nyi-y¯2

式中:MAE与RMSE的量纲与被估算变量一致,分别反映平均误差幅度与对大误差的惩罚强度;R2为无量纲指标,衡量模型对观测值方差的解释程度,R2越接近1表明拟合效果越好;当模型预测效果劣于以观测平均值y¯作为基准预测时,R2可能<0。综合比较各模型在训练集交叉验证与独立测试集上的表现,以RMSE、MAE较低且R2较高作为最优估算模型的选择依据,并在测试集上报告其最终泛化性能。

2 结果与分析

2.1 SOC、TN含量描述性分析及与环境变量的研究分析

张掖地区SOC、TN的描述性统计见表2。张掖地区0~30 cm土层的SOC质量分数为5.97~73.36 g/kg,平均值为25.35 g/kg,标准差为13.75 g/kg,整体上呈现较大的空间差异性。TN质量分数为0.13~45.07 g/kg,平均值为7.24 g/kg,标准差为9.05 g/kg,变异程度同样较高。由方差结果可知,SOC的空间变异幅度明显大于TN,说明SOC的异质性更为显著。总体而言,二者均表现出较高的变异系数,提示研究区SOC与TN的分布受多种环境因子共同驱动,存在较强的空间非均质性。

依据相关性热力图(图2),通过检验SOC、TN与各环境变量的相关关系。结果表明,不同因子与SOC、TN的相关方向与强度存在显著差异;其中部分变量与SOC、TN的相关性不显著(p≥0.05),故在后续建模中予以剔除。同时,为避免不必要的模型复杂度与冗余信息干扰,对仅包含单一数值或缺乏统计学意义的变量亦不予保留。为提高稳健性,后续分析仅保留通过相关性检验且具有明确物理含义的变量集。

依据相关性检验(p<0.05)及图2热力图,SOC与TN均与多类环境因子呈显著相关,但方向与强度存在差异:SOC在地形与气候方面,与海拔(ALT)、降水量(Pre)、坡度及地形起伏度(K、K₁、SLP、TRI)及地形位置指数(SI)呈正相关;在土壤与植被方面,与阳离子交换量(CEC)、黏粒占比(CLAY)、孔隙度(POR)、铵态氮(AN)、速效磷(AL)、钙含量(Ca)、镁含量(Mg)、钠含量(Na)及归一化植被指数(NDVI)呈正相关;而与土壤体积质量(BD)、pH、砂粒含量(SAND)、交换性氢(H)、速效钾(AK)、年最低气温(Tmin)、年平均气温(Tmean)、年最高气温(Tmax)、坡向(ASP)、局地地形参数(LNUM1、LDEP1,以及SI的部分层级)、土壤颜色变量(Dh、Wh、Unh)及净初级生产力(NPP)呈负相关。TN 的相关模式与 SOC 大体相似,但在个别因子上存在差异:TN 与地形因子(TRI、SLP、ALT、K、K₁)、降水量(Pre)、土壤理化属性(CEC、AN、AL、Ca、Mg、Na、CLAY)及 NDVI 呈显著正相关;与土壤体积质量(BD)、pH、砂粒占比(SAND)、年最低气温(Tmin)、年平均气温(Tmean)、年最高气温(Tmax)、局地地形参数(LDEP1、PDEP1)及部分结构与颜色因子(C1、S1、Dh、Wh、Unh)呈显著负相关。为提高后续建模的稳健性,仅将相关性显著且具明确物理意义的变量纳入模型,不显著或冗余变量不再进入分析。剔除不显著变量后,SOC与TN分别保留39个与32个候选因子;为进一步降低自变量之间的冗余性,对上述变量开展多重共线性诊断,结果显示部分因子存在较强共线性(方差膨胀因子VIF>10)。通过迭代剔除共线性较高的因子,最终获得 SOC 30个、TN 25个显著且互不共线的相关特征变量(图3),并以此作为输入特征开展SOC与TN的建模估算。

2.2 机器学习模型选取及影响分析

2.2.1 机器学习模型预测精度评估与验证

在完成相关性筛选与多重共线性诊断后,将保留的显著环境因子作为输入特征,分别构建并评估9类模型:LR、CatBoost、LightGBM、XGBoost、RF、SVR、AdaBoost、GBRT和MLP。所有模型在相同的8∶2训练集与测试集划分及统一随机种子条件下训练;连续特征在训练集上z-score标准化(再映射至测试集),超参数仅在训练集内寻优。模型性能以MAE、RMSE与R2在训练集与测试集上统一报告(表3)。

9种机器学习模型拟合程度对比发现,基于树的集成学习方法整体表现优于线性回归与核方法。其中,XGBoost、GBRT和RF在SOC与TN的估算中均表现出较低的RMSE和MAE,同时具有较高的R2,在9个候选模型中表现最为稳健。相比之下,线性回归与SVR的拟合精度明显偏低,而MLP虽在部分指标上接近优选模型,但稳定性略显不足。

图4进一步展示XGBoost、GBRT与RF 3种优选模型在训练集和测试集上的观测值与预测值、拟合线及置信带,用于直观呈现模型拟合形态与泛化表现。理想状态下,散点应沿y=x参考线分布,且置信带越窄表示预测不确定性越小。结果表明,在SOC与TN 2类目标变量上,3种模型的测试集点云分布相对紧凑,拟合线与y=x参考趋势一致性较高且置信带较窄,显示出良好的拟合一致性与泛化能力。结合表3的交叉验证量化结果RMSE、MAE与R2,因而最终确定XGBoost、GBRT与RF为后续SOC与TN估算及融合建模的核心基学习器。

2.2.2 机器学习模型变量重要程度

对入选的3种最优模型(XGBoost、GBRT、RF)进行后验解释。按各因子的重要性排序并结合蜂群图展示各因子具体影响程度(图5)。3种模型在SOC上呈高度一致的变量结构:BD(土壤体积质量)与Tmin(年最低气温)贡献居前且总体表现为负向影响,Pre(降水量)与NDVI(植被指数)稳定呈正向影响,SILT、CLAY(细粒组分)、CEC(阳离子交换量)与POR(孔隙度)多为正向贡献,pH多为负向贡献。地形因子(SLP、TRI、ASP、LNUM1)贡献度居中,方向随局地条件略有差异,模型间仅存在细微差异:XGBoost、GBRT对Pre与NDVI的灵敏度相对更高,RF对粒度与地形的权重相对靠前;在TN上3个模型呈现出BD(土壤体积质量)与Tmin(年最低气温)贡献居前且总体为负向影响;其后依次为CEC(阳离子交换量)、Pre(降水量)、pH、NDVI(植被指数)及细粒组分(CL/SILT),其中Pre、NDVI、CEC、CL/SILT多表现为正向作用,pH为负向作用。地形因子(SLP、ASP、PDEP1、LDEP1、TRI)贡献度居中。XGBoost、GBRT对Pre、NDVI的敏感性相对更高;RF在粒度与地形上的权重略靠前,但三者对主导因子的识别基本一致。

2.2.3 模型融合及SOC、TN空间估算

在与单模型相同的数据划分与预处理条件下,3种融合策略在测集上的精度整体优于单模型(图6)。在SOC预测中Auto-Weighted的综合表现最优,测试集的拟合优度R²_test为0.887 9,误差指标RMSE为4.607 9、MAE为2.948 2。Blending的测试集预测表现次之,R²_test为0.848 7,RMSE为5.107 2,MAE为2.991 9。Bagging 的测试集表现最低,R²_test为0.770 1,RMSE为6.599 3,MAE 为4.343 8。TN测试集预测中,Auto-Weighted 的表现仍然最好,R²_test为0.775 8,RMSE为4.330 8,MAE为2.418 6。Blending的测试集表现次之,R²_test为0.734 6,RMSE为4.576 2,MAE为2.337 3。Bagging 的测试集预测最差,R²_test为0.655 6,RMSE为5.367 7,MAE为3.157 6。总体来看,3种融合方法均实现对 SOC与TN预测性能的提升。综合比较拟合优度R²_test及误差指标RMSE与MAE,本文最终选取Auto-Weighted作为SOC与TN的最优融合方案。基于Auto-Weighted模型对张掖地区SOC与TN进行估算,并绘制其空间分布图(图7)。

3 讨 论

本研究表明,以决策树为基学习器的集成学习方法XGBoost、GBRT和RF在SOC与TN的估算中整体优于线性回归(LR)与支持向量回归(SVR,核方法),而MLP的精度虽在部分指标上接近优选模型,但稳定性相对不足,与曹脊翔等9关于集成算法优于传统机器学习算法的结论一致。其算法层面的原因在于,张掖地区0~30 cm土层SOC、TN与气候、地形、植被及土壤属性等环境因子之间往往存在显著的非线性关系。线性模型在函数形式设定方面天然受限;而树模型能够通过递归分裂实现分段非线性逼近,无需预设响应函数即可捕捉复杂关系。进一步地,RF通过Bagging与特征随机抽样降低方差、提升抗噪稳健性,GBRT、XGBoost 通过逐步拟合残差并结合学习率、子采样与正则化机制在降低偏差的同时抑制过拟合,因此更适用于本研究的SOC、TN估算场景。

在此基础上,引入Auto-Weighted 融合策略后,SOC的测试集性能达到R²_test=0.888,RMSE=4.61,MAE=2.95;TN的测试集性能达到R²_test=0.776,RMSE=4.33,MAE=2.42,体现出稳定增益。表明多基学习器之间的互补性能够在一定程度上降低单一模型的偏差与方差,并提升测试集上的泛化能力10。该结果与廖燕等11集成优于单模的研究结论相吻合;相比之下,简单算术平均容易受到表现较弱子模型拖累、传统加权在测试集泛化有可能不足,而更具自适应性的融合策略,也进一步提升精度与稳定性12。类似地,王宵宇等13在页岩总有机碳含量评价中指出,改良的集成框架相较常见集成策略在R²、MSE与MAE等指标上更具优势,其中“组合策略”的设计是决定集成效果的关键,此观点与本研究“以多基模型为基础、通过自适应权重实现融合增益”的思路一致。

基于SHAP的主控因子分析显示,SOC与TN受降水量(Pre)、温度(Tmin)、植被(NDVI)、土壤理化性质与地形因子的共同控制。Pre与植被状况对SOC、TN的正向贡献主要体现在SHAP重要性排序及依赖关系中,揭示在张掖干旱与半干旱背景下,水分供给与植被生产力是限制有机质输入的重要环节,适宜降水可促进植被生长,从而增加凋落物与根系周转输入,并可能通过改善土壤团聚体结构与有机质稳定化过程促进SOC与TN的积累14。同时,降水对SOC、TN的影响具有情景依赖性,在强降水事件或坡地产流增强条件下,径流侵蚀与淋溶迁移可能导致SOC与TN的再分配甚至净流失,因此其效应并非在所有情景下均为单向正效应。年平均最低气温(Tmin)的负向贡献表明,当夜间温度整体升高时,土壤微生物代谢与有机质分解的基线水平可能提高,从而增强碳氮矿化并降低SOC、TN的净积累; Tmin升高也可能通过提高蒸散需求、降低有效水分供给间接削弱植被碳输入与碳氮汇聚过程。较高的CEC与合理的CLAY、SILT 比例及适宜的POR有助于改善保水与结构稳定性,从而促进SOC和TN的积累与固持15;pH与BD的负向影响可能与通气、保水条件变化以及微生物活性相关。坡度、地形粗糙度与坡向通过影响径流路径与物质再分配,塑造“汇-散”格局并调节碳氮空间异质性16。总体而言,可解释的集成建模与SHAP框架与陈晓文等17、唐湘博等18和宫航等19关于表层土壤性质贡献排序、阈值响应与交互效应的发现具有一致性,说明在复杂地表过程背景下,集成模型结合全局与局部解释工具可同时提供较高预测精度与可用的机理线索。

区域空间格局方面,SOC与TN均呈显著空间异质性。在降水与温度作为主要气候约束、植被与地形共同调节的背景下,水分供给相对充足、温度较低且植被状况良好的山地更易形成碳氮“热点”20;向绿洲边缘与荒漠过渡区则因水分供给与植被生产力双重受限而形成“冷点”21。此外,SOC与TN的空间分布并非完全独立变化,二者在形成与周转过程中存在相互影响。TN 的变化可通过影响植被生产力与有机质输入间接调控SOC22,在水分供给相对较好的山地或绿洲边缘局部地段,若氮素可利用性较高,植被生长与根系周转增强,凋落物与根系输入随之增加,SOC更易积累23,相反,在水分与养分同时受限的荒漠过渡区,植被输入不足会使SOC与TN更易同步偏低,表现为“冷点”;另一方面,SOC含量与稳定程度也反过来影响TN的保存与形态转化,SOC增加通常意味着有机质底物更充足,微生物同化过程可能增强并促进氮素暂时固定24;同时,当土壤质地(CLAY、SILT)、CEC与孔隙结构(POR)更有利于团聚体形成与有机质保护时,有机氮不易被快速矿化或迁移25,从而推动TN在空间上与SOC呈现更高的一致性。这种相互影响并不意味着SOC与TN处处同向,在坡面径流、侵蚀、沉积与淋溶过程较强的地貌单元,碳氮的侧向迁移与再分配可能造成局部SOC与TN的空间响应差异26,从而进一步强化空间异质性。

在SOC与TN估算中,相较于Blending与Bagging,Auto-Weighted融合策略取得更高的预测精度和更稳定的泛化表现。其优势在于依据基学习器的误差结构与互补性进行自适应赋权27,从而在水热差异显著、地形起伏明显、植被与土壤属性空间变化较大的背景下,能够随环境梯度的改变动态调整权重并保持较稳定的外推表现。相对而言,Bagging主要降低方差、对共同偏差的修正作用有限28,Blending的固定或半固定权重难以及时响应分布变化,解释了三者在本区的表现差异。总体上,合理的融合策略不仅提升SOC与TN的总体估算精度与稳健性,也在空间上减弱高值与低值区域的系统误差,降低由非线性与变量之间交互引发的边缘失真29

4 结 论

1)张掖地区0~30 cm土层SOC与TN的关键驱动因子在以决策树为基学习器的集成模型中高度一致,表明识别结果具有较强稳健性。总体上,土壤结构状态与温度因子构成最强约束,SOC的首要贡献因子为土壤体积质量(BD),其后依次为年平均最低气温(Tmin)与降水量(Pre);TN亦主要受BD、Tmin、阳离子交换量(CEC)与Pre共同控制。方向性上,适宜的降水与较高植被指标总体呈正效应,而BD与Tmin在高值区间更偏负效应,提示在干旱与半干旱过渡带,SOC与TN的空间格局主要由水分和植被碳输入的驱动,同时受到温度、土壤结构状态的调制。

2)在模型表现方面,以决策树为基学习器的集成学习方法(XGBoost、GBRT、RF)在SOC与TN估算中整体优于线性回归(LR)与支持向量回归(SVR);多层感知机(MLP)在部分评价指标上接近优选模型,但整体稳定性相对不足。进一步地,在多模型融合策略中,自适应加权融合(Auto-Weighted)取得最佳综合性能(SOC:R²_test=0.887 9,RMSE=4.607 9,MAE=2.948 2;TN:R²_test=0.775 8,RMSE=4.330 8,MAE=2.418 6),体现出更好的泛化能力与稳健性。

3)本研究的不足之处,时间尺度错配与滞后效应,SOC与TN为“慢变量”,对近年尺度气候与植被指标(如Pre、TminTmax、NDVI)可能存在滞后响应;样本的空间自相关可能导致训练与测试划分出现空间泄露,从而高估泛化性能;放牧、灌溉、施肥与土地利用史等管理因子以及微地貌的量化不足,残差中仍可能包含未观测异质性。

4)后续研究可以在验证上采用块状或缓冲区的空间交叉验证,配合外部样点复核与跨区迁移检验;引入自助抽样或蒙特卡洛输入扰动,给出预测区间并系统表征不确定性。补充管理与干预变量及其代理量,细化微地形指标;构建时滞与多尺度特征,识别阈值与关键交互区间。

参考文献

[1]

WADOUX A M J CMINASNY BMCBRATNEY A B. Machine learning for digital soil mapping: Applications, challenges and suggested solutions[J].Earth-Science Reviews2020210:e103359.

[2]

POGGIO LDE SOUSA L MBATJES N Het al. SoilGrids 2.0: Producing soil information for the globe with quantified spatial uncertainty[J].Soil20217(1):217-240.

[3]

YU W PZHOU WWANG Tet al. Significant improvement in soil organic carbon estimation using data-driven machine learning based on habitat patches[J].Remote Sensing202416(4):e688.

[4]

闫坤,杨慧敏,王德彩.基于NDVI时间序列特征的森林土壤有机碳数字制图:以济源南山林场为例[J].土壤通报202455(4):921-931.

[5]

YAN KYANG H MWANG D C. Digital mapping of forest soil organic carbon based on NDVI time series features: A case study of Jiyuan Nanshan forest farm[J].Chinese Journal of Soil Science202455(4):921-931.

[6]

RUNNING S WNEMANI R RHEINSCH F Aet al. A continuous satellite-derived measure of global terrestrial primary production[J].BioScience200454(6):547-560.

[7]

WERE KBUI T DDICK B Øet al. A comparative assessment of support vector regression, artificial neural networks, and random forests for predicting and mapping soil organic carbon stocks across an Afromontane landscape[J].Ecological Indicators201552:394-403.

[8]

周洋,赵小敏,郭熙.基于多源辅助变量和随机森林模型的表层土壤全氮分布预测[J].土壤学报202259(2):451-460.

[9]

ZHOU YZHAO X MGUO X. Prediction of total nitrogen distribution in surface soil based on multi-source auxiliary variables and random forest approach[J].Acta Pedologica Sinica202259(2):451-460.

[10]

刘尊方,雷浩川,盛海彦.基于XGBoost模型的湟水流域耕地土壤养分遥感反演[J].干旱区地理202346(10):1643-1653.

[11]

LIU Z FLEI H CSHENG H Y. Remote sensing inversion of soil nutrient on farmland in Huangshui River basin based on XGBoost model[J].Arid Land Geography202346(10):1643-1653.

[12]

曹脊翔,陈思源,肖柏夷,.基于机器学习的致密砂岩储层成岩相测井识别:以川中地区沙溪庙组一段为例[J].科学技术与工程202525(21):8858-8870.

[13]

CAO J XCHEN S YXIAO B Yet al. Machine learning based diagenetic facies logging identification: A case of Shaximiao Formation in central Sichuan basin[J].Science Technology and Engineering202525(21):8858-8870.

[14]

王智宇,王达,邱昆峰,.机器学习在矿物岩石地球化学大数据挖掘中的应用与展望[J].成都理工大学学报(自然科学版)202552(5):844-858.

[15]

WANG Z YWANG DQIU K Fet al. Applications and perspectives of machine learning in geochemical big data mining of minerals and rocks[J].Journal of Chengdu University of Technology (Science and Technology Edition)202552(5):844-858.

[16]

廖燕,闫建平,廖茂杰,.融合传统机器学习与深度学习的页岩气储集层岩相预测新方法:以四川盆地下寒武统筇竹寺组为例[J].古地理学报202628(1):353-368.

[17]

LIAO YYAN J PLIAO M Jet al. A novel method for lithofacies prediction in shale gas reservoirs that integrates traditional machine learning and deep learning techniques: A case study of the Lower Cambrain Qiongzhusi Formation in Sichuan basin[J].Journal of Palaeogeography202628(1):353-368.

[18]

田丽洁,刘秋红.基于深度学习的计算机网络流量预测模型研究[J].河北能源职业技术学院学报202525(3):60-63.

[19]

TIAN L JLIU Q H. Research on computer network traffic prediction model based on deep learning[J].Journal of Hebei Energy Institute of Vocation and Technology202525(3):60-63.

[20]

王宵宇,廖广志,黄文松,.基于机器学习的页岩总有机碳含量评价方法[J].石油科学通报202510(2):392-403.

[21]

WANG X YLIAO G ZHUANG W Set al. Evaluation method of total organic carbon content in shale based on machine learning[J].Petroleum Science Bulletin202510(2):392-403.

[22]

崔雨微,李森,常莹莹,.多情景绿洲化对河西内陆河流域碳储量的影响[J].环境科学与技术202548(9):221-236.

[23]

CUI Y WLI SCHANG Y Yet al. Research on impacts of multi-scenario oasification on carbon reserves in Hexi inland river basin[J].Environmental Science and Technology202548(9):221-236.

[24]

孙家敬,贺玉晓,陈雅兰,.生物质炭的土壤固碳效应研究进展及展望[J].土壤学报202663(1)53-64.

[25]

SUN J JHE Y XCHEN Y Let al. Research progress and prospects of soil carbon sequestration effects of biochar[J].Acta Pedologica Sinica202663(1)53-64.

[26]

崔欣然,张春来,李庆,.京津风沙源治理工程区土壤有机碳密度分布特征[J].水土保持学报202539(6):281-289.

[27]

CUI X RZHANG C LLI Qet al. Distribution characteristics of soil organic carbon density in Beijing-Tianjin sandstorm source control project area[J].Journal of Soil and Water Conservation202539(6):281-289.

[28]

陈晓文,荀佳常,刘昌永,.地貌敏感区土壤保持的长期演变及其气候时空响应机制:以山西省为例[J].湖北农业科学202564(9):27-35.

[29]

CHEN X WXUN J CLIU C Yet al. Long-term evolution of soil conservation and its climatic spatio-temporal response mechanism in geomorphologically sensitive areas: A case of Shanxi Province[J].Hubei Agricultural Sciences202564(9):27-35.

[30]

唐湘博,黄有为,苏涵.基于机器学习的中国农业净碳汇预测模型构建及驱动因素响应分析[J/OL].环境科学2025.

[31]

TANG X BHUANG Y WSU H. Construction and driving factors analysis of a machine learning-based prediction model for net carbon sink in Chinese agriculture[J/OL].Environmental Science2025.

[32]

宫航,丁国栋,刘昊,.西藏地区2000—2022年植被覆盖度时空变化格局及驱动力分析[J/OL].环境科学2025.

[33]

GONG HDING G DLIU Het al. Spatiotemporal patterns and driving factors of vegetation coverage in Tibet from 2000—2022[J/OL]. Environmental Science2025.

[34]

王瑞,汤占军.基于多特征融合与集成学习的风机叶片缺陷检测方法[J].计算机科学202552(S1):458-465.

[35]

WANG RTANG Z J. Multi-feature fusion and ensemble learning-based wind turbine blade defect detection method[J].Computer Science202552(S1):458-465.

[36]

师百垒,申艳军,彭建兵,.山地土壤养分的双向补给特征及演化过程[J].地球科学与环境学报202547(4):780-793.

[37]

SHI B LSHEN Y JPENG J Bet al. Bidirectional replenishment characteristics and evolution process of soil nutrients in mountainous areas[J].Journal of Earth Sciences and Environment202547(4):780-793.

[38]

刁二龙,曹广超,曹生奎,.祁连山南坡不同土地利用方式下土壤碳氮含量及通径分析[J].干旱区研究202138(5):1346-1354.

[39]

DIAO E LCAO G CCAO S Ket al. Soil carbon and nitrogen content and path analysis under different land use patterns on the southern slope of Qilian Mountains[J].Arid Zone Research202138(5):1346-1354.

[40]

童珊,曹广超,张卓,.土壤全碳全氮空间异质性及影响因素分析:以祁连山南坡黑河上游为例[J].土壤202254(5):1064-1072.

[41]

TONG SCAO G CZHANG Zet al. Analysis of spatial heterogeneity and influencing factors of soil total carbon and nitrogen: Take the upper reaches of Heihe River on southern slope of Qilian Mountain as an example[J].Soils202254(5):1064-1072.

[42]

宋文婕,梁誉正,陶贞,.微生物介导的土壤有机碳动态研究进展[J].地球科学进展202338(12):1213-1223.

[43]

SONG W JLIANG Y ZTAO Zet al. Advances on soil organic carbon dynamics mediated by microorganisms[J].Advances in Earth Science202338(12):1213-1223.

[44]

邓蕾,李继伟,瞿晴,.退牧还草地土壤有机碳固持动态与驱动机制研究进展[J].应用生态学报202435(11):3208-3216.

[45]

DENG LLI J WQU Qet al. Dynamics and driving mechanisms of soil organic carbon sequestration in grasslands after grazing exclu-Sion: A review[J].Chinese Journal of Applied Ecology202435(11):3208-3216.

[46]

齐瑜洁,黄金权,李威闻,.基于水力侵蚀过程的土壤有机碳变化驱动机制研究进展[J].土壤通报202354(5):1196-1204.

[47]

QI Y JHUANG J QLI W Wet al. Research progress on driving mechanism of soil organic carbon change based on hydraulic erosion process[J].Chinese Journal of Soil Science202354(5):1196-1204.

[48]

张鹏,杜英慧,周博凡,.融合特征选择与梯度提升决策树的典型侵财犯罪风险预测方法[J].中国人民公安大学学报(自然科学版)202531(3):38-50.

[49]

ZHANG PDU Y HZHOU B Fet al. Risk prediction method of typical property crime based on feature selection method and gradient boosting decision tree[J].Journal of People′s Public Security University of China (Science and Technology)202531(3):38-50.

[50]

郑晓楠,于洋,潘虹,.基于Stacking集成学习的水电机组负荷分配[J].排灌机械工程学报202543(10):1040-1048.

[51]

ZHENG X NYU YPAN Het al. Load distribution for hydroelectric units based on Stacking ensemble learning[J].Journal of Drainage and Irrigation Machinery Engineering202543(10):1040-1048.

[52]

曾铃,谢宇航,章赛泽,.基于堆叠集成算法的软岩填方路基沉降融合预测模型研究[J].湖南大学学报(自然科学版)202552(9):125-138.

[53]

ZENG LXIE Y HZHANG S Zet al. Research on fusion prediction model of soft rock embankment subsidence based on stacked generalization integration algorithm[J].Journal of Hunan University (Natural Sciences)202552(9):125-138.

基金资助

国家自然科学基金项目(32260353)

甘肃省重点研发计划项目(21YF5WA096)

科技部高端外国专家引进计划项目(G2022042009L)

甘肃省自然科学基金项目(1606RJZA077)

甘肃省自然科学基金项目(1308RJZA262)

AI Summary AI Mindmap
PDF (2825KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/