内蒙古河套灌区土壤盐分反演的可解释机器学习模型构建

马东祥 ,  姜宇龙 ,  王相平 ,  王志鹏 ,  李源奕 ,  姚荣江 ,  谢文萍 ,  杨劲松

农业科学研究(中英文) ›› 2025, Vol. 46 ›› Issue (04) : 20 -29.

PDF (2744KB)
农业科学研究(中英文) ›› 2025, Vol. 46 ›› Issue (04) : 20 -29. DOI: 10.13907/j.cnki.nykxyj.2025.04.003
盐碱地改良与综合利用

内蒙古河套灌区土壤盐分反演的可解释机器学习模型构建

作者信息 +

Construction of an Interpretable Machine Learning Model for Soil Salinity Inversion in the Hetao Irrigation District of Inner Mongolia

Author information +
文章历史 +
PDF (2809K)

摘要

内蒙古河套灌区土壤盐渍化问题严重制约了当地农业的可持续发展。精准掌握土壤盐分的空间分布情况,是提升农业产能和保护生态环境的关键所在。基于Sentinel-2图像衍生指数(盐分指数:S1、S2、S3、SAIO、CRSI、SI1、SI2、SI3、SI4、SI5和SI_T;植被指数:SAVI、NDVI、RDVI、GNDVI、TVI、DVI、NDGI和ENDVI)、SRTM地形因子(Aspect、Elevation、LS_Factor、Roughness、TWI、Slope、TPI、SPI)等多源遥感数据,通过Pearson相关性分析方法初步筛选特征变量,构建随机森林(Random Forest, RF)、轻量梯度提升(Light Gradient Boosting Machine, LGBM)和极致梯度提升(Extreme Gradient Boosting,XGB)3 种土壤盐分反演模型,并利用Shapley Additive Explanations(SHAP)方法解释特征变量对模型预测结果的贡献度和方向。结果表明:①Pearson相关性分析显示,与目标变量相关程度较高的前10 名特征变量先后依次为Elevation、S1、S2、S3、DVI、SI_T、NDGI、CRSI、SAVI、TVI;②XGB模型是本研究中表现最优秀的模型(训练集R2:0.724 9;验证集R2:0.427 3),但需进一步优化模型性能以提升其泛化能力;③不同模型对特征变量的捕捉能力不同,地形因子Elevation对RF和XGB模型的贡献程度最大,盐分指数CRSI对LGBM模型的贡献程度最大。本研究为河套灌区土壤盐渍化监测提供了理论支撑,对当地土壤盐渍化的精准防治和生态环境保护有重要参考意义。

Abstract

Soil salinization in the Hetao Irrigation District of Inner Mongolia severely hampers the sustainable development of local agriculture. Accurately understanding the spatial distribution of soil salinity is crucial for improving agricultural productivity and protecting the ecological environment. This study utilized multi-source remote sensing data, including Sentinel-2 image-derived indices (salinity indices: S1, S2, S3, SAIO, CRSI, SI1, SI2, SI3, SI4, SI5, and SI_T; vegetation indices: SAVI, NDVI, RDVI, GNDVI, TVI, DVI, NDGI, and ENDVI), and SRTM topographic factors (Aspect, Elevation, LS_Factor, Roughness, TWI, Slope, TPI, SPI). It initially screened feature variables using Pearson correlation analysis and constructed three soil salinity inversion models: Random Forest (RF), Light Gradient Boosting Machine (LGBM), and Extreme Gradient Boosting (XGB). Furthermore, it applied the Shapley Additive Explanations (SHAP) method to elucidate the contributions and directions of feature variables on model predictions. The results indicate: ① Pearson correlation analysis shows that the top ten feature variables most strongly correlated with the target variables are Elevation, S1, S2, S3, DVI, SI_T, NDGI, CRSI, SAVI, and TVI; ② The XGB model performs the best in this study (training set R2: 0.724 9; validation set R2: 0.427 3), although further optimization is necessary to enhance its generalization ability; ③ Different models exhibit varying capacities for capturing feature variables, with the terrain factor Elevation being the most significant contributor to the RF and XGB models, while the salinity index CRSI is the most significant contributor to the LGBM model. This study provides theoretical support for monitoring soil salinization in the Hetao Irrigation District and offers important insights for the precise prevention and control of local soil salinization and ecological protection.

Graphical abstract

关键词

盐渍土 / 遥感数据 / 可解释机器学习 / 盐分反演

Key words

saline soil / remote sensing data / interpretable machine learning / salt inversion

引用本文

引用格式 ▾
马东祥,姜宇龙,王相平,王志鹏,李源奕,姚荣江,谢文萍,杨劲松. 内蒙古河套灌区土壤盐分反演的可解释机器学习模型构建[J]. 农业科学研究(中英文), 2025, 46(04): 20-29 DOI:10.13907/j.cnki.nykxyj.2025.04.003

登录浏览全文

4963

注册一个新账户 忘记密码

由土壤盐渍化引发的土壤固结、肥力下降、作物减产等现象已成为制约区域生态环境保护和农业可持续发展的主要因子之一[1-2]。据统计,中国盐渍土总面积约3.69×107 hm2,约占全球盐渍土总面积的3.35%,综合治理、利用盐渍土资源事关国家粮食安全[3]。因此,及时、准确获取盐渍土壤盐分信息并预测其变化趋势,对促进我国农业可持续发展和生态环境保护具有重要意义[4]
依靠田间采样的传统土壤盐分调查手段难以获取长时序、大范围的土壤盐分信息,无法满足区域土壤盐分动态监测的需求[5-6]。因此,发挥遥感技术快速、高效、覆盖范围广、数据集成能力强等优势对土壤盐分进行动态监测,是实现盐渍土壤盐分调控的主要途径[7-8]。近年来,学者们发现利用机器学习模型可以有效捕捉遥感图像指数与土壤盐分之间的复杂非线性关系[9],并模拟和预测土壤盐分的变化趋势[10]。常用的机器学习模型如支持向量机(Support Vector Machine,SVM)[11]、随机森林(Random Forest,RF)[12]、轻量梯度提升(Light Gradient Boosting Machine,LGBM)[13]、极致梯度提升(Extreme Gradient Boosting,XGB)[14]等,这些模型已成为盐渍土盐分监测和管理领域极具价值的信息化工具[15]。值得注意的是,不同的机器学习模型在具体的使用场景中表现出的性能亦不相同。在新疆三工河流域平原绿洲表层土壤盐分调查的一项研究中显示,同时使用SVM、RF及其他机器学习模型的条件下,RF模型避免了数据的平滑效应和图斑边界两侧的突变,更好地呈现土壤盐分在流域局部空间的分布状况,展现出的性能优于其他模型[11]。在另外一项针对印度内陆水产养殖区土壤盐分监测的研究中同时使用了LGBM和GBM 2种模型进行土壤盐分反演,但这2 种模型表现出的性能均不理想[13]。亦有研究显示,将RF、LGBM和XGB机器学习模型同时用于伊朗埃什特哈德盐湖区土壤盐分监测中,XGB模型的表现最好,该模型可以提供高精度盐度图来监测该区域土壤盐度[14]。因此,要将机器学习模型投入盐渍土壤盐分反演的相关研究中,需要考虑研究区相关特征、纳入变量特性及模型相关参数,进行综合评估,从而优选出最佳的、可靠的模型。但是,传统机器学习模型的主要劣势在于其“黑箱”特性[16],即模型内的决策过程不易理解,缺乏可解释性,从而限制了模型在相关领域的广泛应用[17]
鉴于此,本研究通过谷歌地球引擎(Google Earth Engine,GEE)提取Sentinel-2卫星影像和SRTM地形因子,并计算相关的盐分指数和植被指数,结合实测土壤盐分数据构建内蒙古河套灌区盐渍土壤盐分反演模型(RF、LGBM和XGB模型)。GEE云平台是基于谷歌云服务基础设施的遥感大数据分析云平台,该平台已广泛应用于全球森林变化、全球地表水变化、作物产量估算、稻田制图、城市制图、洪水制图、火灾恢复等区域及全球性问题[9]。同时,为使机器学习模型决策过程更加透明化,使用Shapley Additive Explanations(SHAP)方法[18]解析关键特征变量对模型预测结果的重要性及其贡献方向,提高模型内部决策过程的透明度。研究旨在评估不同机器学习模型的反演精度与泛化能力,优选出最佳模型。研究成果可为河套灌区土壤盐渍化的精准防治和生态环境保护提供理论依据。

1 材料与方法

1.1 研究区概况

图1所示,采样点分别位于内蒙古河套灌区巴彦淖尔市五原县和鄂尔多斯市杭锦旗,两地直线距离约44 km。该地区气候类型属典型干旱半干旱气候,光照时间长、降水稀少、蒸发强烈,年均降水量约160 mm[19];景观地貌呈现明显的荒漠至荒漠草原地带性分布规律[20];主要种植作物为向日葵、玉米等[21]。由于生态环境问题的日益加剧和水资源的过度开发,该地区已成为中国典型的生态脆弱地区之一[22]

1.2 土壤样品采集及检测

本研究的土壤样品在当地春季灌溉前采集。分别于2025年3月31日和4月1日在五原县采样区和杭锦旗采样区,通过土钻法采集0~20 cm深度的土壤,将采集的土壤样品装入密封袋运回实验室进行预处理。土壤样品经风干、研磨、过筛后,测定土壤全盐质量比(total salt,TS)。分别采用EDTA络合滴定法、EDTA间接滴定法、火焰光度法、硝酸银滴定法测定土壤中Ca2+、Mg2+、K+、Na+阳离子的质量比,CO32-、HCO3-、Cl-、SO42-阴离子的质量比;将上述8 种离子质量比之和累加得到土壤中水溶性全盐质量比(g∙kg-1[23]。土壤粒度组成采用百特激光粒度分析仪(BT-9300ST型)进行检测。

1.3 遥感数据来源

本研究采用的遥感数据均来自GEE云平台。基于WGS84坐标,在GEE平台中调用COPERNICUS/S2_SR_HARMONIZED数据集,以获取与实际土壤采样时间同期的Sentinel-2遥感影像数据,并计算相关的盐分指数和植被指数。计算之前在GEE云平台已完成了几何校正、辐射校正、大气校正等步骤,并通过QA60波段实现图像去云处理,保证了数据的准确性、可靠性[24]。相关盐分指数和植被指数如表1所示。此外,通过GEE云平台内置的SRTM数字高程模型计算坡向(Aspect)、海拔(Elevation)、LS因子(LS_factor)、粗糙度(Roughness)、地形湿度指数(TWI)、坡度(Slope)、地形位置指数(TPI)、水流强度指数(SPI)等地形因子[25]

1.4 数据处理

1.4.1 数据清洗

数据集的质量直接关系到模型的性能和预测结果的准确性。本研究通过四分位距(interquartile range,IQR)法处理数据集中的异常值,并将其替换为均值,确保输入模型的数据质量符合标准,以提升模型的准确性、鲁棒性和泛化能力。

1.4.2 特征变量初筛

构建机器学习模型之前对特征变量进行初步筛选,不仅有助于提高模型训练效率和预测精度,还能提升模型的可解释性和泛化能力,是建模过程中的重要环节。本研究利用皮尔逊(Pearson)相关性分析法计算特征变量与目标变量TS之间的相关系数,并筛选Pearson相关系数绝对值排名前10的特征变量用于模型构建。

1.5 模型构建与评价

1.5.1 模型构建

本研究样本数为133 个,其中五原县采样区63 个,杭锦旗采样区70 个。将数据集划分为训练集(70%)和验证集(30%),通过机器学习方法构建遥感图像指数与土壤盐分的回归预测模型。本研究用到的模型如下。

RF模型是一种基于决策树算法和袋装(Bagging)方法相结合的集成学习模型,它主要通过构建多个决策树并结合其预测结果来提高模型的准确性与鲁棒性,主要优势在于不易过拟合[9]。本研究中RF模型设置树的数量为1 000,树的深度为50,叶子数为2,通过15折交叉验证训练模型。

LGBM模型是一种针对大规模数据集和高维特征优化的高效梯度提升树(Gradient Boosting Decision Tree,GBDT)。与传统的GBDT算法相比,LGBM模型采用了直方图算法,将遍历样本转变为遍历直方图,极大地降低了时间复杂度。同时,该模型还采用优化后的特征并行、数据并行方法加速计算,当数据量非常大的时候还可以采用投票并行的策略,以提升训练速度、降低内存消耗[13]。本研究中LGBM模型设置树的数量为2 000,树的最大深度为50,叶子节点数为30,通过15折交叉验证训练模型。

XGB模型是基于GBDT算法的集成学习算法模型,具有较强的可调性,支持并行计算和分布式计算,能够处理多种类型的数据(如稀疏数据、类别数据等)[14]。本研究中XGB模型设置树的数量为500,树的深度为20,通过20折交叉验证训练模型。

1.5.2 模型评价

模型评价是机器学习建模过程中必不可少的环节,其核心目的是通过系统化的指标来量化模型性能,确保模型的可靠性和实用性,同时也为进一步优化模型提供数据支撑。本研究中以决定系数(R2)、平均绝对误差(MAE)、均方根误差(RMSE)3 个指标评价模型性能[26]。其中,R2越靠近1模型精度越高,MAE和RMSE取值越小模型精度越高。各指标计算公式如下:

R2=1-i=1nyi-y^i2i=1nyi-y¯i20,1
MAE=1ni=1nyi-y^i[0,+)
RMSE=1ni=1nyi-y^i20,+

式(1)式(3)中:yi为真实值;y¯i为真实值的均值;y^i为预测值;n为样本数。

1.6 基于SHAP分析的机器学习模型解释方法

机器学习模型通常被视为“黑箱”模型,缺乏直观的解释。SHAP分析是一种基于博弈论的解释性方法,其核心概念来源于Shapley值[27]。在机器学习领域,SHAP方法将Shapley值的思想应用于模型解释,为每个特征变量提供一个公平的贡献度分配,其目的是为黑箱机器学习模型提供透明且可解释的决策过程,帮助用户理解模型的特定预测流程[28]。本研究通过计算特征变量平均绝对SHAP值作为变量重要性得分来量化其对模型构建的重要性,并绘制SHAP摘要图对模型的决策过程进行解释分析。

2 结果与分析

2.1 土壤粒度组成及实测土壤盐分描述性统计分析

对2 个采样区0~20 cm土层土壤样品进行粒度检测,结果如表2所示。五原县采样区土壤粒度组成主要以粉粒为主,黏粒次之,砂粒最少。其中,粉粒体积百分数为83.22%,黏粒和砂粒分别为9.06%和7.72%。杭锦旗采样区土壤粒度组成主要以砂粒为主,粉粒次之,黏粒最少。其中,砂粒体积百分数为91.51%,黏粒和粉粒分别为0.97%和7.53%。由此可见,2 个采样区土壤粒度组成存在明显差异。

实测土壤盐分的描述性统计分析结果如表3所示。结合盐渍土分类标准[23]可知,五原县采样区土壤为轻度盐渍化土壤,而杭锦旗采样区为非盐渍化土壤。五原县和杭锦旗采样区土壤盐分质量比最大值分别为7.92和4.20 g∙kg-1,分别属于重度盐渍土壤和中度盐渍土壤;二者的变异系数分别为79.86%和79.50%。对采样点实测土壤盐分进行统计,非盐渍土壤采样点数为76 个,占总数的57.14%;轻度盐渍土采样点数为49 个,占总数的36.84%;中度、重度盐渍土采样点数较少,分别为6 个和2 个,占比分别为4.51%和1.50%。整体而言,2 个采样区非盐渍化土壤及轻、中、重度盐渍土均有分布,可能存在土壤盐斑现象,且土壤盐分空间分布变异程度较大。

2.2 特征变量初筛结果

本研究初步纳入27 个特征变量,对特征变量与目标变量进行Pearson相关性分析,结果如图2所示。对图2中的Pearson相关系数取绝对值,筛选出排名前10的特征变量用于建模,其绝对值大小排序依次为Elevation、S1、S2、S3、DVI、SI_T、NDGI、CRSI、SAVI、TVI。这不仅可以降低模型的复杂度,同时也有助于提高模型的泛化能力。

2.3 机器学习模型的建立与性能评价

RF、LGBM和XGB模型的主要参数如表4所示。在训练集上,RF模型表现最佳(R²=0.733 8),说明RF模型能够较好地拟合训练集数据,解释数据集73.38%的变异性;XGB模型表现稍逊于RF模型(R²=0.724 9),但其仍能较好地解释训练集数据72.49%的变异性;LGBM模型表现最差(R²=0.611 6),仅能解释训练集数据61.16%的变异性。此外,RF、LGBM和XGB模型的MAE分别为0.157 4、0.163 8和0.163 5 g∙kg-1,表明RF模型的误差最小,而LGBM和XGB模型的误差接近,且均大于RF模型的误差;RF、LGBM和XGB模型的RMSE分别为0.207 4、0.247 2和0.208 1 g∙kg-1,表明RF模型的误差最小,XGB模型次之,LGBM模型的误差最大。综合比较训练集上RF、LGBM和XGB模型的MAE和RMSE,RF模型在训练集上的误差相对最小,模型性能更优。

在验证集上,3 种模型的R²均明显下降。其中,RF模型的R²为0.400 2,表明该模型在训练集上虽然表现良好,但在验证集上的泛化能力较差,可能出现过拟合现象;LGBM模型的R²为0.408 1,在验证集上的表现同样较差,表明模型的泛化能力不足;XGB模型的R²为0.427 3,在3 种模型中最大,但同样表现出泛化能力不足。RF、LGBM和XGB模型的MAE分别为0.304 3、0.297 3和0.303 4 g∙kg-1,表明LGBM模型的误差最小,而RF和XGB模型的误差接近,且均大于LGBM模型的误差;RF、LGBM和XGB模型的RMSE分别为0.376 6、0.374 9和0.307 8 g∙kg-1,表明XGB模型的误差最小,而RF和LGBM模型的误差接近,且均大于XGB模型的误差。综合比较验证集上RF、LGBM和XGB模型的MAE和RMSE,XGB模型在验证集上的表现更优。

综上所述,3 种模型均在训练集上的表现较好,但在验证集上的表现较差,说明3 种模型的泛化能力不足。其中,XGB模型在训练集和验证集的表现较为均衡,尤其在验证集上的较低误差和较高的R²值表明该模型相较于RF和LGBM模型具有较强的泛化能力。因此,XGB模型是本研究中表现最为优异的模型,可优先选择该模型作为研究区盐渍土盐分反演的预测模型,但需进一步优化模型以提升其泛化能力。

2.4 基于SHAP方法的机器学习模型解释分析

本研究基于SHAP方法分别对RF、LGBM和XGB模型的内部决策过程进行解释和可视化分析,结果如图3所示。其中,特征变量重要性得分以平均绝对SHAP值作为特征变量的重要性得分,从整体视角量化特征变量对模型的贡献,并为模型后续优化提供依据。SHAP摘要图纵轴列出了不同的特征变量;横轴表示每个数据点对应的SHAP值,正值表示该特征变量增加了模型预测值(正向贡献),负值则相反;数据点代表数据集中的样本,其分布范围表示特征变量对模型预测的影响作用大小;数据点的颜色表示特征值的大小,红色为高特征值,蓝色为低特征值。

在RF模型中,Elevation为最重要特征变量,其重要性得分为0.065 8,远超其他特征变量,该特征变量是决定RF模型预测结果的核心因素(图3-a)。此外,Elevation对模型预测的作用具有明显的区分度,其SHAP值随着特征值增大而减小,说明Elevation对模型的预测结果具有负向贡献,而其他特征变量对模型预测结果贡献的指向性不明显(图3-b)。在LGBM模型中,CRSI、NDGI、SI_T和DVI这4 个特征变量重要性得分相对接近且明显大于其他特征变量,所以这4 个特征变量对LGBM模型预测结果的作用较大(图3-c)。此外,CRSI对模型预测的作用区分度较明显,其SHAP值随着特征值增大而增大,说明CRSI对模型的预测结果具有正向贡献,而其他特征变量对模型预测结果贡献的指向性不明显(图3-d)。在XGB模型中,Elevation重要性得分为0.080 5,远超其他特征变量,该特征变量是决定XGB模型预测结果的核心因素(图3-e)。此外,Elevation对模型预测的作用具有明显的区分度,其SHAP值随着特征值增大而减小,说明Elevation对模型的预测结果具有负向贡献,其他特征变量对模型预测结果贡献的指向性不明显(图3-f)。值得注意的是,TVI在RF、LGBM和XGB模型中,重要性得分均是所有特征变量中最低的(图3),对上述3个模型预测结果的影响不大。

3 讨论

3.1 可解释机器学习模型在盐渍土壤盐分预测中的优势

相较于传统机器学习盐分预测模型,传统的机器学习方法如RF模型、SVM模型等虽然具有较高的预测精度[29],但其“黑箱”特性使得预测结果缺乏可解释性。这在农业科学应用中尤其关键,因为预测结果需要为土壤管理和决策提供科学依据。相比之下,本研究基于SHAP方法对模型的决策过程进行可视化分析,直观地解释特征变量对模型预测结果的重要性及贡献方向(图3),使模型内部的决策过程更加透明[18],而且也有助于挖掘更多对土壤盐分贡献较大的特征变量[30]。与此同时,这种可解释性有助于增加相关领域从业者对模型预测结果的信任度,也为土壤盐分预测的科学理解提供有力支持,为模型后续的性能优化提供精准导向[16]。可见,可解释机器学习模型的应用不仅提升了预测精度,还增强了模型内部决策过程的透明度,对于盐渍土管理利用和农业可持续发展具有重要的现实意义[28]

3.2 模型性能的影响因子分析

本研究中,RF、LGBM和XGB模型均在训练集上表现良好,在验证集上表现较差,说明模型泛化能力不足,且有一定程度过拟合风险(表4)。首先,本研究用于模型构建的样本量(133 个)较少,限制了特征学习的深度和广度,模型无法全面理解所有特征变量之间的关系,进而导致其训练不充分[31]。因此,应在条件允许的基础上适当增加土壤样本的采集数量,同时获取样本采集对应坐标的遥感数据,以提升模型的稳定性、可靠性及预测结果的准确性[32]。其次,特征选择对模型精度的提升至关重要[33],本研究采用Pearson相关性分析方法,筛选与目标变量的相关系数绝对值排名前10的特征变量用于模型构建(图2)。虽然通过计算Pearson相关系数筛选了与目标变量关联较强的特征变量,有效降低了冗余特征的影响和数据维度过高带来的过拟合风险;但是,该方法只能捕捉到线性关系,一些与目标变量具有非线性关系的重要特征可能会被遗漏。因此,需要考虑更多高维特征选择方法筛选特征变量,如灰色关联分析(GRA)、变量投影重要性分析(VIP)、主成分分析(PCA)[34-35]、竞争性自适应重加权采样(CARS)[27]、连续投影算法(SPA)[36]等方法。此外,土壤盐分的空间分布受气候、地形地质、灌溉方式等多种因素的影响[3]。本研究发现五原县和杭锦旗2 个采样区土壤粒度组成(表1)和盐渍化程度差异显著(表2),且土壤盐分空间分布存在较大变异性(表2)。这种土壤质地差异和盐分分布的空间变异性对模型泛化和预测准确性提升造成了一定挑战。因此,后续可以考虑通过地理加权回归(GWR)[37-38]或不同空间尺度的多尺度建模方法[39]降低样本空间非平稳性对模型性能的负面效应。

3.3 基于SHAP方法的特征变量贡献度分析

SHAP方法为盐渍土壤盐分预测模型提供了可解释性框架,通过量化特征变量的贡献度揭示模型决策机制。在本研究中,Elevation在RF和XGB模型中重要性得分最高,分别为0.065 8和0.080 5,且SHAP值随着Elevation值增大而减小(图3)。这表明在RF和XGB模型中,地形因子是影响模型预测结果的重要自然因素[40],该因子可能通过控制地下水位埋深进而影响盐分淋溶和富集的过程[37]。在LGBM模型中,CRSI对模型预测结果具有明显的正向贡献(图3),表明高盐分胁迫下植被叶绿素降解导致近红外反射率下降[29]。而SAVI指数贡献较弱,可能与研究区植被覆盖度低及盐生植被光谱特性有关[30]。因此,在后续的土壤盐分反演模型优化过程中,综合利用多时序数据研究土壤盐分与地表植被覆盖变化的动态响应关系,有助于提升模型的预测精度[41]。此外,同一特征变量在不同模型中其重要性排序有明显差异,如SI_T在RF、LGBM和XGB模型中的重要性排序分别为第7、3和9名。这是因为不同算法模型对特征变量的捕捉能力不同,而LGBM模型的叶子优先分裂策略更易识别高维特征组合[42]

4 结论

1)通过Pearson相关性分析初步筛选出与土壤盐分相关系数绝对值排名前10的特征变量(其绝对值大小排序依次为Elevation、S1、S2、S3、DVI、SI_T、NDGI、CRSI、SAVI、TVI),有助于降低模型复杂性,提高模型训练效率。但是,该方法可能忽略了一些特征变量与目标变量之间的非线性关系,导致模型泛化能力不足。

2)在本研究中XGB模型在训练集和验证集的表现较为均衡,且泛化能力较强(验证集R2=0.427 3)。这源于其算法对特征交互的非线性捕捉能力及抗过拟合设计,对于本研究中2 个采样点土壤质地具有明显差异的场景较为适用。

3)在本研究中使用SHAP方法为盐渍土盐分预测模型提供了可解释性框架,通过量化特征变量的贡献程度揭示模型决策机制,为后续模型参数优化和性能提升提供了方向。

参考文献

[1]

VAN ZELM EZHANG Y XTESTERINK C. Salt tolerance mechanisms of plants[J]. Annual Review of Plant Biology202071:403-433.

[2]

HASSANI AAZAPAGIC ASHOKRI N. Global predictions of primary soil salinization under changing climate in the 21st century[J]. Nature Communications202112(1):6663.

[3]

杨劲松,姚荣江,王相平,.中国盐渍土研究:历程、现状与展望[J].土壤学报202259(1):10-27.

[4]

王琨,曹倡铭,昝子懿,.基于Sentinel-1/2遥感数据和可解释机器学习的河套灌区土壤盐度反演[J/OL].节水灌溉1-19[2025-09-22](2025-08-11).

[5]

KHASANOV SLI F DKULMATOV Ret al. Evaluation of the perennial spatio-temporal changes in the groundwater level and mineralization, and soil salinity in irrigated lands of arid zone: As an example of Syrdarya Province, Uzbekistan[J]. Agricultural Water Management2022263:107444.

[6]

MA HZHAO W JDUAN W Cet al. Inversion model of soil salinity in alfalfa covered farmland based on sensitive variable selection and machine learning algorithms[J]. PeerJ202412:e18186.

[7]

HE Y JZHANG Z TXIANG Ret al. Monitoring salinity in bare soil based on Sentinel-1/2 image fusion and machine learning[J]. Infrared Physics & Technology2023131:104656.

[8]

ZHAO W JMA HZHOU Cet al. Soil salinity inversion model based on BPNN optimization algorithm for UAV multispectral remote sensing[J]. IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing202316:6038-6047.

[9]

陈猷,申晓晶,周博,.基于遥感影像与随机森林算法的银北灌区土壤盐渍化监测方法研究[J].江西农业大学学报202547(3):803-816.

[10]

SONG JYI Y J. Cascaded machine learning of soil moisture and salinity prediction in estuarine wetlands based on in situ internet of things monitoring[J]. Water Resources Research202561(4):e2024WR038271.

[11]

龙威夷,施建飞,李双媛,.流域绿洲土壤盐分多模型反演效果评估[J].干旱区研究202441(7):1120-1130.

[12]

李小雨,贾科利,魏慧敏,.基于随机森林算法的土壤含盐量预测[J].干旱区研究202340(8):1258-1267.

[13]

MANTENA SMAHAMMOOD VRAO K N. Prediction of soil salinity in the Upputeru river estuary catchment, India, using machine learning techniques[J]. Environmental Monitoring and Assessment2023195(8):1006.

[14]

ZAREI AHASANLOU MMAHDIANPARI M. A comparison of machine learning models for soil salinity estimation using multi-spectral earth observation data[J]. ISPRS Annals of the Photogrammetry, Remote Sensing and Spatial Information Sciences2021,V-3-2021:257-263.

[15]

THANGARASU TMENGASH H AALLAFI Ret al. Spatial prediction of soil salinity: Remote sensing and machine learning approach[J]. Journal of South American Earth Sciences2025156:105440.

[16]

JIA P PZHANG J HLIANG Y Net al. The inversion of arid-coastal cultivated soil salinity using explainable machine learning and Sentinel-2[J]. Ecological Indicators2024166:112364.

[17]

JIANG X FDUAN H CLIAO Jet al. Estimation of soil salinization by machine learning algorithms in different arid regions of northwest China[J]. Remote Sensing202214(2):347.

[18]

AKSOY SSERTEL EROSCHER Ret al. Assessment of soil salinity using explainable machine learning methods and Landsat 8 images[J]. International Journal of Applied Earth Observation and Geoinformation2024130:103879.

[19]

宋波,李文宝,郭鑫,.内蒙古河套灌区向日葵和玉米农田耕作层土壤细菌群落特征及构建影响因子[J].土壤通报202556(1):189-200.

[20]

祁帅,袁瑞强,薛宇,.基于改进遥感生态指数的黄河流域内蒙古段生态环境质量监测及影响因素分析[J].灌溉排水学报44(10):135-144.

[21]

付同刚,蒋莞艳,刘鹏,.内蒙古河套灌区盐碱地治理中农户参与意识及其影响因素[J].中国生态农业学报(中英文)202129(4):625-632.

[22]

李冰洁,范志韬,曲芷程,.基于InVEST-PLUS模型的黄河流域内蒙古段生态系统碳储量评价及预测[J].干旱区研究202441(7):1217-1227.

[23]

鲍士旦.土壤农化分析[M].3版.北京:中国农业出版社,2000.

[24]

YUE J BYANG G JTIAN Q Jet al. Estimate of winter-wheat above-ground biomass based on UAV ultrahigh-ground-resolution image textures and vegetation indices[J]. ISPRS Journal of Photogrammetry and Remote Sensing2019150:226-244.

[25]

WANG NXUE JPENG Jet al. Integrating remote sensing and landscape characteristics to estimate soil salinity using machine learning methods: A case study from southern Xinjiang, China[J]. Remote Sensing202012(24):4118.

[26]

ELSHEWY M AMOHAMED M H AREFAAT M. Developing a soil salinity model from landsat 8 satellite bands based on advanced machine learning algorithms[J]. Journal of the Indian Society of Remote Sensing202452(3):617-632.

[27]

黄华雨,丁启东,张俊华,.地面高光谱耦合可解释性集成机器学习的农田土壤含盐量和pH反演[J/OL].环境科学1-17(2025-04-24)[2025-09-22].

[28]

ZHONG LGUO XDING Met al. SHAP values accurately explain the difference in modeling accuracy of convolution neural network between soil full-spectrum and feature-spectrum[J]. Computers and Electronics in Agriculture2024217:108627.

[29]

SAHBENI GNGABIRE MMUSYIMI P Ket al. Challenges and opportunities in remote sensing for soil salinization mapping and monitoring: A review[J]. Remote Sensing202315(10):2540.

[30]

MOHAMMED SARSHAD SBASHIR Bet al. Evaluating machine learning performance in predicting sodium adsorption ratio for sustainable soil-water management in the eastern Mediterranean[J]. Journal of Environmental Management2024370:122640.

[31]

VABALAS AGOWEN EPOLIAKOFF Eet al. Machine learning algorithm validation with a limited sample size[J]. Plos One201914(11):e0224365.

[32]

RAJPUT DWANG W JCHEN C C. Evaluation of a decided sample size in machine learning applications[J]. BMC Bioinformatics202324(1):48.

[33]

ZHAO J HZHANG C YMIN Let al. Retrieval of farmland surface soil moisture based on feature optimization and machine learning[J]. Remote Sensing202214(20):5102.

[34]

MA HZHAO W JDUAN W Cet al. Inversion model of soil salinity in alfalfa covered farmland based on sensitive variable selection and machine learning algorithms[J]. PeerJ202412:e18186.

[35]

赵文举,杨发奇,马宏,.基于无人机影像和宽度学习的小麦分蘖期土壤盐分反演[J].农业工程学报202541(15):66-75.

[36]

姜传礼,赵健赟,丁圆圆,.SPA算法与机器学习的黄河源土壤水分反演[J].光谱学与光谱分析202343(6):1961-1967.

[37]

YANG QFAN X MWANG L Let al. Detection of soil salinity distribution and its change in the Yellow River Delta comparing 2006 and 2022[J]. Land Degradation & Development202435(14):4288-4303.

[38]

NIE S YBIAN J MZHOU Y C. Estimating the spatial distribution of soil salinity with geographically weighted regression kriging and its relationship to groundwater in the western Jilin irrigation area, NorthEast China[J]. Polish Journal of Environmental Studies202130(1):283-294.

[39]

WU W CAL-SHAFIE W MMHAIMEED A Set al. Soil salinity mapping by multiscale remote sensing in Mesopotamia, Iraq[J]. IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing20147(11):4442-4452.

[40]

赵铭,常春艳,王卓然,.黄三角濒海区土壤盐渍化的驱动力分析及预测模拟[J].中国农学通报202440(6):75-83.

[41]

CHEN XYANG S QWEN X Yet al. Study on soil salinity inversion of different crop types based on multi-time series[J]. Plant and Soil2025514:1187-1203.

[42]

JEONG HABBAS AKIM H Get al. Spatial prediction of groundwater salinity in multiple aquifers of the Mekong Delta region using explainable machine learning models[J]. Water Research2024266:122404.

基金资助

内蒙古自治区“科技兴蒙”行动重点专项(NMKJXM202401-01)

AI Summary AI Mindmap
PDF (2744KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/