食管癌(esophageal cancer,EC)是一种发病机制复杂的消化道肿瘤,其发生发展涉及遗传背景、生活方式及环境暴露等多重因素
[1]。由于EC早期阶段缺乏特异性临床症状,EC患者在确诊时常处于中晚期,整体预后仍不理想
[2]。因此,探讨可用于早期风险评估和预测的临床指标,一直是EC基础研究和临床实践中的重要方向。近年来,围绕EC早期检测的研究逐步从传统形态学评估拓展至分子标志物和多维数据分析领域。目前可以利用循环微小RNA-29c-3p(microRNA-29c-3p,miR-29c-3p)及特定组合
[3-5]、表观遗传生物标志物(DNA甲基化、组蛋白修饰及非编码RNAs)
[6-8]及代谢异常相关信号(循环血浆挥发性有机化合物)
[9]等对EC进行风险评估,但上述方法多依赖高通量或专用检测平台,成本较高,且尚缺乏成熟的临床转化路径。临床实验室常规检测指标具有获取便捷、检测成本低和覆盖人群广等优势,其在肿瘤风险评估中的潜在价值逐渐受到关注。然而,单一实验室指标往往缺乏足够的特异性,其与EC风险之间的复杂非线性关系难以通过传统统计方法加以充分识别。机器学习(machine learning,ML)技术凭借其处理高维度复杂数据的独特优势,已逐步渗透到疾病诊疗的全流程,涵盖风险预测、治疗决策和治疗反应预测等环节
[10]。已有研究
[11]尝试将ML方法应用于EC的影像分析、病理判读或分子数据挖掘中,显示出较传统方法更优良的预测性能。但目前基于临床实验室常规检测数据构建EC预测模型的研究仍然有限,且多数工作侧重模型性能评估,对模型内部决策机制及特征贡献的解释不足,限制了其在临床实践中的可理解性和推广应用。
基于上述背景,本研究利用临床实验室常规检测数据,构建并比较多种机器学习模型用于EC风险预测,在系统评估模型预测性能的基础上,引入沙普利加性解释(shapley additive explanation,SHAP)方法,对模型中关键特征的相对贡献进行量化分析,旨在为基于常规实验室数据的EC风险预测提供一种兼顾预测性能与可解释性的分析框架,并为后续相关研究提供方法学参考。
1 资料与方法
1.1 研究对象
本研究为回顾性病例对照研究,本院提供了一套真实的和去标识化的临床数据集,包括2019-2024年所有实验室数据。所有数据经匿名化处理并分配唯一识别码,收集内容包括基线资料、诊断信息、食管镜检查和病理报告、实验室检测结果(均为食管镜检查或确诊前15 d内采集)。本研究经本院医学伦理委员会批准(伦理审批号:KY20242119),由于采用去标识化数据进行回顾性分析,伦理委员会批准免除受试者知情同意。EC组纳入标准:①病理确诊的EC患者,年龄18~80岁;②拥有完整的临床数据,包括病史、体格检查、实验室检测和影像学检查结果。排除标准:①并发其他肿瘤病史;②既往接受过抗癌治疗(手术、放化疗和免疫治疗等);③并发严重基础疾病(如心脑血管疾病、自身免疫性疾病、糖尿病、肝肾功能衰竭和凝血障碍等)。本研究采用频率匹配法,按照约1∶1.2的比例,根据EC组患者的年龄段(每5岁为一个层级)和性别分布,在同期健康体检人群中筛选研究对象作为对照组,以确保组间基础特征的可比性。按照上述标准共纳入EC患者2 763例,健康对照(health control,HC)3 297名。
1.2 数据清洗和标准化
所有患者的检测结果均在食管镜检查或最终诊断前15 d内收集。原始数据预处理步骤:①剔除缺失率>30%的指标,对多次检测受试者仅保留首次结果;②采用逻辑观察标识符名称与代码(Logical Observation Identifiers Names and Codes,LOINC)系统标准化数据集;③对定量数据进行二值化处理,定性数据采用虚拟编码转换;④使用Python的sklearn.preprocessing包中的MinMaxScaler对数据进行归一化处理,公式如下:v'=(v-Vmin)/(Vmax-Vmin)。其中,v代表原始数据,Vmin代表该指标在数据集中的最小值,Vmax代表该指标在数据集中的最大值,v'代表归一化后数值;⑤异常值处理:采用四分位距法与Z-score法联合识别潜在异常值——对非正态分布指标;所有潜在异常值均通过查阅原始病历和咨询临床专家的方式验证合理性,剔除检测误差、标本污染等无效异常值,保留患者病理状态相关的有效异常值;⑥采用随机森林(random forest,RF)算法补充缺失数据。
1.3 预测模型的构建和评估
从所有独立变量中选择特征因子后,将EC患者分为训练集和测试集。应用多种机器学习分类模型进行综合分析,并比较了不同模型训练集和测试集中每个指标的重要性。此外,使用最优模型评估和验证结果,并开发了SHAP解释模型。①筛选特征因子:采用R软件(glmnet 4.1.2)行递归特征消除(recursive feature elimination,RFE)与最小绝对收缩和选择算子(least absolute shrinkage and selection operator,LASSO)交叉验证分析,取两者重叠因子进一步开展回归分析,采用SPSS软件进行差异性比较,最终获得
P<0.05的特征因子;②数据划分:采用Python(0.22.1)随机数方法根据5∶1的比例随机将数据集分为训练集和测试集;③分类多模型综合分析:采用Python构建极限梯度提升(extreme gradient boosting,XGBoost)、逻辑回归(logistic regression,LR)、轻量级梯度提升机(light gradient boosting machine,LightGBM)、RF、自适应提升算法(adaptive boosting,AdaBoost)和决策树(decision tree,DT)。训练和测试上述参数模型(重复10次样本),分析不同模型训练集和测试集中指标的重要性,并选择最优模型。采用Python绘制受试者工作特征(receiver operating characteristic,ROC)曲线并计算曲线下面积(area under the curve,AUC),用于描述诊断测试工具或预测模型的识别准确性
[12]。使用R软件绘制决策曲线分析(decision curve analysis,DCA),通过量化不同阈值下的临床净获益评估模型临床适用性及模型间优劣差异;利用Python sklearn库绘制校准曲线,评估模型预测概率与实际事件发生概率的一致性(校准度),同时绘制精确率-召回率(precision-recall,PR)曲线并计算平均精确率(average precision,AP),该指标在样本分布不平衡场景下可有效补充传统评估方法的不足
[13-14];④模型训练、验证与泛化能力评估方面,使用5折交叉验证训练集,并用测试集进行评估。采用Python绘制学习曲线,用于评估训练集和验证集的模型拟合和稳定性
[15];⑤模型可解释性分析通过Python shap库实现,借助SHAP绘制摘要图和特征重要性图,量化各特征对预测结果的贡献度及正负向作用以明确核心预测因子,同时构建单个样本的SHAP依赖图与力导向图,直观展示特征对个体预测结果的贡献方向与强度,实现预测过程的个体化解释,为临床医生理解预测逻辑提供可视化支持。
1.4 统计学分析
采用SPSS25.0软件、R软件(3.6.1)和Python软件(3.4.3)进行统计学分析。符合正态分布的观察指标以x±s表示,组间比较采用独立样本t检验;不符合正态分布的检以中位数(四分位数间距)表示,组间比较采用Mann-Whitney U检验;分类变量以例数(百分比)表示,组间比较采用χ²检验。以P<0.05为差异有统计学意义。
2 结 果
2.1 基线分析
本研究按照标准共计纳入EC患者2 763例,HC 3 297名。采用随机数字表法按照5∶1比例将总体样本划分为训练集(
n=5 050)与测试集(
n=1 010)。EC患者和HC者在年龄、性别构成、吸烟史和饮酒史方面比较差异均无统计学意义(
P>0.05),提示具有可比性。训练集和测试集研究对象在上述基线特征及主要实验室指标分布方面比较差异亦无统计学意义(
P>0.05)。见
表1。
2.2 EC风险特征筛选
经数据清洗,在1 415项临床实验室数据中选取67个检测项目作为候选特征因子。使用RFE筛选特征得到共计47个因子,LASSO交叉验证方法共选择出27个因子。取二者重叠因子14个,LASSO回归分析在上述14个独立变量上进行,其中患EC作为因变量(
图1)。LASSO可以压缩变量系数以防止过拟合,并解决严重的共线性问题
[16],结果显示:67个独立变量最终减少到10个(最小距离的标准误差的
λ=0.023),癌 胚 抗 原(carcinoembryonic antigen,CEA)、尿 管 型 定 量(urinary cast quantity,UCQ)、红 细 胞 分 布 宽 度 标 准 差(red cell distribution width-standard deviation,RDW-SD)、血小板(platelet,PLT)计数、血小板分布宽度(platelet distribution width,PDW)、碱性磷酸酶(alkaline phosphatase,ALP)、尿酸(uric acid,UA)、肌酐(creatinine,Cr)、 丙氨酸氨基转移酶(alanine aminotransferase,ALT)和总蛋白(total protein,TP) 被确定为特征因子(
P<0.05)。见
图1和
表2。
2.3 分类多模型的综合分析
采用XGBoost、LR、LightGBM、RF、AdaBoost和DT这6种ML算法以训练模型,并且重复10次,结果显示:在训练集中,XGBoost、LightGBM、RF和DT表现优异,而在测试集中,LightGBM具有最佳的诊断效能(
表3)。因此,对上述模型进行DCA、校准曲线和PR曲线分析后,测试集DCA评估显示LightGBM模型具有出色的临床适用性(
图2A)。校准曲线显示LightGBM模型具有相对较高的预测准确性(
图2B)。在训练集中,XGBoost、RF和DT模型展现了最佳性能,AP值最高(
图2C)。而在测试集中,LightGBM模型则具有最高的AP值(
图2D)。综合分析表明:LightGBM可被认为是6个ML模型中的最佳模型。
2.4 最佳模型构建和评估
在训练集上进行了LightGBM分析和5折交叉验证,训练集平均分为5份,其中4份作为子训练集,1份作为子验证集。结果显示:子训练集的平均AUC为0.999(0.999~1.000),子验证集的平均AUC为0.952(0.941~0.964),测试集的AUC为0.946(0.932~0.960)。鉴于验证集AUC表现未超出测试集,或超出比例小于10%,可认为模型拟合成功,学习曲线表明训练集和验证集具有强拟合性和高稳定性。见
图3。
2.5 EC风险预测模型的SHAP解释
为直观阐释所选变量的作用机制,本研究采用SHAP方法展示其在模型中对EC风险的预测过程。
图4A呈现了模型中10个最重要的特征,每个特征的重要性曲线中,所有患者的SHAP归因结果以不同颜色的点呈现:红色点代表高风险值,蓝色点代表低风险值。x轴的SHAP值反映其对模型预测的重要性。CEA、RDW-SD和Cr等指标的SHAP值随指标数值增加而增大,提示其为EC风险的正向贡献因子;而TP和UA等指标则呈现负向贡献,即指标水平下降与EC风险升高相关。这种方向性分析与临床观察到的消耗性状态及炎症反应高度吻合。
图4B通过平均绝对SHAP值对这10个风险因素进行排名。此外,本研究以1例非EC患者为典型示例(其SHAP预测分数较低,为0.04),进一步阐释模型的可解释性(
图4C)。
3 讨 论
EC是全球最常见的恶性肿瘤之一,2022年我国新发EC 22.4万例,死亡18.8万例,分别占全部恶性肿瘤的4.64%和7.28%
[17]。尽管遗传易感性、生活方式和环境暴露等风险因素已得到广泛关注,但目前临床仍缺乏兼顾预测效能、检测可及性及临床实用性的EC风险预测模型。
本研究基于真实世界临床实验室常规检测数据,系统比较了多种ML模型在EC风险预测中的表 现,结 果 显 示:在 多 模 型 评 估 框 架 下,LightGBM模型在区分能力、校准度和临床净获益等方面均表现较为稳定,优于其余对照模型。
DT模型由于结构简单、对噪声敏感,在未进行严格剪枝或复杂度约束的情况下,易对训练数据产生过拟合。本研究中DT模型在训练集与测试集之间表现出显著性能差异,进一步印证了这一特性。因此,在模型选择过程中,本研究更加重视模型在独立测试集中的泛化能力,最终选择训练集和测试集性能均衡且稳定的LightGBM作为最优预测模型。
近年来,ML在医学领域的应用已从图像识别(如磁共振成像和内窥镜下肿瘤检出)及预后评估等方向逐步拓展,但多数研究依赖于影像学和遗传学等复杂检测技术,限制了其在基层医疗或资源有限地区的推广。本研究聚焦临床常规实验室检测数据(血常规、尿常规、生化指标及常见肿瘤标志物),核心优势体现在两方面:①常规实验室数据中蕴含的EC相关潜在关联模式,往往需多指标联合分析才能展现其临床意义,而ML算法可高效挖掘这种非线性、高维度的特征关联,这是传统统计方法难以实现的;②与影像学和基因组学检测比较,常规实验室检查具有获取便捷、成本低廉及普适性强的特点,尤其适用于欠发达地区或大规模人群筛查场景。本研究构建的风险预测模型并非旨在替代食管镜联合病理检查这一EC诊断“金标准”,而是作为初级保健或大规模筛查中的“风险分层工具”,通过识别高风险人群,引导其尽早接受进一步确诊检查,最终达到提升早期检出率、降低总体医疗负担的目标。
模型可解释性是ML方法在医学领域应用中的重要前提。为增强模型决策过程的透明度,本研究在模型构建的基础上引入SHAP方法,对关键特征在预测结果中的相对贡献进行了量化分析。该方法能够在不显著降低模型性能的前提下,直观呈现不同特征对预测结果的影响方向及重要程度,从而在一定程度上缓解ML模型“黑箱”特性所带来的理解障碍。
本研究筛选的核心指标具有一定的生物学合理性。既往研究已证实红细胞分布宽度(RDW)
[19]、血小板相关参数(PLT和PDW)
[20-21]及ALP水平
[22]与EC的发生发展或预后相关,本研究进一步将上述指标纳入风险预测模型,拓展了其在早期风险评估中的应用场景。此外,UA、Cr和TP等代谢与营养相关指标在模型中的重要性,提示全身代谢状态和营养状况可能在EC发生过程中发挥一定作用
[23-24]。部分此前报道较少的指标(如UCQ和ALT)在本研究中显示出一定预测价值,其潜在生物学机制仍有待在后续研究中进一步探讨。
本研究亦存在一定局限性。首先,研究样本来源于单中心人群,地域和人群特征相对集中,模型的泛化能力尚需在多中心、不同地区及不同人群的外部独立数据集中进一步验证。其次,本研究未对EC患者的病理类型和临床分期进行分层分析,不同亚型及疾病阶段的风险特征可能存在差异。再次,尽管采用了RFE与LASSO相结合的特征筛选策略,并通过交叉验证及独立测试集评估模型性能,但较为复杂的特征筛选流程在一定程度上仍可能高估模型性能表现,相关影响需在外部验证中进一步评估。针对上述局限性,未来研究可从两个方面推进:其一,结合Kaplan-Meier生存分析与预后分层,评估模型对患者长期生存的预测价值,明确其在预后评估与治疗决策中的应用潜力;其二,开展卫生经济学评价与临床转化研究,将模型整合至临床决策支持系统,通过临床试点验证其在实际医疗场景中的可用性与成本效益,最终推动其在基层医疗筛查和高风险人群管理中的广泛应用。
综上所述,本研究基于临床实验室常规检测数据构建并验证了EC的ML风险预测模型,在多模型比较与可解释性分析框架下,系统评估了模型性能及关键特征的相对贡献。本研究结果为基于常规检测数据开展EC风险建模提供了方法学参考,也为后续相关研究奠定了基础。
国家重点研发计划项目(2022YFC3602301)