机器学习预测急诊急性非静脉曲张性上消化道出血患者早期不良预后的价值

李昭凡 ,  田宇航 ,  何佳怡 ,  乔文丽 ,  郭立尊 ,  严宗俊 ,  王莉荔 ,  陈力

解放军医学院学报 ›› 2026, Vol. 47 ›› Issue (02) : 163 -173.

PDF (2293KB)
解放军医学院学报 ›› 2026, Vol. 47 ›› Issue (02) : 163 -173. DOI: 10.12435/j.issn.2095-5227.25070305
研究生论文精粹

机器学习预测急诊急性非静脉曲张性上消化道出血患者早期不良预后的价值

作者信息 +

Machine learning in predicting early adverse prognosis in emergency patients with acute nonvariceal upper gastrointestinal bleeding

Author information +
文章历史 +
PDF (2347K)

摘要

背景 急性非静脉曲张性上消化道出血(acute nonvariceal upper gastrointestinal bleeding,ANVUGIB)是急诊常见急危重症之一,起病急、进展快,评估早期不良预后并开展针对性治疗,对于改善其临床结局至关重要。然而,目前临床常用风险评分系统并不能准确识别出高风险患者。 目的 针对急诊ANVUGIB患者,构建一个综合性的严重不良预后评估系统,以涵盖早期再出血、死亡、外科手术或介入等多项结果预测,实现高风险患者的便捷、准确预测。 方法 选取2023年12月— 2025年5月解放军总医院第一医学中心急诊收治的471例ANVUGIB患者,以生命体征、化验结果、合并疾病及基础疾病等临床资料为预测变量;按预后[入院7 d内是否发生死亡、再出血、急诊外科或(和)介入干预、实施抢救及转入ICU]不同分为良好预后组(n=337)与不良预后组(n=134)。通过单因素、多因素logistic回归分析(“向前:条件”逐步分析法)并结合临床专家经验与共线性分析筛选关键变量,构建极限梯度提升(extreme gradient boosting,XGBoost)、随机森林(random forest,RF)、梯度提升机(gradient boosting machine,GBM)、逻辑回归(logistic regression,LR)、支持向量机(support vector machine,SVM)5种机器学习模型,并使用SHAP算法对最优机器学习模型进行解释,同时与内镜检查前Rockall评分(pre-endoscopic Rockall score,PRS)、格拉斯哥-布拉奇福德出血评分(Glasgow Brachford score,GBS)以及AIMS-65等临床常用风险评分系统进行比较分析(Delong检验)。 结果 471例患者中男性325例(69.1%),女性146例(30.9%),患者年龄中位数(四分位数)为66(57,74)岁,范围18 ~ 95岁。从49项备选变量中最终筛选10项关键变量用以构建5种机器学习模型,其中XGBoost性能表现最佳,受试者工作特征(receiver operating characteristic,ROC)曲线下面积(area under the curve,AUC)、准确率、精确度、召回率、F1值和Brier分数分别为0.904、0.842、0.804、0.834、0.818、0.122。SHAP分析显示,在XGBoost模型中发挥关键作用的前3项变量为格拉斯哥昏迷评分法、合并上消化道肿瘤、血尿素。与PRS、GBS以及AIMS-65等临床常用风险评分系统(AUC分别为0.823、0.791、0.631)比较,XGBoost模型预测能力显著优于PRS(P<0.001),并表现出优于GBS的趋势(校准前P=0.028,Bonferroni校正后P=0.165),与AIMS-65比较两者差异无统计学意义(P=0.322)。在准确率、精确度、召回率及F1分数等关键参数上,XGBoost模型也优于AIMS-65、GBS及PRS等临床常用风险评分系统。 结论 本研究表明,基于生命体征、化验结果、合并疾病及基础疾病等常用临床指标的XGBoost机器学习模型,可作为预测本中心急诊ANVUGIB患者早期多项不良预后的有效工具,有望在ANVUGIB患者治疗的关键窗口期为临床决策提供助力,从而提升急诊整体救治水平,并有效减少医疗资源消耗。

Abstract

Background Acute nonvariceal upper gastrointestinal bleeding (ANVUGIB) is a common critical condition in emergency medicine, characterized by rapid onset and progression. Early assessment of poor prognosis and targeted treatment are essential for improving clinical outcomes. However, current clinical risk scoring systems often fail to accurately identify high-risk patients. Objective To construct a comprehensive severe adverse outcome prediction system for emergency patients with ANVUGIB, covering predictions of early rebleeding, mortality, surgical or interventional treatment, and other outcomes, so as to enable convenient and accurate identification of high-risk patients. Methods A total of 471 patients with ANVUGIB admitted to the Emergency Department of the First Medical Center of PLA General Hospital from December 2023 to May 2025 were enrolled. Clinical data, including vital signs, laboratory results, comorbidities, and underlying diseases, were selected as predictive variables. Based on outcomes within 7 days of admission (including death, rebleeding, emergency surgery or intervention, resuscitation, and transfer to the ICU), patients were divided into good prognosis group (n=337) and poor prognosis group (n=134). Key variables were screened using univariate and multivariate logistic regression (forward: conditional), combined with clinical expert experience and collinearity analysis. Five machine learning models were constructed, including extreme gradient boosting (XGBoost), random forest (RF), gradient boosting machine (GBM), logistic regression (LR), and support vector machine (SVM). The SHAP algorithm was used to interpret the optimal model. Furthermore, the models were compared with three commonly used clinical risk scoring systems—Pre-endoscopic Rockall score (PRS), Glasgow Blatchford score (GBS), and AIMS65—using the DeLong test. Results Among the 471 patients, 325(69.1%) were male and 146(30.9%) were female. The median age was 66 (57, 74) years, ranging from 18 to 95 years. Ten key variables were selected from 49 candidates to construct five machine learning models. Among these, XGBoost showed the best performance. Its area under the receiver operating characteristic curve (AUC), accuracy, precision, recall, F1 score, and Brier score were 0.904, 0.842, 0.804, 0.834, 0.818, and 0.122, respectively. SHAP analysis indicated that the top three contributing variables in the XGBoost model were Glasgow Coma Scale, co-existing upper gastrointestinal tumors, and urea. Compared to commonly used clinical risk scoring systems such as PRS, GBS, and AIMS-65 (with AUCs of 0.823, 0.791, and 0.631, respectively), the XGBoost model demonstrated significantly superior predictive ability to PRS (P<0.001). It showed a trend of outperforming GBS (unadjusted P=0.028, Bonferroni adjusted P=0.165), while no significant difference was observed compared to AIMS-65 (P=0.322). Furthermore, regarding key parameters like accuracy, precision, recall, and F1-score, XGBoost outperformed these clinical scoring systems including AIMS-65, GBS, and PRS. Conclusion This study confirms that the XGBoost machine learning model, based on common clinical indicators such as vital signs, laboratory results, comorbidities, and underlying diseases, is an effective tool for predicting early multiple adverse outcomes in emergency ANVUGIB patients at our center. It is expected to provide strong support for clinical decision-making during the critical treatment window for ANVUGIB patients, thereby improving overall emergency care levels and effectively reducing medical resource consumption.

Graphical abstract

关键词

急性非静脉曲张性上消化道出血 / 机器学习 / 预测模型 / 不良预后

Key words

acute nonvariceal upper gastrointestinal bleeding / machine learning / predictive model / adverse prognosis

引用本文

引用格式 ▾
李昭凡,田宇航,何佳怡,乔文丽,郭立尊,严宗俊,王莉荔,陈力. 机器学习预测急诊急性非静脉曲张性上消化道出血患者早期不良预后的价值[J]. 解放军医学院学报, 2026, 47(02): 163-173 DOI:10.12435/j.issn.2095-5227.25070305

登录浏览全文

4963

注册一个新账户 忘记密码

急性上消化道出血(acute upper gastrointestinal bleeding,AUGIB)是急诊常见急危重症之一,起病急、进展快,发病率虽然不高(84 ~ 160例/10万),但病死率达到10%左右[1]。临床通常将其分为急性静脉曲张性上消化道出血(acute variceal upper gastrointestinal bleeding,AVUGIB)和急性非静脉曲张性上消化道出血(acute nonvariceal upper gastrointestinal bleeding,ANVUGIB),以后者更为常见,病因包含胃十二指肠消化性溃疡、上消化道肿瘤、应激性溃疡、急性和慢性上消化道黏膜炎症等,危险因素众多[2],病死率达6% ~ 12%,美国每年因该病住院费用超25亿美元[3]。亚太工作组推荐使用格拉斯哥-布拉奇福德评分(Glasgow Blatchford Score,GBS)预测ANVUGIB临床结局[4],并证实在内镜检查前Rockall(pre-endoscopic Rockall score,PRS)、AIMS65和GBS等内镜前评分与Rockall等内镜后评分的临床预估能力比较中,GBS对于预测临床干预需求(输血、内镜治疗或手术)和病死率表现最佳[5],然而其临床应用价值依然有限,这是因为包括GBS在内的所有风险评分量表并不能准确识别出高风险患者[6]。急诊始终处于处理急危重症的前沿,准确识别ANVUGIB高风险患者对于辅助临床决策、指导资源合理调配意义重大。因此,针对急诊ANVUGIB患者,探索构建一个综合性的严重不良预后评估系统,以涵盖早期再出血、死亡、外科手术或介入等多项结果预测,实现高风险患者的准确便捷预测,有望减少急诊伤残和死亡发生,具有良好的综合效益。
人工智能(artificial intelligence,AI)的出现改变了医疗实践,尤其是在精准诊断、个性化治疗策略和预后预测方面。其中,机器学习(machine learning,ML)技术以擅长处理高维度和大规模数据著称,可从复杂数据中提取关键信息,基于历史数据预测未来风险趋势,在医疗领域展现出良好的应用价值[7]。Seo等[8]致力于识别急诊室稳定性非静脉曲张性上消化道出血高风险患者,基于机器学习算法,建立了住院死亡率、24 h内发生低血压与7 d内再出血的预测模型,曲线下面积(area under the curve,AUC)分别为0.911、0.766、0.729,优于Rockall、GBS等临床评分系统的表现。但其对于低血压、再出血风险的区分能力仍不高,且在强调时效救治的急救环境下,不利于ANVUGIB患者整体风险的快速识别。因此,本研究拟使用生命体征、化验结果、合并疾病及基础疾病等常用临床指标构建机器学习模型,预测ANVUGIB患者入院7 d内发生死亡、再出血、急诊外科或(和)介入干预、实施抢救及转入ICU等复合不良预后的发生风险,以更好地辅助急诊医师在ANVUGIB患者入院后关键治疗期内的医疗决策,从而提升整体救治率,减少医疗消耗。

1 对象与方法

1.1 研究对象

选取解放军总医院第一医学中心急诊抢救间2023年12月 — 2025年5月收治的471例ANVUGIB患者为研究对象。纳入标准:(1)年龄≥18岁;(2)根据《急性非静脉曲张性上消化道出血诊治指南》[9],符合呕血和黑便症状,伴或不伴头晕、心悸、面色苍白、心率增快、血压降低等周围循环衰竭征象,以及内镜检查证实无食管、胃底静脉曲张并在上消化道发现出血病灶。排除标准:(1)临床关键资料不全,无法进行临床常用风险评分系统评分;(2)合并血液系统疾病;(3)合并其他类型休克。本研究已经解放军总医院医学伦理委员会审批(伦审第S2025-264-01号),并豁免知情同意/书面知情同意。

1.2 样本量

根据既往文献报道,使用10倍EPV(events per variable)原则估计发生事件数,即每纳入一个预测变量,至少应在发生事件组有10例样本[10]。本研究计划最多包含10个预测变量,故最终收录数据中应至少包含100例事件发生数。

1.3 研究方法

1.3.1 数据来源

通过门急诊系统、住院系统查阅以及电话随访等方式获取。(1)收录患者基本信息及进入急诊抢救间第1天的生命体征、化验结果并计算风险评分系统得分,患者生命体征与血液指标采集时间点相差不超过30 min。主要包括:性别、年龄、格拉斯哥昏迷评分法(Glasgow coma scale,GCS)、体温、心率、呼吸频率、收缩压、舒张压、pH值、氧分压、二氧化碳分压、碱剩余、乳酸、丙氨酸氨基转移酶、天冬氨酸氨基转移酶、血清白蛋白、总胆红素、血糖、尿素、肌酐、钙、钾、钠、中性粒细胞计数、白细胞计数、血红蛋白、血小板计数、红细胞比积、C-反应蛋白、血浆活化部分凝血活酶时间、血浆凝血酶原时间、国际标准化比值、血浆纤维蛋白原、血浆D-二聚体。pH值、氧分压、二氧化碳分压、碱剩余、乳酸等结果来自动脉血,其他化验结果均来自静脉血。同时计算休克指数(shock index,SI)、年龄休克指数(age shock index,Age-SI)、改良休克指数(modified shock index,MSI)及内镜检查前Rockall评分(pre-endoscopic Rockall score,PRS)、GBS、AIMS-65等评分。SI=心率/收缩压,Age-SI=年龄×休克指数,MSI=心率/平均动脉压,平均动脉压=(收缩压+2×舒张压)/3。(2)收录主要症状包括呕血、晕厥以及合并疾病及基础疾病(包括休克、肝脏疾病、肝衰竭、肾衰竭、心力衰竭、呼吸衰竭、糖尿病、高血压、冠心病、消化系统肿瘤)。

1.3.2 结局指标

参考急性创伤性脑损伤等急危重症领域相关研究[11],同时结合ANVUGIB病情特点,即发病7 d内为活动期,此阶段出血活跃、再出血风险高、病情进展迅速,易并发休克、多器官衰竭等严重并发症,是临床干预的关键窗口期。因此,本研究将“早期”定义为ANVUGIB患者进入急诊抢救室后的7 d内。不良预后定义为该期限内发生死亡、再出血、实施抢救、急诊外科或介入干预,以及转入ICU;未发生上述情况则记为良好预后。对于住院不足7 d即出院的患者,通过电话随访确认结局,若7 d内未发生不良预后,则判定为良好预后。各项具体定义如下:死亡定义为全因死亡。再出血定义为内镜明确无活动性出血或血流动力学稳定48 ~ 72 h后出现以下一种或一种以上的情况[12]:(1)黑便性状改变、次数增加或出现呕血;(2)胃管内回抽出鲜红色血液;(3)血红蛋白、红细胞计数呈进行性下降;(4)经内镜检查证实存在再出血。实施抢救定义为接受气管插管/切开、心肺复苏、电除颤。

1.3.3 数据处理

将原始数据去除任何识别细节(包含姓名、ID号、电话等)并采取限制访问权限、签署保密协议等措施以确保数据安全。数据处理首先对分类变量进行编码,以0代表女、1代表男,合并疾病及基础疾病以0代表无、1代表有;其次为避免因填充过多引入大量噪声,手动去除缺失值超过20%的参数[13],使用均值填充数值型列缺失值,使用众数填充分类型列缺失值,最后得到最终的数据集。471例中,共有92例C-反应蛋白结果缺失,占比19.53%,5例氧分压结果缺失,4例pH值、二氧化碳分压、国际标准化比值、血浆纤维蛋白原、血浆D-二聚体结果缺失,3例中性粒细胞、血浆活化部分凝血活酶时间、血浆凝血酶原时间结果缺失,2例碱剩余、乳酸结果缺失,1例呼吸频率、尿素、钾、钠、白细胞计数结果缺失,均使用均值填充缺失值。

1.3.4 变量筛选

本研究共纳入患者基础信息、生命体征、化验指标、主要症状、合并疾病及基础疾病、简易风险评分等49项临床变量进行筛选。筛选过程分为3步:第一步,单因素分析:筛选与因变量相关的变量,保留P<0.1的变量作为候选自变量[14]。第二步,多因素logistic回归分析:使用SPSS采用“向前:条件”逐步分析法构建模型,以P<0.05为纳入标准、P>0.10为排除标准,逐步引入能使模型拟合度改善最大的变量。第三步,专家审核与共线性诊断:首先,由2名急诊工作年限≥8年的高年资医师结合专业知识,剔除统计结果中缺乏临床理论支持或不符合医学常识的变量;其次,对剩余变量进行共线性诊断,排除容差<0.1或方差膨胀因子>5的变量,最终确定纳入模型构建的关键特征。

1.3.5 预测模型的构建与评价

基于筛选后的临床关键变量,在全部数据集上,以8∶2的比例划分训练集与测试集,构建并优化5种机器学习预测模型:极限梯度提升(extreme gradient boosting)、随机森林(random forest,RF)、梯度提升机(gradient boosting machine,GBM)、逻辑回归(logistic regression,LR)及支持向量机(support vector machine,SVM)。利用完整训练集训练5种机器学习模型,在训练集内部利用Bootstrap自抽样法,将抽样的数据作为验证数据,其余数据用于训练模型,重复100次进行训练集内部验证,随后在测试集上进行评估。通过计算受试者工作特征(receiver operating characteristic,ROC)曲线下面积、准确率、精确度、召回率、F1分数以及Brier评分,并结合校准曲线和决策曲线分析,从区分度、校准度及临床实用性3个维度综合评估模型性能。召回率越高代表漏诊率越低,F1值是精确率和召回率的调和平均数,综合衡量模型的“准确识别正例”与“不漏诊”的平衡能力,Brier分数衡量预测概率与真实标签的偏差,校准曲线用于可视化评估模型预测概率的可靠性,决策曲线则用来反映评估模型在临床决策中的净收益。以表示模型区分能力的AUC筛选最优预测模型,并使用SHAP[15]对其进行可解释性分析,SHAP值有助于观察每个变量在模型中的贡献价值,使模型决策过程更加透明化。最后,针对PRS、GBS以及AIMS-65三种评分系统,基于训练集确定最佳划分阈值,在测试集上评估其性能,并与最优机器学习模型比较,同时进行Delong检验。

1.4 统计学分析

采用SPSS 27.0进行数据处理。呈正态分布的计量资料用x¯±s表示,两组间比较采用独立样本t检验,呈偏态分布的计量资料用中位数(四分位数)[M(P25P75)]表示,两组间比较采用Mann-Whitney U检验;计数资料用百分率(%)表示,组间比较采用χ2检验,期望频数<5时采用Fisher确切概率法。AUC比较采用Python进行Delong检验。以P<0.05为差异有统计学意义。

2 结 果

2.1 数据基线特征

本研究共纳入471例患者,其中男性325例(69.1%),女性146例(30.9%)。患者年龄中位数(四分位数)为66(57,74)岁,范围18 ~ 95岁。依据研究结局指标,将患者分为良好预后组(337例,71.55%)与不良预后组(134例,28.45%)。良好预后组与不良预后组的男性占比分别为71.5%和62.7%。组间比较显示,良好预后组与不良预后组在性别、体温、收缩压、丙氨酸氨基转移酶、钾、钠、合并肝脏疾病、罹患糖尿病等18项临床变量上无统计学差异(P>0.05),而在年龄、心率、乳酸、血清白蛋白、尿素、血红蛋白以及合并肾衰竭、消化系统肿瘤等31项特征上存在统计学差异(P<0.05)。此外,不良预后组的PRS、GBS以及AIMS-65评分均显著高于良好预后组(表1)。

2.2 变量筛选结果

对49项备选临床变量进行单因素分析,共筛选31项(P<0.1)进入多因素logistic回归分析,“向前:条件”逐步分析法筛选关键变量10项,见表2。随后由2名急诊领域高年资医师结合临床经验与数据基线特征对10项变量进行审核,确认其均有相关医学研究支持。后经共线性分析检验,各床变量的容忍度(Tolerance)均>0.1、方差膨胀因子(VIF)均<10,提示无严重多重共线性问题。最终确定GCS、乳酸、尿素、钙、中性粒细胞、血红蛋白、血小板计数、Age-SI、合并肾衰竭与合并上消化道肿瘤共计10项临床变量作为模型的输入。

2.3 预测模型的构建与比较

将471例数据用于XGBoost、RF、GBM、LR及SVM模型构建,针对每一种模型,利用网格搜索方法进行超参数调优,性能较好的前3个分类器各参数最优取值具体是,XGBoost分类器决策树数量1 000,树最大深度2,学习率0.01,子采样比例0.9,列采样比例0.9,正则化参数0.1。RF分类器决策树数量1 000,树最大深度7,节点最小分裂样本数2,叶节点最小样本数为4。GBM分类器决策树数量1 000,树最大深度2,学习率0.01,子采样比例0.8。使用多项评价指标对5种机器学习模型进行评估,各项指标计算方式采用正类与负类宏观平均方式进行计算。在训练集内,利用Bootstrap自抽样法,将抽样的数据作为验证数据,其余数据用于训练模型,重复100次后,每次采样的模型性能表现平均值,见表3。其中,XGBoost、RF、GBM模型的性能表现较好,以RF表现最优,各模型性能的稳定性均良好。

在测试集评估中,XGBoost模型展现出卓越的综合性能,其AUC(0.904)、准确率(0.842)、精确度(0.804)、召回率(0.834)及F1分数(0.818)均优于其他对比模型。尽管RF模型的Brier分数最低(0.118),表明其预测概率与真实结局的偏差最小,但XGBoost的Brier分数(0.122)亦保持在较低水平。各模型预测ANVUGIB患者早期不良预后的详细性能指标见表4

AUC为主要评价指标,受试者工作特征曲线图(图1A)显示XGBoost模型表现最优,具有最佳的判别能力。校准曲线结果(图1B)表明,XGBoost模型的预测概率与实际不良结局发生率具有良好一致性,相对接近完美校准线,提示该模型可为临床早期干预提供依据。同时,决策曲线分析(图1C)显示,XGBoost模型在阈概率0.2 ~ 0.8的较宽区间内拥有较高的净获益,表明其具有良好的临床实用价值。因此,XGBoost模型可作为预测ANVUGIB患者早期不良预后的首选工具。

利用SHAP汇总图进行全局分析,对性能最优的XGBoost模型做出解释,见图2。XGBoost模型中按SHAP绝对值大小,从上到下依次排序,发挥贡献较小的是血红蛋白与合并肾衰竭,发挥贡献较大的是GCS、合并上消化道肿瘤、尿素,随着值的增大,合并上消化道肿瘤与尿素发挥正向贡献,GCS发挥负向贡献,即GCS评分越低、尿素值越高以及合并上消化道肿瘤,该样本倾向于不良预后的可能性大。

利用SHAP值对测试集样本进行个体层面解析。如图3A所示,在XGBoost模型的第1个样本中,GCS发挥主要正向促进作用(SHAP=2.08),而合并上消化道肿瘤表现为负向影响(SHAP=-0.41)。该样本的SHAP总值为2.846,显著高于基值(-0.088),提示该患者具有较高的不良预后风险。相比之下,图3B展示的GBM模型第4个样本,其SHAP总值为-2.115,远低于基值,表明该患者发生不良预后的倾向较低。

2.4 XGBoost模型与临床常用评分系统的比较

本研究基于训练集确定的最佳阈值(AIMS-65为2,GBS为10,PRS为4)在测试集上进行验证。结果显示,在临床常用评分系统中,AIMS-65预测ANVUGIB患者早期不良预后的综合性能最佳,其AUC为0.823,准确率、精确度、召回率和F1分数分别为0.705、0.679、0.716和0.679。值得注意的是,在临床评分亚组中,GBS的精确度(0.707)、召回率(0.750)及F1分数(0.750)均优于AIMS-65和PRS。进一步采用Delong检验,通过比较各模型预测概率与实际标签的AUC差异(表6),结果表明,XGBoost模型的预测能力显著优于PRS(P<0.001);与GBS比较,XGBoost模型AUC更高,表现出优于GBS的趋势,但Bonferroni校正后差异无统计学意义(P=0.165);与AIMS-65比较,两者差异无统计学意义(P=0.322)。综上,XGBoost模型以AUC(0.904)位居第一,且在准确率、精确度、召回率及F1分数上均优于3种临床常用风险评分系统,显示出较大的临床应用潜力。未来仍需更多大样本来进一步验证XGBoost模型的优越性。

3 讨论

针对目前临床常用风险评分系统不能准确识别出急诊ANVUGIB高风险患者的问题,本研究筛选基础信息、生命体征、化验指标、主要症状、合并疾病及基础疾病、简易风险评分等多维临床变量,构建了基于XGBoost、RF、GBM、LR及SVM的急诊ANVUGIB患者早期(7 d内)不良预后预测模型,结果显示,XGBoost模型表现最佳,其AUC、准确率、精确度、召回率、F1分数和Brier分值分别为0.904,0.842,0.804,0.834,0.818,0.122。与AIMS-65、GBS、PRS(AUC分别为0.823、0.791、0.631)比较,XGBoost模型预测能力显著优于PRS,并表现出优于GBS的趋势,同时在准确率、精确度、召回率及F1分数等关键指标上具有明显优势,该模型实现了对早期死亡、再出血、实施抢救、急诊外科或(和)介入干预,以及转入ICU等复合结局的有效预测,同时具有良好的准确性与临床应用潜力,能够为急诊ANVUGIB患者早期风险筛查及入院后关键治疗决策提供支持。

近年来,机器学习备受学者青睐,在消化道出血患者的预后预测方面,Tsai等[16]基于国际标准化比值、肾功能、红细胞分布宽度等指标构建XGBoost模型,以预测肝硬化患者中罹患上消化道出血的急诊科患者死亡率,AUC达0.861,有助于实施早期干预以降低病死率。Shung等[17]开发的预测AUGIB患者30 d内达到输血或止血干预或死亡的复合终点的机器学习模型,AUC达0.90,实现了多项不良结局的综合预测,展示了机器学习在建立临床预测模型中的巨大优势。针对ANVUGIB,冯等[18]利用尿素/肌酐比值早期动态升高预测ANVUGIB患者主要临床结局事件(包含全因死亡、再出血、急诊外科手术干预、急诊介入手术干预),AUC为0.806(95% CI:0.737 ~ 0.864),证实其对ANVUGIB患者临床结局具有较高的预测价值,有效辅助是否给予更积极的液体复苏等临床决策。与我们“识别高风险患者”的研究理念相似的是,Seo等[8]针对急诊室稳定性非静脉曲张性上消化道出血患者,构建了基于机器学习模型,分别预测了住院死亡率、24 h内发生低血压与7 d内再出血风险。在此基础上,本研究将适用人群扩大,并为了突出急诊环境下的使用便捷性,将ANVUGIB患者入院后7 d内发生死亡、再出血、实施抢救、急诊外科或(和)介入干预,以及转入ICU等多种客观的复合结局指标定义为不良预后,构建了基于XGBoost的早期不良预后预测模型,AUC达0.904(95% CI:0.842 ~ 0.961),展现出了良好的性能表现,对于辅助指导其关键治疗期内临床决策意义更大。

在变量筛选环节,本研究使用逐步回归法进行变量筛选,虽然自动化程度高、可解释性强,但可能因为依赖P值阈值而错过某些重要的变量组合,或产生对特定数据集过拟合的模型,需结合专业知识综合判断,因此本研究增加了2名急诊领域高年资医师审核的环节。由专业背景人员结合既往研究与专家共识审查关键变量并做出增减,是对利用单因素、多因素分析筛选变量一个重要的补充,可有效保证模型的可靠性,避免单纯依靠数据驱动构建模型而忽略模型实际的医学意义。

众所周知,机器学习的“黑箱”性质是人工智能用于临床疾病风险预测最大的挑战,缺乏透明度会降低信任并限制其在临床中的应用,医师需要严格的临床验证和透明度措施来加强模型的可解释性[19]。通过对XGBoost模型进行SHAP分析发现,GCS对于预测ANVUGIB早期不良预后发挥的贡献最大,这与临床上医护人员经常依据患者意识状态判断病情严重程度的经验一致,同时,关于业内公认的预后评估金标准APACHE的相关研究表明GCS是其最强大的预测成分,也肯定了GCS的重要性[20]。重要性排第二的是合并上消化道肿瘤,上消化道肿瘤是ANVUGIB的主要病因[21],肿瘤破溃或侵袭血管可直接引发出血。此类患者常伴有恶病质及全身营养状况不佳,不利于病情恢复;加之肿瘤位于上消化道,直接影响进食与消化吸收,从而加剧营养不良。临床上常用血清白蛋白评估营养状况,它是一种急性期负性蛋白,在与物质结合和运输、免疫调节、维持血浆胶体渗透压、减轻炎症损伤,以及保护血管内皮细胞方面发挥着关键作用[22-23]。低白蛋白血症除了可能影响上述功能外,还可能损害血管内皮细胞功能并增加毛细血管通透性,进一步增加消化道出血的风险[24]。此外,肿瘤患者常并发凝血系统紊乱,且抗肿瘤综合治疗可能导致肝肾功能损害及骨髓抑制,这些因素共同作用增加了患者死亡等不良预后的风险。重要性排第三的是尿素,这与既往多项研究结果吻合[25-27]。消化道出血进入肠道引起的肠源性氮质血症、大量失血引发的肾前性氮质血症均导致尿素升高,值越大,表示出血越多,越可能发生不良预后;BUN的贡献高于HB的贡献,其可能原因为BUN水平通常会在出血几小时后升高,且峰值会在1 ~ 2 d出现,3 ~ 4 d回归正常[6]。而出血早期,血细胞比容、血红蛋白水平由于受到血液浓缩的影响,可以无显著变化,通常在1 ~ 3 d后方可真实体现出血的程度[28]。Age-SI对于ANVUGIB不良预后预测的价值已经得到证实[29]。而关于血小板计数,Jin等[30]在建立老年患者AUGIRB预测模型时,同样强调了该指标的重要临床价值。血小板计数是评估机体止血与凝血功能的关键参数[31]。通常情况下,血小板计数降低意味着机体止血与凝血能力减弱,进而增加出血风险。结合ANVUGIB的病理生理机制分析,消化道出血发生后,机体虽启动凝血保护机制,但伴随血小板的过度消耗及大量补液导致的稀释性减少,易继发性凝血功能障碍,从而进一步加剧出血风险,甚至发生不良预后。上述病理过程往往表现为血小板计数的进行性下降,这一现象与SHAP分析揭示的“数值越低,不良风险倾向越显著”的结论相吻合。其他预测指标,如乳酸、中性粒细胞、血红蛋白、合并肾衰竭等在良好预后与不良预后两组在上存在显著统计学差异且符合医师经验与知识,这些对ANVUGIB患者不良预后预测具有贡献价值的指标以量化的形式明确,对于临床工作具有重要意义,医师可通过观察最为重要的变量来粗略评估患者病情严重程度及给予的关注度。SHAP揭示了模型的决策过程,并为评估ANVUGIB患者早期不良预后风险提供了透明且可靠的依据,极大增强了临床医师和患者对模型的信任。

本研究表明,基于本中心数据,XGBoost模型在预测ANVUGIB患者早期不良预后方面,预测能力显著优于PRS,并表现出优于GBS的趋势,同时在准确率、精确度、召回率及F1分数等关键参数上,优于AIMS-65、GBS及PRS等临床常用风险评分系统。这提示,纳入更多与预后显著相关的特征变量有助于提升模型的预测效能。然而,需注意的是,血液化验等指标获取耗时长,导致模型在实际应用中可能存在时效性不足的局限,这是未来推广应用中亟待解决的关键问题。急危重症患者的预后预测在突出准确性与便捷性的同时,理应强调时效性,“又快又准”的预测对于辅助指导临床决策意义更大。Mannino等[32]利用智能手机获取甲床图像构建预测模型识别贫血(血红蛋白水平<12.5 g/dL),其测量误差范围为±2.4 g/dL,汗液传感器[33]直接层压到皮肤表面即可实时监测氯离子、钠离子和乳酸等化学成分,这些技术的创新均为挖掘迅速可及的临床变量,以构建“又快又准”的重症预测模型提供了支撑。

本研究还存在一定的局限性:首先,这是一项单中心研究,对外推结论支持性弱,样本量较少,应用于临床还需进一步验证优化;其次,本研究是一项回顾性研究,如长期抗凝药使用史、是否存在消化性溃疡等信息未有准确完备收录,其对预后的影响暂未考虑进去[34]。下一步将持续扩充数据量并提升数据完整性,进行多中心试验以验证模型性能,通过病因分层、年龄分层等方式开展更进一步的研究分析。

急诊工作中,便捷准确识别ANVUGIB患者不良预后风险并及时干预,是挽救患者生命、避免恶性事件发生的关键。本研究证实,基于生命体征、化验结果、合并疾病及基础疾病等常用临床指标的XGBoost机器学习模型,可作为预测本中心急诊ANVUGIB患者早期多项不良预后的有效工具,有望在ANVUGIB患者治疗的关键窗口期为临床决策提供助力。

数据共享声明 本论文相关数据可依据合理理由从作者处获取,Email:13018201232@163.com。

参考文献

[1]

Raţiu ILupuşoru RPopescu Aet al. Acute gastrointestinal bleeding:A comparison between variceal and nonvariceal gastrointestinal bleeding[J]. Medicine2022101(45):e31543.

[2]

Wang XYang MLXu JHet al. Risk analysis of 30-day rebleeding in acute non-variceal upper gastrointestinal bleeding[J]. Arab J Gastroenterol202324(2):136-141.

[3]

Zhao XXWei SXPan YJet al. Early prognosis prediction for non-variceal upper gastrointestinal bleeding in the intensive care unit: based on interpretable machine learning[J]. Eur J Med Res202429(1):442.

[4]

Sung JJChiu PWChan FKLet al. Asia-Pacific working group consensus on non-variceal upper gastrointestinal bleeding: an update 2018[J]. Gut201867(10):1757-1768.

[5]

Stanley AJLaine LDalton HRet al. Comparison of risk scoring systems for patients presenting with upper gastrointestinal bleeding: international multicentre prospective study[J]. BMJ2017356:i6432.

[6]

中国医师协会急诊医师分会,中华医学会急诊医学分会,全军急救医学专业委员会,. 急性上消化道出血急诊诊治流程专家共识(2020版)[J]. 中华急诊医学杂志202130(1):15-24.

[7]

Cai YQGong DXTang LYet al. Pitfalls in developing machine learning models for predicting cardiovascular diseases: challenge and solutions[J]. J Med Internet Res202426:e47645.

[8]

Seo DWYi HPark Bet al. Prediction of adverse events in stable non-variceal gastrointestinal bleeding using machine learning[J]. J Clin Med20209(8):2603.

[9]

《中华内科杂志》编辑部,《中华医学杂志》编辑部,《中华消化杂志》编辑部,. 急性非静脉曲张性上消化道出血诊治指南(2018年,杭州)[J]. 中华消化杂志201939(2):80-87.

[10]

廖姣姣,陶立元,许璐,. 二分类或生存结局时预测模型建立研究的样本量计算[J]. 中华儿科杂志202361(9):804.

[11]

Nik ASheikh Andalibi MSEhsaei MRet al. The efficacy of Glasgow Coma Scale (GCS) score and acute physiology and chronic health evaluation (APACHE) II for predicting hospital mortality of ICU patients with acute traumatic brain injury[J]. Bull Emerg Trauma20186(2):141-145.

[12]

Gralnek IMCamus Duboc MGarcia-Pagan JCet al. Endoscopic diagnosis and management of esophagogastric variceal hemorrhage: European Society of Gastrointestinal Endoscopy (ESGE) Guideline[J]. Endoscopy202254(11):1094-1120.

[13]

Ustaalioğlu İAk R. Predicting mortality in non-variceal upper gastrointestinal bleeding: machine learning models versus conventional clinical risk scores[J]. J Clin Med202514(20):7425.

[14]

Qin XJYang WZhou XPet al. A machine learning model for predicting the HER2 positive expression of breast cancer based on clinicopathological and imaging features[J]. Acad Radiol202532(7):3841-3857.

[15]

Chopra VKAnker SD. Anaemia,iron deficiency and heart failure in 2020: facts and numbers[J]. ESC Heart Fail20207(5):2007-2011.

[16]

Tsai SCLin CHChu CJet al. Machine learning models for predicting mortality in patients with cirrhosis and acute upper gastrointestinal bleeding at an emergency department: a retrospective cohort study[J]. Diagnostics202414(17):1919.

[17]

Shung DLAu BTaylor RAet al. Validation of a machine learning model that outperforms clinical risk scoring systems for upper gastrointestinal bleeding[J]. Gastroenterology2020158(1):160-167.

[18]

冯佳兴,林澜,许鸿志,. 血尿素氮/肌酐比值判断消化道出血部位及急性非静脉曲张性上消化道出血患者预后的价值[J]. 四川大学学报(医学版)202253(3):391-397.

[19]

Wang LChen XYZhang Let al. Artificial intelligence in clinical decision support systems for oncology[J]. Int J Med Sci202320(1):79-86.

[20]

Bastos PGSun XWagner DPet al. Glasgow Coma Scale score in the evaluation of outcome in the intensive care unit: findings from the Acute Physiology and Chronic Health Evaluation III study[J]. Crit Care Med199321(10):1459-1465.

[21]

Cañamares-Orbís PChan FKL. Endoscopic management of nonvariceal upper gastrointestinal bleeding[J]. Best Pract Res Clin Gastroenterol201942/43:101608.

[22]

Luo XXLiu DYLi CCet al. The predictive value of the serum creatinine-to-albumin ratio (sCAR) and lactate dehydrogenase-to-albumin ratio (LAR) in sepsis-related persistent severe acute kidney injury[J]. Eur J Med Res202530(1):25.

[23]

Pompili EZaccherini GBaldassarre Met al. Albumin administration in internal medicine: A journey between effectiveness and futility[J]. Eur J Intern Med2023117:28-37.

[24]

Wang GQDing TRAi LZ. Editorial: Effects and mechanisms of probiotics,prebiotics,synbiotics and postbiotics on intestinal health and disease[J]. Front Cell Infect Microbiol202414:1430312.

[25]

Simadibrata DMKoo THMurlidhar Met al. Blood urea nitrogen-to-creatinine ratio to differentiate upper from lower gastrointestinal bleeding: a systematic review and meta-analysis[J]. J Gastroenterol Hepatol202641(2):477-487.

[26]

Kumar NLClaggett BLCohen AJet al. Association between an increase in blood urea nitrogen at 24 hours and worse outcomes in acute nonvariceal upper GI bleeding[J]. Gastrointest Endosc201786(6):1022-1027.

[27]

Wu BUJohannes RSSun XWet al. Early changes in blood urea nitrogen predict mortality in acute pancreatitis[J]. Gastroenterology2009137(1):129-135.

[28]

刘畅,刘亚军.急性非静脉曲张性上消化道出血中西医结合诊治共识(2019年)[J].中国中西医结合杂志201939(11):1296-1302.

[29]

Wu PHHung SKKo CAet al. Performance of six clinical physiological scoring systems in predicting in-hospital mortality in elderly and very elderly patients with acute upper gastrointestinal bleeding in emergency department[J]. Medicina202359(3):556.

[30]

Jin SSZhang YHuang QPet al. Establishment of a risk prediction model for acute upper gastrointestinal rebleeding in elderly patients[J]. Zhonghua Wei Zhong Bing Ji Jiu Yi Xue202234(2):167-171.

[31]

Belur ADZheng SNRaza Met al. Thrombosis,hemostasis,and cardiovascular outcomes[M]//Cardiovascular Outcomes Research. Cham:Springer International Publishing,2024:261-301.

[32]

Mannino RGMyers DRTyburski EAet al. Smartphone app for non-invasive detection of Anemia using only patient-sourced photos[J]. Nat Commun20189(1):4924.

[33]

Tabasum HGill NMishra Ret al. Wearable microfluidic-based e-skin sweat sensors[J]. RSC Adv202212(14):8691-8707.

[34]

陈洪波,王嫄嫄,李静,. 不同抗栓药物并发非静脉曲张性上消化道出血的临床特征及病因分析[J]. 实用临床医药杂志202327(3):81-85.

AI Summary AI Mindmap
PDF (2293KB)

111

访问

0

被引

详细

导航
相关文章

AI思维导图

/