急性胰腺炎是一种常见的消化系统急症,尽管大部分患者表现为轻度病程并能够自愈,但约20%的患者会发展为重症急性胰腺炎,进而导致器官衰竭,最终可能危及生命
[1]。呼吸衰竭作为常见的并发症之一,往往需要在患者入ICU后实施有创机械通气治疗
[2]。急性胰腺炎导致的呼吸衰竭,其发生机制十分复杂。首先,胰腺损伤会引起大量炎症介质的释放,包括细胞因子和损伤相关分子模式(DAMPs),进而诱发全身性炎症反应
[1, 3]。这种系统性炎症反应通过增加肺血管通透性,引发非心源性肺水肿,最终导致急性呼吸窘迫综合征(ARDS)
[4]。然而,延迟启动有创机械通气可能导致低氧血症及血流动力学崩溃,而过早进行插管又可能增加患者面临的通气相关肺损伤、呼吸机相关性肺炎及镇静药物的副作用
[5, 6]。因此,准确评估患者的呼吸衰竭风险并及时采取干预措施,对于改善患者预后至关重要。
目前,针对急性胰腺炎的传统预后评估工具,如Ranson标准、Glasgow-Imrie评分、APACHE II以及BISAP
[7],主要用于评估疾病的严重程度或死亡风险,而非预测患者是否需要启动有创机械通气。这些工具往往无法充分反映各器官功能衰竭之间的复杂相互作用,尤其是在多脏器衰竭进展的情况下。因此,亟需开发一种能够集成高维临床数据的智能工具,用于早期识别高风险患者并辅助临床决策。近年来,机器学习方法因其能够捕捉高维数据中复杂的非线性关系,已广泛应用于重症患者的临床预后预测
[8]。与传统方法相比,机器学习方法在预测重症患者不良结局方面有更为优越的表现
[9, 10]。然而,机器学习模型在临床应用中的推广受到其可解释性不足的限制
[11, 12],特别是在医疗领域,临床医生对于“黑箱”模型的接受度较低。
1 资料和方法
1.1 数据来源
本研究采用回顾性队列研究设计,数据来源于MIMIC-IV数据库(版本3.1)及eICU协作研究数据库(eICU-CRD)。MIMIC-IV数据库(版本3.1)包含2008~2022年重症监护病房(ICU)患者的去标识化临床数据,包括患者的基本信息、生命体征、实验室检查结果、治疗方案以及ICU结局等
[13]。eICU-CRD纳入了2014~2015年美国208家医院的患者数据。数据库的使用已获得麻省理工学院伦理委员会批准(伦理批号:36220489),并免除患者知情同意要求。
1.2 研究对象
本研究纳入急性胰腺炎成年患者,通过ICD-9和ICD-10编码确诊。纳入标准:年龄≥18岁;ICU入院时未接受有创机械通气,且ICU住院时间至少为72 h。排除标准:入院时已经使用机械通气;妊娠患者及临床资料不完整的患者。
1.3 主要结局指标
本研究的主要结局为:患者在ICU入院后72 h内是否启动有创机械通气。根据MIMIC-IV数据库及eICU-CRD中记录的呼吸机设置和气管插管信息,确定患者是否启动了有创机械通气。
1.4 临床资料收集
收集患者的基本人口学特征(如年龄、性别),入ICU时的生理参数(如心率、血压、氧合指数等),实验室检查结果(如白细胞计数、肝肾功能指标、血气分析结果),以及相关器官功能衰竭评分(如SAPS II、APACHE III、SOFA等)。同时,记录患者的合并症、治疗措施(如血管活性药物使用、连续肾脏替代治疗等)以及ICU结局(如死亡、机械通气时间、ICU住院时间等)。
1.5 数据预处理
首先,筛选出临床变量中缺失数据超过50%的变量予以剔除。对于剩余的缺失数据,采用随机森林法进行插补。插补后,对连续变量之间的相关性进行分析,去除绝对相关系数大于0.7的变量,以避免多重共线性。最终保留64个临床变量用于后续分析。
1.6 机器学习模型的开发与验证
MIMIC-IV数据库队列被随机分为训练集(70%)和测试集(30%)。在训练集上,首先采用LASSO回归进行特征选择,从64个候选变量中筛选出具有重要预测价值的变量。然后,使用包括决策树、随机森林、XGBoost、LightGBM、支持向量机(SVM)和逻辑回归在内的多种机器学习模型进行训练。模型的性能通过受试者工作特征曲线(ROC)下面积(AUC)进行评估,并采用决策曲线分析(DCA)来进一步评价模型在临床实践中的净临床收益。根据AUC-ROC及DCA选择出最优模型。采用eICU-CRD 队列进行外部验证。
1.7 模型的可解释性分析
为提高模型的可解释性,本研究采用SHapley加法解释(SHAP)方法,对随机森林模型的预测结果进行解释。SHAP方法能够定量分析每个临床变量在模型预测中的贡献,并通过SHAP摘要图、依赖图和个体瀑布图等可视化工具,帮助临床医生理解各变量如何影响个体患者的预测结果
[14-16]。
1.8 统计学分析
使用R语言(版本4.5.0)进行统计分析。符合正态分布的连续变量以均数±标准差表示,组间比较采用t检验;不符合正态分布的连续变量以中位数(四分位数间距)表示,组间比较采用Mann-Whitney U检验。分类变量以频率(百分比)表示,组间差异采用卡方检验或Fisher精确检验进行分析。P<0.05为差异有统计学意义。
2 结果
2.1 基线特征
本研究共纳入MIMIC-IV数据库队列中517例急性胰腺炎患者,其中361例患者被分配至训练集,156例患者被分配至内部测试集(
图1)。患者中位年龄为57岁,男性患者占58.2%。糖尿病是最常见的合并症,发生率为31.5%,其次为慢性肺病(19.1%)。在ICU入院后72 h内,共有298例患者(57.6%)需要启动有创机械通气。与未在72 h内需要启动机械通气的患者相比,早期需要机械通气的患者在ICU入院时表现出更严重的疾病状态。早期机械通气组序贯器官衰竭评分(SOFA)评分中位数略高,且差异具有统计学意义(
P<0.05)。早期机械通气组全身炎症反应综合征评分(SIRS)明显较高。急性肾损伤(AKI)在早期机械通气组患者中更为常见,且严重程度较高。此外,早期需要机械通气的患者氧合指数较低,而两组间血氧饱和度差异无统计学意义(
P>0.05)。
血流动力学不稳定在需要早期机械通气的患者中更为常见,这些患者使用血管活性药物的比例更高,且其液体负荷较大,ICU住院天数也较长。两组间ICU死亡率差异具有统计学意义(
P=0.04,
表1)。
2.2 临床变量的特征选择与预处理
在最初提取的临床变量中,21个缺失数据超过50%的变量被剔除。对于剩余的变量,缺失值通过随机森林插补法进行了填补。插补后,对所有连续变量之间的相关性进行分析,剔除了具有高共线性的17个变量(相关系数绝对值大于0.7)。最终,保留了64个候选变量用于模型的开发。
2.3 模型开发与性能比较
在训练集中,通过LASSO回归进一步筛选出27个具有预测能力的变量。根据这些变量,开发了包括决策树、随机森林、XGBoost、LightGBM、支持向量机(SVM)和逻辑回归在内的6种机器学习模型。各模型的超参数通过10折交叉验证进行优化。模型的性能通过ROC曲线下面积(AUC)进行评估。在训练集中,随机森林模型的AUC值最高,为0.908,明显优于其他模型;在验证队列中,随机森林模型的AUC为0.733,高于其余模型的AUC值。决策曲线分析显示,随机森林模型在广泛的阈值概率范围内提供了较高的净临床效益,支持其在临床决策中的应用(
图2)。
2.4 模型的临床价值与性能评估
计算模型的敏感性、特异性、阳性预测值(PPV)、阴性预测值(NPV)、准确率和F1分数,所有指标均根据Youden指数法确定的最佳临界值进行评估。训练队列和验证队列的各项性能指标(图
3、
4),分别展示了在最佳阈值下的分类性能。
2.5 模型的外部验证
为评估模型的泛化能力,本研究选取eICU-CRD作为独立外部验证队列,共纳入269例急性胰腺炎患者。外部队列仅纳入与MIMIC-IV数据库中一致的临床变量,并采用相同的数据预处理及缺失值处理流程,以保证结果的可比性。
外部验证中,分类阈值沿用训练集基于Youden指数确定的最佳截点。随机森林模型在外部验证队列中的AUC为0.681(95%
CI:0.552~0.788)(
图5)。尽管外部AUC较内部验证有所下降,但整体预测趋势保持稳定。
2.6 模型可解释性分析
采用SHAP方法对随机森林模型进行解释,结果显示,SOFA评分、血管活性药物使用及AKI分期为贡献度最高的特征变量(
图6A)。器官衰竭程度越重、循环支持需求越高及肾功能损伤越严重,患者在ICU入院后72 h内需要启动有创机械通气的预测概率越高。氧合相关指标在不同区间呈非线性变化,其对预测结果的影响可能受多因素共同调控(
图6B)。
2.7 个体化预测结果解释
通过SHAP瀑布图,进一步分析了个体患者的预测结果。以1例高风险患者为例(
图7A),该患者的预测有创机械通气的概率为91.2%,主要由其SOFA评分的升高、AKI 3期以及近期使用血管活性药物驱动。而另1例低风险患者(
图7B)的预测概率为17.3%,其SOFA评分较低、肾功能良好且未使用血管活性药物,导致其预测风险较低。个体化的解释展示了模型如何综合多个器官衰竭信号,生成具有临床意义的预测结果。
3 讨论
本研究通过分析急性胰腺炎患者的临床数据,构建了一个基于机器学习的可解释性预测模型,用于预测ICU入院后72 h内是否需要启动有创机械通气。该模型能够整合患者的多维度临床数据,包括器官功能衰竭评分、生命体征、实验室检查结果等,为临床提供早期干预的决策支持。研究表明,随机森林模型在训练集中的AUC为0.908,在测试集中的AUC为0.733,在外部验证集中的AUC为0.681,在内外部队列中均表现出一定的预测效能。
尽管机器学习模型在预测急性胰腺炎患者早期呼吸衰竭方面表现优异,但其“黑箱”问题依然限制了其在临床中的应用。为此,本研究采用了SHAP方法对模型进行了可解释性分析,以提高模型的透明度。在关键预测因素方面,本研究通过SHAP分析发现,SOFA评分、血管活性药物使用及AKI分期是模型中贡献度最高的变量。首先,SOFA评分作为综合反映多器官功能状态的评分体系,其升高提示炎症反应加剧及微循环灌注障碍加重。在急性胰腺炎中,系统性炎症反应可迅速累及肺、肾及循环系统,导致肺泡-毛细血管屏障破坏及通透性肺水肿,从而增加早期呼吸支持需求
[3, 17, 18]。SOFA评分在本研究中位居预测变量首位,提示早期机械通气的发生本质上反映的是全身器官衰竭进展,而非单一肺部病变。其次,血管活性药物的使用反映了血流动力学不稳定状态。需要使用血管活性药物的患者,往往已存在感染性或炎症相关性休克。持续低灌注状态可导致乳酸升高及代谢性酸中毒,增加呼吸代偿负荷,同时液体复苏过程中可能加重肺间质水肿
[19]。因此,血管活性药物使用不仅是循环衰竭的标志,也间接提示呼吸衰竭风险增加。再者,急性肾损伤(尤其是AKI 2-3期)在机械通气组中发生率明显更高。AKI不仅是多器官功能障碍的组成部分,其发生还与液体正平衡、炎症介质累积及内环境紊乱密切相关。肾功能恶化可能导致容量负荷增加,从而加重肺水肿和氧合障碍,形成恶性循环。
综合来看,上述3个变量共同指向一个核心机制,即急性胰腺炎患者早期需要机械通气,往往并非孤立的呼吸系统问题,而是全身炎症风暴驱动的多器官功能衰竭综合表现。SHAP依赖图和瀑布图进一步阐明了这些特征变量与模型输出之间的关系,表明多脏器功能衰竭与呼吸衰竭之间存在紧密的生理联系。值得注意的是,尽管本研究基于现有的ICU数据构建了预测模型,但这些模型的实际临床应用仍需进一步验证。例如,在急性胰腺炎的管理过程中,除了呼吸衰竭的治疗,还涉及到包括感染控制、营养支持、胰腺局部并发症的干预等多方面治疗
[20]。在现有模型的基础上,未来应加强模型与临床专家的联合使用,使模型能够与医生的临床经验和病情评估相结合,提供更为精准的决策支持
[21]。
机器学习模型的临床应用不仅仅依赖于模型本身的准确性和可靠性,还需要考虑到可解释性。本研究中,SHAP方法为模型提供了高度透明的解释路径,可帮助临床医生理解模型是如何根据患者的临床特征做出预测的
[22]。这种可解释性是提升临床医生对机器学习模型信任的关键,尤其是在急性胰腺炎等危重症患者的管理中,早期和正确的干预至关重要。如果能够确保机器学习模型的透明度和可操作性,它将为急性胰腺炎等危重症患者的管理提供有力支持
[23]。从临床实践的角度,急性胰腺炎的管理不仅仅是治疗胰腺本身,更是涉及多脏器功能的综合管理。呼吸衰竭的预测不仅能帮助评估患者的肺功能状态,更能反映患者全身器官的衰竭进展。因此,结合机器学习的多维数据分析和临床评分系统,可能成为一种更加精准的预测工具,有助于提高ICU患者的管理水平,并可能改善患者的预后
[24]。
本研究存在一定局限性:首先,数据主要来源于MIMIC-IV数据库和eICU-CRD数据库,两套数据库均来源于美国ICU人群,医疗资源配置、临床决策路径及种族构成与国内可能存在差异,因此模型的泛化能力仍需在国内多中心真实世界队列中进一步验证
[25]。其次,本研究为回顾性研究,部分关键变量依赖结构化记录,可能存在测量误差与残余混杂。未来应开展前瞻性、多中心研究并结合更丰富的临床信息对模型进行更新与优化
[26]。另外,本研究未对急性胰腺炎病因及Atlanta分型进行分层分析。主要原因在于MIMIC数据库中病因依赖ICD编码,存在记录不完整风险;而Atlanta分级需基于器官衰竭持续时间等动态信息,数据库难以精确重建。若采用替代指标分层,可能与研究结局存在信息重叠,从而影响模型评估的独立性。未来将结合多中心前瞻性数据进一步开展分层验证。尽管如此,本研究展示了机器学习模型在急性胰腺炎患者早期呼吸衰竭预测中的潜力。未来研究可以通过进一步优化模型,加入更多的临床变量,并结合多中心的临床数据,进一步提高其临床适用性
[27]。
综上,基于机器学习的可解释性预测模型能够有效预测急性胰腺炎患者是否需要早期启动有创机械通气,并为临床提供重要的决策支持。未来,随着数据积累和模型优化,该模型有望为更多急性胰腺炎等危重症患者的管理提供早期风险评估工具
[28]。
国家自然科学基金(82572463)
国家自然科学基金(82402512)
大学生创新创业训练计划项目(S202412121144)