细菌耐药已成为全球公共卫生领域面临的一个巨大挑战,抗菌药物耐药性2019年被世界卫生组织列为影响全球健康十大威胁之一
[1],对医院及社会经济均会产生重大影响
[2]。多重耐药菌(multi-drug resistant organism,MDRO)是指对3类及以上抗菌药物呈现耐药的细菌
[3]。患者发生MDRO感染会伴随复杂且难治疗的特点,会延长患者住院时间、增加患者的痛苦和经济负担
[4]。因此需要医护人员、检验科、药学及保洁等多部门协同做好防控和治疗工作
[5]。重症监护室(intensive care unit,ICU)患者因自身免疫力下降、肠道菌群失调、抗生素使用时间长、侵入性操作等因素,是发生MDRO感染最多的人群
[6]。研究指出
[7],ICU患者发生感染的情况是普通科室的2~5倍,由MDRO引发的感染高达60%以上,其引起的死亡是普通感染的1.7倍
[8]。尽早发现MDRO感染的高危人群对于感染的预防与控制工作尤为迫切。基于此构建风险评估预测模型,实现早期发现并实施规范化的干预措施极其重要
[9]。
机器学习(machine learning,ML)是人工智能的核心技术,用于处理一些复杂变量之间的非线性关系,从而获得一个较为稳健的风险预测模型,模型输出结果主要是依靠算法来完成,与传统的统计分析方法相比,ML对临床诊疗指导意义更大,目前已在疾病风险预测方面被广泛使用
[10]。本研究旨在结合多模态数据融合和动态ML技术,构建ICU患者MDRO感染早期预警模型,通过多模态数据融合技术,从患者的医疗记录、生理监测数据、影像资料等多个数据源中提取出对MDRO感染预测有价值的特征;利用动态ML算法,构建能够实时更新和优化的预测模型;通过临床验证和评估,验证模型的预测准确性和实用性。
1 资料与方法
1.1 一般资料
1.1.1 数据来源
采取单中心回顾性研究的方法,选取某三甲医院2018年1月1日~2023年8月30日ICU患者1 200例,发生MDRO感染有600例,按照1∶1的比例,选择相同时间内未发生感染的600例患者纳入。本研究通过医院医学伦理委员会审批(伦理审批号:KY2023112111)。
1.1.2 诊断标准
MDRO感染诊断依据医院感染的诊断标准
[11],临床重要耐药菌感染诊断、治疗及防控指南
[12],结合医院感染监测软件的提示信息、病原学诊断,由临床医生判断是否为医院感染,并由医院感染管理科专人审核,排除定植及污染患者,最终判断是否为MDRO医院感染。住院期间同一患者的相同菌种标本,均视为同一菌株,不重复记录。
1.1.3 研究对象
纳入标准:(1)ICU住院时间≥48 h;(2)患者感染部位为下呼吸道感染者;(3)临床标本中分离出的耐碳青霉烯类:鲍曼不动杆菌(Carbapenem-resistant
Acinetobacter baumannii,CRAB)、大肠埃希菌(carbapenem-resistant
Enterobacteriaceae,CRE)、肺炎克雷伯菌(carbapenem-resistant
Klebsiella pneumoniae,CRKP)、铜绿假单胞菌(carbapenem-resistant
Pseudomonas aeruginosa,CRPA)及耐甲氧西林金黄色葡萄球菌(methicillin-resistant
Staphylococcus aureus,MRSA);(4)年龄≥18岁且病例资料完整者;(5)符合《医院感染诊断标准》和MDRO感染判定标准者。排除标准:(1)入住ICU前或24 h内感染者:(2)病历数据资料缺失≥20%者;(3)住院期间从未送检者及送检结果有误者;(4)妊娠期及产褥期妇女。本研究筛选感染患者流程图见(
图1)。
1.1.4 样本量计算
逻辑回归模型参考构建风险预测模型样本量10倍原则,即阳性结局事件数量为最终进入模型变量数10倍以上
[13]。然而目前ML模型还无相关针对性的样本估算公式,根据相关研究发现引起患者发生MDRO感染的影响因素约为26个,因此本研究基于逻辑回归模型的样本估算方式。本研究总计收集1 200例患者,对数据进行清洗后,使用python中函数将数据进行随机划分,即训练集960人,测试集240人。
1.2 方法
1.2.1 资料收集方法
调取医院信息系统中的ICU患者信息,根据纳入和排除标准回顾性获取患者的一般情况、基础疾病、实验室检查、抗生素使用等临床资料;结局变量MDRO感染通过医院感染信息系统获取;包括性别,年龄(<60岁/≥60岁)、职业、婚姻情况、入院途径,基础疾病(冠心病、低蛋白血症、肺部感染等)、侵入性操作(气管插管/切开、吸痰、留置尿管、机械通气、中心静脉置管等)、实验室指标(白细胞计数、C-反应蛋白、白蛋白含量、降钙素及白介素-6)、急性生理与慢性健康评估(Acute Physiology and Chronic Health Evaluation Ⅱ,APACHE Ⅱ)和格拉斯哥昏迷评分法(Glasgow Coma Scale,GCS)评分情况(其中APACHE Ⅱ≥15分患者归属为重症,<15分归属为非重症;GCS得分值越高,提示患者意识状态越好,≤8分为昏迷,昏迷程度越重者的昏迷指数分值越低,≤3分则提示脑死亡或预后极差),共收集600例MDRO感染患者,包括CRAB 109例、CRE 119例、CRKP 275例、CRPA 42例、MRSA 55例,研究对象筛选过程(
图1)。
1.2.2 统计学处理
使用SPSS26.0进行统计分析,计数资料用频数和百分比(%)描述。基于Python 3.9构建模型,本研究数据均采用卡方检验进行单因素分析来筛选影响因素,将P<0.05的变量纳入后续研究。本研究样本量按8∶2划分为训练集和测试集,利用训练集数据分别构建logistic回归、决策树中分类与回归树(classification and regression trees,CART)、极端梯度提升(eXtreme Gradient Boosting,XGBoost)和随机森林(random forest,RF)4种模型。采用5折交叉验证方法确定最优超参数,在测试集上进行独立验证,通过比较ROC曲线下面积(area under the receiver operating characteristic curve,AUC)、校准及决策曲线获得最佳模型,通过准确率、阳性预测值(positive predictive value,PPV)、阴性预测值(negative predictive value,NPV)及Kappa值等指标对模型预测性能进行评估并计算变量重要性。
2 结果
2.1 单因素分析
根据是否发生MDRO感染,进行单因素分析发现肺部感染、脑血管病、低蛋白血症、冠心病、慢性阻塞性肺病、高血压、手术史、住院天数、年龄、C-反应蛋白、白蛋白含量、抗生素使用情况等26个变量的差异具有统计学意义(
P<0.05),性别、职业、婚姻情况等(
P>0.05)差异无统计学意义具有均衡可比性结果见(
表1)。使用皮尔逊相关系数生成特征相关性图,显示各变量特征彼此间无高度相关,最大相关性值未超过0.5(
图2)说明每个变量对MDRO感染风险的预测各有贡献。
2.3 MDRO感染风险的4种预测模型
2.3.1 Logistic回归
将单因素分析中
P<0.05的26个变量作为自变量,构建逻辑回归模型,变量赋值(
表2)使用5折交叉验证的方法确定最优模型。Logistic回归结果显示,肺部感染、脑血管病、低蛋白血症、高血压、冠心病、慢性阻塞性肺病、手术史、年龄、呼吸机使用时间、尿管留置时间、导尿、灌肠、气管切开/插管、中心静脉置管、引流管、白蛋白、降钙素原、APACHE Ⅱ评分18个变量是患者发生MDRO感染的重要危险因素(
表3)。
2.3.2 决策树
基于单因素分析筛选出的25个变量作为预测因子纳入模型中,以信息增益为基础进行树的生长,选择最小代价复杂度剪枝法对决策树进行后剪枝,生成模型。该图包含6层,其中肺部感染、脑血管病、低蛋白血症、冠心病、高血压、灌肠、吸痰、手术史、尿管留置时间、联用抗生素情况、白蛋白含量、呼吸机和抗生素治疗时间13个变量是模型的重要解释变量(
图3)。
2.3.3 随机森林
通过Python实现算法拟合,经相应验证发现当树的数量为100时,总样本量误差最小,此时袋外数据out-of-bag (OOB)误差为0.256,此时该模型准确度较高,采用5折交叉验证的方式对变量进行筛选,结果显示当选取前23个变量时,OOB误差最小,即肺部感染、手术史及脑血管疾病等23个变量为模型的重要解释变量(
图4)。
2.3.4 极度梯度提升树
通过Python实现算法拟合,经过模型验证使用网格搜索方式对每一种参数组合进行评估,使用5折交叉验证来评估不同特征子集性能,结果显示选择肺部感染、手术史、脑血管疾病及低蛋白血症前15个特征,交叉验证方法得到的评价指标性能最高为模型的重要解释变量(
图5)。
2.4 模型预测性能比较
2.4.1 训练集比较
训练集中发现随机森林最佳,其准确率为97.08%,灵敏度为97.7%,特异度为96.47%,阳性预测值为96.49%,阴性预测值为97.69%,Kappa值为0.942,均高于其他三种模型(
表4)。ROC曲线下面积AUC值由大到小:RF(99.50%)>XGBoost(95.20%)>CART(86.60%)>logistic回归(85.90%)(
图6A)。校准曲线用于评估模型预测概率的准确性,其通过比较模型预测的概率与实际发生的概率来评估模型的校准度,横坐标是模型预测的概率平均预测概率,纵坐标是实际发生的概率,其中RF紧沿着45°对角线,表明其预测概率与实际概率有很好的一致性(
图6B)。决策曲线分析通过比较不同阈值下模型净效益来评估模型在各种决策阈值上的表现;净效益是真阳性率和假阳性率之间的权衡,其中RF在大多数阈值概率下高于其他模型,阈值范围在0~1之间说明其具有较好的预测性能,在实际临床应用中能够有效地识别出需要早期干预的患者(
图6C)。
2.4.2 测试集比较
测试集中显示随机森林模型最佳,其准确率为79.58%,特异度为84.75%,阳性预测值为83.49%,均优于其他三种(
表5)。ROC曲线下面积AUC值由大到小:RF(90.50%)>CART(89.40%)>logistic回归(87.20%)>XGBoost(87.10%)(
图7A)。校准曲线图显示RF接近45°对角线,校准度最佳(
图7B)。决策曲线图显示RF在大多数阈值概率下高于其他模型,其阈值范围在0~1之间说明能够保持较好的预测性能(
图7C)。
3 讨论
3.1 4种算法构建的预测模型的优势与不足
目前MDRO感染风险预测模型大多基于logistic回归
[14,15],其是一种线性模型,但引起MDRO感染相关危险因素错综复杂,每个变量间会有所关联,仅用logistic回归对感染风险预测不太具有代表性。因此本研究将基于4种算法构建ICU患者MDRO感染风险预测模型,研究结果显示RF是最优模型,其在训练集和测试集均呈现最佳表现。Logistic回归因可解释性常用于研究危险因素,对样本量及数据类型要求较高,易受缺失数据影响,能提供一种直观方式来解释每个特征对预测结果的影响程度
[16],通过系数可直接了解特征重要性,计算成本较低且训练速度快,有助于临床工作者进行风险分层。CART解释性强且模型结构直观,对缺失变量及数据分布类型不敏感,但容易产生复杂结构过拟合和泛化能力弱等问题
[17]。XGBoost自动分析预测因子间交互作用和非线性效应
[18],对缺失值和异常值有较好处理能力,能有效提高预测精度从而获得更准确稳定结果,可构建出预测精度较高模型。RF通过组合多个决策树进行分析,降低单个决策树过拟合风险,提高模型泛化能力
[19],每棵树不同分类边界相互补充,降低整体预测错误率从而达到预测效果,对异常值具有较高容忍度,不易受到这些因素影响。因此与其他算法相比,RF对于预测ICU患者发生MDRO感染风险具有较强优势,可筛选出可解释性关键危险因素,能有效为感染预防和干预提供一定参考价值。
本研究将静态算法转换为动态算法,主要基于在线学习框架
[20],将RF、XGBoost、CRAT和logistic回归4种算法作为基础,对数据进行流处理和模型更新,能有效处理单个数据点并在接收新数据时进行即时调整模型参数。主要先基于静态算法初始化方法设置初始模型参数来逐个处理数据点,计算预测值与真实值之间损失,根据损失函数对模型参数进行优化,根据模型表现动态调整学习率,为防止过拟合风险,更新过程中进行模型正则化,实现快速、有效模型更新机制,并能有效适应数据分布变化
[21,22]。但在实际临床应用中,需根据具体问题调整策略和参数,以达到模型最佳效果。
3.2 共同预测因子是MDRO预防与控制的关键因素
特征重要性结果显示,年龄是影响患者发生MDRO感染的重要危险因素,与以往的研究结果
[23]一致,老年患者因身体器官发生退行性变化、免疫功能减弱等,使感染反复发作引起病原菌难以消灭,MDRO感染风险相对较大
[24]。ICU患者身体机能衰退引起免疫力下降,手术会导致患者极易发生MDRO感染
[25]。白蛋白含量的下降会减弱患者抵抗病原菌能力
[26],导致身体免疫屏障受损,诱发组织器官感染,甚至引起耐药菌感染。原发疾病对感染也有重要的影响,心脑血管病患者可能会因误吸,将口咽部及呼吸道分泌物带至肺部,导致病菌进入机体发生感染
[27]。慢性阻塞性肺病患者在治疗中会使用过多抗菌药物及激素,会增加感染风险
[28];肺部感染患者伴有侵入性操作,导致呼吸道对病原菌防御功能下降
[29]。侵入性操作会破坏机体生理屏障和防御机制,导致病菌入侵机体引起感染,其中气管切开及插管操作会削弱患者呼吸道的保护机制,导致细菌易于入侵患者机体而引起耐药菌感染
[30]。危重症患者使用有创机械通气≥7 d
[31],会增加患者发生MDRO感染的风险。抗菌药物的选择性压力是诱导细菌产生耐药的重要原因之一,细菌中由于多种耐药质粒可协同作用,对不同抗菌药物产生耐药从而导致患者发生MDRO感染
[32]。抗菌药物时间使用过长是感染的独立危险因素
[33],长时间使用抗菌药物会将诱导药物主动外排、细胞膜通透性降低及药物作用靶位点改变
[34]进而诱发危重症患者发生感染。
综上所述,肺部感染、脑血管病、低蛋白血症、冠心病、慢性阻塞性肺病、高血压、年龄、手术史、白蛋白含量、气管切开/气管插管、呼吸机时间、引流管、抗生素治疗等因素对于MDRO感染的预防有着极其重要的作用。
3.3 基于随机森林模型的预测性能最高
RF算法在国内外医疗领域中被广泛应用,常用于解决各类临床预测、诊断等问题。吕永楠等
[35]利用RF建立急性心肌梗死诊断模型,结果指出其能较好区分急性心肌梗死与心绞痛,能为临床工作者提供一种新思路。盛晓欣等
[36]使用RF方法研究癫痫患者正常脑电和癫痫脑电信号,建立识别与预测模型,显示该预测模型总预测误差仅为2%左右,为预测癫痫发作提供较好参考依据。Song等
[37]基于4种算法构建患者发生压疮风险预测模型中指出RF模型准确度最高。本研究经分析发现,在预测MDRO感染发生情况中,随机森林模型在训练集和测试集上均呈现最佳表现,其次是XGBoost模型,然后是决策树模型,最后是逻辑回归模型。训练集和测试集中随机森林模型准确率、灵敏度、特异度、阳性预测值、阴性预测值、AUC值、Kappa值均优于其他三者。决策曲线分析(decision curve analysis, DCA)是一种用于评估预测模型在临床决策中应用价值的工具。DCA图指出随机森林模型的净效益曲线在大多数阈值概率下高于其他模型,这表明随机森林模型在这些阈值下能够提供更好的预测性能,这意味着在实际临床应用中,随机森林模型可能更能够有效地识别出需要治疗的真阳性患者,同时减少不必要的假阳性患者治疗情况。XGBoost模型虽然在净效益上略低于随机森林模型,但仍然表现出了良好的预测能力。CART模型和逻辑回归模型的净效益曲线也显示出一定的预测价值,但相对于前两个模型来说,它们的表现略显逊色。本研究发现RF模型在患者MDRO感染风险预测中具有较高准确率,但因“黑箱”特性使模型可解释性较差,本研究主要通过特征重要性评估方法来解决该问题
[38],帮助了解特征对预测结果影响程度,从而在一定程度上解释模型决策过程,提高可解释性,为ICU患者MDRO感染防控工作提供有力支持。
本研究通过多模态数据融合与动态ML技术,构建了针对ICU患者MDRO感染的早期预警模型。该模型利用多种数据源(如医疗记录、生理监测、影像资料等)的综合信息,提升了预测的准确性。动态ML算法的应用使得模型能够根据患者的实时病情变化进行快速更新和优化,提高了预警的时效性和准确性。不足之处:(1)本研究是一项单中心回顾性研究,数据选择可能具有偏倚情况;(2)模型仅进行内部验证,数据仅来源于一家医院,可能存在地域性局限性,同时无法检验模型的泛化能力;(3)MDRO感染变量除文中提及外,可能与医护人员监测方式和频率、医疗环境消毒、相关人员手卫生依从性等外部因素有关,因该项数据收集较为困难,本研究未将该因素纳入,后期将进一步纳入这些因素并进行分析,在今后研究中将收集感染年份靠前患者并扩大样本量去开展多中心研究;在临床应用中去检验模型实用性和可靠性,对模型进行相应完善,使本研究结果能够为临床MDRO感染预防工作提供更可靠理论与实践依据。
作者贡献度说明:
左蝶:文章设计、采集数据、数据分析和起草文章;赵佳:采集数据和收集相关文献;王小燕、李萍:提供文章修改意见和方法指导;龙晓艳、马学先、刘冰:写作指导和对文章内容作批评性审阅。
所有作者声明不存在利益冲突关系。
新疆维吾尔自治区自然科学基金(2023D01C121)