基于Transformer的影像与检验数据多模态预测模型在医院获得性感染的应用研究

张明旭 ,  吴迪恒 ,  林嘉泽 ,  吕祎君 ,  周凌宏 ,  甄鑫 ,  周浩 ,  秦耿耿

南方医科大学学报 ›› 2026, Vol. 46 ›› Issue (06) : 1423 -1433.

PDF (1505KB)
南方医科大学学报 ›› 2026, Vol. 46 ›› Issue (06) : 1423 -1433. DOI: 10.12122/j.issn.1673-4254.2026.06.22

基于Transformer的影像与检验数据多模态预测模型在医院获得性感染的应用研究

作者信息 +

A Transformer-based multimodal model for predicting hospital-acquired infections using imaging and clinical laboratory data

Author information +
文章历史 +
PDF (1540K)

摘要

目的 构建一个基于Transformer的多模态数据编码模型用于预测医院获得性感染。 方法 收集公开医学数据库MIMIC-IV中300 000条患者的实验室检验数据,同时在南方医院收集1172例患者的实验室检验数据和其中274例患者的X线胸片。使用本研究提出的基于Transformer的编码模型处理数据并接入机器学习分类器对医院获得性感染(HAI)进行预测。提取X线胸片影像组学特征和深度特征,采用特征融合算法将其与实验室检验数据融合后对呼吸机相关性肺炎(VAP)进行预测。通过准确率 (ACC)、AUC、灵敏度 (SEN) 和特异度 (SPE)评价模型性能,并将本研究所提出算法与传统机器学习分类算法进行定量比较,验证模型的有效性和可行性。 结果 结果显示本研究所构建的模型在内部验证中AUC可达0.989;在外部验证中,在预测HAI问题上的最优模型的AUC达到0.98,在融合影像特征后预测VAP任务中,最优模型的AUC达到0.93,均高于预设的基线模型性能。 结论 基于Transformer的实验室检验数据处理模型在预测HAI的问题中具有优秀的预测能力和较高的临床应用价值,并拓展性的对HAI的亚型进行了预测,取得了较好的结果。

Abstract

Objective To construct a Transformer-based multimodal data encoding model for predicting hospital-acquired infections (HAI). Methods Laboratory test data of 300 000 patients were extracted from the publicly available MIMIC-IV database. The laboratory data of 1172 patients and chest X-ray images from 274 of these patients were collected from Nanfang Hospital. A novel Transformer-based encoding model was developed to process the data, which was then connected to a machine learning classifier for predicting HAI. The radiomic and deep learning features were extracted from the chest X-ray images for predicting ventilator-associated pneumonia (VAP). These imaging features were subsequently integrated with the laboratory test data using a feature fusion algorithm. The model performance was evaluated by assessing the accuracy, the area under the ROC curve (AUC), sensitivity, and specificity. The proposed algorithm was quantitatively compared against traditional machine learning classifiers to validate its effectiveness and feasibility. Results The results demonstrated that the model developed in this study achieved an AUC of 0.989 in the internal validation set. In the external validation set, the optimal model for predicting HAI attained an AUC of 0.98, and following the integration of imaging features, the optimal model reached an AUC of 0.93 in the VAP prediction task, demonstrating superior performance over the baseline models. Conclusion The Transformer-based model for processing laboratory test data has excellent predictive capability and good clinical applicability for HAI prediction with also good performance for predicting VAP.

Graphical abstract

关键词

医院获得性感染 / 呼吸机相关性肺炎 / 实验室检验数据 / 深度学习 / 特征融合

Key words

hospital-acquired infections / ventilator-associated pneumonia / laboratory test data / deep learning / feature fusion

引用本文

引用格式 ▾
张明旭,吴迪恒,林嘉泽,吕祎君,周凌宏,甄鑫,周浩,秦耿耿. 基于Transformer的影像与检验数据多模态预测模型在医院获得性感染的应用研究[J]. 南方医科大学学报, 2026, 46(06): 1423-1433 DOI:10.12122/j.issn.1673-4254.2026.06.22

登录浏览全文

4963

注册一个新账户 忘记密码

医院获得性感染(HAI)是指住院患者在医院内获得的感染,包括住院期间发生的感染及出院48h内出现的院内获得性感染,需排除入院时已存在或处于潜伏期的感染1,在死亡率、发病率、住院时间和费用方面对住院患者构成重大负担2。HAI可分为肺部感染、尿路感染及血流感染等亚型,其中呼吸机相关性肺炎(VAP)作为最常见和最严重的HAI亚型,是重症监护室中导致患者死亡的主要原因3。早期积极干预并采用相应的治疗手段可以有效降低HAI患者的死亡率,因此预测HAI和VAP在临床上具有重要意义。
既往的研究中已经有使用机器学习的相关算法,对患者的电子健康记录(EHR)进行分析从而预防VAP4,也有团队通过逻辑回归或长短记忆网络对患者术后HAI发生率进行预测56。但这些研究依赖于EHR的复杂整合,面临数据获取难度大和高昂的管理成本等问题78,制约了HAI预测模型的临床实用性,且由于不同来源的数据收集临床信息的方式并不统一,有用数据的丢失是非常常见的9。基于此,本研究聚焦于实验室检验数据的独立预测潜力——其标准化格式和院内易获取的特征,为构建高效、低成本的HAI实时预警系统提供了可行路径。同时,既往的HAI预测模型仅仅将临床特征直接输入机器学习算法,但往往忽视了特征间的内在联系1011,这些联系可能对感染风险的预测产生影响。近年来,Transformer依靠其自注意力机制的深度学习方法,在时序建模与多模态关联分析中展现出独特优势12。本研究据此提出了一个基于Transformer的检验数据编码模型,其核心在于学习特征间的全局依赖关系,而非人工预设的特征组合,这为解决临床数据中的异质性与数据缺失提供了新的技术路径,打破了传统HAI预测中仅使用机器学习算法对预设特征组合的依赖,并使用更容易获得的临床实验室检验数据和影像数据预测HAI及VAP,帮助一线医生识别患者感染风险,促进及时干预。

1 资料和方法

1.1 一般资料

本研究使用了两类数据源以构建和验证模型性能:一是公开医学数据库MIMIC-IV,二是来自南方医科大学南方医院的真实临床数据。

1.1.1 公共数据库数据(MIMIC-IV)

为训练HAI预测模型并进行初步性能验证,本研究使用了由麻省理工学院公开发布的医学信息数据库 MIMIC-IV(v2.2)。该数据库包含超过38万例住院患者的电子病历、检验检查、诊断编码等详细结构化信息。本研究从其中提取了300 000条实验室检验数据及对应的临床标签。检验数据中,部分检验项目缺失率较高,可能源于其中非住院患者常规检测项目。因此,本研究排除了缺失率超过80%的检验项目和检查项目缺失度超过80%的患者信息。既往研究建议排除缺失率>10%的变量以保障数据完整性13,但此类策略更适用于理想化的小规模研究,难以适应真实医疗场景中因临床决策差异导致的天然数据稀疏性。本研究将缺失率阈值放宽至80%,旨在最大限度保留潜在预测因子。最终保留12 135例患者检验信息。

1.1.2 真实临床数据

本研究同时收集南方医科大学南方医院2024年1月~2024年12月的实验室检验数据。共纳入1172份完整的患者记录,其中经确诊HAI的患者为368例,HAI的诊断标准依照国家卫生健康委员会发布的《医院感染诊断标准(试行)》进行14。对于在研究期间内存在多次就诊记录的患者,我们制定了明确的数据纳入与排除规则,以确保研究队列中每个个体仅贡献一个独立的数据点。本研究优先选取每位患者在2024年1月~12月期间的首次合格就诊记录。若该次就诊经确认符合HAI诊断标准,则该患者被纳入HAI阳性组;若不符合,则纳入非感染对照组。此后的所有重复就诊记录均被排除在最终分析之外。该策略旨在保证数据的独立性与统计模型的稳健性。纳入的患者数据含详细的实验室检测项目,预处理方法同MIMIC-IV数据集。

在已纳入实验室检验数据的患者群体基础上,收集符合研究要求的274例患者后前位数字化X线胸片(DICOM格式)。纳入标准包括:影像检查与实验室检验时间差≤24 h;临床诊断为呼吸机相关性肺炎且具有完整病程记录,诊断标准同样依照《医院感染诊断标准(试行)》进行;排除标准包括:存在严重伪影或关键解剖结构缺失的胸片;合并活动性肺结核、肺部肿瘤等干扰性疾病。对于在研究期间内存在多次符合纳入标准的X线胸片的患者,本研究仅采用首次合格影像,以确保每位患者仅贡献一个独立的影像数据点。具体而言,我们选取与首次确诊呼吸机相关性肺炎的实验室时间点最接近、且时间差在24 h内的首张合格胸片。若同一时间点存在多体位投照,则优先选取后前位胸片。此方法旨在消除因同一患者多次成像所带来的数据关联性,保证模型训练与评估的独立性。

本研究中的患者诊断由一名经过培训的临床研究员根据上述预定义的客观标准,从电子病历中初步筛选出潜在病例。随后,由两名不知晓本研究假设的资深呼吸与危重症医学科医师,独立对初步筛选出的所有病例的病历资料进行审阅。他们依据相同的预定义标准,将每个病例判定为“HAI确诊”、“非HAI”或“不确定”,分类VAP问题同理。当两名医师的判定结果不一致时,将由第3名更高年资的感控专家进行最终仲裁,以达成一致意见。只有经独立审核并达成一致的病例才被纳入最终分析。为评估人工判定的一致性可靠性,在仲裁前对两名医师的初次独立判定结果进行一致性分析,采用Cohen's Kappa系数分别计算HAI和VAP判定结果的一致性。k值的解释参照Landis和Koch标准,k>0.75视为一致性良好。两名医师对HAI和VAP判定结果的一致性分别为k=0.82和k=0.79,均提示一致性良好。

为了增强模型的泛化能力和适应不同来源数据的异质性,本研究采用MIMIC-IV数据集进行模型训练与内部验证,再将训练完成的模型应用于真实患者数据中,进行外部性能评估。

1.2 实验室检验数据预处理方法

参照既往研究15,实验室检验数据依据其格式划分为分类变量、二值变量及数值变量三类,并采用相应处理方法:

数值型特征通过标准化处理后,将其映射到一个高维嵌入空间。为了避免尺度差异的影响,所有数值型数据首先经过均值为0、方差为1的标准化处理,随后被映射到一个固定维度的向量空间。在该向量空间中,数值型数据能够保持其原始数值关系,同时便于后续的模型学习。具体地,对于每个数值型输入xi 其嵌入表示ei由以下公式生成:

ei=Embed(Standardize(xi))

其中Embed表示数值映射操作,Standardize表示标准化处理过程。

类别型特征被映射为稠密的向量嵌入,以捕捉类别间的潜在关系。对于每一个类别特征cj,其嵌入表示ej通过查找预训练嵌入表获得:

ej=Embed(cj)

这种嵌入方法能够减少类别数量较大时可能出现的高维稀疏性,并且能够更好地表示类别之间的相似性。

对于文本型数据,本研究使用预训练的 BERT 模型将文本数据转化为上下文相关的嵌入表示。BERT 模型通过对输入的文本进行编码,生成具有语义信息的嵌入向量,进而将文本信息转化为可与其他类型数据共同输入的统一嵌入表示。具体而言,对于每个文本输入tk,其嵌入表示ek由以下公式得到:

ek=BERT(tk)

这种方法能够有效地利用大规模语料库预训练得到的上下文信息,为文本数据提供更为丰富的语义表示。

所有类型的数据在经过各自的嵌入转换后,被拼接为一个长向量E作为模型的最终输入。这些嵌入表示在进入 Transformer 编码器之前,会按顺序排列,形成一个具有统一结构的输入向量:

E=[e1,e2,...,en]

其中,n是数据的特征维度。通过这种方式,数值型、类别型和文本型数据能够被有效地整合成一个统一的嵌入表示。过程中使用了特征名和对应数值分别进行编码,编码后相乘得到连续变量嵌入的操作,这样做的原因是标记化的嵌入范式在区分数值方面表现不佳16。此分层处理策略旨在维持数据语义信息的同时,确保各类特征在数值空间的可计算性17。这种嵌入式表示方法在面对缺失数据时展现了独特的优势。通过将缺失的特征与列的描述信息一同进行编码,缺失值不仅得到了合理的处理,而且避免了传统插补方法可能带来的偏差,确保了缺失数据在整个数据集中的一致性和有效性。预处理后的结构化数据作为编码器的输入。为识别有/无HAI患者间的差异预测因子、降低过拟合风险并增强模型可解释性,本研究分别采用t检验和U检验评估连续变量与分类变量的统计学显著性差异。

1.3 影像学数据预处理方法

为确保放射组学特征的稳定性与可重复性,本研究的感兴趣区域(ROI)由两名具有五年以上影像诊断经验的放射科医师在不知晓患者分组信息的情况下独立进行手动分割,使用 ITK-SNAP (version 4.0)软件完成。ROI范围包括双肺实质区域,排除心影、胸壁及膈肌等非肺部组织。为评估分割结果的一致性,对两名医师的分割结果计算Dice相似系数(DSC)和组内相关系数(ICC),其中DSC=0.87,ICC=0.91,表明分割结果一致性良好。最终ROI采用两名医师经协商一致的结果作为后续特征提取的依据。

放射组学特征提取基于PyRadiomics(version 3.1.0)实现,包含形态学特征、灰度共生矩阵(GLCM)、灰度运行长度矩阵(GLRLM)、灰度差分矩阵(GLDM)及小波变换特征等共 15 维形态与纹理特征。所有特征在提取前均进行了 Z-score 标准化,以消除尺度差异的影响。

深度特征提取部分采用 ResNet50 作为主干网络(预训练于ImageNet数据集),并在本研究的X线胸片数据上进行微调。为避免过拟合,网络仅对最后三层卷积块进行参数更新,前层权重保持冻结状态。输入图像在送入网络前统一调整为224×224分辨率,采用随机旋转、水平翻转和亮度扰动等数据增广策略,以提高模型对姿态和曝光差异的鲁棒性。深度特征的输出取全局平均池化层后的2048维特征向量,与放射组学特征拼接形成融合特征。为验证深度特征的稳定性,在独立样本上重复提取后计算Pearson相关系数(r=0.94,P<0.001),显示其良好重现性。

通过上述流程,本研究在保证影像特征可重复性的同时,兼顾了放射组学的可解释性与深度特征的语义表达能力,为后续多模态特征融合提供了稳定可靠的输入。

1.4 模型架构

本研究创新性提出基于Transformer架构的实验室检验数据分析框架,用于HAI风险预测。该模型通过堆叠多头自注意力层捕获跨检测项目的潜在关联性,将高维稀疏检验序列编码为128维稠密动态嵌入,提炼语义,最终通过机器学习分类头输出HAI风险概率。同时本研究进一步使用了跨模态融合框架,将易于获取的X线胸片特征与实验室检验数据融合后协同建模,完成医院获得性肺炎的预测。该模型主要包含三个部分:数据编码,特征融合和模型训练验证。

1.4.1 基于Transformer的数据编码

本研究使用了一种基于Transformer的数据编码方法,在编码数字数据的基础上,通过词嵌入技术将所有文本数据也进行了编码18。为了实现对不同来源检验数据的统一建模,本研究使用了一种门控变换器架构19,该架构由多个层堆叠而成,每一层由多头自注意力机制和门控前馈网络组成。

表格数据首先经过预处理步骤,将原始的表格信息转换为嵌入向量表示。假设输入数据为X,则通过处理后得到的嵌入表示为ERn×d,其中n为token数量d为嵌入维度。该嵌入表示作为Transformer编码器的初始输入:

Z0=E

在第l层Transformer中,输入表示ZlRn×d经过多头自注意力模块,捕捉特征间的全局交互关系。多头自注意力机制的核心是通过查询、键和值来计算注意力,具体过程如下:

headi=Attention(ZlWiQ,  ZlWiK,   ZlWiV)
Zattl=[head1,...,headh]WO

其中,WiQWiKWiVRd×dhWORd×d为可学习参数,h为注意力头的数量。

为进一步提高模型对重要特征的关注能力,引入门控机制,通过控制每个token的激活程度来增强判别性。门控向量由sigmoid激活函数计算得出:

gl=σ(ZattlwG),      gl[0,1]n

其中wGRd×1为可学习的门控参数,接下来通过逐元素乘法将门控向量应用于自注意力输出:

Zl+1=Linear((glZattl)Linear(Zattl))

其中⊙表示逐元素乘法,⊕表示拼接操作。这一门控机制允许模型根据上下文信息动态地加权每个token,提升了模型对关键特征的建模能力。

经过门控加权后的表示Zl+1继续通过前馈神经网络进行处理。该前馈网络由两层全连接层组成,每一层后接ReLU激活函数,具体计算为:

Zffl+1=ReLU(Zl+1W1+b1)W2+b2

其中W1W2Rd×d是可学习的权重,b1b2Rd是偏置项。

经过l层堆叠的Transformer编码器,输出的表示Zl将输入机器学习分类器中用于后续的预测任务。

1.4.2 影像学特征融合

实验室检验数据和影像学两种模态的数据,本研究使用了一种基于距匹配及判别表征学习的多模态数据融合方法20,旨在解决实验室检验指标与影像学特征的多模态数据协同建模问题。本方法可以学习潜在特征,识别模态之间的相互关系和相互作用,从而提高特征的判别性。具体实现方法如下:

首先为两个模态的数据定义了特征矩阵XiRm×ni∈(1,2),其中i表示不同模态,m为特征数,n为样本数。为了融合两个模态的特征并从中学习隐藏的共享特征,假设存在一个潜在的共享表征空间,其中经过投影的多序列特征将在任何两种序列之间遵循相似的分布,因此,为每个特征矩阵定义了投影矩阵QiRk×mk为共享表征空间中特征的维度。将投影后序列间相似性通过数据分布中的第一原始矩和第二中心矩来量化,并将这个矩匹配问题通过下面的公式最小化使得任何两个序列在表征空间的特征具有相似的分布:

minQi,i ijM(QiXi)-M(QjXj)22+
ijVar(QiXi)-Var(QjXj)22

其中M(QiXi)=QiXieVar(QiXi)=(QiXi)°2e-(QiXie)°2分别表示第一原始矩(或平均值)和第二中心矩(或方差),e是一个所有元素都为1的n×1的列向量,()°2是哈达玛积形式的平方,x2=i=1m(xi)2表示l2范数。因此,共享表征空间中的融合特征矩阵通过以下方式获得:

V=1/4i=14QiXiVRk×n

由于融合特征是针对鉴别分类任务学习的,为了使融合特征更利于分类任务,该方法引入判别分析中的类内散度和类间散度作为融合特征的优化目标。类内散度矩阵和类间散度矩阵的计算公式如下:

SW(V)=c=1Cj=1nc(v(c)j-μc)(v(c)j-μc)

SB(V)=c=1Cncμc-μ(μc-μ)

其中SW(V)SB(V)分别是V的类内散射矩阵和类间散射矩阵,v(c)jVcth类中的jth样本,μcVcth类中样本的平均向量,μV的所有样本的平均矢量,nccth类的样本数,本研究模型中c=2.

类内样本距离和类间中心距离可以表示为tr(SW(V))tr(SB(V)),通过一些代数步骤,可以得到tr(SW(V))tr(SB(V))的简化公式,如下所示:

tr(SW(V))=tr(VLV)

tr(SB(V))=tr(V(S-E)V)

其中,矩阵S中的元素满足Sij=1n,如果vivj两者都属于该cth类,反之Sij=0;矩阵L=U-S,其中U是一个对角矩阵,其Ith对角元素是SIth行的和,并且E是一个元素都为1n的矩阵。然后,基于类内散度和类间散度的融合特征优化目标项可以写成:

Regf intra(V)=tr(SW(V))=tr(VLV)

Regf inter(V)=-tr(SB(V))=tr(V(S-E)V)

最后,目标函数可表示为:F(Q,X,V)=γ1M(Qi,Qj,Xi,Xj)+γ2V(Qi,Qj,Xi,Xj)+ρRegv(V)+λ1Regf intra(V)+λ2Regf inter(V)

其中M(Qi,Qj,Xi,Xj)=ijM(QiXi)-M(QjXj)22V(Qi,Qj,Xi,Xj)=ijVar(QiXi)-Var(QjXj)22λ1λ2是平衡上述优化目标项的权衡参数。因此上述目标函数可以公式化为以下优化问题:minQi,iF(Q,X,V)。这本质上是一个无约束最小化问题,本研究使用梯度下降方法对其进行优化,需要计算目标函数F相对于Q的梯度。Q中每个元素QiF中都是独立最小化的,这相对于Qi是可微的。通过算出FQi的导数,优化问题就变成了更新QiQi-ηF的迭代过程,其中η=t0/(at+t1)是与迭代次数t和固定超参数at0以及t1相关的自适应步长。给定Qi的随机初始化,其在每次迭代中的更新规则为:

Qi(t+1)=Qi(t)-ηF

此外,在每次迭代时,需要对Qi的每一列进行归一化步骤,由qijj=1,2,...,m表示,最终获得融合后的多模态数据。

本研究同时通过PCA降维将融合后的多模态特征投影至低维潜在空间,有效缓解“维度灾难”问题,在维度优化与信息整合方面呈现优势,同时显著减少了计算时间,提高了模型的计算效率和临床实用性21。PCA模型的参数仅从训练集数据中学习,随后将相同的变换应用于验证集和测试集,确保评估过程无数据泄露。目标维度的选择基于累计方差解释率,设定阈值为95%。分析显示保留前97个主成分即可解释训练集95.11%的总体方差(图1)。

1.4.3 模型建构

为缓解HAI及VAP样本分布中阳性样本比例偏低的问题,本研究在模型训练阶段引入了样本平衡与损失加权的综合策略。首先,在训练集上对少数类样本(感染组)采用合成少数类过采样技术(SMOTE)进行上采样,通过特征空间插值生成合成样本,以提升少数类样本的表示多样性并降低模型对多数类的偏倚。经SMOTE处理后,感染组与非感染组样本比例约为1∶1,有效缓解了类别不平衡带来的性能下降问题。

在模型训练的优化目标中,为获得对类别区分更敏感且具跨特征子空间一致性的表示,本研究采用基于特征垂直分区的监督对比式损失进行优化22。其核心思想是:将同一样本的特征划分为若干“垂直分区”(不同列子集的不同视图),并在同一类别样本的跨分区视图之间形成正样本对,在不同类别样本之间形成负样本对,从而在嵌入空间内最大化“同类—跨视图”相似度、最小化“异类—跨视图”相似度,定义为:

            L(X,y)=-i=1Bj=1Bk=1Kk,=1K1{yi=yj}logexp(ψ(vik,vjk,))j=1Bk=1B1{yiyj}exp(ψ(vik,vjk))

其中B为批大小,K为分区数,vik表示样本i于第k个特征分区得到的嵌入表示;ψ(,)为余弦相似度。最终流程图如图2所示:

1.4.4 模型的验证

本研究构建并训练了所提出的HAI风险预测模型,通过网格搜索法确定编码模型中的最优参数23。我们设置的参数网格如下:

架构参数:层数∈{4,6,8,12},头数∈{4,8,12,16},隐藏维度∈{128,256,512}

训练参数:学习率∈{1e-5,3e-5,5e-5,1e-4},批次大小∈{8,16,32,64}

优化参数:优化器∈{Adam}

在模型训练过程中,为了提高收敛的稳定性并防止早期梯度震荡,本研究采用了带预热的学习率调度策略,在训练初期的预热阶段(约占总训练步数的10%,即 warmup_ratio=0.1)学习率从0逐步线性上升到设定的最大学习率,随后再逐步线性下降至0。这样的方式可以在训练早期稳定梯度更新,在中后期则有助于模型平滑收敛并获得更好的泛化性能。

本研究包含3个独立实验:在MIMIC-IV数据集上训练验证HAI预测模型;在南方医院数据集上训练验证HAI预测模型;选择南方医院数据集中部分患者,补充对应的影像学数据后训练验证VAP预测模型,且此实验中,所有患者的检验-影像数据的时间差≤24 h。每个实验都有独立的7∶1.5∶1.5数据划分,确保评估的客观性。为评估模型的判别能力,我们使用受试者工作特征曲线(ROC)及其曲线下面积(AUC)作为主要评估指标,做出相关ROC曲线。在使用我院实验室检验数据预测HAI风险的外部评估任务中,基线被定义为直接对实验室检验数据使用机器学习算法分类的结果,通过准确率ACC、ROC曲线下面积(AUC)、灵敏度SEN、特异度SPE来评估模型性能,公式为:

Accuracy=TP+TNTP+TN+FP+FN
Sensitivity=TPTP+FN
Specificity=TNTN+FP

其中TP,TN,FP,FN分别表示真阳性、真阴性、假阳性和假阴性,此外还计算了PPV、NPV及PR曲线辅助观察模型性能。而在预测VAP的外部验证任务中,基线模型则被定义为在本研究提出模型下仅使用实验室检验数据预测VAP的性能表现,对比模型则是使用融合数据预测VAP的性能表现,评估方法同上。

2 结果

为了便于理解不同实验任务的数据来源、样本规模及模型验证关系,本文列出了各任务与数据集的对应关系(表1)。该表明确区分了本研究任务的训练、内部验证及外部验证数据来源,说明了数据模态(实验室检验/影像融合)、样本数量及基线模型对应情况。

2.1 MIMIC-IV数据集内部验证结果

使用MIMIC-IV数据集建模后,内部验证预测HAI的结果如图3所示。

2.2 使用实验室检验数据的外部验证结果

在使用实验室检验数据预测医院获得性感染的外部验证任务中,基线模型为直接使用机器学习模型进行预测,改进模型为使用本研究提出的编码方法处理后的数据输入机器学习模型,二者性能对比如表2所示。

为进一步展示本研究提出的改进模型在不同预测阈值下的分类性能,绘制其 Precision-Recall (PR) 曲线(图4)。

PR 曲线能够反映模型在阳性样本识别过程中精确率与召回率之间的权衡关系,其曲线下面积 (AUPRC) 可作为模型对少数类(本研究中为感染HAI的患者)识别能力的综合指标。本研究提出的模型的PR曲线整体呈较高的Precision水平,说明模型在识别感染患者时兼具较高的灵敏度与特异性,具有良好的整体判别性能(图4)。

2.3 使用影像融合数据的预测结果

在使用影像融合数据预测VAP的外部验证任务中,基线模型被定义为使用本研究所提出的方法,在仅使用实验室检验数据作为模型输入时的结果;改进模型同样为本研究所提出的方法,但输入数据变为包含影像学特征数据的融合数据(表3)。

本研究绘制了融合数据输入模型后的PR曲线,可见本模型在融合数据下的良好判别性能(图5)。

3 讨论

本研究提出了一种基于Transformer架构的实验室检验数据编码模型,用于HAI风险预测,并结合影像学特征,进一步对VAP的风险进行了预测。使用公共数据集MIMIC-IV构建的模型,最优模型的AUC达到了0.989;外部验证中,使用实验室检验数据预测HAI问题的最优模型的AUC可达0.98,敏感度可达0.93;使用融合数据预测VAP问题中的最优模型的性能可达0.93,且敏感度满足临床使用要求。已有的研究中同样有使用公开的MIMIC数据集,基于多种机器学习模型预测HAI的发生,但其最佳AUC仅为0.88(XGBoost),且敏感度与特异性表现也不如本文所提出的模型24;也有研究使用EHR,建立基于逻辑回归(LR)、随机森林等模型预测医院获得性流感,最佳AUC也仅达到0.83(LR)25。与既往仅使用机器学习模型的HAI/VAP预测研究相比(如基于逻辑回归或随机森林的传统模型),本研究创新性的将Transformer架构应用于检验数据的建模,提升了对HAI的预测能力15。本研究的重点聚焦于使用Transformer架构挖掘特征间内在联系,所提出的模型展现出其在预测HAI及VAP问题中的价值。实验结果表明,相比目前主流的传统机器学习方法,本研究所提出的模型表现出更优性能,验证了深度学习方法,特别是Transformer结构,在临床实验室检验数据建模与感染风险预测任务中的有效性和适用性。需要说明的是,在改进模型下,不同分类器在外部验证中的AUC、准确率及敏感度、特异度指标存在一定差异。例如GradientBoost在总体AUC略低于XgBoost的情况下,其准确率反而较高。这种差异主要来源于各分类器在决策边界与概率输出分布上的不同。AUC衡量的是模型在不同阈值下的整体排序能力,而准确率及敏感度、特异度则反映模型在特定阈值下的分类表现;因此,当数据存在类别不平衡或预测概率分布偏斜时,不同指标之间可能出现不一致。尤其在感染预测任务中,阳性样本相对稀少,模型在追求较高灵敏度时往往会牺牲部分特异度或总体准确率。本研究在模型选择上更注重 AUC与敏感度的平衡,以确保在临床高危人群识别中的有效性。

与既往研究相比,本研究的首要优势在于聚焦实验室检验数据的独立建模潜力。以往大多数HAI预测模型依赖EHR数据的整合,例如合并用药记、护理评分、体征监测数据等2627。比如先前有研究通过将预处理后的EHR数据输入多种机器学习算法来预测多重耐药菌所造成的感染28。但这类多源数据存在结构不统一、跨系统访问受限、更新频率低等问题29,导致实际临床部署面临较高门槛。相比之下,实验室检验数据具备标准化程度高、更新频率快、院内普遍可得的特点,是当前临床信息化系统中最易于获取的结构化数据之一。通过构建基于Transformer的自注意力机制,我们实现了对检验指标之间依赖关系的建模,进一步挖掘其潜在的表征能力,提升了模型的预测性能。

本研究的第2个贡献在于多模态特征融合策略预测VAP的实现。我们创新性地将常规检验数据与同步可得的X线影像特征进行整合,通过使用跨模态特征融合框架,从而实现对VAP患者肺部复杂病理状态的更敏感识别。现有对VAP的预测研究大多仅使用EHR数据或其它临床数据,而忽视了多模态数据间的信息互补3031。比如有一些研究使用MIMIC数据集中的人口统计学信息和检验结果预测VAP,AUC可达0.831和0.843233;也有研究只使用ICU中新生儿胸部X光片,结合创建的ResNet50和RegNetX80模型辅助诊断新生儿的VAP,AUC可达0.80234。尽管这些研究在一定程度上取得了良好的预测效果,但它们的预测结果仅基于单一数据来源,导致模型的表现受到数据本身局限性的影响。相比之下通过融合影像数据,结合本研究提出的基于Transformer的深度学习框架,我们不仅提升了预测性能,也在一定程度上缓解了由于单一模态信息不完全所导致的诊断偏误问题,验证了不同数据来源的互补性对VAP风险预测的巨大潜力。此外通过PCA降维等手段对融合特征进行压缩和重构,模型在兼顾判别力的同时也控制了计算资源消耗,为后续临床的实际部署提供了可行性保障。

本研究在数据预处理策略上也进行了充分考虑。针对临床实际环境中常见的数据缺失问题,我们采取了相对宽松的变量纳入阈值,并结合特征分类处理、标准化等方法,尽可能保留潜在有效信息。这种策略兼顾了数据质量与样本保留率,适配了真实临床数据的特点,有助于增强模型的可推广性。

尽管本研究取得了一定成果,但仍存在一些局限。首先,真实临床数据来源为单中心回顾性样本,样本分布可能受到医院科室结构、患者构成、检测流程等因素的影响,模型的泛化能力仍需在其他医疗机构或更多中心真实数据上进一步验证。其次,目前模型主要关注实验室检验数据和X线胸片影像两类模态信息,尚未整合如病程记录、治疗过程、临床用药等其他临床信息。未来研究可在此基础上探索更复杂的多模态集成策略,以提升模型鲁棒性和决策支持能力。此外,虽然Transformer结构在捕捉长距离依赖关系方面具备优势,但其训练资源消耗较大,尽管本研究采用了多种方法提高了计算效率,但在实际部署问题中仍存在一定挑战。如何进一步压缩模型结构、优化推理效率,以支持在医院临床信息系统中的快速部署与实时反馈,将是后续研究的重点。

在临床应用方面,本研究展示的工作具有良好的现实意义。通过格式化数据来源、强化模型性能与稳定性,为构建高效、灵敏的HAI及VAP预警系统提供了可参考的方法。特别是在ICU、感染科等高风险科室,该模型可辅助临床医生识别潜在感染风险高的患者,提前实施干预措施,减少感染发生率,提升整体医疗质量,提高患者存活率和改善预后。

综上所述,本研究基于Transformer构建了一套面向HAI的感染风险预测模型,充分利用了实验室检验数据与影像数据,既考虑了结构优化与性能提升,也兼顾了真实临床环境下的可实施性。未来,我们将继续在多中心数据验证、跨模态深层集成与模型轻量化部署方面深入探索,并将会对更多HAI的亚型进行风险预测。

参考文献

[1]

Mouajou V, Adams K, DeLisle G, et al. Hand hygiene compliance in the prevention of hospital-acquired infections: a systematic review[J]. J Hosp Infect, 2022, 119: 33-48. doi:10.1016/j.jhin.2021.09.016

[2]

Migliara G, Di Paolo C, Barbato D, et al. Multimodal surveillance of healthcare associated infections in an intensive care unit of a large teaching hospital[J]. Ann Ig, 2019, 31(5): 399-413.

[3]

Eid MH, Ţânţu MM, Latour JM, et al. Suction circuit flushing with chlorhexidine decreases ventilator-associated pneumonia: a quasi-experimental study[J]. Front Med, 2023, 10: 1295277. doi:10.3389/fmed.2023.1295277

[4]

Giang C, Calvert J, Rahmani K, et al. Predicting ventilator-associated pneumonia with machine learning[J]. Medicine, 2021, 100(23): e26246. doi:10.1097/md.0000000000026246

[5]

Kassicieh CS, Kassicieh AJ, Rumalla K, et al. Hospital-acquired infection following spinal tumor surgery: a frailty-driven pre-operative risk model[J]. Clin Neurol Neurosurg, 2023, 225: 107591. doi:10.1016/j.clineuro.2023.107591

[6]

Sun C, Pei LJ, Zhang YL, et al. Deep learning-based risk prediction model for postoperative healthcare-associated infections[J]. Zhongguo Yi Xue Ke Xue Yuan Xue Bao, 2022, 44(1): 9-16.

[7]

Ellingsen G, Hertzum M, Christensen B, et al. Large-scale EHR suites and path-dependence[J]. Stud Health Technol Inform, 2022, 295: 372-5. doi:10.3233/shti220742

[8]

Neubig L, Larsen D, Kunduk M, et al. Unstructured electronic health records of dysphagic patients analyzed by large language models[J]. IEEE J Transl Eng Health Med, 2025, 13: 237-45. doi:10.1109/JTEHM.2025.3571255

[9]

Sun MH, Engelhard MM, Bedoya AD, et al. Incorporating informatively collected laboratory data from EHR in clinical prediction models[J]. BMC Med Inform Decis Mak, 2024, 24(1): 206. doi:10.1186/s12911-024-02612-1

[10]

Wang Y, Xiao YY, Yang QD, et al. Clinical prediction models for multidrug-resistant organism colonisation or infection in critically ill patients: a systematic review protocol[J]. BMJ Open, 2022, 12(9): e064566. doi:10.1136/bmjopen-2022-064566

[11]

Jiang YX, Li ZM, Jiang WT, et al. Risk prediction model for postoperative pneumonia in esophageal cancer patients: a systematic review[J]. Front Oncol, 2024, 14: 1419633. doi:10.3389/fonc.2024.1419633

[12]

Liang ZJ, Xu YJ, Hong YF, et al. A survey of multimodel large language models[C]//Proceedings of the 3rd International Conference on Computer, Artificial Intelligence and Control Engineering. Xi' an China. ACM, 2024: 405-409. doi:10.1145/3672758.3672824

[13]

Li SW, Zhang Y, Lin YS, et al. Development and validation of prediction models for nosocomial infection and prognosis in hospitalized patients with cirrhosis[J]. Antimicrob Resist Infect Control, 2024, 13(1): 85. doi:10.1186/s13756-024-01444-y

[14]

国家卫生健康委员会. 医院感染诊断标准(试行)[EB/OL].

[15]

Sun JM, Wang ZF. TransTab: learning transferable tabular transformers across tables[C]//Advances in Neural Information Processing Systems 35. November 28-December 9, 2022. OrleansNew, Louisiana, USA. Neural Information Processing Systems Foundation, Inc. (NeurIPS), 2022: 2902-2915. doi:10.52202/068431-0210

[16]

Lin BY, Lee S, Khanna R, et al. Birds have four legs?! NumerSense: probing numerical commonsense knowledge of pre-trained language models[EB/OL]. 2020: arXiv: 2005.00683. doi:10.18653/v1/2020.emnlp-main.557

[17]

Wang ZF, Gao CF, Xiao C, et al. MediTab: scaling medical tabular data predictors via data consolidation, enrichment, and refinement[EB/OL]. 2023: arXiv: 2305.12081.

[18]

Tsai YH, Bai SJ, Pu Liang P, et al. Multimodal transformer for unaligned multimodal language sequences[J]. Proc Conf Assoc Comput Linguist Meet, 2019, 2019: 6558-69. doi:10.18653/v1/p19-1656

[19]

Tao YZ, Sun T, Muhamed A, et al. Gated transformer for decoding human brain EEG signals[J]. Annu Int Conf IEEE Eng Med Biol Soc, 2021, 2021: 125-30. doi:10.1109/embc46164.2021.9630210

[20]

Zhang Z, Xie J, Zhong W, et al. A multi-modal feature fusion classification model based on distance matching and discriminative representation learning for differentiation of high-grade glioma from solitary brain metastasis[J]. J South Med Univ, 2024, 44(1): 138-45.

[21]

Gasparetto A, Marcuzzo M, Zangari A, et al. A survey on text classification algorithms: from text to predictions[J]. Information, 2022, 13(2): 83. doi:10.3390/info13020083

[22]

Ucar T, Hajiramezanali E, Edwards L. Subtab: Subsetting features of tabular data for self-supervised representation learning[J]. Adv Neural Inf Process Syst, 2021, 34: 18853-65.

[23]

Wang XL, Jin YC, Schmitt S, et al. Recent advances in Bayesian optimization[J]. ACM Comput Surv, 2023, 55(13s): 1-36. doi:10.1145/3582078

[24]

Feng T, Noren DP, Kulkarni C, et al. Machine learning-based clinical decision support for infection risk prediction[J]. Front Med, 2023, 10: 1213411. doi:10.3389/fmed.2023.1213411

[25]

Cho Y, Lee HK, Kim J, et al. Prediction of hospital-acquired influenza using machine learning algorithms: a comparative study[J]. BMC Infect Dis, 2024, 24(1): 466. doi:10.1186/s12879-024-09358-1

[26]

El Arab RA, Almoosa Z, Alkhunaizi M, et al. Artificial intelligence in hospital infection prevention: an integrative review[J]. Front Public Health, 2025, 13: 1547450. doi:10.3389/fpubh.2025.1547450

[27]

Chang CW, Chang CH, Chien CY, et al. Predictive modelling of hospital-acquired infection in acute ischemic stroke using machine learning[J]. Sci Rep, 2024, 14(1): 31066. doi:10.1038/s41598-024-82280-3

[28]

Li Y, Cao Y, Wang M, et al. Development and validation of machine learning models to predict MDRO colonization or infection on ICU admission by using electronic health record data[J]. Antimicrob Resist Infect Control, 2024, 13(1): 74. doi:10.1186/s13756-024-01428-y

[29]

Alzu'bi AA, Watzlaf VJM, Sheridan P. Electronic health record (EHR) abstraction[J]. Perspect Health Inf Manag, 2021, 18(Spring): 1g.

[30]

Han X, Wu WQ, Zhao HM, et al. Developing and validating a prediction model for in-hospital mortality in patients with ventilator-associated pneumonia in the ICU[J]. Ann Palliat Med, 2022, 11(5): 1799-810. doi:10.21037/apm-22-502

[31]

Zhang JB, Yang PP, Zeng L, et al. Ventilator-associated pneumonia prediction models based on AI: scoping review[J]. JMIR Med Inform, 2024, 12: e57026. doi:10.2196/57026

[32]

Cui ZG, Dong YF, Yang HZ, et al. Machine learning prediction models for multidrug-resistant organism infections in ICU ventilator-associated pneumonia patients: Analysis using the MIMIC-IV database[J]. Comput Biol Med, 2025, 190: 110028. doi:10.1016/j.compbiomed.2025.110028

[33]

Liang YJ, Zhu CR, Tian C, et al. Early prediction of ventilator-associated pneumonia in critical care patients: a machine learning model[J]. BMC Pulm Med, 2022, 22(1): 250. doi:10.1186/s12890-022-02031-w

[34]

Hsu JF, Lin YC, Lin CY, et al. Deep learning models for early and accurate diagnosis of ventilator-associated pneumonia in mechanically ventilated neonates[J]. Comput Biol Med, 2025, 189: 109942. doi:10.1016/j.compbiomed.2025.109942

基金资助

国家自然科学基金(3257071033)

广东省自然科学基金(2024A1515011520)

广东省基础与应用基础研究基金(2024A1515012100)

RIGHTS & PERMISSIONS

版权所有©《南方医科大学学报》编辑部2021

AI Summary AI Mindmap
PDF (1505KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/