卵巢癌是公认最致命的妇科癌症,其死亡率位居妇科癌症之首
[1]。中国约48%的卵巢癌患者在早期被发现,但是卵巢癌的5年生存率仅约40%
[2]。卵巢癌的早期临床症状不具备特异性,与一些良性妇科疾病类似,如何找到有效、可靠的诊疗手段,实现早期诊断仍是临床难题。已有的诊断方法如利用卵巢癌的关键肿瘤标志物CA125联合经阴道超声或其他标志物(HE4),存在敏感性低的局限性,导致患者错过最佳的治疗窗口使肿瘤进一步发展,不能显著改善卵巢癌患者的生存率
[3]。
在常规健康体检中,部分实验室检查项目如血清白蛋白浓度和淋巴细胞比率被证明与卵巢癌的诊断和预后相关,研究表明这些检查项目的成分(如免疫细胞,凝血细胞)直接或间接的参与了肿瘤的发生、发展和免疫逃逸的过程,也验证了这些实验室检验项目作为有效肿瘤标志物的潜力
[4]。这些实验室项目由于其较低的成本和便捷的获取方式,成为了科研领域广泛使用的研究工具。尤其是在医学研究领域中,实验室项目可以作为表格数据的输入形式,具有清晰、结构化的特点,便于分析和处理。
近年来,Transformer模型以其在处理序列数据方面的优势,逐渐被引入生物标志物预测、疾病诊断、药物发现等多个领域
[5]。传统的机器学习模型在面对高维度、复杂关系的数据时,难以有效捕捉其中的深层次联系。而Transformer模型通过自注意力机制
[6]能够对输入数据中的各个特征之间的关系进行建模,从而更好地理解数据中的复杂模式。例如,Gorishniy等
[7]通过调整Transformer架构,利用注意力机制对表格特征进行有效编码,在学习特征间的复杂交互方面表现出色。Somepalli等
[8]通过引入样本间注意力机制,使模型能更好地捕捉数据行之间的关系。Wang等
[9]通过在Transformer的前馈网络中加入一个逐令牌的门控层,实现了对特征信息的动态筛选,使其能根据上下文选择性地增强或抑制特定信息。
本研究提出了一种基于门控机制的改良Transformer框架,旨在提升深度学习模型在复杂表格数据上的性能与可解释性。该框架的创新性在于通过多层网络架构提取显著特征的同时,其独特的门控设计能够判断每个特征对预测结果是起正向还是负向作用。我们将此模型应用于利用常规、高维检验数据进行卵巢癌鉴别这一的临床任务中,通过将原始数据有效编码为高维向量,模型能够有效识别特征间的潜在关系。结果表明,其预测性能超越了传统的机器学习模型,该方法在处理复杂医疗表格数据方面具有优越性,可为临床决策支持提供重要的技术保障。
1 资料和方法
1.1 研究对象
本研究回顾性收集2012年1月1日~2021年4月4日从同济妇产科医院收治的320例卵巢癌患者及良性病变患者(
表1)。所有患者被随机分为训练集、验证集和独立测试集,数据集用于预测模型的构建和性能评估。该研究已获得同济妇产科医院及研究所的伦理审核批准(伦理批号:2019-S984)。所有参与者均签署书面知情同意。
纳入标准:患者从确诊前1个月至接受任何治疗期间完成的实验室检测结果。排除标准:有其他恶性肿瘤或癌前病变病史、近6个月内妊娠或HIV感染者;非同济医院新确诊的病例;因缺乏可用实验室检测数据而导致验证结果不可靠的个体。卵巢癌组纳入原发性恶性卵巢癌、输卵管癌或腹膜癌患者;对照组则包括卵巢、输卵管及子宫无病变的健康个体,或存在卵巢、输卵管及子宫良性病变的参与者。
1.2 研究方法
本研究创新性地提出了一种基于Transformer的多实验室检验指标分类模型(
图1)用于鉴别卵巢癌患者,该模型通过编码器将检验指标特征进行特殊的编码表示,利用Transformer捕捉特征间非线性的潜在关系的同时得到统一的嵌入输出,再使用浓缩的表示全局信息特征分类层通过全连接层用于分类卵巢癌。研究步骤主要有:数据预处理、模型构建、模型验证与评估。为验证模型的有效性,对模型的性能与表格数据领域常用的机器学习性能进行比较。
1.2.1 特征选择
从99项实验室指标和临床数据中,采用单变量过滤式特征筛选以降低维度并缓解过拟合,对每个候选检验指标分别进行ANOVA F检验
[10],计算其与二分类结局之间的区分度即F统计量,并按F统计量降序选择前20个特征进入建模(
表1)。
1.2.2 数据预处理
由于部分检验项目由不同医疗器械公司的仪器测量,且即使为同一中心相同检测项目也可能出现不同单位,因此进行适当单位换算。例如游离三碘甲状腺原氨酸(FT3)可记录为“pg/mL”或“pmol/L”,统一换算:(pg/mL)×1.54=(pmol/L);甲胎蛋白(AFP)可记录为“ng/mL”或“IU/mL”,统一换算:(ng/mL)= (IU/mL)/1.11;带或不带“%”,统一换算为带“%”。数据集中实验室项目存在缺失特征,且直接丢弃含有缺失值的行和列可能会损失有价值的信息,所以采用多重插补链式方程(MICE)算法对实验室项目中的缺失值进行插补
[11]。MICE 针对每个包含缺失值的特征进行插补。将该特征视为一个目标变量,使用其他不含缺失值的特征作为预测变量。以该特征的均值作为初始猜测,每一列的缺失值通过该列的回归模型进行预测,然后更新插补结果。
其中f为回归模型,为其他特征数据, m为迭代次数。
最后对数据每一列特征进行标准化,标准化在深度学习中是很常见的技术,统一尺度使数据分布更稳定,同时加快收敛速度
[12]。
其中 Z是标准化后的值。x是原始数据值。 是该特征在训练集中的均值。 是该特征在训练集中的标准差。
1.2.3 模型构建
对表格数据的处理核心是转化为带有语义的高维编码。首先在已经得到填充完整的数据基础上,引入列名描述。列名描述决定了该列单元格中的意义,机器学习常常会将单元格所处的语义忽略。例如在卵巢癌的纳入特征中,“尿葡萄糖”列使用“+-”、“+”、“++”表示不同的葡萄糖浓度强度:“+-”表示弱阳性(轻度存在尿糖),对应数字0;“+”表示阳性(中等程度的尿糖),对应数字1;“++”表示强阳性(显著存在尿糖),对应数字2;如果患者该单元格值为2,则表明该患者可能有糖尿病的风险;同理描述年龄的列单元格值为50,则表示50岁而非体质量50 kg。
1.2.3.1 嵌入表示
对表格数据的任意列进行分类,分为连续值列(表示数值单元格)、布尔值列(表示只有0或1的单元格)、多分类列(表示包含2种以上类别的单元格)。任何文本特征先转为数值特征,如“尿葡萄糖”,使用标签编码将文本或者表示分类的符号转换为表示类别的数值。下一步将列名描述纳入到编码,能使最后的嵌入语义上更加丰富,从而最终提高模型的性能。做法是加载预训练分词器获取词汇表大小以及填充Token的ID,确保每个不同列名都对应唯一的ID;最后通过嵌入层将输入的Token ID转换为高维嵌入,表示完成对列名描述的转换。
传统的嵌入方法对连续数值特征的转换效果差
[13],易丢失大部分原始信息。本研究对连续特征的处理是先完成对列名描述转换,得到列名的嵌入向量
,c-tokens是预训练分词器BERT Tokenizer将列名分为的标记数,d为模型设定的维度数;最后将列嵌入向量
与数值特征大小
相乘得到
,表示连续特征能够尽可能的利用原始信息。
布尔值列的取值只存在0和1两种情况,,本文目的是对于列名数值为1的样本,保留该特征的列名描述;反之则删除该列名描述。同样,布尔值的列名描述和连续值的列名描述转换方法相同,列嵌入向量,同样是用相乘操作只保留布尔值为1的列嵌入向量。
多分类列的处理为将列名描述和值拼接起来作为一个字符串,例如有一个样本的类别特征为“红细胞形态=混合型,尿葡萄糖 = 阴性”,则这一行处理过以后的表示为“红细胞形态[空格]混合型,尿葡萄糖[空格]阴性”,再使用分词器进行分词得到处理完的Tokens IDs,再输入到嵌入层升维得到列嵌入向量。
最后,
、
和
都通过层归一化
[14]和相同的线性层进行处理,以对齐到相同的空间,然后与空的
嵌入拼接,得到最终的表示
=
⊕
⊕
。假设在一个医学数据样本中,存在2个列分别表示:“血葡萄糖”和“尿葡萄糖”。传统的方法可能会将这2个列视为独立的特征,但这2个列实际上描述的却有相同的内容“葡萄糖”。这种编码方式能够敏锐捕捉到这一联系,减少了特征之间的冗余,注意力集中在特征间的潜在联系。
1.2.3.2 改进后的编码器
编码器部分基于经典神经网络Transformer改进的版本Tanh Gating Transformer
[15]。该模型包含2个核心的组件:多头自注意力层和tanh gating前馈层。在第k层的输入表示可以表示为:
表明第一层为数据的总嵌入表示E;多头权重矩阵为
。单头权重矩阵
维度为
[16]。得到多头注意力输出
再经过逐个tokens遍历的tanh gating前馈层进行编码输出,其中下列公式中的“*”是逐个元素相乘:
此处得到编码器的输出
,该机制能够进一步评估该特征代表的token对于预测产生的影响,可以是正相关或者负相关的影响。最后分类器使用输出
的
层,
层代表了整个输入序列的聚合表示,用于输出最终预测概率
[17]。
1.2.3.3 全连接层输出概率
得到层通过一个简单的线性分类器,也就是映射到二分类的全连接层,为每个样本生成分类概率分布的logits输出。
1.3 模型验证与评估
通过比较研究模型与机器学习基线模型性能评估模型,在2种情况下进行评估:数据未受到扰动;对数值列引入高斯噪声和对分类列进行随机替换部分值。
1.3.1 数据集添加噪声
对于数值特征列,通过引入高斯噪声来模拟实际应用中的测量误差或数据丢失
[18]。患者的实验室检测结果可能由于设备误差、记录错误或传输问题而出现偏差。通过对这些数值特征引入噪声,可以更真实地模拟医院环境中的数据问题,以帮助模型在面对不完美的医疗数据时,仍然能够做出准确的预测和决策
[19]。噪声是根据每个数值列的标准差乘以一个噪声比例生成的。这些噪声加到原始数据的数值特征中,从而生成带噪声的数值数据。噪声的标准差与特征的标准差成正比,以确保噪声的规模与特征的变化范围匹配。
对于分类特征列,通过随机替换其中一部分值来引入噪声。具体操作:对于每个分类特征,获取该特征的所有唯一值,以指定的概率随机选择这些值进行替换。替换后的值是从该特征的原始取值中随机抽取的。这种方式模拟了分类数据中的错误标签或记录错误。
1.3.2 模型架构与实验设置
在所有实验中保持设置固定。编码器使用2层改进后的Transformer,其中token的嵌入向量维度为128,内部层的隐藏维度为256。注意力模块具有8个头。选择Relu激活函数,并不使用dropout。使用Adam优化器训练模型,学习率设置为1e-4,不使用权重衰减;批量大小为{16,32,64}。对于监督训练,设定早停的耐心值为5。实验设备为配备RTX A6000 GPU、Intel Xeon Platinum 8352V CPU和256GB内存的机器。
1.3.3 基准模型
LightGBM
[20];逻辑回归
[21];支持向量机(SVM)
[22];随机森林
[23];梯度提升
[24];XGBoost
[25];K近邻 (KNN)
[26]。
1.3.4 评价指标
通过在独立测试集上进行评估,比较各模型的泛化能力。评估指标包括:受试者工作特征曲线下面积(AUC)、准确率(ACC)、灵敏度(SEN)和特异度(SPE)。
2 结果
2.1 原始数据上模型性能比较
比较机器学习和Transformer变体模型的评价指标显示,与其他7种机器学习算法比较,Transformer变体模型有最优的分类能力;ACC、SEN、SPE几乎持平最佳性能(
图2A,
表2)。
2.2 扰动数据上模型性能比较
选取比较有代表性的噪声参数设置,对扰动数据设置为噪声比例
,数值列加入扰动概率为0.1和分类列数值交换概率设置为0.1。结果显示(
图2B,
表3),机器学习模型性能普遍下降,对噪声较为敏感;Transformer变体模型在加入噪声以后,性能下降最小,表现最为稳定,显示出在噪声环境下的稳健性和泛化能力。
2.3 SHAP图特征重要性可视化分析
SHAP分析结果显示(
图3),CA125和年龄对卵巢癌的预测影响最大白蛋白、白球比值、中性粒细胞比例、纤维蛋白原、D-二聚体、凝血酶时间等指标也有较大贡献。
3 讨论
本研究创新性地提出了一种基于 Transformer 变体的分类模型,以常规实验室检验指标为特征,实现卵巢癌良恶性病变的智能鉴别。该模型在区分卵巢癌方面表现出优异的准确性与稳健性,依托常规化验数据即可实现快速、低成本的初步筛查,为临床提供了一种高效可行的辅助诊断工具。
与多种经典机器学习算法比较,Transformer 变体模型在同一数据集上的 AUC、准确率、灵敏度和特异度均处于领先水平,显示出良好的判别能力与泛化性能。特别是在加入噪声(数值扰动、类别交换)后,模型性能几乎未受影响,明显优于传统树模型的退化表现,体现出较强的鲁棒性。本研究的改良结构在性能与稳定性上均略有提升,尤其在小样本和特征分布偏移条件下更具优势,说明该模型对真实临床数据的适应性更好。这种优势可能源于模型在特征嵌入与注意力机制上的改进。通过同时编码列名与取值语义,模型能够捕捉到实验指标间的潜在非线性关系(如白蛋白与球蛋白的交互),而无需显式构造交叉特征。多头自注意力机制在全局范围内建模指标间的依赖关系,使模型能够学习复杂的病理关联模式。结合层归一化与非线性门控机制,模型在噪声扰动下保持了稳定的决策边界,从而在临床环境中具有更好的适应性与可靠性。
在临床应用层面,本研究结果表明,利用常规实验室检验数据可实现卵巢癌良恶性病变的区分。这一思路突破了以往依赖影像学、肿瘤标志物或复杂模型组合的诊断框架,降低了成本和操作复杂度。特别是在 CA125 正常或非特异性升高的患者中,该模型可提供额外的判别依据,有助于早期发现潜在高危病例。与既往研究多聚焦于影像学特征(如超声影像组学、MRI放射组学)或单一生化指标建模不同,本研究通过整合多系统实验室指标,实现了疾病状态的整体评估,更符合临床“多维度综合判断”的诊断逻辑。
基于SHAP的解释性分析显示,CA125与年龄对模型贡献最大,这与临床诊断经验高度一致,提示它们在模型中起核心作用
[27, 28]。例如,CA125 为应用最广的血清标志物而发病风险随年龄增加。此外,模型还识别出白蛋白/球蛋白比值、中性粒细胞比例、纤维蛋白原、D-二聚体和凝血酶时间等与炎症、营养及凝血状态相关的指标,提示卵巢癌发生可能伴随多系统失衡
[29]。整体上,模型不仅依赖单一肿瘤标志物,还结合了多维度血液学与代谢指标,从而提升了对卵巢癌预测的准确性和临床解释价值
[30]。这与既往研究提出的“炎症-凝血-营养”三联机制相一致,为 CA125 正常或轻度升高病例提供了新的辅助判别依据,具有重要的临床解释意义
[31]。
虽然本研究提出的模型在鉴别卵巢癌良恶性有较于机器学习更优越的性能,但是仍然存在一些局限性。首先,列名的实验室命名需要统一,否则模型可能学习不到共享语义空间,但是对于跨中心数据有难度。其次,模型的训练与评估样本量有限,且真实临床卵巢癌发病概率约在0.006%,正负例与真实分布不一致。不同医疗机构在检验方法、仪器平台、参考区间等方面存在差异,均可能影响模型可迁移性表现。因此,后续需要多中心、跨地区的前瞻性研究开展独立外部验证,重新评估模型的稳定性与校准情况。最后,目前未系统比较CA125联合HE4、ROMA 等卵巢癌临床常用方法,也未充分开展围肿瘤分期、病理亚型(如上皮性、非上皮性)的分层评估。后续应在更大样本量中进行分层建模,并报告各亚组的判别与校准指标。
综上所述,本研究提出的基于 Transformer 的变体模型,在干净与噪声数据集上均表现出较高的判别性能和稳定性。SHAP 分析结果与临床生物学机制高度一致,显示该模型不仅依赖CA125等经典标志物,还充分挖掘了炎症、营养及凝血等多维度信息,为卵巢癌的早期识别与随访管理提供了新的工具。未来需开展多中心、前瞻性研究,并结合症状学、影像学及多组学数据进行验证与扩展,以进一步提升模型的泛化能力与临床应用价值。
国家自然科学基金(82572381)
国家自然科学基金(82404078)
广东省自然科学基金(2024A1515012100)
广东省基础与应用基础研究基金项目区域联合基金-青年基金项目(2023A1515110701)