根据2022年全球癌症统计数据,肺癌是最常见的癌症之一,全球每年新发肺癌病例近250万例,占所有癌症新发病例的12.4%;同时,肺癌也是全球癌症相关死亡的首要原因,约占癌症死亡总数的18.7%
[1]。非小细胞肺癌(non-small cell lung cancer,NSCLC)是最常见的肺癌亚型,占肺癌的85%以上,30%的患者在诊断时已处于晚期
[2]。接受化疗的肺癌患者的中位生存期为7.5个月,而靶向治疗彻底改变了具有特定基因[如表皮生长因子受体(epidermal growth factor receptor,
EGFR)和Kirsten大鼠肉瘤病毒致癌基因(Kirsten rat sarcoma viral oncogene,
KRAS)]变异的NSCLC患者的治疗方式和预后,中位生存期延长至17.5个月
[3]。因此,早期识别患者的基因突变至关重要。
肺癌驱动基因的筛查通常是先经皮肺活检、支气管内活检或手术切除对肿瘤进行组织学取样,然后对组织样本进行基因分子检测或免疫组织化学染色
[4]。然而,由于肿瘤内部异质性,活检中肿瘤浸润细胞存在显著的取样差异,因此取样的组织可能不能代表肿瘤的其余部分
[5]。且驱动突变和受体表达会随着时间推移而变化,往往需要重复进行病理检查
[6]。此外,组织取样过程可能会受到患者耐受性、手术并发症及所获组织的数量和质量等多种因素影响
[7]。因此,迫切需要寻找一种简便、非侵入性、可重复性的方法对患者进行肺癌驱动基因的筛查。
放射组学可通过非侵入性检查(CT或PET-CT)获得的影像中提取定量并可重复的信息,包括人眼难以识别或量化的复杂影像学特征
[8]。提取放射组学特征后可用于统计或进行深度学习,以开发预测各种临床结果的模型。NSCLC因发病率高,肿瘤和周围肺实质之间对比度高,且可通过筛查检测,因此数据可用性好,适用于放射组学的影像学特征提取与应用。在肺癌领域,针对驱动基因的放射组学模型研究已较为广泛。然而不同研究所构建的模型在基因突变预测上存在较大差异。有研究
[9]显示其模型在
KRAS突变的预测中具有较高的准确度,但在
EGFR突变预测方面表现较差;而另一项研究
[10]结果则恰好相反,对
EGFR突变的预测效果较好,对
KRAS突变的预测能力相对较低。临床更需要同时预测多种基因突变的模型。
本研究通过对癌症影像档案(The Cancer Imaging Archive,TCIA)的公开数据集进行分析,提取放射组学特征,构建预测NSCLC患者的EGFR和KRAS基因突变的机器学习模型,以期为临床肿瘤精准治疗提供参考依据。
1 资料与方法
1.1 资料
本研究数据来自TCIA的Lung-PET-CT-Dx数据集。该数据集包含了NSCLC患者的CT及相关临床信息,数据经过严格的质量控制和隐私保护处理。患者纳入标准:1)年龄≥18岁;2)经病理组织学检测诊断为NSCLC;3)有明确基因突变(包括EGFR和KRAS基因突变)。排除标准:缺乏标注或数据不全者。图像质量与标注一致性检查:对下载后的原始CT影像进行质量审查,剔除图像严重失真、噪声过大或分辨率过低的样本,以确保后续特征提取与分析的可靠性。同时,对影像的标注信息与临床数据进行再次比对,排除无法匹配基因信息或缺失关键临床指标的病例。
通过上述筛选后,共得到116例NSCLC患者的CT图像数据,其中包括EGFR野生型92例及EGFR突变型24例,KRAS野生型89例及KRAS突变型27例。每例患者均具备完整的影像资料和基因突变状态标注,从而为后续的放射组学特征提取、数据增强、模型构建和验证提供了高质量的基础数据。
1.2 影像数据预处理与特征提取
对纳入的NSCLC患者CT原始影像进行预处理与特征提取,以实现高质量、可重复、可泛化的模型输入特征。本研究借助Python和PyTorch深度学习框架,对CT影像进行统一的尺寸归一化、标准化处理和数据增强操作,然后利用三维卷积神经网络(three-dimensional-convolutional neural networks,3D-CNN)模型提取高维深度特征,为后续的机器学习建模提供基础(
图1)。
为便于后续特征提取与模型输入,本研究对图像进行了以下处理。1)格式转换。该数据集的注释已标记好肿瘤位置的三维区域,将原始医学影像和分割掩码转化为NIfTI格式方便后续处理。2)感兴趣区(regions of interest,ROI)对齐。将CT和SEG(segmentations)对齐,并提取ROI以适配训练要求。3)归一化与标准化。裁剪分割掩膜的有效区域,将CT图像和分割结果重采样到相同的分辨率,最终形成输入为两通道的3D体数据(CT和SEG)。4)数据增强策略。由于本研究样本量相对有限且类别分布不平衡,为提高模型的鲁棒性和泛化能力,对影像数据采用以下数据增强方法。①随机水平翻转:以50%概率水平翻转图像。②随机垂直翻转:以50%概率垂直翻转图像。③随机旋转:在±20°范围内随机旋转图像。这些数据增强操作可以模拟临床图像观察方向和角度的变化,增加数据多样性,减少模型过拟合风险。增强后的图像与原始图像一同用于后续特征提取过程,从而有效提升最终模型的稳健性。5)3D-CNN特征提取器的选择与实现。本研究采用3D-CNN作为基础架构,用于从CT图像中提取空间-体积特征。与传统的二维卷积不同,3D-CNN能够更好地捕捉医学影像中的三维空间信息。具体操作中,本研究移除了网络的末端分类层,将最后1个三维卷积层的输出作为特征表示。每张CT图像经过3D-CNN处理后,生成1个高维特征向量,包含具有判别性的三维空间特征。这些深度特征随后被输入LightGBM分类器中,利用其高效的梯度提升决策树算法进行最终分类(
图2)。
1.3 特征融合与标签映射
1.3.1 深度特征与基因标签的映射
在提取完所有图像的深度特征后,将其与每个患者的基因标签进行精确匹配。利用样本ID,将提取的图像特征与对应的基因(EGFR或KRAS)突变状态关联。每个样本的图像特征被表示为高维特征向量(由3D-CNN提取),维度为2 048。最终的数据集形成了1个标准的监督学习数据集,其中图像特征作为输入,基因突变状态(0代表野生型,1代表突变型)作为输出。
1.3.2 构建二分类任务
在融合特征后,研究目标转化为1个标准的二分类任务,预测患者是否具有某种特定基因(EGFR或KRAS)的突变。在任务中,输入为两通道的3D体数据(CT和SEG),输出为对应的基因突变标签(0或1)。
1.4 模型训练与优化
1.4.1 模型选择
为实现对基因突变状态的精准分类预测,本研究采用LightGBM模型作为核心分类器。LightGBM采用单边梯度采样技术,能够自动识别并保留对模型学习贡献度大的样本(通常是少数类样本),同时随机采样部分低梯度样本并施加补偿权重,确保在不增加过多计算的情况下显著提升少数类的识别效果,并能避免丢失重要信息,在处理类别不平衡数据时具有较大优势。内置的动态类别权重调节机制和自定义损失函数支持使得模型能够自动适应不同严重程度的类别不平衡问题
[11]。直方图算法的应用进一步增强了稳定性,通过特征离散化和自动分桶策略确保了对稀疏特征和长尾分布的有效处理。在本项分类任务中,由于
EGFR和
KRAS基因的突变型样本较少会带来类别不平衡问题,因此相对于其他分类器,LightGBM在处理类别不平衡问题具有较大优势。
在本研究中,LightGBM模型以两通道的3D体数据(CT和SEG)作为输入,以基因突变状态(0表示野生型,1表示突变型)作为输出,执行二分类任务。
1.4.2 模型优化与超参数调优
在构建模型时,为进一步提升预测性能,对LightGBM的关键超参数通过网格搜索,探索以下不同超参数组合的性能表现,从而选择最优配置。
学习率:1)学习率控制每次迭代中树模型对预测结果的权重更新步长。2)设置较小的学习率有助于稳定模型的学习过程,避免梯度爆炸或模型收敛过快。3)在调优过程中,最终选择0.01作为最佳学习率,平衡了训练效率和模型性能。
最大深度:1)决定了每棵决策树的最大深度。2)树深度较大时,模型可以捕获更复杂的特征模式,但同时也容易过拟合。3)设置为5,在避免过拟合的同时,确保模型具备足够的表达能力。
叶子节点数:1)控制单棵树的复杂度,直接影响模型的拟合能力。2)设置为20,限制树的生长规模,防止模型过于复杂。
弱分类器数量:1)控制弱分类器(决策树)的数量。2)设置为800,确保模型有足够的学习能力,同时通过其他正则化手段避免过拟合。
子样本比例:1)指定每棵树构建时随机选取的样本比例。2)设置为0.8,通过引入随机性降低模型对部分训练数据的依赖,提高泛化能力。
列采样比例:1)定义每棵树构建时使用的特征子集比例。2)设置为1.0,即使用全部特征,表明特征维度对本任务的影响较小。
L1(reg_alpha)和L2(reg_lambda)正则化:1)LightGBM支持L1和L2正则化,通过约束特征权重防止过拟合。2)L1正则化设置为0.5,L2正则化设置为1.0,在特征选择与模型平滑性之间取得平衡。
最小子样本数:1)决定叶子节点分裂所需的最小样本数。2)设置为30,避免模型学习过于局部的模式,增强鲁棒性。
正样本权重:1)用于处理类别不平衡问题,调整正样本的权重。2)设置为5,有效缓解数据分布不均衡对模型性能的影响
1.5 模型评估方法
本研究采用基于分层5折交叉验证的随机搜索策略。首先将原始数据集通过分层抽样划分为训练集(80%)和独立测试集(20%),确保两者保持相同的类别比例。在超参数优化阶段,训练集进一步被分为5个互斥的子集,每次使用其中4个子集(64%全量数据)进行训练,剩余1个子集(16%全量数据)作为验证集,循环5次使得每个子集均参与验证。该过程采用分层抽样策略严格保持每个子集中阳性与阴性样本的比例与原始数据一致,同时通过随机搜索对100组超参数组合进行高效探索,以验证集受试者操作特征(receiver operator characteristic,ROC)曲线-曲线下面积(area under the curve,AUC)的平均值作为参数优化依据。最终模型性能在全程未参与训练和参数选择的独立测试集上进行评估,这种双重验证体系保证了超参数选择的可靠性和性能评估的无偏性。
1.6 消融实验
为评估不同分类器在预测NSCLC患者EGFR和KRAS突变状态中的性能贡献,对随机森林、支持向量机(support vector machine,SVM)、XGBoost和LightGBM 4种分类器进行实验,形成了4种模型的对比组。每个模型使用相同的特征集,通过5折交叉验证进行训练和评估,计算以下性能指标:AUC、精确度、敏感度、F1分数和准确度。实验设置保持一致,模型超参数通过网格搜索优化。
1.7 决策曲线分析
采用决策曲线分析(decision curve analysis,DCA)评估本研究模型的临床实用性。该分析方法通过量化不同决策策略下的临床净获益来判断模型的价值。绘制3条曲线进行比较:1)基于本研究模型预测结果的决策曲线;2)假设所有研究对象“均接受干预”(Treat all)的策略曲线;3)假设所有研究对象“均不接受干预”(Treat none)的策略曲线。模型的临床价值体现在其决策曲线高于“均接受干预”和“均不接受干预”2条参考曲线的阈值范围。
1.8 模型对比
将本研究模型的预测性能与使用相同数据集的既往放射组学模型(Pinheiro等
[12]、Shiri等
[13]、Zhang等
[14]、Le等
[15])进行比较,评估指标包括敏感度、特异度、准确度和AUC。
1.9 统计学处理
使用SPSS 19.0统计学软件对数据进行统计分析。计量资料比较采用Mann-Whitney U检验,计数资料比较采用χ2检验。P<0.05为差异具有统计学意义。
2 结 果
2.1 一般资料
EGFR野生型组和EGFR突变型组患者的年龄[(68.09±8.73)岁 vs (70.00±10.08)岁]和性别[男性72例(78.26%) vs 15例(62.50%)]差异均无统计学意义(均 P>0.05)。EGFR突变型组中不吸烟患者所占比例显著高于EGFR野生型组(33.3% vs 9.8%;χ2=9.459,P=0.009),表明EGFR突变状态与患者吸烟史呈显著负相关。KRAS野生型组和KRAS突变型组患者年龄、性别、吸烟史差异均无统计学意义(均P>0.05)。
2.2 分类器消融实验结果
消融实验结果显示LightGBM分类器在
EGFR和
KRAS分类中均表现良好,AUC分别达到0.947 6和0.904 2(
表1、
表2)。
2.2 <bold><italic>EGFR</italic></bold>突变预测
模型在预测
EGFR突变的AUC为0.947 6(
图3),表明模型对于
EGFR突变样本与非突变样本的区分效果良好。预测
EGFR突变的准确度为89.66%,精确度为87.50%,敏感度为93.33%,F1分数为90.32%(
表1)。
DCA结果显示该模型在阈值0.517 2~0.944 7之间均具有较高的净收益及临床应用价值(
图4)。
2.3 <bold><italic>KRAS</italic></bold>突变预测
模型在预测
KRAS突变的AUC为0.904 2(
图5),表明模型对于
KRAS突变样本与非突变样本的区分效果良好。预测
KRAS突变的准确度为87.10%,精确度为87.50%,敏感度为87.50%,F1分数为87.50%(
表2)。
DCA结果显示该模型在阈值0.516 1~0.916 4之间均具有较高的净收益及临床应用价值(
图6)。
2.4 模型对比
模型对比结果显示:在
EGFR和
KRAS基因突变预测中,本研究模型的AUC、敏感度、特异度、准确度均高于先前研究的最佳结果(
表3)。
3 讨 论
肺癌是全球性的健康问题,大约一半的肺癌新病例发生在亚洲,其中NSCLC占80%~85%。近年来中国肺癌新发病例数持续上升
[16-17]。有效的早期检测对肺癌防治至关重要。CT作为肺癌筛查的常规方法,结合影像基因组学方法已广泛用于预测肿瘤患者的靶向基因突变情况
[9, 18-19]。关于NSCLC的基因突变预测,目前研究主要集中在预测
EGFR的突变。一项荟萃分析
[20]显示:纳入的128篇文献中,有121篇研究侧重于
EGFR突变状态,而分析对
KRAS、
ALK、BRAF、ROS1和
MET等基因突变的关注相对较少。本研究采用机器学习方法对患者CT图像提取出的影像组学特征建模分析,以有效检测NSCLC患者的
EGFR和
KRAS基因突变。本研究结果表明,基于放射基因组学的LightGBM模型可用于通过CT图像预测NSCLC患者
EGFR和
KRAS基因的突变状态,AUC分别为0.947 6和0.904 2。模型在预测2种驱动基因突变时的敏感度、特异度、F1分数等指标上表现良好,具备较强的泛化能力。
近年来,利用影像组学预测肺癌靶向基因的研究并不少见。但有些仅考虑了单一驱动基因突变情况,无法同时预测多个基因。Dong等
[21]从CT影像中提取了总共1 287个放射组学特征,最终选择28个特征并构建列线图以预测
EGFR突变,AUC为0.79,灵敏度为84.2%,特异度为65.4%。一项荟萃分析
[22]显示,基于14项CT放射组学模型研究对NSCLC患者
EGFR突变状态的预测的汇总ROC AUC值为0.8。Mahajan等
[23]在NSCLC的
EGFR突变预测研究中,将CT放射组学特征构建的机器学习模型与端到端深度学习模型进行对比,发现整合CT放射组学与深度学习的模型预测效能最优,AUC为0.88±0.03。Wang等
[24]建立了一种基于CT影像的全自动人工智能系统,预测了中国和美国的9个队列18 232名患者的
EGFR基因突变,在TCIA队列中AUC为0.755(0.709~0.798)。Gong等
[25]对比多任务深度神经网络、放射组学模型后,开发的基于特征融合策略的混合模型在预测肺癌患者
EGFR突变的AUC为0.86±0.03。Wang等
[26]基于放射组学特征,建立了预测
KRAS基因突变的肺癌放射组学评分模型,结果显示:与CT模型相比,PET/CT放射组学评分模型预测
KRAS突变的AUC更高(0.834 vs 0.770)。Schöneck等
[27]使用多种模型、特征和数据集的组合基于CT对NSCLC中的
KRAS突变进行预测,5个模型的集合AUC为0.53,F1分数为0.67,模型预测
KRAS突变的准确度不足以用于临床。本研究利用相较于PET/CT更经济简便的CT影像学特征进行建模分析,考虑了2种基因突变情况,预测
EGFR与
KRAS基因表达的AUC均高于既往研究水平,具有较高的预测能力。
EGFR突变预测中,模型准确度、精确度、敏感度和特异度分别为89.66%、87.50%、93.33%和85.71%,在识别突变患者与避免误判方面实现了较好的平衡。KRAS突变预测准确度为87.10%,精确度、敏感度及特异度均为87%左右,同样表现出稳定且均衡的分类性能,提示模型在2种基因的突变检测中均具有较好的临床应用潜力。
对于多靶向基因预测,本研究模型各项指标上表现更加优秀。Li等
[28]开发了一种3D-beta自动编码器进行肺癌成像分析。该模型在肺癌CT公共数据集中提取特征信息,可有效预测包括
EGFR或
KRAS突变状态。尽管该研究中验证了3D-beta与对比模型的F1分数表现同样出色,但缺乏AUC值等其他参数的对比。Rinaldi等
[10]使用LASSO-Logistic回归模型构建了放射组学评分模型来预测基因突变状态,该模型对
EGFR的AUC为0.86,但对
KRAS的AUC为0.61,这可能因其验证人群与训练人群相比样本量较小有关。Prencipe等
[9]从公共数据库的CT影像中提取放射组学特征来检测
KRAS和
EGFR基因突变,最终利用多层感知机(multi-layer perceptron,MLP)预测
EGFR和
KRAS突变状态的验证集AUC分别为0.69和0.82。Shiri等
[29]从136名NSCLC患者的CT、PET和PET/CT图像中提取放射组学特征,开发了经ComBat协调后的多变量预测模型来预测
EGFR和
KRAS基因突变状态,AUC分别为0.92~0.94和0.91~0.94。本研究的模型同时对2种基因的突变都有较高的预测水平,且平衡了特异度、敏感度和F1分数,具有较好的泛化能力。
上述文献中多使用PyRadiomics提取放射组学特征,本研究中运用3D-CNN对3D影像进行处理。3D-CNN具备端到端学习能力,能够直接从原始三维医学影像中自动提取深层特征,无需依赖人工设计特征,从而更全面地捕捉肿瘤的复杂异质性和空间结构信息
[30]。相比之下,PyRadiomics主要基于二维切片计算特征,可能会丢失部分三维空间连续性信息。此外,3D-CNN通过三维卷积核直接处理体积数据,完整保留肿瘤的空间上下文关系,包括内部组织特征和周围浸润情况。这种特征提取方式与下游任务(如分类和预测)是联合优化的,使得所学特征更具针对性,而PyRadiomics则需要额外的特征筛选和建模步骤。3D-CNN对图像预处理的依赖性较低,能够通过数据增强提升模型的鲁棒性,而PyRadiomics提取的特征容易受到图像标准化程度的影响。
本研究尚存在一些局限性。首先,数据来自公共数据库,样本量相对较小,且为回顾性研究,潜在的选择偏差可能会影响到模型的稳健性和普遍性。具体而言,由于数据样本有限,模型可能会过度拟合训练数据中的统计波动,而无法有效泛化到未见样本。在小样本场景下,传统的训练-验证机制可靠性下降,使得模型选择和超参数调优过程更容易陷入局部最优,影响模型的稳健性和可推广性。未来本研究团队计划收集更多的外部验证数据,以扩大样本量,从而提高模型的泛化能力并增强其在临床应用中的可靠性。其次,数据采用的是数据库已有的分割注释,尽管采用此数据集的多数研究均使用该注释,但再次人工分割注释可能会增加模型的可靠性。本研究采用3D-CNN进行特征提取,与PyRadiomics不同,3D-CNN能够端到端地学习深层次影像学特征,更全面地捕捉肿瘤的空间结构信息,但3D-CNN的黑箱特性限制了对具体特征(如形态特征、纹理特征等)贡献度的直接量化。最后,样本的选择来自于国外研究数据库,结果可能缺乏普遍性,需要在中国人群中进一步验证。
本研究基于3D-CNN结合数据增强和LightGBM分类器,构建了1个高效的肺癌基因突变预测模型。本研究对数据进行了数据增强与过采样处理,在图像数据集上应用了多种数据增强方法(如水平翻转、垂直翻转和旋转),扩充了数据的多样性,避免了模型在小样本数据上的过拟合。本研究利用3D-CNN提取高维影像特征,随后通过LightGBM模型的超参数调优,进一步提升了模型的泛化能力。与已有的模型相比,本研究模型在EGFR和KRAS基因突变预测的AUC上实现了显著提升。DCA结果表明,模型在EGFR基因预测中,在阈值0.517 2~0.944 7范围内均能获得较高的净收益,同时在KRAS基因预测中,在阈值0.516 1~0.916 4之间亦保持较高的净收益,说明本模型在不同风险阈值下均具备稳定的决策效能。这一特性表明,模型可依据具体的临床诊疗需求进行灵活调整,以在敏感度与特异度之间实现最优平衡,从而优化个体化决策过程并提高临床应用价值。总之,本研究模型在EGFR和KRAS突变状态的早期预测上更为准确,可以帮助识别具有药物敏感性倾向的患者,有助于患者更个性化的治疗决策。
国家自然科学基金(81602028)