全球最新癌症统计显示,食管癌在全球常见癌症中发病率居第11位,同时在癌症相关死亡中居第7位
[1-2]。全球约50%的食管癌新发病例和死亡病例发生在中国,每年新发病例数超过32万,死亡人数高达30万余人,疾病负担较大
[3-4]。我国食管癌的主要病理学类型为食管鳞状细胞癌(esophageal squamous cell carcinoma,ESCC),症状隐匿,且具有高度侵袭性,极易侵袭扩散至食管壁全层,绝大部分患者就诊时已处于疾病进展期
[5-6]。其T分期(肿瘤浸润深度)是决定治疗方案及评估预后的核心因素。准确的T分期不仅直接关系到治疗策略的选择(如内镜下切除术与外科手术的区分),也与淋巴结转移风险、局部复发率及患者总生存期显著相关。食管癌T分期的“金标准”——病理组织学检查,精确度虽高,但因其具有侵入性难以广泛应用于临床实践。
近年来,影像组学与机器学习技术的结合为临床诊疗提供了新的辅助工具。影像组学能够从常规医学图像中提取人眼难以识别的定量特征
[7-8],机器学习可对高维特征进行有效建模与分析
[9-10]。二者的融合不仅有助于深入挖掘图像中与疾病发生、发展相关的隐匿信息,也在肿瘤的无创诊断、精准分期及疗效评估等方面展现出潜在价值,为实现个体化、精准化的临床决策提供了新的可能。在食管癌研究领域,已有学者尝试应用影像组学或深度学习技术辅助进行肿瘤分期、疗效预测及预后评估
[11]。然而,在利用CT影像术前无创鉴别食管癌T分期方面,目前多数研究或侧重于单一的影像组学方法,或仅使用深度学习模型,未能充分发挥多模态数据的互补优势
[12-14]。更重要的是,准确区分Tis ~ T1a期与T1b ~ T3期对于临床决策至关重要,前者是内镜治疗的潜在适应证,而后者通常需外科手术等更积极的治疗。基于此,本研究整合CT影像的影像组学特征与深度学习特征,并通过机器学习构建并验证一个复合模型,以无创、准确地术前鉴别食管癌的肿瘤浸润深度(Tis ~ T1a期
vs T1b ~ T3期),为临床医师制定个体化治疗方案(尤其是选择内镜下切除术或食管癌根治术)提供客观、有效的辅助决策工具,以期改善食管癌患者预后及生存质量。
1 对象与方法
1.1 数据来源
纳入2018年1月至2025年6月就诊于解放军总医院第一医学中心的食管腺鳞癌患者临床资料。纳入标准:(1)经病理证实的食管腺鳞癌患者,术前2周内行CT检查;(2)行检查前所有患者未接受包括手术、放射治疗和化学治疗等任何治疗。排除标准:(1)伴有其他系统恶性肿瘤史,经过手术治疗或放化疗;(2)图像质量欠佳,影响数据采集、测量及评估;(3)临床信息不全。本研究已经解放军总医院医学伦理委员会批准(编号:S2025-493-02)。
1.2 CT影像采集与处理
1.2.1 CT图像采集
影像学检查采用飞利浦 Brilliance极速ICT 512层螺旋CT扫描仪进行。扫描参数如下:管电压120 kV,旋转速度0.2 s/r,探测器准直宽度80 mm,扫描矩阵512×512,标准层厚5 mm,对图像均进行1.5 mm薄层重建,螺距0.75。患者取仰卧位,双手上举置于头两侧,送入扫描架进行扫描。
1.2.2 图像预处理
获取患者原始医学数字成像和通信(digital imaging and communications in medicine,DICOM)格式的CT数据后,利用Python 3.9版本的开源数据处理工具包(包括pydicom和SimpleITK)对所有CT图像进行标准化格式转换、偏置场校正(采用N4 Bias Field Correction算法)和归一化处理。随后,将预处理后的图像导入MRIcron软件进行标准化处理,调整窗宽和窗位至统一的灰度参数范围(纵隔窗:W=500 Hu,H=5 Hu)。
1.2.3 图像分割及特征提取
由两名胸外科副主任医师独立完成对术前CT平扫的薄层图像的人工分割。2名医师均具备CT影像解释资质并接受过专门的分割培训。他们在观察病变形态特征的基础上,多平面重组并找到肿瘤直径的最大横轴位层面,沿着病变边缘逐层描绘感兴趣区域(region of interest,ROI),勾画时避开食管空腔和其他非肿瘤组织结构。为提高分割质量,采用MRIcron软件中的手绘素描工具,将图像放大至原始分辨率的3倍进行精细描绘,最终将各层ROI合并形成三维感兴趣体积(volume of interest,VOI)。为确保分割结果的可靠性和一致性,2名医师在处理随机分配的数据集时,严格遵循质控流程,有分歧时协商达成一致。评估前,2名医师对患者的所有临床及病理信息均不知情。
1.3 结局指标
本研究的结局指标为基于病理金标准的T分期。为契合内镜治疗决策的临床关键需求,将病理T分期转换为一个二分类变量:早期组(Tis ~ T1a期)与进展期组(T1b ~ T3期)。
1.4 特征筛选与模型预构建
来自解放军总医院第一医学中心的全部数据作为训练集。
影像组学特征提取:在VOI与原始DICOM文件的空间对齐之后,使用开源Python 3.9工具包进行影像组学特征提取,分为形状特征、强度特征和纹理特征三类。其中,纹理特征旨在表征勾画区域内像素与其邻近区域像素之间的关系,基于灰度共生矩阵、灰度区域大小矩阵、灰度游程矩阵、邻域灰度差异矩阵、灰度依赖矩阵进行计算。
深度学习特征:基于三维残差网络
[15] (3D Residual Network,3D-ResNet)开发了深度卷积神经网络用于提取相关深度学习特征。通过将标准化后的CT图像及对应的VOI掩膜数据转换为标准化的NumPy数组,其深层卷积层通过多层非线性变换,自动提取出512个高层次特征。
特征变量为:从CT图像中提取的影像组学与深度学习特征。从训练集中提取影像组学特征后,采用Z-score归一化方法,以消除因设备或扫描参数差异导致的特征偏差,同时保持数据的分布特性;并使用类内相关系数(intraclass correlation coefficient,ICC)对特征进行一致性评估,仅保留ICC值>0.75的特征。在特征选择阶段,使用最小绝对收缩和选择算子(least absolute shrinkage and selection operator,LASSO)回归,并结合五折交叉验证方法。对于深度学习特征,本研究采用类似的方法降维。通过设定前融合的方法,同时结合早停策略避免过拟合,确定了用于预建模的特征。
1.5 模型开发
本研究采用6个机器学习模型基于影像组学和深度学习特征建立三类模型:(1)影像组学模型(radiomics model,Rad);(2)深度学习模型(deep learning-based model,DL);(3)影像组学+深度学习模型(Rad+DL)。6个机器学习模型分别为支持向量机(Support Vector Machine,SVM)、随机森林(Random Forest,RF)、随机梯度下降(Stochastic Gradient Descent,SGD)、k近邻(k-nearest Neighbor,KNN)、极端梯度增强(eXtreme Gradient Boosting,XGBoost)和轻量级梯度提升机(Light Gradient Boosting Machine,LightGBM)。
在模型构建过程中使用嵌套交叉验证网格搜索进行超参数调优,并比较其受试者工作特征(receiver operating characteristic,ROC)曲线下面积(area under the curve,AUC)后,最终选择RF作为基础分类器,因其在初步比较中表现出最优且稳定的性能。
模型的内部验证采用Bootstrap法(1 000次重复抽样)。模型区分度通过ROC曲线及AUC评估,临床实用性通过决策曲线分析(decision curve analysis,DCA)评估,校准度通过校准曲线评估。
1.6 统计学分析
特征提取、选择以及构建及测试在Python 3.9环境中执行;患者基线特征的描述与组间比较则使用SPSS 26.0软件进行。计量资料根据其分布特征,以x̄±s或M(IQR)表示;计数资料以例数与百分比(%)描述。组间比较时,符合正态分布的计量资料采用Student's t检验,非正态分布者采用Mann-Whitney U检验;计数资料的比较采用χ2检验。所有统计分析均为双侧检验,以P<0.05为差异有统计学意义。
模型性能评估包括绘制受试者工作特征曲线,计算其曲线下面积。采用决策曲线分析评估该模型的临床实用性。
2 结果
2.1 患者基线特征
纳入患者340例,其中男292例,女48例,平均年龄(62.0±7.6)岁。早期组有68例,进展期组有272例,两组患者的性别、年龄、病变位置、有无扩张、周围脂肪间隙是否清晰之间的差异均无统计学意义(
P>0.05),而管壁最大厚度、病变长度和灶周淋巴结的差异有统计学意义(
P<0.05)。见
表1。
2.2 特征筛选
共提取出1 130个影像组学特征和512个深度学习特征。LASSO通过对回归系数施加L1范数惩罚,能将不重要特征的系数压缩至零,从而实现自动的特征选择并有效防止模型过拟合。依据其LASSO回归系数非零的原则降维,其压缩可变系数设定为0.015 1(
图1、
图2),筛选出9个影像组学特征和11个深度学习特征。9个影像组学特征依次为original_glszm_GrayLevelVariance、log-sigma-1-mm-3D_glszm_LowGrayLevelZoneEmphasis、log-sigma-3-mm-3D_glszm_SmallAreaHighGrayLevelEmphasis、wavelet-LLH_glszm_GrayLevelVariance、wavelet-LHL_firstorder_Skewness、wavelet-HLL_firstorder_Skewness、wavelet-HLL_glszm_GrayLevelVariance、wavelet-HHL_glszm_LowGrayLevelZoneEmphasis、wavelet-HHH_gldm_DependenceEntropy。
2.3 模型性能
在6种算法中RF因其最强的诊断能力脱颖而出,在训练集和验证集中各指标均表现出良好的诊断性能,见
表2。
图3和
图4的ROC曲线显示基于RF复合模型的3个诊断模型在训练集和验证集,均表现出良好效能,其中Rad+DL(
AUC分别为0.877、0.794)优于Rad(0.816、0.785)和DL(0.799、0.678)。
2.4 模型评估
图5、
图6展示了两组数据集中复合模型的校准曲线,所有曲线均呈现较好的一致性趋势。DCA结果显示,在合理的阈值概率范围(0.2 ~ 0.8),依据本模型进行选择性干预,能够在整体上减少不必要的手术或治疗不足,从而为临床提供具有正向净效益的决策参考。因此Rad+DL在鉴别早期食管癌时具有明显优势(
图7、
图8)。
3 讨论
本研究基于LASSO回归筛选出的20个关键特征,成功构建并验证了一个基于CT影像组学与深度学习特征的复合模型,用于术前无创鉴别食管癌的肿瘤浸润深度(Tis ~ T1a期 vs T1b ~ T3期)。该模型在验证中展现了较好的准确度,表明从常规CT图像中提取的多维度量化特征,能够有效捕获与肿瘤侵袭深度相关的生物学信息,为补充现有临床分期手段提供了新的思路。
当前,临床实践中精准区分食管癌的早、晚期(特别是Tis ~ T1a
vs T1b ~ T2
vs T3 ~ T4)仍然是一大难点和关键挑战,直接影响了治疗决策的制定和患者的预后。早期食管癌(特别是重度不典型增生Tis和黏膜层T1a)患者可在内镜下实现微创、根治性(R0)切除(如内镜黏膜切除术、内镜黏膜下剥离术),可以有效保留食管功能,显著提高生活质量并改善长期生存。现有术前分期手段(如白光内镜、超声内镜、CT)对准确区分T1a(黏膜层)与T1b(黏膜下层)的敏感性、特异度均有待提高
[16-17],准确性仅70% ~ 80%
[18]。对于局部进展期患者,直接手术对比新辅助治疗(放化疗或化疗)后再手术的模式选择,以及手术范围的确定,高度依赖于准确的术前分期
[19]。超声内镜对T分期的准确性虽优于CT,但准确性受操作者经验、食管狭窄程度影响,且无法评估远处转移,同样难以在大规模人群推广
[20]。PET/CT在检测远处转移方面优势明显,但其空间分辨率限制了其对局部T分期和较小转移灶的检出能力
[21-22]。因此,如何突破现有单一影像学手段的局限、实现食管癌术前侵袭深度的精准、无创评估成为一大挑战和难题。
相较于现有研究,本研究的主要优势在于构建了一种复合模型信息融合的解决方案。首先,与单独应用影像组学或深度学习模型的研究相比,本研究的复合模型(Rad+DL)在验证集上取得了更高的AUC值,这表明结合手工设计的定量特征与深度学习自动提取的深层特征,能更全面地表征肿瘤异质性,从而提升模型性能。其次,与高度依赖操作者主观判断的EUS不同,本研究提出的模型基于客观的临床及影像数据驱动,其结果具有可量化、可重复的优点,有望减少人为差异。第三,本模型基于临床常规采集信息和CT图像进行分析,无需额外有创检查或特殊扫描序列,具有良好的临床转化潜力和普及性,可为T分期提供额外的决策参考。
既往研究尚未针对早期病变进行鉴别,Liu等
[23]从73例食管癌CT影像中提取病变的纹理特征,其结果显示基于CT图像的特征熵可以区分食管癌T1 ~ T2期与T3 ~ T4期、是否发生淋巴结转移,
AUC分别为0.637、0.815,但并未提取高级特征。刘雪成等
[24]通过融合食管癌动脉期CT图像的深度学习特征、影像组学特征及临床指标(肿瘤长度、边界)构建联合预测模型,显著提升T2与T3分期的鉴别效能(训练集
AUC=0.867,验证集
AUC=0.810),优于单一临床、影像组学或深度学习模型。Tan等
[25]基于1 066例患者的CT影像数据,系统构建了针对食管癌病理亚型、T分期及N分期的预测模型,其训练集
AUC=0.823,验证集
AUC=0.813,该研究证实肌肉影像特征的纳入有助于提升诊断准确性。Li等
[26]基于PET/CT的影像组学模型,用以预测ESCC患者的侵袭深度(≤T2期与≥T3期) (外部验证logistic回归模型
AUC=0.844,准确率81.25%;线性判别分析模型
AUC=0.828,准确率87.5%),并对肿瘤进行了体积匹配分析。上述研究均揭示了影像组学在食管癌分期预测中的巨大潜力。
此外,随着人工智能和计算机视觉技术的持续进步,融合多模态数据源的“多组学建模”将成为未来发展的新趋势。例如,将CT影像组学与全基因组表达、蛋白质组数据、生物标志物以及临床病理信息相结合,构建跨模态联合模型,有望实现更加精准的疾病预测与个体化治疗方案制定
[27]。这种整合模型不仅可以改善T分期的分类性能,还可辅助预测淋巴结状态、远处转移概率及患者长期生存率,最终服务于精确医学理念的落地。值得一提的是,模型的可解释性也是当前人工智能在临床推广的关键难点之一
[28]。尽管深度学习具有强大的特征自动提取能力,但其“黑箱”属性仍可能限制其在临床中的信任度与采纳率。此外,为进一步提升模型的泛化能力和临床实用性,未来还需重点关注跨设备、跨机构和跨人群的算法鲁棒性验证。不同CT扫描仪品牌、参数设置、图像重建算法及不同患者体型可能对影像质量造成影响,进而影响模型表现。因此,大规模多中心研究及多样化影像数据的整合,成为模型临床转化不可或缺的一环。同时,构建标准化影像组学流程,包括图像采集、预处理、ROI勾画、特征提取与建模评估等,也亟待形成统一共识,以提高不同研究之间的可比性与复现性,为提升患者预后和优化资源配置提供强有力的数据支持。
本研究尚存不足:一方面,回顾性研究设计可能导致临床特征收集存在偏倚;另一方面,受真实世界研究条件限制,现有样本量仍显不足,且为单中心数据。为强化结论可靠性,后续拟通过延长研究周期扩大样本规模,同时未来应考虑纳入多中心数据,引入外部验证环节,同时进行淋巴结转移相关预测模型以更全面地评估研究结果的鲁棒性和适用性。本模型基于机器学习与深度学习算法,其决策过程存在一定的“黑箱”特性。尽管本研究通过LASSO回归筛选了特征,增强了模型的可解释性,但特征与预测结果之间复杂的非线性关系,特别是深度学习网络内部的深层逻辑,仍难以被直观理解。后续研究可尝试引入可解释性人工智能技术,如SHAP(SHapley Additive exPlanations)、LIME(local interpretable model-agnostic explanations)等可解释性算法,从而揭示模型关注的关键特征区域,增强医师对模型决策机制的理解与接受度。
综上所述,本研究建立了基于CT影像组学特征的机器学习联合诊断模型能够比较准确地无创鉴别早期与进展期食管癌,从而协助临床医师制定更加精准的治疗方案。后续研究若能结合术中导航(如内镜-CT影像融合)与分子分型标签,有望构建食管癌“影像-病理-基因组”三联诊断体系,最终推动以分期为导向的个体化治疗范式革新。
数据共享声明 本论文相关数据可依据合理理由从作者处获取,Email:nancet1@163.com。