基于分层注意力驱动多实例学习的肾透明细胞癌数字病理分级分期

许家宁 ,  毛钇骁 ,  张煜

南方医科大学学报 ›› 2026, Vol. 46 ›› Issue (05) : 1175 -1184.

PDF (2225KB)
南方医科大学学报 ›› 2026, Vol. 46 ›› Issue (05) : 1175 -1184. DOI: 10.12122/j.issn.1673-4254.2026.05.22

基于分层注意力驱动多实例学习的肾透明细胞癌数字病理分级分期

作者信息 +

Hierarchical attention-driven multiple instance learning for clear cell renal cell carcinoma grading and staging in digital pathology

Author information +
文章历史 +
PDF (2278K)

摘要

目的 提出一种分层注意力驱动的多实例学习框架(HA-MIL),实现对肾透明细胞癌的精准分级分期。 方法 利用TCGA-KIRC数据库中504例患者的全切片图像(WSI)及其临床病理标签。HA-MIL将WSI分割为多个图像块,采用分层注意力机制捕获不同层级实例的重要程度,并引入动态门控融合机制实现特征优化,以降低对病理学家主观评估的依赖。 结果 HA-MIL在分期任务中的准确率为(87.35±0.72)%,ROC曲线下面积(AUC)为0.95,F1分数为(86.41±0.63)%;在分级任务中准确率为(85.82±0.60)%,AUC为0.93,F1分数为(86.00±0.65)%。相较于支持向量机、双流多实例学习和基于注意力的多实例学习等方法,HA-MIL表现出更高的准确性和鲁棒性(P<0.05)。消融实验结果显示,分层注意力机制使准确率提升3.2%、F1分数提升2.2%,性能优于传统注意力机制。 结论 HA-MIL框架在肾透明细胞癌的分级与分期任务中展现出卓越性能,为病理图像在肾透明细胞癌的智能分析提供了新方法,具有重要的临床应用前景。

Abstract

Objective To develop a hierarchical attention-driven multiple instance learning (HA-MIL) framework for precise grading and staging of clear cell renal cell carcinoma (ccRCC). Methods Whole-slide images (WSIs) and the corresponding clinicopathological labels were obtained from 504 patients from the TCGA-KIRC database. The proposed HA-MIL framework processes WSIs by segmenting them into patches, leverages a hierarchical attention mechanism to discern the significance of instances across different levels and incorporates a dynamic gated fusion module to refine feature aggregation. This approach mitigates the dependency on subjective evaluations by pathologists. Results Experimental results showed that HA-MIL achieved an accuracy of (87.35±0.72)%, an AUC of 0.95, and an F1-score of (86.41±0.63)% in the staging task. For the grading task, the model attained an accuracy of (85.82±0.60)%, an AUC of 0.93, and an F1-score of (86.00±0.65)%. HA-MIL demonstrated significantly higher accuracy and robustness compared to the baseline methods including SVM, DSMIL, and ABMIL. Ablation studies confirmed the contribution of the hierarchical attention mechanism, which improved the accuracy and F1-score by 3.2% and 2.2%, respectively, outperforming the conventional attention mechanisms. Conclusion The HA-MIL framework exhibits superior performance for grading and staging of ccRCC, thus offering a novel, intelligent method for pathological image analysis of ccRCC in the clinical setting.

Graphical abstract

关键词

肾透明细胞癌 / 深度学习 / 多实例学习 / 注意力机制 / 分级分期

Key words

clear cell renal cell carcinoma / deep learning / multiple instance learning / attention mechanism / grading and staging

引用本文

引用格式 ▾
许家宁,毛钇骁,张煜. 基于分层注意力驱动多实例学习的肾透明细胞癌数字病理分级分期[J]. 南方医科大学学报, 2026, 46(05): 1175-1184 DOI:10.12122/j.issn.1673-4254.2026.05.22

登录浏览全文

4963

注册一个新账户 忘记密码

肾透明细胞癌(ccRCC)占肾癌病例的70%~80%,具有高度侵袭性,20%~30%的病例在诊断时已发生转移,且转移性ccRCC患者5年生存率不足15%1。目前组织学分级[如国际泌尿病理学会核分级系统(WHO/ISUP)]和病理分期[如美国癌症联合委员会癌症分期系统(AJCC/TNM)]是决定患者预后和治疗方案的关键依据23。随着数字病理技术的进步,全切片图像(WSI)分析为精确诊断提供了新机遇。然而,ccRCC在WSI中的表现呈现高度异质性,表现为核多形性、细胞排列模式多样性及坏死区域分布等特征的显著变异4,传统病理诊断依赖病理学家通过显微镜进行人工观察,存在主观性强、重复性差等局限性,在分级分期任务中面临显著挑战5。研究表明,病理学家在核分级中的诊断一致性仅60%~75%,且阅片任务繁重,耗时较长,进一步加重了病理医生的工作负担6。因此,亟需开发一种自动化、智能化的分级与分期工具,以降低诊断的主观性、提升一致性,并减轻病理医生的工作压力。
近年来,机器学习在ccRCC病理分析中展现出显著潜力。有研究利用多实例学习框架对WSIs进行分析,在包含肾细胞癌的数据集上实现了肿瘤检测与分类,但该方法未专门针对核分级与分期进行优化7。有学者提出了一种融合深度特征与手工纹理特征的框架,用于从组织病理学图像中检测肾癌,有效提升了分类性能,但其研究重点在于癌与非癌的区分,并未深入探讨核分级与肿瘤分期这两个对预后至关重要的细化任务8;Zhou等9提出了K-Net模型,利用基因表达数据预测KIRC分级,并提供了模型可解释性以揭示关键生物学通路,其准确率达74%,其预测性能目前尚不及部分先进的图像分析方法。Yao等10基于CLAM算法开发了一个深度学习模型,利用TCGA的WSIs来预测ccRCC的病理分期,验证了组织形态学特征与患者预后的强关联。但模型仍是一个单任务框架,并未将核分级作为一个并行的、相互关联的任务进行联合学习与优化,而分级信息对于全面的风险评估与个体化治疗决策同样不可或缺11。当前ccRCC病理图像分析面临的主要挑战在于肿瘤区域的显著空间异质性:同一张切片内常并存不同分级的细胞形态;核级特征(如核仁突出度、核异型度)与组织架构特征(如腺泡/梁索排列、间质反应)呈现不均匀、跨尺度的空间分布且边界模糊12。此类异质性难以通过全局平均池化或最大池化等操作进行捕捉,进而难以获取决定分级/分期的判别性线索。因此亟需能够在空间上自适应聚焦并进行动态特征选择的建模策略。
为此,本文提出了一种分层注意力驱动的多实例学习框架(HA-MIL),结合多实例学习技术和级联的空间注意力自适应融合模块建立肿瘤诊断模型,聚焦肿瘤区域细微纹理和周围组织浸润特征的同时动态调整特征权重,以实现ccRCC的精准分级和分期预测,同时生成的可解释性热图能为病理机制研究提供新线索,捕捉关键病理特征,对临床决策提供强有力的支持。

1 材料和方法

1.1 模型框架总览

图1展示了HA-MIL框架,针对于用于组织检测和分类病理图像数据任务。流程从整个病理切片图像输入开始,通过阈值化操作将图像划分为多个小块(图1A),并将划分完成的图像块送入ResNet50特征提取器,得到其对应的特征向量(图1B),最后经过特征增强模块进行增强处理(图1C)。

模型采用基于注意力的机制进行特征加权(图1D、E)。在这个模块中,模型通过分别计算全局稀疏注意力和局部注意力来计算每个实例(图像块)的注意力分数。加权后的特征通过特定的注意力门控进行融合,生成一个全局级别的表示,以进一步提高分类的性能。最终将这个融合得到的全局表示送入分类器进行最终分类,输出病理图像属于不同类别的概率结果(class-1~class-4)。

此外,注意力权重可以用于展示热力图,其中色彩越深表示该区域被赋予的权重越大,它直观地反映了模型在不同区域的关注程度,有助于展示特征融合后的分布以及理解模型在预测时的重点关注区域。

1.2 WSI图像块分割和特征提取

对于WSI图像组成集合W=[w1,...,w504],wkl×h,k[1,504],对单张全切片图像wk进行有效组织区域检测,分割得到像素分辨率尺度为2048×2048的含有效组织的图像块集合:P=[p1,,pt],pk2048×2048,k[1,t]。对以上图像块,以Resnet50作为特征提取器进行特征提取,得到每张WSI中图像块的原始特征集合:X=[x1,...,xt],xk1×2048,k[1,t]

检测有效组织区域时,滑动窗口遍历WSI同时从当前坐标(x,y)读取一个2048×2048像素的图像块,并下采样至224×224像素大小。而后进行色彩空间转换,将图像从RGB格式转换到HSV(色相-饱和度-明度)色彩空间,利用饱和度(S)和亮度(V)通道更准确地分离组织区域。因此构成双重阈值判断:当饱和度通道>20时过滤低饱和度背景,亮度通道<250时排除高亮区域,同时进行白色区域检测(S<30 & V>220),即满足组织占比≥0.3且白色区域<0.4时判定为有效组织,最后记录保留有效patch的坐标。该设计能更准确地排除空白背景、染色剂残留或玻片反光区域,同时保留低饱和度但具有诊断价值的组织区域。

1.3 基于特征空间的特征增强

深度特征空间中蕴含着高度抽象的图像语义信息,在此空间进行扰动已被证明能有效模拟数据分布的变化,是一种高效的“隐式”正则化策略,可提升模型鲁棒性13。现有的病理数据增强方法主要依赖于图像空间的数据增强,本文使用了基于特征空间的生物学约束和噪声注入的特征增强方法,低成本地平衡长尾分布的样本数据。该方法结合了生物学约束的缩放、空间维度的旋转以及高斯噪声与拉普拉斯噪声的混合注入1415,旨在提高模型对小样本数据集的学习能力,同时保留与临床诊断相关的生物学特征。该框架主要包含3个核心组件:受保护维度缩放、空间维度旋转、混合噪声注入。

在组织病理学中,特定形态学特征存在诊断临界值与生物学合理范围:例如正常与癌变细胞核面积有明确区间(5~50 μm²),核浆比在正常细胞中<0.5、在癌细胞中>0.8,核形态规整度则反映细胞异型性,这些特征对应深度学习特征空间的特定通道。为避免生成不合理病理特征,需保护上述特征维度的数值范围,防止过度缩放。通过分析特征可解释性与形态学参数的相关性,计算特征通道激活值与细胞核形态参数的Pearson相关系数16。设定阈值 |σ|>0.6且统计显著性P<0.01的通道被识别为受保护通道𝒫,得到受保护的特征通道子集P{1,2,...,c}。缩放操作在通道维度进行16,定义为:

XScale=Xs

其中,X是原始特征矩阵,s是一个缩放因子向量sC,即对每个通道c使用独立的缩放因子Sc,定义为:

sc=1,ifcPuU0.95,1.05,ifcP

这里𝒰0.95,1.05表示区间上的均匀分布。该操作在引入特征多样性的同时,确保了对诊断至关重要的生物学特征(对应通道子集 𝒫)的数值稳定性,使特征增强过程兼顾医学合理性与可解释性。

对于空间维度旋转,特征图中的每个空间位置(一个C维向量)都对应着原始图像上一个特定感受野区域,承载了该区域的语义信息,对应可以将提取到的特征图,重新解释为具有空间网格结构的数据,从而在其空间维度上定义旋转操作。旋转操作不仅能够增加数据的多样性,而且能使得模型对不同视角下的肿瘤特征具备更好的鲁棒性14。即通过对特征图FB×C×H×WH,W维度应用二维旋转变换,对原始图像中不同组织区域的空间上下文关系进行了1次扰动。旋转角度从[-5,5]的范围均匀采样得到,模拟了组织病理切片在数字化过程中可能发生的物理旋转。空间旋转矩阵R可表示为:

R=cos (θ)-sin (θ)sin (θ)cos (θ)

其中,θ为旋转角度。设Fi,j,c表示特征图在空间位置(i,j)处第c个通道的值,则旋转操作可以理解为对每个通道独立的进行一次空间坐标变换,沿着空间维度展平得到变换后的特征:

XRotate=Flatten(i,jFi,j,cK(i',j',i,j;R))T

其中,(i',j')是旋转后的网格坐标,K是由旋转矩阵R和双线性插值核共同决定的采样函数。

同时,在特征空间进行噪声注入。噪声的类型包括高斯噪声和拉普拉斯噪声。通过对每个特征通道加权混合高斯噪声与拉普拉斯噪声,得到进一步的增强特征形式:

XNoise=X+αNgauss+1-αNlaplace

其中,α是噪声权重,取值范围为 [0, 1],NgaussNlaplace分别表示高斯噪声和拉普拉斯噪声。

最终经过以上增强操作,得到的特征矩阵X'=[x1',...,xt'],xk'R1×2048,k[1,t]可表示为:

X'=FlattenRotateFs,R+λαNgauss+1-αNlaplaceT

相比传统的基于图像处理的数据增强方法,该增强策略核心在于直接在特征空间而非原始图像空间进行数据增强,避免了直接处理图像数据的巨大计算开销。通过生物学约束的噪声注入和几何变换,在保持组织学特征合理性的前提下扩充少数类样本这种直接在特征空间进行操作的方式可显著提升处理效率16,同时为后续的深度学习模型训练提供了更丰富、更平衡且保持空间特性的高质量特征数据。为证明增强模块的有效性,本研究进行了系统消融实验,实验对无增强基线、传统图像空间增强方法(裁剪、颜色抖动)与本文特征增强策略的分类性能进行了定量对比,同时对增强策略的组合进行了评估。

1.4 分层注意力融合多实例学习框架

HA-MIL在引入注意力网络的基础上,增加了协同整合局部注意力和全局注意力模块的双注意力融合机制,实现对病理图像多层次特征的全面捕捉,既可以保留细胞级别的细微结构特征,又能捕获组织层面的宏观分布模式。

局部注意力模块的注意力计算17得到局部注意力权重集合α=[α1,,αt],加权求和后的局部特征表示:

Xlocal_agg=i=1tαixi

与局部注意力不同,全局注意力模块关注整体图像的上下文信息,通过对所有实例的全局特征计算权重来识别最具判别性的区域。采用Top-K选择的稀疏注意力机制,降低计算复杂度,选择最重要的K个区域,对应得到稀疏后的全局特征表示,从而提高计算效率。

Top-K(a)=a1,a2,,aK
Xglobal_agg=i=1Kaixi

为了实现局部和全局特征的最优融合,HA-MIL引入可学习门控机制进行局部和全局特征的动态权重分配,使模型能够自适应地关注不同层次的重要信息,提升模型的学习能力18。该机制通过学习动态权重来平衡局部特征和全局特征的贡献得到最终的包级表达GT。具体地,门控机制基于局部和全局特征拼接成联合特征向量,通过一个全连接层计算出融合权重,以自适应地调整局部与全局信息的利用比例:

G=σWgXlocal_agg;Xglobal_agg+bg

其中Wg是可学习的权重矩阵,用于对拼接后的特征进行线性变换,bg为偏置项。σ对应激活函数Sigmoid,将输出压缩到[0,1]区间。

模型中双注意力融合机制的有效性主要体现在3个方面:在特征表达方面,局部注意力通过细粒度权重分配强化细胞核形态、染色质分布等微观特征1920;全局注意力利于肿瘤异质性、浸润模式等宏观特征的表达。在计算效率方面,Top-K选择机制通过保留最具信息量的区域,实现计算资源的优化配置21。门控网络提供的动态融合策略使模型能够适应不同分化程度的ccRCC样本,增强模型鲁棒性。

1.5 训练过程

HA-MIL的训练策略,主要针对WSI图像的四分类任务。引入增强数据,在训练时对少数类样本进行过采样确保类别平衡。在损失函数上使用标签平滑改进的Focal Loss来解决类别不平衡问题以及防止过拟合。优化器采用Adam(lr=1e-3),模型包含BN层和Dropout增强泛化能力。同时采用5折分层交叉验证,早停策略监控验证准确率,保存最佳模型。每折独立评估并输出ROC曲线、混淆矩阵和F1分数,最终汇总平均指标。模型通过注意力机制增强特征选择能力,结合严格的数据划分和早停机制,在保证模型性能的同时控制过拟合。

为有效降低样本类别不平衡对模型性能的影响,HA-MIL模型在Focal Loss的基础上增加标签平衡操作,引入一个调整因子(1-pt)γ来让模型更加关注难分类的样本22,具体形式如下:

FL(pt)=-α1-ptγlog (pt)

其中pt是预测为正确类别的概率(即模型预测的概率值),α是类别平衡因子,用于处理类别不平衡问题。如果个别类别的样本数量较少,则可以为这些类别设置更大的α值,给予其更高的权重。γ是焦点参数,用于调整难易样本的关注度,常见的设置为2.0。在Focal Loss中,当预测正确时,pt会接近1,损失会较小;而当预测错误时,pt会接近0,损失会较大。因此,较大的γ会使模型更加关注那些难以分类的样本。通过调节γα,可以控制模型对于不同难度样本的关注度,从而可以帮助模型更好地识别少数类别的样本。

同时,模型增加标签平滑,目的是减少正确标签的权重,并将其分配给其他类别。标签平滑损失公式为:

smooth_targets=ϵC-1

经历平滑操作后,原始的one-hot标签转换为:

ysmooth(k)=1-ϵifk=tϵC-1else

其中ϵ是平滑系数,用于控制原始标签的平滑程度。C是类别总数,t是真实类别,k对应类别索引。平滑后的交叉熵损失如下:

CEsmooth(pt)=-k=1Cysmooth(k)log (pk)

损失计算时,使用平滑后的标签(smooth_targets)而非原始的one-hot标签。通过将部分概率分数从真实类别分配到其他类别,能减轻头部类别的主导效应,防止模型对预测结果过于自信,缓解过拟合。整合后模型的总损失函数如下:

=1Ni=1Nαti1-e-CEiγCEi
CEi=-(1-ϵ)log (pti)-ktiϵC-1log (pk)

1.6 实验设置

本研究使用了来自TCGA队列的504个WSI,用于HA-MIL模型的开发和内部验证,其中包括分级:1级259例,2级68例,3级167例,4级11例;分期:1期253例,2期56例,3期115例,4期78例。考虑到部分类别样本量有限,可能导致模型性能下降,对应采用了数据增强策略,共获得184个增强后的WSI,其中G4级补充49例、G2级补充35例、S2期补充50例、S4期补充50例;其余样本量充足的类别未进行增强。最终,本研究共获得 688例WSI 用于模型训练,增强后各亚组样本分布更趋均衡。为增强模型泛化能力,训练集通过过采样平衡,测试集保留原始分布。在性能评估实验中,选取3种具有代表性的基线方法进行对比:传统机器学习方法SVM23;双流多实例学习(DSMIL),采用双分支架构分别处理局部和全局特征24;标准基于注意力的多实例学习(ABMIL)模型17。所有基线方法均采用相同的特征提取器和超参数优化策略,确保对比的有效性。同时采用5折交叉验证策略,以准确率和F1分数作为主要评估指标,同时计算各指标的标准差以评估方法稳定性。为防止过拟合,训练过程中加入了早停机制(patience=5)和L2正则化(weight decay=1e-5)。为评估性能差异的统计显著性,采用配对t检验(5次重复实验)对各模型的准确率与F1分数进行比较。经Shapiro-Wilk正态性检验验证,两组数据的差值服从正态分布(P>0.05),符合配对t检验的适用前提。以P<0.05为差异有统计学意义。

2 结果

2.1 对比实验

分级分期任务实验结果表明,在ccRCC分级分期的四类别分类任务中,所提出的HA-MIL方法在Stage和Grade分类任务上均展现出最优性能(图3表1)。

HA-MIL在Stage分类任务中取得87.35%的准确率和86.41%的F1分数,在Grade分类任务中获得85.82%的准确率和86.00%的F1分数,均显著优于传统SVM、DSMIL和基准ABMIL方法(表1)。双注意力融合机制在ccRCC分级任务中展现出显著优势。在相同的ResNet50骨干网络下,相较于单一注意力基线模型,双注意力模型的分类准确率提升了3.2%,F1分数提高了2.2%。

配对t检验结果显示,HA-MIL在分级任务中的准确率高于 ABMIL(P=0.013)与 DSMIL(P=0.009)。在分期任务中,HA-MIL也优于SVM(P=0.021)与ABMIL(P=0.017)。

HA-MIL模型的ROC曲线和混淆矩阵结果显示,分期任务AUC约为0.95,分级任务AUC约为0.93。以分级为例,混淆矩阵中体现Grade-1样本的分类精度最高,Grade-2与Grade-3类别之间存在一定的双向混淆,并观察到少数Grade-4样本被误分类为Grade-3。结果与临床病理诊断中常见的挑战高度一致(图4A)。

在计算效率方面,HA-MIL通过稀疏化全局注意力机制,在保持模型表达能力的同时降低了计算开销。HA-MIL在分级与分期任务上均取得最优性能(Grade准确率85.82%,Stage准确率87.35%,表1),与同样基于MIL的方法相比较,而其计算复杂度仅小幅增加:HA-MIL的FLOPs为6.85 G,ABMIL为5.92 G,DSMIL为5.34 G;HA-MIL的参数量为28.63 M,ABMIL为25.34 M,DSMIL为23.87 M。

2.2 消融实验

2.2.1 特征增强模块消融实验

混淆矩阵结果显示,消融前后的分类性能提升:增强后的特征减少了高混淆区域(如相邻Grade间的误判),尤其是中高等级(Grade-2,3)的区分度明显改善(图4B)。从定量指标来看,特征增强前模型准确率约56.51%,宏平均F1分数约31.13%,平均AUC约0.61;特征增强后准确率提升至约71.94%,宏平均F1分数提高至约79.83%,平均AUC提升至约0.88,且其指标优势于任何单一增强策略(平均准确率为63.37%,F1分数为66.05%)。同时,提出的特征增强框架相较于传统图像空间增强框架在保证分类准确度的低损耗(消融实验中相较于传统方法准确率绝对差值不足1%)的前提下,其预处理时间大幅降低约40%。

2.2.2 稀疏特征门控模块消融实验

实验结果表明,移除局部注意力导致细微结构特征丢失,使任务准确率下降10.3%;禁用全局注意力则使组织层面的分布模式识别能力降低3.5%;而固定权重(非自适应)的融合方式也会造成1.5%的性能损失(表3)。

2.3 可视化实验

总体而言,热图展示出对细胞密度高、核深染的肿瘤区域的高度关注,而对间质及正常肾实质等区域的响应较低。3位病理学家采用双盲法对模型热图与对应WSI进行评估,一致认为模型注意力分布准确的反映了肿瘤的恶性程度,与其使用的分期系统呈现出高度一致性。随着分期级别的提高,在相同放大倍数下,模型关注的肿瘤细胞核大小显著增大。从细粒度形态演变来看:在Stage-1样本中,模型主要关注细胞核形态相对规则、分布均匀的区域;在Stage-2与Stage-3样本中,高注意力区域开始对应核膜不规则、染色质分布紊乱的细胞群体;而在Stage-4样本中,模型最强响应则集中于具有显著多形性、核质比异常及核深染的肿瘤细胞(图5)。

3 讨论

随着深度学习与数字病理技术的融合,病理图像分析领域正在快速发展,其中包含如“分级-分期”一体化框架,能够在统一架构下对癌症患者的诊断进行全面预测25。其次,从依赖小样本标注的传统训练模式,逐步转向弱监督学习与大规模预训练模型,从而显著减少对人工标注的依赖26。尽管在算法和算力上取得了重大进展,当前研究仍面临诸多挑战。最突出的便是WSI图像的超高分辨率问题,每张幻灯片可包含超过10亿像素,导致计算资源需求极大,常规GPU难以一次性载入全图15。此外,肿瘤病理样本普遍存在类别不平衡问题,如高级别样本远少于低级别样本,导致模型在训练中产生偏差。跨医疗机构之间样本分布差异性也对模型的泛化能力提出挑战,例如由于染色流程和扫描设备不同,不同医院的WSI在颜色、对比度等维度上存在显著偏移27。在可解释性方面,尽管近年来注意力机制与可视化技术有所突破,但仍难以完全满足临床医生对模型“可追溯”和“可控”的需求28。此外,临床落地也需解决一系列现实问题,如数据标准化、人机协作流程设计、模型监管与法律伦理问题29

为了提高对ccRCC病理图像的处理能力,并实现精准的自动化分级与分期预测,本文提出了一种基于分层注意力融合结构的深度学习模型,称为HA-MIL。该模型在设计上充分考虑了病理图像的特点,融合了有效的组织检测机制、特征增强模块和局部-全局双重注意力机制,旨在实现对病变区域的精准定位与深层次表征。实验结果表明,该方法在TCGA-KIRC数据集上取得了优于现有方法的性能。值得注意的是,本方法在所有指标上的标准差均小于0.75%,表现出优异的稳定性,对比的既往方法则显示出较大的性能波动。这种性能提升主要归因于门控融合机制的有效性,该机制通过动态权重分配实现了局部特征与全局特征的自适应融合,从而显著提升了模型对关键病理特征的识别能力。此外,实验结果也揭示了不同任务的难度差异:所有方法在Stage分类任务上的表现均优于Grade分类,这表明组织分期可能具有更明显的形态学特征,而肿瘤分级则需要更精细的特征表示。这些发现为后续研究提供了重要启示,包括进一步优化特征融合策略以及探索对抗训练等增强方法对细粒度分类性能的潜在提升。早期研究所提出的基于纹理特征与SVM的方法,其主要依赖传统机器学习手段,并通过浅层分类器实现病理图像的分类23。虽然SVM模型在小样本场景下具备一定的泛化能力,但其表达能力有限,难以捕捉肿瘤组织中复杂的结构模式和多尺度空间信息,在高异质性病理图像中性能不稳定。基于深度学习的MIL方法,如文献17提出的ABMIL通过注意力机制对实例进行加权聚合,在病理图像分类中取得了一定进展,但其单一注意力机制难以充分建模局部与全局的复杂依赖关系,限制了模型对多尺度病理特征的判别能力。有研究提出的DSMIL通过引入双流架构分别处理实例级和包级特征,在一定程度上提升了特征表示能力,但双流之间的交互不足,且缺乏有效的局部-全局特征融合机制,导致在高度异质性的ccRCC病理图像中性能受限24。有研究提出的3D-CNN模型通过分析肿瘤浸润深度,在T分期预测中达到81.3%准确率,但受限于单任务学习框架,未能联合优化分级与分期指标8。也有研究构建的多任务网络MT-CCRCCNet,在ccRCC病例中同步预测分级和分期,准确率仅78.6%9。相比上述方法,HA-MIL通过整合高效的组织检测、特征增强和双注意力机制,显著提升了ccRCC病理图像分析的准确性和鲁棒性。在组织检测阶段,采用HSV色彩空间的双阈值策略有效排除了干扰因素并保留了具有诊断价值的组织区域;在特征提取阶段,ResNet50结合特征增强策略提了特征表达能力;在特征融合阶段,创新的双注意力机制通过局部关注微观结构、全局筛选关键区域,并结合门控机制实现动态融合。至此,HA-MIL优势在于其组织检测的鲁棒性、特征增强的有效性以及注意力机制符合病理诊断逻辑的特点,但仍存在若干需要突破的局限性:首先,在数据依赖性方面,模型的性能与训练数据的质量、规模及来源机构高度相关。这可能导致模型在面对来自不同医院、使用不同染色协议或扫描仪生成的病理图像时,出现显著的性能衰减。为提升模型的鲁棒性与临床泛化能力,后续研究须引入包含多中心、多扫描设备的大规模外部验证集进行严格测试,并积极探索领域自适应以抵御域偏移问题。可解释性层面,尽管注意力热图能部分反映决策依据,但与病理诊断要求的可追溯标准仍存在差距,为弥补这一差距,未来工作可以将病理学先验知识显式地嵌入到模型中,从而实现与病理诊断标准对齐的、可追溯的决策过程提炼可量化的病理学先验知识并建模。参考联合病理专家梳理ccRCC分级分期核心诊断指标(如细胞核大小变异系数、腺体结构完整性、肿瘤浸润深度等),将这些指标转化为可计算的图像特征参数(如细胞核面积标准差、腺体区域连通性、肿瘤-间质边界清晰度等),构建病理学先验知识词典12。该框架的设计理念也可拓展至其数字化病理分析领域,为人工智能在医学影像分析中的应用提供新思路。例如,可扩展至其他癌症(如肝癌30、前列腺癌31)的分级分期任务,为解决“癌症AI泛化难题”提供新思路。未来研究可着眼于多模态数据融合、弱监督学习优化和临床部署可行性等方向,以进一步提升模型的临床应用价值。

综上,HA-MIL为ccRCC的自动化分级分期分析提供了可靠解决方案。通过持续优化和临床验证,有望成为病理诊断的重要辅助工具,推动精准医疗的发展。

参考文献

[1]

Hsieh JJ, Purdue MP, Signoretti S, et al. Renal cell carcinoma[J]. Nat Rev Dis Primers, 2017, 3: 17009. doi:10.1016/j.celrep.2017.02.074

[2]

Powles T, Albiges L, Bex A, et al. Renal cell carcinoma: ESMO Clinical Practice Guideline for diagnosis, treatment and follow-up[J]. Ann Oncol, 2024, 35(8): 692-706. doi:10.1016/j.annonc.2024.05.537

[3]

Ljungberg B, Albiges L, Abu-Ghanem Y, et al. European association of urology guidelines on renal cell carcinoma: the 2019 update[J]. Eur Urol, 2019, 75(5): 799-810.

[4]

Chen RJ, Lu MY, Wang JW, et al. Pathomic fusion: an integrated framework for fusing histopathology and genomic features for cancer diagnosis and prognosis[J]. IEEE Trans Med Imaging, 2022, 41(4): 757-70. doi:10.1109/tmi.2020.3021387

[5]

Litjens G, Kooi T, Bejnordi BE, et al. A survey on deep learning in medical image analysis[J]. Med Image Anal, 2017, 42: 60-88. doi:10.1016/j.media.2017.07.005

[6]

Xiao Q, Yi XP, Guan X, et al. Validation of the World Health Organization/International Society of Urological Pathology grading for Chinese patients with clear cell renal cell carcinoma[J]. Transl Androl Urol, 2020, 9(6): 2665-74. doi:10.21037/tau-20-799

[7]

Campanella G, Hanna MG, Geneslaw L, et al. Clinical-grade computational pathology using weakly supervised deep learning on whole slide images[J]. Nat Med, 2019, 25(8): 1301-9. doi:10.1038/s41591-019-0508-1

[8]

Cai JX, Liu MT, Zhang Q, et al. Renal cancer detection: fusing deep and texture features from histopathology images[J]. Biomed Res Int, 2022, 2022: 9821773. doi:10.1155/2022/9821773

[9]

Zhou K, Wei LH. Grading prediction of kidney renal clear cell carcinoma by deep learning[C]//2022 2nd International Conference on Bioinformatics and Intelligent Computing. Harbin China. ACM, 2022: 37-42. doi:10.1145/3523286.3524510

[10]

Yao J, Wei L, Hao PP, et al. Application of artificial intelligence model in pathological staging and prognosis of clear cell renal cell carcinoma[J]. Discov Oncol, 2024, 15(1): 545. doi:10.1007/s12672-024-01437-8

[11]

Bex A, Abu Ghanem Y, Albiges L, et al. European association of urology guidelines on renal cell carcinoma: the 2025 update[J]. Eur Urol, 2025, 87(6): 683-96.

[12]

Lu MY, Williamson DFK, Chen TY, et al. Data-efficient and weakly supervised computational pathology on whole-slide images[J]. Nat Biomed Eng, 2021, 5(6): 555-70. doi:10.1038/s41551-020-00682-w

[13]

Verma V, Lamb A, Beckham C, et al. Manifold mixup: better representations by interpolating hidden states[EB/OL]. arXiv, 2018. doi:10.48550/arXiv.1806.05236

[14]

Zhang L, Wang XS, Yang D, et al. Generalizing deep learning for medical image segmentation to unseen domains via deep stacked transformation[J]. IEEE Trans Med Imaging, 2020, 39(7): 2531-40. doi:10.1109/TMI.2020.2973595

[15]

Wu YC, Ge ZY, Zhang DH, et al. Mutual consistency learning for semi-supervised medical image segmentation[J]. Med Image Anal, 2022, 81: 102530. doi:10.1016/j.media.2022.102530

[16]

Chen RJ, Lu MY, Williamson DFK, et al. Pan-cancer integrative histology-genomic analysis via multimodal deep learning[J]. Cancer Cell, 2022, 40(8): 865-78.e6. doi:10.1016/j.ccell.2022.07.004

[17]

Ilse M, Tomczak J, Welling M. Attention-based deep multiple instance learning[J/OL]. arXiv, 2018.

[18]

Shao ZC, Bian H, Chen Y, et al. TransMIL: transformer based correlated multiple instance learning for whole slide image classification[J/OL]. arXiv, 2021.

[19]

Im YH, Park SH, Lee SC. HDA-net: H&E and RGB dual attention network for nuclei instance segmentation[J]. IEEE Access, 2024, 12: 56622-32. doi:10.1109/access.2024.3390726

[20]

Deng RN, Cui C, Remedios LW, et al. Cross-scale multi-instance learning for pathological image diagnosis[J]. Med Image Anal, 2024, 94: 103124. doi:10.1016/j.media.2024.103124

[21]

Xie X, Luo YB, Peng HW, et al. RTop-K: ultra-fast row-wise top-K selection for neural network acceleration on GPUs[C]//International Conference on Learning Representations, 2024.

[22]

Lin TY, Goyal P, Girshick R, et al. Focal loss for dense object detection[J]. IEEE Trans Pattern Anal Mach Intell, 2020, 42(2): 318-27. doi:10.1109/tpami.2018.2858826

[23]

Cortes C, Vapnik V. Support-vector networks[J]. Mach Learn, 1995, 20(3): 273-97. doi:10.1007/bf00994018

[24]

Li B, Li Y, Eliceiri KW. Dual-stream multiple instance learning network for whole slide image classification with self-supervised contrastive learning[J]. Conf Comput Vis Pattern Recognit Workshops, 2021, 2021: 14318-28. doi:10.1109/CVPR46437.2021.01409

[25]

Mobadersany P, Yousefi S, Amgad M, et al. Predicting cancer outcomes from histology and genomics using convolutional networks[J]. Proc Natl Acad Sci U S A, 2018, 115(13): E2970-9. doi:10.1073/pnas.1717139115

[26]

Lu MY, Chen TY, Williamson DFK, et al. AI-based pathology predicts origins for cancers of unknown primary[J]. Nature, 2021, 594(7861): 106-10. doi:10.1038/s41586-021-03512-4

[27]

Ehteshami Bejnordi B, Veta M, Johannes van Diest P, et al. Diagnostic assessment of deep learning algorithms for detection of lymph node metastases in women with breast cancer[J]. JAMA, 2017, 318(22): 2199-210. doi:10.1001/jama.2017.14580

[28]

Ghassemi M, Oakden-Rayner L, Beam AL. The false hope of current approaches to explainable artificial intelligence in health care[J]. Lancet Digit Health, 2021, 3(11): e745-50. doi:10.1016/s2589-7500(21)00208-9

[29]

van der Laak J, Litjens G, Ciompi F. Deep learning in histopathology: the path to the clinic[J]. Nat Med, 2021, 27(5): 775-84. doi:10.1038/s41591-021-01343-4

[30]

Saillard C, Schmauch B, Laifa O, et al. Predicting survival after hepatocellular carcinoma resection using deep learning on histological slides[J]. Hepatology, 2020, 72(6): 2000-13. doi:10.1002/hep.31207

[31]

Bulten W, Pinckaers H, van Boven H, et al. Automated deep-learning system for Gleason grading of prostate cancer using biopsies: a diagnostic study[J]. Lancet Oncol, 2020, 21(2): 233-41. doi:10.1016/S1470-2045(19)30739-9

基金资助

国家自然科学基金(82472056)

广东省自然科学基金(2024A1515012004)

RIGHTS & PERMISSIONS

版权所有©《南方医科大学学报》编辑部2021

AI Summary AI Mindmap
PDF (2225KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/