基于上下文感知原型合成的半监督医学图像分割

岳焕景 ,  谢浩峰 ,  王正坤 ,  杨敬钰

湖南大学学报(自然科学版) ›› 2026, Vol. 53 ›› Issue (6) : 50 -58.

PDF (2406KB)
湖南大学学报(自然科学版) ›› 2026, Vol. 53 ›› Issue (6) : 50 -58. DOI: 10.16339/j.cnki.hdxbzkb.2026271
计算机科学

基于上下文感知原型合成的半监督医学图像分割

作者信息 +

Context-aware prototype synthesis for semi-supervised medical image segmentation

Author information +
文章历史 +
PDF (2462K)

摘要

现有的原型学习方法通常为每个类别计算单一全局原型,难以在粘连边缘和模糊区域实现精准分割. 针对上述问题,本文提出了一种基于上下文感知原型的半监督医学图像分割框架, 通过自蒸馏机制学习标注图像局部区域与查询图像块间的亲和度关系,并利用聚类算法生成细粒度的多原型表征,显著提升了原型学习的判别能力与特征粒度. 为进一步增强模型性能,在自蒸馏和原型生成模块中分别引入记忆库机制,有效利用标注图像的可靠信息,同步提升全局上下文理解能力和局部细节分割精度. 此外,通过将对比学习整合到训练框架中,实现了类内特征的紧凑性和类间特征的强判别性. 所提方法在LA和NIH Pancreas两个主流数据集上进行了广泛的实验. 在10%和20%标注数据的半监督分割任务设置下,本方法在LA数据集和NIH Pancreas数据集上分别取得了90.18%/91.15%及79.42%/82.25%的Dice系数,其性能超越了现有主流半监督方法.

Abstract

The existing prototype learning approaches typically compute a single global prototype per category, which often struggles to achieve precise segmentation in adhesive edge regions and ambiguous areas. To address this issue, this paper proposes a context-aware prototype-based semi-supervised medical image segmentation framework. It employs a self-distillation mechanism to learn affinity relationships between local regions of annotated images and query image patches, and utilizes clustering algorithms to generate fine-grained multi-prototype representations, significantly enhancing the discriminative capability and feature granularity of prototype learning. To further improve model performance, a memory bank mechanism is incorporated into both the self-distillation and prototype generation modules, effectively leveraging reliable information from annotated images to simultaneously enhance global contextual understanding and local detail segmentation accuracy. Moreover, contrastive learning is integrated into the training framework to achieve intra-class feature compactness and inter-class feature discriminability. Extensive experiments on two widely used datasets, LA and NIH Pancreas, demonstrate that the proposed method outperforms recent semi-supervised approaches. Under the 10% and 20% labeled data settings for semi-supervised segmentation tasks, our method achieves Dice scores of 90.18% / 91.15% on the LA dataset and 79.42% / 82.25% on the NIH Pancreas dataset, respectively, surpassing state-of-the-art semi-supervised methods.

Graphical abstract

关键词

医学图像分割 / 半监督学习 / 原型学习 / 对比学习

Key words

medical image segmentation / semi-supervised learning / prototype learning / contrastive learning

引用本文

引用格式 ▾
岳焕景,谢浩峰,王正坤,杨敬钰. 基于上下文感知原型合成的半监督医学图像分割[J]. 湖南大学学报(自然科学版), 2026, 53(6): 50-58 DOI:10.16339/j.cnki.hdxbzkb.2026271

登录浏览全文

4963

注册一个新账户 忘记密码

医学影像中器官与病灶等目标的自动分割对临床诊疗具有重要意义. 近年来,数据驱动的深度学习方法在医学图像分割领域取得显著进展,基于全监督的深度学习方法1-3在多个公开数据集上表现出色. 然而,这类方法的性能高度依赖大量精细标注数据,而专业医师进行像素级标注需要耗费大量时间精力. 为解决这一问题,半监督医学图像分割(semi-supervised medical image segmentation, SSMIS)方法应运而生并日益受到关注,其核心目标是通过少量标注图像和大量未标注图像的协同使用,达到与全监督方法相当的分割性能.
当前大多数研究通过一致性学习利用大量未标注数据,即强制模型对同一样本的不同处理方式产生一致预测,从而提升半监督学习性能. 为生成可靠伪标签,Tarvainen等4提出均值教师框架,其教师模型与学生模型结构相同,参数更新由学生模型参数的指数移动平均(exponential moving average, EMA)计算得来. 多项研究对该框架进行了扩展:Yu等5通过考虑学生模型预测的不确定性,指导模型从教师模型的可靠伪标签中学习;Bai等6采用标注与未标注图像间的双向复制粘贴策略实现分布对齐;Chen等7将多器官图像分割为小块并随机重排,使模型学习器官间的空间关系. 其他研究从不同角度拓展了一致性学习的应用:Luo等8强制模型在不同尺度下的预测保持一致,并基于模型置信度加权;Wu等9结合模型内和模型间的一致性,促进多视角多模型对同一样本预测的一致性;Luo等10通过建立水平集函数回归任务与常规分割任务间的一致性来增强形状约束.Gao等11构建了标注与未标注像素级样本间的相关性,并通过强制各模型相关性矩阵一致实现正则化.但出于计算效率考虑,该方法仅选择部分像素进行训练,且相关性仅用于一致性正则化. 这些方法主要关注预测的形状约束或全局特征的语义关系,忽视了像素/体素层面的局部特性,导致粘连边缘和模糊区域分割不准确. 而原型学习通过从特征空间中计算特定目标或类别的聚类中心(原型),以此构建具有明确语义解释的度量空间,鼓励模型建立紧凑的类内特征分布并增强类间特征可分性. 该方法最初广泛应用于小样本分割和域适应任务,近年来因其能有效捕捉有限标注的语义信息并降低伪标签噪声干扰,已逐步扩展至半监督与弱监督学习领域.
在基础理论方面,Snell等12开创性地提出基于原型的少样本分类方法,通过在嵌入空间学习类别原型并计算测试样本与原型间的距离进行分类. Zhang等13设计的单样本分割方法采用掩码平均池化策略计算支持图像原型,并利用余弦相似度实现查询图像与原型间的特征匹配. Wang等14则通过原型匹配与图神经网络构建源域与目标域间的图结构,节点包含源域原型与目标域样本特征,边基于节点相似度建立,有效解决了异构域适应问题. 针对自然图像存在的类内差异(如光照、形变、遮挡等),研究者提出多原型扩展方案. Liu等15开发的部件感知原型网络通过识别目标不同部位生成多个代表性原型;Zhou等16提出的弱监督分割方法通过存储和更新全样本原型实现数据集级区域语义聚合.
在半监督医学图像分割领域,原型学习显著提升了模型对有限标注的利用能力:Wu等17采用最高分标注特征作为原型,通过最小化类内特征与原型距离实现紧致分布;Xu等18提出循环原型一致性学习方法,联合标注与未标注数据迭代优化原型;Zhang等19同时利用样本内与跨样本原型增强预测多样性. 由于医学图像目标具有形态纹理相似性,现有方法通常为每个目标计算单一全局原型. 然而,医学图像中普遍存在的模糊区域和伪影使得分割结果高度依赖上下文信息. 特别是在粘连边缘和模糊区域. 因此,作为表征学习目标的原型不应是全局一致的,而应是上下文相关的. 支持这种上下文相关分割结果的像素级特征不应仅与单一全局原型对齐,而应向体现特定局部信息的原型靠拢. 针对上述问题,本文提出了一种新型上下文感知原型合成框架,该框架能够在相似区域内动态合成上下文感知原型. 该网络首先通过自蒸馏方法显式构建图像块之间的亲和度关系,并构建存储所有标注图像块特征的特征记忆库以有效利用标注图像的可靠信息,其次,通过计算所有图像块的类别原型,将标注图像的类别原型存储在原型记忆库中;最终基于图像块之间的亲和度关系进行相似区域分组,为每个组别生成上下文感知原型并实施基于原型的对比学习,以此实现类内区域自适应的表征学习,使得同一类别中的像素能够根据不同的上下文原型获得更丰富的表征,提升了网络的特征表达能力.

1 网络结构

1.1 网络结构概述

半监督医学图像分割任务使用少部分标注图像和大量无标签图像训练网络,因此训练数据集被分为标注数据和无标签数据两部分.基于均值教师-学生网络框架4,本文提出了基于上下文感知原型合成的半监督医学图像分割框架,如图1所示.方法采用一个编码器-解码器结构的分割模型F(·)作为骨干网络.将图像输入该网络后,产生的像素级特征分别输入一个自蒸馏编码器Esd(·)和两个卷积头G(·)、H(·)中.Esd(·)与分割网络编码器的结构相同,用于后续的自蒸馏学习,目标是对当前图像及数据集中的相似区域进行分组.Esd(·)与F(·)间存在梯度截断,目的是防止自蒸馏过程影响网络中的其他部分,其输出结合自蒸馏构建图像块间的亲和度矩阵,辅助上下文感知原型合成.G(·)作为预测头,根据模型的输出特征来预测像素级分割预测概率图. H (·)是一个卷积头,其输出的像素级特征用于后续基于原型的对比学习. 图1中下标s表示学生模型,下标t表示教师模型.

1.2 基于自蒸馏学习的图像块亲和度计算

受过往工作20-21的启发,本文首先采用自蒸馏方法学习图像块之间的亲和关系,如图2所示. 不同于过往工作的是,本文提取图像块特征并学习图像块之间的亲和度,而不是使用全局特征来计算图像级亲和度. 此外,本文设计了一个独立的编码器放置在分割网络的下游,即自蒸馏编码器Esd(·),并将其与分割网络解耦. 这种设计既能避免自蒸馏过程干扰分割网络,又能直接利用分割网络的输出特征,鼓励网络捕获图像块之间的亲和关系,为原型合成及对比学习提供支撑.

对于输入图像q,对其分别执行随机空间变换TtTs后得到对应变换图像,将二者分别输入学生模型和教师模型,得到教师模型自蒸馏特征及学生模型自蒸馏特征.之后通过对教师模型自蒸馏特征进行空间逆变换并应用学生网络的空间变换,确保教师模型与学生模型的自蒸馏特征间空间位置上的一致性. 由于F(·)输出的像素级特征进入自蒸馏编码器后,经过4次下采样,所以 Fsd中的每个向量 fm 都代表了q中相应位置的图像块的特征,其中m为空间位置索引.

为了有效利用标注图像生成的教师模型自蒸馏特征并减少重复迭代带来的计算负担,引入容量为n的图像块特征记忆库 Mf来存储计算过的教师模型自蒸馏特征. 之后,对于输入图像q,按照如下公式分别计算教师模型和学生模型的图像块亲和度矩阵 AtAs

At=MfTFtsd
As=MfTFssd

式中:代表矩阵乘法; FtsdFssd分别代表教师模型自蒸馏特征及学生模型自蒸馏特征.

MfTFsd中的向量在计算前需要展平并归一化,因此亲和度矩阵 A 代表着输入图像块和图像块特征记忆库中存储的所有图像块之间的余弦相似度. 通过拉近教师模型和学生模型两个视角下 AtAs的一致性,能够有效地鼓励模型捕捉局部区域的语义关联性并学习局部特征的判别性表示. 最后,通过KL散度计算 AtAs之间的自蒸馏损失Lsd

At_norm=Softmax(At/τt)
As_norm=Softmax(As/τs)
Lsd=KL(At_norm||As_norm)

式中:τtτs分别代表教师模型和学生模型的温度超参数;Softmax(·)用于归一化输入矩阵,得到归一化矩阵 At_normAs_norm.

1.3 基于上下文内容感知的原型合成

1.3.1 计算局部原型

为了生成上下文感知的原型,首先需要计算每个图像块的局部原型. 由于图像块被视为局部区域的基本单元,其对应的局部原型也被视为原型的基本单元. 本文采用卷积头H (·)输出的通道为Cin,空间分辨率为H×W×D的像素级特征Fh合成原型并计算后续基于原型的对比损失. 对于输入图像q中的图像块pi,通过如下掩码平均池化22来计算类别c的局部原型 ηi

ηi=
j=1pi1(yi,j=c)fi,jhj=1pi1(yi,j=c),j=1pi1(yi,j=c)0;0,  其他情况

式中: | ∙ |表示集合中的元素数量;1( ∙ )表示指示函数;下标(ij)代表图像块pi 中的第j个像素;y表示标注图像的真实标签或无标签图像的标签; f h表示 Fh中的单个像素级特征. 若图像块对应的标签中不包含某一类别的像素,其对应的局部类别原型会被设为零向量,且不参与后续计算. 最终,图像块pi 的局部原型 ηi 被计算出来,其中包含Nc个类别原型.

对于输入图像块pi,使用学生模型的像素级特征,按照上述方法计算输入图像块原型. 为了有效利用标注图像的可靠语义信息,本文还构建了容量为n的图像块原型记忆库 Mη . 对于标注图像的图像块,根据教师模型输出的特征来计算其局部原型,计算后的原型将被存入原型记忆库 Mη 中以便后续感知原型合成时使用. 值得注意的是,为了确保图像块特征记忆库和原型记忆库中存储的特征和原型共享相同的图像块索引,教师网络的卷积头Ht(·)输出的像素级特征同样进行了空间逆变换并应用学生网络的空间变换,使得 Mf中的每个图像块特征与 Mη 中的每个图像块原型都对应相同的标注图像块.

1.3.2 上下文感知原型合成

为了整合现有的局部原型,本文利用亲和度矩阵 As来对图像块进行分组. 具体来说, As矩阵的每一行均视为一个样本点,代表输入图像特征和记忆库中所有特征匹配的余弦相似度. 因此使用K-means方法对 As矩阵中所有样本点进行聚类,从而将现有的n个特征记忆库中的图像块划分到K个聚类中. 然后,利用 As 矩阵将输入图像块分配到对应的聚类中. 具体而言,对于每个聚类后的矩阵,将矩阵中的数值沿列相加并归一化,得到代表每个输入图像块与聚类k之间的相似度向量 Sk,对于输入图像块pi,如果它符合下述规则之一,即可将其分配到聚类k中:(1)输入图像块与聚类k之间的相似度大于 Sk 向量中所有相似度平均值;(2)输入图像块pi 与聚类k的相似度大于pi 与其他聚类的相似度. 同一聚类中的记忆库图像块与输入图像块具有相似的上下文语义特征,因此这些区域的原型在特征空间中呈现出高度一致性,可用于合成具有类别判别性的上下文感知原型.而来自同一聚类的原型能够捕捉该类别的本质特征. 通过聚合这些具有语义一致性的原型特征,可以构建更鲁棒的类别表征,也能够有效增强模型对同类特征的聚合能力和不同类特征的判别能力.

在将图像块分配聚类完毕后,对每个聚类分别计算该聚类的记忆库图像块原型及输入图像块原型.记忆库存储的原型由教师模型基于标注数据生成,封装了可靠的类别语义特征,而输入图像块原型包含学生模型生成的来自当前批次数据的即时类别语义.聚类k中类别为c的记忆库图像块原型 ηa 、输入图像块原型 ηq 以及上下文感知原型计算公式如下:

ηk,ca=i=1Lηi,ca
ηk,cq=i=1Lsikηi,cq
ηk,c=λqηk,cq+γλaηk,caλq+γλa

式中:λq=i=1LsikL为输入图像块的个数,sik 为相似度向量 Sk 的第i个元素;λa 等于当前聚类中记忆库图像块的总数;γ是平衡记忆库图像块原型与输入图像块原型权重的超参数.

1.4 基于上下文感知原型的对比学习

本文将聚类k中类别为c的输入图像块像素集合用Qk,c 表示,其类别信息来自真实标签或伪标签. 对于这些像素,我们采用如下方式计算类别c中像素的上下文感知原型对比损失:

Lcacok,c,i,j=lgexp(fi,jhηk,c/τ)exp(fi,jhηk,c/τ)+c'cexp(fi,jhηk,c'/τ)
Lcacok,c=-1Qk,c(i,j)Qk,cLcacok,c,i,j

其中,τ是温度超参数.

为了提升计算效率,上下文感知原型对比损失优先选择学生网络预测结果与真实标签或伪标签不一致的像素,对于其他像素,按照其预测熵值进行排序,并选取熵值高的部分像素参与计算.此外,若一些输入图像块在所有聚类中都存在,则这些图像块会被多次计算损失,不仅对模型训练效率产生影响,还会对模型分割结果产生负面效果. 这类图像块通常位于目标主体区域,因而容易被模型准确分割,若在损失函数中过度强化此类样本的计算权重,将导致两个关键问题:其一,模型优化过程会过度偏向这些高置信度区域;其二,边缘区域的模糊样本和低对比度区域的表征能力会被抑制,最终导致分割边界定位不准和细节丢失. 因此,此类图像块将被归类至一个特殊的包含所有记忆库图像块的共享聚类,从而避免其参与原始聚类的对比损失计算. 最终,计算全局的上下文感知原型对比损失Lcaco

Lcaco=1K+11Nck=0Kc=0Nc-1Lcacok,c

1.5 损失函数

对于学生模型输入图像qs,其预测概率图 P 计算如下所示:

P=Softmax(Gs(Fs(qs)))

标注图像的监督损失Lsup和无标签图像的一致性损失Lcon计算如下所示:

Lsup=LDice(Pl,y)+LCE(Pl,y)
Lcon=LDice(Pu,yp)+LCE(Pu,yp)

式中:LDiceLCE分别是常见的Dice损失和交叉熵损失;y表示标注图像的真实标签;yp表示无标签图像由教师模型生成的伪标签; PlPu分别表示标注图像和无标签图像的预测概率图. 最终,总损失L计算如下:

L=Lsup+Lcon+αLsd+βLcaco

其中,αβ分别是LsdLcaco的损失权重.

2 实验与结果

2.1 数据集

本文的实验在2个公开数据集上进行,分别为LA左心房数据集23(以下简称“LA数据集”)和NIH Pancreas胰腺数据集24(以下简称“NIH Pancreas数据集”).

LA数据集包含100例3D钆增强核磁共振图像,其各向同性分辨率为0.625 mm×0.625 mm×0.625 mm,参照过往工作617,将100例图像划分为80例训练样本和20例验证样本. NIH Pancreas数据集包含来自53名男性和27名女性的82例3D腹部对比增强CT图像,由美国国立卫生研究院临床中心采集. 图像切片的固定分辨率为512×512像素,切片间距为1.5~2.5 mm. 本文使用的数据划分与过往工作1025保持一致,使用62例图像作为训练集,剩余20例图像作为测试集. 在图像预处理中,本文将像素值限制在-125~275亨氏单位之间,并将图像分辨率重采样到1.0 mm×1.0 mm×1.0mm,最后将像素值归一化.

2.2 实验设置

本文实验基于深度学习开源框架 PyTorch,并使用NVIDIA GeForce RTX 3090 GPU搭配CUDA 11.7进行训练和推理. 模型训练使用SGD优化器,学习率为0.01,动量为0.9,权重衰减为 0.000 1. 本文的模型训练分为三阶段:在第一阶段,通过监督损失Lsup来预训练分割网络F和预测分支G;在第二阶段,借助教师-学生框架和自蒸馏损失Lsd来预训练自蒸馏编码器Esd(·);在第三阶段,使用总损失L来训练整个模型.

Esd(·)的架构与分割模型的编码器一致,但在末尾添加了一个MLP层. 此外,一个Transformer层被添加到学生自蒸馏编码器Esd(·)的末端,以防止出现退化解. 预测分支G(·)是一个输出特征维度等于类别数量的1×1卷积头,而H(·)是一个输出特征维度等于输入特征维度的1×1卷积头.不同损失函数中的温度超参数设置为τt=0.1、τs=0.01和τ=0.5. MfMη 的大小n设定为数据集中所有标注图像块的数量.两个记忆库都在每次迭代结束时以先进先出的队列方式更新.聚类数K设置为10.

本文采用3D VNet2作为骨干网络. 对于LA数据集,在训练中,将图像随机裁剪为112×112×80像素并使用随机旋转和随机翻转作为空间变换. 批大小设定为4,三阶段训练的迭代数分别设置为2 000、 5 000和15 000次. 初始学习率设为0.01,每2 500次训练迭代后将学习率降低10%. 损失权重αβ分别设为0.1和0.5. 对于10%和20%标注数据下的训练,其γ值分别设为1和0.5. 对于 NIH Pancreas数据集,图像随机裁剪的尺寸变为96×96×96,且不采用任何空间变换. 其他设置与LA数据集保持一致.

2.3 实验分析

本文将提出的方法与其他新近的半监督方法在10%和20%标注样本量下进行对比,对比的方法包括:UAMT5、URPC8、SS-Net17、MC-Net25、MC-Net+[9]、BCP6和ML-RP26. 为了公平比较,在完全相同的实验设置下重新训练上述方法. 分割精度采用Dice系数、Jaccard系数、95%豪斯多夫距离27(95% Hausdorff distance,95HD)以及平均表面距离(average surface distance, ASD). Dice系数和Jaccard系数越高,表示算法对目标器官的分割效果越好,对于预测M和真实标签T,计算公式如下:

Dice=2×MTM+T,
Jaccard=MTM+T-MT

95HD计算两个对象所有边缘像素到对方的表面距离的最大值,95HD计算所有边缘像素的表面距离并从小到大排序后,选择前95%位置的数值作为最终的距离,豪斯多夫距离(HD)计算公式如下:

HD=d(M,T)=max{supmMinftT,suptTinfmMd(m,t)}

式中:mt分别代表预测M和真实标签T中的像素; dmt)代表预测的边缘像素到标签边缘像素的表面距离.

ASD计算模型预测的所有边缘像素到标签的表面距离的平均值. 95HD衡量模型预测边界与真实标签边界之间的最大距离,而平均表面距离更能代表模型预测边界与标签边界之间的总体吻合度.

表1表2展示了LA数据集及NIH Pancreas数据集在10%以及20%标注图像设定下的定量对比实验结果. V-Net-F作为参考上限,在100%标注图像设定下使用监督损失训练模型;V-Net-L作为参考下限,在10%以及20%标注图像设定下使用监督损失训练模型.

表1所示,本文方法在全部4个评价指标上均超越过往方法. 在使用10%以及20%标注图像时,相较于次优方法,本文方法在Dice和Jaccard系数上分别提升了0.6个百分点/0.96个百分点及0.25个百分点/0.42个百分点,此外本文方法在边界准确度指标上也取得了最优性能. 在使用20%标注图像的情况下,本文方法达到了与使用100%标注图像训练的3D-VNet-F相当的结果. 这表明,通过局部区域匹配和原型合成,本文方法能够有效利用有限的标注数据. 随着更多的标注样本加入到训练集,无标签区域可以与更多具有相似上下文的可靠标注区域进行匹配,从而合成更精确的上下文感知原型. 此外,图3中提供了不同方法在LA数据集上的视觉比较. 由于其识别不同上下文的能力,本文方法在边缘区域和低对比度区域产生了最佳的分割结果.

表2展示了在10%和20%标注图像设定下对 NIH Pancreas数据集的定量对比实验结果. 由于图像尺寸更大、样本数量更有限以及目标形状更为复杂,胰腺分割比左心房分割更具挑战性. 一些方法在仅使用10%标记数据时,只能达到低于60%的Jaccard系数,而本文方法则在4个指标中均取得最优性能. 相较于次优方法,在使用10%以及20%标注图像时,本文方法的Dice系数和Jaccard系数上分别提升了1.17个百分点/1.34个百分点及0.5个百分点/0.61个百分点,而在反映边界准确度的95HD和ASD指标上,本文方法也取得了最优性能.由图4可视化结果可以看出,得益于对不同局部区域的分组处理及基于上下文感知原型的对比学习,本文方法整体上更加接近真实标签.

为了进一步研究本文方法中各组件的有效性,以LA数据集为基准,使用10%和20%的标注图像训练并进行消融实验,实验分为如下部分:(1)基线模型(Baseline):采用教师-学生框架,包含监督损失和一致性损失,并引入预训练阶段;(2) Baseline-PCL模型:在Baseline的基础上,为每个样本计算整体原型,并引入基于原型的对比损失(prototype-based contrastive loss, PCL);(3) PCL-CA:在Baseline的基础上,对编码器输出的特征进行聚类,基于聚类结果构建当前批次的上下文感知原型,并在每个聚类内部实施PCL. 该方法未使用亲和度矩阵、记忆库或自蒸馏机制;(4) PCL-CA-Mem:在Baseline的基础上,利用编码器特征计算亲和度矩阵,以合成上下文感知原型,并在各聚类内执行 PCL,但不包含自蒸馏学习.

消融实验结果如表3所示. 可以看出,采用整体原型的Baseline-PCL方法显著优于基线模型,表明原型学习能够有效增强简单的形状约束方法. PCL-CA方法通过对图像块特征进行聚类,并在各聚类中计算上下文感知原型,相比Baseline-PCL取得了更好的分割效果,说明本文方法通过上下文感知的区域分组策略有效改进了原型学习机制.进一步地,PCL-CA-Mem通过引入双流记忆库和亲和度矩阵,提升了PCL-CA的分割性能,表明记忆库有助于为不同区域生成更准确的原型.值得注意的是,随着有标签图像比例的增加,PCL-CA-Mem在分割指标上的提升幅度超过PCL-H和PCL-CA,说明该策略能够更有效地利用标注数据.最终,借助自蒸馏学习,本文方法在所有评估指标上均达到最佳性能,这归因于Esd(·)模块能够有效捕捉分割网络所生成特征中的高分辨率信息,尤其在模糊区域表现突出.值得注意的是,与基于整体原型的Baseline-PCL相比,本文方法在分割结果上实现了显著提升.例如,使用10%和20%标注图像时,95HD指标分别降低了2.62 mm和2.49 mm.消融实验进一步验证,本文方法能够更精确地识别医学图像中的边缘区域,从而提升了原型学习的性能上限.

3 结 论

本文提出了一种基于上下文感知原型的医学图像半监督框架,能够有效学习数据集层面的区域关联性,并为每个相似区域组合成具有上下文感知能力的原型,从而增强了半监督医学图像分割中的原型学习能力. 同时引入特征记忆库与原型记忆库,以有效利用标注图像中的可靠信息,同时实现全局上下文理解和像素级分割精度. 在两个公共数据集上进行的实验证明了本文方法在定量和定性两个方面均优于现有最先进技术.

参考文献

[1]

RONNEBERGER OFISCHER PBROX T. U-net:convolutional networks for biomedical image segmentation[M]//Medical Image Computing and Computer-Assisted Intervention-MICCAI 2015.Cham:Springer International Publishing,2015:234-241.

[2]

MILLETARI FNAVAB NAHMADI S A. V-net:fully convolutional neural networks for volumetric medical image segmentation[C]//2016 Fourth International Conference on 3D Vision (3DV). October 25-28,2016. Stanford,CA,USA.IEEE,2016:565-571.

[3]

CHEN B ZLIU Y SZHANG Zet al .TransAttUnet:multi-level attention-guided U-Net with transformer for medical image segmentation[J]. IEEE Transactions on Emerging Topics in Computational Intelligence20248(1): 55-68.

[4]

TARVAINEN AVALPOLA H. Mean teachers are better role models:weight-averaged consistency targets improve semi-supervised deep learning results[C]//Neural Information Processing Systems (Neur IPs), 2017.

[5]

YU L QWANG S JLI X Met al .Uncertainty-aware self-ensembling model for semi-supervised 3D left atrium segmentation[C]//Medical Image Computing and Computer Assisted Intervention-ICCAI 2019.Cham:Springer,2019:605-613.

[6]

BAI Y HCHEN D WLI Q Let al .Bidirectional copy-paste for semi-supervised medical image segmentation[C]//2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), June 17-24,2023,Vancouver,BC,Canada. IEEE,2023:11514-11524.

[7]

CHEN D WBAI Y HSHEN Wet al .MagicNet:semi-supervised multi-organ segmentation via magic-cube partition and recovery[C]//2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), June 17-24,2023,Vancouver,BC,Canada. IEEE,2023:23869-23878.

[8]

LUO X DWANG G TLIAO W Jet al .Semi-supervised medical image segmentation via uncertainty rectified pyramid consistency[J].Medical Image Analysis202280:102517.

[9]

WU Y CGE Z YZHANG D Het al .Mutual consistency learning for semi-supervised medical image segmentation[J]. Medical Image Analysis202281:102530.

[10]

LUO X DCHEN J NSONG Tet al. Semi-supervised medical image segmentation through dual-task consistency[J]. Proceedings of the AAAI Conference on Artificial Intelligence202135(10): 8801-8809.

[11]

GAO S BZHANG Z JMA J Cet al. Correlation-aware mutual learning for semi-supervised medical image segmentation[C]//Medical Image Computing and Computer Assisted Intervention-MICCAI 2023. Cham: Springer, 2023: 98-108.

[12]

SNELL JSWERSKY KZEMEL R S. Prototypical networks for few-shot learning[C]//Neural Information Processing Systems,2017:4080-4090.

[13]

ZHANG X LWEI Y CYANG Yet al .SG-one:similarity guidance network for one-shot semantic segmentation[J].IEEE Transactions on Cybernetics202050(9):3855-3865.

[14]

WANG Z JLUO Y DHUANG Zet al .Prototype-matching graph network for heterogeneous domain adaptation[C]//Proceedings of the 28th ACM International Conference on Multimedia.Seattle, WA, USA. ACM,2020:2104-2112.

[15]

LIU Y FZHANG X YZHANG S Yet al. Part-aware prototype network for few-shot semantic segmentation[C]//Computer Vision-ECCV 2020.Cham:Springer,2020:142-158.

[16]

ZHOU T FZHANG M JZHAO Fet al. Regional semantic contrast and aggregation for weakly supervised semantic segmentation[C]//2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), June 18-24,2022,New Orleans,LA,USA. IEEE, 2022: 4289-4299.

[17]

WU Y CWU Z HWU Q Yet al .Exploring smoothness and class-separation for semi-supervised medical image segmentation[C]//Medical Image Computing and Computer Assisted Intervention-MICCAI 2022. Cham: Springer, 2022: 34-43.

[18]

XU ZWANG Y XLU D Het al. All-around real label supervision:cyclic prototype consistency learning for semi-supervised medical image segmentation[J]. IEEE Journal of Biomedical and Health Informatics202226(7): 3174-3184.

[19]

ZHANG Z XRAN RTIAN C Net al. Self-aware and Cross-sample prototypical learning for semi-supervised medical image segmentation[C]//Medical Image Computing and Computer Assisted Intervention-MICCAI 2023. Cham:Springer,2023:192-201.

[20]

TEJANKAR AABBASI KOOHPAYEGANI SPILLAI Vet al .ISD:self-supervised learning by iterative similarity distillation[C]//2021 IEEE/CVF International Conference on Computer Vision (ICCV), October 10-17,2021,Montreal,QC,Canada. IEEE,2022: 589-9598.

[21]

YOU C YDAI W CMIN Y Fet al. Bootstrapping semi-supervised medical image segmentation with anatomical-aware contrastive distillation[C]//Information Processing in Medical Imaging.Cham:Springer,2023:641-653.

[22]

ZHANG X LWEI Y CYANG Yet al. SG-one:similarity guidance network for one-shot semantic segmentation[J]. IEEE Transactions on Cybernetics202050(9):3855-3865.

[23]

CLARK KVENDT BSMITH Ket al. The cancer imaging archive (TCIA):maintaining and operating a public information repository[J]. Journal of Digital Imaging201326(6): 1045-1057.

[24]

XIONG Z HXIA QHU Z Qet al. A global benchmark of algorithms for segmenting the left atrium from late gadolinium-enhanced cardiac magnetic resonance imaging[J]. Medical Image Analysis202167:101832.

[25]

WU Y CXU M FGE Z Yet al .Semi-supervised left atrium segmentation with mutual consistency training[C]//Medical Image Computing and Computer Assisted Intervention-MICCAI 2021.Cham:Springer,2021:297-306.

[26]

SU J WLUO Z MLIAN Set al .Mutual learning with reliable pseudo label for semi-supervised medical image segmentation[J].Medical Image Analysis202494:103111.

[27]

MAIER-HEIN LEISENMANN MREINKE Aet al .Why rankings of biomedical image analysis competitions should be interpreted with care[J].Nature Communications20189:5217.

基金资助

国家自然科学基金资助项目(62072331)

National Natural Science

AI Summary AI Mindmap
PDF (2406KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/