基于扩散先验的CNN-Transformer网络在无监督低剂量CT去噪中的研究

曾颖 ,  杨晓敏 ,  杨浩然

四川大学学报(自然科学版) ›› 2026, Vol. 63 ›› Issue (02) : 384 -394.

PDF (1665KB)
四川大学学报(自然科学版) ›› 2026, Vol. 63 ›› Issue (02) : 384 -394. DOI: 10.19907/j.0490-6756.250149
电子信息科学

基于扩散先验的CNN-Transformer网络在无监督低剂量CT去噪中的研究

作者信息 +

Diffusion-Prior guided CNN-Transformer network for unsupervised Low-Dose CT denoising

Author information +
文章历史 +
PDF (1704K)

摘要

针对低剂量CT图像去噪中依赖LDCT-NDCT(Low Dose CT-Normal Dose CT)配对数据的核心难题,本文提出一种基于扩散先验的无监督去噪模型CTDM(CNN-Transformer Diffusion Model),通过构建噪声分布建模和跨尺度结构保持的联合学习框架,在无需配对数据约束下实现高保真CT图像去噪。首先,构建解剖先验约束的扩散概率模型,基于最大后验概率优化策略将预训练模型捕获的先验知识动态嵌入迭代去噪过程,实现无监督条件下的可靠噪声抑制。其次,设计CNN-Transformer双流混合网络,通过并行化局部-全局特征提取与自适应融合机制,在单阶段模型训练框架下实现高效去噪。相对于传统级联模型在显存和推理时间上的缺陷,本文采用单阶段训练策略,与多阶段串行去噪模型相比显著降低GPU显存消耗与推理时间。实验结果表明,CTDM在去噪性能上不仅优于当前最先进的无监督方法,其去噪效果甚至超越CTformer等有监督模型。

Abstract

To address the core challenge of dependency on paired LDCT-NDCT (Low Dose CT-Normal Dose CT) data in low-dose CT denoising, this paper proposes CTDM(CNN-Transformer Diffusion Model), an unsupervised denoising model based on diffusion priors. We establish a joint learning framework that integrates noise distribution estimation and cross-scale structure preservation, high-fidelity CT denoising is achieved without the constraints of paired data. First, we construct an anatomy-prior constrained diffusion probabilistic model, where pre-trained prior knowledge is dynamically embedded into the iterative denoising process via maximum a posteriori (MAP) optimization, enabling reliable noise suppression under unsupervised conditions. Second, we design a CNN-Transformer dual-stream hybrid network that combines parallelized local-global feature extraction with adaptive fusion mechanisms, achieving efficient denoising within a single-stage training framework. Compared to traditional cascaded models, our approach significantly reduces GPU memory consumption and inference time by eliminating multi-stage serial processing. Experimental results demonstrate that CTDM outperforms state-of-the-art unsupervised methods and even surpasses supervised models like CTformer in denoising fidelity.

Graphical abstract

关键词

低剂量CT / 无监督去噪 / 扩散模型 / 混合网络

Key words

Low-Dose CT / Unsupervised denoising / Denoising Diffusion Model / Hybrid network

引用本文

引用格式 ▾
曾颖,杨晓敏,杨浩然. 基于扩散先验的CNN-Transformer网络在无监督低剂量CT去噪中的研究[J]. 四川大学学报(自然科学版), 2026, 63(02): 384-394 DOI:10.19907/j.0490-6756.250149

登录浏览全文

4963

注册一个新账户 忘记密码

计算机断层扫描(Computed Tomography, CT)作为临床诊断的核心成像技术,通过X射线三维重建为疾病筛查提供关键解剖信息,但其检查过程中产生的电离辐射可能诱发细胞损伤甚至致癌风险1。为践行“合理可行最低剂量”(As Low As Reasonably Achievable, ALARA)原则,低剂量CT(Low Dose CT, LDCT)技术通过降低管电流或管电压减少辐射剂量。然而,剂量削减导致光子通量显著降低,使得重建图像受量子噪声、条状伪影等干扰,可能掩盖微小病灶特征,严重影响诊断可靠性。这一矛盾驱动LDCT去噪研究成为医学影像处理领域的重要方向。
基于深度学习的LDCT去噪方法近年来取得突破性进展,其发展脉络呈现显著的技术迭代特征。早期研究以RED-CNN等全卷积网络为主导2-5,通过逐层堆叠卷积操作提取局部纹理特征,利用监督学习实现端到端去噪映射。此类方法虽能有效抑制高斯噪声,但对CT图像中非平稳分布的复杂噪声处理能力有限,其根本瓶颈在于卷积神经网络的局部感受野特性难以建模跨区域的长程解剖关联5-6。针对此问题,Transformer架构凭借自注意力机制实现全局上下文感知,在低剂量CT去噪中展现出独特优势7-10。如Luthra等7提出的Eformer首次建立基于Transformer的LDCT去噪基线;Zhang等11设计的混合型网络通过并联CNN与Transformer分支,在噪声抑制与细节保留间取得更好平衡。此类融合架构验证了局部-全局特征协同建模的可行性,但现有方法多采用级联或并行策略,未能实现跨尺度特征的深度交互。
尽管上述监督学习方法性能优越,其实际应用面临根本性制约:模型训练需依赖大量精确配对的LDCT-NDCT(Normal Dose CT, NDCT)数据,而临床实践中对同一患者进行双剂量扫描既不现实也不符合辐射防护原则12。无监督学习提供了一条有效的技术路线12-14。例如,Liu等12从未配对的训练数据中合成配对图像,Niu等14则提出了一种基于相似性原理的LDCT去噪方法。这些方法虽降低了数据配对需求,但在噪声建模准确性与计算效率间尚未找到有效平衡点。
去噪扩散模型(Denoising Diffusion Model, DDM)的最新发展为突破上述困境提供了新路径15。DDM的核心在于定义了一个前向噪声扩散过程和一个逆向去噪过程,通过逐步迭代将随机噪声转化为目标数据分布。其显著优势在于模型能够通过预测噪声分布来隐式地学习复杂的数据分布特征,这种逐步精细化的去噪机制,对于还原医学图像中极其细微却至关重要的结构(如微细血管分支或早期微小肿瘤边缘)尤为关键,展现出远优于生成对抗网络(Generative Adversarial Network, GAN)单步生成模式的还原能力16。与自然图像相比,医学数据的采集通常涉及更复杂精密的物理成像过程,降低辐射剂量等措施往往导致图像质量显著下降。得益于扩散模型强大的数据分布学习能力,这些模型能够从训练数据中隐式地捕捉与成像物理过程相关的知识。因此,基于扩散模型的方法已被引入用于提升因成像限制而退化的低质量医学图像质量17-18。例如,AdaDiff19方法采用了一种自适应扩散先验进行深度磁共振成像重建,该方法采用两阶段训练流程:第一阶段通过快速执行扩散过程实现初始重建,第二阶段则通过自适应调整阶段细化扩散先验。近期研究进一步证实,将扩散先验嵌入贝叶斯推理框架可显著提升无监督去噪性能20-23。Song等24在自然图像去噪中验证了扩散模型对复杂噪声分布的有效建模能力;Peng等25将这一思路拓展至LDCT领域,但其方法直接采用了U-Net作为扩散模型的主干网络。
值得注意的是,现有方法普遍采用多阶段级联策略实现渐进式优化26-29,虽能提升性能却面临双重架构局限:1) 级联式推理需逐阶段执行数百次去噪迭代,显著增加单幅图像处理耗时;2) 在跨尺度特征传递过程中,低频噪声分量易通过下采样操作混叠至高分辨率特征空间,导致高频细节模糊化。这些瓶颈促使我们重新审视扩散模型在无监督LDCT去噪任务中的架构设计。将多阶段优化压缩为单阶段设计已有类似探索30,例如Zhao等31在图像融合领域提出的DDFM模型,该方法利用无条件DDM生成图像先验,并通过最大似然子问题保留源图像的跨模态信息。Yu等32利用DDM改进多厚度CT分割任务,提出高效预训练策略以迁移预训练特征至CT分割任务。然而,在LDCT去噪领域,相关单阶段优化研究仍显不足。针对上述挑战,本文旨在构建一种基于单阶段训练策略的无监督CNN-Transformer扩散模型(CNN-Transformer Diffusion Model,CTDM),其创新性体现在以下两方面:
1) 设计单阶段扩散模型实现无监督LDCT去噪,通过预训练模型提供的图像先验知识构建最大后验概率(Maximum A Posteriori,MAP)问题,并迭代求解去噪结果。相较于需级联多阶段优化的传统扩散模型,该设计不仅摆脱了对配对LDCT-NDCT数据的依赖,更通过单阶段逆向扩散过程实现了去噪加速。
2) 构建具有并行增强能力的CNN-Transformer混合模块,其中CNN分支利用局部卷积操作有效抑制非结构化噪声,而Transformer分支则通过自注意力机制重建长程解剖结构依赖关系。通过局部精细感知与全局语义理解的协同机制,有效克服将多阶段去噪模型压缩为单阶段设计时可能出现的特征提取不充分问题。

1 方法

1.1 基于NDCT的模型预训练

扩散模型通过预定义的前向扩散过程与可学习的逆向生成过程实现噪声到清晰图像的重构15

1.1.1 前向扩散过程

前向扩散过程通过逐步注入高斯噪声,将原始NDCT图像x0渐近退化为高斯噪声分布。其退化过程定义为马尔可夫链数学形式:

qx1:T|x0=t=1Tqxt|xt-1

其中,每个时间步t{1,2,...,T}的退化过程服从以下高斯分布:

qxt|xt-1=Nxt;1-βtxt-1,βtI

式中,βt~(0,1)是预设的噪声调度系数,控制噪声的注入速率,T是总扩散时间步。通过变量重整化技巧,可直接从x0计算任意中间时刻t的噪声图像xt

xt=α¯tx0+1-α¯tϵt

其中,ϵt~N0,I,αt=1-βt,α¯t=i=1tβi,满足时序递减特性。当扩散步数达到最大值T时,变量xT会收敛到标准高斯分布N(0,I),最终完全消除原始CT图像的解剖结构信息。

1.1.2 逆向扩散过程

逆向扩散过程从标准高斯噪声分布出发,经过T次迭代去噪逐步重建具有清晰解剖结构的图像。基于贝叶斯定理,任意中间步骤的逆向后验分布qxt-1|xt,x0可表示为条件高斯分布:

qxt-1|xt,x0=Nxt-1;μqxt,x0,σq2I

其中,μqxt,x0=α¯t-1βt1-α¯tx0+αt(1-α¯t-1)1-α¯txt。由于扩散模型真实逆向后验分布qxt-1|xt难以直接解析,因此通过参数化的高斯转移过程pθxt-1|xt对其进行近似建模:

pθx0:T=pxTt=1Tpθxt-1|xt
pθxt-1|xt=Nxt-1;μθxt,t,σt2I

其中方差项采用与理论后验分布一致的设定σt2I=σq2I,而均值函数μθxt,t通过神经网络参数化。网络参数θ的优化目标为最小化负对数似然-logpθ(x0)的变分下界(Variational Lower Bound, VLB):LVLB=Eq(x1:T|x0)logq(x1:T|x0)pθx0:T。模型在生成过程中逐步重建器官的形态学特征和组织纹理的统计特性,整体训练过程如图1所示。NDCT图像输入正向扩散过程后,通过马尔可夫链逐步添加噪声;随后将噪声图像输入去噪网络,通过多轮迭代逐步去除噪声。

1.2 LDCT去噪算法

设含噪图像LDCT为y0,其对应的无噪清晰图像为x0(NDCT),两者退化关系可表述为y=x+n,其中n表征LDCT特有的噪声成分。去噪框架建立在噪声图像y0与真实图像x0的结构相似性基础上。虽然两者的噪声水平存在显著差异,但预训练的扩散模型能够通过特征迁移机制将x0的学习特征有效迁移至y0的去噪处理上。

1) 退化过程建模。为了保证两个含噪变量在噪声空间中的分布一致性,从而在逆向扩散过程中实现特征有效迁移,采用同步加噪策略:用与预训练NDCT(xt)时相同的前向加噪过程,通过共享噪声参数ϵt生成对应的含噪潜变量yt

yt=α¯ty0+1-α¯tϵt

2) 优化框架构建。建模后可得yt=xt+α¯tn,优化目标变为利用扩散先验去除噪声项α¯tn。当T充分大时,yT服从标准正态分布N(0,I),因此初始化x^T=yT作为逆向去噪起点。基于预训练扩散模型提供的先验分布pθxt-1|x^t,在MAP框架下将去噪过程转化为如下双约束优化问题:

x^t-1=argminxt-1xt-1-yt-12+λt-1σtxt-1-μθx^t,t2, t>1

其中,x^t是第t次迭代优化的结果,把逆向扩散过程中的前序去噪结果x^t用作当前步t-1的生成引导信号,形成渐进式约束机制。动态权重系数λt-1=λ0α¯t-1为可调超参数,基于噪声水平的时序衰减特性,在低噪声阶段(小t值)强化先验约束,在高噪声阶段降低λt-1以增强数据保真作用。

3) 迭代求解机制。通过求解目标函数对x^t-1的极值条件,可得闭式解:

x^t-1=yt-1+λt-1μθx^t,t/σt1+λt-1/σt, t>1μθx^t,t, t=1

t=1时,噪声方差σt2=0,逆向过程退化为确定性生成。如图2所示,整个迭代过程从t=Tt=1逐步生成清晰图像x^0图2中,蓝色方框代表重复迭代去噪。整个去噪全程仅依赖预训练扩散模型的先验知识,无需LDCT-NDCT配对数据。每个迭代步骤都具有闭式解,确保了算法的执行效率。去噪实现细节如算法1所示。与需要依赖已训练模型来优化后续模型的级联多阶段方法不同,整个流程仅需训练一个无条件扩散模型。

算法1 LDCT去噪算法

输入: y0,θ,T,βtt=1,,T,λtt=1,,T

输出: x^0

1)   ϵt~N(0,I)

2)   yt=α¯ty0+1-α¯tϵt

3)   x^T=yT

4)   τm=[1,21,41,...,501,1 001,1 501,2 000]

5)  If τm>1 do

6)    根据式(9)更新x^t-1

7)   τm=τm-1

8)  end

9)   x^0=μθx^1,1

1.3 LDCT去噪网络

1.3.1 网络整体架构

为实现LDCT去噪任务,模型需要强大表征能力构建高质量图像先验,从而为去噪过程提供精准指导。针对无结构噪声xT到复杂解剖结构的生成难题,本文设计了一种新型多尺度编码器-解码器架构(如图3)以满足模型长程特征建模与局部细节捕捉的双重能力。该架构以CNN-Transformer融合模块(CT模块)为核心构建单元,突破了传统方法中CNN与Transformer单一架构的固有局限。

网络工作流程包含两阶段:1) 多尺度编码:输入噪声图像首先通过3×3卷积提取浅层特征后(通道数由1扩展至64),随后通过CT模块与下采样层逐级捕获深层特征,特征通道数逐渐增加(通道数遵循C=64×2n的指数增长规律),空间分辨率逐步降低(分辨率按1/2比例逐级缩减);2) 多尺度解码:采用对称结构的上采样层与残差连接重构图像细节,在末端通过3×3卷积将多通道特征映射为单通道去噪结果。

1.3.2 CT模块

为保障CT图像去噪后解剖结构的真实性并避免组织局部细节模糊化,本文设计如图4所示的并行双分支结构(RConv与ETrans),通过局部-全局特征协同建模实现这一目标。输入张量经3×3卷积层进行初步特征提取后,被划分为两组并行通路:

ETrans分支:基于Swin Transformer33核心架构(含层归一化、窗口多头注意力及残差连接),引入自适应窗口划分机制增强长程解剖关联性建模。其自注意力机制通过全序列相关性计算,加权聚合全局信息以捕捉长距离依赖关系。在特征非线性映射阶段,采用深度可分离卷积(DWConv)与残差连接的嵌套设计,在维持通道独立性的同时强化空间相关性建模34。由于自注意力机制在频域呈现低通滤波特性35,随着网络层深增加,高频分量(如纹理细节、边缘突变)逐渐被抑制,仅保留低频轮廓特征,易造成细微病理特征弱化。因此,引入由小核卷积层构成的第二分支,以弥补Transformer因降采样而丢失的像素级纹理信息。

RConv分支:采用组归一化-GELU-3×3卷积级联结构,通过小感受野卷积核提取高频纹理细节。卷积层的局部参数共享机制可保护高频分量,其平移不变性特性对重复性局部模式(如血管纹理)具有强捕捉能力。双分支输出经1×1卷积实现特征自适应融合,最终达成全局解剖结构与局部纹理细节的互补性平衡。

2 实验设计与实现

2.1 数据集与预处理

实验采用两个公开医学影像数据集:低剂量CT与投影数据集(LDCT-PD Dataset)36和AAPM-Mayo医学影像挑战赛数据集(Mayo Dataset)37。LDCT-PD数据集专注于收集低剂量CT图像及其投影数据,包含5组共1 704幅胸部CT图像,每组均提供NDCT图像与10%常规剂量的LDCT图像。为评估模型泛化能力,实验选取其中4组NDCT图像构建无噪声先验知识库进行训练,剩余1组中的LDCT图像作为测试集。所有胸部图像均采用标准医学影像显示窗宽(窗位:0 HU,窗宽:2000 HU)进行可视化处理。针对高分辨率(512×512)胸部CT图像的显存优化需求,本文采用分块处理策略38,将图像分割为128×128像素块进行训练。该数据集中10%剂量的LDCT图像具有极高噪声水平,可有效评估模型在极端噪声条件下的去噪性能。

Mayo数据集用于更全面地验证所提CTDM的实用性与泛化能力,包含10组共计2378张腹部CT图像,从中选取一组作为测试集。所有腹部图像均采用标准医学影像显示窗宽(窗位:-160 HU,窗宽:240 HU)进行可视化处理。与LDCT-PD数据集不同,Mayo数据集的LDCT图像采用全剂量25%的扫描参数获取,原始分辨率为256×256,同样分割为128×128的像素块进行训练。

2.2 实现细节

实验基于PyTorch深度学习框架实现,非深度学习方法均采用Matlab处理。网络训练过程中采用Adam优化器,初始学习率设为2×10-5,并采用线性衰减策略。对于LDCT-PD数据集,超参数λ0取0.3;Mayo数据集超参数λ0取0.07。扩散模型噪声调度参数β设置为β1=1×10-6,βT=1×10-2,采用线性递增策略。本文图像质量评价采用两项指标:1)峰值信噪比(Peak Signal-to-Noise Ratio, PSNR):衡量去噪图像与NDCT的像素级误差;2)结构相似性指数(Structural Similarity Index Measure, SSIM):评估图像结构保真度。

2.3 扩散模型加速

在扩散模型的前向过程中,噪声调度系数α¯t遵循单调递减规律,导致不同时间步对应差异化噪声水平。在高时间步,逆向过程早期对应高噪声水平。在此阶段,图像的低频成分占主导地位,主体结构已初步形成,大步长跳跃采样即可快速去除宏观噪声,加速整体轮廓重建。在低时间步,图像进入微结构重建期,在小t区间密集采样可精细化调节解剖结构的微细特征,确保关键诊断信息的保真度。因此,针对LDCT去噪任务,本文从原始扩散步长T=2 000中提取非均匀采样序列,缓解传统扩散模型的马尔可夫链式采样过程计算效率低问题,其中t[1,501]采用密集采样,剩余步骤采用稀疏采样(τ=[1,21,41,...,501,1001,1501,2000])。

2.4 比较结果

为系统评估所提CTDM模型的去噪性能,本文选取了传统方法、监督学习方法和无监督方法3类代表性算法进行多维度对比。实验对象包括:1) 传统去噪算法BM3D39和NLM40;2) 监督方法:CNN架构的RED-CNN2、Transformer架构的CTformer8以及基于内容-噪声互补学习框架的CNCL41;3) 无监督方法:基于级联扩散模型的Dn-Dp29和无需标签数据的Noise2Sim14

表1所示,定量分析结果表明:在25%剂量腹部CT数据上,CTDM取得了所有方法中最优的去噪指标。在更具挑战性的10%剂量胸部CT数据上,CTDM以0.976 6 dB和0.458 4 dB的幅度在PSNR指标上分别超越了监督方法CTformer和CNCL。即使在无监督方法范畴内,CTDM也显著优于Dn-Dp与Noise2Sim。虽然监督方法RED-CNN取得了最高的PSNR/SSIM指标,但CTDM的表现已十分接近这些顶尖监督模型的性能水平。考虑到监督模型通过利用成对的噪声-干净图像学习确定性映射函数,其本质上具备性能优势,CTDM在无需配对数据的约束下能够逼近其精度水平十分具有突破意义,尤其在极低剂量条件(10%)下依然展现出优异的鲁棒性。

图5的腹部CT去噪结果表明,尽管监督学习方法通常获得较高的PSNR,其视觉效果往往过度平滑甚至产生轻微模糊。这源于其依赖均方误差损失函数进行模型优化——通过最小化预测图像与真实图像的像素级差异来追求高PSNR,但可能不足以充分捕捉CT图像中的复杂结构和纹理信息。在此背景下,本文模型通过利用图像内在的自然统计特性引导去噪过程,无需依赖大量标注数据,在处理LDCT图像时具备独特优势,其性能可达到甚至接近监督方法的水平。在腹部CT图像上,CTDM超越了其他无监督方法,并实现了比监督方法更优的视觉保真度,进一步证实了其在LDCT去噪领域的优势与潜力。

图6展示了胸部CT图像的视觉对比结果。在10%剂量条件下,LDCT图像中大量关键信息被显著的条纹状泊松噪声所掩盖。传统方法BM3D(c)和NLMs(d)仅能实现部分噪声抑制,残留噪声依然明显。相比之下,基于监督深度学习的模型取得了更优的去噪效果。其中,RED-CNN(e)的重建结果最为接近标准剂量CT图像,但其端到端特性导致了一定程度的平滑效应。CTformer(f)表现欠佳,尤其在骨骼边缘区域仍残留明显噪声。CNCL(g)整体去噪效果良好,但引入了部分失真。在无监督方法中,Noise2Sim(h)和Dn-Dp(i)展现出具有竞争力的视觉效果,然而前者仍残留条纹噪声,后者存在一定模糊感。本文提出的CTDM方法(j),通过扩散先验约束与混合网络协同优化,在有效抑制噪声的同时,更完整地保留了解剖结构的边缘细节。尽管仍有改进空间,CTDM取得了优于部分监督方法的去噪效果。

图7聚焦于胸部CT图像特定感兴趣区域(ROI)内骨骼结构及组织轮廓的重建效果。对比结果表明,BM3D(c)和NLMs(d)几乎未能有效消除噪声,条纹状泊松噪声依然显著。RED-CNN(e)实现了非常好的视觉清晰度,但伴随平滑现象。CTformer(f)则出现严重模糊并残留噪声。CNCL(g)面临失真问题。值得注意的是,即便是监督学习方法也可能损失部分轮廓信息。相比于Noise2Sim(h)和Dn-Dp(i),本文方法CTDM(j)展现出更理想的去噪效果,在骨组织边缘锐度和软组织纹理保留方面达成了更优的平衡。

2.5 消融实验

为评估CT模块在去噪网络中的协同作用,本文设计了3种对比模型变体:1) net1-ETDM:纯Transformer架构,移除所有CNN组件;2) net2-RCDM:纯CNN架构,移除全部Transformer组件;3) net3-CTDM:混合架构,引入CT模块。

表2所示,net3-CTDM在PSNR与SSIM指标上均取得最优性能。由于CT图像具有极宽动态范围(-1000~3000 HU),显著增加了去噪难度,其指标微小提升可能对应着关键解剖结构的实质性改善。本文net3-CTDM的性能优势源于CT模块的双分支协同机制:全局建模(ETrans分支)保障噪声抑制能力,局部细化(RConv分支)聚焦高频细节,提升结构相似性。图8可视化对比进一步验证,相较于net1-ETDM,net3-CTDM能更清晰地保留组织纹理边缘以及细小结节,避免诊断信息损失。尽管CT模块引入了额外的模型参数,但其带来的性能增益在可接受的模型复杂度范围内,通过结构优化提升去噪效能超越了参数量增长的计算代价30

2.6 计算效率与去噪速度

表3所示,CTDM在模型参数量与去噪效率方面均优于两阶段级联模型Dn-Dp。其显存占用显著下降,充分体现了单阶段结构的紧凑性优势。在速度方面,CTDM处理单张胸部CT图像耗时仅需3.397 3 s,较Dn-Dp提速57%。作为基于迭代采样的扩散模型,CTDM较大的模型规模与较长的推理耗时是其复杂分布建模与迭代式生成机制的固有特性。表3中,实验结果来自于LDCT-PD数据集。本文通过单阶段设计,在同类无监督扩散模型方法中实现了效率与性能的良好平衡。该设计有效避免了级联模型中多个独立子网络带来的结构冗余,从而缩减了模型总参数量并缩短了去噪时间。

表4进一步对比了各类监督方法的计算复杂度与去噪时间。通过对比,CTDM的模型参数量显著高于监督学习方法(如RED-CNN、CNCL),这源于二者去噪模式的根本差异:监督模型依赖于成对的噪声-干净图像数据,学习一对一确定性映射。紧凑的网络结构就可以有效拟合此类映射任务。而基于无监督扩散模型的CTDM,其目标是从NDCT图像中学习数据本身的分布,通过建模噪声添加与去除的马尔可夫过程,逐步从纯噪声生成符合真实数据分布的图像。为了精确捕捉复杂的图像分布,模型必须具备更强的表达能力(更深或更宽的网络结构),从而导致了更高的模型容量需求以及更复杂的优化过程42-43

在去噪耗时方面,相较端到端CNN方法,CTDM仍存在效率差距。由于监督模型执行单次确定性变换,仅需一次前向传播即可输出最终去噪结果;而CTDM基于迭代采样机制,需逐步执行完整的逆扩散过程。每一步迭代都依赖神经网络预测噪声更新方向,导致累积的计算成本显著高于监督模型。在后续研究中我们也将持续探索轻量化设计策略进行模型优化,进一步提升其临床应用的潜力。

3 结论

本文提出一种基于扩散先验与混合网络架构的无监督LDCT去噪模型CTDM,其核心包含两个协同设计:首先,通过构建扩散先验驱动的MAP优化框架,在贝叶斯推断理论指导下实现噪声分布学习与建模;其次,创新性地设计CNN-Transformer跨尺度特征融合模块,通过局部-全局特征动态互补机制,在保持解剖结构连续性的同时抑制伪影生成。相比级联模型,训练复杂度从多阶段参数优化简化为单阶段优化。在无监督条件下,CTDM展现出了与监督方法相当的精度水平,通过扩散先验与混合网络的联合优化,在关键解剖结构的细节保留度上甚至能够超越监督模型。这些突破为扩散模型在医学图像重建领域的实用化提供了新思路,尽管当前模型存在参数量较大与推理耗时的局限,但其单阶段训练已显著降低实现门槛。在后续研究中,将重点开发模型压缩策略与硬件加速方案,以推动技术向临床实时系统的转化。

参考文献

[1]

Hobbs J BGoldstein NLind K Eet al.Physician knowledge of radiation exposure and risk in medical imaging[J].J Am Coll Radiol201815(1): 34-43.

[2]

Chen HZhang YKalra M Ket al.Low-dose CT with a residual encoder-decoder convolutional neural network[J].IEEE Trans Med Imaging201736(12): 2524-2535.

[3]

Ming JYi B SZhang Y Get al.2020.Low-dose CT image denoising using classification densely connected residual network[J].KSII Transactions on Internet and Information Systems (TIIS), 2020,6: 2480-2496.

[4]

Liang TJin YLi Yet al.EDCNN: edge enhancement-based densely connected network with compound loss for low-dose CT denoising[C]//2020 15th IEEE International Conference on Signal Processing (ICSP).Beijing,China: IEEE,2020: 193-198.

[5]

Li MHsu WXie Xet al.SACNN: Self-attention convolutional neural network for low-dose CT denoising with self-supervised perceptual loss network[J].IEEE Trans Med Imaging202039(7): 2289-2301.

[6]

Wang XGirshick RGupta Aet al.Non-local neural networks[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition.Salt Lake City, UT, USA: IEEE, 2018: 7794-7803.

[7]

Luthra ASulakhe HMittal Tet al.Eformer:Edge enhancement based transformer for medical image denoising[EB/OL].[2025-05-01].

[8]

Wang DFan FWu Zet al.CTformer: Convolution-free Token2Token dilated vision transformer for low-dose CT denoising[J].Phys Med Biol202368(6): 065012.

[9]

Li HYang XYang Set al.Transformer with double enhancement for low-dose CT denoising[J].IEEE J Biomed Health Inform202327(10): 4660-4671.

[10]

Zhang ZYu LLiang Xet al.TransCT: Dual-path transformer for low dose computed tomography [M] // Medical image computing and computer assisted intervention-MICCAI 2021.Cham: Springer International Publishing, 2021: 55-64.

[11]

Zhang JShangguan ZGong Wet al.A novel denoising method for low-dose CT images based on transformer and CNN[J].Comput Biol Med2023163: 107162.

[12]

Liu XLiang XDeng Let al.Learning low-dose CT degradation from unpaired data with flow-based model [J].Med Phys202249(12): 7516-7530.

[13]

Yuan NZhou JQi J.Half2Half: Deep neural network based CT image denoising without independent reference data[J].Phys Med Biol202065(21): 215020.

[14]

Niu CLi MFan Fet al.Noise suppression with similarity-based self-supervised deep learning[J].IEEE Trans Med Imaging202342(6): 1590-1602.

[15]

Ho JJain AAbbeel P.Denoising diffusion probabilistic models [J].NeurIPS202033: 6840-6851.

[16]

Dhariwal PNichol A.Diffusion models beat gans on image synthesis[J].NeurIPS202134: 8780-8794.

[17]

Kazerouni AAghdam E KHeidari Met al.Diffusion models for medical image analysis: A comprehensive survey[J].Med Image Anal202388: 102846.

[18]

Webber GReader A J.Diffusion models for medical image reconstruction[J].BJR| Artificial Intelligence20241(1): ubae013.

[19]

Güngör ADar S UÖztürk Şet al.Adaptive diffusion priors for accelerated MRI reconstruction[J].Med Image Anal202388: 102872.

[20]

Gauvain J LLee C H.Maximum a posteriori estimation for multivariate Gaussian mixture observations of Markov chains[J].IEEE Trans Speech Audio Process19942(2): 291-298.

[21]

Kawar BVaksman GElad M.Snips: Solving noisy inverse problems stochastically[J].NeurIPS202134: 21757-21769.

[22]

Kawar BElad MErmon Set al.Denoising diffusion restoration models[J].NeurIPS202235: 23593-23606.

[23]

Zhu YZhang KLiang Jet al.Denoising diffusion models for plug-and-play image restoration[C]//2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW).Vancouver, BC, Canada: IEEE, 2023: 1219-1229.

[24]

Song YShen LXing Let al.Solving inverse problems in medical imaging with score-based generative models[EB/OL].[2025-05-08].

[25]

Peng CGuo PZhou S Ket al.Towards performant and reliable undersampled MR reconstruction via diffusion model sampling[M]//Medical Image Computing and Computer Assisted Intervention-MICCAI 2022.Cham: Springer Nature Switzerland,2022: 623-633.

[26]

Ho JSaharia CChan Wet al.Cascaded diffusion models for high fidelity image generation[J].Journal of Machine Learning Research202223(47): 1-33.

[27]

Karras TLaine SAila T.A style-based generator architecture for generative adversarial networks[C]//2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR).Long Beach: IEEE, 2019: 4396-4405.

[28]

Saharia CHo JChan Wet al.Image super-resolution via iterative refinement[J].IEEE Trans Pattern Anal Mach Intell202245(4): 4713-4726.

[29]

Liu XXie YCheng Jet al.Diffusion probabilistic priors for zero-shot low-dose CT image denoising [J].Med Phys202552(1): 329-345.

[30]

Bao FNie SXue Ket al.One transformer fits all distributions in multi-modal diffusion at scale[C]//International Conference on Machine Learning.[S.l.]: PMLR, 2023: 1692.

[31]

Zhao ZBai HZhu Yet al.DDFM: Denoising diffusion model for multi-modality image fusion[C]//2023 IEEE/CVF International Conference on Computer Vision (ICCV).Paris: IEEE, 2023: 8048-8059.

[32]

Yu CSong YWang Qet al.Leveraging denoising diffusion probabilistic model to improve the multi-thickness CT segmentation[J].Neurocomputing2024610: 128573.

[33]

Liu ZLin YCao Yet al.Swin transformer: Hierarchical vision transformer using shifted windows[C]//2021 IEEE/CVF International Conference on Computer Vision (ICCV).Montreal,QC,Canada: IEEE, 2021: 9992-10002.

[34]

Li HSong QGui Det al.Reconstruction-assisted feature encoding network for histologic subtype classification of non-small cell lung cancer[J].IEEE J Biomed Health Inform202226(9): 4563-4574.

[35]

Wang PZheng WChen Tet al.Anti-oversmoothing in deep vision transformers via the Fourier domain analysis: From theory to practice[EB/OL].[2025-05-08].

[36]

Moen T RChen BHolmes III D Ret al.Low dose CT image and projection data[J].Med Phys202148(2): 902-911.

[37]

McCollough C HBartley A CCarter R Eet al.Low-dose CT for the detection and classification of metastatic liver lesions: Results of the 2016 Low Dose CT Grand Challenge[J].Med Phys201744(10): e339-e352.

[38]

Luhman TLuhman E.Improving diffusion model efficiency through patching[EB/OL].[2025-05-08].

[39]

Dabov KFoi AKatkovnik Vet al.Image denoising by sparse 3-D transform-domain collaborative filtering [J].IEEE Trans Image Process200716(8): 2080-2095.

[40]

Buades AColl BMorel J M.A non-local algorithm for image denoising[C] //2005 IEEE ComputerSociety Conference on Computer Vision and Pattern Recognition (CVPR’05).San Diego: IEEE,2005: 60.

[41]

Geng MMeng XYu Jet al.Content-noise complementary learning for medical image denoising[J].IEEE Trans Med Imaging202241(2): 407-419.

[42]

Guo Y FPei XWang D Het al. HyperSegUNet: A hyperparameter self-learning medical image segmentation network based on hypernetworks[J].Journal of Sichuan Normal University(Natural Science)202447(1): 127-135.

[43]

郭逸凡, 裴瑄, 王大寒, .HyperSegUNet:基于超网络的超参自学习医学图像分割模型[J].四川师范大学学报(自然科学版)202447(1): 127-135.

[44]

Wang Z QZeng X H. Contrast-enhanced relational memory network for medical image report generation [J].Journal of Chongqing University of Posts and Telecommunications(Natural Science Edition)202436(3): 503-512.

[45]

王志强, 曾宪华.对比增强的关联记忆网络用于医学图像报告生成[J].重庆邮电大学学报(自然科学版)202436(3): 503-512.

基金资助

四川省自然科学基金项目(24NSFSC2159)

四川省自然科学基金项目(2024NSFSC1792)

AI Summary AI Mindmap
PDF (1665KB)

334

访问

0

被引

详细

导航
相关文章

AI思维导图

/