基于Swin-ResViT网络的低质量动态cine-MR至高质量定位MR图像实时生成研究

陈博湧 ,  汪新怡 ,  赵新新 ,  宋婷 ,  李永宝

南方医科大学学报 ›› 2026, Vol. 46 ›› Issue (04) : 929 -938.

PDF (3134KB)
南方医科大学学报 ›› 2026, Vol. 46 ›› Issue (04) : 929 -938. DOI: 10.12122/j.issn.1673-4254.2026.04.21

基于Swin-ResViT网络的低质量动态cine-MR至高质量定位MR图像实时生成研究

作者信息 +

Swin-ResViT network for real-time generation of high-quality localization MR images from low-quality cine-MR

Author information +
文章历史 +
PDF (3208K)

摘要

目的 探索基于Swin-ResViT网络从动态cine-MR生成高质量治疗前定位MR(sMR),提升实时影像的信噪比和对比度。 方法 提出一种融合Swin Transformer模块的ResViT模型(Swin-ResViT),通过优化瓶颈层结构以提升特征提取效率。回顾性收集2024年2~7月在中山大学肿瘤防治中心接受治疗的17例肝癌患者数据,其中12例肝癌患者的治疗中cine-MR和治疗前定位MR作为训练集,5例患者为测试集。通过量化sMR与参考定位MR的归一化均方根误差(NRMSE)、峰值信噪比(PSNR)、结构相似性指标(SSIM)、运动标记点误差以及模型推理速度,综合评估图像生成质量和模型性能。 结果 生成图像质量方面,Swin-ResViT生成的sMR相较于原始cine-MR,NRMSE、LPIPS分别下降约90%、82%(P<0.001);PSNR、SSIM、CNR分别提升约157%、79%、181%(P<0.001)。结构准确性方面,动态sMR序列中右肝叶肝膈交界处运动标记点的平均定位误差为0.7695±0.7294 mm(P<0.05)。模型推理速度方面,对于224×224像素的单帧图像,在NVIDIA GeForce RTX 2080 Ti GPU上Swin-ResViT的平均处理时间为15.5 ms,对比标准ResViT为41.4 ms,减少了约62%。 结论 Swin-ResViT模型能从cine-MR合成高质量sMR,该方法兼具高效计算与显著图像增强优势,对实时MRgRT具有重要临床意义。

Abstract

Objective To obtain high-quality pre-treatment localization MR (sMR) images from dynamic cine-MR using the Swin-ResViT network for target tracking in MRgRT. Methods We propose a ResViT model fused with a Swin Transformer module (Swin-ResViT) with an optimized bottleneck layer structure for enhancing feature extraction efficiency. Seventeen liver cancer patients were retrospectively enrolled from Sun Yat-sen University Cancer Center from February to July 2024, and 12 of them were assigned to the training set (using intra-treatment cine-MR and pre-treatment planning MR), with the remaining 5 patients as the test set. Image generation quality and model performance were comprehensively evaluated by quantifying the normalized root mean square error (NRMSE), peak signal-to-noise ratio (PSNR), structural similarity index (SSIM), motion marker point error, and model inference speed between sMR and reference localization MR. Results Regarding image quality, Swin-ResViT reduced NRMSE and LPIPS by 90% and 82% compared to cine-MR (P<0.001), and improved PSNR, SSIM, and CNR by 157%, 79%, and 181% (P<0.001), respectively. Regarding structural accuracy, the mean localization error of motion markers at the right hepatophrenic junction in the generated dynamic sMR sequences was 0.7695±0.7294 mm (P<0.05). Regarding model inference speed, for a single 224×224-pixel frame, the average processing time on an NVIDIA GeForce RTX 2080 Ti GPU was 15.5 ms for Swin-ResViT as compared with 41.4 ms for the ResViT network, demonstrating a 62% reduction. Conclusion The Swin-ResViT model can synthesize high-quality sMR from cine-MR images. This method combines computational efficiency with significant image enhancement advantages, and thus has important clinical significance for real-time MRgRT.

Graphical abstract

关键词

磁共振引导放射治疗 / Transformer / cine-MR / 合成MR / 深度学习

Key words

MRgRT / Transformer / cine-MR / synthetic MR images / deep learning

引用本文

引用格式 ▾
陈博湧,汪新怡,赵新新,宋婷,李永宝. 基于Swin-ResViT网络的低质量动态cine-MR至高质量定位MR图像实时生成研究[J]. 南方医科大学学报, 2026, 46(04): 929-938 DOI:10.12122/j.issn.1673-4254.2026.04.21

登录浏览全文

4963

注册一个新账户 忘记密码

磁共振引导放射治疗(MRgRT)能利用二维动态磁共振成像(cine-MR)序列,以约5帧/s的速率实现分次内靶区运动实时追踪,为精准放疗提供技术支持1-3。然而,由于MR成像时间与空间分辨率之间存在固有权衡,cine-MR序列在满足高帧率要求的同时,常难以兼顾高空间分辨率,导致图像噪声较高、对比度偏低,难以满足高精度靶区定位与追踪的临床需求45。因此,发展能够有效提升cine-MR图像质量的先进算法具有重要意义。
基于深度学习的方法是当前解决该问题的主流范式6-8。如有学者提出一种由去噪循环生成对抗网络(CycleGAN)和增强CycleGAN级联的框架,用于增强二维cine-MR图像质量:其中,去噪CycleGAN利用时域序列对cine-MR进行降噪,而增强CycleGAN则融合计划和定位图像的先验信息以提升cine-MR的空间分辨率和对比度9。有研究采用人工降采样策略,从高分辨率MR生成低分辨率数据,并训练并行CycleGAN网络以预测和融合多平面图像,最终合成高分辨率MR10。然而,这些方法存在两大核心瓶颈:在模型架构层面,基于卷积神经网络的GAN(如CycleGAN)虽在图像生成任务中表现出色1112,但其卷积操作的局部感受野特性限制了长程依赖关系建模能力,导致模型对全局上下文感知不足,生成的图像易出现结构性伪影和细节失真,难以保证解剖结构的全局一致性1314;在研究侧重点方面,现有方法15-17多集中于提升图像的整体信噪比与分辨率,其依赖人工降采样构建训练配对,但这种模拟数据与临床真实采集数据间存在固有的域分布差异,致使增强结果虽能优化宏观纹理平滑度,却对原始图像中关键解剖结构(如肿瘤边界)的增强效果有限,无法从根本上解决临床靶区追踪的瓶颈问题。
近年来,条件去噪扩散概率模型(cDDPM)以其生成高保真、多样化图像的能力在图像生成领域取得了令人瞩目的成果18-20。然而,标准的扩散模型通常需要上千次迭代采样,导致其推理速度极慢,难以满足MRgRT的实时性要求;此外,扩散模型的随机采样特性也有可能导致解剖结构的细微偏差。
为应对上述挑战,本研究提出了一种融合Swin Transformer21模块和跳跃连接的ResViT22架构(Swin-ResViT)。一方面,为克服卷积操作的固有局限,Swin-ResViT继承并发展了Transformer架构23的核心思想,通过引入Swin Transformer的移位自注意力机制来增强长程依赖建模能力,从而解决由局部感受野导致的解剖结构不一致问题;另一方面,得益于MRgRT临床流程中固有的数据优势——患者每次治疗前采集的高质量三维定位MR图像,本研究可在监督学习框架下直接利用真实的解剖先验知识指导图像增强。具体而言,本研究通过将定位MR作为高质量先验,聚焦于实现从低质量cine-MR到高质量解剖结构的跨模态映射,而非仅侧重于宏观纹理增强。因此,与以往方法不同,Swin-ResViT旨在生成与解剖先验知识高度一致的实时合成磁共振(sMR)图像序列,从而显著提升如肿瘤边界等关键解剖结构的对比度。现报道如下。

1 材料和方法

1.1 数据采集与预处理

本研究回顾性收集了2024年2~7月在中山大学肿瘤防治中心接受Elekta Unity MRgRT治疗的17例肝细胞癌患者影像数据,所有数据被分为训练验证组(12例,共2438对图像)和测试组(5例,共844对图像)两组。纳入标准:肿瘤位于肝脏区域;接受Elekta Unity 1.5T MR引导放射治疗;具有完整的治疗前定位MR及治疗中动态cine-MR影像序列。排除标准:图像存在严重金属伪影或运动伪影;影像数据缺失或扫描参数不符合研究规范。本研究经中山大学肿瘤防治中心伦理委员会审批通过(伦理批号:G2024-054-01)。所有患者在治疗前均于自由呼吸状态下采集定位MR导航扫描图像,并于膈肌位置放置导航带监测呼吸运动,以有效抑制运动伪影。定位MR图像采用快速自旋回波序列(TSE)在1.5T场强下采集,具体参数:重复时间(TR)2.10 ms,回波时间(TE)0.22 ms,翻转角90°,空间分辨率0.62 mm×0.62 mm×3.0 mm,层厚3.0 mm,视野(FOV)根据患者个体情况设定。治疗期间采用平衡快速场回波(bFFE)序列采集二维cine-MR图像,参数:TR 3.8 ms,TE 1.92 ms,翻转角40°,空间分辨率3.03 mm×3.03 mm,层厚5.0 mm。

为提升空间一致性,将所有cine-MR图像重采样至与定位MR冠状位图像相同的空间分辨率。由于呼吸运动及采集时间差异导致cine-MR图像与定位MR图像间无法实现像素级对齐,本研究采用形变配准方法24将处理后的cine-MR图像与定位MR图像中结构相关性最高的切片进行配准,以构建配对训练数据。为验证配准质量,本研究在配准后的图像对上分别选取右肝膈顶交界处及大血管分叉处作为标记点并计算其平均欧氏距离,结果显示其平均配准误差分别为1.009 mm、0.769 mm,表明经过形变配准后的数据集实现了高精度的解剖对齐。

最终,所有配准后的图像均统一裁剪为224×224像素分辨率,并经由实例最小-最大归一化处理,将像素值规范至[0,1]区间。最终将处理后的数据输入神经网络中进行训练与验证,其中训练阶段应用数据增强策略以提升模型鲁棒性。

1.2 Swin-ResViT模型

1.2.1 网络结构

Swin-ResViT的网络结构(图1A),采用编码器-瓶颈层-解码器对称架构,并通过跳跃连接实现跨路径特征融合。编码器部分由一系列卷积层构成,通过逐级下采样提取图像的多尺度局部特征;与之对应的解码器则采用转置卷积操作进行上采样操作,逐步恢复空间分辨率并重建目标图像。瓶颈层作为网络核心,由多个Swin Transformer模块堆叠而成,负责对编码器所提取的特征进行全局上下文建模,从而捕捉与图像重建任务相关的长程依赖关系。与标准ResViT相比,Swin-ResViT对模型结构进行了优化:不仅简化了模型组合方式(瓶颈层仅由Swin Transformer模块构成,且在编码器和解码器间加入跳跃连接),还减少了层数,从而在保持特征提取能力的同时显著提升了计算效率,降低了模型复杂度和训练开销。与UNet25类似,跳跃连接将编码器路径上的空间特征与解码器路径上对应尺度的语义特征进行拼接,以缓解下采样过程中的空间信息损失。

与传统多头自注意力(MSA)模块不同,Swin Transformer模块采用基于窗口与移位窗口的高效自注意力计算机制21。Swin Transformer模块由层归一化(LN)、多头自注意力模块、残差连接及多层感知器(MLP)层构成(图1B)。基于窗口(W-MSA)与移位窗口(SW-MSA)的多头自注意力机制在2个连续子模块中交替堆叠。与传统MSA的全局计算不同,Swin Transformer模块首先在初始子模块中将输入特征图均匀划分为固定大小的非重叠窗口,每个窗口内部独立进行自注意力计算,大幅降低了计算复杂度。为解决窗口间信息交互不足的问题,后续子模块在划分窗口前沿特定轴向平移特征图,使相邻窗口内的元素得以重新组合并参与统一注意力计算,从而在不显著增加计算负担的前提下实现跨窗口的信息交换与全局依赖建模。基于此结构,Swin Transformer模块可表述为:

z^l=W-MSA(LN(zl-1))+zl-1
zl=MLP(LN(z^l))+z^l
z^l+1=SW-MSA(LN(zl))+zl
zl+1=MLP(LN(z^l+1))+z^l+1

与既往研究26][27类似,自注意力计算如下:

Attention(Q,K,V)=SoftMaxQKTd+BV

1.2.2 损失函数

用于训练模型的损失函数包含3个部分:平均绝对误差损失(MAE)、结构相似性损失(SSIM)和梯度损失。平均绝对误差损失用于缩小合成图像和参考定位MR(reference MR)之间的像素值偏差:

LMAE=EyiϵΥ, xiTϵXT|yi- xiT|

其中,xiTyi分别代表第i个reference MR与其对应的合成图像。

结构相似性损失从亮度、对比度和结构3个维度约束合成图像与reference MR的相似性:

Lssim=EyiϵΥ, xiTϵXT2μxiTμyi+C12σxiTyi+C2μxiT2+μyi2+C1σxiT2+σyi2+C2

其中,μxiTμyiσxiT2σyi2分别是reference MR和其对应的合成图像的均值与方差,σxiTyi为两者的协方差,C1C2为常数。

梯度损失通过正则化细微结构变化,用于最小化reference MR与合成图像之间的精细解剖差异28。边缘梯度采用Sobel算子计算:

LGrad=EyiϵΥ, xiTϵXT||yi-xiT||22

完整的损失函数为:

Loss=λ1LMAE+λ2Lssim+λ3LGrad

其中λ1λ2λ3分别设置为3、1和2。该权重组合基于初步试验结果经验性确定。

1.3 模型训练

Swin-ResViT基于Pytorch框架构建。实验运行环境为Windows 10操作系统,32 GB内存,Intel i5-6400处理器,NVIDIA GeForce RTX 2080 Ti显卡。

模型训练采用Adam优化器,相关超参数设置如下:初始学习率为0.004,并随训练周期(epoch)线性衰减;动量参数β1和β2分别设置为0.5和0.999。训练共进行150个epochs,批处理大小为24。每个训练周期开始前随机从数据集中挑选1例患者的数据作为验证集,其余数据作为训练集。为确保实验结果可重复性,训练与验证过程中随机种子固定为777。模型最终评估在独立的测试集上进行。

为充分评估模型的泛化能力并降低因数据集规模较小导致的过拟合风险,本研究采用了4折交叉验证策略,将17例患者随机划分为4个子集,每次实验选取1个子集作为测试集,其余子集用于训练和验证。该过程重复4次,确保每个患者的数据均被独立测试过1次,最终结果取4次实验的平均值与标准差。

1.4 评估指标

采用NRMSE、SSIM、PSNR指标和模型推理速度评估模型的生成性能29-32。NRMSE用于衡量reference MR与模型合成图像之间的差异程度,数值越低表明两者差异越小。PSNR和SSIM从感知相似性角度评估图像质量,数值越高表明模型输出的图像质量越优越。公式定义如下:

NRMSE=1NjN|xT(vj)-y(vj)|2xT(vj)max-xT(vj)min
SSIM=(2μyμxT+c1)(2σyσxT+c2)(μy2+μxT2+c1)(σy2+σxT2+c2)
PSNR=10×log10(MAX2jN|xT(vj)-y(vj)|2/N)

其中N为像素总数,xT(vj)y(vj)分别是reference MR和合成图像第j个像素的像素值,MAX为图像的最大灰度值。

LPIPS指标用于测量2幅图像之间的感知相似性,通过深度学习方法实现。本研究采用基于AlexNet骨干网络的LPIPS指标,其数值越低,表示图像质量越好。

采用对比噪声比(CNR)评估图像中肿瘤区域的可辨识度,其数值越高,表明肿瘤与周围正常肝组织的辨识度越高。公式定义如下:

CNR=|μtumor-μliver|0.5×(σtumor2+σliver2)

其中μσ分别代表对应区域内的像素均值与标准差。

1.5 对比实验

为了全面评估所提出模型在跨模态图像合成任务中的性能,本研究将其与3种代表性的主流方法进行对比,包括基于生成对抗网络的CycleGAN、基于混合Transformer架构的ResViT,以及基于生成式扩散模型的cDDPM。为确保对比的公平性,所有模型均在相同的训练集和验证集上进行训练,并针对本研究的成对数据特点进行了适配。

1.5.1 CycleGAN

虽然CycleGAN通常用于无监督任务,但在本研究中调整为监督训练模式,以充分利用成对数据的优势。模型保留了包含9个残差块的ResNet生成器和70×70 PatchGAN判别器的标准架构。在损失函数方面,除了原有的循环一致性损失和对抗损失外,CycleGAN额外引入了平均绝对误差损失来约束生成图像与真实图像之间的一致性。模型训练轮次设定为150个Epoch,其余超参数与官方实现保持一致。

1.5.2 ResViT

ResViT是一种结合了卷积神经网络局部特征提取能力和Vision Transformer全局上下文建模能力的先进模型。与CycleGAN类似,为了进一步提升生成图像的结构准确性,ResViT在原有的对抗损失和重构损失基础上,显式增加了L1损失进行监督训练。该模型同样训练150个Epoch,其他训练参数均参照原论文官方设置。

1.5.3 cDDPM

本研究构建了一个基于U-Net架构的cDDPM模型。该模型通过通道拼接的方式,将cine-MR作为条件输入与噪声图像联合送入网络。骨干网络包含5个层级,特征通道数由64逐层增加至1024,并通过多层感知机将正弦时间步嵌入以逐元素相加的方式注入特征图。训练过程中,本研究采用均方误差(MSE)作为损失函数,扩散步数T与多数扩散模型一致设为1000,并使用线性噪声调度策略31。考虑到模型收敛特性及与对比方法的公平性,本研究将训练轮次统一设定为150个Epoch,除模型特有参数外,其余超参数与Swin-ResViT一致。

1.5.4 Pix2Pix

鉴于本研究使用了配对的训练数据,本研究引入了Pix2Pix作为基线模型之一。Pix2Pix作为一种经典的条件生成对抗网络,专用于配对图像翻译任务,其生成器采用U-Net结构,判别器采用PatchGAN结构。在训练过程中,模型同时最小化对抗损失和L1重构损失,以确保生成图像在结构和纹理上与真实图像一致。除模型特有参数外,其余超参数与Swin-ResViT一致。

1.6 消融实验

为验证Swin-ResViT网络中损失函数、跳跃连接、Swin-Transformer模块等组件的有效性及融合架构的必要性,本研究设置了以下3组消融实验。

1.6.1 损失函数有效性分析

为评估不同损失项对图像重建质量的贡献,本研究构建了3种损失函数组合进行对比:仅使用平均绝对误差损失;使用平均绝对误差损失联合梯度损失;本研究提出的完整组合损失。

1.6.2 跳跃连接数量分析

为探究多尺度特征融合对恢复空间信息的具体作用,本研究逐步增加编码器与解码器之间的跳跃连接数量(0~3个),设置了4种不同的网络配置进行训练与评估。

1.6.3 网络架构合理性分析

为分析Swin Transformer瓶颈层与跳跃连接在网络架构中各自的贡献,本研究构建了2个基准模型与Swin-ResViT进行对比:Baseline 1,移除了Swin-ResViT编码器与解码器之间的所有跳跃连接,仅保留Swin Transformer瓶颈层,以验证跳跃连接在恢复高频解剖细节方面的作用;Baseline 2,保留了与Swin-ResViT相同的U-Net骨架和跳跃连接,但将瓶颈层替换为标准ResViT中的ART模块(数量与ResViT一致),以验证Swin Transformer模块在建模全局依赖时相对于ART模块的效率与性能优势。

1.7 模型注意力可视化

为进一步验证Swin-ResViT架构在cine-MR增强任务中的有效性,本研究采用Grad-CAM技术对网络关注的区域进行了可视化,选取Swin-ResViT模型瓶颈层的最后一层作为目标层,肝脏区域作为目标区域生成热力图,再将热力图上采样后叠加到原始输入上,以直观展示模型在重建解剖结构时所关注的空间位置与特征权重。

1.8 统计学分析

使用Python 3.7 SciPy库进行数据分析。本研究中的图像质量客观评价指标均为计量资料,经正态性检验符合正态分布,以均数±标准差表示。采用配对样本t检验比较Swin-ResViT模型与其他对比模型在同一测试集上生成的图像质量指标差异,以评估不同方法间的性能优劣。所有统计检验均为双侧检验,以P<0.05为差异有统计学意义。

2 结果

2.1 sMR的合成质量评估

定性分析表明,Swin-ResViT所生成的sMR图像在软组织结构等解剖细节上与reference MR高度一致,相较于原始cine-MR图像,sMR在肿瘤边界清晰度方面显著改善(图2A)。与3个对比模型生成的sMR图像相比,Swin-ResViT所生成的sMR图像伪影更少(图2B)。

定量比较sMR、cine-MR与reference MR的图像质量及推理速度方面的差异(表1)。图像生成质量方面,Swin-ResViT生成的sMR相较于原始cine-MR,NRMSE下降约90%(从0.1990±0.0305降至0.0199±0.0181,P<0.001),PSNR、SSIM、CNR分别从14.2808±1.3035 dB、0.5434±0.0436、0.3128±0.1939提升至36.7590±5.4363 dB、0.9737±0.0356、0.8795±0.0489(P<0.001),LPIPS从0.3602±0.0076降至0.0656±0.0181(P<0.001)。模型推理速度方面,对于224×224像素的单帧图像,在NVIDIA GeForce RTX 2080 Ti GPU上Swin-ResViT的平均处理时间为15.5 ms,标准ResViT为41.4 ms,减少约62%;相比之下,扩散模型因需多步迭代采样31,耗时高达20 s,远超临床实时处理的时间窗口。

4折交叉验证的定量结果显示,Swin-ResViT在4个不同的测试折叠中均展现出稳定的性能,其NRMSE均值为0.0201±0.0168,SSIM均值为0.9741±0.0317。各折叠间标准差较低,未出现明显的过拟合现象(表2)。

合成动态序列的评估结果(图34)。定性结果所示,生成的连续动态序列图像在视觉质量上得到了提升。与原始cine-MR相比,合成图像具有更清晰的解剖结构边界和丰富的纹理细节,且在时序上保持了平滑、自然的呼吸运动特征,在形态学上与Reference MR高度一致(图3)。基于右肝叶肝膈交界处标记点(Y轴坐标为三位操作者测量均值)的轨迹追踪分析结果表明,合成序列的运动轨迹误差曲线与Reference MR的形态趋势保持一致,且其误差绝对值低于原始系统误差,验证了模型在保留运动信息方面的有效性(图4)。

2.2 消融实验

2.2.1 损失函数

不同损失函数组合下的模型性能结果显示,仅使用MAE损失时,SSIM为0.9695±0.0252;引入梯度损失后,SSIM提升至0.9780±0.0244。本研究采用的组合损失的NRMSE为0.0199±0.0181,PSNR为36.7590±5.4363 dB,SSIM为0.9737±0.0356(P<0.001,表3)。

2.2.2 跳跃连接

不同跳跃连接数量对模型性能的影响结果显示,模型性能随跳跃连接数量的增加呈渐进提升趋势。当采用完整跳跃连接配置时,模型取得最优性能,NRMSE为0.0199±0.0181,PSNR为36.7590±5.4363,SSIM为0.9737±0.0356(表4)。

2.2.3 网络架构

Swin-ResViT与两种架构变体的定量与定性对比结果显示,Baseline 1(无跳跃连接)的推理时间为10.7 ms,图像边缘模糊,在NRMSE、PSNR及SSIM指标上均劣于Swin-ResViT。Baseline 2(瓶颈层替换为ART模块)的推理时间为43.2 ms,在NRMSE、PSNR及SSIM指标上亦劣于Swin-ResViT。Swin-ResViT的推理时间为15.5 ms,且NRMSE、PSNR和SSIM指标均为最优(表5图5)。

2.3 模型注意力可视化

基于纯卷积架构的Pix2Pix模型,其注意力热力图呈现出明显的碎片化特征,高响应区域主要局限于图像的高频边缘。相比之下,Swin-ResViT的注意力热力图展现了显著的全局连贯性,其高响应区域完整覆盖了肝脏及周边软组织等关键解剖靶区(图6)。

3 讨论

在MRgRT中,cine-MR成像通常以约5帧/s运行,这要求图像处理算法必须具备极高的实时性。传统图像增强算法不仅对复杂图像的处理性能有限,其较高的计算复杂度也导致显著的处理延迟,难以满足临床实时需求。因此,本研究采用深度学习范式,旨在兼顾图像重建性能与计算效率。

本研究创新性地提出Swin-ResViT模型,从低质量的实时cine-MR序列中重建高保真、近似于定位MR图像质量的合成图像。在架构上,Swin-ResViT基于ResViT改进,采用具有全局建模能力的Swin Transformer模块堆叠构建瓶颈层,结合跳跃连接与更精简的层数,在降低模型复杂度的同时保障了性能,避免了CycleGAN等基于卷积的网络因长程依赖建模不足而易产生的结构性伪影。与当前生成式模型领域前沿的扩散模型相比,尽管cDDPM能生成高质量图像,但对比实验显示,其因需上千次迭代采样,单帧推理时间长达20 s,完全无法应用于实时性任务。

为了进一步从理论层面阐释Swin-ResViT在cine-MR增强任务中的优越性,本研究采用Grad-CAM技术对模型关注区域进行了可视化分析。Cine-MR图像增强的核心难点在于其固有的低信噪比与整体对比度不足,这意味着仅凭局部像素信息往往难以推断出准确的解剖结构。特征可视化结果证实了卷积神经网络受限于局部感受野,倾向于通过捕捉局部纹理来重建图像。然而,在模糊且噪声较大的cine-MR中,局部边缘信息往往是不可靠的。相比之下,Swin-ResViT在重建局部细节时,实际上利用了整个器官的全局形态先验作为上下文约束,这种全局建模能力使得Swin-ResViT能够在局部信息模糊的情况下依然能推断并恢复出高保真的解剖结构。

此外,本研究通过消融实验进一步证实了Swin-ResViT架构设计的合理性。实验结果表明,跳跃连接对高频解剖细节的恢复有着重要作用,移除该结构会导致模型合成图像模糊、SSIM指标下降。在瓶颈层设计上,本研究引入的Swin Transformer模块展现了更优的效能比:在维持相当重建质量的前提下,Swin-ResViT将推理延迟从43.2 ms降低至15.5 ms,提升了约62%的推理速度。这证明Swin-ResViT在Swin Transformer模块的高效全局建模与卷积特征的跨层融合之间找到了平衡点。在范式上,与标准ResViT依赖无监督损失不同2232,Swin-ResViT充分利用配对数据优势,融合MAE、SSIM及梯度等多元监督损失,使sMR在像素级内容和感知特征上与reference MR有更高的一致性29-32。这些创新使得Swin-ResViT在sMR合成的推理速度、纹理细节、像素值准确性等实现了多方位提升。

在数据处理方面,本研究从三维定位MR图像中选择空间相关性最高的切片作为参考图像,用于提升二维cine-MR图像的质量。与多数使用降采样图像作为训练输入的研究不同101517,本研究所用的cine-MR图像和定位三维MR图像均为临床真实图像。采用降采样策略训练的网络主要侧重于提升图像的空间分辨率和宏观纹理,对于原始图像中难以分辨的解剖细节增强性能十分有限;而本研究的策略侧重于跨模态的解剖结构映射,实现了真实临床图像间丰富特征的映射,提升图像如肿瘤边界等关键解剖结构的对比度。实验结果证明了该策略的可行性,视觉评估显示模型生成的sMR在解剖结构上与reference MR高度一致,且肿瘤边界清晰度也得到明显改善;合成动态序列评估结果显示模型在有效提升图像质量的同时有着优越的动态保真度。

本研究纳入的17例患者中,12例作为训练集,5例作为测试集,客观验证了Swin-ResViT的性能。同时综合考量了NRMSE、SSIM、PSNR等图像质量客观指标,辅以视觉评估,综合性地评估sMR的图像质量,统计学检验进一步确保了结果的可信度。

本研究存在以下局限性:首先,动态cine-MR与reference MR间存在固有的平面外错位,尽管本研究通过形变配准和组合损失函数优化了对齐精度,但仍难以实现严格的像素级对应。其次,参考图像未能完全抑制心脏运动伪影,导致非靶区(如心脏)的重建质量逊于原始图像,但该策略优先保障了肝脏靶区的临床精度需求。最后,受限于MRgRT数据的稀缺性,样本量相对较小且缺乏外部验证集。尽管交叉验证证实了模型稳定性,未来仍需开展多中心、大规模的前瞻性研究以进一步提升模型的泛化能力。

综上所述,本研究提出Swin-ResViT在cine-MR图像质量的实时增强方面展现了优秀的性能,对实时MRgRT具有重要临床意义。

参考文献

[1]

田 静, 韩 丹, 周 涛. 肿瘤放射治疗技术的发展及应用研究[J]. 中国医刊, 2022, 57(10): 1064-7. doi:10.3969/j.issn.1008-1070.2022.10.006

[2]

Raaymakers BW, Jürgenliemk-Schulz IM, Bol GH, et al. First patients treated with a 1.5 T MRI-Linac: clinical proof of concept of a high-precision, high-field MRI guided radiotherapy treatment[J]. Phys Med Biol, 2017, 62(23): L41-50. doi:10.1088/1361-6560/aa9517

[3]

Raaymakers BW, Lagendijk JJW, Overweg J, et al. Integrating a 1.5 T MRI scanner with a 6 MV accelerator: proof of concept[J]. Phys Med Biol, 2009, 54(12): N229-37. doi:10.1088/0031-9155/54/12/n01

[4]

Lombardo E, Dhont J, Page D, et al. Real-time motion management in MRI-guided radiotherapy: Current status and AI-enabled prospects[J]. Radiother Oncol, 2024, 190: 109970. doi:10.1016/j.radonc.2023.109970

[5]

Paganelli C, Whelan B, Peroni M, et al. MRI-guidance for motion management in external beam radiotherapy: current status and future challenges[J]. Phys Med Biol, 2018, 63(22): 22TR03. doi:10.1088/1361-6560/aaebcf

[6]

Van Reeth E, Tham IWK, Tan CH, et al. Super-resolution in magnetic resonance imaging: a review[J]. Concepts Magn Reson Part A, 2012, 40A(6): 306-25. doi:10.1002/cmr.a.21249

[7]

Mo YJ, Wu Y, Yang XN, et al. Review the state-of-the-art technologies of semantic segmentation based on deep learning[J]. Neurocomputing, 2022, 493: 626-46. doi:10.1016/j.neucom.2022.01.005

[8]

Lepcha DC, Goyal B, Dogra A, et al. Image super-resolution: a comprehensive review, recent trends, challenges and applications[J]. Inf Fusion, 2023, 91: 230-60. doi:10.1016/j.inffus.2022.10.007

[9]

Dong YY, Yang F, Wen J, et al. Improvement of 2D cine image quality using 3D priors and cycle generative adversarial network for low field MRI-guided radiation therapy[J]. Med Phys, 2024, 51(5): 3495-509. doi:10.1002/mp.16860

[10]

Xie HQ, Lei Y, Wang TH, et al. Synthesizing high-resolution magnetic resonance imaging using parallel cycle-consistent generative adversarial networks for fast magnetic resonance imaging[J]. Med Phys, 2022, 49(1): 357-69. doi:10.1002/mp.15380

[11]

You A, Kim JK, Ryu IH, et al. Application of generative adversarial networks (GAN) for ophthalmology image domains: a survey[J]. Eye Vis, 2022, 9(1): 6. doi:10.1186/s40662-022-00277-3

[12]

Rabbi J, Ray N, Schubert M, et al. Small-object detection in remote sensing images with end-to-end edge-enhanced GAN and object detector network[J]. Remote Sens, 2020, 12(9): 1432. doi:10.3390/rs12091432

[13]

Radford A, Metz L, Chintala S. Unsupervised representation learning with deep convolutional generative adversarial networks[EB/OL]. 2015: arXiv: 1511.06434.

[14]

Zhang H, Goodfellow I, Metaxas D, et al. Self-attention generative adversarial networks[EB/OL]. 2018: arXiv: 1805.08318. doi:10.48550/arXiv.1805.08318

[15]

Chun J, Zhang H, Gach HM, et al. MRI super-resolution reconstruction for MRI-guided adaptive radiotherapy using cascaded deep learning: in the presence of limited training data and unknown translation model[J]. Med Phys, 2019, 46(9): 4148-64. doi:10.1002/mp.13717

[16]

Huang BY, Xiao HN, Liu WW, et al. MRI super-resolution via realistic downsampling with adversarial learning[J]. Phys Med Biol, 2021, 66(20). DOI:10.1088/1361-6560/ac232e .

[17]

Yoon YH, Chun J, Kiser K, et al. Inter-scanner super-resolution of 3D cine MRI using a transfer-learning network for MRgRT[J]. Phys Med Biol, 2024, 69(11). DOI:10.1088/1361-6560/ad43ab .

[18]

Ho J, Jain A, Abbeel P. Denoising diffusion probabilistic models[EB/OL]. 2020: arXiv: 2006.11239.

[19]

Saharia C, Chan W, Chang HW, et al. Palette: image-to-image diffusion models[C]//Special Interest Group on Computer Graphics and Interactive Techniques Conference Proceedings. Vancouver BC Canada. ACM, 2022: 1-10. doi:10.1145/3528233.3530757

[20]

Chen XQ, Qiu RLJ, Peng JB, et al. CBCT-based synthetic CT image generation using a diffusion model for CBCT-guided lung radiotherapy[J]. Med Phys, 2024, 51(11): 8168-78. doi:10.1002/mp.17328

[21]

Liu Z, Lin YT, Cao Y, et al. Swin transformer: hierarchical vision transformer using shifted windows[C]//2021 IEEE/CVF International Conference on Computer Vision (ICCV). October 10-17, 2021, Montreal, QC, Canada. IEEE, 2022: 9992-10002. doi:10.1109/iccv48922.2021.00986

[22]

Dalmaz O, Yurt M, Çukur T. ResViT: residual vision transformers for multimodal medical image synthesis[J]. IEEE Trans Med Imag, 2022, 41(10): 2598-614. doi:10.1109/tmi.2022.3167808

[23]

Vaswani A, Shazeer N, Parmar N, et al. Attention is all you need[J]. Advances in neural information processing systems, 2017, 30. doi:10.3390/rs9080848

[24]

Zhu JY, Park T, Isola P, et al. Unpaired image-to-image translation using cycle-consistent adversarial networks[C]//2017 IEEE International Conference on Computer Vision (ICCV). October 22-29, 2017, Venice, Italy. IEEE, 2017: 2242-51. doi:10.1109/iccv.2017.244

[25]

Ronneberger O, Fischer P, Brox T. U-Net: convolutional networks for biomedical image segmentation[C]//Medical Image Computing and Computer-Assisted Intervention-MICCAI 2015. Cham: Springer, 2015: 234-41. doi:10.1007/978-3-319-24574-4_28

[26]

Hu H, Gu JY, Zhang Z, et al. Relation networks for object detection[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. June 18-23, 2018, Salt Lake City, UT, USA. IEEE, 2018: 3588-97. doi:10.1109/cvpr.2018.00378

[27]

Hu H, Zhang Z, Xie ZD, et al. Local relation networks for image recognition[C]//2019 IEEE/CVF International Conference on Computer Vision (ICCV). October 27-November 2, 2019. Seoul, Korea. IEEE, 2019: 3463-72. doi:10.1109/iccv.2019.00356

[28]

Thorwarth D. Functional imaging for radiotherapy treatment planning: current status and future directions-a review[J]. Br J Radiol, 2015, 88(1051): 20150056. doi:10.1259/bjr.20150056

[29]

Galić I, Habijan M, Leventić H, et al. Machine learning empowering personalized medicine: a comprehensive review of medical image analysis methods[J]. Electronics, 2023, 12(21): 4411. doi:10.3390/electronics12214411

[30]

Huynh E, Hosny A, Guthier C, et al. Artificial intelligence in radiation oncology[J]. Nat Rev Clin Oncol, 2020, 17(12): 771-81. doi:10.1038/s41571-020-0417-8

[31]

Kazerouni A, Aghdam EK, Heidari M, et al. Diffusion models in medical imaging: a comprehensive survey[J]. Med Image Anal, 2023, 88: 102846. doi:10.1016/j.media.2023.102846

[32]

Wendling M, Morrow A, Hoggarth M. An efficient protocol for radiotherapy quality control with machine learning[J]. Med Phys, 2020, 47(4): 1526-34.

基金资助

国家自然科学基金(82472117)

广东省基础与应用基础研究基金(2024A1515010820)

广东省基础与应用基础研究基金(2024A1515011831)

RIGHTS & PERMISSIONS

版权所有©《南方医科大学学报》编辑部2021

AI Summary AI Mindmap
PDF (3134KB)

2

访问

0

被引

详细

导航
相关文章

AI思维导图

/