轻量级动态多尺度结肠息肉分割模型

刘泽生 ,  余本国 ,  刘泽晋

中北大学学报(自然科学版) ›› 2026, Vol. 47 ›› Issue (3) : 385 -394.

PDF (2573KB)
中北大学学报(自然科学版) ›› 2026, Vol. 47 ›› Issue (3) : 385 -394. DOI: 10.62756/jnuc.issn.1673-3193.2025.09.0016
自动化与计算机

轻量级动态多尺度结肠息肉分割模型

作者信息 +

Segmentation Model of Colon Polyp with Lightweight Dynamic Multi⁃Scale

Author information +
文章历史 +
PDF (2634K)

摘要

结肠息肉的精准分割对结直肠癌的早期筛查和临床诊断具有重要意义。然而, 由于息肉在尺寸、 形态及边界特征上的显著差异, 且常伴随低对比度与边界模糊等问题, 现有方法在分割精度与计算效率之间难以取得平衡。针对上述问题, 本文提出了一种轻量级动态多尺度分割网络LDMS-Net。该模型基于U形编码器-解码器结构, 在编码阶段引入动态多尺度卷积模块(DMM), 通过全局平均池化与两层全连接网络生成自适应权重, 对不同膨胀率(1,2,3)及标准卷积分支进行动态加权融合, 实现多尺度特征的自适应建模; 同时采用结构重参数化策略, 在推理阶段将多分支结构融合为单一3×3卷积, 以降低计算复杂度。为进一步提升分割性能, 设计区域细节聚合器(RDA)和全局上下文整合器(CCI), 分别用于强化局部纹理信息与建模全局语义依赖, 并在解码阶段通过层次后期融合策略逐层整合多尺度特征。实验在Kvasir-SEG和CVC-ClinicDB等数据集上进行, 在仅使用Kvasir-SEG 800张训练图像的条件下, 所提方法在测试集上取得93.65%的平均Dice系数和89.39%的平均交并比, 参数量为6.54×106, FLOPs为7.23×109。结果表明, 该方法在保证轻量化的同时具有较高的分割精度和良好的鲁棒性。

Abstract

Precise segmentation of colon polyps is crucial for early screening and clinical diagnosis of colorectal cancer. However, large variations in polyp size, shape, and boundary characteristics, along with low contrast and blurred edges, make it challenging to balance segmentation accuracy and computational efficiency. To address these issues, a lightweight dynamic multi-scale segmentation network (LDMS-Net) was proposed. The model adopted a U-shaped encoder-decoder architecture and introduced a dynamic multi-scale module (DMM) in the encoder. Specifically, global average pooling and a two-layer fully connected network were used to generate adaptive weights, enabling dynamic fusion of multiple convolution branches with different dilation rates (1,2, 3) and a standard convolution branch for adaptive multi-scale feature representation. A structural re-parameterization strategy was further applied to merge the multi-branch structure into a single 3×3 convolution during inference to reduce computational cost. In addition, a regional detail aggregator (RDA) and a comprehensive context integrator (CCI) were designed to capture local texture details and global semantic dependencies, respectively, and were integrated in the decoder via a hierarchical late fusion strategy. Experiments on Kvasir-SEG and CVC-ClinicDB datasets show that, using only 800 training images from Kvasir-SEG, the proposed method achieves a mean Dice coefficient of 93.65% and a mean IoU of 89.39%, with 6.54×106 parameters and 7.23×109 floating-point operations. The results demonstrate that LDMS-Net achieves high accuracy and robustness while maintaining a lightweight design.

Graphical abstract

关键词

结肠息肉分割 / 轻量化 / 动态多尺度 / 特征提取

Key words

colon polyp segmentation / lightweight / dynamic multi-scale / feature extraction

引用本文

引用格式 ▾
刘泽生,余本国,刘泽晋. 轻量级动态多尺度结肠息肉分割模型[J]. 中北大学学报(自然科学版), 2026, 47(3): 385-394 DOI:10.62756/jnuc.issn.1673-3193.2025.09.0016

登录浏览全文

4963

注册一个新账户 忘记密码

0 引 言

医学影像分割在疾病诊断与治疗规划中扮演着关键角色, 通过精准勾画病灶轮廓和定位病变区域, 为临床医生提供辅助的诊断依据12。结肠息肉作为结直肠癌的主要前兆病变, 其准确分割对于早期诊断和干预至关重要, 有助于降低结直肠癌的发病率和死亡率3。然而, 结肠息肉在尺寸、 形态和边界特征上的复杂性为分割任务带来了显著挑战4。息肉尺寸从数毫米到数厘米不等, 且常伴随模糊边界或与周围组织对比度低的问题。此外, 临床计算机辅助诊断(Computer-Aided Diagnosis, CAD)系统对实时性和低计算资源的需求进一步增加了模型设计的难度。早期结肠息肉分割主要依赖传统图像处理与机器学习方法, 如基于主动轮廓模型(ACM)5、 图割(Graph Cuts)6、 GrabCut7以及随机森林结合手工特征(RF+HF)等。这些方法在简单背景下可取得一定效果, 但面对息肉形态多样、 边界模糊及低对比度等复杂情况时, 分割精度往往受到明显限制, 且高度依赖人工设计的特征与后处理, 难以满足临床实时性与鲁棒性需求。现有分割方法在处理复杂形态息肉时, 常因多尺度特征提取不足或局部细节与全局语义整合不佳, 导致过分割、 欠分割或边界模糊, 限制了其在资源受限环境中的应用。

深度学习技术的快速发展为医学影像分割提供了新的解决方案。基于卷积神经网络(Convolutional Neural Network, CNN)的模型8, 例如: UNet9因其对称的编码器-解码器结构和跳跃连接设计, 在捕捉多尺度特征方面表现出色, 成为医学影像分割的基准方法。UNet的成功催生了多种变体, 如UNet++[10]、 ResUNet11和Attention UNet12, 通过引入残差连接或注意力机制提升了模型的鲁棒性。然而, 这些模型受限于卷积操作的局部感受野, 难以有效建模长程依赖关系13, 导致在处理复杂形态的息肉时性能受限。为克服这一局限, 研究人员尝试将视觉变换器(Vision Transformer, ViT)引入医学影像分割14。ViT通过全局自注意力机制建模长程空间关系, 在图像分类任务中取得了显著成果。基于Transformer的模型, 例如: TransUNet15和Swin-UNet16通过结合CNN和ViT的优势, 改善了全局上下文信息的捕获能力。然而, 这些模型通常需要高计算资源和大规模预训练数据支持, 参数量和计算复杂度较高, 例如: TransUNet的参数量常超过100×106, 计算量达10×109, 难以满足临床环境中对轻量化模型的需求17

多尺度特征提取作为医学影像分割的核心技术, 其核心挑战在于如何有效处理目标区域显著的尺寸变异问题。传统解决方案主要依靠特征金字塔网络(FPN)18或扩张卷积操作来扩展感受野, 此类方法虽能捕获多尺度特征, 但在局部纹理细节与全局语义信息的协同整合方面仍显不足。当前主流框架广泛采用多尺度策略模块, 例如: ASPP19和FPN通过并行卷积或特征融合机制提升了模型对异尺度目标的识别能力。值得注意的是, 局部纹理信息直接影响分割边界的清晰度, 而全局语义线索则决定着病灶定位的准确性, 二者的融合成为提升分割性能的关键。近年来, 动态特征提取方法20通过引入可自适应调整的卷积核参数或注意力权重机制, 展现出更强的多尺度上下文建模能力。然而这类方法普遍依赖复杂的模块设计, 导致计算成本显著增加, 难以适配低功耗设备的实时处理需求。在此背景下, 结构重参数化技术(如RepVGG21)为实现模型效率优化提供了新思路, 通过训练阶段的多分支设计与推理阶段的单路径转换, 有效平衡了性能与计算成本的矛盾。当前研究的热点正聚焦于如何在维持模型轻量化的前提下, 构建高效的局部-全局特征协同机制, 这对推动精准医疗影像分析系统的实际部署具有重要价值。

针对上述结肠息肉分割面临的尺度剧烈变化、 边界模糊以及临床部署对轻量化的严苛要求, 本文提出轻量级动态多尺度分割网络(Lightweight Dynamic Multi-scale Segmentation Netowrk, LDMS-Net), 主要贡献如下:

1) 提出动态多尺度卷积模块(DMM), 将输入自适应的动态核选择机制与多膨胀率深度卷积相结合, 并在推理阶段通过结构重参数化将多分支动态结构完全融合为单个普通的3×3卷积, 在实现多尺度高表达能力的同时将推理FLOPs降至7.23×109, 彻底解决传统静态多尺度模块与动态方法无法兼顾精度与速度的矛盾。

2) 设计层次后期融合(Hierarchical Late Fusion)策略, 在解码器每一层将局部细节聚合器(RDA)提供的精细纹理与全局上下文整合器(CCI)提供的长程语义进行逐层融合, 显著优于传统的早期或中期融合方式, 有效缓解了高级语义与低级细节间的语义鸿沟, 确保边界清晰度和整体一致性。

3) 在仅使用Kvasir-SEG 800张训练图像的常用跨数据集协议下, LDMS-Net以6.54×106的参数量获得mDice 93.65%、 mIoU 89.39%, 在同等轻量级方法中达到当前最佳水平, 表明其具备较高的临床应用潜力。

1 方 法

1.1 整体架构

本文提出的轻量级动态多尺度分割网络LDMS-Net整体架构如图 1 所示。输入图像首先经U形编码器逐级提取多尺度特征, 随后通过区域细节聚合器(Regional Detail Aggregator, RDA)和全局上下文整合器(Comprehensive Context Integrator, CCI)分别捕获局部纹理细节与全局语义信息, 最后由解码器采用层次后期融合策略将两者逐层整合并上采样恢复至原分辨率, 输出最终分割结果。

编码器包含4个阶段, 每阶段由两个动态多尺度卷积模块(DMM)构成, 相邻阶段间通过步幅为2的下采样将空间分辨率减半、 通道数加倍。对于输入尺寸为H×W×3的图像, 第k阶段输出特征图尺寸为H2i-1×W2i-1×2i-1C, 从而形成丰富的多尺度特征金字塔。

为进一步缓解边界模糊与过/欠分割问题, 本文在编码器与解码器之间引入两个专用模块:

1) 区域细节聚合器(RDA, 共4个, 分别位于4个上采样阶段之前): 每个RDA接收所在阶段及其上一阶段的特征图, 构建局部特征金字塔, 并通过局部窗口自注意力捕获精细纹理、 弥合高低层语义差距;

2) 全局上下文整合器(CCI, 仅1个, 位于编码器最深层之后): 接收编码器全部5个层级(包括输入图像)的特征图, 构建全局特征金字塔, 并通过Transformer捕获长程依赖, 实现精准病灶定位。

解码器采用层次后期融合(Hierarchical Late Fusion)策略: 在每个上采样阶段, 先将对应RDA输出的局部细节特征与CCI提供的全局语义特征逐通道拼接或加权融合, 再送入上采样模块, 从而在每一层级都同时保留清晰边界与整体一致性, 最终输出与输入同分辨率的分割概率图。

LDMS-Net选用U形结构而非纯Transformer或非对称架构, 是因为实验表明U形编码器-解码器在保持轻量化的同时, 能最有效地实现多尺度特征、 局部细节与全局语义的协同融合。若改为纯Transformer架构, 虽全局建模能力更强, 但参数量与计算量将显著增加, 难以满足临床实时需求。

1.2 DMM

本文提出的动态多尺度卷积模块(Dynamic Multi-scale Convolution Module, DMM)完整前向流程如图 2 所示。输入特征图首先通过全局平均池化(GAP)生成通道描述符向量z, 并由此计算动态权重α1α4; 同时, 输入特征被送入4个膨胀率分别为1,2,3以及一个5×5的并行深度卷积核进行多尺度特征提取; 随后4个分支输出按对应αi加权融合, 再经批归一化BN、 SE通道注意力和1×1卷积增强后, 与输入残差连接得到最终输出。在推理阶段, 所有分支与动态权重通过结构重参数化融合为单个普通的3×3卷积, 实现训练时高性能与推理时高效率的统一。为清晰起见, 图中仅展示一个通道进行说明。实际中, 深度卷积独立应用于每个输入通道, 动态权重在所有通道间共享。

下面将按信号流顺序依次详细阐述动态核选择机制、 深度卷积核集合、 特征增强与融合、 残差连接与结构重参数化4个组成部分的设计与公式。

1.2.1 动态核选择机制

动态核选择机制通过根据输入特征图的全局信息生成卷积核权重, 实现自适应多尺度特征提取。该机制显著提升了模块对不同医疗图像模态(如CT、 MRI、 超声)和目标尺度(如小息肉或大肿瘤)的适应性, 是DMM区别于其余多分支模块的关键组件。该机制包括全局特征提取和权重生成两个步骤。

对输入特征图FRCin×H×W进行全局平均池化(Global Average Pooling, GAP, 用于将每个通道的空间信息压缩为一个标量), 生成通道描述符为

z=1H×Wh=1Hω=1WFch,ω,c=1,2,...,Cin

其中, 输入特征图FRCin×H×W, 表示具有Cin个通道和空间分辨率为H×W的特征张量。全局平均池化通过对每个通道的空间维度求均值, 生成通道描述符zRCin, 其第c个分量zc为输入特征图第c通道的空间均值, 在图 2 中体现在GAP模块的输出处, 用于捕捉整个特征图的全局上下文信息。

通过两层全连接网络处理z(其分量zc对应各通道描述符), 生成4个卷积核的权重为

α=SoftmaxFC2ReLUFC1z

其中, 通道描述符z首先通过第一层全连接网络FC1:RCinRCin/γ降维, 其中缩放因子γ=8。随后, ReLU激活函数引入非线性。第二层全连接网络FC2:RCin/γR4生成4个权重。Softmax操作归一化权重, 确保i=14αi=1, 输出α=α1,α2,α3,α4R4, 每个αi表示对应卷积核的贡献度。

1.2.2 深度卷积核集合

深度卷积核集合是DMM多尺度特征提取的基础, 通过4个不同感受野的卷积核捕获从局部细节到全局上下文的特征。DMM引入膨胀卷积以扩大感受野并减少冗余, 是模块性能提升的关键组件。

DMM设计了4个并行深度卷积核, 以捕获不同尺度的空间特征。这些核包括: 第1个3×3卷积核, 扩张率为1, 生成3×3的感受野, 专注于局部细节; 第2个3×3卷积核, 扩张率为2, 形成7×7的感受野, 适用于中尺度上下文; 第3个3×3卷积核, 扩张率为3, 扩展至11×11的感受野, 针对大尺度目标; 一个5×5卷积核, 产生5×5的感受野, 平衡局部和中尺度特征。这一组合通过膨胀卷积显著增强了多尺度特征提取能力, 适应医疗图像分割中多样化的目标尺度。每个核对输入特征图执行深度卷积, 表示为

Fi=FKi,i=1,2,3,4,

式中: 深度卷积核KiRCin×kh×kw×Cout, 独立作用于每个输入通道, 其中khkw为核尺寸, 输出通道数Cout=Cin, 保持通道数不变。

1.2.3 特征增强与融合

特征增强与融合阶段将并行卷积的输出通过动态加权融合为单一特征图, 并通过批归一化(BN)、 Squeeze-and-Excitation(SE)层和1×1逐点卷积进一步优化特征表达。该部分可在动态核选择和深度卷积的基础上提升特征质量, 是DMM性能优化的重要环节。

4个卷积输出通过动态权重αi进行加权求和(在图2中体现为4个深度卷积分支输出后、 加权求和前的乘法操作, i=1,2,3,4), 即

F'=i=14αiFKi

其中, αiR来自式(2), 控制第i个卷积核的贡献度。每个卷积输出FKi包含特定尺度的特征, 融合特征图F'整合多尺度信息。

对融合特征图应用BN进行归一化操作, 如式(5)所示。其中, 运行均值μRCout和方差δ2用于统计每个通道的分布。

F=BNF'=ηδ2+εF'-μ+β

SE层用于增强通道依赖性, 分别为

s=Conv2ReLUConv1GAPF
F=sF

1×1逐点卷积用于调整通道维度, 表示为

O=Conv1×1F

1.2.4 残差连接与结构重参数化

残差连接通过残差结构优化梯度传播, 结构重参数化在推理时融合动态核为单一卷积核, 确保轻量级部署。

残差连接通过1×1卷积处理输入特征图, 与主路径输出相加。推理时融合动态核和BN参数为单一卷积核, 具体为

Kfused=i4α¯iKiηδ2+ε
bfused=β-μηδ2+ε,

其中, 动态权重值α¯i用于加权深度卷积核Ki, 3×3核通过零填充扩展至5×5以对齐5×5K4

1.3 区域细节聚合器和全局上下文整合器

多尺度特征金字塔在密集预测任务中的有效性已被多项研究验证。本文设计了一种基于Transformer的全局上下文整合器(CCI)模块, 作为编码器与解码器之间的桥梁, 以融合编码器的多尺度特征金字塔。通过充分利用金字塔层次结构中的多尺度特征, CCI能够在不同尺度高效捕获全局上下文语义。为优化特征金字塔处理, 提出了一种卷积嵌入方法替代标准补丁嵌入, 包含重塑、 卷积、 拼接及平铺操作。如图 3 下方所示, CCI以编码器5个阶段的特征图构成的全局特征金字塔作为输入。这些特征图被重塑至目标尺寸, 并通过3×3卷积聚合。卷积输出被平铺为向量后输入Transformer模块。此设计显著降低了计算复杂性, 并弥补了Transformer缺乏局部归纳偏见的不足, 从而提升了细粒度细节捕获能力。

具体而言, 编码器特征图x1,x2,x3,x4,x5的分辨率相对于输入图像分别为1,121418116。特征金字塔X=x1,x2,x3,x4,x5被下采样至目标尺寸HS×WS(其中S为相对于输入图像的步幅, 如H16×W16)。重塑后的金字塔沿通道维度拼接, 并通过3×3卷积聚合多尺度特征, 最终平铺为向量(序列)。

X'=FlattenConvConcatReshapeX

为生成具有全局上下文感知能力的语义信息, 平铺的特征图X' 被输入至Transformer模块。该模块包含多头自注意力(Multi-Head Self-Attention, MHSA)、 两层多层感知器(MLP)、 两个层归一化(LayerNorm, LN)层及两个残差连接。Transformer模块的处理分别表示为

Xa=X'+MHSALNX'
Xo=Xa+MLPLNXa

其中, 多头自注意力(MHSA)由查询(Q)、 键(K)和值(V)三部分构成, 各头的维度由输入序列长度和通道数决定。自注意力机制估计表示为

Att=SoftmaxQKTdV,

式中: d=CM为头维度, M为头数。输出X被重塑为C, 并传输至解码器。

与CCI类似, 设计了一种轻量高效的区域细节聚合器(RDA)模块。如图 3 上方所示, RDA基于局部自注意力机制, 具备局部归纳偏见和线性计算复杂性。为弥合高层次与低层次特征间的语义差距, 编码器相邻阶段的输出被组合, 构建局部特征金字塔作为RDA输入。局部特征金字塔的层数依据RDA所在阶段而定, 第一和第四阶段包含两层, 第二和第三阶段包含三层。金字塔特征根据RDA阶段重塑至目标尺寸, 沿通道维度拼接, 并通过3×3卷积聚合, 随后, 所得特征输入Transformer模块进一步处理。

此设计具有以下优势: 1) 局部特征金字塔整合了多尺度空间和语义信息, 对医学影像分割至关重要。2) RDA的局部归纳偏见使其能够提供细致边缘和纹理信息, 辅助解码器恢复完整空间分辨率。3) 解码器通过层次后期融合策略, 聚合RDA的局部纹理信息与CCI的全局语义信息, 生成精准的分割结果。此策略通过逐层整合多尺度表征, 确保了分割边界清晰性和整体一致性。凭借CCI与RDA的协同作用, LDMS-Net在医学影像分割任务中表现出优异性能, 在多个基准数据集上展现出较强竞争力。

2 实 验

2.1 实验数据集

为验证LDMS-Net在结肠息肉分割任务中的有效性, 本文选用了5个公开基准数据集: Kvasir-SEG22(100张)、 CVC-ColonDB23(380张)、 CVC-ClinicDB24(612张)、 ETIS-LaribPolypDB25(196张)和CVC-300(60张)。这些数据集的真值分割掩码均由专业内镜医师或放射科医生手工精细标注, 公开发布的数据集已被结肠息肉分割领域广泛认可并作为标准参考。

为保证公平比较与可复现性, 本文严格遵循该领域公认的标准训练/测试划分协议: 训练集仅使用Kvasir-SEG的800张训练图像(官方划分), 其余4个数据集(CVC-ClinicDB 612张、 CVC-300 60张、 CVC-ColonDB 380张、 ETIS-LaribPolypDB 196张)全部作为独立测试集, 用于评估模型跨数据集的泛化性能; Kvasir-SEG剩余的200张图像作为同数据集测试集。

2.2 评估指标

为了评估LDMS-Net模型的性能, 采用平均Dice相似系数(mDice)、 平均交并比(mIoU)、 精确率(Precision)、 召回率(Recall)、 准确率(Accuracy)、 参数量以及FLOPs作为评估指标, 部分计算公式分别为

mDice=1Ni=1N2TP2TP+FP+FN
mIoU=1Ni=1NTPTP+FN+FP
Precision=TPTP+FP
Recall=TPTP+FN
Accuracy=TP+TNTP+TN+FP+FN

式中: TP为正确预测的息肉区域的像素数; FP为错误预测为息肉区域的背景区域的像素数; TN为正确预测的背景区域的像素数; FN为错误预测为背景区域的息肉区域的像素数。

2.3 实验配置

实验在配备NVIDIA RTX 4080 GPU(16 GB显存)的计算平台上进行, 基于PyTorch框架实现。

训练过程中, 输入图像统一调整为256×256像素的分辨率, 批次大小设为16。优化器采用AdamW, 初始学习率设为1×10-4。训练轮数设为200轮, 每10轮保存一次模型检查点。为增强模型泛化能力, 数据增强策略包括随机翻转、 旋转、 缩放和亮度调整。损失函数采用Dice损失与交叉熵损失的组合, 以优化分割精度与模型收敛性。动态核选择器的初始温度参数τ设为1.0, 并以每50轮衰减0.1的速率逐渐锐化权重分布。CCI模块的多头自注意力机制设置8个头, RDA模块的局部窗口大小设为7×7, 以平衡计算效率与特征表达能力。

2.4 实验结果

2.4.1 对比实验

将LDMS-Net与其他传统方法以及先进方法在Kvasir-SEG和CVC-ClinicDB数据集进行比较, 包括Unet、 Unet++、 ResUnet、 TransUnet、 ssformer、 ResUnet++、 Swin-Unet、 Deeplabv3+、 HarDNet-MSEG、 U2-Net。实验结果如表 1表 2 所示, 其中最优指标值用加粗字体标示。

对于Kvasir-SEG数据集, LDMS-Net在平均Dice相似系数、 平均交并比、 准确率等指标上均居首位, 分别达到了93.65%, 89.39%, 96.30%, 优于其他模型, 而其参数量和计算量仅为6.54×106、 7.23×109, 远小于其余模型。图 4 展示了LDMS-Net在5个数据集上的可视化典型分割结果, 每个数据集中选取两例最具代表性的病例。从图中可以看出, LDMS-Net能够更准确地识别出息肉的轮廓形状, 其划分的边界更为清晰, 且结果也更接近真实值, 优于其他方法。

图 4 不仅展示出本方法对规则形状息肉的准确分割, 也能够对不规则形状的息肉进行准确的识别和边界定位, 这说明LDMS-Net在处理息肉分割任务时具有更强的能力。

综上, 证明了本模型相较于其他方法的显著优势, 无论在准确率还是边界区分或其他评价指标的表现上, 都显示出其在息肉分割任务中的卓越性能。

2.4.2 消融试验

表 3 使用Unet作为基线, 显示了每个模块对模型性能的影响。添加多分支模块后, mIoU提高了2.09百分点, 展示了其在提取多尺度特征以提高泛化能力方面的有效性。

此外, 将RDA和CCI结合起来可以增强表征学习。RDA和CCI的结合实现了最佳的鲁棒性, 突出了集成局部纹理和密集预测任务的全局语义。

表 4 呈现了LDMS-Net模块设计选择的细粒度消融实验结果。当所有膨胀率设置为1时, mDice和mIoU均显著下降(分别降低1.55百分点和2.37百分点), 这证实了多尺度膨胀卷积对捕获尺度多样性的重要性。将膨胀集合扩展至[1,2,4]虽能略微提升大病灶的分割性能, 但未超越基线配置[1,2,3], 表明过大的感受野会产生收益递减效应。类似地, 将5×5分支替换为纯3×3卷积会降低分割精度, 而7×7分支仅带来微弱的性能提升却需额外计算量和参数开销, 因此验证了5×5卷积核是实现精度与效率平衡的最佳选择。

2.4.3 鲁棒性与部署效率验证

为有力验证LDMS-Net在目标尺度剧烈变化以及计算资源受限场景下的独特优势, 本文分别针对尺度鲁棒性和嵌入式部署效率进行了专项实验。

首先, 按息肉真实面积将Kvasir-SEG测试集(200张)划分为小(<200 px2)、 中(200~1 000 px2)、 大(>1 000 px2)3类, 与4种代表性方法对比, 结果如表 5 所示。LDMS-Net在临床最难的小息肉上mDice提升尤为显著(提升3.1百分点), 充分体现了DMM动态多尺度机制的优越性。

其次, 在两款临床常见的嵌入式平台(NVIDIA Jetson NX 15W、 Jetson Nano 10W)上测试384×384输入的推理速度与显存占用(FP32), 结果如表 6 所示。得益于推理阶段结构重参数化, LDMS-Net在Jetson NX上达到85 帧·s-1、 在更受限的Nano上仍保持30 帧·s-1(实时), 显存占用最低, 验证了其在资源受限设备上的显著部署优势。

3 结 论

针对息肉尺寸多变、 边界模糊及计算资源有限等挑战, 本文提出了一种轻量级动态多尺度分割网络LDMS-Net。通过融合动态多尺度特征提取与局部-全局特征聚合机制, LDMS-Net实现了精准高效的结肠息肉分割。在多组数据集上的实验表明, 该网络在保持低计算复杂度的同时, 各项性能指标均优于代表性基线方法。从理论角度分析, 解码器对不同编码器层的差异化利用具有显著效果: 浅层主要编码高频边界细节, 深层则捕获低频语义语境。后期融合策略使这些互补信息在预测阶段得以保留与整合, 从而同时确保边界锐利度与病灶定位鲁棒性。这些成果彰显了其在临床计算机辅助诊断系统中的部署潜力。未来工作将探索该网络在其他医学图像分割任务中的扩展应用, 并进一步提升其实时处理能力。

参考文献

[1]

LITJENS GKOOI TBEJNORDI B Eet al. A survey on deep learning in medical image analysis[J]. Medical Image Analysis201742: 60-88.

[2]

DI JZHU YLIANG C. A medical image segmentation model based on SAM with an integrated local multiscale feature encoder[J]. Journal of Measurement Science and Instrumentation202516(3): 359-370.

[3]

NIIKURA RHIRATA YSUZUKI Net al. Colonoscopy reduces colorectal cancer mortality: A multicenter, long-term, colonoscopy-based cohort study[J]. PLoS One201712(9): e0185294.

[4]

BERNAL JSÁNCHEZ F JFERNÁNDEZ-ESPARRACH Get al. WM-DOVA maps for accurate polyp highlighting in colonoscopy: Validation vs. saliency maps from physicians[J]. Computerized Medical Imaging and Graphics201543: 99-111.

[5]

AMELING SWIRTH SPAULUS Det al. Texture-based polyp detection in colonoscopy[C]//Bildverarbeitung für die Medizin 2009. Berlin, Heidelberg: Springer, 2009: 346-350.

[6]

BERNAL JSÁNCHEZ JVILARIÑO F. Towards automatic polyp detection with a polyp appearance model[J]. Pattern Recognition201245(9): 3166-3182.

[7]

HWANG S, OH J, TAVANAPONG Wet al. Polyp detection in colonoscopy video using elliptical shape feature[C]//2007 IEEE International Conference on Image Processing, 2007: II-465-II-468.

[8]

TAJBAKHSH NSHIN J YGURUDU S Ret al. Convolutional neural networks for medical image analysis: Full training or fine tuning?[J]. IEEE Transactions on Medical Imaging201635(5): 1299-1312.

[9]

RONNEBERGER OFISCHER PBROX T. U-Net: Convolutional networks for biomedical image segmentation[C]//Medical Image Computing and Computer-Assisted Intervention—MICCAI 2015. Cham: Springer, 2015: 234-241.

[10]

ZHOU ZRAHMAN SIDDIQUEE M MTAJBAKHSH Net al. UNet++: A nested U-Net architecture for medical image segmentation[C]//Deep Learning in Medical Image Analysis and Multimodal Learning for Clinical Decision Support. Cham: Springer, 2018: 3-11.

[11]

ZHANG ZLIU QWANG Y. Road extraction by deep residual U-net[J]. IEEE Geoscience and Remote Sensing Letters201815(5): 749-753.

[12]

OKTAY OSCHLEMPER JLE FOLGOC Let al. Attention U-Net: Learning where to look for the pancreas[DB/OL]. (2018-05-20)[2025-09-25].

[13]

WANG XGIRSHICK RGUPTA Aet al. Non-local neural networks[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2018: 7794-7803.

[14]

DOSOVITSKIY ABEYER LKOLESNIKOV Aet al. An image is worth 16×16 words: Transformers for image recognition at scale[DB/OL]. (2021-06-03)[2025-09-25].

[15]

CHEN JLU YYU Qet al. TransUNet: Transformers make strong encoders for medical image segmentation[DB/OL]. (2021-06-03)[2025-09-25].

[16]

CAO HWANG YCHEN Jet al. Swin-Unet: Unet-like pure transformer for medical image segmentation[C]//Computer Vision-ECCV 2022 Workshops. Cham: Springer, 2023: 205-218.

[17]

VALANARASU J M J, OZA P, HACIHALILOGLU Iet al. Medical transformer: Gated axial-attention for medical image segmentation[C]//Medical Image Computing and Computer Assisted Intervention-MICCAI 2021. Cham: Springer, 2021: 36-46.

[18]

LIN T YDOLLÁR PGIRSHICK Ret al. Feature pyramid networks for object detection[C]//2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2017: 936-944.

[19]

CHEN L CPAPANDREOU GSCHROFF Fet al. Rethinking atrous convolution for semantic image segmentation[DB/OL]. (2017-12-05)[2025-09-25].

[20]

YANG BBENDER GLE Q Vet al. CondConv: Conditionally parameterized convolutions for efficient inference[DB/OL]. (2017-12-05)[2025-09-25].

[21]

DING XZHANG XMA Net al. RepVGG: Making VGG-style ConvNets great again[C]//2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2021: 13728-13737.

[22]

JHA D, SMEDSRUD P HRIEGLER M Aet al. Kvasir-SEG: A segmented polyp dataset[C]//MultiMedia Modeling. Cham: Springer, 2020: 451-462.

[23]

BERNAL JSÁNCHEZ JVILARIÑO F. Towards automatic polyp detection with a polyp appearance model[J]. Pattern Recognition201245(9): 3166-3182.

[24]

BERNAL JSÁNCHEZ F JFERNÁNDEZ-ESPARRACH Get al. WM-DOVA maps for accurate polyp highlighting in colonoscopy: Validation vs. saliency maps from physicians[J]. Computerized Medical Imaging and Graphics201543: 99-111.

[25]

SILVA JHISTACE AROMAIN Oet al. Toward embedded detection of polyps in WCE images for early diagnosis of colorectal cancer[J]. International Journal of Computer Assisted Radiology and Surgery20149(2): 283-293.

[26]

WANG JHUANG QTANG Fet al. Stepwise feature fusion: Local guides global[C]//Medical Image Computing and Computer Assisted Intervention-MICCAI 2022. Cham: Springer, 2022: 110-120.

[27]

JHA D, SMEDSRUD P HRIEGLER M Aet al. ResUNet++: An advanced architecture for medical image segmentation[C]//2019 IEEE International Symposium on Multimedia (ISM), 2020: 225-2255.

[28]

CHEN L CZHU YPAPANDREOU Get al. Encoder-decoder with atrous separable convolution for semantic image segmentation[C]//Computer Vision-ECCV 2018. Cham: Springer, 2018: 833-851.

[29]

HUANG C HWU H YLIN Y L. HarDNet-MSEG: A simple encoder-decoder polyp segmentation neural network that achieves over 0.9 mean dice and 86 FPS[DB/OL]. (2021-01-20)[2025-09-25].

[30]

QIN XZHANG ZHUANG Cet al. U2-Net: Going deeper with nested U-structure for salient object detection[J]. Pattern Recognition2020106: 107404.

AI Summary AI Mindmap
PDF (2573KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/