基于3D-nnUNet的岩心三维图像喉道划分算法

王晨铭 ,  熊淑华 ,  何海波 ,  滕奇志

四川大学学报(自然科学版) ›› 2026, Vol. 63 ›› Issue (03) : 250198 -250198.

PDF (1901KB)
四川大学学报(自然科学版) ›› 2026, Vol. 63 ›› Issue (03) : 250198 -250198. DOI: 10.19907/j.0490-6756.250198
电子信息科学

基于3D-nnUNet的岩心三维图像喉道划分算法

作者信息 +

A 3D-nnUNet-based algorithm for pore-throat segmentation in core CT images

Author information +
文章历史 +
PDF (1946K)

摘要

岩心CT图像的三维喉道划分是数字岩心分析的核心步骤,关系到孔隙空间结构参数计算与渗流特性分析的准确性和可靠性。针对三维喉道结构在空间连接、尺度分布与形态特征上的复杂性与多样性,本文基于3D-nnUNet架构提出一种多分支注意力融合机制与多尺度特征增强的新型划分算法。该算法设计了通道-空间增强注意力模块(Channel-spatial Enhancement Aattention, CEA),通过并行耦合卷积块注意力模块(Convolutional Block Attention Module, CBAM)与高效空间金字塔注意力(Efficient Spatial Pyramid Attention, EPSA),协同多尺度空洞卷积运算,显著提升模型对多尺度喉道特征的鉴别能力。同步引入改进型空间金字塔快速池化(Spatial Pyramid Pooling-Fast, SPPF)结构,采用渐进式池化方案,在降低计算资源消耗的同时,保证多尺度特征完整性,提升复杂喉道结构的连通性表达能力。实验验证表明:本方案Dice系数达91.20%,IoU达88.42%,喉道正确划分率(CR)达89.20%,相比其他主流传统算法和深度学习算法,多项指标均有提升,实现了高准确性的三维喉道划分,为数字岩心分析及储层渗流模拟提供自动化三维喉道划分工具。

Abstract

Three-dimensional throat segmentation from core CT images is a key step in digital core analysis, significantly impacting the accuracy and reliability of pore structure characterization and flow simulation.In this paper, we propose a novel segmentation algorithm based on an enhanced 3D-nnUNet framework, employing a multi-branch attention fusion mechanism and multi-scale feature enhancement.In this algorithm, a Channel-spatial Enhancement Aattention (CEA) module is developed by parallel integration of Convolutional Block Attention Module (CBAM) and Efficient Spatial Pyramid Attention (EPSA), combined with multi-scale dilated convolution operations, the ability to distinguish multi-scale throat features is thereby significantly improved.To further augment contextual representation, a Spatial Pyramid Pooling-Fast (SPPF) module is incorporated into the network bottleneck, employing a progressive pooling with fixed-size kernels to enhance multi-scale feature learning while mininizing computational overhead.The entire network is implemented on the nnUNetv2 platform with automatic architecture adaptation and trained and evaluated on binarized pore-throat CT datasets.Experimental results achieve a Dice coefficient of 91.20%, an IoU of 88.42%, and a correct recognition rate (CR) of 89.20%, outperforming other mainstream traditional and learning-based approaches.The proposed approach provides an effective and automated tool for three-dimensional throat segmentation in digital core analysis and reservoir flow simulation.

Graphical abstract

关键词

3D-nnUNet / 岩心孔隙 / 三维喉道划分

Key words

3D-nnUNet / core porosity / 3D throat segmentation

引用本文

引用格式 ▾
王晨铭,熊淑华,何海波,滕奇志. 基于3D-nnUNet的岩心三维图像喉道划分算法[J]. 四川大学学报(自然科学版), 2026, 63(03): 250198-250198 DOI:10.19907/j.0490-6756.250198

登录浏览全文

4963

注册一个新账户 忘记密码

孔隙指的是岩体内部尚未被固体物质填充的空隙,其直接反映出岩石的储集潜力。孔隙又分为孔腔和喉道两个部分,喉道是连接相邻孔腔之间的狭小通路,对渗流通达性具有决定性影响。孔隙结构的划分在岩心三维建模与数字岩心分析中扮演着至关重要的角色,它通常用于表征岩石样品中孔腔与喉道的几何构造、空间分布特征以及连通网络情况。以CT图像为基础的岩心微观结构三维重建与分析,伴随着计算机断层成像技术(Computed Tomography,CT)的快速发展已成为数字岩心的主流研究方向,其中对孔腔-喉道的划分尤为关键1-3
常见的三维喉道划分算法在当前研究中大致可归为两类:基于最大球策略(Maximal Inscribed Sphere)与基于中轴骨架(Medial Axis)的路径分析方法。在Al-Kharusi和Blunt的研究中1,最大球方法首次被用于复杂微孔通道的建模任务中。其后续改进,如 Dong等2-3提出的“双阶段搜索”策略,可有效克服传统方法在喉道定位精度方面的不足,但由于岩心孔腔形态多变且边界不规整,该类方法在构造球链路径时仍可能误判连接关系,从而出现过度(划分)或遗漏划分。刘雨晨等4针对最大球法在强噪声背景下稳定性差的问题,在前人研究基础上构建了一种加入后处理策略的最大球改进方案,提升喉道划分的可靠性与准确性。
中轴引导的算法则依赖于目标体骨架结构,结合孔腔截面变化信息,对喉道位置进行推断。这类方法通常基于3种常见的骨架提取策略,即拓扑迭代式细化法5-6、欧氏距离变换法7以及势场导向流形抽取方法8。相关学者通过对距离变换算法中关键点范围与路径规划权重函数进行调整9,可显著提升骨架连贯性与几何准确性;与此同时,龚小明等10在其研究中引入了以截面面积的局部最小值判定喉道的新机制,并结合截面形状参数来动态调整种子点搜索半径,优化了传统中轴方法在大尺度扁平孔隙上对喉道的定位偏差。Silin等提出的stick-and-ball模型11和Yamaguchi12使用的路径-距离融合中轴算法,虽在一定程度上为孔喉网络三维重建提供了结构基础,但仍有研究表明,这些方法在多路径交错、结构复杂的场景下容易出现喉道漏检与结构破坏等问题。
为克服上述方法局限性,部分研究者开始引入深度学习机制进行三维结构建模。例如,陈忠照等13在3DUNet结构基础上引入Transformer编码模块,以增强网络对复杂形态的结构感知能力,提升了三维喉道划分效率,但由于其输入分辨率限制与推理开销较大,该方法在处理多尺寸岩心图像时仍存在适配性障碍。
基于此背景,本文提出一种针对三维喉道划分并融合注意力机制的3D-nnUNet14模型,该网络模型继承了3D-nnUNet自动调整 patch 大小与结构深度的特性,使得模型可在无须手动指定输入尺寸的条件下,灵活适配不同大小的岩心 CT 体积数据,从而兼容多种尺度下的孔隙模型。此外,网络引入通道-空间融合注意力模块(Channel-Spatial Enhanced Attention,CEA),将 CBAM15(Convolutional Block Attention Module)与 EPSA16(Efficient Spatial Pyramid Attention)模块以并行方式集成,用以强化对喉道边界与局部空间细节的捕捉能力;同时,模型在主干bottleneck层引入一种轻量化空间金字塔快速池化模块SPPF17(Spatial Pyramid Pooling-Fast),通过渐进式上下文聚合策略,在保证效率的同时保留更丰富的结构上下文信息,能够显著提升对喉道复杂连通结构的表达能力。
本文的研究工作主要体现在以下4个方面:1) 首次将3D-nnUNet模型应用于三维喉道划分领域,灵活适配多尺度岩心图像;2) 提出融合CBAM与EPSA的通道-空间增强注意力模块(CEA)以提升喉道结构识别能力;3) 在主干中引入轻量化SPPF模块,提高了模型对复杂结构的上下文感知能力;4) 对比了不同注意力机制和不同尺度感受野模块在3D-nnUNet模型基础上改进后的三维喉道划分表现。

1 基于3D-nnUNet的岩心三维喉道划分算法

1.1 岩心CT三维喉道介绍

为了实现对岩石内部微观结构的非破坏性观察与定量分析,计算机断层扫描技术被广泛应用于岩心样本的成像,通过X射线穿透岩心样本并采集其在不同角度下的衰减信息,重建出高分辨率的岩心二维断层序列图像。获取到的原始CT图像通常为灰度图,灰度值反映了岩石不同部位对X射线的吸收强度。为提取岩心中的孔隙结构,需要对图像进行一系列图像预处理步骤(包括图像增强、噪声去除和阈值分割等操作),来获得孔隙二值化序列图。为实现孔隙结构的空间可视化与结构分析,本文采用VTK(Visualization Toolkit)可视化编程工具对上述二值图序列进行三维重建。VTK支持从连续切片图中生成三维孔隙体素模型,生成的三维孔隙体素模型可进行体绘制及表面渲染等多种形式的可视化展示,上述岩心孔隙三维重建流程如图1所示。

在三维孔隙模型中,喉道通常表现为连接两个孔腔之间的狭窄通道,是渗流过程中的关键部位。喉道示意图如图2所示。

1.2 3D-nnUNet网络模型

nnUNetv2是一种具备高度自动适应能力的三维医学图像划分框架。本文使用了其中的3D-nnUNet架构,架构遵循经典的 encoder-decoder 结构体系,主要由 input、encoder、decoder 以及 output 等4个部分构成。在input输入阶段,网络对原始体素图像进行 滑窗裁剪,同时引入一系列数据增强手段并配合归一化操作,进一步强化网络在不同样本上的泛化能力;encoder部分通过卷积(Conv)、InstanceNorm18与LeakyReLU19激活的多层级组合提取多尺度特征,并借助分层下采样策略保留局部结构信息;decoder则采用采样操作与skip connection跳跃连接方式,将深层语义特征与浅层细节特征进行融合,可以有效增强边界区域的划分精度;在output模块中,网络输出与输入尺寸一致的体素级预测图,并通过Softmax函数实现多类别分类,网络训练过程采用Dice Loss与CrossEntropy Loss20的加权损失组合,可以同时兼顾类别不均衡与区域重叠优化问题。

3D-nnUNet框架可以根据输入数据的维度、类别数量和显存资源自动调整patch size、batch size以及网络深度,从而展现出极高的任务适配能力和泛化稳定性,将该模型应用于三维喉道的划分中,通常包括图像预处理、网络动态自适应、网络训练和测试3个关键步骤。其整体流程如图3所示。

1.3 针对岩心三维喉道划分的3D-nnUNet网络模型

基于结构稳定性高、适应性强的3D-nnUNet划分架构,本文提出一种具备轻量化特性增强的模型结构。在网络的编码器各级输出后,新增融合了通道注意力模块 CBAM与空间金字塔注意力机制EPSA的通道-空间增强模块(CEA),旨在有效提升模型对不同尺度喉道特征的建模能力。此外,在网络的最深层语义特征图中集成改进型SPPF(Spatial Pyramid Pooling Fast)模块,通过分阶段池化操作,增强对复杂孔隙拓扑结构的全局感知能力。该网络整体结构如图4所示。

1.3.1 CEA模块

在三维岩心CT图像的喉道结构划分任务中,模型不仅要捕捉不同尺度下的形态特征,还要具备对空间拓扑连接关系的整体感知能力,以实现对多尺度复杂孔隙结构的识别。本文在3D-nnUNet的编码阶段引入CEA(Channel-Spatial Enhanced Attention)模块,CEA模块通过融合通道维度和空间结构的注意力机制,增强了模型对图像内部重要特征的识别能力,从而更有效地建模三维喉道结构。

CEA模块基于输入特征图X,设计了两个功能互补的并行分支:CBAM注意力通路与EPSA多尺度感受野路径。最终,通过逐元素相加的方式,对两支输出进行融合,生成增强后的特征图Z,其结构如图5所示。

在CBAM支路中,主要串联了通道注意力机制(CA)和空间注意力机制(SA)。如图6a所示,通道注意力机制的构建,首先通过空间维度上的全局最大池化和平均池化操作获得通道特征描述,再利用共享全连接层(MLP)进行映射,融合后输入Sigmoid函数生成通道权重图。如图6b所示,空间注意力机制的构建,首先在通道维度上分别进行最大池化和平均池化操作,获得两个二维的空间特征图,随后将二者进行通道拼接(Concat),再通过一个卷积操作提取联合特征,最后经由Sigmoid激活函数生成空间注意力图,用于对关键空间位置进行加权增强。

图6c所示,在EPSA分支中构建了并行的多尺度卷积路径,分别使用3×3×3、5×5×5和7×7×7的3D分组卷积核,从不同尺度提取空间结构特征。各分支输出在通道维度拼接后,输入轻量级的SE模块,用于生成每个尺度的注意力响应权重,通过Softmax函数归一化后,将各尺度响应重新加权融合,以获得结构层次更加清晰的多尺度表达。该模块有效提升了网络对不同尺寸及不同拓扑喉道结构的理解能力。

在CEA模块的设计中,我们选择了CBAM与EPSA的并行融合方式,主要基于两者的特征提取方向具有互补性,CBAM通过通道注意力和空间注意力强化局部显著区域与细节边界,EPSA依托多尺度卷积结构,能够捕获全局上下文信息和复杂的尺度变化特征,如果采用串行堆叠,先加权的模块会对后续模块的输入特征引入强烈的先验偏置,可能削弱另一模块的特征感知能力。并行结构则可让CBAM与EPSA在相对独立的路径上提取特征,并在融合时实现全局与局部信息的互补,从而最大化两类注意力机制的特长。

1.3.2 SPPF模块

常见的喉道结构具有显著的尺度差异及复杂的连通性特征,这对模型提出了更高的空间上下文理解要求,尤其是在深层语义层中需具备较强的多尺度结构感知能力。为提升主干网络在高阶语义阶段的空间信息整合能力,本文在3D-nnUNet架构的 bottleneck层引入了一种轻量级的上下文增强模块SPPF(Spatial Pyramid Pooling-Fast)。该模块为获取更丰富的上下文表示,通过连续的最大池化操作模拟不同感受野下的响应特性。结构如图7所示,输入特征图首先通过一个1×1×1的卷积进行通道压缩和融合,再依次执行3次核(5×5×5)大小一致的最大池化操作,每次池化基于前一次结果进行,形成级联结构逐步提取空间上下文。3条池化路径与初始输入在通道维度上合并后,再次经过1×1×1卷积整合输出,从而获得具备多尺度感知能力的深层特征图。

SPPF与传统的SPP模块21采用多路并行卷积不同,其通过串联池化的方式实现多尺度模拟,显著降低模型计算负担与参数量的同时仍能保持对结构信息的敏感性。在三维图像任务中,SPPF模块适用于深层特征阶段的空间聚合,可在不明显提升计算资源开销的前提下增强模型的上下文建模能力。该设计在保留浅层局部感知能力的同时,借助了叠加式池化实现了对全局结构语义的覆盖,对于处理结构复杂、尺度跨度较大的喉道区域有显著效果。

1.3.3 模型结构参数量与计算复杂度(FLOPs)对比

为验证所提模块在提升性能同时是否引入冗余计算,本文统计了各结构的参数量与计算复杂度(FLOPs),结果如表1所示。相比原始3D-nnUNet,CBAM模块仅增加约0.2×106参数与0.4 GMacs FLOPs,计算开销较低;EPSA模块因引入多尺度卷积,参数与FLOPs增幅较大。将二者并联形成的CEA模块相比单独EPSA,参数仅增加0.14×106,FLOPs增加0.4 GMacs,说明并未引入显著冗余。加入SPPF后仅增加0.66×106参数和0.08 GMacs FLOPs,远低于EPSA、CEA等模块带来的计算开销,在显著提升全局特征建模能力的同时,几乎不增加模型负担,充分体现了其轻量化、高效性的设计优势。

2 实验与结果分析

2.1 实验环境及训练参数

本研究实验在Windows 10操作系统环境下完成,硬件平台配置为128 GB内存、Intel(R)Core(TM)i9-12900K CPU以及NVIDIA GeForce RTX 3060 GPU(显存容量为 12 GB);软件环境方面,采用的深度学习框架为PyTorch 2.5.1并搭配CUDA 12.1版本,编程语言为 Python 3.10.16。

网络训练部分基于nnUNetv2框架默认配置展开,优化器选择带有 Nesterov 动量加速机制的随机梯度下降算法(Stochastic Gradient Descent, SGD)22,该优化方案在参数迭代过程中,通过提前评估梯度方向提升了收敛效率,并有效缓解震荡现象,具体超参数设置如下:初始学习率为0.01,动量因子设为0.99,权重衰减系数设置为3×10-5

nnUNetv2框架在损失函数设计上引入了Dice Loss与 Cross Entropy Loss的加权混合策略,前者强调预测结果与真实标签之间的区域重叠程度,特别适用于小尺寸目标与边界模糊区域的优化,而后者则以提升像素级分类概率为目标,从而改善整体分类性能。联合损失的设定在平衡精度与召回的同时,也增强了模型对样本的适应能力。具体损失函数定义如下式所示。

L=αLCE+(1-α)LDice

其中,Dice损失的数学表达式如下式所示。

LDice=1-2ipigi+ipi+igi+

式中gipi分别代表模型预测值与真实标签的像素值,是平滑项,防止分母为零。交叉熵损失在二分类场景下表达为:

LCE=ylog(p)+[1-ylog(1-p)]

其中, y∈{0,1}为真实标签, p∈[0,1]为预测概率。

nnUNetv2框架引入余弦变化的动态学习率调整机制(Cosine Annealing)23,提升了训练过程中的模型稳定性和表现,该策略在训练早期保持相对较高的学习率,以加速网络参数的有效更新,随后逐步下降学习率,实现对模型参数的细致优化,从而增强模型的收敛能力与后期精度的提升。

2.2 实验数据集

本研究使用的数据集来源于计算机断层扫描(CT)获取的多组岩心序列图像,通过对这些图像进行一系列图像处理(包括图像增强、噪声去除和阈值分割等操作),来获得孔隙二值化序列图,得到用于训练的三维岩心孔隙二值化图像。借助VTK可视化开发工具24,对生成的二维图像序列进行了三维重建渲染。

为提升模型在不同形态样本上的泛化表现,本研究构建了200组三维喉道标注样本的数据集,样本体素点阵的大小覆盖范围从64×64×64到256×256×256,具有良好的结构多样性。数据集按照7∶3的比例划分为训练集与验证集,并额外准备了80组形状和尺寸各异的图像样本作为独立测试集,其中部分样本包含了细小孔隙噪点以及裂缝等结构,以上测试集用于评估模型在未见样本上的划分精度与结构适应能力。图8展示了孔隙三维可视化结果,图8a为原始孔隙结构的三维建模结果,图8b为对应的标准三维喉道划分的三维建模结果。

2.3 评价指标

实验引述了正确划分率(CR)、欠划分率(UR)和过划分率(OR)这3项评价指标13,以便客观地衡量不同算法在完成喉道划分任务方面的整体性能。这3项定量评价指标具体定义如下式。

CR=TR×100%
OR=OU+O×100%
UR=UU+O×100%

其中, R表示真实标签中所包含的全部喉道数量,U表示算法未成功检测出的喉道数量即漏检,O为误划分出的喉道数目,而 T代表模型准确识别出的喉道总数。当且仅当UO都为0时,上述公式不适用,该情况记ORUR都为0。

在孔腔与喉道的分割任务中,Dice系数和IoU常用于衡量预测结果与真实标签的重叠情况。但由于喉道边界定义模糊,轻微的过划分或欠划分对划分的影响不大,此时Dice和IoU指标参考意义有限。为更全面评估分割效果,本文引入正确划分率CR、过划分率OR和欠划分率UR等指标,用于补充传统指标在边界判断上的不足。但当过划分或欠划分严重,导致与标签区域偏离时,Dice和IoU又能体现其评价价值。综合多个指标,有助于更全面反映模型性能。

Dice系数与IoU的具体计算公式如下所示。

Dice(Tp,Fp,Fn)=2Tp2Tp+Fp+Fn
IoU(Tp,Fp,Fn)=Tp Tp +Fp+Fn

其中,Tp表示模型成功识别出的正类样本数量,Fp指的是被错误判定为正类的负类样本数,Fn代表实际为正类但被错误预测为负类的样本数量。

2.4 实验效果对比

本文模型在三维喉道划分的训练任务中的损失曲线如图9所示。其中,横轴为epoch,纵轴为loss;蓝色曲线为训练损失,红色为验证损失;绿色虚线表示每次验证过程中的伪Dice分数,绿色实线为其移动平均值。默认组合损失(Dice Loss+交叉熵)中的Dice分支实际采用负Dice系数的形式来构造损失函数(即L=-LDice+LCE),这是nnUNet框架中的一种常见设计方式,所以图中损失逐渐趋近于-1。

2.4.1 不同算法效果对比

对比实验分为传统算法和深度学习算法两个组别进行,传统算法包括基于中轴线变换的方法和基于最大包围球策略算法,深度学习算法对比包括文献[13]提出的基于Transformer 的改进3DUNet算法。通过引入多项客观评价指标,对各类算法在不同维度上的性能表现进行定量分析与比较。

需要指出的是,基于Transformer改进的3DUNet算法输入分辨率限制为64×64×64大小,该方法无法处理不规则的多尺寸的岩心图像,所以挑选大小为64×64×64的数据集进行实验比较。其次,由于传统中轴变换方法与最大球方法输出的是非像素化的中心线或几何结构、非稠密掩膜图,故不适合直接使用Dice或IoU等像素重叠指标评估,其他相关性能对比结果已在表2中汇总列出。

表2的实验对比数据可以观察到,本文提出的改进算法不仅在三维喉道划分任务中展现出明显优势,还在多个核心指标上均优于两种传统方法和3D-nnUNet模型。由于中轴提取法与最大包围球策略难以实现对全部喉道区域的精准像素级识别,因此在Dice系数与IoU指标上缺乏直接可比性。

中轴变换方法在正确划分率CR上达到70.75%,一定程度上反映了其在捕捉几何骨架结构方面的适用性,但该方法的过划分率OR高达45.10%,反映出较多非喉道区域被误划分。同时,欠划分率UR达48.12%,漏检现象亦较为严重。最大包围球方法在OR方面大幅下降至 9.52%,UR高达68.05%,其整体识别能力不足,喉道捕捉率偏低。作为深度学习代表的3D-nnUNet 框架,在本任务中的表现相对均衡,Dice与IoU达89.50%和87.06%,在结构识别方面已有较强适应性。

本研究所提出的改进模型在关键指标Dice(91.20%)、IoU(88.42%)与CR(89.20%)上均取得最优结果,且OR降至8.50%,改进后该算法在降低误划分方面具有显著提升,但是UR高于原始网络,说明改进后分割比原始网络更加保守。

为便于直观展示不同模型在实际数据上的表现,图10 给出了5组典型岩心 CT 孔隙样本的三维喉道划分效果图。图10内容从左至右依次为:原始孔隙三维建模图、人工标注的标准划分图、最大球法的划分结果、中轴法的划分结果、3D-nnUNet模型输出,以及本文提出的改进型3D-nnUNet网络生成的结果。每个单独分离的孔腔用不同的颜色表示,从图中可以看出,最大球算法多组示例中欠划分严重,中轴变换算法在a、c两组都存在比较明显的过划分,在d组中3D-nnUNet相比本文算法也存在明显的过划分和欠划分。

由于基于Transformer的改进3DUNet算法输入分辨率限制,表3为在固定大小为64×64×64的数据集中进行实验比较。本文提出的三维喉道分割算法在各项指标上整体优于对比方法。其中,Dice系数和IoU分别达到98.19%和96.72%,分割精度高于改进后的3DUNet和3D-nnUNet,CR(正确划分率)也达到了87.66%,显著优于其他方法。本文方法的OR(过划分率)最低,仅为 6.67%,表明误分割更少。虽然在UR(欠划分率)上高于3D-nnUNet,但仍明显低于改进后的3DUNet,整体表现更加均衡。

图11给出了4组典型岩心CT孔隙样本的三维喉道划分效果图。图中内容从左至右依次为:原始孔隙三维建模图、人工标注的标准划分图、基于Transformer的改进 3DUNet模型输出、3D-nnUNet模型输出,以及本文提出的改进型3D-nnUNet网络生成的结果。从结果中能看出,基于Transformer 改进的3DUNet在a组对比其他两种算法分割切面出现不规则状,在c组存在大量的欠分割,b、d两组中多数喉道特征被识别划分,但是并未完全划分实现孔腔分离。

2.4.2 不同注意力机制改进效果对比

本文为了评估不同注意力机制在三维喉道结构提取中的改进效果,在3D-nnUNet主干架构的基础上引入多种经典注意力模块进行对比实验,包括CA25、SA26、SE27、ECA28、PSA29、CBAM以及EPSA模块。上述注意力机制被单独替换至网络中,并在两组具有代表性的岩心数据集上进行性能测试,通过Dice 系数与IoU指标对模型的划分能力进行量化分析。实验结果如表4所示,表中分为两组数据,第1组数据为综合性数据,数据分布比较均匀;第2组数据抽取测试集中结构复杂、尺度跨度较大、形态变化剧烈的数据集,这组数据更具挑战性,以验证不同注意力机制在难度较大的数据集下的表现。

在第1组数据中,结果显示原始3D-nnUNet模型已具备良好的识别效果,Dice与IoU分别为89.50%和87.06%。在引入各类注意力机制后,融合通道与空间建模能力的CBAM模块表现最佳,其Dice值在所有比较项中排名最高,达到 90.41%,说明其对中等复杂度结构具有较好的适应和增强能力。

第2组数据中,原始网络在此数据集上的划分效果明显下降,Dice仅为76.33%,IoU为71.51%。引入EPSA模块后,网络性能有所提升,Dice与IoU分别提升至77.07%与72.02%,在复杂结构场景中展现出更强的泛化表现。

分析表明,不同注意力机制在处理不同复杂度样本时有着差异化的优势:CBAM适用于形态规整、结构清晰的样本;而EPSA在面对多尺度变化与复杂空间结构的样本时展现出更强的适应性,故采用两种注意力机制进行融合,以适应多类型的样本。

2.4.3 不同多尺度感受野增强模块改进效果对比

本文为评估不同多尺度感受野增强策略在三维喉道结构提取中的适应效果,在3D-nnUNet主干网络的基础上,分别引入DC30、PSP31、SCCONV32和SPPF这4类代表性模块,并开展对比实验以分析其对模型划分性能的影响。各项实验结果汇总于表5中,表中同样分为两组数据,同第2.4.2节。第1组数据为综合性数据,第2组为测试集中难度较大的数据,以验证不同尺度感受野增强模块在难度较大的数据集下的表现。

在第1组样本中,SCCONV模块表现最突出,Dice值提升至 90.97%,IoU为87.83%表明其在中等复杂度场景下具备较高的特征提取效率。当模型应用于第2组较困难的样本时,各模块差异被进一步放大,原始模型在此条件下性能明显退化。SPPF模块通过连续池化与跨尺度特征融合的策略,取得了Dice为77.39%、IoU为72.30%的表现。该结果验证了SPPF在结构复杂、划分困难的三维喉道区域中具备更强的感知能力。

SPPF相较其他感受野扩展模块结构更为简洁,依赖基础池化操作实现多尺度特征压缩与汇聚,无须引入过多额外参数,训练与推理开销较低,在高难度数据集中提升比较明显,故选择该模块进行改进。

2.5 消融实验

表6可见,主干网络中引入CEA模块后在Dice与IoU指标上分别提升0.4%和0.34%,并在CR(正确划分率)上提高5.26%,验证了通道-空间注意力与多尺度感知联合建模在喉道区域结构表达方面的增强作用。

当在主干网络中加入SPPF模块后,模型在Dice、IoU与CR上也分别获得一定程度的提升,尤其在UR(欠划分率)方面降至 11.93%,为所有单模块配置中最低,显示其在增强上下文信息、抑制漏划分方面的显著效果。

同时加入CEA与SPPF两个模块后,模型性能提升最大,Dice提高至91.20%,IoU达到 88.42%,CR上升至89.20%;同时,OR(过划分率)降至最低,仅为 8.50%,UR(欠划分率)高于只加入SPPF模块时的数据。单独加入SPPF模块时,UR(欠划分率)最低为11.93%,而CEA+SPPF联合时UR升至25.40%,同时OR(过划分率)显著下降至8.50%。这主要是因为欠划分与过划分在一定程度上具有互补性:当模型预测更“保守”时,非喉道区域的误判减少(OR下降),但可能牺牲部分小喉道的召回率(UR上升)。SPPF模块通过大核池化实现多尺度上下文特征聚合,偏重于全局结构增强;CEA模块则通过通道与空间注意力机制突出显著区域并抑制较弱的响应特征。两者结合时,虽然有效降低过划分率,但本就响应较弱的小喉道特征可能被进一步削弱,导致欠划分率上升。这可视作SPPF与CEA在“全局特征增强”与“细节保留”之间存在一定不平衡,并在一定程度上产生轻微的特征竞争或模块冲突。

3 结论

本研究围绕岩心CT图像中三维喉道结构存在的复杂形态、尺度差异等难点问题,提出了一种集成注意力机制与多尺度增强模块的3D-nnUNet改进网络架构,通过在原有网络中融入CEA模块以及结构轻量、感受野扩展能力强的SPPF模块,增强了模型对喉道区域的空间表达力与上下文感知能力。由于nnUNet框架所具备的patch自适应机制,因此该方法能够处理不同尺寸的三维图像输入,提高了模型在复杂地质结构中的实用适应性。从实验结果可得知,本文模型在多个关键评价指标上均有提升,通过消融实验进一步验证了注意力机制与多尺度结构在不同复杂度岩心样本下的划分效果,为后续结构优化提供了理论依据。

参考文献

[1]

Al-Kharusi A SBlunt M J.Network extraction from sandstone and carbonate pore space images [J].J Petrol Sci Eng200756(4): 219-231.

[2]

Dong H.Micro-CT imaging and pore network extraction [D].London: Department of Earth Science and Engineering, Imperial College London, 2008.

[3]

Dong HBlunt M J. Pore-network extraction from micro-computerized-tomography images[J].Phys Rev E200980(3): 036307.

[4]

Liu Y CTeng Q ZHe X Het al.Optimization algorithm for throat segmentation in 3D core images [J].Journal of Sichuan University (Engineering Science Edition)201244(S1): 171-176.

[5]

刘雨晨, 滕奇志, 何小海, .岩心3维图像孔喉划分优化算法[J].四川大学学报(工程科学版)201244(S1): 171-176.

[6]

Jennane RAufort GBenhamou C Let al.A new method for 3D thinning of hybrid shaped porous media using artificial intelligence.application to trabecular bone [J].J Med Syst201236(2): 497-510.

[7]

Bertrand GCouprie M.Powerful parallel and symmetric 3D thinning schemes based on critical kernels [J].J Math Imag Vis201448(1): 134-148.

[8]

Liu J T.A new method of extracting objects' curve-skeleton: A new method of extracting objects' curve-skeleton [J].Acta Autom Sin200834(6): 617-622.

[9]

Cornea N DSilver DYuan Xet al.Computing hierarchical curve-skeletons of 3D objects [J].Vis Comput200521(11): 945-955.

[10]

Yuan H.Research on fracture extraction and pore-throat segmentation algorithm in 3D core images [D].Chengdu: Sichuan University, 2015.

[11]

袁浩.岩心三维图像裂缝提取及孔喉划分算法研究[D].成都: 四川大学, 2015.

[12]

Gong X MTeng Q ZWang Z Yet al.Pore-throat segmentation algorithm based on medial axis in 3D core images [J].Journal of Sichuan University (Engineering Science Edition)201648(S2): 100-106.

[13]

龚小明, 滕奇志, 王正勇,.基于中轴线的岩心3维图像孔喉划分算法[J].四川大学学报(工程科学版)201648(S2): 100-106.

[14]

Silin DPatzek T.Pore space morphology analysis using maximal inscribed spheres [J].Phys A Stat Mech Appl2006371(2): 336-360.

[15]

Yamaguchi T.Skeleton extraction by distance and geodesic methods in porous media segmentation [J].Journal of Microscopy2013250(3): 238-247.

[16]

Chen Z Z.Core CT image analysis based on deep learning [D].Chengdu:Sichuan University,2024.

[17]

陈忠照.基于深度学习的岩心CT图像分析[D].成都: 四川大学,2024.

[18]

Isensee FJaeger P FKohl S A Aet al.nnU-Net: A self-configuring method for deep learning-based biomedical image segmentation [J].Nat Methods202118(2): 203-211.

[19]

Jiang PZhang JChen J.Enhanced rain removal network with convolutional block attention module (CBAM):A novel approach to image de-raining [J].EURASIP Journal on Advances in Signal Processing2025(1): 9.

[20]

Yang ZLi YXu Tet al.EPSA-Net: Efficient spatial pyramid attention network for High-Resolution remote sensing image scene classification [J].IEEE T Geosci Remote202260: 1-17.

[21]

He KZhang XRen Set al.Spatial pyramid pooling in deep convolutional networks for visual recognition[J].IEEE T Pattern Anal201537(9): 1904-1916.

[22]

Ulyanov DVedaldi ALempitsky V.Instance normalization: The missing ingredient for fast stylization [C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2017: 872-881.

[23]

Xu BWang NChen Tet al.Empirical evaluation of rectified activations in convolutional networks [C]//Proceedings of the 32nd International Conference on Machine Learning (ICML), 2015: 95-99.

[24]

Ma XHuang HWang Yet al.Normalized loss functions for deep learning with noisy labels [C]//Proceedings of the 37th International Conference on Machine Learning, 2020: 6543-6553.

[25]

He KZhang XRen Set al.Spatial pyramid pooling in deep convolutional networks for visual recognition [C]//European Conference on Computer Vision, 2014: 346-361.

[26]

Doofealy AFawzi O.Convergence analysis of Nesterov acceleration for stochastic gradient methods [C]//International Conference on Machine Learning, 2020: 2597-2607.

[27]

Loshchilov IHutter F.SGDR:Stochastic gradient descent with warm restarts [C]//International Conference on Learning Representations(ICLR), 2017.

[28]

Schroeder WMartin KLorensen B.The visualization toolkit:An object-oriented approach to 3D graphics [M].4th ed.Clifton Park, NY, USA: Kitware Inc., 2006.

[29]

Hou QZhou DFeng J.Coordinate attention for efficient mobile network design [C]//2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2021: 13708-13717.

[30]

Vaswani AShazeer NParmar Net al.Attention is all you need [C]//Proceedings of the 31st International Conference on Neural Information Processing Systems (NeurIPS), 2017: 5998-6008.

[31]

Hu JShen LSun G.Squeeze-and-excitation networks [C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2018: 7132-7141.

[32]

Wang QWu BZhu Pet al.ECA-net: Efficient channel attention for deep convolutional neural networks [C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2020: 11531-11539.

[33]

Pei WMa YZhang Qet al.PSA: A novel efficient attention module for image classification [C]//Proceedings of the 29th ACM International Conference on Multimedia (MM '21), 2021: 1090-1098.

[34]

Yu FKoltun V.Multi-scale context aggregation by dilated convolutions [PP/OL].V3.arXiv (2016-04-30)[2025-03-25].

[35]

Zhao HShi JQi Xet al.Pyramid scene parsing network [C]//2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR).Honolulu HI, USA: IEEE, 2017: 6230-6239.

[36]

Tian ZShen CChen Het al.Self-calibrated convolutions for semantic segmentation [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2020: 10711-10720.

基金资助

国家自然科学基金(62071315)

AI Summary AI Mindmap
PDF (1901KB)

134

访问

0

被引

详细

导航
相关文章

AI思维导图

/