基于深度学习的岩石铸体薄片图像喉道识别算法

蔡明达 ,  何小海 ,  滕奇志 ,  吴媛媛 ,  何海波

四川大学学报(自然科学版) ›› 2026, Vol. 63 ›› Issue (4) : 900 -910.

PDF (2841KB)
四川大学学报(自然科学版) ›› 2026, Vol. 63 ›› Issue (4) : 900 -910. DOI: 10.19907/j.0490-6756.250214
电子信息科学

基于深度学习的岩石铸体薄片图像喉道识别算法

作者信息 +

Throat recognition algorithm for rock cast thin section images based on deep learning

Author information +
文章历史 +
PDF (2908K)

摘要

岩石铸体薄片图像中喉道结构的精准分析,对于了解储层微观结构、运移性质有重要意义。现有喉道识别方法在处理铸体薄片图像时,存在误识别和准确率不高的问题,影响了整体识别效果。鉴于此,本文提出基于TransUNet构建的GAB-ETransUNet喉道深度学习识别算法。该算法以TransUNet为基础,将Transformer层升级为ETransformer结构,增强对喉道特征的关注;引入组聚合桥接模块GAB,有效促进多尺度特征融合,减少图像误识别现象。实验结果表明,与TransUNet相比,GAB-ETransUNet算法表现更优,CR提升至83.63%,提高了5.99%;UR降低了4.22%;OR降低了3.82%;参数量降低了30.1%,有效提升了喉道识别的准确性与可靠性。

Abstract

The precise analysis of throat structures in rock cast thin section images is crucial for understanding reservoir microstructure and transport properties.However, existing throat recognition methods suffer from low accuracy and misidentification when processing these images.To address these limitations, this paper proposes GAB-ETransUNet, a deep learning algorithm for throat recognition built on the TransUNet architecture.Built upon such architecture, the algorithm upgrades the Transformer layer to an ETransformer structure to better focus on throat features, and second, it introduces a Group Aggregation Bridging(GAB) module to promote multi-scale feature fusion and reduce misidentification.Experimental results demonstrate that GAB-ETransUNet significantly outperforms the original TransUNet, achieving a CR of 83.63% (an increase of 5.99%) while reducing UR and OR by 4.22% and 3.82%, respectively; these improvements are accomplished with a 30.1% reduction in model parameters, thereby effectively enhancing both the accuracy and reliability of throat recognition.

Graphical abstract

关键词

喉道识别 / GAB-ETransUNet / EMSA / GAB / 多尺度特征融合

Key words

throat recognition / GAB-ETransUNet / EMSA / GAB / multi-scale feature fusion

引用本文

引用格式 ▾
蔡明达,何小海,滕奇志,吴媛媛,何海波. 基于深度学习的岩石铸体薄片图像喉道识别算法[J]. 四川大学学报(自然科学版), 2026, 63(4): 900-910 DOI:10.19907/j.0490-6756.250214

登录浏览全文

4963

注册一个新账户 忘记密码

岩石铸体薄片是一种通过特殊工艺制备的岩石样品,在特定温度和压力条件下,向岩石孔隙中注入环氧树脂或有机玻璃,使其与固化剂发生化学反应并固化,从而形成坚硬的填充物,再将固化的样品磨至30~40 μm厚度即可制得岩石铸体薄片。在光学显微镜下对岩石铸体薄片进行图像采集,采集的图像见图1a,蓝色部分为填充的树脂染料。薄片中的孔隙结构特征与岩石的变形和强度特性密切相关1,这些特征为地质勘探和油气开发提供了非常有价值的参考,而在孔隙的基础上对喉道结构的分析有助于认识孔隙中流体的运移特性,对油气储层勘探具有重要意义2。由于在薄片中填充的彩色树脂颜色清晰明显,有利于突出孔腔的形状,因此可以利用图像分析法来进行岩石铸体薄片图像的研究。根据岩石孔隙结构特征测定图像分析法中制定的行业标准3,由3个及3个以上岩石颗粒所包围的空间称为孔腔,相邻两个孔腔之间的连接部分(即两颗岩石颗粒之间的空间)称为喉道,孔腔和连接它的部分喉道的总体称为孔隙,孔腔与喉道示意图见图1b。基于上述标准,本文对岩石铸体薄片图像中的喉道识别展开研究。
当前针对岩石铸体薄片图像中喉道的识别仍面临诸多挑战。喉道结构往往大小不一且形态复杂,与周围背景的区分度较低,传统图像分析方法难以实现精准识别,深度学习方法在喉道识别上的应用仍处于探索阶段,为此,本文围绕岩石铸体薄片图像的喉道识别展开深入研究。本文主要贡献包含以下3个方面:1) 根据采集的400张岩石铸体薄片图像制作了5500张自建数据集;2) 以TransUNet为基准网络,为了解决其对喉道局部特征关注不足以及计算复杂度较高的问题,构建了结合组聚合桥接(Group Aggregation Bridge module, GAB)的高效(Efficient, E)TransUNet网络,将其命名为GAB-ETransUNet;3)开展对比实验以及消融实验并进行了模型复杂度及推理时间对比,根据实验结果验证了本文网络的在喉道识别上的有效性。

1 相关工作

1.1 传统喉道识别方法

早期的喉道识别研究主要依赖于数字图像处理技术,并在孔隙提取得到的二值图上进行操作。这些方法的核心是利用喉道的形态学特征(如狭窄、连接性)进行识别。Tavanaei4提出采用分水岭图像分割方法通过梯度图像检测孔隙边界,并结合形态学处理实现喉道与孔隙的分离。虽然该方法表现出较好的孔隙-颗粒区分能力,但其在喉道识别上会出现误识别的问题,由于分水岭算法对图像噪声和局部梯度变化敏感,导致喉道区域的提取断裂以及错误提取了冗余边界。因此需额外引入腐蚀、膨胀等操作修正喉道连接性,增加了算法复杂度。涂秉宇等5提出了一种基于拐点检测的喉道识别方法,以孔隙二值图为原图,利用16邻域链码检测边界拐点,通过筛选和匹配算法确定有效拐点对,最终形成分割线。然而该方法依赖高质量的孔隙二值图,且对边界噪声较敏感,容易出现误识别的情况。蔡宇恒6提出了基于最大内切圆的喉道识别算法。将骨架提取融入计算过程,通过计算孔隙二值图中孔隙区域的最大内切圆,定位喉道的最窄连通部分,从而实现识别。虽然该方法相比拐点检测法,减少了冗余运算,提升了喉道识别的效率,但仍存在许多喉道划分位置偏差的问题。

1.2 深度学习喉道识别方法

由于传统方法高度依赖二值图的连通性假设,即图像可能因为存在噪声或染色瑕疵,导致本该相连的孔隙在二值图中出现断裂,对后续喉道划分位置带来影响。其次,基于形态学或几何特征操作的传统方法对局部梯度变换较敏感,容易在非喉道区域产生误识别的情况。与传统方法不同,深度学习能够直接利用原始彩色图像进行学习,保留孔隙的颜色、纹理及梯度等多维信息,避免了二值化过程造成的信息丢失及由此引发的连通性假设偏差。

从技术本质来看,喉道识别的核心任务是准确区分孔隙区域中的连通狭窄部分,这一过程依赖于图像分割技术对微观结构的颜色特征提取和边界识别能力。在图像语义分割深度学习的研究中,Ronneberger等7提出了UNet网络,通过跳跃连接巧妙地将语义信息与空间信息整合在一起。这种跳跃连接为上采样过程直接提供了低级纹理信息,对高级语义特征的构建至关重要,让反卷积层能获取基本的高分辨率特征8。Chen等9提出的TransUNet通过将CNN的局部特征提取能力与Transformer的全局上下文建模优势相结合,在编码阶段利用CNN捕获图像细节特征,在深层网络引入Transformer建立长距离依赖关系,提升了医学图像的分割精度。Liu等10提出了CM-UNet,采用CNN编码器提取局部特征,并创新地使用Mamba架构的解码器聚合全局上下文,通过引入通道-空间注意力门控和多尺度融合模块,显著提升了遥感图像分割的效率和精度。Kirillov 等11提出了Segment Anything Model (SAM),通过引入提示式分割任务,构建了一个通用的分割基础模型。该模型在超过十亿掩码的监督下进行训练,实现了对任意提示的快速响应,有效解决了传统方法在交互效率和跨领域适应性方面的局限。

随着深度学习在图像分割领域的成熟,其技术优势也逐渐在喉道识别任务中得到应用。邓亮12采用UCTransNet网络作为基准,在网络下采样过程中融入卷积块注意力机制模块和多尺度融合模块,运用高效的特征融合方法,最大程度融合喉道特征信息与潜在语义信息,减少了语义差异。经过实验对比,该方法相较于最大内切圆算法、UNet、UCTransNet方法,在识别性能上都实现了提升,为喉道识别提供了新的思路。岳枫云等13提出了一种基于改进UNet++的喉道识别算法。该算法以UNet++作为特征提取的主干网络,在下采样过程中融入卷积块注意力模块,增强了模型捕获不同维度特征相关性的能力,提升了喉道特征提取的准确性。

综上所述,尽管深度学习在图像分割领域进展显著,但专门针对喉道识别任务的研究仍处探索阶段。现有方法面对喉道多变、尺度差异大等特点,存在特征捕捉不足、多尺度融合低效以及计算速度较慢等问题,为本文方法的设计提供了方向。

2 本文方法

2.1 整体网络结构(GAB-ETransUNet)

TransUNet是一种结合Transformer的全局建模能力与卷积神经网络CNN(Convolutional Neural Network, CNN)的局部细节提取优势的混合编码图像分割网络,能解决传统CNN感受野有限和Transformer局部细节丢失的问题14。然而,直接将TransUNet使用在喉道识别任务上存在以下问题:1) 计算复杂度较高:Transformer中的多头自注意力(Multi-head Self-Attention, MSA)计算随输入分辨率呈二次增长,会使计算开销较大;2) 尺寸适应性差:喉道宽度从数像素到数十像素不等,单一的跳跃连接难以捕捉到不同尺度的特征,对喉道局部特征关注不足及尺寸适应性差。

为此,本文构建了GAB-ETransUNet网络,结构见图2。将输入图像通过3层CNN进行卷积下采样,逐步压缩空间维度并扩展通道数。引入ETransformer,将二维特征图展平为一维序列,并映射到D=512的高维嵌入空间。ETransformer中的EMSA(Efficient Multi-Head Self-Attention, EMSA)机制通过深度卷积下采样降低计算成本,同时利用1×1卷积增加头间交互,使注意力更聚焦于喉道的局部狭窄特征。经过12层ETransformer处理后,再经过reshape得到64×64×512的特征图。解码器部分先经过级联上采样,通过2×2转置卷积上采样2倍,接着进行3×3卷积和ReLU调整特征。在跳跃连接处引入GAB模块,将编码器的低级特征(256×256×64)、解码器的中级特征(256×256×128)和高级语义掩码(经1×1卷积降维至256×256×32)进行分组融合:首先将特征分为4组,每组分别应用膨胀率为1、2、5、7的3×3空洞卷积提取多尺度特征,然后拼接并通过1×1卷积压缩通道数至128,并利用掩码信息过滤非喉道区域,从而提升狭窄结构的识别鲁棒性,实现多尺度特征的有效融合,有利于应对喉道大小不一、形态复杂导致的误识别问题。最终通过分割头输出512×512的二值分割图,完成喉道的识别结果。

2.2 ETransformer模块

Transformer是一种基于自注意力机制的深度学习模型架构,最初用于自然语言处理领域,因其在长序列建模的优势,有利于捕捉图像的全局信息,在计算机视觉领域也得到了广泛应用。标准的Transformer模块由一个MSA和一个多层感知机(Multi-Layer Perceptron, MLP)组成15,Transformer主要是通过MSA在序列的标记间建立全局连接,MSA采用Q-K-V分解来建模序列标记之间的全局关系,在MSA后采用前馈神经网络(FeedForward Neural Network, FFN)学习更广泛的表示。因此,Transformer可以根据图像内容动态调整感受野。但是MSA存在以下缺陷:1) 内存和计算量随通道数呈二次增长,给训练和推理带来巨大开销;2) 每个头仅负责嵌入维度的一个子集,可能会损害网络性能,特别是当每个头的令牌嵌入维度较短时,查询和键的点积无法构成一个有信息的函数。

针对上述问题,Zhang等16提出了ETransformer(Efficient Transformer)层结构来弥补上述问题,模型结构见图3。在ETransformer中,为了提高MSA的效率,构建了一种高效的多头自注意力机制。EMSA与MSA相似,EMSA首先采用一组投影来计算Q。为了压缩模型所占的内存,将2维的输入令牌xRn×dm沿着空间维度重建为3维令牌,然后进行深度卷积运算DWConv,通过空间压缩因子s将高度和宽度维度降低。将空间维度缩小后的新标记图重塑为2维标记图,再输入到两组投影中计算KV。在获得QKV之后,采用式(1)来计算QKV上的注意力函数。

EMSA(Q,K,V)=IN(Softmax(conv(QKdk)))V

其中conv()是标准的1×1卷积操作,用于建模不同头之间的交互。因此每个头的注意力函数可以依赖于所有的键K和查询Q。为增强不同位置联合关注不同表示子集信息的多样性能力,对Softmax之后的点积矩阵添加实例归一化IN(),最后将每个头的输出值连接起来并进行线性投影形成最终的输出。

ETransformer编码器由EMSA和MLP组成,将向量化的图像块xpi通过线性投影映射在D维嵌入空间中。为了编码图像块的空间信息,通过学习特定的位置嵌入将其添加到补丁嵌入中来保留位置信息,具体实现见式(2),其中ER(P2C)×D是补丁嵌入的投影矩阵,EposRN×D表示位置嵌入矩阵。

z0=xp1E;xp2E;;xpNE+Epos

编码器输出z1式(3),其中LN()为Layer Norm,表示层归一化算子。

z'=EMSA(LN(z0))+z0,z1=MLP(LN(z'))+z'

在计算成本方面,依赖于深度卷积操作,EMSA相较于MSA实现了计算成本的压缩,其中MSA的计算成本公式为O(2dmn2+4dmn2),改进后的EMSA的计算成本公式见式(4),其中s是空间压缩因子。对比可知,当s>1时EMSA的计算成本低于MSA,尤其是在s较大时效果更显著。

O(2dmn2/s2+2dm2n(1+1/s2)+dmn(s+1)2/s+k2n2/s2)

在性能上,EMSA相比MSA具备更好的注意力头交互建模能力。在MSA 中每个头仅负责嵌入维度的一个子集,而EMSA 通过引入1×1卷积操作来建模不同头之间的交互,使每个头的注意力函数能依赖所有的键和查询,同时通过实例归一化增强不同头的多样性,提高算法对喉道特征的关注。

2.3 GAB模块

GAB模块是由Ruan等17在EGE-UNet网络中提出了关键模块,用于多尺度的特征融合,通过将低层特征、高层特征以及解码器生成的掩码信息相结合,利用分组和空洞卷积提取不同尺度的信息,从而有效针对目标大小和形状的多样性,融合多尺度特征,具体实现见图4。为了实现不同特征之间的融合,使用深度可分离卷积和双线性插值调整高级特征的大小18,使其与低级特征的大小匹配,然后沿通道维度将两个特征图两两组合划分为4组,并将低级特征中的一组与高级特征中的一组以及解码器端获取的掩码信息连接起来,得到4组融合特征。对不同组应用核大小为3、膨胀率分别为{1,2,5,7}的膨胀卷积,以提取不同尺度的信息。最后,沿通道维度连接这4组特征,采用1×1卷积实现不同尺度特征之间的交互。

2.4 算法整体概述

本文算法处理完整铸体薄片图像的流程如图5所示,输入的图像为标注了孔隙信息为黄色的铸体薄片图像,对分辨率大于512×512的输入图像,以512×512为裁剪尺寸,重叠部分为256移动裁剪区域,将原始图像裁剪为GAB-ETransUNet网络的输入图像,通过网络得到预测结果后再按照裁剪顺序合并为完整图像,合并时,重叠部分取两个重叠图像的逻辑或结果,即可获得最终的预测图像。

3 实验与结果分析

3.1 数据集处理

本文实验数据集的建立基于显微镜采集的400张分辨率为3456×2304的岩石铸体薄片图像及其对应的孔隙提取结果,其中400张岩石铸体薄片来自400个不同的岩心样本,在铸体薄片图像上用黄色标注孔隙提取结果,并将标记孔隙后的图像作为数据集的原图。根据原图制作了对应的喉道标签图,通过裁剪原图以及标签图从中获取5500张大小为512×512的图像,按照8∶1∶1的比例分配,即4400张训练集,550张验证集,550张测试集。数据集中的原图与标签图见图6,其中标签图中的白色像素部分代表喉道识别目标。

3.2 实验设置

本文实验基于Linux系统下Pytorch1.13.1,Cuda11.7的开发环境,硬件环境及相关的实验参数见表1

3.3 评估指标

为了评估本文方法在喉道识别的可行性,对识别结果与真实值采用混淆矩阵中的真正例TP,假正例FP,假反例FN,真反例TN 指标进行统计。TP 指喉道识别预测与标签均为正类的像素点数;FP 指预测为正类但标签为负类的像素点数;FN 指预测为负类但标签为正类的像素点数;TN 指预测与标签均为负类的像素点数。基于以上统计结果,采用图像分割中常用的4个评价指标来进行不同模型性能的比较:Dice系数、召回率(Recall)、精确率(Precision)、F1分数(F1-Score)。公式见式(5)~式(8),其中式(8)中的SPrecision(i)SRecall(i)分别表示第i组预测结果与标签图计算得到的精确率和召回率,N表示共有N组图像。

SDice=2TP2TP+FP+FN
SRecall=TPTP+FN
SPrecision=TPTP+FP
MF1Score=1Ni=1N2×SPrecision(i)×SRecall(i)SPrecision(i)+SRecall(i)

上述指标在喉道识别结果的评估上存在一定缺陷,由于喉道的提取主要关注的是两个孔腔之间变窄的连接部分,识别的好坏与正类像素点的重合程度并不完全成正比。例如存在预测结果的喉道区域面积与标签中的喉道区域面积大小不同,但是预测结果实际提取出了两个孔腔的连接处属于正确识别的情况,而式(5)~式(8)中的指标都受像素点的重合情况影响。因此本文还针对预测结果是否处于人工划定标签图的所处位置进行统计。参考邓亮提出的喉道识别客观评价标准7,引入正确识别率CR、欠识别率UR以及误识别率OR等3个客观指标,公式见式(9)~式(11)。其中R为标签中人工标注的喉道数量;T为预测与标签一致的正确识别数;O为预测比标签多识别出的喉道数量(误识别数);U为标签有标注但预测未识别出的喉道数量(欠识别数)。基于这3个评估指标有利于对喉道识别效果做更准确的评判。

SCR=TR×100%
SOR=OO+R×100%
SUR=UU+R×100%

3.4 损失函数

本文采用的损失函数是Dice+BCE损失函数,如式(14)所示,结合了Dice损失函数和二分类交叉熵BCE损失函数19。Dice损失函数用于衡量喉道预测结果和真实标签之间的相似性,BCE损失函数用于衡量预测结果的准确性。Dice损失函数见式(12),其中yi为第i个样本的真实标签,y^i为模型预测的第i个样本为正类的概率,ε为防止除零的平滑项,设为1E-5。BCE损失函数见式(13),其中N为样本数量。

LDice=1-2i=1Nyiy^i+εi=1Nyi+i=1Ny^i+ε
LBCE=-1Ni=1N[yilog(y^i)+(1-yi)log(1-y^i)]
LDice+BCE=0.5LDice+0.5LBCE

3.5 对比实验

为了验证本文方法的可行性,分别在EGE-UNet16、VM-UNet20、Nested-UNet21、UC-TransNet22、UD-TransNet23、本文方法等算法上进行对比实验。其中Dice、Recall、Precision和F1-Score等4个指标为测试集中550张512×512图像预测结果与实际标签图计算得到的数值,CR、OR、UR等3个指标为数据集外20张3456×2304铸体薄片图像的预测结果与标签图的计算结果。预测结果图像如图7所示,为了便于观察,将算法获取的喉道识别结果图的白色像素转为红色叠加到原图上。

表2可知,本文方法虽然在CR上不为所有方法中最高,但是综合全部参数在所有方法中的性能表现最优,OR为所有方法中最低,Dice、Precision、F1-Score为所有方法中最高。本文方法相比于EGE-UNet在OR上降低了2.23%,在Dice、Precision、F1-Score上分别提升了4.98% 、5.62%、5.75%;相比于VM-UNet在OR上降低了8.06%,在Dice、Precision、F1-Score上分别提升了9.51%、2.16%、9.67%;相比于Nested-UNet在OR上降低了9.65%,在Dice、Precision、F1-Score上分别提升了6.11%、3.07%、6.09%;相比于UC-TransNet在OR上降低了6.58%,在Dice、Precision、F1-Score上分别提升了3.25%、1.88%、3.89%;相比于UD-TransNet在OR上降低了12.88%,在Dice、Precision、F1-Score上分别提升了7.51%、19.01%、8.51%。

结合图8中的识别结果对不同方法的喉道识别表现进行分析。EGE-UNet的正确识别率相对较低,但其抑制误识别的效果较好,OR仅为11.69%;VM-UNet的CR与Recall为所有方法中最低,正确识别效果最差,从图8可以观察出该算法存在许多欠识别;Nested-UNet的整体识别效果比前两种方法有一定提升,但是误识别的情况也增多了;UC-TransNet正确识别结果相较于前3种方法有较大提升,但是抑制误识别不如EGE-UNet,同时无法识别一些细小孔隙连接处的喉道;UD-TransNet的CR、Recall为所有方法中最高,UR为最低,说明其正确识别喉道的能力最强,然而缺点是OR高达22.34%,结合图像可以看出误识别较明显,欠识别少、误识别多导致该算法Recall最高的同时Precision最低;虽然本文方法的CR和UR略低于UD-TransNet(CR相差1.21%,UR相差0.87%),但UD-TransNet的OR比本文方法高12.88%,这表明本文方法在保持较高正确识别率的同时,显著减少了误识别问题。通过图8可以直观看出,本文方法的识别结果与Ground Truth最为接近,边界清晰且连续性好,因此在喉道识别的应用上综合性能更优。

本文还在实验中对MSA、BRA(Bi-level Routing Attetion)24、EMA(Efficient Multi-scale Attetion)25、EMSA等不同注意力机制在基准网络上的效果进行了对比实验,为了对比不同注意力机制的性能,下面引入热力图作为可视化工具。热力图是通过颜色梯度展示模型关注区域的工具,越接近红色代表高关注度,越接近蓝色代表低关注度,能将抽象特征转化为视觉形式,辅助分析模型效果26。以TransUNet为基准架构,将网络中12级Transformer层的多头自注意力机制MSA分别更换为BRA、EMA、EMSA,在解码器第一层对热力图进行可视化。不同注意力机制下的热力图见图9,观察可知相比于MSA、BRA、EMA,采用EMSA的网络输出的热力图更精细,在喉道附近呈现为深红色,说明对喉道信息的关注程度更高;在岩石、孔腔附近呈现为蓝色和黄绿色,说明对非目标信息的关注程度更低。

对更改不同注意力机制的算法进行实验,通过表3的实验结果可知,EMSA的UR为所有方法中最低,CR、Dice、Precision、F1-Score为所有方法中最高。上述指标表示EMSA对喉道信息的关注度比其他注意力机制更高,喉道正确识别效果与抑制误识别的效果比MSA和BRA更好。虽然EMSA的误识别率比EMA高了1.53%,但是在欠识别率上降低了1.59%,正确识别率提升了3.21%,说明其在正确识别喉道的性能上更有优势。

3.6 消融实验

为了验证本文所采用的各项模块对喉道识别的提升效果,本文进行了消融实验,实验结果见表4。本文方法GAB-ETransUNet在修改Transformer为ETransformer和添加GAB的情况下,UR、OR为所有方法中最低,CR、Dice、F1-Score为所有方法中最高。相比于基准网络TransUNet,GAB-ETransUNet在UR、OR上分别降低了4.22%、3.82%,在CR、Dice、F1-Score上分别提升了5.99%、3.24%、4.26%,验证了修改后模型的有效性。对比增加了GAB与不加GAB的结果发现,增加了GAB模块有利于降低喉道识别的误识别率,说明GAB模块在多尺度特征融合上有利于减少模型对非目标部分的误识别情况。

3.7 模型复杂度及推理时间对比

为公平比较不同模型的Flops(Floating Point Operations)、参数量Params以及推理时间,本文在同一实验环境中,同时对不同模型推理预测550张分辨率为512×512的测试集图像的运行结果进行了记录,见表5。EGE-UNet由于其轻量化设计在复杂度对比中表现最优,推理时间也最短,仅需7.49 s,然而其识别效果是最差的。对比Nested-UNet、UC-TransNet、UD-TransNet这些非轻量化模型,本文方法在Flops上优于这些算法,下降到了100 G以下。在推理时间上,本文方法的21.97 s比UC-TransNet与UD-TransNet都更快。将基准网络TransUNet与本文改进后的GAB-ETrans UNet进行对比,Flops由129.26 G下降为99.95 G,降低了22.7%;Params由93.23 M下降为64.88 M,降低了30.1%;推理时间上TransUNet为28.98 s,GAB-ETransUNet为21.97 s,降低了24.2%;实现了计算成本的降低,验证了ETransformer模块的有效性。

4 结论

本文提出了一种基于TransUNet构建的GAB-ETransUNet网络模型,用于岩石铸体薄片图像喉道识别。通过将Transformer层修改为ETransformer结构,降低了计算成本,增强了对喉道特征的关注;引入GAB模块,有效提升了多尺度特征融合能力,减少了误识别现象。在对比实验中,本文方法正确识别率高且误识别率低,识别结果与真实情况最为接近。消融实验以及模型复杂度实验进一步证明了ETransformer和GAB模块在提升模型性能方面的关键作用。当前研究仍存在局限性:由于喉道数据集的稀缺性,本文仅在单个数据集上训练及验证,后续为了提高模型的泛化能力需要构建更多数据集,在更多样的数据集上进行验证。同时对于一些较极端的喉道特征,如高度分叉或被孔腔边缘模糊包裹的情况,模型仍存在欠分割与边界界定偏差的问题,后期考虑设计更精细的注意力机制来捕捉特征,进一步推进算法的实际应用。

参考文献

[1]

Fakhimi AAlavi Gharahbagh E.Discrete element analysis of the effect of pore size and pore distribution on the mechanical behavior of rock[J].Int J Rock Mech Min Sci201148(1): 77-85.

[2]

Gong YLiu K.Pore throat size distribution and oiliness of tight sands-A case study of the Southern Songliao Basin, China[J].J Petrol Sci Eng2020184: 106508.

[3]

Professional Standardization Technical Committee for Oil and Gas Field Development. Determination of Rock Pore Structure Characteristics by Image Analysis Method: SY/T 6103-2004 [S]. Beijing: National Development and Reform Commission, 2004: 1.

[4]

油气田开发专业标准化技术委员会. 岩石孔隙结构特征的测定图像分析法: SY/T 6103-2004 [S].北京:国家发展和改革委员会, 2004: 1.

[5]

Tavanaei ASalehi S.Pore, throat, and grain detection for rock sem images using digitalwatershed image segmentation algorithm[J].J Por Media201518(5): 507-518.

[6]

Tu B YXiong S HTeng Qet al.Throat segmentation algorithm for rock cast thin section images[J].Modern Computer2018630(30): 22-27.

[7]

涂秉宇, 熊淑华, 滕奇志, .岩石铸体薄片图像的喉道分割算法[J].现代计算机2018630(30):22-27.

[8]

Cai Y H.Research on algorithms for pore and grain size analysis in cast thin section images [D].Chengdu:Sichuan University, 2021.

[9]

蔡宇恒.铸体薄片图像孔隙及粒度分析相关算法研究[D].成都:四川大学, 2021.

[10]

Ronneberger OFischer PBrox T.U-Net: Convolutional networks for biomedical image segmentation [M]//Medical Image Computing and Computer-assisted Intervention-MICCAI 20152015: 234-241.

[11]

Zeiler M DKrishnan DTaylor G Wet al.Deconvolutional networks[C]//2010 IEEE Computer Society Conference on Computer Vision and Pattern Recognition, 2010: 2528-2535.

[12]

Chen JLu YYu Qet al.TransUNet: Transformers make strong encoders for medical image segmentation[PP/OL].[2025-07-22].

[13]

Liu MDan JLu Zet al.CM-UNet: Hybrid CNN-Mamba UNet for remote sensing image semantic segmentation[PP/OL].[2025-08-19].

[14]

Kirillov AMintun ERavi Net al.Segment anything[C]//2023 IEEE/CVF International Conference on Computer Vision (ICCV), 2023: 3992-4003.

[15]

Deng L.Research on image analysis and processing of microscopic macro-model displacement [D].Chengdu:Sichuan University, 2022.

[16]

邓亮.微观大模型驱替图像分析与处理研究[D].成都:四川大学, 2022.

[17]

Yue F YHe X HTeng Q Zet al.A throat segmentation algorithm for cast thin section images based on improved UNet++ [J].New Generation of Information Technology20236(23): 15-22.

[18]

岳枫云, 何小海, 滕奇志, .基于改进UNet++的铸体薄片图像喉道分割算法[J].新一代信息技术20236(23): 15-22.

[19]

Chen JMei JLi Xet al.TransUNet: Rethinking the U-Net architecture design for medical image segmentation through the lens of transformers[J].Med Image Anal202497: 103280.

[20]

Moller M.Efficient training of feed-forward neural networks[M]//Neural Network Analysis, Architectures and Applications.Boca Raton: CRC Press, 2024: 136-173.

[21]

Zhang QYang Y B.Rest: An efficient transformer for visual recognition[J].Advances in Neural Information Processing Systems202134: 15475-15485.

[22]

Ruan JXie MGao Jet al.Ege-unet: An efficient group enhanced unet for skin lesion segmentation [C] //International Conference on Medical Image Computing and Computer-assisted Intervention, 2023: 481-490.

[23]

Howard A GZhu MChen Bet al.Mobilenets: Efficient convolutional neural networks for mobile vision applications[PP/OL].[2025-08-05].

[24]

Su JLiu ZZhang Jet al.DV-Net: Accurate liver vessel segmentation via dense connection model with D-BCE loss function[J].Knowl Based Syst2021232: 107471.

[25]

Ruan JLi JXiang S.Vm-unet: Vision mamba unet for medical image segmentation[PP/OL].[2025-08-12].

[26]

Zhou ZSiddiquee M M RTajbakhsh Net al.UNet++: Redesigning skip connections to exploit multiscale features in image segmentation[J].IEEE Trans Med Imaging202039(6): 1856-1867.

[27]

Wang HCao PWang Jet al.UCTransNet: Rethinking the skip connections in U-Net from a channel-wise perspective with Transformer[J].Proceedings of the AAAI Conference on Artificial Intelligence202236(3):2441-2449.

[28]

Wang HCao PYang Jet al.Narrowing the semantic gaps in U-Net with learnable skip connections: The case of medical image segmentation[J].Neural Netw2024178: 106546.

[29]

Zhu LWang XKe Zet al.BiFormer: Vision transformer with bi-level routing attention[C]//2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2023: 10323-10333.

[30]

Ouyang DHe SZhang Get al.Efficient multi-scale attention module with cross-spatial learning [C]//ICASSP 2023 - 2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2023: 1-5.

[31]

Selvaraju R RCogswell MDas Aet al.Grad-CAM: Visual explanations from deep networks via gradient-based localization[C]//2017 IEEE International Conference on Computer Vision (ICCV), 2017: 618-626.

基金资助

国家自然科学基金(62071315)

四川省科技计划项目(2024ZYD0263)

AI Summary AI Mindmap
PDF (2841KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/