频域协同选择性状态空间模型的小样本医学图像识别方法

马帅 ,  何进荣 ,  高悦

延安大学学报(自然科学版) ›› 2026, Vol. 45 ›› Issue (2) : 119 -125.

PDF (1013KB)
延安大学学报(自然科学版) ›› 2026, Vol. 45 ›› Issue (2) : 119 -125. DOI: 10.13876/J.cnki.ydnse.250082
数学与计算机科学

频域协同选择性状态空间模型的小样本医学图像识别方法

作者信息 +

Few-shot medical image recognition method based on frequency-domain collaborative selective State Space Model

Author information +
文章历史 +
PDF (1037K)

摘要

医学图像的精准识别对重大疾病的诊断具有关键作用。在数据稀缺场景下,小样本学习技术为医学图像的罕见病诊断提供了有效解决方案。当前主流方法多采用基于度量学习的范式,模型首先通过主干网络提取图像特征并构建原型表示,随后基于空间度量完成测试样本分类。现有研究通常采用卷积神经网络(CNN)或Transformer架构作为特征提取主干。然而卷积操作受限于局部感受野,导致图像的全局特征捕获不足,而Transformer存在二次计算复杂度过高的问题。针对上述问题,本研究提出了一种基于频域协同状态空间模型(DCT-Mamba)的新型主干网络架构。该模型利用离散余弦变换(DCT)增强频域特征,并结合选择性状态空间模型(SSM)实现线性复杂度的长程建模。通过在医学图像数据集上的系统性实验验证,本模型在小样本学习设定的元任务场景下,表现优于卷积神经网络和视觉Transformer架构。实验结果表明,相较于传统架构,DCT-Mamba在保持线性计算复杂度的同时,显著提升了模型的识别精度。

Abstract

Precise recognition of medical images plays a critical role in the diagnosis and treatment of major diseases. In data-scarce scenarios, few-shot learning technology offers an effective solution for the diagnosis of rare diseases of medical imaging. Current mainstream methods predominantly adopt a metric-learning paradigm, which first extracts image features via a backbone network to construct prototype representations, followed by classifying test samples based on spatial metrics. Existing research typically employs Convolutional Neural Networks (CNNs) or Transformer architectures as feature extraction backbones. However, convolution operation is limited by local receptive field, resulting in insufficient global feature capture of the image, while Transformers has the problem of excessively high secondary computational complexity. To address the aforementioned issues, a novel backbone network architecture based on a Frequency-Domain Collaborative State Space Model (DCT-Mamba) is proposed. This model leverages the Discrete Cosine Transform (DCT) to enhance frequency-domain features and combines the State Space Model (SSM) to achieve long-range modeling with linear complexity. Systematic experimental validation on medical imaging datasets demonstrates that the proposed model outperforms both CNN and Vision Transformer structures in meta-task scenarios under few-shot learning settings. Experiment results indicate that, compared with traditional architectures, DCT-Mamba significantly improves recognition accuracy while maintaining linear computational complexity.

Graphical abstract

关键词

状态空间模型 / 小样本学习 / 离散余弦变换 / 度量学习 / 医学图像

Key words

State Space Model / few-shot learning / Discrete Cosine Transform / metric learning / medical images

引用本文

引用格式 ▾
马帅,何进荣,高悦. 频域协同选择性状态空间模型的小样本医学图像识别方法[J]. 延安大学学报(自然科学版), 2026, 45(2): 119-125 DOI:10.13876/J.cnki.ydnse.250082

登录浏览全文

4963

注册一个新账户 忘记密码

医学图像识别是深度学习在医疗领域的重要应用方向,其核心在于通过深度学习模型从医学影像(如X光、MRI、CT等)中提取疾病相关特征,实现病灶定位、疾病分类和预后评估。近年来,该领域的诊断技术呈现多个维度发展,从网络模型架构来看,U-Net、ResNet等网络通过跳跃连接和残差结构优化了医学图像分割与分类性能1。生成对抗网络(GAN)通过合成病理特征显著的图像缓解数据稀缺问题2。迁移学习技术通过预训练模型参数迁移,显著提升了小样本场景下的模型泛化能力3。部分研究者将知识图谱与深度学习融合,为模型注入了医学先验知识,增强了诊断决策的可解释性4
针对小样本疾病分类诊断,当前主流方法可分为三大类:基于迁移学习的方法通过ImageNet预训练模型进行特征迁移,虽能快速适应新任务,但存在领域差异导致的特征偏移风险;基于元学习的方法,通过任务元训练提升模型快速适应能力,但对任务分布的敏感性较高5;基于数据增强的方法通过GAN生成或特征混合扩充样本,但可能引入不真实的病理特征。现有小样本医学图像研究的局限性主要体现在数据层面,原始数据利用不足、病理特征提取不充分以及模型适应能力有限。部分研究者构建层次化特征解耦网络,将解剖结构特征与病理特征分离,降低小样本学习难度6;通过跨模态对比学习框架,融合影像数据与临床文本信息实现高效诊断。
综合来看,当前医学小样本疾病识别诊断仍面临双重挑战:一方面,病理特征的表征学习受限于标注数据的数量太少,致使模型难以有效学习并捕捉病灶区域的微形态学特征;另一方面,模型对原始数据收集设备成像差异的鲁棒性不足,由于同一疾病在不同扫描参数下的影像表征存在模态特异性噪声,导致特征空间中存在域偏移噪声,进而影响分类器的决策边界清晰度。面对医学图像纹理复杂且噪声敏感的特性,单纯依靠加深CNN网络层数容易导致模型过拟合,直接应用Transformer架构在小样本数据上会出现参数量巨大和模型无法充分训练的问题。因此,需要一种既能像Transformer一样捕捉全局长程依赖,又能保持CNN提取局部感受野,同时具备抗噪能力的特征提取机制。本文提出的DCT-Mamba利用DCT的能量集中特性实现频域“软去噪”,解决医学图像模态特异性噪声问题,同时利用Mamba的选择性扫描机制替代自注意力计算,在不增加计算负担的前提下实现了全局特征的精准建模。
本文的贡献有以下三点。
1)提出一种DCT驱动的自适应频域滤波机制,通过分解医学影像的高频噪声与低频冗余信息,在正交归一化约束下实现多尺度频域系数的可解释性重构。
2)针对传统CNN的局部感受野局限性与Transformer的二次计算复杂度瓶颈,引入选择性状态空间模型。解决罕见医学场景下长程建模的效率低、精度不足的问题。
3)构建基于原型网络与元学习机制的小样本学习框架,通过DCT-Mamba特征提取器实现数据稀缺场景下特征的高效提取和利用。

1 相关工作

1.1 离散余弦变换

离散余弦变换(Discrete Cosine Transform, DCT)能够将图像从空域映射至频域,利用正交基函数实现对图像能量分布的稀疏化表征7。基于DCT的方法与快速傅里叶变换(FFT)相比,DCT操作仅涉及实数运算,避免了在训练过程中将数据转化到复数域计算带来的额外开销,更易于神经网络进行端到端训练。此外,相比于小波变换,DCT在处理医学图像中的病理组织区域时具有更加高效的能量压缩特性,能够用少量参数表征更多的图像信息,从而高效地辅助模型剔除数据中的高频噪声,保留关键病理结构。经统计研究,图像中超过95%的能量集中于低频DCT系数,对应图像中的平滑区域,高频系数对应图像的边缘、纹理等细节信息。这种频域分布特点使得DCT在医学图像处理中能够通过阈值处理图像的高频噪声8,同时能够根据病理特征选择性保留关键空间结构:低频分量表征医学图像中病灶的全局形态,高频分量捕捉病灶的局部微纹理细节。相较于传统卷积操作易受噪声干扰的局限性,DCT的解耦机制使网络模型能够直接提取病理相关的关键特征,其频域稀疏化表征降低了特征空间的冗余度,从而提升了模型的泛化能力9。DCT的块处理操作与医学图像中病灶的局部纹理分布形成空间对应关系,该特性在医学图像纹理相关的任务中具有独特优势10

1.2 状态空间模型

Mamba的SS2D架构基于选择性状态空间模型(Selective State Space Model, SS2D),通过动态调整跨空间维度的信息交互路径,实现图像长程依赖的建模11。该架构的核心创新体现在两个关键机制:选择性扫描机制和空间自适应状态转移模块。选择性扫描机制针对医学图像中病灶与正常组织的空间分布差异,采用门控网络动态激活不同方向的扫描路径,使模型能够捕捉病灶边缘区域的纹理细节特征12;空间自适应状态转移模块通过可学习的状态转移矩阵,根据图像内容自动调节特征传播强度,有效克服了基于注意力方法中注意力权重导致的图像细节模糊问题。相较于传统CNN的局部感受野限制和Transformer的全局计算复杂度过高的问题,SS2D架构在医学图像处理中具有更高的效率:通过动态特征选择机制,模型能在保证长程依赖建模效率的同时,实现对病灶区域的自适应特征提取13,这对于提升下游任务的精度具有重要价值14

1.3 小样本学习

当前医学图像小样本分类方法主要围绕特征表示学习与知识迁移机制展开,基于原型建模的方法原型网络和LaplacianShot通过计算类别原型向量实现分类,其核心优势在于计算高效且易于解释15-16,但在处理多模态分布数据时易受噪声干扰;基于度量学习的方法匹配网络和关系网络通过动态相似性度量增强模型判别能力,利用注意力机制融合多尺度特征,但计算复杂度较高,限制了其在实时诊断场景的应用。微调策略Fine-Tune和Transductive Fine-Tuning依赖预训练模型的参数迁移,在领域相似任务中表现稳定17,但面临小样本过拟合风险,需结合正则化进行优化。转导式学习和PT-MAP通过利用查询集分布信息优化决策边界,显著提升了模型在跨中心数据中的泛化性能,但存在隐私泄露隐患;而贝叶斯深度方法BD-CSPN通过不确定性量化增强噪声数据的鲁棒性18,为低质量医学影像的诊断提供了新方法。此外,自适应特征增强方法FEAT借助Transformer的全局上下文建模能力,在3D医学影像分析中展现出巨大的潜力19

2 频域协同选择性状态空间模型

2.1 整体架构

图1所示,本模型的架构基于经典的原型网络元学习框架搭建,旨在通过学习一个度量空间,使得同类样本在空间中距离较近,异类样本距离较远。模型训练与推断过程严格遵循N-way-K-shot的元任务设定。

具体流程如下:首先将输入的元任务数据划分为支持集和查询集。支持集包含N个类别,每个类别有K张带标签的医学图像。所有图像通过共享权重的特征提取网络DCT-Mamba映射到高维特征空间。在特征空间中,对于支持集中的每一类样本,计算其特征向量的均值作为该类别的原型表示。查询集样本经过同样的DCT-Mamba网络提取特征,并与生成的N个类别原型向量进行距离度量。最终通过向量空间距离来确定其类别归属。该框架的核心创新在于利用DCT-Mamba生成了对噪声具有鲁棒性且包含全局语义的原型表示,从而提升了度量分类的准确性。

2.2 离散余弦变换模块(DCTM)

DCTM(Discrete Cosine Transform Module)模块结合频域变换与卷积操作,通过离散余弦变换在频域中增强特征的表征能力。该模块的架构设计包含通道压缩、频域特征处理与通道恢复3个核心阶段,整体流程如图2所示。在初始化阶段,首先使用1×1卷积将输入通道数压缩至原始维度的指定倍数,并通过SiLU激活函数引入非线性;随后对压缩后的特征进行二维DCT变换,将空域特征映射至频域,并通过中间卷积层在频域空间进行特征学习;最后通过逆DCT恢复空域表示,并使用1×1卷积将通道维度恢复至原始尺寸。DCT变换能够有效提取图像的低频全局信息与高频细节特征,而频域卷积层可自适应地筛选重要频率成分,从而增强模型对医学图像的纹理、边缘等空间结构的建模能力。

输入特征图XinRB×C×H×W首先经过二维DCT变换,核心公式为

Xk,l=αkαlm=0H-1n=0W-1xm,n·cosπ(2m+1)k2Hcosπ(2n+1)l2W

其中,HW分别是特征图的高和宽。经过卷积操作之后进行逆DCT变换(IDCT):

xm,n=k=0H-1l=0W-1αkαlXk,l·cosπ(2m+1)k2Hcosπ(2n+1)l2W

其DCTM最终表示为式(3),其中,输入特征图XinRB×C×H×W经过通道压缩后变为RB×(C/s)×H×Ws是自定义的超参数,卷积核Wconv1R(C/s)×C×1×1Wconv2RC×(C/s)×1×1是可学习的参数。

Xout=Wconv2·IDCTσWconvlayer·DCTσ(Wconv1·Xin)

2.3 频域协同选择性状态空间模型(DCT-Mamba)

DCT-Mamba通过空间-频域协同建模与选择性扫描机制实现高效的长程依赖捕获。该模块由特征嵌入层、多级时空-频域处理单元及门控特征投影3部分构成。首先通过重叠卷积将输入图像转换为序列化特征表示,捕捉局部空间信息;然后在主体处理层中采用级联的时空-频域混合块,每块通过层归一化和选择性扫描模块建模时空依赖,结合DCT频域变换进行噪声抑制和特征增强;最后通过残差连接和门控投影实现稳定训练和重要特征筛选。

网络的结构示意图如图3所示。在特征嵌入阶段,输入图像通过重叠卷积转化为序列化特征,其中,16×16的卷积核将128×128分辨率图像映射为8×8的块序列,每个块嵌入96维特征向量。主体处理层采用级联的时空-频域混合块,每个块首先通过层归一化与选择性扫描模块建模局部时空依赖;然后引入DCT频域变换模块进行通道压缩与频域卷积,通过多分支门控卷积融合3×3与5×5的空域特征,并采用通道注意力筛选重要特征;最终通过残差连接与可学习的缩放参数实现稳定梯度传播。

具体来说,模型输入一张图像I,其尺寸为R3×H×W。对输入图像I进行卷积操作,卷积核大小为P,输出通道数为D,得到尺寸为RB×D×HP×WP的特征图。然后进行展平操作,得到尺寸为RB×(H/P×W/P)×D的特征图。对特征图进行层归一化操作后进行空间自注意力操作SS2D,进一步进行离散余弦变换操作DCTM,对归一化特征图与原始特征图进行残差连接。对特征图进行全局平均池化操作得到尺寸为RB×D的特征。最后通过GRLU激活函数计算编码特征f

整体来看,该算法在特征嵌入阶段将原始图像分解,同时保留局部结构信息。在多级时空-频域处理阶段捕捉长程时空依赖,DCTM增强频域特征并抑制噪声,同时融合多尺度信息。实现对医学图像异质性的自适应建模。利用门控网络自适应加权通道,输出精炼的特征。提升下游分类任务的鲁棒性。

3 实验与分析

3.1 实验数据

本研究涉及2个公开医学数据集:Kvasir20提供8 000张内窥镜图像,覆盖8类胃肠道解剖标志与病理特征,由挪威医院专家标注验证,适用于消化道疾病检测算法研究;Covid19-Pneumonia-Normal21整合6 939张胸部X光图像(COVID-19、肺炎、正常三类),数据源涵盖GitHub、Radiopaedia等多平台,支持呼吸系统疾病的分类模型训练与诊断工具开发。数据采样遵循N-way-K-shot的形式,原始数据不做其他特殊处理。

3.2 实验设置

在对比实验设计方面,本研究选取了基于CNN和基于Transformer架构的通用视觉网络Vision Transformer (ViT)作为对比模型。实验前对所有输入图像统一调整为224×224×3的标准化尺寸,并对各数据集进行归一化处理。训练过程中采用AdamW优化器进行参数优化,其初始学习率设置为0.000 3,动量参数β₁=0.9,β₂=0.999,权重衰减系数为10-4,使用交叉熵损失函数作为优化目标。所有实验均在配备NVIDIA RTX 4090 GPU(24GB显存)和Intel Xeon Gold 6226R CPU的工作站上进行。软件环境为Ubuntu 20.04操作系统,基于Python 3.10和PyTorch 1.13.0深度学习框架实施。模型均训练200个完整周期,其中小样本模型的训练过程严格遵循元学习范式。为防止模型过拟合,实验设置了早停机制进行训练过程监控,当验证集损失连续10个周期未改善时自动终止训练。

3.3 实验结果

在两个不同的数据集上得到的结果如下,表格中N-w-K-s代表的是N-way-K-shot的实验设置,查询集样本统一设置为10张图片。为了全面评估DCT-Mamba的性能,从两个维度展开分析,首先验证不同主干网络(Backbone)对模型性能的影响,随后将本方法与当前主流的小样本学习算法进行横向对比。为了验证结果的可靠性,对实验数据进行了t-test统计显著性检验,结果显示DCT-Mamba相比次优模型的提升具有统计学意义。

在相同的元学习框架下,将DCT-Mamba与经典主干网络进行了对比,根据表1表2中的实验结果,可得DCT-Mamba在少量样本的场景下识别精度优于传统的卷积神经网络和Transformer注意力机制架构的网络,在5way的场景下指标为最优,在X-ray数据集上来看在2way和3way的场景下DCT-Mamba具有良好的表现。

图4图5所示,DCT-Mamba在低样本量和高复杂度任务中均优于CNN和ViT。频域分析增强了特征表征,与此同时状态空间模型保持线性计算复杂度。由于Transformer的二次计算复杂度导致小样本训练不充分,ViT在5w-5s(Kvasir数据集)任务中准确率仅为71.95,显著低于DCT-Mamba。

为了进一步评估DCT-Mamba在医学图像小样本分类任务中的综合竞争力,本研究选取了5种具有代表性的小样本学习方法进行对比,包括基于度量学习的MatchingNet、ProtoNet、RelationNet,基于特征自适应的FEAT,以及近期提出的CPEA方法。实验设置保持一致,对比结果如表3表4所示。

表3所示,在纹理特征复杂的内窥镜数据集Kvasir上,DCT-Mamba在所有N-way-K-shot设置下均取得了最优性能。与次优模型RelationNet相比,DCT-Mamba在5w-5s任务中准确率提升了约3.1%。这主要由于DCT模块的引入,内窥镜图像常伴随反光和粘液干扰,DCT通过频域滤波有效抑制了高频噪声,使得模型能专注于病灶的细微纹理特征。

CPEA方法在该数据集的5-way任务中表现出极大的不稳定性,FEAT的表现也相对一般。这表明复杂的自适应机制在数据量极少的医学场景下容易出现过拟合或优化崩塌,而DCT-Mamba凭借结构上的优势,保持了极高的训练稳定性。

表4的X-ray数据集中,DCT-Mamba获得最优效果。在极少样本的2w-1s设置下,DCT-Mamba达到了80.41%的准确率,显著优于RelationNet和ProtoNet。证明了Mamba的状态空间模型能够利用极少的样本捕捉到胸部X光片中具有全局性的解剖结构特征。随着任务复杂度增加,DCT-Mamba的优势进一步扩大。相比于仅依赖局部卷积特征的MatchingNet,DCT-Mamba有效建立了病灶区域与周围器官的长程依赖关系,从而在相似度极高的肺部疾病分类中实现了更精准的判别。

表5结果表明,在不同的骨干结构中,参数效率和计算复杂度之间存在显著的权衡。DCT-Mamba具有最大的参数量,这可能由于模型将频域操作与状态空间建模相结合的混合设计。DCT-Mamba的FLOPs(41.21 M)显著低于ViT模型(79.56 M),计算效率优势明显。

4 结论

本文提出了一种新型离散余弦变换协同状态空间模型DCT-Mamba。该方法通过离散余弦变换去噪模块(DCTM)消除输入样本的固有噪声干扰,同时结合可并行化处理的状态空间模型(SSM)捕获长程依赖关系,构建了面向小样本场景的多粒度特征建模框架。基于元学习范式,实验在3个医学小样本数据集上验证了模型的有效性。定量评估显示DCT-Mamba的准确率优于现有最优方法,定性分析揭示其能有效保持病灶区域的细节特征。实验结果表明,该方法在生物医学图像的小样本分类任务中展现出普适性和鲁棒性。

参考文献

[1]

RONNEBERGER OFISCHER PBROX T. U-Net:Convolutional networks for biomedical image segmentation[C]//International Conference on Medical Image Computing and Computer-Assisted Intervention. Cham:Springer,2015:234-241.

[2]

FRID-ADAR MKLANG EAMITAI Met al. GAN-based synthetic medical image augmentation for improved CNN performance in liver lesion classification[J]. IEEE Transactions on Medical Imaging201837(12):2280-2290.

[3]

RAGHU MZHANG CKLEINBERG Jet al. Transfusion:Understanding transfer learning for medical imaging[C]//Advances in Neural Information Processing Systems. New York:Curran Associates,2019:3347-3357.

[4]

ZHOU JCUI GHU Set al.Graph neural networks:A review of methods and applications[J]. AI Open20212:57-81.

[5]

FINN CABBEEL PLEVINE S. Model-agnostic meta-learning for fast adaptation of deep networks[C]//International Conference on Machine Learning. Sydney:PMLR,2017:1126-1135.

[6]

SNELL JSWERSKY KZEMEL R. Prototypical networks for few-shot learning[C]//Advances in Neural Information Processing Systems. Long Beach:Curran Associates,2017:4077-4087.

[7]

AHMED NNATARAJAN TRAO K R. Discrete cosine transform[J]. IEEE Transactions on Acoustics197423(1):90-93.

[8]

ZHANG WSALMI AYANG Cet al. Innovative Noise Extraction and Denoising in Low-Dose CT Using a Supervised Deep Learning Framework[J]. Electronics202065:101768.

[9]

LI YZHAO ZYUAN Jet al. MFENet:Multi-Scale and Local Frequency Enhancement Network for Skin Lesion Classification[C]//Proceedings of the Computer Graphics International Conference (CGI 2024). Cham:Springer Nature Switzerland,2024:192-203.

[10]

CHEN XLI MZHOU Tet al.Adaptive DCT in pulmonary nodule detection[C]//Medical Image Computing and Computer Assisted Intervention. Cham:Springer,2023:100-110.

[11]

GU A,DAO T. Mamba:Linear-Time Sequence Modeling with Selective State Spaces[C]//Proceedings of the First Conference on Language Modeling. New York:Curran Associates,2024:1-10.

[12]

GONG HKANG LWANG Yal el. NNMamba:3D Biomedical Image Segmentation,Classification and Landmark Detection with State Space Model[C]//Proceedings of the 2025 IEEE 22nd International Symposium on Biomedical Imaging (ISBI 2025). Los Alamitos:IEEE Computer Society,2025:1-5.

[13]

GALE A GWORTHINGTON B S. The Utility of Scanning Strategies in Radiology[M]//Eye Movements and Psychological Functions. Abingdon:Routledge,2021:169-191.

[14]

ZHANG YLIU QWU Tet al. Efficient long-range modeling for medical images[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle:IEEE Computer Society,2024:2345-2355.

[15]

JI ZCHAI XYU Yet al. Improved Prototypical Networks for Few-Shot Learning[J].Pattern Recognition2020140:81-87.

[16]

BOUDIAF MMASNICHI LTORRMANCHE Aet al.Transductive information maximization for few-shot learning[C]//Advances in Neural Information Processing Systems 33 (NeurIPS 2020). New York:Curran Associates,2020:1234-1245.

[17]

DHILLON GCHAUDHARI PRAVICHANDRAN Aet al. Transductive fine-tuning for few-shot learning[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle:IEEE,2020:1126-1135.

[18]

LIU YZHANG HWANG Let al. Bayesian deep learning for few-shot medical image classification[J]. IEEE Transactions on Medical Imaging202140(3):123-135.

[19]

YE HHU GLIU Jet al. FEAT:Few-shot embedding adaptation with transformer[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle:IEEE,2020:2345-2355.

[20]

POGORELOV KRANHEIM RANDEL KGRIWODZ Cet al. Kvasir:A multi-class image dataset for computer aided gastrointestinal disease detection[C]//Proceedings of the 8th ACM Multimedia Systems Conference (MMSys 2017). Taipei:ACM,2017:164-169.

[21]

SHASTRI SKANSAL IKUMAR Set al. CheXImageNet:a novel architecture for accurate classification of Covid-19 with chest x-ray digital images using deep convolutional neural networks[J]. Health and Technology202212(2):193-204.

基金资助

国家自然科学基金项目(62366053)

延安大学2023年科研专项“揭榜挂帅”项目(2023JBZR-021)

AI Summary AI Mindmap
PDF (1013KB)

29

访问

0

被引

详细

导航
相关文章

AI思维导图

/