基于改进MobileViT的观赏鱼品种分类模型研究

徐文丁 ,  王鹤榕 ,  于辉辉 ,  陈英义

中国农业大学学报 ›› 2026, Vol. 31 ›› Issue (9) : 24 -35.

PDF (2187KB)
中国农业大学学报 ›› 2026, Vol. 31 ›› Issue (9) : 24 -35. DOI: 10.11841/j.issn.1007-4333.2026.09.03

基于改进MobileViT的观赏鱼品种分类模型研究

作者信息 +

PETFish-MViT: A novel classification model of ornamental fish based on improved MobileViT

Author information +
文章历史 +
PDF (2239K)

摘要

为解决观赏鱼精细分类困难的问题,本研究基于MobileViT模型构建了PETFish-MViT模型。通过引入互标记增强模块优化注意力分配,重构特征融合结构,并采用标签平滑损失函数,提升模型对观赏鱼的分类性能,缓解数据分布不均问题。结果表明:1)模型在自建观赏鱼数据集上分类准确率达到了91.4%,F1值达到90.7%,相比原始MobileViT模型准确率提高2.8%,F1值提高2.8%;2)在公开数据集WildFish上进行测试,准确率达到77.0%,表明PETFish-MViT模型具有一定的泛化性能。综上,该模型可以为观赏鱼爱好者提供一种分类手段和工具,在观赏鱼产业中发挥重要作用。

Abstract

To solve the problem of difficulty in fine classification of ornamental fish, this study conducted a PETFish-MViT model based on MobileViT. By introducing a mutual labeling enhancement module to optimize attention allocation, reconstruct the feature fusion structure, and adopt a label smoothing loss function, the model’s classification performance for ornamental fish is improved, alleviating the problem of uneven data distribution. The results showed that:1) The classification of the model on the self-built ornament fish data reached 91.4%, with an F1 value of 90.7%. Compared to the original model, the accuracy increased by 2.8%, and the F1-score increased by 2.8%. 2) On the public dataset WildFish test, the model achieves accuracy rate of 77.0%, indicating that the PETFish-MViT model exhibits certain generalization performance. In summary, this model can provide a classification method and tool for ornamental fish enthusiasts, playing a significant role in the ornamental fish industry.

Graphical abstract

关键词

观赏鱼品种分类 / 深度学习 / Transformer / MobileViT

Key words

ornamental fish classification / deep learning / Transformer / MobileViT

引用本文

引用格式 ▾
徐文丁,王鹤榕,于辉辉,陈英义. 基于改进MobileViT的观赏鱼品种分类模型研究[J]. 中国农业大学学报, 2026, 31(9): 24-35 DOI:10.11841/j.issn.1007-4333.2026.09.03

登录浏览全文

4963

注册一个新账户 忘记密码

观赏鱼是世界上最重要的观赏动物之一,因色彩艳丽、形态优美而广受大众喜爱,具有可观的经济价值1。联合国粮食及农业组织截至2021年的统计表明,观赏鱼产业的全球贸易价值已达150亿~300亿美元2。对观赏鱼品种分类的研究不仅有助于加深人们对观赏鱼不同种类的了解,也有助于推进鱼类生态系统保护工作的开展。因此,有必要开展针对观赏鱼品种智能精准分类方法的研究,为观赏鱼养殖、贸易以及物种多样性研究与保护提供技术支撑。
随着深度学习方法在智慧渔业领域的不断深入应用,基于深度学习技术的鱼类智能精准分类方法得到广泛研究与应用,主流方法主要分为基于卷积神经网络(Convolutional neural network, CNN)的方法和基于Transformer的方法两类。在鱼类图像分类任务中,CNN能够通过逐层卷积和池化操作捕捉图像中鱼体纹理、形状、颜色等关键特征,在鱼类分类研究中表现出优异性能。2016年,CNN首次被应用于鱼类分类任务3。之后,Yeh等4将注意力机制引入CNN,通过弱化无意义的区域并将所有模块集成到全连接层中,进一步提高了卷积特征的表达能力,在自制水下鱼类数据集上取得了95.32%的准确率。Xu等5提出一种将Squeeze-and-Excitation(SE)注意力机制6与ResNet7结合的鱼类分类方法,专门用于对图像中的鱼体、鱼头和鱼鳞进行识别。Li等8采用网络融合技术,把浅层与深层特征信息融合,有效解决了复杂背景下鱼类分类面临的难点。Bhanumathi等9用多个卷积网络分别提取图像特征后再进行自适应融合,最终取得了较好的分类效果。然而,使用CNN完成分类任务时,网络主要依赖目标的局部特征(如鱼鳞纹理和体色分布),过于关注图像的局部特征就会产生忽略全局上下文信息关联的问题10-12,这在一定程度上影响了其对目标的分类识别精度。除此之外,传统卷积网络在捕捉细粒度差异方面仍存在一定不足,难以处理观赏鱼在外观上的细微差异。
针对CNN存在的局限性,2020年,Dosovitskiy等13提出了Vision Transformer (ViT)架构,将Transformer直接引入到图像分类任务中,ViT依赖Transformer强大的全局建模能力,取得了较为优异的图像分类结果14-16。Gong等17针对原始ViT模型在多水域环境下鱼类特征提取能力较弱的问题,提出了基于迁移学习与ViT的鱼类分类方法Fish-TViT,经验证,该方法在海水鱼和淡水鱼数据集上均达到了较高的分类精度。Si等18提出了一种采用token选择性自注意力模块聚焦关键token的新型分类框架,实现对海洋生物的精准分类。Manikandan等19提出了一种集成式鱼类分类模型,以ViT为基础框架,使用DenseNet-16920提取鱼类相关特征,有效提高了模型的分类性能。然而,ViT需要在大量数据上开展预训练并迁移到中小图像识别任务中,参数规模和计算量相比CNN都更大,难以适应实时识别、边缘部署等识别速度要求较高的场景。
因此,使用CNN提取局部特征并引入Transformer关注全局特征已经成为图像分类领域的重要研究方向21-24。MobileViT正是通过有效结合ViT的全局建模能力和CNN的局部特征提取能力,构建出一种适合实时识别场景并兼顾分类效果的网络。然而MobileViT模型依旧存在对细粒度视觉特征提取能力有限,对多尺度信息不敏感的问题。因此,本研究针对观赏鱼图像数据特点,对MobileViT进行针对性改进,提出PETFish-MViT模型,改进模型的特征选择和特征融合方法,并优化损失函数,构建了一个兼顾精度和效率的轻量化模型,为观赏鱼品种分类提供关键技术支撑。

1 材料与方法

1.1 数据集构建

为客观、合理评估PETFish-MViT在观赏鱼分类任务中的性能,本研究首先使用自建的观赏鱼数据集PETFish对模型进行训练,再用公开数据集WildFish检验模型的泛化能力与鲁棒性。综合评估验证模型在观赏鱼分类任务中的性能及其在不同数据集上的泛化能力。

由于观赏鱼分类任务对复杂自然环境下多样化、有挑战性数据集有明确需求,本研究通过网络爬虫技术从互联网上获得水下观赏鱼图像,构建了PETFish数据集。最终数据集有13 205张图像,涉及141种观赏鱼类别。所选图像来自若干不同网站,在不同自然环境下由不同设备进行拍摄,因此数据集本身具有较高的多样性,也因而可以不受具体设备或拍摄角度的限制,能更充分、真实地反映复杂自然环境下观赏鱼的自然栖息状态与外观特征。

此外,该数据集含有大量实际应用中十分典型的受复杂背景、水体浑浊、环境拟态以及外观相似影响的难分类样本,进一步贴近实际应用中的分类难度,图1展示了若干典型困难样本。本研究还对PETFish数据集开展了严谨、系统的数据清洗工作,验证了标签准确性以及单目标图像分类的正确性。通过以上流程,构建起一个质量优良、具有较高多样性的数据集,为开展相关研究提供了可靠且规范的数据支撑。

WildFish数据集则是一个开放鱼类识别基准数据集,共包含54 459张鱼类图像,涵盖1 000种野生鱼类,每种类别至少有30张图像。本研究已按照6∶4的比例对PETFish数据集和WildFish数据集进行了训练集与测试集划分。最终,PETFish数据集的训练集包含7 923张图像,测试集包含5 282张图像;WildFish数据集的训练集包含32 673张图像,测试集包含21 782张图像。

1.2 方法

观赏鱼分类任务本身面临水体浑浊、环境复杂、鱼体与背景难区分、不同品种间外观易混淆等诸多困难,提升观赏鱼分类准确率主要依赖2个方面:一是降低干扰因素的影响让模型更加聚焦于关键区域;二是合理融合局部与全局特征,使模型提取的特征更加全面。因此,本研究对MobileViT进行系统改进,提出PETFish-MViT方法,实现对观赏鱼品种的精准分类。

PETFish-MViT的整体结构如图2所示,网络由卷积层、倒残差模块(Inverted residual block, MobileNetV2 block)、MobileViT模块以及类别预测层组成。用互标记增强(Mutual token enhancement, MTE)模块替代第4层MobileViT模块中的Transformer模块,计算每个token的注意力得分,聚焦关键token;将多特征融合(Multi-feature fusion, MFF)模块应用于所有MobileViT模块中,融合多尺度特征。此外,用交叉熵损失函数替代标签平滑损失函数,以缓解数据集中样本类别不平衡的问题。接下来将对这3部分修改进行系统说明。

1.2.1 互标记增强模块(MTE)

MobileViT模块中的Transformer子模块将输入图像划分为若干token,各token均参与计算,这就导致关键区域信息被无关背景区域稀释。为区分不同token对网络判别结果的影响,引入了如图3所示的MTE模块。利用自注意力机制为各token生成注意力得分,在不增加额外参数的情况下强化token的注意力表达,引导网络关注真正对识别结果有意义的关键特征,让关键token获得更高响应,更多的参与进后续Transformer层的全局信息交互中来。

为提高关键token的注意力得分,本研究通过MTE模块对注意力权重进行再加权。然而,如果只对类别token的注意力权重进行增强很可能引入噪声信息,聚合来自无关token的大量冗余信息。因此,Wang等25提出了一个互注意力权重选择模块,其核心思想是选择既与类别token上下文信息具有较强关联,又与类别token本身具有较强语义相似性的关键token。具体方法是将注意力权重矩阵的第一行WRB×H×N+1与第一列CRB×H×(N+1)进行逐元素相乘,得到互注意力权重。MTE模块采用类似思想对token进行增强,但是MTE模块并不用来筛选token,而是用得到的结果对注意力得分进行加权。互注意力向量MAVRB×H×(N+1)的计算公式如下:

MAV=CW
C=A:,:,:,0,W=A:,:,0,:

式中:MAV为互注意力向量;C为注意力权重矩阵第一列;W为注意力权重矩阵第一行;A为注意力权重矩阵。

MAV 中的每个位置表示对应token的增强得分,得分越高说明该token获得的关注度越高,对 MAV 中的token得分进行排序,再把所得结果扩展到与注意力权重矩阵相同的维数,得到互注意力矩阵 MAM

图4是该过程的一个示例。

最后,把得到的 MAM 与原始注意力权重相乘,得到有互注意力机制的注意力权重。互注意力权重MAWRB×H×(N+1)×(N+1)很好的保留了类别token上下文以及token自身包含的信息。

MAW=MAMA

式中: MAW 为重新加权后的互注意力权重矩阵; MAM 为原始互注意力权重矩阵;A为注意力权重矩阵。

1.2.2 多特征融合模块(MFF)

由于MobileViT更加关注全局信息,而对局部特征关注较少,但局部特征(如观赏鱼的体色细节和纹理信息)又对于区分细小差异的观赏鱼具有重要意义,因此,本研究对MobileViT模块所用的融合方法进行改进,加强网络对局部特征的融合能力。

下面对MobileViT模块进行简要描述:

1) 局部表示(Local representations):首先通过一个n×n卷积层提取特征图X的局部信息,使模型能够关注局部特征模式及空间关系。随后通过1×1卷积层对通道映射进行调整,高效提取不同通道的特征。通过以上步骤得到的局部特征图Xlocal可以表示为:

Xlocal=Conv1×1Convn×nX

式中:Xlocal为局部特征图;Conv为卷积运算;n为卷积核的大小,X为原始特征图。

2) 全局表示(Global representations):全局表示可以归纳为3个过程。首先,将输入的局部特征图Xlocal展开为N个互不重叠的展平图像块;然后通过Transformer模块对各个块之间的关系进行编码。最后,把所得图像块重组获得全局特征图Xglobal。其计算过程可表示为:

Xglobal=Conv1×1FoldTransformerUnfoldXlocal

式中:Xglobal为全局特征图;Conv为卷积运算;Fold为重组操作;Transformer为Transformer编码器;Unfold为展开操作;Xlocal为局部特征图。

3) 特征融合(Fusion):将全局特征图Xglobal与输入特征图X拼接,通过一个n×n卷积层得到融合特征图Xfusion。其计算过程可表示为:

Xfusion=Conv1×1ConcatX,Xglobal

式中:Xfusion为融合特征图;Conv为卷积运算;Concat为特征拼接操作,是将特征图X与全局特征图Xglobal进行连接;X为原始特征图;Xglobal为全局特征图。

原始MobileViT模块所用融合方法只是把输入特征与全局特征进行简单组合,虽然保留了两类特征信息,但是简单进行空间上的拼接本质属于对特征进行堆叠,局部细节与全局特征缺乏充分的信息交互,导致后续还需要依靠卷积层来学习这两者之间的关联关系。因此,本研究通过MFF模块增强层间局部特征的获取与传递能力。如图5所示,MFF模块先让全局特征与局部特征分别通过一个1×1卷积层进行通道维数变换,然后把两者逐元素相加(element-wise addition)并与输入特征进行拼接,得到的拼接特征经过一个n×n卷积层生成最终的融合特征。公式(7)和(8)是上述过程的公式化描述。MFF模块通过逐元素相加实现了对这两类特征进行显式交互,可以在当前的特征融合阶段就建立局部特征和全局特征之间的关联,保留更多细粒度信息。

Xlocal-global=Conv1×1Xlocal+Conv1×1Xglobal
Xfusion=Convn×nConcatX,Xlocal-global

式中:Xlocal-global为局部-全局融合特征;Conv为卷积运算;Xlocal为局部特征图;Xglobal为全局特征图;Xfusion为最终融合特征图;Concat为特征拼接操作;X为原始特征图。

因此,MFF模块进一步提高了模型对全局特征与局部特征的联合建模能力。该改进使模型能够更全面地利用观赏鱼细粒度特征,提高了模型对关键细节的感知能力。

1.2.3 标签平滑损失函数

由于观赏鱼分类任务中部分品种十分稀有,故构建的数据集中各类别样本的数量存在不平衡的问题。图6可以清楚地看出自建数据集PETFish和使用的公开数据集WildFish 2个数据集中各类别样本数量的分布情况。因此,在模型训练与评估过程中,有必要采取措施解决类别不平衡问题,确保模型对各类别进行充分学习,具备良好的泛化能力。

MobileViT模型采用的损失函数为交叉熵损失函数。交叉熵损失函数能够度量模型预测标签y^i与真实标签yi之间的差异。但是它对各类别样本都赋予相同的权重,导致样本数量较少的类别容易被低估,影响模型在小样本类别上的学习效果。为避免这个问题,本研究采用标签平滑损失函数26替代交叉熵损失函数,即在训练时对标签进行平滑处理,将原本真实标签中的1和0替换为较小的正值和非零值,从而在训练中引入一定的平滑性,有效解决数据集类别不平衡问题,也可以有效防止模型对常见类别形成过强依赖。标签平滑损失函数的计算公式见公式(9)和(10)。

LLS=-iCy^ilog yi
y^i=1-ε+εC-1,correctεC-1,others

式中:LLS为标签平滑损失;C为类别数;y^i为预测该类别的概率;yi为该类别对应的真实标签;ε为平滑系数;通常取较小的数值(如0.1或0.05);对于正确类别(真实标签),其标签被设为1-ε+ε/(C-1),而对于其他类别(非真实标签),其标签被设为ε/(C-1)

1.3 模型实现细节及评价指标

1.3.1 实现细节

本研究中的所有试验均在Linux操作系统下完成,采用NVIDIA GeForce RTX 2080 Ti GPU作为计算设备。模型训练批大小设置为4,优化器选用AdamW27,权重衰减系数取0.01,初始学习率设为0.000 1,每次训练100个epoch。在训练前采用随机水平翻转进行数据增强,并对图像进行统一尺寸的随机裁剪处理。

1.3.2 评价指标

本研究从准确率(Accuracy)、精确率(Precision)、召回率(Recall)、F1分数(F1 score)以及参数量(Parameter)28-305个指标出发,系统评价模型性能,前四项指标的计算公式如下,参数量则是用于衡量模型的规模与复杂度。

Accuracy=TP+TNTP+TN+FP+FN
Precision=TPTP+FP
Recall=TPTP+FN
F1=2×Precision×RecallPrecision+Recall

式中:TPTNFPFN分别表示真正例、真负例、假正例和假负例样本数。

2 结果与分析

2.1 与主流分类模型的对比分析

本节将PETFish-MViT与部分卷积神经网络以及基于Transformer的网络进行了对比分析,并涉及相关轻量级网络。对比结果如表1所示。

在分类准确率方面,PETFish-MViT的准确率和F1值分别达到92.7%和92.1%,与常用的CNN方法相比,准确率提升至12.9%~35.3%,尽管其参数量略高于轻量级CNN模型,但性能提升相较于这些轻量化模型更为明显;相较基于Transformer的方法,准确率提升至少9.6%。其根本原因在于PETFish-MViT模型对CNN结构与Transformer结构进行了有效融合,既保留了CNN在局部特征提取方面的优势,又引入Transformer模块增强了模型对全局上下文信息的建模能力。因此,PETFish-MViT在提升分类精度的同时,可在统一框架内平衡局部与全局2种特征的表达,十分适合用于解决观赏鱼分类任务。

在参数量方面,PETFish-MViT的参数量为5.1×106,相比参数量最小的DeiT,参数量降低了3.7%,较参数量最大的PVT降低58.2%,轻量化较为显著,同时准确率也高于以上轻量化Transformer模型。这主要得益于PETFish-MViT有效引入卷积结构,很好地弥补了传统轻量化模型牺牲模型性能换取较小参数规模这一不足。

2.2 改进MobileViT消融试验

为系统评估3个改进模块对模型性能做出的贡献,在本节中以MobileViT为基线模型进行消融实验,逐步引入各项改进,对应得到的具体结果如表2所示,基线模型的准确率、精确率、召回率和F1分数分别为 89.9%、89.5%、89.1%和89.3%。单独引入MTE模块和MFF模块对模型性能贡献大致相当,均使准确率提高0.5%,F1值分别提升0.7%和0.3%;替换损失函数的提升效果则更为明显,准确率和F1值均提高1.1%。结果表明,在观赏鱼图像分类任务中,引入鲁棒性更强的损失函数能够给模型训练带来更大的性能提升。此外,MTE与MFF两模块均旨在增强模型特征理解能力,故效果相近。同时,对3种改进的两两组合进行分析可以发现各组合较基线模型都有一定的提升,引入MTE和MFF模块准确率提高0.2%,引入MTE模块并替换损失函数准确率提高1%,引入MFF模块并替换损失函数准确率提高0.6%,这一结果仍能够说明MTE模块和MFF模块单独使用对分类结果的影响差距较小,替换损失函数对网络的提升最为明显,但相比于单个模块引入,引入2个模块的提升并不明显。

对同时融合3种改进的完整模型进行分析可以发现,PETFish-MViT模型在PETFish数据集上准确率、精确率、召回率和 F1 分数分别较基线模型提升了1.5%、1.2%、1.7% 和1.4%,性能提升较为明显,主要得益于引入MTE模块扩大关键token对结果的影响,采用MFF模块强化局部信息融合,使用标签平滑损失函数有效缓解类别不平衡问题。这3部分改进互相配合,使模型在观赏鱼图像分类任务中表现出较为优异的性能。

2.3 在不同层中应用 MTE 的影响

为了探究在模型不同层中应用MTE模块的影响,在PETFish-MViT的3种不同规模模型上开展了对比试验(S:small,小型;XS:extra small,更小型;XXS:extra extra small,最小型)。如图2所示,本模型共包含5个层级,其中第3层、第4层和第5层包含MobileViT模块。分别在这3层中引入MTE模块,实验结果如表3所示。

根据表3的结果可以看到,对于S模型,在各层引入MTE模块时,准确率分别提高0.1%、0.5%和0.4%,有一定的性能提升,对于XS和XXS这类小型模型,引入MTE模块对结果并未产生太大影响,提升基本均在0.1%左右,XXS模型准确率甚至略有下降。原因在于小模型参数较少,对关键特征本身就存在提取不足的问题,MTE模块的引入反而干扰了不同token的表示,导致性能下降。

2.4 可视化注意力权重分布分析

梯度加权类激活映射(Gradient-weighted class activation mapping, Grad-CAM)是深度学习结果评估中一种有效的可视化技术,用于区分网络对不同区域的关注程度。本研究对PETFish-MViT中第4层自注意力权重分布图进行可视化,并与原始MobileViT模型直接对比,结果如图7所示。

图7中的2个模型在目标定位层面对不同区域的关注度表明,MobileViT模型更多地关注了与观赏鱼特征无关的背景区域,干扰了网络最终的决策。相比之下,PETFish-MViT模型通过MTE模块能够将注意力集中在观赏鱼鱼体目标上,从而得到更高的分类准确率。从特征提取部分热力图可以直观看出,PETFish-MViT模型通过MTE与MFF模块,使网络能够覆盖更大范围的关键特征目标区域,从而提取更加丰富且准确的特征。

2.5 WildFish数据集上的泛化分析

为验证PETFish-MViT对更大规模且未训练数据的适应能力和泛化能力,本研究进一步在大规模鱼类基准数据集WildFish上对PETFish-MViT模型进行了验证。从表4结果可以直观看出,PETFish-MViT在WildFish数据集上显著优于其他网络模型。

该结果表明本研究采用的这3种改进方法可以使模型在处理大规模复杂图像数据时,在不同尺度上充分利用鱼体特征。在其他鱼类数据集上进行验证时,准确率达到77%,F1值达到76.8%,相比表现最好的DeiT模型,准确率高0.7%,F1值高1.1%,性能表现较为稳定且优异,体现出良好的泛化能力与鲁棒性。

3 讨 论

本研究提出的观赏鱼分类模型PETFish-MViT在自建PETFish数据集和公开WildFish数据集上准确率分别达到92.7%和77.0%,F1值为92.1%和76.8%,相较于原始MobileViT模型准确率和F1值均提高2.8%,验证了改进模块的有效性。

在特征选择方面,Si等18提出Token选择性自注意力方法,该方法通过让每一个token根据注意力权重自主选择相关token。本研究提出的MTE模块在此基础上对具体实现方法进行改进,通过计算互注意力向量对原始注意力权重再加权,根据此权重再筛选token,在保留全局特征的同时有效抑制了背景无关区域的干扰,这也可以与Gard-CAM结果相互印证。此外,针对背景噪声干扰的问题,ACC-ViT模型35分别设计了注意力组合、关键区域过滤、互补token整合3个模块;MCM-ViT模型36则引入注意力重分配策略,本研究引入的MTE模块相较这2个模型,并未引入额外的参数,在保持模型轻量化的同时实现了分类精度的提升。

在特征融合机制方面,原始MobileViT模型使用简单拼接的方式融合局部特征与全局特征,而本研究引入的MFF模块则在特征融合阶段通过逐元素相加的方法建立局部特征和全局特征之间的关联,消融试验结果证明引入MFF模块可使分类准确率提高0.5%,证明跨层特征融合可以有效补偿单一层次特征表达不足的缺点,这与Hu等37在HAVT模型中的研究结论一致,Li等8、Bhanumathi等9对特征融合策略的研究也证明了浅层纹理信息与深层语义特征有效结合对复杂背景下观赏鱼品种识别的重要性。

在引入这2个模块的基础上,将交叉熵损失函数替换为标签平滑损失函数为模型带来了最为显著的提升,该结果与Szegedy等26、Durden等28针对损失函数开展的相关研究结论相符,可以说明标签平滑策略在类别不均衡的场景下具有正则化效果,可以减少模型过度自信现象,缓解模型对大样本类别过度依赖的问题38

本研究方法也存在一定的局限性。当前模型仍依赖监督学习框架,缺乏对未见品种进行分类的能力,依赖大量的数据集及数据标注,因此后续研究有必要引入目标检测及开放词汇检测框架,进一步提高模型分类能力的同时实现开放类别识别,扩大模型在真实场景下的实际使用价值。

4 结 论

本研究为解决观赏鱼分类任务中存在的部分观赏鱼外观高度相似、具有保护色、栖息环境复杂、水体浑浊等独特问题导致的通用模型识别准确率较低,提出了一种新型观赏鱼分类模型PETFish-MViT。该模型能够更加关注对观赏鱼分类贡献更大的鱼体关键区域,并通过更强大的特征融合能力,关注更多鱼体特征。在复杂环境下,PETFish-MViT较高的分类精度保证了其在实际应用中的可靠性;较小的参数规模使得模型在边缘部署方面具有更大的优势;而优异的泛化能力,则为模型的跨场景应用提供了有力支持。总之,PETFish-MViT模型可以为观赏鱼爱好者提供一种分类手段和工具,在观赏鱼产业中发挥重要作用。

参考文献

[1]

Pountney S M.Survey indicates large proportion of fishkeeping hobbyists engaged in producing ornamental fish[J].Aquaculture Reports202329:101503

[2]

Food and Agriculture Organization of the United Nations. Trade and Market News: 3rd International Ornamental Fish Trade and Technical Conference[EB/OL]. [--].

[3]

Salman AJalal AShafait FMian AShortis MSeager JHarvey E.Fish species classification in unconstrained underwater environments based on deep learning[J].Limnology and Oceanography:Methods201614(9):570-585

[4]

Yeh C HLin M HChang P CKang L W.Enhanced visual attention-guided deep neural networks for image classification[J].IEEE Access20208:163447-163457

[5]

Xu X LLi W SDuan Q L. Transfer learning and SE-ResNet152 networks-based for small-scale unbalanced fish species identification [J].Computers and Electronics in Agriculture2021180:105878

[6]

Hu JShen LSun G. Squeeze-and-excitation networks [C].In:2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition.Salt Lake City,UT,USA:IEEE,2018:7132-7141

[7]

He K MZhang X YRen S QSun J.Deep residual learning for image recognition[C].In:2016 IEEE Conference on Computer Vision and Pattern Recognition(CVPR).Las Vegas,NV,USA:IEEE,2016:770-778

[8]

Li L PShi F PWang C X.Fish image recognition method based on multi-layer feature fusion convolutional network[J].Ecological Informatics202272:101873

[9]

Bhanumathi MArthi B. FishRNFuseNETDevelopment of heuristic-derived recurrent neural network with feature fusion strategy for fish species classification [J].Knowledge and Information Systems202466:1997-2038

[10]

Li Z PHu JWu K YMiao J WZhao Z XWu J S.Local feature acquisition and global context understanding network for very high-resolution land cover classification[J].Scientific Reports202414:12597

[11]

Li T PZhang Z YZhu M DCui Z TWei D M.Combining transformer global and local feature extraction for object detection[J].Complex & Intelligent Systems202410:4897-4920

[12]

Qin R RWang C ZWu Y MDu H FLv M Y. A U-shaped convolution-aided transformer with double attention for hyperspectral image classification [J].Remote Sensing202416(2):288

[13]

Dosovitskiy ABeyer LKolesnikov AWeissenborn DZhai X HUnterthiner TDehghani MMinderer MHeigold GGelly SUszkoreit JHoulsby N. An image is worth 16x16 words:Transformers for image recognition at scale[EB/OL].[--].

[14]

Wang WYang XTang J H.Vision transformer with hybrid shifted windows for gastrointestinal endoscopy image classification[J].IEEE Transactions on Circuits and Systems for Video Technology202333(9):4452-4461

[15]

Khalil MKhalil ANgom A.A comprehensive study of vision transformers in image classification tasks[EB/OL].[--].

[16]

Nie X SJin H YYan Y FChen XZhu Z HQi D L. ScopeViTScale-aware vision transformer [J].Pattern Recognition2024153:110470

[17]

Gong BDai K YShao JJing LChen Y Y. Fish-TViTA novel fish species classification method in multi water areas based on transfer learning and vision transformer [J].Heliyon20239(6):e16761

[18]

Si G ZXiao YWei BBullock L BWang Y YWang X D. Token-Selective Vision Transformer for fine-grained image recognition of marine organisms [J].Frontiers in Marine Science202310:1174347

[19]

Manikandan D LSanthanam S M.Parallel desires:Unifying local and semantic feature representations in marine species images for classification[J].Marine Geophysical Research202445:16

[20]

Huang GLiu ZVan Der Maaten LWeinberger K Q.Densely connected convolutional networks[C].In:2(CVPR)017 IEEE Conference on Computer Vision and Pattern Recognition,Honolulu,HI,USA:IEEE,2017:2261-2269

[21]

Touvron HCord MDouze MMassa FSablayrolles AJégou H.Training Data-Efficient Image Tansformers & Distillation Through Attention[EB/OL].[--].

[22]

Wang W HXie E ZLi XFan D-PSong K TLiang DLu TLuo PShao L.Pyramid vision transformer:A versatile backbone for dense prediction without convolutions[C].In:2021 IEEE/CVF International Conference on Computer Vision(ICCV),Montreal,QC,Canada:IEEE,2022:548-558

[23]

Yuan KGuo S PLiu Z WZhou A JYu F WWu W.Incorporating convolution designs into visual transformers[C].In:2021 IEEE/CVF International Conference on Computer Vision(ICCV),Montreal,QC,Canada:IEEE,2022:559-568

[24]

Yuan LChen YWang TYu WShi YJiang Z HTay F E.H.Feng J SYan S C. Tokens-to-token vitTraining vision transformers from scratch on imagenet [C].In:2021 IEEE/CVF International Conference on Computer Vision(ICCV),Montreal,QC,Canada:IEEE,2022:538-547

[25]

Wang JYu X HGao Y S.Feature fusion vision transformer for fine-grained visual categorization[EB/OL].[--].

[26]

Sambyal A SNiyaz UShrivastava SKrishnan N CBathula D R.LS+: Informed label smoothing for Improving calibration in Medical image classification[C].In:Medical Image Computing and Computer Assisted Intervention-MICCAI 2024,Cham:Springer,2024:513-523

[27]

Loshchilov IHutter F.Decoupled weight decay regularization[EB/OL].[--].

[28]

Durden J MHosking BBett B JCline DRuhl H A. Automated classification of fauna in seabed photographsThe impact of training and validation dataset sizewith considerations for the class imbalance [J].Progress in Oceanography2021196:102612

[29]

Opitz J.A closer look at classification evaluation metrics and a critical reflection of common evaluation practice[C].In:Transactions of the Association for Computational Linguistics,Cambrideg:MAAssociatioon for Computational Linguistics,202412:820-836

[30]

Abou Baker NHandmann U.One size does not fit all in evaluating model selection scores for image classification[J].Scientific Reports202414:30239

[31]

Krizhevsky ASutskever IHinton G E.ImageNet classification with deep convolutional neural networks[J].Communications of the ACM201760(6):84-90

[32]

Sandler MHoward AZhu M LZhmoginov AChen L C.MobileNetV2: Inverted residuals and linear bottlenecks[C].In:2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition,Salt Lake City,UT,USA:IEEE,2018:4510-4520

[33]

Ma N NZhang X YZheng H TSun J.ShuffleNet V2:Practical guidelines for efficient CNN architecture design[C].In:Computer Vision-ECCV 2018.Cham:Springer,2018:122-138

[34]

Iandola F NHan SMoskewicz M WAshraf KDally W JKeutzer K. SqueezeNetAlexNet-Level Accuracy with 50x Fewer Parameters and <0.5MB Model Size [EB/OL].[--].

[35]

Zhang Z CChen Z DWang Y XLuo XXu X S.A vision transformer for fine-grained classification by reducing noise and enhancing discriminative information[J].Pattern Recognition2024145:109979

[36]

Li B CWu YLiu Q YChen YHe KYu Y. MCM-ViTMask-guided context-enhanced multi-scale transformer for fine-grained visual classification [J].Computers and Electrical Engineering2025122:109888

[37]

Hu X BZhu S NPeng T L.Hierarchical attention vision transformer for fine-grained visual classification[J].Journal of Visual Communication and Image Representation202391:103755

[38]

Shwartz-Ziv RGoldblum MLi Y LBruss C BWilson A G.Simplifying neural network training under class imbalance[EB/OL].[--].

基金资助

北京市智慧农业创新团队项目(BAIC10-2026)

国家重点研发计划项目(2023YFD2400400)

国家重点研发计划项目(2023YFD2400401)

AI Summary AI Mindmap
PDF (2187KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/