随着移动智能设备和多点触控技术的广泛使用,基于草图的图像检索任务
[1]已成为跨模态检索的一个关键分支。手绘草图的生成已经从传统的以纸和笔为媒介发展到数字交互环境,极大提高了其作为视觉表示工具的价值。在现实世界的开放场景中,用户检索需求可能涉及大量未知类别,由于缺乏零样本学习能力,现有模型的性能显著下降。此外,获得大量高质量的草图具有挑战性,导致草图数据集稀缺
[2]。为了解决上述问题,零样本草图检索任务(Zero-shot sketch-based image retrieval,ZS-SBIR)
[3-5]引入了一种零样本学习机制,将数据集分为可见类别(训练集)和不可见类别(测试集),这需要模型在跨模态语义鸿沟和类别语义不一致的双重挑战下执行检索任务。
零样本草图检索的早期方法通常利用卷积神经网络同时从草图和自然图像中提取视觉特征。然而,由于卷积神经网络依赖于局部感受野,容易丢失草图的关键细节信息
[6]。为解决这一问题,SAKE方法引入了基于生成模型的特征合成路径,并借助知识蒸馏保留了在大规模数据集上预训练获得的判别性特征,从而减少模型在适应新类别时出现的灾难性遗忘现象
[7]。但该方法依赖复杂的师生网络结构,同时预训练教师模型若存在偏差,将进一步影响生成特征的准确性。为进一步强化语义传递,后续研究引入类别词嵌入技术,以建立跨模态和跨类别的语义关联
[8-10]。然而,提取的粗粒度语义信息并不能准确表示类别特征,这限制了模型在复杂草图场景下的判别能力。最近的研究转向对比语言-图像预训练(Contrastive language-image pre-training,CLIP)模型
[11],该类方法充分利用CLIP在零样本推理任务上的优势,结合文本语义信息,通过提示学习调整输入表示。尽管如此,标准CLIP模型仍存在两方面局限:一是其文本通常依赖于固定的手工模板,难以动态适配多样化的语义内容;二是视觉分支在微调过程中未能充分融合文本模态的引导信息
[12]。针对上述问题,DRCPL将文本提示映射为视觉提示,实现了视觉-语言间的协作学习机制,显著提升了模型对未知类别的泛化性能
[13]。
尽管上述工作显著推动了零样本草图检索任务的发展,但它们仍然面临以下问题:(1)现有方法对视觉Transformer层的特征利用不足,导致对复杂草图的适应性差;(2)现有方法主要依赖视觉编码器最后一层的类别token([CLS] token)作为图像表示,忽视了Transformer架构中不同层次捕获的多样化特征表示,无法有效整合多级语义信息,导致泛化能力受限。因此,本文提出了一种基于多级适配器增强与自适应特征融合的零样本草图检索方法(Multi-level adapter enhancement and adaptive feature fusion for zero-shot sketch-based image retrieval,MAEAF)。具体来说,首先提出了一个多级适配器增强模块(Multi-level adapter enhancement module,MAEM),该模块在视觉编码器的关键层插入轻量级的适配器。在视觉Transformer中,不同层捕获不同抽象级别的特征,在浅层,适配器可以增强草图轮廓和边缘特征的表示;在中层,适配器可以强化草图局部形状的表示;在深层,适配器可以调整语义特征,使草图的语义与自然图像的语义更好地对齐。此外,提出了一个自适应特征融合模块(Adaptive feature fusion module,AFFM),该模块通过自适应加权机制整合多层次优化特征,解决了单一特征表示的局限性。这种设计赋予了模型根据输入特征动态调整特征依赖的能力,即对于轮廓清晰、结构简单的草图,模型可赋予中层特征更高权重以充分利用其几何信息;对于语义复杂、需要上下文理解的图像,则可倾向于深层特征的全局语义表示。在Sketchy
[14]、TU-Berlin
[15]和QuickDraw
[16]3个基准数据集上进行了全面的实验。结果表明,与现有的最先进的零样本草图检索方法相比,提出的基于多级适配器增强与自适应特征融合的零样本草图检索方法具有更优越的性能。
1 相关工作
1.1 零样本草图检索
零样本草图检索任务要求模型在仅学习可见类别草图和图像映射关系的基础上,通过类别间的语义关联,完成对不可见类别草图的有效检索。在跨域对齐方面,早期方法主要依赖生成对抗网络实现草图与图像间的特征映射
[6],后续方法进一步引入了关系感知度量学习和孪生网络等技术,以减小域间差异。随着视觉Transformer(Vision transformer,ViT)
[17]的兴起,基于自注意力与交叉注意力机制的跨模态网络被用于建模图像与草图在图像块层面的语义对应
[3]。在知识迁移方面,SAKE
[7]利用知识蒸馏保留预训练模型的语义信息,结合词嵌入模型构建语义关联空间,并探索多模态预训练模型的潜力。随着CLIP模型域泛化能力的深入研究,其文本与视觉编码器之间的协同效应以及提示学习的共享策略增强了CLIP视觉与文本编码器间的知识交互,有效弥补了草图与自然图像嵌入之间的语义鸿沟,为跨域检索提供了有效途径
[10]。
1.2 视觉-语言预训练模型和提示学习
近年来,视觉-语言预训练模型已成为多模态学习中的重要研究方向。其中,CLIP模型作为代表性方法,展现出卓越的跨模态理解与泛化能力。CLIP采用双分支架构,分别使用视觉编码器与文本编码器提取图像与文本的嵌入表示。通过对比学习,CLIP将匹配的图文对在嵌入空间中拉近,而非匹配对则推远,从而具备强大的零样本识别能力
[11]。
多模态提示学习是优化CLIP及视觉-语言预训练模型的关键策略,对增强模型适应特定任务的能力具有重要作用。CoOp采用可学习的文本提示替代手工设计的提示模板,提升了零样本分类性能
[18]。然而,该方法主要侧重于文本提示的优化,对视觉模态的影响有限,所以,后续逐渐开始探索从文本提示到视觉提示的流动机制,旨在建立更强的模态间交互作用。DRCPL
[13]提出一种视觉与文本提示的联合优化方法,不仅影响文本编码器,还将提示通过语义映射传递至视觉编码器,从而增强图像特征的任务适应能力。
2 方法
2.1 问题定义
零样本草图检索的数据集由可见类别的训练集和不可见类别的测试集构成,确保。在这个数据集中,表示训练集中的草图集,表示训练集中的图像集,其中是草图样本,是图像样本,是类别标签,是草图数量,是图像数量。测试集中草图和图像的定义与训练集中的定义相似,同时确保。
2.2 模型结构
基于多级适配器增强与自适应特征融合的零样本草图检索方法(MAEAF)的框架如
图1所示,主要由CLIP、多级适配器增强模块和自适应特征融合模块组成。
2.2.1 基于CLIP的提示学习
文本编码器采用基于CLIP的Transformer结构,将一个带有类别名称的手工模板“a photo of a [类别]”输入文本编码器中,对文本描述中的单词进行分词,然后将它们投影到单词嵌入空间
,其中
表示嵌入tokens的数量,
是文本特征的维度。为了灵活地学习特征表示,模型冻结了文本和视觉编码器参数,同时在文本编码器的浅层引入了可学习的tokens。具体来说,在文本编码器的前
H层Transformer中引入
n个可学习的文本提示
,文本提示一方面通过具有残差连接的浅层网络(ResMLP)
[13]生成相应的视觉提示
,表示为
。另一方面,文本提示与其他文本tokens进行拼接,作为输入
,由文本编码器
的
L层Transformer按顺序进行处理,得到文本编码器的第
层输出结果,表示为
。文本编码器最后一层的输出
中的最后一个token
通过文本投影层
投影到公共视觉-语言嵌入空间,以获得最终的文本表示
。
采用ViT作为视觉编码器,输入图像被划分为固定大小的图像块,这些图像块被映射到块嵌入,以获得初始图像块嵌入,其中是图像块的数量,是视觉特征的维度。将可学习的[CLS] token ci 、视觉tokens和从文本提示投影得到的视觉提示拼接在一起,作为视觉编码器的输入,最后得到视觉编码的第层输出,表示为。
2.2.2 多级适配器增强模块
尽管视觉Transformer在图像理解任务中表现出色,但在零样本草图检索场景中,预训练的ViT模型往往难以充分捕捉草图的抽象特性和结构信息。传统设计通常仅在网络末端插入单一适配器,这限制了模型对不同层次特征的针对性增强。为此,提出了多级适配器增强模块(MAEM),具体结构如
图1所示,通过在ViT的关键层次部署适配器,实现对不同级别特征的层次化增强。
适配器的结构设计为轻量级的瓶颈结构,可以在保持参数效率的同时实现有效的特征变换。给定输入特征,适配器结构的表达式为,,其中,是降维投影矩阵,是升维投影矩阵,是固定的缩减率,是通过残差连接得到的,以确保训练的稳定性。
在视觉编码器的第层部署适配器,这些层分别对应ViT中不同抽象级别的特征:浅层特征主要编码边缘和轮廓信息,中层特征整合局部特征的结构信息,深层特征形成高级语义概念。对于每一层,适配器仅应用于代表全局图像的[CLS] token ,表示为,其中,是第层适配器优化后的[CLS] token。该token随后被放回序列中替换原始token,表示为。最终,获得适配器增强的特征集合。
2.2.3 自适应特征融合模块
单一的特征表示难以充分适应草图与自然图像之间的领域差异,并且传统的特征融合方法通常采用简单的拼接或平均池化,未能充分考虑不同层次特征的贡献差异。为此,提出了自适应特征融合模块(AFFM),通过可学习的权重机制动态整合多级特征,实现从局部到全局的全面表征。
自适应特征融合模块将来自不同层次的适配器增强特征进行融合。首先进行特征拼接,表示为,其中,表示特征维度的拼接操作,、、分别表示来自第3、6、9层的适配器增强后的[CLS] token。拼接后的特征通过一个非线性融合网络进行维度变换和特征交互,表示为,其中,是一个融合权重矩阵,是偏置项,通过引入GELU激活函数进行非线性变换。视觉特征表示经过一个线性投影层映射到公共嵌入空间中,表示为。
视觉编码器的最后一层输出中的[CLS] token 通过视觉投影层投影到公共视觉-语言嵌入空间上,得到原始视觉特征,表示为。同时,引入可学习的融合权重参数来平衡多级融合特征和原始特征的重要性,表示为,,其中,是可学习的标量参数,是Sigmoid函数,以确保权重在(0,1)范围内。
2.3 损失函数
2.3.1 对比学习损失
对比学习损失通过计算视觉和文本表示之间的余弦相似度,将视觉特征与相应的文本表示对齐,损失函数定义为其中,,表示温度超参数,表示小批量大小,表示可见类别的数量,表示余弦相似性。
2.3.2 三元组损失
三元组损失旨在最小化草图与正样本图像间的距离,同时最大化与负样本图像的距离,损失函数定义为,其中,是余弦距离函数,是边界超参数。
2.3.3 相似性分布匹配损失
相似性分布匹配损失旨在最小化草图图像相似性分布和标签匹配分布之间的Kullback-Leibler(KL)散度,其公式为
其中,=1E—10,用来避免零除法误差;是匹配概率;是真实匹配概率,;表示草图和图像属于同一类别,表示草图和图像属于不同类别。
将上述3个损失函数结合起来进行训练,总损失函数L表示为。
3 实验
3.1 数据集和评估指标
采用3个广泛使用的数据集,并遵循既定的数据集划分协议
[5]。Sketchy
[14]数据集包含75 471张草图和73 002张图像,共有125个类别,其中100个类别用于训练,25个类别用于测试,定义为S-Ⅰ。另一种划分方法
[1]使用104个类别进行训练,21个类别进行测试,定义为S-Ⅱ。TU-Berlin
[15]数据集由20 000张草图和204 489张图像组成,共有250个类别,其中220个类别用于训练,30个类别用于测试。QuickDraw
[16]数据集包含330 000张草图和204 000张图像,共有110个类别,其中80个类别用于训练,30个类别用于测试。
为进行公平比较,实验采用了与文献[
7]相同的评估指标,包括平均精度均值(Mean average precision,mAP)和精确率(Precision,
P)。所有类别和前200张图像的平均精度均值分别记为mAP@all和mAP@200,检索前100张图像和200张图像的精确率分别记为
P@100和
P@200。
3.2 实验配置
所有实验均在32 GB V100 GPU上使用PyTorch框架进行。实验选择CLIP的ViT-B/16骨干网络作为视觉编码器,同时使用基于Transformer的骨干网络作为文本编码器,即
L设置为12。所提方法采用与文献[
13]相同的参数设置,其中输入图像大小设置为224
224,提示学习的提示深度
H设置为9,提示tokens的数量
n设置为2,边界参数
m设置为0.3,温度超参数
ρ设置为0.07。实验使用初始学习率为5E—06的Adam优化器,在训练过程中使用余弦衰减策略衰减到3E—06,权重衰减率为5E—04。此外,实验以32的批处理大小训练了40个轮次。
3.3 实验结果
为了验证所提方法的有效性,选择了13种最先进的零样本草图检索方法。
表1提供了MAEAF与使用CNN、ViT和CLIP作为骨干模型在3个基准数据集上的比较分析。结果表明,MAEAF在大部分评估指标上均优于现有的最先进的方法。与DRCPL方法相比,所提方法在Sketchy S-Ⅰ、Sketchy S-Ⅱ、TU-Berlin和QuickDraw数据集上将平均精度均值分别提高了1.5%、1.3%、2.6%和0.7%,并将精确率分别提高了1.0%、1.2%、2.1%和1.0%。
实验结果表明,使用提示学习的CLIP模型可以更全面地理解零样本草图检索任务中的多域数据。此外,多级适配器增强模块在浅层、中层、深层部署适配器可以针对性地增强视觉的细节、局部及全局特征,显著提升了模型对视觉多层次特征的建模能力。自适应特征融合模块动态调整多级融合特征与原始视觉编码器输出特征的平衡,解决了单一特征表示难以适应草图抽象特性和自然图像丰富细节的问题,实现了从局部细节到全局语义的全面特征增强。
3.4 消融实验
为评估所提模型中多级适配器增强模块(MAEM)与自适应特征融合模块(AFFM)的有效性,在所有基准数据集上进行了消融实验,实验结果如
表2所示。其中实验1为基准模型(未添加MAEM和AFFM),用于验证基础框架的性能;实验2仅添加MAEM,用于单独评估层次化特征增强的效果;实验3同时添加MAEM和AFFM,用于验证两个模块的协同作用。
由
表2可知,仅添加MAEM的实验2相比基准实验1,在所有数据集上的性能都有提升,表明MAEM通过对不同层次特征的针对性增强,有效提升了模型的特征表征能力。在此基础上添加AFFM的实验3,模型达到最佳性能,表明AFFM通过动态平衡多级融合特征与原始特征的权重,解决了单一特征表示的局限性,与MAEM形成了良好的协同效应。
3.5 定性结果和计算量分析
图2展示了在Sketchy和TU-Berlin数据集上DRCPL和MAEAF方法返回的前5个图像检索结果。绿色边框表示返回正确的检索结果,红色边框表示返回错误的检索结果。从
图2可以看出,所提方法获得了更准确的结果,检索结果再次验证了MAEAF方法的有效性。
将所提方法与4种零样本草图检索方法(ZS-SBIR)在计算复杂度方面进行了比较。从
表3中可以看出,所提方法具有较少的可学习参数量,是因为模型仅对视觉提示、文本提示以及多级适配器增强模块(MAEM)和自适应特征融合模块(AFFM)中的参数进行训练。尽管CLIP-AT实现了较低的浮点计算量,但所提方法在合理增加计算量的情况下实现了更好的检索性能。
4 结论
本文提出了一种基于多级适配器增强与自适应特征融合的零样本草图检索方法(MAEAF),该方法设计了多级适配器增强模块,通过在不同深度(浅层、中层、深层)部署轻量级瓶颈结构适配器,分别增强边缘轮廓、局部结构和全局语义的特征表示,显著提升了模型对多层次视觉特征的建模能力。此外,提出了一个自适应特征融合模块,该模块动态调整多级融合特征与原始输出特征的平衡,实现了从局部到全局的全面特征增强。在3个基准数据集上进行了全面的实验,结果表明,所提方法能够有效地对齐草图和图像特征,并具有优异的零样本草图检索性能。
内蒙古自然科学基金项目(2024MS06029)