图文匹配能够突破模态限制,弥补视觉与文本之间的语义鸿沟。其核心挑战在于准确学习跨模态嵌入,实现高质量的语义对齐。根据跨模态交互的实现方式,图文匹配方法可分为两大类:粗粒度匹配和细粒度匹配。在图文匹配的早期研究中,粗粒度方法
[1]将图像和文本编码到一个共享的嵌入空间,然后通过跨模态嵌入的余弦相似性计算语义相似度;细粒度匹配在视觉和文本的局部特征之间进行跨模态交互,再聚合局部对齐结果,得到累积相似度。细粒度匹配方法能显著提升模型的检索性能,成为当前图文检索研究的主要方向。
Lee等
[2]提出了视觉与文本片段之间的注意力机制,旨在聚焦显著对齐并抑制错误对齐,为后续诸多研究提供了启发。MMCA利用自注意力模块和交叉注意力模块,更准确地衡量图像与句子之间的视觉-语义相似度以及模态内的关系
[3]。NAAF采用双分支匹配机制,利用匹配片段的积极作用和非匹配片段的消极作用联合推断整体相似度
[4]。Pan等
[5]提出硬对齐编码方案,仅关注最相关的图像区域-文本词语对,从而准确发现语义对应关系。HREM采用层次关系建模,结合跨模态和跨样本的实例级关系,实现更高质量的语义对齐
[6]。CORA使用场景图表示文本描述,并通过图注意力网络有效编码对象-属性和对象-对象的语义关系
[7]。LAPS以语言感知为核心,基于文本信息精准筛选关键图像区域,降低计算复杂度与冗余
[8]。Liu等
[9]提出跨尺度对齐模型,生成位置-共现感知子序列并融合为语义单元,再用自适应语义剔除弱关联。Lyu等
[10]针对标注噪声提出基于互信息变化的软标签估计与分布自适应软边际损失。
然而,大多数细粒度匹配的学习过程仍存在两个问题:(1)细粒度匹配通常采用传统交叉注意力机制完成两种模态特征的对齐,即通过计算视觉片段特征向量与文本单词向量之间的交叉注意力分数,来衡量每个视觉片段与文本描述的相关性。但这种方法存在缺陷,如果文本描述和视觉片段中包含与检索任务无关的内容,交叉注意力会错误地为这些部分分配较高权重,从而影响匹配质量。(2)当前细粒度匹配方法使用Swin Transformer和ViT等视觉编码器,将图像分割为多个非重叠的视觉片段并编码视觉特征
[11]。这种分割方式会导致片段冗余问题,即图像中不重要的背景区域或与文本无关的区域会产生大量冗余视觉片段掩盖关键视觉片段,最终导致对齐误差的累积
[12]。
为解决上述问题,本文提出一种基于上下文锚点注意力
[13]和DINOv3
[14]的图文检索模型(Image-text retrieval based on context anchor attention and DINOv3,CAAD)。该模型采用自监督预训练的DINOv3作为图像编码器来提取更具判别性的视觉特征,在保留关键视觉信息的同时有效减少冗余片段,使模型捕捉更细微的局部细节。同时,设计了上下文锚点注意力模块(Context anchor attention,CAA),通过平均池化和条带卷积操作捕捉长程上下文依赖并聚焦关键区域特征,减少背景信息的干扰,实现更准确的图文检索。在两个基准数据集上进行了大量实验,结果表明CAAD优于当前最先进的细粒度匹配方法。
1 方法
CAAD模型的整体结构如
图1所示。给定图像-文本对(
I,T),首先对文本进行分词处理,并使用视觉编码器DINOv3和预训练的BERT模型
[15]分别提取图像特征与文本特征。接着,设计上下文锚点注意力模块(CAA)来识别与文本相关的图像块。然后,通过语义-视觉校正模块对关键视觉块的语义信息进行校正,得到更准确的语义表示。最终,片段-词对齐模块计算视觉块与文本词汇之间的对齐分数。
1.1 特征提取
在文本特征提取阶段,采用预训练的BERT模型作为文本编码器,将句子T编码为一组词语级别的特征表示,其中,M表示句子中包含的词语数量,d为特征维度。
在图像特征提取阶段,采用DINOv3作为视觉编码器。对于输入图像,首先进行数据增强,将其裁剪为2个全局视角()和8个局部视角(),这些裁剪图像后续被划分为若干个不重叠的图像块,并通过线性投影层嵌入特征序列中。
在嵌入阶段,引入旋转位置编码
[16](Rotary position embedding,RoPE)以及寄存器标记(Register tokens)。RoPE通过旋转操作将位置信息融入向量,能够显式地建模相对位置依赖。同时,RoPE和寄存器标记作为全局锚点用于稳定训练过程。接下来,将特征序列输入至ViT-B/16主干网络,得到最终的视觉特征表示为
,其中,
表示图像的分类标记(CLS token),用于捕获全局语义;
d为特征维度;
表示各个图像块的局部特征。
在训练过程中,遵循DINOv3的多任务联合优化范式,最小化联合损失函数为
,其中,
表示DINO对比损失,其通过对齐教师网络与学生网络在不同视角下的预测,实现了视角不变的表征学习;
表示iBOT掩码图像建模损失,在图像块级别计算教师与学生的分布差异,从而提升模型对局部区域的建模能力;
为KoLeo正则化项,利用Kozachenko-Leonenko熵估计作为惩罚,鼓励特征分布的均匀性与多样性
[17];
用于平衡KoLeo正则化项与其他两项自监督损失,参考DINOv3的原始工作
[14],将
λ设置为0.1。
1.2 上下文锚点注意力
传统交叉注意力机制主要关注局部区域或短程特征关联,容易忽略远程依赖信息,从而导致不准确的图文匹配
[2]。为此,引入上下文锚点注意力(CAA),以有效捕获长程上下文信息。CAA适用于包含大面积背景或干扰因素较多的图像场景。同时,相较于仅针对单一模态设计的注意力机制,CAA更自然地适应多模态数据处理,能够提升检索的准确性与效率。CAA结构如
图2所示。
首先,将特征提取阶段得到的输入特征图输入至CAA模块,然后提取全局上下文特征,通过全局平均池化操作获得整体区域的语义信息,并经卷积层进一步压缩,得到全局特征图,表示为,其中,表示核尺寸为1×1的卷积操作,表示全局平均池化操作。
为了在保持计算高效的同时扩大感受野,CAA使用条带卷积,采用水平方向和垂直方向的深度可分离卷积操作来替代大尺度卷积。首先,对池化后的特征图施加水平方向的深度卷积,即,其中,表示核尺寸为1×的深度卷积操作。其次,对其结果再施加垂直方向的深度卷积,即,其中,表示核尺寸为×1的深度卷积操作,卷积核大小由层数决定,定义为。接着,输出特征通过一个卷积与Sigmoid激活函数生成注意力权重,即。最终,将注意力权重作用于原始特征图,并通过逐元素乘法与加法实现特征增强,即,其中,表示逐元素乘法,表示逐元素加法。而增强后的特征图经过一个卷积层得到最终输出,即。
1.3 损失函数
为获得稳健的跨模态对齐,采用由双向三元组对比损失与比例约束损失共同组成的联合损失函数,具体表示为。
给定一对正样本(I,T),其中图像的图像块特征经CAA模块增强后输入到片段-词对齐模块,与文本词向量共同计算细粒度相似度分数,并聚合为图文相似度,进而基于该相似度构建双向三元组对比损失以优化跨模态对齐。经归一化的图像块特征记为,词向量为,则表示为。其次,聚合图文相似度得到。最后,计算双向三元组对比损失,在一个mini-batch中,对每个正样本(I,T),选取最难负样本,,得到,其中,,为边界参数。
为抑制冗余图像块干扰,提升对齐稳定性,引入选择比例约束,采用均值近似实际选择率:,,其中,为目标选择率。在推理阶段,先根据选择率,保留个图像块,再根据聚合比率进一步压缩为个有效图像块,以平衡计算效率与对齐精度。
2 实验
2.1 数据集和评估指标
在图文检索数据集Flickr30K
[18]与MSCOCO
[19]上进行实验,其中每张图像均对应5条文本描述。Flickr30K数据集包含31 000张图像与155 000条文本描述。按照常见的实验设置,将其划分为29 000张训练图像、1 000张验证图像以及1 000张测试图像。MSCOCO数据集包含123 287张图像与616 435条文本描述,将其划分为113 287张训练图像、5 000张验证图像、5 000张测试图像
[20]。为确保实验的可靠性与公平性,针对MSCOCO数据集分别验证两种实验设置下的结果:一是基于完整5 000张测试图像的结果(MSCOCO 5K);二是将5 000张测试图像随机分为5组,每组1 000张,计算其5折交叉验证的平均结果(MSCOCO 1K)。
评估指标采用召回率(R@K)作为主要度量标准,即在检索结果的前K个候选结果中,正确匹配样本出现的比例。R@1、R@5与R@10分别表示前1、5、10个检索结果中的正确匹配率。为了对比不同方法的整体性能,计算rSum指标,该指标定义为在图像检索文本(Image→Text,I→T)与文本检索图像(Text→Image,T→I)两个方向上所有R@K值的累加和,rSum公式为
2.2 实验配置
文本编码器采用预训练的BERT-Base模型,其输出特征维度为768。视觉编码器采用DINOv3-Base模型,嵌入维度为768,输入图像被分割为16×16的非重叠图像块。所有实验采用深度学习框架PyTorch实现,运行环境为Python 3.8.20与PyTorch 2.4.1,开发工具为Visual studio code 2010,GPU型号为NVIDIA Tesla V100 GPU(32 GB显存)。
训练阶段采用AdamW优化器,初始学习率设为2×10⁻⁴,并使用余弦退火策略动态调整。批量大小设置为64,训练总轮次为30。在损失函数方面,跨模态对齐损失中的间隔参数
设为0.2,比例约束损失中的目标选择率
ρ设为0.8,聚合比率
设为0.6。上述超参数的设置参考并沿用了近期最先进工作
[8]的实验配置,以确保对比的公平性。
2.3 与代表性方法的比较
为验证所提出模型的有效性,将CAAD模型与近年来具有代表性的图文检索模型在Flickr30K数据集和MSCOCO数据集上进行对比,结果如表1—3所示,其中主流图文检索模型包括SCAN、MMCA、GPO、NAAF、CHAN、HREM、CORA、LAPS、TSVC、CSA以及APSE-IPIK
[21]。需要特别说明的是,HREM、CORA和LAPS的实验结果是基于其开源代码在相同超参数设置下复现所得,其他对比模型数据均来自原文,以确保对比结果的公正性与可复现性。
实验结果表明,CAAD模型在大部分指标上优于现有图文检索模型,验证了所提模型的有效性。主要原因可以归结为两点:一是DINOv3的强大表征能力能够有效过滤冗余视觉片段并保留关键视觉信息,从而捕捉到更丰富的细节与高层语义;二是上下文锚点注意力模块能够捕获长距离上下文依赖关系,更加准确地聚焦与文本语义相关的图像区域。
2.4 消融实验
为了更全面地验证所提出的CAA模块与DINOv3图像编码器的有效性,在Flickr30K和MSCOCO 1K数据集上进行了消融实验,结果如
表4所示。从
表4可以观察到,去除CAA与DINOv3后,模型性能显著下降。在MSCOCO 1K数据集上,基础模型
rSum值仅为537.3,当分别引入DINOv3或CAA时,
rSum值分别提升至540.6或541.3,说明二者均对跨模态特征学习具有积极影响。当同时引入两者时,完整模型在MSCOCO 1K数据集上
rSum值达到545.9,在Flickr30K数据集上
rSum值达到546.0,与基础模型相比性能均有所提升,表明两个模块的结合具有明显的协同效应。
DINOv3编码器能够提取多视角视觉特征,使模型能够保留关键局部细节并减少视觉冗余。在MSCOCO 1K/Flickr30K数据集上将rSum从537.3/523.8提升至540.6/527.7,证明了其较强的特征判别力。CAA模块有效缓解了传统交叉注意力在处理冗余背景时的不足。CAA通过全局上下文建模与条带卷积操作,抑制了噪声干扰并聚焦于关键区域,从而大幅提升了跨模态对齐的精度。实验结果显示,采用CAA替代交叉注意力后,rSum从537.3/523.8提升至541.3/528.2,显示了CAA在细粒度语义对齐中的优势。
二者结合后,模型不仅在定量指标上显著提升,更在语义对齐的稳定性与鲁棒性方面表现突出。以MSCOCO 1K数据集为例,CAAD模型rSum值达到545.9,效果优于仅使用DINOv3或CAA变体,说明二者具有明显的互补性,即DINOv3为模型提供了更具判别力的视觉语义表示,而CAA模块通过引入上下文锚点机制实现了全局语义建模,能够高效对齐特征与文本语义。
2.5 定性分析
图3展示了上下文锚点注意力(CAA)与交叉注意力在复杂场景下的热力图对比情况。从
图3可以看到,交叉注意力在多人物或杂乱场景的图像中,注意力权重易扩散到与文本无关的区域,而上下文锚点注意力通过上下文建模与条带卷积,有效聚焦与文本高度相关的区域,抑制冗余视觉片段的干扰,其热力图在关键语义区域呈现出更加集中、清晰的响应,表现出更强的细粒度语义捕捉能力。
为进一步验证所提模型的有效性,在MSCOCO 1K数据集上对CAAD、LAPS以及CSA 3种模型进行了双向检索的定性分析,结果如
图4所示。
图4中绿色框表示检索结果正确,红色框表示检索结果错误。在文本检索图像子任务中,输入一段文本查询后,CAAD能够返回更多符合文本描述的正确图像。在图像检索文本子任务中,输入一张查询图像后,CAAD同样能够返回更多与其图像内容匹配的正确文本描述,说明其在语义推理与细粒度对齐方面具备更强的能力。总体而言,CAAD模型在两项检索子任务中的性能均优于现有图文检索模型,进一步验证了CAAD模型能够有效提升跨模态图文检索的准确性。
2.6 模型复杂度分析
为验证所提CAAD模型在保持性能优势的同时具备较高的计算效率,从参数规模、浮点计算量和推理速度3个方面,将CAAD与最新图文检索模型(CSA和LAPS)进行对比分析,结果如
表5所示。
从
表5的统计结果可以看出,3个模型参数规模总体处于同一量级。CAAD的总参数量为201.4 M,其中CAA模块作为新增的轻量化组件仅包含两层条带卷积和两个1×1卷积层,参数量约1.82 M,占模型总参数量的1.0%,这表明CAAD在引入新机制的同时未明显增加模型复杂度。在输入分辨率相同的条件下,CAAD的浮点计算量低于CSA和LAPS。在单卡NVIDIA Tesla V100(32 GB)环境下,设置批量大小为64进行测试,CAAD的平均推理时间为0.147 s/批次,与CSA和LAPS相比具有一定的效率优势。
3 结论
本文提出了一种基于上下文锚点注意力与DINOv3的图文检索模型CAAD。该模型以自监督学习的DINOv3作为图像编码器,有效提取出高质量且具有判别性的视觉图像特征;同时,CAA模块准确识别与文本描述最相关的图像块,从而实现更精确的跨模态对齐。在Flickr30K与MSCOCO数据集上进行了大量实验,结果表明所提方法在多项指标上显著优于现有的最新方法,验证了其在细粒度图文检索任务中的有效性与先进性。未来研究将探索CAAD在多语种图文检索任务中的应用潜力。通过引入多语言预训练模型,并结合上下文锚点注意力机制,实现不同语言文本与图像语义空间的统一表示,从而增强模型在跨语种图文检索场景下的适应性与泛化能力。
内蒙古自然科学基金项目(2024MS06029)