基于上下文锚点注意力和DINOv3的跨模态图文检索

孙鑫 ,  魏宏喜 ,  贺超

内蒙古大学学报(自然科学版) ›› 2026, Vol. 57 ›› Issue (3) : 234 -242.

PDF (2567KB)
内蒙古大学学报(自然科学版) ›› 2026, Vol. 57 ›› Issue (3) : 234 -242. DOI: 10.13484/j.nmgdxxbzk.20260302
人工智能

基于上下文锚点注意力和DINOv3的跨模态图文检索

作者信息 +

Cross-Modal Image-Text Retrieval Framework Based on Context Anchor Attention and DINOv3

Author information +
文章历史 +
PDF (2628K)

摘要

图文检索的核心在于准确学习图像与文本之间的语义关联。针对复杂场景下传统细粒度匹配存在的视觉片段冗余与对齐偏差问题,提出了一种基于上下文锚点注意力与DINOv3的图文检索模型CAAD。该模型利用DINOv3提取更丰富的视觉特征,并通过上下文锚点注意力捕捉长程上下文依赖,增强图像整体语义理解,提升关键视觉片段与文本的对齐能力。在Flickr30K和MSCOCO数据集上进行实验,结果表明CAAD优于当前最先进的图文检索方法,其rSum分别为546.0和545.9,较最优模型CSA提升14.3%和4.3%。

Abstract

The core of image-text retrieval lies in accurately learning the semantic associations between images and text.To address the issues of visual fragment redundancy and alignment bias in traditional fine-grained matching under complex scenarios, an image-text retrieval model CAAD based on context anchor attention and DINOv3 is proposed.DINOv3 is used as the image encoder to extract richer visual features and context anchor attention is employed by the model to capture long-range contextual dependencies, thereby enhancing the understanding of the overall image semantics and improving the alignment between key visual fragments and text.Experiments conducted on the Flickr30K and MSCOCO datasets show that CAAD outperforms the current state-of-the-art methods for image-text retrieval, achieving rSum scores of 546.0 and 545.9, representing improvements of 14.3% and 4.3% over the best existing model CSA, respectively.

Graphical abstract

关键词

图文检索 / 特征提取 / 上下文锚点注意力 / DINOv3

Key words

image-text retrieval / feature extraction / context anchor attention / DINOv3

引用本文

引用格式 ▾
孙鑫,魏宏喜,贺超. 基于上下文锚点注意力和DINOv3的跨模态图文检索[J]. 内蒙古大学学报(自然科学版), 2026, 57(3): 234-242 DOI:10.13484/j.nmgdxxbzk.20260302

登录浏览全文

4963

注册一个新账户 忘记密码

图文匹配能够突破模态限制,弥补视觉与文本之间的语义鸿沟。其核心挑战在于准确学习跨模态嵌入,实现高质量的语义对齐。根据跨模态交互的实现方式,图文匹配方法可分为两大类:粗粒度匹配和细粒度匹配。在图文匹配的早期研究中,粗粒度方法1将图像和文本编码到一个共享的嵌入空间,然后通过跨模态嵌入的余弦相似性计算语义相似度;细粒度匹配在视觉和文本的局部特征之间进行跨模态交互,再聚合局部对齐结果,得到累积相似度。细粒度匹配方法能显著提升模型的检索性能,成为当前图文检索研究的主要方向。
Lee等2提出了视觉与文本片段之间的注意力机制,旨在聚焦显著对齐并抑制错误对齐,为后续诸多研究提供了启发。MMCA利用自注意力模块和交叉注意力模块,更准确地衡量图像与句子之间的视觉-语义相似度以及模态内的关系3。NAAF采用双分支匹配机制,利用匹配片段的积极作用和非匹配片段的消极作用联合推断整体相似度4。Pan等5提出硬对齐编码方案,仅关注最相关的图像区域-文本词语对,从而准确发现语义对应关系。HREM采用层次关系建模,结合跨模态和跨样本的实例级关系,实现更高质量的语义对齐6。CORA使用场景图表示文本描述,并通过图注意力网络有效编码对象-属性和对象-对象的语义关系7。LAPS以语言感知为核心,基于文本信息精准筛选关键图像区域,降低计算复杂度与冗余8。Liu等9提出跨尺度对齐模型,生成位置-共现感知子序列并融合为语义单元,再用自适应语义剔除弱关联。Lyu等10针对标注噪声提出基于互信息变化的软标签估计与分布自适应软边际损失。
然而,大多数细粒度匹配的学习过程仍存在两个问题:(1)细粒度匹配通常采用传统交叉注意力机制完成两种模态特征的对齐,即通过计算视觉片段特征向量与文本单词向量之间的交叉注意力分数,来衡量每个视觉片段与文本描述的相关性。但这种方法存在缺陷,如果文本描述和视觉片段中包含与检索任务无关的内容,交叉注意力会错误地为这些部分分配较高权重,从而影响匹配质量。(2)当前细粒度匹配方法使用Swin Transformer和ViT等视觉编码器,将图像分割为多个非重叠的视觉片段并编码视觉特征11。这种分割方式会导致片段冗余问题,即图像中不重要的背景区域或与文本无关的区域会产生大量冗余视觉片段掩盖关键视觉片段,最终导致对齐误差的累积12
为解决上述问题,本文提出一种基于上下文锚点注意力13和DINOv314的图文检索模型(Image-text retrieval based on context anchor attention and DINOv3,CAAD)。该模型采用自监督预训练的DINOv3作为图像编码器来提取更具判别性的视觉特征,在保留关键视觉信息的同时有效减少冗余片段,使模型捕捉更细微的局部细节。同时,设计了上下文锚点注意力模块(Context anchor attention,CAA),通过平均池化和条带卷积操作捕捉长程上下文依赖并聚焦关键区域特征,减少背景信息的干扰,实现更准确的图文检索。在两个基准数据集上进行了大量实验,结果表明CAAD优于当前最先进的细粒度匹配方法。

1 方法

CAAD模型的整体结构如图1所示。给定图像-文本对(I,T),首先对文本进行分词处理,并使用视觉编码器DINOv3和预训练的BERT模型15分别提取图像特征与文本特征。接着,设计上下文锚点注意力模块(CAA)来识别与文本相关的图像块。然后,通过语义-视觉校正模块对关键视觉块的语义信息进行校正,得到更准确的语义表示。最终,片段-词对齐模块计算视觉块与文本词汇之间的对齐分数。

1.1 特征提取

在文本特征提取阶段,采用预训练的BERT模型作为文本编码器,将句子T编码为一组词语级别的特征表示T=t1,,tMRM×d,其中,M表示句子中包含的词语数量,d为特征维度。

在图像特征提取阶段,采用DINOv3作为视觉编码器。对于输入图像I,首先进行数据增强,将其裁剪为2个全局视角(256×256)和8个局部视角(112×112),这些裁剪图像后续被划分为若干个不重叠的图像块,并通过线性投影层嵌入特征序列中。

在嵌入阶段,引入旋转位置编码16(Rotary position embedding,RoPE)以及寄存器标记(Register tokens)。RoPE通过旋转操作将位置信息融入向量,能够显式地建模相对位置依赖。同时,RoPE和寄存器标记作为全局锚点用于稳定训练过程。接下来,将特征序列输入至ViT-B/16主干网络,得到最终的视觉特征表示为V=vcls,v1,,vNR(N+1)×d,其中,vcls表示图像的分类标记(CLS token),用于捕获全局语义;d为特征维度;vi表示各个图像块的局部特征。

在训练过程中,遵循DINOv3的多任务联合优化范式,最小化联合损失函数为Lpre=LDINO+LiBOT+λ×LKoLeo,其中,LDINO表示DINO对比损失,其通过对齐教师网络与学生网络在不同视角下的预测,实现了视角不变的表征学习;LiBOT表示iBOT掩码图像建模损失,在图像块级别计算教师与学生的分布差异,从而提升模型对局部区域的建模能力;LKoLeo为KoLeo正则化项,利用Kozachenko-Leonenko熵估计作为惩罚,鼓励特征分布的均匀性与多样性17λ用于平衡KoLeo正则化项与其他两项自监督损失,参考DINOv3的原始工作14,将λ设置为0.1。

1.2 上下文锚点注意力

传统交叉注意力机制主要关注局部区域或短程特征关联,容易忽略远程依赖信息,从而导致不准确的图文匹配2。为此,引入上下文锚点注意力(CAA),以有效捕获长程上下文信息。CAA适用于包含大面积背景或干扰因素较多的图像场景。同时,相较于仅针对单一模态设计的注意力机制,CAA更自然地适应多模态数据处理,能够提升检索的准确性与效率。CAA结构如图2所示。

首先,将特征提取阶段得到的输入特征图Xl-1,n(2)输入至CAA模块,然后提取全局上下文特征,通过全局平均池化操作获得整体区域的语义信息,并经1×1卷积层进一步压缩,得到全局特征图,表示为Fl-1pool=C1×1[Pavg(Xl-1,n(2))],其中,C1×1表示核尺寸为1×1的卷积操作,Pavg表示全局平均池化操作。

为了在保持计算高效的同时扩大感受野,CAA使用条带卷积,采用水平方向和垂直方向的深度可分离卷积操作来替代大尺度卷积。首先,对池化后的特征图施加水平方向的深度卷积,即Fl-1,nw=D1×kb(Fl-1,npool),其中,D1×kb表示核尺寸为1×kb的深度卷积操作。其次,对其结果再施加垂直方向的深度卷积,即Fl-1,nh=Dkb×1(Fl-1,nw),其中,Dkb×1表示核尺寸为kb×1的深度卷积操作,卷积核大小kb由层数决定,定义为kb=11+2×l。接着,输出特征通过一个1×l卷积与Sigmoid激活函数生成注意力权重,即Al-1,n=Sigmoid[C1×l(Fl-1,nh)]。最终,将注意力权重作用于原始特征图Pl-1,n,并通过逐元素乘法与加法实现特征增强,即Fl-1,nattn=(Al-1,nPl-1,n)Pl-1,n,其中,表示逐元素乘法,表示逐元素加法。而增强后的特征图经过一个1×1卷积层得到最终输出,即Xl,n(2)=C1×1(Fl-1,nattn)

1.3 损失函数

为获得稳健的跨模态对齐,采用由双向三元组对比损失与比例约束损失共同组成的联合损失函数,具体表示为L=Lalign+Lratio

给定一对正样本(I,T),其中图像I的图像块特征经CAA模块增强后输入到片段-词对齐模块,与文本词向量共同计算细粒度相似度分数,并聚合为图文相似度S(I,T),进而基于该相似度构建双向三元组对比损失以优化跨模态对齐。经归一化的图像块特征记为vĩ,词向量为tj,则Aij表示为Aij=vĩTtj/vĩtj 。其次,聚合图文相似度得到SI,T=1/Nci=1NcmaxjAij+1/Mj=1MmaxiAij。最后,计算双向三元组对比损失,在一个mini-batch中,对每个正样本(I,T),选取最难负样本T^=argmaxjTSI,jI^=argmaxiISi,T,得到Lalign=(I,T) α-SI,T+S(I,T^)++α-SI,T+S(I^,T)+,其中,x+=max(x,0)α为边界参数。

为抑制冗余图像块干扰,提升对齐稳定性,引入选择比例约束,采用均值近似实际选择率:ρ^=1/Ni=1NaiLratio=(ρ-ρ^)2,其中,ρ为目标选择率。在推理阶段,先根据选择率ρ,保留Ns(Ns=ρN)个图像块,再根据聚合比率γ进一步压缩为Nc(Nc=γNs)个有效图像块,以平衡计算效率与对齐精度。

2 实验

2.1 数据集和评估指标

在图文检索数据集Flickr30K18与MSCOCO19上进行实验,其中每张图像均对应5条文本描述。Flickr30K数据集包含31 000张图像与155 000条文本描述。按照常见的实验设置,将其划分为29 000张训练图像、1 000张验证图像以及1 000张测试图像。MSCOCO数据集包含123 287张图像与616 435条文本描述,将其划分为113 287张训练图像、5 000张验证图像、5 000张测试图像20。为确保实验的可靠性与公平性,针对MSCOCO数据集分别验证两种实验设置下的结果:一是基于完整5 000张测试图像的结果(MSCOCO 5K);二是将5 000张测试图像随机分为5组,每组1 000张,计算其5折交叉验证的平均结果(MSCOCO 1K)。

评估指标采用召回率(R@K)作为主要度量标准,即在检索结果的前K个候选结果中,正确匹配样本出现的比例。R@1、R@5与R@10分别表示前1、5、10个检索结果中的正确匹配率。为了对比不同方法的整体性能,计算rSum指标,该指标定义为在图像检索文本(Image→Text,I→T)与文本检索图像(Text→Image,T→I)两个方向上所有R@K值的累加和,rSum公式为

rSum=R@1+R@5+R@10IT+R@1+R@5+R@10TI

2.2 实验配置

文本编码器采用预训练的BERT-Base模型,其输出特征维度为768。视觉编码器采用DINOv3-Base模型,嵌入维度为768,输入图像被分割为16×16的非重叠图像块。所有实验采用深度学习框架PyTorch实现,运行环境为Python 3.8.20与PyTorch 2.4.1,开发工具为Visual studio code 2010,GPU型号为NVIDIA Tesla V100 GPU(32 GB显存)。

训练阶段采用AdamW优化器,初始学习率设为2×10⁻⁴,并使用余弦退火策略动态调整。批量大小设置为64,训练总轮次为30。在损失函数方面,跨模态对齐损失中的间隔参数α设为0.2,比例约束损失中的目标选择率ρ设为0.8,聚合比率γ设为0.6。上述超参数的设置参考并沿用了近期最先进工作8的实验配置,以确保对比的公平性。

2.3 与代表性方法的比较

为验证所提出模型的有效性,将CAAD模型与近年来具有代表性的图文检索模型在Flickr30K数据集和MSCOCO数据集上进行对比,结果如表1—3所示,其中主流图文检索模型包括SCAN、MMCA、GPO、NAAF、CHAN、HREM、CORA、LAPS、TSVC、CSA以及APSE-IPIK21。需要特别说明的是,HREM、CORA和LAPS的实验结果是基于其开源代码在相同超参数设置下复现所得,其他对比模型数据均来自原文,以确保对比结果的公正性与可复现性。

实验结果表明,CAAD模型在大部分指标上优于现有图文检索模型,验证了所提模型的有效性。主要原因可以归结为两点:一是DINOv3的强大表征能力能够有效过滤冗余视觉片段并保留关键视觉信息,从而捕捉到更丰富的细节与高层语义;二是上下文锚点注意力模块能够捕获长距离上下文依赖关系,更加准确地聚焦与文本语义相关的图像区域。

2.4 消融实验

为了更全面地验证所提出的CAA模块与DINOv3图像编码器的有效性,在Flickr30K和MSCOCO 1K数据集上进行了消融实验,结果如表4所示。从表4可以观察到,去除CAA与DINOv3后,模型性能显著下降。在MSCOCO 1K数据集上,基础模型rSum值仅为537.3,当分别引入DINOv3或CAA时,rSum值分别提升至540.6或541.3,说明二者均对跨模态特征学习具有积极影响。当同时引入两者时,完整模型在MSCOCO 1K数据集上rSum值达到545.9,在Flickr30K数据集上rSum值达到546.0,与基础模型相比性能均有所提升,表明两个模块的结合具有明显的协同效应。

DINOv3编码器能够提取多视角视觉特征,使模型能够保留关键局部细节并减少视觉冗余。在MSCOCO 1K/Flickr30K数据集上将rSum从537.3/523.8提升至540.6/527.7,证明了其较强的特征判别力。CAA模块有效缓解了传统交叉注意力在处理冗余背景时的不足。CAA通过全局上下文建模与条带卷积操作,抑制了噪声干扰并聚焦于关键区域,从而大幅提升了跨模态对齐的精度。实验结果显示,采用CAA替代交叉注意力后,rSum从537.3/523.8提升至541.3/528.2,显示了CAA在细粒度语义对齐中的优势。

二者结合后,模型不仅在定量指标上显著提升,更在语义对齐的稳定性与鲁棒性方面表现突出。以MSCOCO 1K数据集为例,CAAD模型rSum值达到545.9,效果优于仅使用DINOv3或CAA变体,说明二者具有明显的互补性,即DINOv3为模型提供了更具判别力的视觉语义表示,而CAA模块通过引入上下文锚点机制实现了全局语义建模,能够高效对齐特征与文本语义。

2.5 定性分析

图3展示了上下文锚点注意力(CAA)与交叉注意力在复杂场景下的热力图对比情况。从图3可以看到,交叉注意力在多人物或杂乱场景的图像中,注意力权重易扩散到与文本无关的区域,而上下文锚点注意力通过上下文建模与条带卷积,有效聚焦与文本高度相关的区域,抑制冗余视觉片段的干扰,其热力图在关键语义区域呈现出更加集中、清晰的响应,表现出更强的细粒度语义捕捉能力。

为进一步验证所提模型的有效性,在MSCOCO 1K数据集上对CAAD、LAPS以及CSA 3种模型进行了双向检索的定性分析,结果如图4所示。图4中绿色框表示检索结果正确,红色框表示检索结果错误。在文本检索图像子任务中,输入一段文本查询后,CAAD能够返回更多符合文本描述的正确图像。在图像检索文本子任务中,输入一张查询图像后,CAAD同样能够返回更多与其图像内容匹配的正确文本描述,说明其在语义推理与细粒度对齐方面具备更强的能力。总体而言,CAAD模型在两项检索子任务中的性能均优于现有图文检索模型,进一步验证了CAAD模型能够有效提升跨模态图文检索的准确性。

2.6 模型复杂度分析

为验证所提CAAD模型在保持性能优势的同时具备较高的计算效率,从参数规模、浮点计算量和推理速度3个方面,将CAAD与最新图文检索模型(CSA和LAPS)进行对比分析,结果如表5所示。

表5的统计结果可以看出,3个模型参数规模总体处于同一量级。CAAD的总参数量为201.4 M,其中CAA模块作为新增的轻量化组件仅包含两层条带卷积和两个1×1卷积层,参数量约1.82 M,占模型总参数量的1.0%,这表明CAAD在引入新机制的同时未明显增加模型复杂度。在输入分辨率相同的条件下,CAAD的浮点计算量低于CSA和LAPS。在单卡NVIDIA Tesla V100(32 GB)环境下,设置批量大小为64进行测试,CAAD的平均推理时间为0.147 s/批次,与CSA和LAPS相比具有一定的效率优势。

3 结论

本文提出了一种基于上下文锚点注意力与DINOv3的图文检索模型CAAD。该模型以自监督学习的DINOv3作为图像编码器,有效提取出高质量且具有判别性的视觉图像特征;同时,CAA模块准确识别与文本描述最相关的图像块,从而实现更精确的跨模态对齐。在Flickr30K与MSCOCO数据集上进行了大量实验,结果表明所提方法在多项指标上显著优于现有的最新方法,验证了其在细粒度图文检索任务中的有效性与先进性。未来研究将探索CAAD在多语种图文检索任务中的应用潜力。通过引入多语言预训练模型,并结合上下文锚点注意力机制,实现不同语言文本与图像语义空间的统一表示,从而增强模型在跨语种图文检索场景下的适应性与泛化能力。

参考文献

[1]

张振兴,王亚雄.图文跨模态检索研究综述[J].北京交通大学学报202448(2):23-36.

[2]

LEE K HCHEN XHUA Get al.Stacked cross attention for image-text matching[C]//Computer Vision-ECCV 2018.Cham:Springer International Publishing,2018:212-228.

[3]

WEI XZHANG T ZLI Yet al.Multi-modality cross attention network for image and sentence matching[C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition.Seattle,WA,USA:IEEE,2020:10938-10947.

[4]

ZHANG KMAO Z DWANG Qet al.Negative-aware attention framework for image-text matching[C]//2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition.New Orleans,LA,USA:IEEE,2022:15640-15649.

[5]

PAN Z XWU F YZHANG B L.Fine-grained image-text matching by cross-modal hard aligning network[C]//2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition.Vancouver,BC,Canada:IEEE,2023:19275-19284.

[6]

FU Z RMAO Z DSONG Yet al.Learning semantic relationship among instances for image-text matching[C]//2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition.Vancouver,BC,Canada:IEEE,2023:15159-15168.

[7]

PHAM KHUYNH CLIM S Net al.Composing object relations and attributes for image-text matching[C]//2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition.Seattle,WA,USA:IEEE,2024:14354-14363.

[8]

FU Z RZHANG LXIA Het al.Linguistic-aware patch slimming framework for fine-grained cross-modal alignment[C]//2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition.Seattle,WA,USA:IEEE,2024:26297-26306.

[9]

LIU ZXU J HGAO S Set al.CSA:Cross-scale alignment with adaptive semantic aggregation and filter for image-text retrieval[J].Pattern Recognition2025165:111647.

[10]

LYU S, TIAN Z JOU Z Het al.TSVC:Tripartite learning with semantic variation consistency for robust image-text retrieval[C]//Proceedings of the AAAI Conference on Artificial Intelligence.Menlo Park,CA:AAAI,2025:19269-19277.

[11]

LIU ZLIN Y TCAO Yet al.Swin transformer:Hierarchical vision transformer using shifted windows[C]//2021 IEEE/CVF International Conference on Computer Vision.Montreal,QC,Canada:IEEE,2021:9992-10002.

[12]

LI Y XHOU Q BZHENG Z Het al.Large selective kernel network for remote sensing object detection[C]//2023 IEEE/CVF International Conference on Computer Vision.Paris,France:IEEE,2023:16748-16759.

[13]

CAI X HLAI Q XWANG Y Wet al.Poly kernel inception network for remote sensing detection[C]//2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition.Seattle,WA,USA:IEEE,2024:27706-27716.

[14]

SIMÉONI OVO H VSEITZER Met al.DINOv3[DB/OL].(2025-08-13)[2025-11-01].

[15]

DEVLIN JCHANG M WLEE Ket al.BERT:Pre-training of deep bidirectional transformers for language understanding[C]//Conference on the North American Chapter of the Association for Computational Linguistics-Human Language Technologies.Minneapolis:Association for Computational Linguistics,2019:4171-4186.

[16]

SU J LAHMED MLU Yet al.RoFormer:Enhanced transformer with rotary position embedding[J].Neurocomputing2024568:127063.

[17]

SABLAYROLLES ADOUZE MSCHMID Cet al.Spreading vectors for similarity search[DB/OL].(2019-08-30)[2025-11-01].

[18]

YOUNG PLAI AHODOSH Met al.From image descriptions to visual denotations:New similarity metrics for semantic inference over event descriptions[J].Transactions of the Association for Computational Linguistics20142:67-78.

[19]

LIN T YMAIRE MBELONGIE Set al.Microsoft COCO:Common objects in context[C]//Computer Vision-ECCV 2014.Cham:Springer International Publishing,2014:740-755.

[20]

张飞飞,马泽伟,周玲,.图文跨模态检索研究进展[J].数据采集与处理202338(3):479-505.

[21]

CHEN J CHU H XWU Het al.Learning the best pooling strategy for visual semantic embedding[C]//2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition.Nashville,TN,USA:IEEE,2021:15784-15793.

[22]

HUANG XWANG S LJIA Tet al.Adaptive prompt-based semantic embedding with inspire potential of implicit knowledge for cross-modal retrieval[J].AAAI Technical Track on Machine Learning Ⅱ202539(16):17485-17493.

基金资助

内蒙古自然科学基金项目(2024MS06029)

AI Summary AI Mindmap
PDF (2567KB)

116

访问

0

被引

详细

导航
相关文章

AI思维导图

/