知识增强与协同推理的视觉常识推理方法

李星悦 ,  韩春燕 ,  鲜雨成 ,  琚生根 ,  李勤

四川大学学报(自然科学版) ›› 2026, Vol. 63 ›› Issue (4) : 862 -876.

PDF (2348KB)
四川大学学报(自然科学版) ›› 2026, Vol. 63 ›› Issue (4) : 862 -876. DOI: 10.19907/j.0490-6756.250369
计算机科学

知识增强与协同推理的视觉常识推理方法

作者信息 +

Knowledge-augmented collaborative reasoning for visual commonsense reasoning

Author information +
文章历史 +
PDF (2404K)

摘要

视觉常识推理(Visual Commonsense Reasoning, VCR)旨在让模型像人类一样基于图像进行认知推理,现有方法主要依赖大规模跨模态预训练模型进行隐式跨模态建模,在外部知识引入、上下文建模以及答案与理由一致性方面仍存在不足。针对上述问题,本文提出一种知识增强与协同推理的视觉常识推理框架。该框架通过引入由场景常识图和区域事实描述构成的双层知识注入机制,显式融合场景级常识与实体级视觉事实,从而缓解知识缺失与语义模糊问题;同时,构建基于大语言模型的双任务协同学习框架,联合优化问答与理由推断任务,并通过认知对齐损失增强二者在隐空间中的逻辑一致性。在 VCR 数据集上的实验结果表明,所提出的框架能够有效提升模型的推理性能,其中在联合任务 Q→AR 上相比当前代表性方法提升 4.2 个百分点,验证了知识增强与协同推理策略的有效性。

Abstract

Visual Commonsense Reasoning (VCR) aims to enable models to perform human-like cognitive reasoning based on images. Although existing methods primarily rely on large-scale cross-modal pre-trained models for implicit cross-modal modeling, they still fall short in terms of external knowledge incorporation, contextual modeling, and the consistency between answers and rationales. To address these limitations, the paper propose a knowledge-augmented collaborative reasoning framework for VCR. The proposed framework introduces a dual-layer knowledge injection mechanism comprising scene commonsense graphs and regional factual descriptions. By explicitly integrating scene-level commonsense with entity-level visual facts, this mechanism mitigates knowledge deficiency and semantic ambiguity. Meanwhile, a dual-task collaborative learning framework based on large language models is designed to jointly optimize question answering and rationale inference. A cognitive alignment loss is further employed to enhance the logical consistency between the two tasks in the latent space. Experimental results on the VCR benchmark demonstrate that the proposed framework effectively improves model reasoning performance. Notably, it outperforms state-of-the-art baselines by 4.2 percentage points on the joint Q→AR task, thereby validating the effectiveness of the knowledge-augmented collaborative reasoning strategy.

Graphical abstract

关键词

大语言模型 / 视觉常识推理 / 知识增强 / 协同学习

Key words

Large language models / visual commonsense reasoning / knowledge enhancement / collaborative learning

引用本文

引用格式 ▾
李星悦,韩春燕,鲜雨成,琚生根,李勤. 知识增强与协同推理的视觉常识推理方法[J]. 四川大学学报(自然科学版), 2026, 63(4): 862-876 DOI:10.19907/j.0490-6756.250369

登录浏览全文

4963

注册一个新账户 忘记密码

视觉常识推理(Visual Commonsense Reasoning,VCR)1旨在从复杂视觉场景中结合视觉线索与隐含常识知识,对问题进行推断并给出合理答案及其理由。与传统视觉问答任务不同,VCR 不仅要求模型具备目标识别能力,还需理解人物行为、社会规范及因果关系等高层语义信息2,因此被视为检验多模态模型认知推理能力的重要基准。
自VCR任务提出以来,相关研究主要围绕推理结构与多模态表示学习展开,形成两条技术路线:一类为结构化推理模型,通过注意力机制或图神经网络对图像实体及关系进行显式建模,并与文本信息交互融合;另一类基于视觉-语言预训练模型(Vision-Language Pretraining, VLP)及多模态大语言模型(Multimodal Large Language Models, MLLM),在大规模图文数据上学习统一语义表示并迁移至 VCR 任务。随着Transformer3、BERT4等模型的发展,视觉-文本联合建模方法5-6不断涌现,并在多项任务上取得良好效果。近年来,大语言模型及其多模态扩展7-8进一步提升了复杂视觉语境下的推理能力。
尽管上述方法取得进展,但在视觉常识推理中仍存在瓶颈。如图1所示,在判断人物是否“计划犯罪”时,模型不仅需要识别视觉内容,还需结合“头巾(bandana)”“隐蔽地点(secluded place)”与“帮派(gang)”等概念之间的社会常识关联。
外部常识是视觉常识推理的重要支撑,但现有模型多依赖训练数据中的隐式统计相关性,缺乏显式建模,导致处理隐含语义与复杂因果关系时能力受限。其次,现有方法在视觉上下文建模方面仍较粗糙,相关工作9-11多侧重局部区域或单次交互的跨模态对齐,难以刻画跨实体的细粒度语义关系,从而影响复杂场景下推理稳定性。最后,在 VCR 的多阶段推理设置中,问题回答(Q→A)与理由推断(QA→R)通常被独立建模,缺乏协同约束,易导致答案与理由语义不一致,削弱推理结果的可信度。
针对上述挑战,本文提出一种知识增强与协同推理的视觉常识推理框架(Knowledge-Augmented Collaborative Reasoning for Visual Commonsense Reasoning, KACR)。该方法通过构建场景常识图(Scene Commonsense Graph,SCG)引入外部知识,并利用区域事实描述(Visually-Grounded Factual Description,VGFD)补充细粒度视觉信息,从而实现多层次语义建模。同时,设计双任务协同学习机制,对问答与理由推断进行联合优化,并通过认知对齐损失(Cognitive Alignment Loss)增强两者在表示空间中的一致性。实验结果表明,该方法在 VCR 数据集上取得了优于多种基线方法的性能。
本文贡献是:1) 针对现有方法在外部常识利用与细粒度上下文建模方面的不足,提出了一种基于大语言模型的知识增强与协同推理框架。本文将场景常识图(SCG)与区域事实描述(VGFD)协同引入推理过程,通过显式注入社会规范、文化背景及隐含因果信息,有效突破了视觉常识推理中普遍存在的常识匮乏与语义模糊瓶颈。2) 为解决传统独立建模导致的问答与理由割裂问题,构建了基于大语言模型的双任务协同学习机制。具体而言,本文采用共享的视觉-语言编码结构,实现了问答与理由推断两个子任务在同一体系下的联合优化。此外,通过引入认知对齐损失,在潜在表示空间中对双任务的表征施加约束,从而显式建模了答案与理由之间的因果关联,进一步增强了模型的推理稳定性。3) 在VCR数据集上的实验结果表明,我们提出的框架能够有效提升模型的推理性能,验证了知识增强与协同推理策略的有效性。

1 相关工作

1.1 传统视觉常识推理方法

早期视觉常识推理研究围绕 VCR 任务构建特定模型,通过独立视觉与语言编码模块获取图像区域特征和文本表示,并在多模态空间中融合推断12。以 R2C1为代表的工作确立了“特征提取-多模态融合-推理预测”范式,后续研究在特征表达、跨模态对齐及推理结构方面进行了改进13-16。但该类方法推理能力依赖人工设计结构,对复杂隐含语义与常识关系的建模仍然有限。

1.2 基于视觉-语言预训练与大模型的VCR算法

随着视觉-语言预训练范式的发展,VCR 研究转向基于大规模预训练多模态模型的迁移学习方法,在图文数据上学习统一跨模态表示并应用于下游推理任务,从而提升视觉与语言的对齐能力17-19。早期模型通过跨模态自监督任务学习联合表示,并在 VCR 任务中分别微调;后续研究引入细粒度区域-文本对齐机制,验证其对复杂视觉推理的重要性20。然而,这类方法通常将常识隐式编码于模型参数中,缺乏显式推理建模,限制了可解释性与稳健性。

近年来,大语言模型如 GPT21、LLaMa22、Qwen23及其多模态扩展进一步推动该方向发展。相关方法将视觉特征映射至语言空间,通常采用 ViT24或 CLIP25提取视觉特征,从而利用大语言模型的语义理解与推理能力26-27。但其推理仍依赖预训练阶段的统计知识,缺乏针对具体视觉场景的显式常识建模,同时计算与存储开销也限制了复杂视觉常识推理中的应用。在此背景下,Qwen-VL 在中文语义理解与跨模态推理任务上表现良好,为视觉常识推理提供基础模型支撑。

1.3 VCR中的外部知识利用

鉴于仅依赖视觉特征难以捕捉高层社会语义,部分研究引入外部知识库增强视觉常识推理能力。相关方法通常基于 ConceptNet28、ATOMIC29等常识知识库检索与视觉实体相关知识,并通过图神经网络等方式融合30。然而,通用知识库在场景适应性方面存在局限,难以刻画具体场景中的人物意图与社会规范;同时,粗粒度视觉区域建模制约了外部知识与视觉实例之间的精确对齐,限制了复杂场景中的推理效果。

2 任务定义

视觉常识推理(VCR)旨在根据视觉场景回答问题并提供合理的逻辑解释。其输入包括图像I、目标边界框集合B(Bounding Boxes)、自然语言问题Q,以及候选答案集合A和候选理由集合R。其中,B为问题与选项中的实体提供精确的视觉定位,使模型需要具备跨模态的指代理解能力。

视觉常识推理任务通常包含两个子任务:1) 问题到答案(Q→A),即从候选答案中选择正确答案;2) 答案到理由(QA→R),即在给定正确答案的条件下,选择与之匹配的合理理由,分别描述为式(1)式(2)

A+=argmaxAiAfAAi|Q,I,B

其中,A+表示正确答案,fA是针对Q→A任务的预测模型。

R+=argmaxRiRfRRi|Q,I,B,A+

其中,R+表示正确理由,fR是针对QA→R任务的预测模型。

此外,VCR 还定义了联合任务Q→AR(Question to Answer and Rationale, Q→AR),要求模型同时预测正确答案及其支撑理由。该任务采用严格的联合评估标准,只有当Q→A与QA→R均预测正确时,预测结果才被视为正确。因此,模型通常在训练阶段分别学习两个子任务,并在测试阶段综合评估其整体推理能力。

3 模型

本文提出一种知识增强与协同推理框架。如图2所示,首先构建上下文信息:将图像区域特征转化为文本化区域事实描述(VGFD),捕捉显性视觉细节;同时利用 ConceptNet 和 ATOMIC 外部知识库构建场景常识图(SCG),获取隐性常识。两类信息整合为结构化文本序列,作为多模态大语言模型的增强输入,从而缓解视觉常识缺失与上下文模糊问题。其次,设计基于 Qwen2-VL 的双任务联合学习框架,通过共享视觉语言编码器和并行分类器,实现Q→A与QA→R任务的协同训练。最后,引入认知对齐损失,通过约束两个任务在隐藏空间中的表征相似性,对齐答案预测与理由生成的语义空间,增强两者的内在逻辑关联。后续小节将对各模块进行详细阐述。

3.1 场景常识图构建

为弥补多模态大语言模型的常识不足,本文构建场景常识图(SCG)作为外部知识注入模块。该过程包括多模态核心概念提取、外部知识库检索以及上下文感知知识精炼等三个阶段。

3.1.1 多模态核心概念提取

推理的起点是识别场景中的关键概念,这些概念既存在于视觉模态,也体现在文本描述中。因此,我们从图像和文本两个维度提取核心概念。

VCR数据集为关键对象提供实体标签和边界框。为在语言模型中明确指代这些视觉元素,我们进行实体接地,并根据数据集索引为每个实体分配唯一标识符,从而将视觉区域转化为离散符号,形成场景图的初始节点集Vobject

其次,利用多模态大语言模型完成视觉关系抽取。实体间的空间布局、社交互动和属性关系构成场景理解的基础。传统场景图生成方法受限于封闭标签集和大量标注数据,本文将多模态大语言模型(Gemini-2.5-flash)作为零样本关系推理引擎,在不依赖额外标注的情况下推断实体间关系。通过输入原始图像及实体边界框信息,并设计结构化提示,引导模型以(Subject,Relation,Object)三元组形式输出关系,从而构建视觉关系集合 Vimg,为后续场景常识图建模与知识增强推理提供结构化基础。

最后,从文本侧提取与推理相关的概念。VCR推理通常由动作、状态及抽象概念驱动,因此对问题Q、候选答案集合{Ai}i=14以及候选理由集合{R}i=14进行语言分析,采用词性标注技术提取名词、动词和形容词,形成文本概念集Vtext。最终核心概念集合为𝒦seed=VimgVtext

3.1.2 常识知识库检索

为构建覆盖全面的知识体系,我们并行从 ConceptNet和ATOMIC两个互补外部知识库进行检索。ConceptNet提供实体属性类常识,ATOMIC提供事件与社交互动因果知识。对于关键词集合𝒦seed中的每个关键词k𝒦seed,从本地知识库检索前N个相关三元组τ=(hrt),并构建原始知识池τraw,作为后续上下文筛选与场景常识图构建的基础。

3.1.3 上下文感知的知识精炼

由于从多源知识库中检索得到的原始知识三元组包含大量噪声,若直接注入模型,既会干扰推理过程,也难以保证与当前场景的一致性。为此,我们构建了一种基于视觉-语言对齐的知识精炼机制,以同时约束“与当前问题相关”与“与当前图像一致”这两个维度。

首先,将知识库中符号化的三元组τ=h,r,t统一转写为自然语言句子Sτ。该文本化(Textualization)过程通过预定义模板函数Sτ=ftextualizeh,r,t完成。这一操作使得后续可以在统一的语言空间中度量知识与视觉场景之间的关联性。

随后,为评估单条知识与当前视觉场景的匹配程度,我们采用在大规模图文对上预训练的视觉-语言模型 CLIP(Contrastive Language-Image Pre-training)。具体而言,利用 CLIP 的图像编码器将整张图像I映射为视觉特征向量vI=fimg(I),并使用其文本编码器将每个知识句子Sτ加上问题答案映射为文本特征向量vqaτ=ftextSqaτ。二者在共享嵌入空间中的相关性通过余弦相似度计算:

simτ,I=vIvqaτvIvqaτ

对于由关键词集Kseed检索得到的原始三元组集合τraw,我们依据sim(τ,I)对其中元素进行降序排序,并在每个关键词对应的候选集合内仅保留得分最高的MTop条三元组,得到精炼后的知识集合:

τ*={τ(1),τ(2),,τ(Mtop)}

其中τ(i)表示将τraw按sim(τI)从高到低排序后的第i个三元组,Mtop为预设的保留条数。

通过上述精炼过程,保留下来的知识三元组不仅在语义层面与推理问题高度相关,而且在视觉-语言对齐空间中与当前图像保持一致,从而构成一个规模可控、语义与视觉双重约束的场景图:

G=K,τ*

最终,这些精选知识将与前述视觉实体描述一并格式化为结构化场景图提示,作为输入注入多模态大语言模型,支持后续的协同推理过程。

3.2 区域事实描述

在通过外部知识库构建场景图之后,视觉常识推理的另一关键挑战在于对实体本身进行深入且准确的理解。单纯依赖边界框内的像素信息,难以支撑涉及实体属性、状态及身份的高阶推理。VCR 问题常涉及人物身份、物体属性及行为语义等图像难以直接提供的背景知识。因此,我们设计了视觉接地的区域事实描述(VGFD)模块,其中“视觉接地”强调生成的事实描述必须严格锚定于对应实体的可观察视觉区域,避免依赖语言先验或主观推断。该模块利用多模态大语言模型为每个视觉实体生成结构化、上下文无偏的事实性描述。

本模块旨在为场景图中的每个实体节点提供精确、客观的视觉证据补充,与第 3.1 节中挖掘抽象因果与社交关系的常识图谱形成互补。我们限定生成内容为事实性描述,仅关注实体固有属性及图像中可观察特征,从而为后续推理提供稳固的知识基础,并确保推理起点来源于可观察的场景事实。详细指令模板如图3所示。

该模块的具体实现流程如下:对于在第3.1.1节中经过多模态核心提取得到的每一个视觉实体(如 person_1, dog_1),我们提取其在原始图像中对应的边界框裁切图Icrop。随后,我们利用一个大语言模型Gemini-2.5-flash作为描述生成器。为了确保输出的客观性和事实性,我们设计了一个高度约束的指令提示,该提示与实体裁切图Icrop一同作为大语言模型的输入。

该指令明确规定了生成内容的边界:仅描述图像可见属性:严格基于 Icrop中的视觉信息,描述实体的外观、姿态、颜色和衣着等。禁止主观与认知推断:不推断实体的动机、意图、情绪或未来可能发生的事件。例如,不使用happy、angry等情绪化词汇。避免社交与关系推理:不描述实体间的潜在关系或进行任何形式的社交场景解读。

通过此方法,对于图像中的 person_1,模块能够生成如“person_1 is a man with short, light-colored hair, wearing a dark blue uniform with a round patch on the chest.”这样的高质量事实描述,而非“person_1 looks happy and is greeting someone.”这样的推理性描述。

最终,每个实体生成的区域事实描述将作为其节点的丰富属性,与第3.1节中精炼的常识知识三元组一同被整合进最终的结构化提示Prompt中。这使得每个实体从一个抽象的符号(如 person_1)转变为一个拥有详细、视觉接地属性的丰富表征。这种双重知识注入策略结合了抽象的关系知识和具象的实体描述,且共同为核心的协同推理框架提供了全面、多维度的知识支持,显著提升了模型在复杂场景下的理解与推理能力。

3.3 知识驱动的多模态输入构建

为了实现对复杂视觉场景的深度理解与推理,我们提出了一种新颖的、基于知识增强的双任务协同感知框架。该框架通过三个核心阶段进行运作:1) 知识驱动的多模态输入构建;2) 基于共享骨干网络的双任务联合编码;3) 通过认知状态对齐实现的协同学习。下面将详细阐述其技术细节。

推理的质量高度依赖于输入信息的完备性。因此,我们首先构建一个富含上下文信息的多模态输入流,该输入流整合了原始视觉信息、文本查询以及前序章节生成的结构化知识。

为了避免无关知识引入噪声,我们采用动态关联与筛选策略来选取与当前推理任务最相关的知识。具体而言,对于一个给定的问题(Question)、候选答案(Answer Choices)和候选理由(Rationale Choices),我们将其文本内容拼接成一个查询上下文Tcontext。然后,我们遍历第3.2节中为每个视觉实体生成的区域事实描述,仅保留那些实体名称在Tcontext中被提及的描述。

在此基础上,我们将筛选后的知识与原始任务信息共同整合到一个层次化的 Prompt 模板中该模板旨在模拟人类的认知流程:从感知整体到聚焦细节,再到运用知识进行推理。该层次化Prompt包含以下4个部分:1) 场景上下文(Scene Context): 对任务的总体介绍。2) 场景常识知识(Scene Commonsense Knowledge): 注入筛选后的场景常识图知识,提供关系和常识背景。3) 区域事实描述(Visually-Grounded Factual Description): 注入筛选后的区域事实描述,提供实体层面的视觉细节。4) 任务指令(Task Instruction):明确陈述具体任务,即问题和相应的选项。

我们为问答(Q→A)和理由选择(QA→R)两个子任务分别构建了两个不同的Prompt包括PQAPQARPQAR的特殊之处在于其“任务指令”部分包含了正确的答案,从而将任务聚焦于为何这个答案是正确的。此方式将离散的视觉特征转化为大语言模型易于理解和推理的语言化场景表示。

3.4 基于统一编码的双任务协同推理

本框架的核心是一个基于 Qwen2-VL 的共享视觉语言大模型,其在整体架构中作为统一的共享骨干网络(Shared Backbone Network),以协同处理问答(Q→A)与理由推断(QA→R)两个子任务。此阶段首先对第3.3节构建的多模态输入进行统一编码,然后通过特定的损失函数进行联合优化。

Qwen2-VL作为一个端到端的多模态大语言模型,其处理器(Processor)能够将异构的图像和文本数据统一编码到共享的嵌入空间中。

首先,进行文本特征提取,对于第3.3节生成的两个结构化提示PQAPQAR,文本特征提取流程先进行分词处理,利用Qwen2-VL内置的分词器将提示文本分解为一系列子词(Subword Tokens)分别TQATQAR,有效处理大规模词表和未登录词问题。通过词嵌入操作,将每个token根据其在词汇表中的索引,被映射到一个高维的预训练词嵌入向量,形成初始的文本嵌入序列,因此有

EtextQA=fembedTQARLA×d
EtextQAR=fembedTQARRLR×d

其中,TQATQAR是分词后的token序列,fembed代表词嵌入查找函数,它将每个token映射到词嵌入矩阵中的对应后,得到初始的词嵌入序列EtextQAEtextQAR这些嵌入序列随后被送入模型的Transformer层,并在其中与位置编码结合,使模型能够理解文本的语序和结构。最终生成的这两个独立的文本特征序列,将分别与共享的视觉特征进行融合。

其次,进行图像预处理与特征编码,不同于采用独立视觉编码器的两阶段方法,本框架利用 Qwen2-VL的统一流程进行图像处理。1) 输入图像经内置处理器进行标准化预处理,以适配模型输入维度。2) 视觉编码器将图像划分为Patch并线性投影为嵌入向量,形成视觉Token序列。这些视觉Token直接与由问题、答案及理由构成的文本Token序列拼接,共同送入多层Transformer编码器进行交互建模。该机制确保了图像隐表示在统一的多模态空间中既保留局部细节,又实现了与文本语义的深度对齐。

最终,这一过程的输出是图像的高维特征序列EimgRLV×d,其中LV是视觉token的数量,d是嵌入维度。与传统方法关键的不同在于,这一视觉特征提取过程并非孤立进行。在Qwen2-VL的统一框架下,Eimg与第3.4节中生成的文本特征EtextQAEtextQAR被同时送入模型的主体部分。

3.4.1 共享骨干网络与统一表示学习

传统的视觉推理方法常采用解耦的流水线模式,即为“回答”和“解释”两个子任务分别设计独立的模型或解码头。这种范式虽然直接,但存在两个固有缺陷:1) 它导致了信息孤岛,模型在两个任务间无法进行有效的信息交互与知识迁移;2) 它忽略了两个任务在认知层面的内在一致性,即正确的答案和合理的解释应源于对场景的同一份连贯理解。

为克服上述局限性,本框架的核心设计之一是采用一个共享的骨干网络。具体而言,本文采用Qwen2-VL作为一个统一的视觉语言模型ϕMLLM 其参数在“问答 (Q→A)”与“理由选择 (QA→R)”两个任务的训练过程中是完全共享的。

在本框架中,我们为两个子任务设计了统一的跨模态融合机制。对于每个子任务,其对应的文本特征序列(EtextQAEtextQAR)与共享的视觉特征序列Eimg被一同送入骨干网络ϕMLLM 。该网络由一叠Transformer解码器层构成,通过其内部的交叉注意力(Cross-Attention)机制,实现文本与视觉特征之间深度、交错的融合。该过程可以形式化地表示为:

HQA=ϕMLLM EtextQA,Eimg
HQAR=ϕMLLM EtextQAR,Eimg

其中,HQARLA×dHQARRLR×d分别是两个任务经过骨干网络处理后输出的最终隐藏状态序列LALR是对应输入序列的长度,d是隐藏层维度。

在得到最终的隐藏状态序列之后,我们需要从中提取一个能够概括模型对整条输入(图像、问题、外部知识和候选选项)进行综合推理结果的聚合向量。对于自回归式的大语言模型,序列最后一个token的隐藏状态通常被视为对整个序列信息的最高层级汇聚:通过多层自注意力机制,该位置的表示已递归地融合了先前所有文本与视觉 token 的信息。因此,本文采用最终序列的末位隐藏向量作为高层认知状态向量,用作后续分类决策和任务对齐的基础表征。

在双任务设定下,我们分别从问答与理由选择两个子任务的最终隐藏状态序列中提取对应的认知状态向量。具体而言,对问答任务,我们从序列HQARLA×d中取最后一个位置的隐藏向量,记为hQARd,它浓缩了模型为回答问题Q而对整个场景进行分析与推理后形成的内部表征;对理由选择任务,我们从序列HQARRLR×d中取最后一个位置的隐藏向量,记为hQARRd,表示在已知正确答案Acorrect的前提下,模型为寻找最合理解释R而形成的认知状态。后续的认知对齐损失直接作用于hQAhQAR,用于约束两种认知状态在表示空间中的对齐;同时,这两个向量也分别作为各自子任务分类头的输入,是协同学习与联合优化的关键中间表示。

3.5 协同学习与联合优化

在提取出分别代表“回答”和“解释”两个任务的认知状态向量hQAhQAR后,本框架的最后阶段是通过一个精心设计的联合优化目标,以协同学习(Collaborative Learning)的方式对整个模型进行端到端的训练。该优化目标旨在达成两个核心目的:1) 确保模型在每个子任务上都能做出准确的预测;2) 强制模型在两个任务的推理过程中保持内在的认知一致性。

为此,我们构建了一个由3部分组成的复合损失函数total,它包含了两个任务特定的分类损失和一个跨任务的认知对齐损失。

3.5.1 任务特定的分类损失

为了监督模型在每个子任务上的性能,我们为每个任务引入了独立的线性分类头(Separate Linear Classification Heads)。这种设计允许模型从一个被对齐的、深度的认知状态出发,学习到将该状态映射到具体任务决策空间(答案选项或理由选项)的特定线性变换,从而为每个任务提供了更高的模型灵活性。

Q→A任务损失(QA):我们定义一个答案分类头fclsA:RdRc,其中d是隐藏层维度,c=4是候选选项的数量。该分类头将问答任务的认知状态向量hQA映射为4个候选答案的原始预测得分(logits)zA。随后,我们通过Softmax函数计算概率分布,并与真实答案标签 yA 计算标准的交叉熵损失:

zA=fclsAhQA=WAhQA+bA
QA=-i=1CyA,ilog expzA,ik=1CexpzA,k

其中,WARC×dbARC该损失函数驱动模型学习一个从场景理解到正确答案的映射。

QA→R 任务损失 (QAR):类似地,我们为理由选择任务定义一个独立的理由分类头fclsR:RdRc。该分类头接收理由任务的认知状态向量hQAR,并输出4个候选理由的(logits)zR。其损失函数计算方式与Q→A任务一致,使用真实理由标签yR

zR=fclsRhQR=WRhQAR+bR
QAR=-i=1CyR,ilog expzR,ik=1CexpzR,k

其中,WRRC×dbRRC该损失函数则监督模型学习一个从“已知答案的场景”到“合理解释”的溯因推理过程。

3.5.2 认知对齐损失

任务分类损失仅保证了模型在各自任务上的表层正确性。然而,由于两个决策路径(fclsAfclsR)是独立的,模型可能会在共享骨干网络中学习到两个不相关的表示,这违背了我们追求内在逻辑一致性的初衷。

为此,我们引入了认知对齐损失align,它构成了我们协同学习策略的基石。我们提出一个核心假设:对于同一个视觉场景,一个正确的答案及其对应的合理解释,应当源于一个相似或一致的内部认知状态。 换言之,模型在得出答案Acorrect时的思考过程所形成的表示hQA,应当与其在解释为何 Acorrect是正确答案时的思考过程所形成的表示hQAR在语义空间中是高度对齐的。

align在两个独立的分类头之前,对它们各自的输入施加了一个强约束,迫使它们源于同一个语义源头。我们选用余弦相似度(Cosine Similarity)来度量它们在向量空间中的对齐程度,其损失函数定义为:

align=1-sim(hQA,hQAR)=1-hQAhQARhQAhQAR

通过最小化align,显式地在两个任务的推理过程之间建立了一座逻辑桥梁。

3.5.3 总优化目标

基于上述损失项定义,模型的总损失函数表示为三部分损失的加权和,用以构建联合优化目标,如式(15)所示。

total=αQA+1-αQAR+βalign

其中,αβ是可调节的超参数,用于平衡不同损失项的相对重要性。其中,参数α0,1用于平衡问答任务与理由推断任务在联合训练中的相对重要性。考虑到VCR任务中Q→A与QA→R在目标函数形式上具有一致性,本文采用互补权重α与(1-α)对两个任务进行加权,以避免某一子任务在训练过程中占据主导地位,从而保证协同学习的稳定性。此外β负责控制认知对齐约束的强度。

通过使用梯度下降法(AdamW优化器)最小化 total,我们提出的KACR框架支持端到端联合训练,在同时提升问答与理由预测性能的同时,通过认知对齐机制增强了模型推理的一致性。

4 实验

4.1 数据集及评估指标

我们采用了视觉常识推理(VCR)数据集进行实验,这是一个专为复杂视觉认知任务构建的大规模基准。该数据集包含约10万张源自电影片段的图像,以及超过26万个与图像内容强关联的推理问题。按照官方标准,我们将数据集划分为训练集、验证集和测试集,分别包含212 923、26 534和25 263个问题,其中训练集和验证集均提供了真实标签。在评估指标方面,我们采用分类准确率(Classification Accuracy)来衡量模型在3个子任务上的性能:从问题预测答案(Q→A)、根据问答预测理由(QA→R)以及联合预测(Q→AR)。特别需要说明的是,对于联合任务 Q→AR,我们并不将其视为独立的分类统计,而是采用级联判定机制:只有当模型在Q→A和QA→R两个子任务上对同一问题的预测均为正确时,才判定该样本在Q→AR任务中回答正确。

4.2 基线模型

本文将所提出的KACR方法与4类方法进行了对比:1) 仅文本基线方法,包括BERT4、ESIM+ELMO和LSTM+ELMO31,这些方法只利用语言信息,可用于评估视觉上下文在VCR中的重要性; 2) VQA基线方法,包括RevisitedVQA9、BottomUpTopDown10、MLB32和MUTAN33,它们最初为VQA任务中处理简单回答而设计,在此基础上进行改造以适配VCR; 3) VCR专用方法,包括R2C1、CKRM11、TAB-VCR12、CCN13、HGL14、ECMR15、MCC34、JAE35、VC R-CNN16和CL-VCR36; 4) 视觉-语言预训练及多模态大模型,既包括经典的VisualBERT17、VL-BERT18、UNITER19和MEP3P37,也纳入了近期表现优异的大模型方法,如BLIP28以及Qwen223系列(包含Zero-shot及结合VGFD+SCG策略的变体)。

下文将简要介绍具有代表性的 VCR 方法和视觉-语言方法。R2C1利用带注意力机制的 LSTM,将顺序的答案词与顺序的问题词或视觉目标进行上下文建模。CKRM11是一种基于注意力的模型,用于将外部知识迁移到VCR任务中。TAB-VCR12采用集成颜色、纹理、尺寸等属性的目标检测器来增强 VCR 的视觉特征。CCN13使用连接式认知网络,通过重组视觉神经元的连接关系来完成 VCR。HGL14构建异构图来建模图像与文本之间的相关性。ECMR33将不同句子的结构化句法三元组与视觉图相结合,用于推理。MCC34生成反事实样本,并采用对比学习来训练 VCR 模型。JAE35提出了一种即插即用的、基于知识蒸馏增强的 VCR 框架。VC R-CNN16采用基于区域的 CNN,对视觉特征进行因果干预以实现增强。CL-VCR36采用基于课程学习的掩码策略来训练VCR模型。VisualBERT17由一系列 Transformer 层堆叠而成,通过自注意力在图文对中隐式对齐视觉区域特征与文本词语特征。VL-BERT18以 Transformer 为骨干网络,在多个数据集上联合处理视觉与文本嵌入特征,以学习视觉-语言对齐。UNITER19设计了4种预训练任务来实现视觉-语言对齐。MEP3P37提出了一种增强型多模态大语言模型(MLLM)伪3D感知框架,通过引入深度信息和改进的Transformer机制,提升了视觉常识推理任务中的物体关系理解能力。

4.3 性能比较

表 1 给出了不同方法在 VCR 数据集3项子任务(Q→A、QA→R 和 Q→AR)上的分类准确率,最优结果以加粗表示。整体来看,方法性能从仅文本或传统 VQA 模型,到任务特定 VCR 模型,再到大规模预训练视觉–语言模型,呈现出逐步提升的趋势。表中同时报告了在不同规模多模态大语言模型(Qwen2-VL-2B 与 Qwen2-VL-7B)上的结果,用以分析所提出方法的模型规模可扩展性。

仅文本方法与VQA基线(如BERT、RevisitedVQA等)在3项任务上的整体表现较为有限,尤其在Q→AR指标上准确率偏低,表明仅依赖语言信息或简单套用VQA范式难以满足VCR任务对视觉常识与多步推理的需求。相比之下,VCR专门模型(如R2C、TAB-VCR、GIST等)以及预训练视觉-语言模型(如VisualBERT、UNITER、MEP3P)均取得了显著提升,其中MEP3P在Q→AR上达到60.0%,但答案与理由之间的一致性仍然是主要瓶颈。

在多模态大语言模型设置下,Qwen2-VL-2B(Zero-shot)在未进行任务适配的情况下已优于多数早期基线,但仍落后于专门的VCR模型。引入本文提出的场景图知识注入机制后,Qwen2-VL-2B(Zero-shot+VGFD+SCG)在3项子任务上均取得稳定提升,表明基于外部知识构建结构化区域事实描述能够有效补充细粒度常识与场景上下文。

在此基础上,本文提出的完整框架Ours(Qwen2-VL-2B)通过进一步引入双任务协同学习与认知对齐损失,在Q→A、QA→R和Q→AR上均取得显著性能提升,其中在Q→AR指标上相较当前最优方法MEP3P提升超过4个百分点,体现了所提出方法在增强答案-理由一致性方面的有效性。

在相同框架下,将共享骨干模型扩展为 Qwen2-VL-7B后(Ours(Qwen2-VL-7B)),模型在3项子任务上进一步提升,尤其在Q→AR上表现更为明显,表明所提出的 KACR 框架具有良好的模型规模可扩展性。需要说明的是,表2中的 Baseline(Qwen2-VL-7B)仅使用Qwen2-VL-7B 进行标准微调,不包含场景图知识增强、双任务协同或认知对齐机制,其性能提升主要来源于模型规模扩展。与之相比,Ours(Qwen2-VL-7B)在相同骨干条件下仍显著优于基线,进一步验证了方法本身的有效性。

4.4 消融实验

为验证本框架中各关键组件的有效性,本文进行了一系列消融实验,详细结果汇总于表2。我们通过Q→A、QA→R 以及Q→AR等3个指标,全面评估了各组件对模型不同维度推理能力的影响。

首先,我们评估了知识增强模块的贡献。实验数据显示,无论是移除区域事实描述(w/o VGFD)还是场景常识图(w/o SCG),模型在3个评估指标上均出现了不同程度的下滑。具体而言,当同时移除这两个模块时(w/o VGFD+SCG),Q→A、QA→R 和 Q→AR分别下降了1.3%、1.0%和1.7%。这表明,VGFD提供的细粒度视觉信息与SCG提供的抽象常识不仅有助于提升最终的联合推理表现,对于提升模型在“精准定位答案”和“逻辑匹配理由”这两个独立子任务上的基础能力同样至关重要。

其次,我们分析了协同推理策略的有效性。在移除双任务协同学习结构(w/o Dual-task Collaborative Learning)后,模型在Q→A上的性能损失尤为明显(下降 1.2%),同时QA→R也下降了 0.7%,这证明了我们提出的双任务协同学习框架能够通过参数共享和联合优化,促进任务间的信息交互,从而学习到更鲁棒的多模态表征。此外,移除认知对齐损失(w/o Cognitive Alignment Loss)导致QA→R和Q→AR分别下降了 0.9% 和 1.1%,说明引入显式的逻辑一致性约束能有效校准答案与理由的匹配度,进而提升整体推理的严密性。

最后,将完整模型(Ours)与未经过本框架改良的基线模型(Baseline, Qwen2-VL-2B)进行了整体对比。结果显示,本文的方法在Q→A、QA→R和Q→AR等3个指标上分别取得了2.5%、2.4%和3.8%的全面提升。这一结果充分证明,本文提出的知识增强与协同推理框架不仅增强了单一任务的执行能力,更通过组件间的有机协作,实现了视觉常识推理性能的整体跃升。

4.5 超参数实验

4.5.1 参数α的影响

为了探究损失函数中权重参数α对模型多任务协同性能的具体影响,我们在保持认知对齐权重β不变的前提下,进行了一系列参数敏感性实验,实验结果如图4所示。我们将α的取值从0.1递增到0.7。由表4结果可以观察到:当α为0.1时,模型在Q→A、QA→R和Q→AR上的准确率分别为77.1%、79.1%和61.8%。此时回答损失的权重较低,模型更多地关注解释任务,因此QA→R 表现较好,但Q→A和联合指标Q→AR仍存在明显提升空间。随着α增大至0.3,3项指标均有所提高,特别是Q→AR由61.8%升至63.2%,表明适当增加回答任务的权重有助于整体推理性能的提升。当α进一步增大到0.5时,3个子任务同时达到最高或接近最高的性能:Q→A为79.9%,QA→R为79.6%,Q→AR为64.2%。此时主任务与辅助任务的损失权重大致相当,说明在该设置下模型能够在“回答准确性”和“解释合理性”之间取得良好平衡,并由此显著提升“答案+理由同时正确”的Q→AR指标。当α增至0.7时,Q→A虽略有波动(79.1%),但QA→R降至78.4%,Q→AR也回落到63.1%。这表明过度强调回答损失会削弱模型对解释任务的学习能力,从而破坏答案与理由之间的协同关系,最终影响联合推理表现。综合来看,α=0.5在3项任务上实现了最优且相对均衡的性能,因此被采用为最终设置。

4.5.2 参数β的影响

在分析β时,我们固定α=0.5,将β从0.1调整至1.0。如图5所示,当β=0.1时,模型在Q→A、QA→R和Q→AR上分别取得79.9%、79.6%和64.2%的最佳结果。随着β增大,3项指标均出现不同程度的下降:例如,当β=0.5时,Q→AR准确率降至63.6%,而当β=1.0时进一步降至63.5%。这说明适度的对齐约束有利于强化答案与理由在隐空间中的表征一致性,从而提高联合推理的可靠性;但当β过大时,对齐损失在总目标中的占比过高,会过度压缩不同类别样本之间的判别性,导致模型在3个子任务上的性能均出现轻微退化。

4.6 计算效率与资源消耗分析

为评估 KACR 框架在实际应用场景中的可行性与部署成本,本节对模型在统一实验环境下的训练资源消耗与推理阶段计算效率进行分析。所有实验均在搭载 NVIDIA RTX 4090 GPU 的服务器环境中完成。

1) 参数规模与训练资源消耗。本文分别基于 Qwen2-VL的2 B与7 B两种模型规模构建KACR框架。以KACR(Qwen2-VL-2B)为例,在统一训练配置下完成双任务协同优化,整体训练耗时约为16 h,训练过程中峰值显存占用为22.12 GB。相比之下,未引入知识协同与对齐机制的基线模型训练耗时约为12 h。因此,KACR在训练阶段仅引入了有限的额外计算与显存开销,表明该框架在资源消耗层面具有较好的可控性。

2) 推理效率分析。KACR 的推理流程包括离线的知识构建阶段(如场景常识图检索与区域事实描述生成)以及在线的联合推理阶段。表 3 给出了在线推理阶段的平均延迟统计结果。

表3可以看出,在当前实验配置下,KACR 的在线推理延迟保持在0.29 s /样本的量级,能够满足常见视觉常识推理任务对响应速度的需求。该延迟主要来自于模型在推理阶段对更丰富多模态知识信息的联合建模过程。在此基础上,KACR在Q→AR联合指标上提升了3.8个百分点的性能,表明引入结构化场景常识与区域事实信息能够显著提升模型的推理质量。综合来看,KACR 在保持可接受推理效率的同时,实现了对视觉常识推理性能的有效增强,适用于对推理准确性具有较高要求的应用场景。

4.7 场景常识三元组数量的影响

在本文方法中,我们利用CLIP模型计算每个场景常识三元组与当前图像及问题的相关性得分,并依据此得分对每个关键词检索到的候选知识进行排序。超参数M控制了在每个关键词对应的候选集内所保留的最高分三元组的数量。为了探究这一数量对模型性能的影响,我们进行了一系列消融实验。如表4所示,我们观察到一个趋势:随着M值从2(know_2)增加到8(know_8),即为模型提供更多经过筛选的高质量知识,模型在 Q→A、A→R和Q→AR等3个任务上的性能均呈现稳步提升。具体而言,当M设置为8时,模型在所有任务上均达到峰值性能,准确率分别达到了79.9%、79.6%和64.2%。这表明,在一定范围内,增加与场景高度相关的知识供给能有效增强模型的推理能力。然而,一个值得注意的现象是,当允许模型使用所有检索到的知识 (know_all) 时,其性能相较于 know_8 出现了全面下滑。这揭示了知识并非“越多越好”,即使经过CLIP初步筛选,过量的知识仍可能引入噪声,干扰模型的判断。因此,本实验证明了通过精细化筛选并提供适量的高质量知识,是实现最佳性能的关键。

4.8 案例分析

为了直观展示模型在复杂场景下的推理优势,图6对比了本模型(KACR)与基线模型(Qwen2-VL-2B)在不同案例上的表现。如图6左上角所示,当问题询问“为何Person 0不住在该处”时,基线模型忽略了人物衣着细节,给出了无法验证的猜测。相比之下,我们的模型敏锐捕捉到了 Person 0“身穿外套(wearing a coat)”这一细粒度视觉事实,并将其与“室内穿着厚外套通常意味着外来访客”的常识建立关联,从而实现了准确推理。这证明了引入区域事实描述能有效帮助模型捕捉被忽视的关键线索。同样的差异也体现在对抗性较强的场景中。在图6g的案例中,面对“为何点燃火柴”的提问,基线模型受昏暗的环境背景误导,错误判断其意图为“照亮房间”。而我们的模型通过场景常识图(SCG)准确定位了画面边缘的“木堆(pile of wood)”实体,成功排除了背景干扰,推断出“生火”这一符合物理逻辑的行为。此外,在左下角涉及细粒度状态理解的案例中,基线模型仅能给出专注这类宽泛且模糊的情感描述。而我们的模型结合人物面部神态与上下文语境,精准识别出“悲伤与困惑”的复合情绪,选择了比基线模型更为深刻且具体的理由。然而,模型在处理深层隐喻或特定叙事套路时仍面临挑战。如图6h案例所示,正确答案依赖于“刺客准备行动”的戏剧性隐喻。由于VGFD模块为抑制幻觉被限制于生成客观描述,且SCG检索的常识偏向日常逻辑,导致模型缺乏支撑高阶意图推理的关键线索,倾向于选择保守的错误选项。这一现象深刻揭示了在追求“视觉事实准确性”与保留“叙事想象力”之间存在的内在权衡,为未来提升模型的高阶语义理解能力指明了方向。

5 结论

本文针对当前视觉常识推理(VCR)模型在外部知识利用不足、上下文理解模糊以及答案与理由间逻辑一致性缺失等关键挑战,提出了一种基于多模态大语言模型的知识增强与协同推理框架。首先使用一种双层知识注入策略:通过构建融合常识知识库的场景常识图,并利用大语言模型生成视觉接地的区域事实描述,本框架将抽象的因果关系知识与精细的实体视觉证据显式地注入到Prompt中,有效缓解了模型的知识缺失问题,并丰富了场景的上下文表示。其次设计了一个双任务协同学习架构:基于大语言模型,我们通过共享骨干网络和并行的分类器,实现了问答与理由推断两个子任务的联合优化。这种协同学习范式促进了跨任务的信息共享,迫使模型学习到更通用、更鲁棒的多模态表征。最后通过引入了认知对齐损失以保证逻辑一致性:作为本框架的核心创新,通过约束两个任务在决策前的认知状态向量的余弦相似度,显式地在答案选择和理由推断之间建立了逻辑桥梁。该机制强制模型的回答与解释源于一个统一且连贯的内部认知过程,显著增强了推理链条的可靠性。实验结果表明,本框架在VCR基准测试中取得了优异的性能,验证了所提方法的有效性。

参考文献

[1]

Zellers RBisk YFarhadi Aet al.From recognition to cognition: Visual commonsense reasoning[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2019: 6720-6731.

[2]

Jain AVatsa MSingh R.Words over pixels? Rethinking vision in multimodal large language models[C]//Proceedings of the 34th International Joint Conference on Artificial Intelligence (IJCAI-25), 2025: 10481-10489.

[3]

Vaswani AShazeer NParmar Net al.Attention is all you need[C]//Advances in Neural Information Processing Systems 30, 2017: 5998-6008.

[4]

Koroteev M V.BERT: A review of applications in natural language processing and understanding[PP/OL].[2025-11-20].

[5]

Cheng HYe HZhou Xet al.Vision-language pre-training via modal interaction[J].Pattern Recogn2024156: 110809.

[6]

Yuan YLi ZZhao B.A survey of multimodal learning: Methods, applications, and future[J].ACM Comput Surv202557(7): 1-34.

[7]

Yu YShi CTang Jet al.Qwen-VL2 model with NEFTune technique for medical report generation[C]//Proceedings of the 4th International Symposium on Computer Applications and Information Technology, 2025: 165-168.

[8]

Li JLi DSavarese Set al.BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models[C]//Proceedings of the International Conference on Machine Learning, 2023: 19730-19742.

[9]

Jabri AJoulin AVan der Maaten L.Revisiting visual question answering baselines[C]//Proceedings of the European Conference on Computer Vision, 2016: 727-739.

[10]

Anderson PHe XBuehler Cet al.Bottom-up and top-down attention for image captioning and visual question answering[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2018: 6077-6086.

[11]

Wen ZPeng Y.Multi-level knowledge injecting for visual commonsense reasoning[J].IEEE Trans Circuits Syst Video Technol202031(3): 1042-1054.

[12]

Lin JJain USchwing A.TAB-VCR: Tags and attributes based VCR baselines[PP/OL].[2025-11-20].

[13]

Wu AZhu LHan Yet al.Connective cognition network for directional visual commonsense reasoning[PP/OL].[2025-11-20].

[14]

Yu WZhou JYu Wet al.Heterogeneous graph learning for visual commonsense reasoning[PP/OL].[2025-11-20].

[15]

Zhang XZhang FXu C.Explicit cross-modal representation learning for visual commonsense reasoning[J].IEEE Trans Multimedia202124: 2986-2997.

[16]

Wang THuang JZhang Het al.Visual commonsense R-CNN[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2020: 10760-10770.

[17]

Li L HYatskar MYin Det al.VisualBERT: A simple and performant baseline for vision and language[PP/OL].[2025-11-20].

[18]

Su WZhu XCao Yet al.VL-BERT: Pre-training of generic visual-linguistic representations [PP/OL].[2025-11-20].

[19]

Chen Y CLi LYu Let al.UNITER: Universal image-text representation learning[C]//Proceedings of the European Conference on Computer Vision, 2020: 104-120.

[20]

Lu JBatra DParikh Det al.ViLBERT: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks[J].Advances in Neural Information Processing Systems201932: 13-23.

[21]

Islam RMoushi O M.GPT-4o: The cutting-edge advancement in multimodal LLM[C]//Intelligent Computing-Proceedings of the Computing Conference, 2025: 47-60.

[22]

Touvron HLavril TIzacard Get al.LLaMA: Open and efficient foundation language models[PP/OL].[2025-11-20].

[23]

Wang PBai STan Set al.Qwen2-VL: Enhancing vision-language model's perception of the world at any resolution[PP/OL].[2025-11-20].

[24]

Dosovitskiy ABeyer LKolesnikov Aet al.An image is worth 16×16 words: Transformers for image recognition at scale[PP/OL].[2025-11-20].

[25]

Radford AKim J WHallacy Cet al.Learning transferable visual models from natural language supervision[C]//Proceedings of the International Conference on Machine Learning, 2021: 8748-8763.

[26]

Alayrac J BDonahue JLuc Pet al.Flamingo: A visual language model for few-shot learning[J].Advances in Neural Information Processing Systems202235: 23716-23736.

[27]

Liu HLi CWu Qet al.Visual instruction tuning [J].Advances in Neural Information Processing Systems202336: 34892-34916.

[28]

Speer RChin JHavasi C.ConceptNet 5.5: An open multilingual graph of general knowledge[J].Proc AAAI Conf Artif Intell201731(1): 4444-4451.

[29]

Hwang J DBhagavatula CLe Bras Ret al.ATOMIC 2020: On symbolic and neural commonsense knowledge graphs[J].Proc AAAI Conf Artif Intell202135(7): 6384-6392.

[30]

Lee J YKim I.Vision-language-knowledge co-embedding for visual commonsense reasoning[J].Sensors202121(9): 2911.

[31]

Chen QZhu XLing Z Het al.Enhanced LSTM for natural language inference[C]//Proceedings of the Annual Meeting of the Association for Computational Linguistics, 2017: 1657-1668.

[32]

Kim J HOn K WLim Wet al.Hadamard product for low-rank bilinear pooling[PP/OL].[2025-11-20].

[33]

Ben-Younes HCadene RCord Met al.MUTAN: Multimodal Tucker fusion for visual question answering[C]//Proceedings of the IEEE International Conference on Computer Vision, 2017: 2612-2620.

[34]

Zhang XZhang FXu C.Multi-level counterfactual contrast for visual commonsense reasoning[C]//Proceedings of the ACM International Conference on Multimedia, 2021: 1793-1802.

[35]

Li ZGuo YWang Ket al.Joint answering and explanation for visual commonsense reasoning[J].Proc AAAI Conf Artif Intell202332: 3836-3846.

[36]

Ye KKovashka A.A case study of the shortcut effects in visual commonsense reasoning[J].Proc AAAI Conf Artif Intell202135(4): 3181-3189.

[37]

Zhu JWang HShi M.Multimodal large language model enhanced pseudo-3D perception framework for visual commonsense reasoning[J].IEEE Trans Circ Syst Vid202434(11): 11682-11694.

基金资助

国家自然科学基金重点项目(62137001)

AI Summary AI Mindmap
PDF (2348KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/