基于语义引导注意力和多任务学习的图文情感分析

冯松 ,  胡慧君 ,  刘茂福

武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (4) : 495 -505.

PDF (1932KB)
武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (4) : 495 -505. DOI: 10.14188/j.1671-8836.2024.0099
人工智能与深度学习

基于语义引导注意力和多任务学习的图文情感分析

作者信息 +

Image-Text Sentiment Analysis Based on Semantic Guided Attention and Multi-Task Learning

Author information +
文章历史 +
PDF (1977K)

摘要

在社交媒体和在线平台产生的大数据背景下,图文情感分析成为了一个重要的研究任务,对于理解用户情感倾向至关重要。现有方法通常局限于模态的单层次特征,缺乏对图像多层次情感信息的理解,并且在多模态特征融合时容易产生信息冗余和特征偏移,导致模型效果不佳。针对上述问题,提出了一种基于语义引导注意力和多任务学习的图文情感分析方法。通过多尺度特征提取模块捕获图像的多层次情感信息,利用语义引导注意力融合与文本情感信息相关的图像信息,在多任务学习模块中引入情感聚焦校准任务来最小化融合特征与其情感质心的距离。在三个社交媒体数据集上的实验结果表明,该方法在图文情感分析任务中优于其他现有方法。

Abstract

In the backdrop of today's big data milieu on social media and online platforms, image-text sentiment analysis has become an important research task, which is crucial for understanding users' emotional tendencies. Existing methods are usually limited to the single-level features of modalities, lack an understanding of multi-level emotional information in images, and are prone to information redundancy and feature shift during multimodal feature fusion, resulting in poor model performance. In response to these issues, this study proposes an image-text sentiment analysis based on semantic guided attention and multi-task learning. Capture multilevel emotional information of images through a multiscale feature extraction module, use semantic-guided attention to fuse image information related to textual emotional information, and introduce an emotional focus calibration task in the multi-task learning module to minimize the distance between the fused features and their emotional centroids. Experimental results obtained from three social media datasets demonstrate that the proposed method outperforms existing methods in image and text sentiment analysis tasks.

Graphical abstract

关键词

图文情感分析 / 多尺度特征提取 / 语义引导注意力 / 情感聚焦校准 / 多任务学习

Key words

image-text sentiment analysis / multi-scale feature extraction / semantic guided attention / motional focus calibration / multi-task learning

引用本文

引用格式 ▾
冯松,胡慧君,刘茂福. 基于语义引导注意力和多任务学习的图文情感分析[J]. 武汉大学学报(理学版), 2025, 71(4): 495-505 DOI:10.14188/j.1671-8836.2024.0099

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

随着互联网和通信技术的飞速发展,社交媒体已成为人们分享生活和表达情感的主要平台。用户倾向于通过图像和文本结合的方式传达自己的观点和情感。这种数字化的交流方式在社交媒体上产生了大量的情感数据,为深入研究用户情感提供了宝贵的资源。但是传统的情感分析方法通常只依赖于单一模态,如文本或图像,这些方法在理解复杂的用户情感体验方面存在局限性。为了克服这一挑战,研究者开始转向多模态情感分析[1],旨在结合图像和文本信息全面捕捉用户的情感状态。

多模态情感分析面临两个问题。1) 数据的模态异构性问题,即不同模态的情感表达不一致。社交媒体中的数据往往具有多种模态,如文本、图像等,每种模态都有其特征和表达方式。在某些社交媒体帖子中可能包含带有负面评价的文本,但配图却表达出积极向上或者快乐的情感,这种在不同模态间情感表达不一致的问题会降低多模态情感分析的准确性。2) 特征融合过程中的偏移问题。当不同模态的特征融合时,特征空间的不匹配和模态间的权重不平衡,会导致某些模态的信息被过度强调而其他模态的信息被忽略。这种偏移不仅会掩盖模态间的真实关系,还可能引起模型对情感的误判。

尽管现有研究已经在这一领域取得了一定的进展,但大多依赖于图像的单层次特征,限制了对图像中多层次情感信息的深入理解。此外,现有方法在处理图文信息融合时,往往简单地将文本和图像特征直接拼接,导致引入了大量与情感无关的信息,不仅增加了特征的冗余,还可能引起特征在表示空间中的偏移,影响情感分析的准确性。

为了解决上述问题,本文提出了一种基于语义引导注意力和多任务学习的图文情感分析方法(Semantic Guided Attention and Multi Task Learning, SGAMTL),主要贡献如下:

1) 多尺度特征提取与语义引导注意力机制的融合。提出了一种多尺度特征提取方法,该方法能够全面捕获图像的全局和局部特征,从而增强模型对多模态情感内容的深入理解与表达能力。引入了一种语义引导注意力机制,该机制利用文本信息指导图像特征的融合过程,确保模型能够将注意力集中于图像中与文本情感相一致的关键区域。这种融合策略不仅提高了情感分析的准确性,也减少了无关视觉信息的干扰。

2) 情感聚焦校准网络的设计与多任务学习框架的构建。为了解决多模态信息融合后的特征偏移问题,本文设计了情感聚焦校准网络。该网络基于标签信息,通过估计情感质心并最小化样本与质心之间的距离,有效地校准了特征表示,增强了模型对情感信息的一致性表达。本文将这一校准任务整合到多任务学习框架中,与情感分析任务相互学习,提升模型性能。

1  相关工作

1.1 多模态情感分析

当前,学者们展开了一系列的结合多种模态数据实现跨模态情感分析。王靖豪等[2]提出了一种基于多层次特征融合注意力网络,通过计算“图文”与“文图”特征,实现多模态情感特征互补。宋云峰等[3]提出了一种基于注意力的多层次混合融合的多任务多模态情感分析,通过跨模态注意力机制实现不同模态间的两两融合,然后分别使用自注意力实现模态间的贡献度选择,最后结合多任务学习获得最终分类结果。Wen等[4]提出了跨模态上下文门控卷积网络,并引入了跨模态上下文门的概念,使其能有效地捕获模态间的交互信息,同时减少不相关信息的影响,从而生成具有情感语义信息的图文特征。Hu等[5]提出了一种多模态融合图卷积网络(MMGCN),该方法可以有效利用多模态之间的依赖关系。Tsai等[6]提出了一种多模态转换器(MulT),以端到端方式解决模态未对齐问题,通过跨模态注意机制在整个时间序列上进行模态间交互;Han等[7]提出了双向双模态融合网络,对两种模态特征表示进行差异增量操作,进而提取模态间的相关信息。Hu等[8]提出了多模态动态融合网络(MM-DFN),该模型通过捕获不同语义空间中的上下文信息动态减少冗余并增强模态之间的互补性。这些方法探索了多模态之间的交互融合方法,但是却没有考虑到每种模态对于情感分析的贡献程度不同。

1.2 多任务学习

多任务学习是指融合不同任务的训练数据,共同优化模型参数,这意味着不同任务可以相互受益,通过共享特征表示提高学习效率和模型性能。He等[9]提出了一种交互式的多任务学习模型,能够同时学习多个相关任务,通过一组共享的隐变量,迭代地传递给不同的任务来提高模型的性能。多模态数据在决策过程中通常具有不同的贡献度,Akhtar等[10]针对多模态数据在决策过程中的不同贡献度,提出了一个深度多任务学习框架。该框架利用门控循环单元来捕捉对话的全局上下文信息,并通过注意力机制实现模态间的交互,结合多任务学习策略同时预测情感和情绪。Jin等[11]提出了一个多任务、多尺度的情感分析模型,通过多任务学习增强编码器性能,提升情感分类的准确性。Yang等[12]提出了一种两阶段多任务情感分析框架,在第一阶段利用预训练模型捕捉通用特征,在第二阶段则通过多任务学习策略优化模型对情感进行识别。Majumder等[13]提出了一种多任务学习框架。该框架使用深度神经网络对情感分类任务和讽刺检测任务之间的相关性进行建模,以提高情感分析的性能。Yang等[14]提出了一种基于transformer的跨模态多任务学习框架,它将两个单模态辅助任务结合起来以学习模态的不同内在表示,并通过模态间的交互提升情感分析的性能。Li等[15]提出了一种基于多任务学习的多模态情感分析和情感识别方法。该方法采用共享和私有模型来单独和联合处理情感和情绪特征,并利用注意力机制和Bi-LSTM网络进行特征融合。上述方法虽然在多任务学习与情感分析的结合上取得了一定的进展,但尚未充分认识到对融合特征进行校准在提升情感分析准确性中的重要作用。

1.3 特征校准

在涉及跨领域或跨模态任务的研究中,由于不同模态之间存在固有的模态差异,研究者们开始关注特征校准的问题。在这方面,探索如何有效地对不同模态的特征进行校准成为研究的焦点。Yu等[16]提出了一种自监督多任务多模态情感分析网络(Self-MM),首先基于自监督学习策略的标签生成模块,以获得独立的单峰监督。然后,通过联合训练多模态和单模态任务,分别学习一致性和差异性,以此来校准融合特征在表示空间中的特征偏移问题。此外,在训练阶段,设计了权重调整策略平衡不同子任务之间的学习进度,即引导子任务关注模态监督差异较大的样本。Wei等[17]提出了一种新颖的多视图校准网络(MVCN),该方法设计了一个基于情感的一致性约束任务来校准表示空间中的特征偏移,还引入了一种自适应损失校准策略解决不一致的注释标签。Li等[18]提出了一种用于多模态情感检测的对比学习和分层融合方法(CLMLF)。该方法设计了两个对比学习任务使得模型更好地学习多模态数据中与情感相关的共同区域。Hazarika等[19]提出了一个新颖的框架(MISA),它将每种模态投影到两个不同的子空间。第一个子空间是模态不变的,在这个空间内跨模态的表示学习它们的共性并减少模态差距。第二个子空间是特定于模态的,它是每种模态私有的。通过这两种方式可以减少不同模态之间的差异性,从而达到特征校准的目的。这些特征校准的方法虽然在减少模态间差异性和增强特征一致性表达方面取得了进展,但是缺乏对情感质心的直接校准,未能充分利用标签信息优化融合特征在情感特征空间中的一致性表示,从而未能解决跨模态情感分析中的融合特征偏移问题。

2  本文模型

本文提出的一种多模态学习模型框架如图1所示,由多尺度特征提取、语义引导注意力模块和多任务学习3个部分组成。

2.1 多尺度特征提取

在多模态情感分析中,局部图像特征和全局图像特征提供了图像不同层次语义信息,因此捕捉这两种特征可以丰富模型对情感内容的理解和表达。为了全面捕捉多模态数据的特征信息,设计了一个多尺度特征提取模块,因为本文所使用的IsTS-CN数据集是图集,所以需要在图像处理时对该数据集特殊处理,IsTS-CN数据集中图片最多为9幅,因此将每条数据中的图像填充为9幅,将每张图片通过特征提取后进行拼接得到图集视觉特征。

2.1.1 文本特征提取

在文本特征提取方面,本文采用了RoBERTa[20]和Bi-GRU[21]模型的组合。RoBERTa模型通过预训练和微调提取文本信息的深层表示,而Bi-GRU则通过逐步学习序列信息,捕捉文本中的上下文关系。在输入文本Text开头添加“[CLS]”符号,然后通过RoBERTa得到:

TRoBERTa=tCLS,t1,t2,,tNRd×N+1

其中,tm为第m个单词的语义特征;N为RoBERTa字编码的最大长度;d=768,为输出维度。然后使用Bi-GRU提取文本的上下文信息:

fm=GRUtmGRUtmRH

其中,H=dh×2=d为Bi-GRU隐藏层长度的两倍;dh为Bi-GRU的隐藏层维度。最终的文本语义特征:

T=fCLS,f1,f2,, fNRH×N+1

2.1.2 图像全局特征提取

为了获得图像的整体特征,本文引入ViT模型[22]。在庞大的图像文本对数据集上进行预训练,该模型能够理解图像的全局结构和内容。ViT模型的优势在于它能够有效地捕捉图像的全局信息,为情感分析任务提供更全面的视觉上下文。对于输入图像I,首先将每幅图片剪裁成256×256,然后将图像分割成L16×16的图像块,使用ViT模型提取图像全局特征:

V=ViTI=vCLS,v1,v2,,vLRd×L+1

2.1.3 图像局部特征提取

通过局部特征,模型可以关注于图像中对情感具有决定性影响的关键区域,从而更准确地理解和识别情感表达。采用Faster R-CNN提取图像局部特征,Faster R-CNN以ResNet-50为主干网络,通过区域检测和表示提取,能够捕捉到图像中重要的局部信息。首先将每幅图像裁剪成256×256作为输入I,选择top-m区域,每个区域经过ResNet-50后成为2 048维特征向量pfii=CLS,1,2,,m

Pf=Faster RCNNI=pfCLS,pf1,pf2,,pfmR2 048×m+1

为了对对象之间的交互进行建模,将区域表示Pr送入到ResNet-50,然后经过线性变换以获得与文本特征向量相同维度的图像局部特征:

PR=ResNetPf=prCLS,Pr1,Pr2,,PrmR2 048×m+1

然后通过单层感知机将图像局部特征PR转换成与文本和图像全局特征具有相同维度的特征向量,得到最终的图像局部特征:

P=tanhWRTPRRH×m+1

其中,WRTRH×2 048为可训练权重矩阵。

2.2 语义引导注意力模块

为了更好地整合图集和文本之间的情感信息,本文在Transformer的基础上设计了一种语义引导注意力方法(semantic guided attention),旨在有效促进不同模态信息之间的交流和融合。将提取到的文本特征T,图像局部特征P作为输入传递给语义引导注意力模型。首先将文本特征T和图像局部特征P经过自注意力层和层归一化(Layer Normalization,LN)得到T'P'。然后将T'作为缩放点积注意力机制中的Queries,Keys,Values输入到多头自注意力中生成文本感知特征HT

AttQ,K,V=softmaxQKTdV
HT=MHAQ,K,V=Concathead1,head2,,headhWO
headj=QWjQ,KWjK,VWjV

其中,Att为注意力机制,MHA为多头注意力机制, WOWjQ,WjK,WjV都为可学习权重矩阵。

再将生成的文本感知特征HT作为注意力机制中的Queries,图像全局特征P'作为注意力机制中的Keys,Values输入到注意力机制中,通过前馈神经网络(Feedforward Neural Network,FNN)和层归一化以获得文本引导的文本图像局部特征FT-P

f=AttQ,K,V=softmaxQKTdV
FT-P =LNFNNf

同理将提取到的文本特征T,图像全局特征V作为输入传递给语义引导注意力模型得到文本图像全局特征FT-V

最后,将文本图像局部特征FT-P 和文本图像全局特征FT-V 进行拼接,再经过注意力层与全连接层得到最终的图文融合特征F

2.3 多任务学习

2.3.1 图文情感分析

将图文融合特征向量输入注意力层和全连接层,再经过softmax函数进行图文情感分析,得到情感分析结果y,情感分类损失采用交叉熵损失(Cross-Entropy Loss)LSC

d=LinearWdF
p=softmaxWpd
LSC=-i=13ti  log (pi)

其中,WdWp均为可训练权重矩阵,pi表示模型对第i个类别的预测概率,实际标签为ti

2.3.2 情感聚焦校准

在多模态情感分类任务中,通常期望具有相同情感标签的样本在表示空间中更加接近。然而,由于模态存在异质性,特征偏移问题成为一个阻碍因素,使得在捕捉多模态特征与情感之间的相关性方面面临挑战。为了解决这一问题,本文设计了多任务学习框架,除传统的情感分类任务,还借鉴了聚类算法的思想,基于标签信息的方法,引入了情感聚焦校准任务,通过估计情感质心和限制样本与其质心之间的距离校准特征偏移。

首先将经过注意力层和全连接层的图文融合特征F,通过全连接层与层归一化映射到任务相关的表示F'

F˙=LinearWfF
F'=NormalizeF'=F˙F˙2

然后计算图文融合特征F˙的正质心M0、中性质心M1和负质心M2。这里0、1、2分别表示正向标签、中性标签和负向标签。

M012=iBIYi=012F'iiBIYi=012

其中,B是样本的数量,I是指示函数,F'iYi分别是第i个样本的特征表示和真实情感标签。

计算样本的质心M和对应图文融合特征F˙之间的绝对距离D'

D'=F'j-MYj22j=1Bι

其中,Yj表示第j个样本的真实标签,ι是特征维度。

再将D'归一化为相对距离D

D=D'D'=d1,d2,,dB

然后使用L2损失函数将样本与其情感质心之间的距离最小化:

LSFC=-j=1Blog exp -djj=1Bexp -dj

2.3.3 损失函数

多任务学习不仅网络结构设计很重要,学习损失的优化也至关重要。对于多任务学习的损失函数而言,最简单的方法是将所有任务的损失直接相加,以得到整体的损失。然而,不同任务损失的量级可能存在显著差异,因此简单地将损失相加可能会导致某个任务在整体学习过程中占据主导地位。当模型的优化倾向于某个任务时,其他任务往往会受到影响,其效果可能会相对减弱。因此,本文采用了加权求和的策略优化多任务学习中的两个任务,采用的方式如下:

L=λ1LSC+λ2LSFC

其中,λ1λ2是平衡多任务学习中不同训练损失函数的超参数。

3  实 验

3.1 数据集

IsTS-CN数据集:由曹梦丽等[23]构建的中文社交媒体图集文本情感分析数据集。源自微博平台,以“考研”“毕业季”等与大学生相关的关键词为搜索对象。该数据集包含10 347条图集文本对,涵盖34 807幅图片,平均每条数据约含有3幅图片。情感分布方面,正面情感数据有5 449条,中性情感数据有2 191条,负面情感数据有2 707条。

CSMSA数据集:由Ge等[24]构建的中文表情包文本对数据集,来源于最受欢迎的社交软件。原始数据包含28 000条表情包文本对数据和16 000幅不同的表情包,经过清洗后,最终有效数据为1 570条。该数据集是第一个用于多模态情感分析的带注释的基于表情包的中文数据集。原数据集有4种划分方式,本文采用的是较难的Hard Task-2划分方式。

MMSD-CN数据集:由李书星等[25]构建的中文社交媒体情感数据集,来源于新浪微博,关键词为“打工人”。原始数据超过20 000条,经过交叉验证和人工校验后,最终包含10 952条有效数据。情感分布方面,正面情感数据有4 667条,中性情感数据有2 265条,负面情感数据有4 020条。数据统计如表1所示。

3.2 实验设置

Faster R-CNN图像编码器从每幅图像提取top-m个显著区域,m为36,每个区域使用2 048维的特征向量表示。IsTS-CN图集文本对数据集中图像至多为9幅,因此填充时统一取值为9。模型中其他参数设置如表2所示。

3.3 结果与分析

在本文实验中,评价指标采用准确率(Accuracy)和宏平均的F1值(Macro-F1)评估情感分析模型的性能,具体计算公式为:

Accuracy=TP+TNTP+FP+TN+FN
F1=2PrecisionRecallPrecision+Recall
Macro⁃F1=13i=13F1i

其中,Precision为精准率;Recall为召回率;TP代表正类预测为正类的样本数;TN代表负类预测为负类的样本数;FP代表负类预测为正类的样本数;FN代表正类预测为负类的样本数;F1i表示在第i个分类上计算的评价指标。

3.3.1 对比实验

将本文的模型SGAMTL与以下10种主流模型进行对比,结果见表3

BERT[26]:在BERT模型上进行微调,有效提取文本的语义特征用于微博文本情感分析。

RoBERTa[20]:它是对BERT的改进和优化,包含更多的层和参数,能够更有效地提取文本语义特征。

ResNet[27]:通过引入残差学习框架解决训练神经网络时产生的梯度消失和梯度爆炸问题,它是本文提取图像初始视觉特征的模型。

MBERT[28]:对文本和图像分别通过预训练的模型BERT和ResNet获得嵌入向量,将图文特征向量进行拼接后输入到多模态编码层(BERT)进行融合计算。

VistaNet[29]:采用图像指导文本的视觉注意力机制决定文档中不同句子对于文档情感分类的重要性程度。

SA-SSC[25]:当图文语感不一致时,图像特征在语义特征的指导下生成新的视觉特征。然后将图文特征向量输入到协同注意力模块进行特征融合用于图文情感分类。

SAMSAM[24]:特征输入分成文本、图像、OCR文本和图像风格,设计了一种特征交互层融合不同类型的特征信息。

SA-JIA[30]:在文本和图像两个方面引导下得到新的图文特征,减少噪声的同时增强图文模态的情感一致性表达,然后经过交互注意力处理,使文本和图像进行交互融合。

CLMLF[18]:通过两个对比学习任务,基于标签和基于数据的对比学习,学习多模态数据中与情感相关的共同特征。

MVCN[17]:提出了一种具有新颖稀疏注意力的融合模块减少视觉元素的负面影响,设计了一个情感一致性约束子任务解决表示空间中的特征偏移。

根据表3的数据,可以明显看出相较于纯图像分类,模型对纯文本分类更准确,这表明在社交媒体情感分析领域,文本对情感分析的贡献大于图像。尽管图像包含更多视觉信息,但这些信息也带有更多噪声。多模态模型的性能明显优于单模态模型,这表明跨模态的信息互补对情感分析具有积极影响。多模态情感分析的关键在于有效提取文本和图像中与情感相关的信息,同时需要考虑不同模态特征的融合,以更准确地反映用户的情感并处理由此带来的特征偏移问题。

本文的SGAMTL方法首先提取图像的全局和局部特征,以解决图像信息提取不足的问题。然后,采用语义引导注意力机制以文本为基础,融合多模态特征,解决文本和图像不同模态之间的差异。最后,采用情感聚焦校准网络来矫正融合特征与其质心之间的特征偏移问题。表3结果显示,在三个社交媒体数据集IsTS-CN、CSMSA和MMSD-CN上,本文的SGAMTL方法明显优于其他主流方法,说明SGAMTL方法能够有效处理社交媒体图文情感分析任务。

目前性能较好的深度学习方法,如VistaNet[29],采用了图像指导文本的视觉注意力机制,实现了文本与图像信息的融合。SA-JIA[30]通过联合交互注意力机制增强了图像和文本之间的情感一致性信息。CLMLF[18]通过两个对比学习子任务融合文本和图像中情感相关的共同特征。而MVCN[17]通过稀疏注意力和累积校准策略来减少多模态数据中的噪声问题。这些方法在多模态情感分析方面都有所贡献,但不能完全解决各个模态信息充分提取和融合特征的特征偏移问题,所以其结果均不如本文的SGAMTL方法。

3.3.2 消融实验

为了验证SGAMTL方法中不同模块在多模态情感分析任务中的有效性,在相应参数保持不变的情况下,我们在IsTS-CN、CSMSA和MMSD-CN数据集上对SGAMTL方法进行了消融实验,实验结果如表4所示。其中:

SGAMTL-M为在原方法的基础上将多尺度图像特征提取改为单一图像全局特征提取,语义引导注意力和情感聚焦校准网络保持不变;

SGAMTL-T为在原方法的基础上去掉了语义引导注意力机制,融合模块变成直接拼接文本和多尺度图像特征,其他模块保持不变;

SGAMTL-E为仅去掉情感聚焦校准模块,其他模块不变;

SGAMTL-A为去掉多尺度特征提取、语义引导注意力和情感聚焦校准网络。

根据表4的结果,可以观察到当三个改进模块全部移除时,即仅采用SGAMTL-A时,算法性能显著下降,充分说明了本文的改进在图文情感分析中的重要性。除SGAMTL-A外,SGAMTL-T在各项评测指标上表现最差,说明语义引导注意力机制对于模态融合的有效性至关重要。这是因为SGAMTL-T只是简单地将文本模态和图像模态进行拼接,没有考虑到不同模态之间的差异性,导致融合特征缺乏文本与图像之间的关联性。SGAMTL-M和SGAMTL-E的效果相近,均优于SGAMTL-T,表明多尺度图像特征的提取以及情感聚焦校准模块对于整体性能的提升都是有贡献的。本文的SGAMTL方法在所有实验设置中均取得最佳效果,说明了多模态情感分析任务中各模块的协同作用,尤其是多尺度特征提取、语义引导注意力和情感聚焦校准网络的有效性。这进一步验证了SGAMTL方法的优越性,为其在社交媒体图文情感分析任务中的成功应用提供了实验支持。

3.3.3 实例分析

本文对SGAMTL方法在数据集IsTS-CN上进行了实例分析。

对于表5中的预测正确实例,从文本的角度看,“好累呀”和“大学生活比我高中的时候还累”虽然表达了一定的负面情感,但是后续的“努力吧,总有一天我会看见你的日出与日落”呈现了积极乐观的正面情感。从图片方面来看,三幅城市风景图看不出来明显的情感。结合文本和图像信息,数据集标注了这个实例的情感为正面。SGAMTL方法在分析文本信息时能够捕捉关键的情感语义信息,并且在整合图像信息时能够正确地预测出实例的情感。

表6预测错误实例中,文本信息“大学生活撤退”表达了一定的负面伤感情感,但图片展示了正面情感,如第一张图中的“比耶”手势和第二张图中两人准备空中击掌。因此,数据集标注的整体情感为正面,然而SGAMTL方法的预测结果却为负面,可能是因为该方法过于关注文本中的“撤退”,在整合图像信息时过分以文本为主导,导致情感预测错误。

综上所述,文本与图像的融合方式对情感分析效果产生一定影响。以文本为主导的融合方法能够提高情感分析效果,但也可能带来一些负面影响。因此,文本与图像的融合方式在情感分析中显得至关重要。

4  结 语

当前主流方法未能充分考虑提取多尺度图像信息和融合多模态情感信息之后的特征偏移问题,本文提出的基于语义引导注意力和多任务学习的图文情感分析方法在解决上述问题方面取得了显著进展。通过多尺度图像信息的提取,成功捕获了图像全局信息和图像局部信息,使模型更全面地理解与表达多模态情感相关内容。语义引导注意力机制以文本为基础融合图像特征信息,强化了文本与图像之间的关联性,进一步提升了模型性能。最后,采用情感聚焦校准网络,通过一种基于标签信息的方法,用估计情感质心解决多模态融合信息带来的特征偏移问题,为图文情感分析任务提供了新的解决方案。

本文方法仍存在一定局限性,仅能预测最终的情感分类,而在实际应用中,人工智能在情感分析中的角色应当更贴近人的思维方式。在面对多模态情感数据时,仅仅进行最终情感的分类还不足以满足实际需求,更重要的是能够给出情感产生的原因,以增强结果的可解释性与信服力。未来的研究方向应该不仅将情感分析视为分类任务,还应探索生成式情感分析任务,以更深入地分析情感产生的原因,使人工智能在情感分析领域的应用更为全面与深入。

参考文献

[1]

MAJUMDER NHAZARIKA DGELBUKH Aet al. Multimodal sentiment analysis using hierarchical fusion with context modeling[J]. Knowledge⁃Based Systems2018161:124-133.DOI: 10.1016/j.knosys.2018.07.041 .

[2]

王靖豪,刘箴,刘婷婷,. 基于多层次特征融合注意力网络的多模态情感分析[J]. 中文信息学报202236(10): 145-154.

[3]

WANG J HLIU ZLIU T Tet al. Multimodal sentiment analysis based on multilevel feature fusion attention network[J]. Journal of Chinese Information Processing.202236(10):145-154 (Ch).

[4]

宋云峰, 任鸽, 杨勇, . 基于注意力的多层次混合融合的多任务多模态情感分析[J]. 计算机应用研究202239(3):716-720.DOI: 10.19734/j.issn.1001-3695.2021.08.0357 .

[5]

SONG Y FREN GYANG Yet al. Mutimodal sentiment analysis based on hybrid feature fusion of multi-level attention mechanism and multitask learning[J]. Application Research of Computers202239(3):716-720. DOI: 10.19734/j.issn.1001-3695.2021.08.0357(Ch ).

[6]

WEN H LYOU S DFU Y. Cross-modal context-gated convolution for multi-modal sentiment analysis[J]. Pattern Recognition Letters2021146: 252-259. DOI: 10.1016/j.patrec.2021.03.025 .

[7]

HU JLIU YZHAO Jet al. MMGCN: Multimodal fusion via deep graph convolution network for emotion recognition in conversation[EB/OL]. [2024-03-04]. DOI: 10.48550/arXiv.2107.06779 .

[8]

TSAI Y HBAI S JLIANG P Pet al. Multimodal transformer for unaligned multimodal language sequences[C]//Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. Stroudsburg: Association for Computational Linguistics, 2019: 6558-6569. DOI: 10.18653/v1/p19-1656 .

[9]

HAN WCHEN HGELBUKH Aet al. Bi-bimodal modality fusion for correlation-controlled multimodal sentiment analysis[C]//Proceedings of the 23rd International Conference on Multimodal Interaction. New York: ACM Press,2021: 6-15. DOI: 10.1145/3462244.3479919 .

[10]

HU DHOU X LWEI L Wet al. MM-DFN: Multimodal dynamic fusion network for emotion recognition in conversations[C]// Proceedings of the 47th IEEE International Conference on Acoustics, Speech and Signal Processing. Piscataway: IEEE Press,2022: 7037-7041. DOI: 10.1109/ICASSP43922.2022.9747397 .

[11]

HE R DLEE W SNG H Tet al. An interactive multi⁃task learning network for end-to-end aspect-based sentiment analysis[C]// Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. Stroudsburg: Association for Computational Linguistics, 2019:504⁃ 515. DOI: 10.18653/v1/p19-1048 .

[12]

AKHTAR M SCHAUHAN D SGHOSAL Det al. Multi-task learning for multi-modal emotion recognition and sentiment analysis[C]//Proceedings of Conference of the North American Chapter of the Association for Computational Linguistics:Human Language Technologies. Stroudsburg:Association for Computational Linguistics,2019:370-379. DOI: 10.18653/v1/n19-1034 .

[13]

JIN NWU J XMA Xet al. Multi-task learning model based on multi-scale CNN and LSTM for sentiment classification[J]. IEEE Access20208: 77060-77072. DOI: 10.1109/access.2020.2989428 .

[14]

YANG BWU L JZHU J Het al. Multimodal sentiment analysis with two-phase multi-task learning[J]. IEEE/ACM Transactions on Audio, Speech, and Language Processing202230: 2015-2024. DOI: 10.1109/TASLP.2022.3178204 .

[15]

MAJUMDER NPORIA SPENG H Yet al. Sentiment and sarcasm classification with multitask learning[J]. IEEE Intelligent Systems201934(3): 38-43. DOI: 10.1109/MIS.2019.2904691 .

[16]

YANG LNA J CYU J F. Cross-modal multitask transformer for end-to-end multimodal aspect-based sentiment analysis[J]. Information Processing & Management202259(5): 103038. DOI: 10.1016/j.ipm.2022.103038 .

[17]

LI JZHAO H W. Multimodal sentiment analysis method based on multi-task learning[C]//Proceedings of the 2023 6th International Conference on Signal Processing and Machine Learning. New York: ACM Press, 2023: 308-314. DOI: 10.1145/3614008.3614055 .

[18]

YU W MXU HYUAN Zet al. Learning modality-specific representations with self-supervised multi-task learning for multimodal sentiment analysis[C]//Proceedings of the 35th AAAI Conference on Artificial Intelligence. Palo Alto:AAAI Press,2021: 10790-10797. DOI: 10.1609/aaai.v35i12.17289 .

[19]

WEI Y WYUAN S ZYANG R Set al. Tackling modality heterogeneity with multi-view calibration network for multimodal sentiment detection[C]//Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. Stroudsburg: Association for Computational Linguistics, 2023: 5240-5252. DOI: 10.18653/v1/2023.acl-long.287 .

[20]

LI ZXU BZHU C Het al. CLMLF: A contrastive learning and multi-layer fusion method for multimodal sentiment detection[C]//Proceedings of the 19th North American Chapter of the Association for Computational Linguistics. Stroudsburg: Association for Computational Linguistics,2022:2282-2294. DOI: 10.18653/v1/2022.findings-naacl.175 .

[21]

HAZARIKA DZIMMERMANN RPORIA S. MISA: Modality-invariant and-specific representations for multimodal sentiment analysis[C]//Proceedings of the 28th ACM International Conference on Multimedia. New York: ACM Press, 2020:1122-1131. DOI: 10.1145/3394171.3413678 .

[22]

LIU Y, OTT M, GOYAL Net al. RoBERTa: A robustly optimized BERT pretraining approach[EB/OL]. [2024-03-04].

[23]

ZHAI P HZHANG D Y. Bidirectional-GRU based on attention mechanism for aspect-level sentiment analysis[C]//Proceedings of the 11th International Conference on Machine Learning and Computing. New York: ACM Press,2019: 86-90. DOI: 10.1145/3318299.3318368 .

[24]

DOSOVITSKIY ABEYER LKOLESNIKOV Aet al. An image is worth 16×16 words: Transformers for image recognition at scale [EB/OL]. [2024-07-21].

[25]

曹梦丽.基于辅助信息抽取与融合的社交媒体图文情感分析方法研究[D].武汉: 武汉科技大学,2022.DOI: 10.27380/d.cnki.gwkju.2022.000499 .

[26]

CAO M L.Sentiment analysis for images-text on social media based on auxiliary information extraction and fusion[D]. Wuhan: Wuhan University of Science and Technology,2022. DOI: 10.27380/d.cnki.gwkju.2022.000499(Ch ).

[27]

GE FLI WREN Het al. Towards exploiting sticker for multimodal sentiment analysis in social media: A new dataset and baseline[C]//Proceedings of the 29th International Conference on Computational Linguistics. New York: ACM Press, 2022: 6795-6804.

[28]

李书星, 胡慧君, 刘茂福. 基于语感一致性的社交媒体图文情感分析[J]. 中国科技论文202318(3): 322-329.

[29]

LI S XHU H JLIU M F. Sentiment analysis of social media images-text based on semantic sense consistency[J]. China Sciencepaper202318(3): 322-329 (Ch).

[30]

KENTON J D M W CTOUTABOVA L K. Bert: Pre-training of deep bidirectional transformers for language understanding[C]//Proceedings of the 17th NAACL-HLT. Stroudsburg: Association for Computational Linguistics, 2019:4171-4186.

[31]

HE K MZHANG X YREN S Qet al. Deep residual learning for image recognition[C]// Proceedings of the 22nd IEEE Winter Conference on Applications of Computer Vision. Piscataway: IEEE Press, 2016: 770-778. DOI: 10.1109/CVPR.2016.90 .

[32]

YU J FJIANG J. Adapting BERT for target-oriented multimodal sentiment classification[C]//Proceedings of the 28th International Joint Conference on Artificial Intelligence. Freiburg: Morgan Kaufmann,2019:5408-5414. DOI: 10.24963/ijcai.2019/751 .

[33]

TRUONG Q TLAUW H W. VistaNet: Visual aspect attention network for multimodal sentiment analysis[C]// Proceedings of the 33th AAAI Conference on Artificial Intelligence. Palo Alto:AAAI Press,2019: 305-312. DOI: 10.1609/aaai.v33i01.3301305 .

[34]

胡慧君, 丁子毅, 张耀峰, . 基于联合交互注意力的图文情感分析方法[J/OL]. 北京航空航天大学学报, 1-11. [2023-11-23].

[35]

HU H JDING Z YZHANG Y Fet al. Images-text sentiment analysis in social media based on joint and interactive attention[J/OL]. Journal of Beijing University of Aeronautics and Astronautics, 1-11. [2023-11-23].

基金资助

“十四五”湖北省优势特色学科(群)项目(2023D0302)

AI Summary AI Mindmap
PDF (1932KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/