基于多模态双向融合与图神经网络的对话情感分析

张建新, 胡慧君, 扈振义, 刘茂福, 张耀峰

武汉大学学报(理学版) ›› 2026, Vol. 72 ›› Issue (3) : 381 -392.

PDF (3230KB)
武汉大学学报(理学版) ›› 2026, Vol. 72 ›› Issue (3) : 381 -392. DOI: 10.14188/j.1671-8836.2024.0138
智能计算与机器学习

基于多模态双向融合与图神经网络的对话情感分析

    张建新1, 2, 胡慧君1, 2, 扈振义1, 2, 刘茂福1, 2, 张耀峰3, 4
作者信息 +

Emotion Recognition in Conversations Based on Multimodal Bidirectional Fusion in Graph Neural Networks

    Jianxin ZHANG1, 2, Huijun HU1, 2, Zhenyi HU1, 2, Maofu LIU1, 2, Yaofeng ZHANG3, 4
Author information +
文章历史 +
PDF (3306K)

摘要

多模态对话情感分析的目标是识别对话中每个句子的情感。现有方法的模态融合方式较简单,无法充分捕捉和利用不同模态的特性和信息。此外,这些方法更侧重于局部上下文的捕捉,特别是在处理较长对话时,往往忽略了发言者之间远距离情感信息的整合。为了解决这些问题,提出了一种基于多模态双向融合的图神经网络(Graph Neural Network Based on Multimodal Bidirectional Fusion,GMBF),该网络由多模态融合模块和远距离情感融合模块组成。多模态融合模块由三个双向融合模块组成,双向融合模块从正向和逆向两个方向融合多模态信息,通过逐步融合模态信息以确保信息的充分融合;远距离情感融合模块首先构建对话的句子信息,然后捕捉远距离发言者信息,并将其融入句子信息中,从而使模型能够更好地理解全局情感背景。实验结果表明,所提出的方法在多模态对话情感分析任务中表现优异,展现了其在多模态信息融合和全局信息提取方面的优势。

Abstract

The goal of multimodal conversational emotion recognition is to identify the emotion of each utterance in a conversation. Existing methods for modality fusion, which are relatively simple, fail to fully capture and leverage the characteristics and information of different modalities. Furthermore, these methods primarily focus on capturing local context, and often overlook the integration of long-range emotional information between speakers, especially in handling lengthy conversations. To address these issues, this paper proposes a Graph Neural Network Based on Multimodal Bidirectional Fusion (GMBF), which consists of a multimodal fusion module and a long-range emotion fusion module. The multimodal fusion module is composed of three bidirectional fusion submodules, each of which integrates multimodal information from both forward and reverse directions, ensuring comprehensive information fusion through progressive integration. The long-range emotion fusion module first constructs sentence-level information for the conversation, then captures long-range speaker information and incorporates it into the sentence representations, enabling the model to better understand the global emotional context. Experimental results demonstrate that the proposed method achieves superior performance on multimodal conversational emotion recognition tasks, demonstrating its advantages in multimodal information fusion and global information extraction.

Graphical abstract

引用本文

引用格式 ▾
张建新, 胡慧君, 扈振义, 刘茂福, 张耀峰. 基于多模态双向融合与图神经网络的对话情感分析[J]. 武汉大学学报(理学版), 2026, 72(3): 381-392 DOI:10.14188/j.1671-8836.2024.0138

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

随着社交媒体和即时通讯工具的普及,人们之间的互动变得前所未有的频繁和复杂。对话情感分析(Emotion Recognition in Conversations, ERC)作为自然语言处理(Natural Language Processing, NLP)的一个重要分支,旨在识别和理解对话中表达的情感。这一任务不仅在情感计算、心理健康评估和人机交互等领域具有广泛的应用,而且在提升用户体验和社交媒体内容分析的准确性方面发挥着至关重要的作用。

当下,人们的交流不再局限于文字,已扩展到语音、视频和图像等多种模态[1]。因此,单一模态信息不足以全面捕捉对话情感。多模态融合方法旨在综合利用文本、语音和视觉信息,在更丰富的情境下分析情感表达。以往的多模态融合方法直接将所有模态信息一次性融合,导致信息融合不充分,影响模型性能[2]

在对话情感分析领域,传统的基于序列的方法[3-4]仅能顺序读取对话内容,只能接收之前发言所传递的情感信息,无法捕捉未来的情感信息,导致全局情感信息缺失;同时,对话不仅是单个发言者的连续讲话,更是多个发言者之间的互动,这种方法将每个发言者的发言视为独立的时间序列,仅能捕捉该发言者的情感动态变化,忽视了多个发言者之间的相互作用和情感传递。相比之下,图建模方法通过聚合过去与未来窗口内的信息,弥补了序列模型中全局情感缺失的问题。同时,发言者间的互动作为各节点间的边,能有效表示和处理多个发言者之间的情感传递[5]

然而,传统的图建模方法,尤其是图神经网络(Graph Neural Networks, GNN)在处理节点间关系时,通过局部邻域信息的传播进行节点表示更新,侧重于聚合窗口内节点的信息,忽略了远距离的情感信息[5]。由于窗口大小的限制,当前句子无法获取对话的全局信息。对于远距离的句子,特别是在较长对话中,它们的信息可能需要多次传播才能到达当前句子。这种局限性使得模型难以全面理解对话中的情感动态,尤其是在涉及复杂情感变化的场景中,可能导致情感分析结果与实际情感表达不一致。

多模态信息的互补性,能够提升信息的完整性和准确性。双向长短期记忆(Bidirectional Long Short-Term Memory, BiLSTM)网络在NLP中的成功应用,证明了双向处理能够全面捕捉上下文信息。因此,本文提出了一种基于多模态双向融合的图神经网络(Graph Neural Network Based on Multimodal Bidirectional Fusion,GMBF),通过引入全局信息和建模发言者之间的互动关系改进了图神经网络,有效弥补了序列模型在全局情感捕捉上的不足[6-7]。此外,引入外部常识知识对发言者心理状态进行建模,以增强图建模中边的表达,并全面反映对话中的情感动态和参与者互动[8]。GMBF包括多模态融合模块和远距离情感融合模块,构成多模态融合模块的双向融合模块通过正向和逆向两个不同的方向融合多模态信息,确保了各个模态之间的互补信息都能被充分捕捉到,弥补单一方向融合可能遗漏的信息,提升整体信息质量;同时,远距离情感融合模块将与当前句子同一发言者的后续句子的情感信息融合到当前句子的表示中,使模型直接将远距离的相关信息聚合到当前句子中,避免了因多发言者信息融合导致的情感混淆,提升了模型的情感分析性能。本文的主要贡献如下:

1) 提出了多模态融合模块,充分融合文本、语音和视觉信息,确保了信息的全面性,从而更全面地捕捉对话中的情感表达。

2) 提出了远距离情感融合模块,通过将远距离发言者的情感信息与当前句子信息进行融合,增强了模型对整体语境的理解能力。

1  相关工作

ERC任务不仅需要捕捉单个发言者的情感,还需要理解发言者之间的互动关系和对话上下文的影响。因此,如何有效地融合多模态信息和对上下文建模成为ERC研究的关键问题。

1.1 多模态融合

多模态融合方法因其能够综合利用多种模态的信息而受到广泛关注。不同模态如文本、音频和视觉信号可以提供互补的信息,从而提升情感分析的准确性和鲁棒性[9]。根据不同的信息融合策略,ERC中的多模态融合方法通常分为前融合、后融合和混合融合三类。

前融合方法在特征提取阶段将不同模态的原始特征直接连接或组合,从而利用所有模态的信息。Joshi等[2]提出的COGMEN模型将多模态信息在特征提取阶段进行融合,并利用上下文的GNN建模不同模态之间的复杂依赖关系,但是简单的前融合可能无法充分利用各模态特征的独立性和特异性,导致部分模态信息在融合过程中被稀释或丢失。Zhang等[10]提出的CMCF-SRNet通过设计跨模态局部约束Transformer和基于图的语义精炼Transformer,解决发言之间语义关系信息不足的问题,但是其模态信息融合仍不够充分。

后融合方法则是在特征提取和初步处理之后再进行模态间的信息融合。Lu等[11]提出的BiGMF模型通过双流图学习结构,避免了前融合中模态特征相互干扰,使得各模态信息可以在各自的流中得到充分提取和表达,但在融合阶段如何高效地整合独立流的信息仍然是一个挑战,可能会影响模型的整体性能。

混合融合方法结合了前融合和后融合的优点,在特征提取和模态间信息融合的过程中,兼顾了模态特征的独立性和信息整合的有效性,因此,本文采用了混合融合的方法。Zhang等[12]提出的MA-CMU-SGRNet模型,通过多层次对齐机制,将不同模态之间的信息进行精细化对齐,从而在不同层级上建立一致的语义表示,有助于增强模态间的交互信息和整合效能,为混合融合方法提供了新的视角和思路,为对话情感分析领域的进一步研究奠定了基础。

1.2 图建模

在对话情感分析任务中,准确捕捉对话的上下文信息对于情感分析至关重要。这些上下文信息不仅涵盖单个发言的内容,还包括发言者之间的互动、时序依赖关系以及跨模态的信息融合。因此,有效的上下文建模方法是实现准确情感分析的核心。

ERC领域的研究逐步从单一的情感分类方法,转向能够捕捉上下文关系的序列建模方法。序列建模如Poria等[13]提出的bc-LSTM+Att模型,仅基于长短期记忆网络(Long Short-Term Memory, LSTM)捕捉视频中语句的上下文关系,无法处理远距离依赖,并且在面对较长序列时容易出现梯度消失问题。为了解决上述问题,Hazarika等[14]在ICON模型中引入了交互式记忆网络,并通过层次化的结构整合了文本、音频和视觉三种模态的特征,从而在一定程度上解决了远距离依赖问题。

尽管序列建模在捕捉对话中的上下文关系方面取得了显著进展,但仍然存在一些局限性。首先,序列模型通常依赖于线性顺序,这在处理对话中复杂的非线性关系时可能不足。其次,在处理长序列时,即使引入了记忆网络,模型的性能仍可能受到影响,表现出渐进性下降的趋势。近年来,ERC任务中越来越多地采用基于图结构的上下文建模方法解决上述问题。

Ghosal等[5]提出的DialogueGCN模型,通过引入图卷积网络(Graph Convolutional Network, GCN)建模对话中的复杂依赖关系,包括发言者之间的交互和时序依赖,更全面地表示和整合了对话信息。然而,DialogueGCN仅依赖固定的邻接节点进行信息传播,可能无法灵活处理对话中复杂的上下文关系。为进一步改进,Shen等[15]提出了DAG-ERC,引入了有向无环图结构建模对话中的信息流。与之前的图结构相比,DAG-ERC更注重时间顺序的信息传播,并且限制了从未来的发言传递信息到过去,这使得模型在处理长对话和复杂上下文时更加有效。Li等[16]提出的GA2MIF模型进一步推进了对话情感分析中的上下文建模,GA2MIF能够更灵活地处理对话中复杂的非线性关系,尤其是在多模态信息融合方面表现出色,但是其在多模态信息的整合上较为侧重于局部的多模态信息融合,没有设计专门的机制来整合和捕捉全局的远距离情感信息。这使得模型在处理长对话时,可能会忽略对话中相隔较远的情感关联。

综合以上分析可知,目前的多模态对话情感分析任务存在以下问题:1) 在多模态融合方面,前融合和后融合的融合方式都比较简单,无法充分捕捉各模态信息的细节;2) 在上下文建模方面,尽管图建模可以处理对话中的复杂依赖关系,但是仍存在远距离依赖处理不佳的问题。

2  本文方法

图1展示了GMBF模型的整体架构。GMBF主要由两个模块组成:多模态融合模块和远距离情感融合模块。多模态融合模块由三个双向融合模块(Bidirectional Fusion Module, BFM)组成,用于融合单模态特征;远距离情感融合模块则用于构建句子信息,捕捉远距离发言者信息,并将这两类信息进行融合。在句子信息构建过程中,图中的边通过知识库进行了增强。

2.1 问题定义

在对话情感分析任务中,一组对话由N个连续的发言构成,定义对话为序列U=u1,u2,,uN,其中,ui表示对话中第i个话语。一组对话对应M个发言者,定义发言者为序列S=s1,s2,,sM,其中,si表示语句ui对应的发言者。话语ui包含文本t、音频a、视觉v三种模态,其特征表示分别记作uitRdtuiaRdauivRdv。本文中Ut=u1t,u2t,,uNtRN×dtUa=u1a,u2a,,uNaRN×daUv=u1v,u2v,,uNvRN×dv表示整个对话中所有发言的文本、音频和视觉模态序列。对话情感分析任务的目标是根据预定义的情感类别,从这些模态特征中预测每个发言ui的情感标签。为此,模型需要综合利用对话的上下文信息、发言的多模态特征以及发言者的信息,以实现对每个发言情感的准确分类。

2.2 双向融合模块

为了避免信息在一次性融合过程中可能出现的丢失和混淆,双向融合模块将多模态信息逐步引入模型,有助于模块在每个阶段充分利用不同模态的信息,进行更细致的特征提取和交互,从而提高融合效果和模型的整体性能。对于输入的三种模态特征m1m2m3,其中m1=UtRN×dtm2=UaRN×dam3=UvRN×dv,该模块负责首先正向融合其中两种模态,然后逐步引入第三种模态并进行逆向融合,如图2所示,其中每个BFM都以第三种模态为主进行融合,所以融合过程中前两种模态经过一次Transformer编码,而第三种模态经过两次编码,以最终形成综合性的多模态特征表示。该模块包含两个子模块:正向融合子模块和逆向融合子模块。

正向融合子模块先将模态m1m2作为输入,经过Transformer编码器[17]得到输出o1RN×dt,如(1)式所示。

o1=Transformerm1,m2

然后将o1和第三种模态m3作为输入,连续经过两次Transformer编码器得到输出o3RN×dt,如(2)式所示。

o3=TransformerTransformero1,m3,m3

逆向融合子模块首先将m1m3作为输入,经过两次Transformer编码器得到输出o4RN×dt,如(3)所示。

o4=TransformerTransformerm1,m3,m3

最后将o4和模态m2作为输入,同样经过Transformer编码器得到输出o5RN×dt,将o3o5进行融合,作为双向融合模块最终的输出表示ofinal1RN×dt,如(4)式所示。

ofinal1=W0o5,o3+b

式中,W0是可训练参数,b是偏置项。

本文采用了三个双向融合模块对初始特征进行融合,且不同模态组合的特性可能对情感分类产生不同的贡献,因此设计了一个权重自适应模块,用于动态衡量各个模态对最终输出的影响。该模块对多模态特征进行加权融合,最终生成综合性的特征表示。给定三个模块的输出向量ofinal1ofinal2ofinal3,将它们通过无偏置的线性变换来处理每个输出向量的表示,并对处理后的多模态表示进行softmax操作,得到每个输出的权重nsoftmax,如(5)式所示。

nsoftmax=softmaxW1ofinal1,W2ofinal2,W3ofinal3

其中,W1W2W3表示与不同模态对应的权重矩阵,用于对不同模态重要性进行调整;用于将权重矩阵W1W2W3与对应的输出向量ofinal1ofinal2ofinal3进行向量积运算。

使用这些权重nsoftmax对输出向量进行加权并求和,得到最终的融合表示N'RN×dt,如(6)式所示。

N'=i=13nsoftmaxni

其中,ni=ofinaliRN×dt表示逐元素乘积。

2.3 远距离融合模块

在对话情感分析中,准确捕捉和理解全局上下文以及发言者的特定信息,对于识别对话中的情感至关重要。为此,远距离情感融合模块首先利用图神经网络对对话进行图表示,从而构建句子信息,并使用Transformer捕捉远距离发言者的情感信息。最后,将前述句子信息与发言者信息进行融合处理。

2.3.1 对话的图表示

本文构建了一个有向图表示对话信息的交互,记为G=𝒱,,,𝒜。其中,𝒱表示对话节点,表示边类型,表示对话ij之间的边,𝒜表示边属性。

有向图的顶点由对话里的每个句子ui构成,本文使用多模态融合模块输出的表示N'iRdu作为节点特征hi的初始值,初始节点特征包含会话上下文信息,节点用vi表示。有向图的边表示为ei,j=vi,rij,vj,对于每条边,如果该边的rijxIntent,xWant,oWant,则通过COMET模型[18]生成与关系类型对应的表示,并用这些表示增强边的表达,使得图结构中包含了更多的心理和语义信息。这些增强的边表示使得本文的GMBF模型能够更准确地捕捉发言者在会话中的动作和意图。其中,xWant表示当前会话对后续会话的动作指导;xIntent表示后续会话对当前会话意图的预测;oWant表示不同发言者间的动作影响。

有向图边的类型遵从如下法则:若话语的发言者为同一人,则有intravsivsi;若话语的发言者不为同一人,则有intra{vsivsj}ij。进一步考虑窗口大小,使用Ρ作为窗口超参数,分别表示过去Ρ个话语和未来个话语与当前话语的关系。另外,考虑到要增强边的表示,若vivj,并且si=sj,则rij=xIntent;若vivj,并且si=sj,则rij=xWant;若vivj,并且sisj,则rij=oWant;其他情况rij=others

2.3.2 句子信息构建

图神经网络结构用于处理构建的对话交互图,以捕捉对话中的复杂交互和心理状态的传递,从而构建局部句子信息。具体而言,GMBF模型的图神经网络包括以下两个关键部分:基于注意力的关系图卷积和GraphTransformer[19]

RGCN[20]通过根据连接的边类型聚合其邻居的节点表示更新节点的隐藏状态,ARGCN[21]引入了一种距离感知的注意力机制增强RGCN的能力,对话节点更新的过程如(7)式所示。

hi'=σrRci,jjNirxij,r+W4hi

其中,σ表示激活函数,R表示关系集合,hi=N'iRdt是节点vi的输入表示,hi'Rdt是节点vi的输出表示,Nir属于关系rR下的vi的邻居集合,W4是可训练参数,ci,r是一个问题特定的归一化常数,通常分配为关系r下的邻居数量。

GMBF模型使用一个包含L层的GraphTransformer,以传播由ARGCN聚合的交互信息。每个话语节点vi𝒱的节点表示hilRdt,通过(8)式进行更新。

hil+1=1-βijNiαi,jmj+βiW6hil

其中,Ni表示与目标节点i连接的源节点集合,mj是源节点传递的信息,αi,j是注意力得分,βiϵRl是残差连接的门控参数,W6Rdt×dt是映射权重。基于上述节点更新规则,可以得到对话中所有节点的最终表示。对话的最终输出表示为HRdu×du

2.3.3 远距离发言者信息捕捉

为了在发言者层面学习上下文表示,GMBF模型使用了一个Transformer网络捕捉同一发言者的相邻话语之间的自依赖性。给定每个话语的融合特征ni=N'iRdt,发言者层面的上下文表示为piRdu的计算如(9)式所示。

pi=Transformerni,hλ,j, j1,Uλ

其中,Uλ表示发言者pλ的所有话语, hλ,jRdt是发言者pλ的第j个隐藏状态,源自发言者层面的Transformer网络。

2.3.4 信息融合

首先,表示GMBF模型得到对话的句子信息GRN×du和远距离发言者的信息SRN×du。对于对话中的第i句话,其特征信息表示为XiRdu,该句发言者为pi,Xi=fGpast,pi聚合了过去npast句话的信息,其中Gpast是过去npast句话的信息。对话的第i句话的发言者特征信息表示为SiRdu,聚合了本轮对话中从第i句到最后一句的所有发言者为pi的句子的信息,如(10)式所示。

Si=ARGCNSi,Sj,ji,Uλ

其中,Uλ代表对话所有话语。

现在计算XiSi的相似度,记作simXi,Si。计算Xi与这轮对话所有发言者信息S的相似度,如(11)式所示。

simXi,S=i=1NsimXi,Si

其中,N是对话中的话语数量。

使用Transformer融合XiSi,在融合过程中进行加权融合。Transformer的注意力分数被赋予的权重为ωij=simXi,S,得到融合结果HiRdu,如(12)式所示。

Hi=TransformerXi,S,ωij

2.3.5 训练和预测层

线性层对远距离情感融合模块提取的融合特征Hi进行处理,然后将Hi经过ReLU激活函数和Softmax层,以预测与话语对应的情感。

Hi'=ReLUW7Hi+b1
Di=SoftmaxW7Hi'+b2
y^i=argmaxDi

其中,Hi'表示经过线性变换和ReLU激活函数处理后的特征,W7表示线性变换中的权重矩阵,b1b2表示线性变换中的偏置向量,Di表示Softmax层的输出,y^i表示最终预测的情感类别。

本文使用交叉熵函数来计算损失θ,如(16)式所示。

θ=-i=1Nj=1cilogPi,jyi,j

其中,N是所有对话的数量,ci是第i个对话中的话语数量,Pi,j是第i个对话中第j个话语的情感标签概率,yi,j是第i个对话中第j个话语的标签,θ是可训练的参数。

3  实 验

3.1 数据集

本文使用IEMOCAP[22]和MELD[23]数据集评估GMBF模型。这两个数据集的统计数据如表1所示。

IEMOCAP多模态数据集包含了双向对话的视频,每个视频记录了一个完整的对话,有151个对话和7 433个句子。数据集中的对话是由两名演员根据剧本表演而来。每个句子都标有6种情绪之一:快乐、悲伤、中性、愤怒、兴奋和沮丧。

MELD多模态数据集是从《老友记》电视剧中收集的多发言者对话数据集,涵盖视频、音频和文本数据,包含1 433个对话和13 708个句子。每个句子都标有7种情绪之一:中性、惊讶、恐惧、悲伤、快乐、厌恶和愤怒。该数据集中的对话通常涉及三个或更多的发言者。

3.2 参数设置

将IEMOCAP和MELD数据集均按照8∶1∶1的比例划分为训练集、验证集和测试集,为保证数据的随机性和多样性,采用随机采样器进行采样。在特征提取方面,设定隐藏维度均为300维,使用基于Transformer架构的预训练语言模型RoBERTa-large提取文本特征,其维度为1 024;使用openSMILE(一种开源的音频特征提取工具,广泛用于音频和情感识别任务)提取音频特征,其维度为1 582;使用DenseNet(一种卷积神经网络架构,具有密集连接特性,常用于图像特征提取)提取视觉特征,其维度为342维。此外,设定GCN层数为8层。为保证结果的可靠性,对模型进行了多次独立训练,并取测试集上10次随机运行所得分数的平均值作为报告的结果。

3.3 实验结果与分析

为了评估模型的性能,本文采用了准确率(Acc)和加权平均的F1值(w-F1)作为评价指标。具体计算公式如下:

Acc=TP+TNTP+FP+TN+FN×100%
F1=2Precision·RecallPrecision+Recall
wF1=i=1n(niNF1(i))×100%

其中,Precision为精准率,Recall为召回率;TP代表正类预测为正类的样本数,TN代表负类预测为负类的样本数,FP代表负类预测为正类的样本数,FN代表正类预测为负类的样本数;F1(i)表示在第i个分类上计算的F1值。

准确率(Acc)反映了模型总体预测的正确率,其值越大表示模型的分类性能越好。加权平均的F1值(w-F1)综合考虑了模型的精确率和召回率,w-F1对类别不平衡的数据更具鲁棒性,其值越接近1越好,表示模型在不同类别上的表现越均衡。

GMBF模型将与以下基线模型进行比较。

ICON[14]:提出了一种多模态情感检测框架,提取对话视频中的多模态特征,并通过全局记忆进行情感预测。

DialogueRNN[24]:基于RNN的方法,跟踪对话中各方的情感状态,并使用这些信息进行情感分类。

DialogueCRN[25]:采用多回合推理模块,基于情感认知理论从认知角度全面理解对话背景。

SACL-LSTM[26]:通过监督对抗对比学习框架提取类间结构化表示,设计上下文对抗训练策略提高模型的上下文鲁棒性。

COGMEN[2]:基于图神经网络,结合本地和全局信息建模对话中的复杂依赖关系,进行多模态情感分析。

COSMIC[27]:结合常识知识的框架,通过学习对话参与者间的互动,解决上下文传播和情感转移问题。

SPCL-CL-ERC[28]:提出监督原型对比学习损失,通过课程学习缓解极端样本的影响,提高对话情感分析的分类效果。

EmotionIC[29]:基于情感惯性和传染驱动的依赖建模方法,结合注意力和循环方法,在特征提取和分类层面更全面地建模对话。

DialogueGCN[5]:基于图神经网络的方法,利用对话者之间的依赖关系来建模对话上下文进行情感分析。

DAG-ERC[15]:提出用有向无环图对话建模,通过有向无环神经网络更直观地处理远距离对话背景信息。

GraphCFC[30]:提出了图基跨模态特征补全模块,利用多子空间提取器和配对跨模态补全策略,增强多模态信息的提取。

GA2MIF[16]:提出基于图和注意力的多阶段信息融合方法,优化多模态数据融合,捕捉远距离上下文和跨模态互补信息。

本研究在IEMOCAP和MELD两个情感分析数据集上对GMBF模型与基线模型的性能进行了评估,结果如表2所示。

表2可知,GMBF模型在这两个数据集上均表现出色。在IEMOCAP数据集上,GMBF模型达到了70.79%的准确率和71.04%的加权F1值,显著优于基线模型。具体而言,SACL-LSTM和GA2MIF在该数据集上也表现良好,分别取得了69.22%和70.00%的加权F1值,SACL-LSTM虽然利用对抗性对比学习加强了特征的表示,但是LSTM在提取远距离信息方面仍有缺陷;GA2MIF忽略了多模态信息融合的时候发言者情感的影响,GMBF模型由于远距离情感融合模块的存在,可以更好地聚合远距离信息,并且让发言者情感信息深度参与模态融合,表明了发言者情感信息的有效性。COGMEN准确率为68.20%,其多模态信息直接进行融合,GMBF模型不仅进行双向融合,还将融合过程逐步进行,避免了信息混合过于粗糙的问题。在MELD数据集上,GMBF模型取得了67.62%的准确率和65.87%的加权F1值,同样优于大部分基线模型。SPCL-CL-ERC和EmotionIC模型在该数据集上的表现也较为突出,分别取得了67.25%和66.32%的加权F1值。SPCL-CL-ERC模型的加权F1比GMBF模型高,是因为MELD数据集本身具有类别不平衡的特点,SPCL-CL-ERC引入了监督原型对比学习(SPCL)损失,这种损失在处理类别不平衡和对比学习中具有优势。尽管GMBF在多模态信息融合和远距离情感捕捉上具有优势,但在类别不平衡的数据集上可能会表现出一些劣势,导致加权F1值有所下降。EmotionIC模型的加权F1也比GMBF模型高,这是因为EmotionIC模型专注于情感惯性和传染的建模,这些因素在实际对话中起着至关重要的作用。

3.4 消融实验

本研究在IEMOCAP和MELD上进行了消融实验。表3展示了不同消融设置下的实验结果。

对于逆向融合子模块来说,在所有模态组合中产生了积极影响。三模态情况下,两个数据集上去除逆向融合子模块之后模型性能均发生了下降,证明了该模块的有效性。其次,在两模态融合的情况下,逆向融合子模块均起作用。在IEMOCAP数据集中,T+V模态组合性能下降最显著,而在MELD数据集中,A+V模态组合性能下降最显著。这表明不同模态间的信息互补性在不同数据集上的表现具有差异性。实验结果说明逆向融合子模块包含了特征的关键融合信息,去除后模型无法增强多模态信息的融合,导致性能下降。

对于正向融合子模块来说,在大部分模态组合中产生了积极影响。尤其是在T+V和T+A模态组合中,模型的w-F1和Acc都有下降,说明正向融合模块在这两个模态组合中起到了关键作用。在IEMOCAP数据集上,该模块对模型的整体性能影响较大,特别是在T+A模态组合中,消融该模块导致了最大幅度的性能下降。在A+V模态组合中,去除该模块导致w-F1和Acc上升,说明该模块对于语音和图像的建模未能体现优势,去除该模块使A+V的特征交互变得更加直接,从而性能有所提升。在MELD数据集上,该模块的消融同样显著影响了模型的性能,尤其是在A+V模态组合中,说明正向融合子模块在处理音频和视频信息时尤为重要。

对于远距离情感融合模块来说,在不同的模态配置下,利用远距离发言者的情感信息进行融合的机制确实发挥了作用,该模块在IEMOCAP数据集上的效果强于在MELD上的,这是因为MELD数据集的对话是由多个人构成,该模块获取的未来的情感信息是分散的,并不集中,导致模型性能提升不大。

GMBF模型在综合利用多模态信息时表现出色,即使去除某个模态,整体性能仍然保持较高水平,体现了模型的有效性。这些结果验证了各模块在不同模态组合中的作用,为进一步优化模型提供了重要参考。

3.5  t-SNE可视化

本研究对模型在IEMOCAP数据集上的t-SNE可视化结果进行了分析,图3(a)展示了模型在初始状态下的特征分布,图3(b)则展示了模型学习到的特征分布。IEMOCAP数据集包含的标签为:快乐(hap)、悲伤(sad)、中性(neu)、愤怒(ang)、兴奋(exc)和沮丧(fru)。与初始状态相比,不同情感类别的数据点在低维空间中表现出了更明显的分离。具体而言,快乐、悲伤、中性和愤怒这几个类别在分类后的t-SNE图中形成了较为明显的聚类,表明模型能够较好地区分这些情感类别,而兴奋和沮丧则存在一些混杂现象,这是因为这两种情感可能会因为相似的情感强度或表达方式而被混淆。例如,某些带有强烈情感波动的言辞可能在不同语境下被解读为激动或沮丧。这些结果表明,通过模型的分类,大部分情感类别的数据点在低维空间中实现了较好的分离,验证了GMBF模型在情感分析任务中的有效性。MELD数据集上的可视化效果与IEMOCAP数据集类似,其包含的标签为:中性(neu)、惊讶(sur)、恐惧(fea)、悲伤(sad)、快乐(joy)、厌恶(dis)和愤怒(ang)。

3.6 分类结果分析

混淆矩阵可提供详细的分类结果。在混淆矩阵中,对角线上的值越大越好,非对角线上的值越小越好。图4展示了GMBF模型在IEMOCAP和MELD数据集上的混淆矩阵。从图4可以看出,模型在大多数情感类别上的分类性能较好,但在某些情感相似或样本数量较少的类别上存在一定的误分类现象。尤其是快乐(hap)与兴奋(exc)、中立(neu)与愤怒(ang)或悲伤(sad)等情感类别容易被混淆。这表明,未来可以通过进一步引入上下文信息或改进模型结构等方法,进一步提高模型在情感分析任务中的准确性和鲁棒性。

3.7 实例分析

本研究通过对具体对话案例进行研究,分析模型在实际应用中的表现。选择此案例是为了展示模型在处理对话时的有效性和局限性。

该案例来自IEMOCAP数据集中的一组对话,该对话涉及两位参与者,分别表达了多种情感,包括快乐、悲伤和愤怒等。对话包含了74个发言轮次,表4展示了对话中的6个轮次。可以看到,GA2MIF模型对轮次38的话语预测为“快乐”,这可能是在38轮之前“快乐”的句子出现频率较高,导致GA2MIF模型预测错误,而GMBF模型因为关注了对话后半部分发言者的情感信息,所以预测没有发生偏离。

本研究对上述案例中含有74个发言轮次的对话,在远距离情感融合模块中进行信息融合时的注意力进行了可视化,如图5所示,图中不同颜色代表不同的注意力值,颜色越浅,注意力程度越高。由图5可知,注意力热图右半部分颜色较浅,表明模型对对话后半部分的注意力高于前半部分,说明模型确实在用远距离对话人的情感信息对当前话语进行调整,证明了远距离情感融合模块的有效性。

4  结 语

本文提出了一种基于多模态双向融合的图神经网络模型来进行多模态情感分析。通过引入多模态融合模块和远距离情感融合模块,GMBF模型在两个基准数据集上取得了不错的性能,显示了模型在多模态融合和全局上下文信息提取上的有效性。此外,本文还强调了在处理多发言者对话时,考虑发言者心理状态的重要性。

未来的工作将进一步探讨如何在更大规模和更复杂的对话场景中扩展和优化该模型,并且考虑挖掘对话中的隐式情感,以提高情感分析的准确性和鲁棒性。

参考文献

[1]

GEETHA A VMALA TPRIYANKA Det al. Multimodal Emotion Recognition with deep learning: Advancements, challenges, and future directions[EB/OL].[2024-05-30]. DOI: 10.1016/j.inffus.2023.102218 .

[2]

JOSHI ABHAT AJAIN Aet al. COGMEN: COntextualized GNN based Multimodal Emotion recognitioN[C]//Proceedings of the 2022 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies. Stroudsburg: Association for Computational Linguistics, 2022: 4148-4164. DOI: 10.18653/v1/2022.naacl-main.306 .

[3]

LIAN ZLIU BTAO J H. CTNet: Conversational transformer network for emotion recognition[J]. IEEE/ACM Transactions on Audio, Speech, and Language Processing202129: 985-1000. DOI: 10.1109/TASLP.2021.3049898 .

[4]

MA HWANG JLIN Het al. A multi-view network for real-time emotion recognition in conversations[EB/OL].[2022-01-25]. DOI: 10.1016/j.knosys.2021.107751 .

[5]

GHOSAL DMAJUMDER NPORIA Set al. DialogueGCN: A graph convolutional neural network for emotion recognition in conversation[EB/OL]. 2019: 1908.11540. DOI: 10.18653/v1/d19-1015 .

[6]

HOU G YSHEN Y LZHANG W Qet al. Enhancing emotion recognition in conversation via multi-view feature alignment and memorization[C]//Findings of the Association for Computational Linguistics: EMNLP 2023. Stroudsburg: Association for Computational Linguistics, 2023: 12651-12663. DOI: 10.18653/v1/2023.findings-emnlp.842 .

[7]

WANG BDONG GZHAO Yet al. Hierarchically stacked graph convolution for emotion recognition in conversation[EB/OL].[2023-03-05]. DOI: 10.1016/j.knosys.2023.110285 .

[8]

LI J NLIN ZFU Pet al. Past, present, and future: Conversational emotion recognition through structural modeling of psychological knowledge[C]//Findings of the Association for Computational Linguistics: EMNLP 2021. Stroudsburg: Association for Computational Linguistics, 2021: 1204-1214. DOI: 10.18653/v1/2021.findings-emnlp.104 .

[9]

黄礼东, 胡慧君, 陈佳逸, . 基于知识增强与多层注意力机制的方面级情感分析方法[J]. 武汉大学学报(理学版)202470(4): 473-481. DOI: 10.14188/j.1671-8836.2023.0014 .

[10]

HUANG L DHU H JCHEN J Yet al. Aspect-based sentiment analysis method based on knowledge enhancement and multi-layer attention mechanism[J]. Journal of Wuhan University (Natural Science Edition)202470(4): 473-481. DOI: 10.14188/j.1671-8836.2023.0014(Ch ).

[11]

ZHANG X HLI Y. A cross-modality context fusion and semantic refinement network for emotion recognition in conversation[C]//Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Stroudsburg: Association for Computational Linguistics, 2023: 13099-13110. DOI: 10.18653/v1/2023.acl-long.732 .

[12]

LU NHAN ZHAN Met al. Bi-stream graph learning based multimodal fusion for emotion recognition in conversation[EB/OL].[2024-06-30]. DOI: 10.2139/ssrn.4614720 .

[13]

ZHANG X HCUI W GHU Bet al. A multi-level alignment and cross-modal unified semantic graph refinement network for conversational emotion recognition[J]. IEEE Transactions on Affective Computing202415(3): 1553-1566. DOI: 10.1109/TAFFC.2024.3354382 .

[14]

PORIA SCAMBRIA EHAZARIKA Det al. Context-dependent sentiment analysis in user-generated videos[C]//Proceedings of the 55th Annual Meeting of the Association forComputational Linguistics (Volume 1: Long Papers). Stroudsburg: Association for Computational Linguistics, 2017: 873-883. DOI: 10.18653/v1/p17-1081 .

[15]

HAZARIKA DPORIA SMIHALCEA Ret al. ICON: Interactive conversational memory network for multimodal emotion detection[C]//Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing. Stroudsburg: Association for Computational Linguistics, 2018: 2594-2604. DOI: 10.18653/v1/d18-1280 .

[16]

SHEN W ZWU S YYANG Y Yet al. Directed acyclic graph network for conversational emotion recognition[EB/OL]. 2021: 2105.12907.DOI: 10.18653/v1/2021.acl-long.123 .

[17]

LI JWANG X PLV G Qet al. GA2MIF: Graph and attention based two-stage multi-source information fusion for conversational emotion detection[J]. IEEE Transactions on Affective Computing202415(1): 130-143. DOI: 10.1109/TAFFC.2023.3261279 .

[18]

VASWANI ASHAZEER N MPARMAR Net al. Attention is all you need[EB/OL].[2017-06-12]. DOI: 10.1007/978-3-031-84300-6_13 .

[19]

BOSSELUT ARASHKIN H, SAP M, et al. COMET: Commonsense transformers for automatic knowledge graph construction[EB/OL]. 2019: 1906.05317. DOI: 10.18653/v1/p19-1470 .

[20]

SHI Y SHUANG Z JFENG S Ket al. Masked label prediction: Unified message passing model for semi-supervised classification[EB/OL]. 2020: 2009.03509. DOI: 10.24963/ijcai.2021/214 .

[21]

CHEN J JHOU H XGAO Jet al. RGCN: Recurrent Graph Convolutional Networks for Target-Dependent Sentiment Analysis[M]//Knowledge Science, Engnieering and Management. Cham: Springer International Publishing, 2019: 667-675. DOI: 10.1007/978-3-030-29551-6_59 .

[22]

JIANG J FWANG AAIZAWA A. Attention-based relational graph convolutional network for target-oriented opinion words extraction[C]//Proceedings of the 16th Conference of the European Chapter of the Association for Computational Linguistics: Main Volume. Stroudsburg: Association for Computational Linguistics, 2021: 1986-1977. DOI: 10.18653/v1/2021.eacl-main.170 .

[23]

BUSSO CBULUT MLEE C Cet al. IEMOCAP: Interactive emotional dyadic motion capture database[J]. Language Resources and Evaluation200842(4): 335-359. DOI: 10.1007/s10579-008-9076-6 .

[24]

PORIA SHAZARIKA DMAJUMDER Net al. MELD: A multimodal multi-party dataset for emotion recognition in conversations[EB/OL]. 2018: 1810.02508.DOI: 10.18653/v1/p19-1050 .

[25]

MAJUMDER NPORIA SHAZARIKA Det al. DialogueRNN: An attentive RNN for emotion detection in conversations[DB/OL]. [2019-07-17]. DOI: 10.1609/aaai.v33i01.33016818 .

[26]

HU DWEI L WHUAI X Y. DialogueCRN: Contextual reasoning networks for emotion recognition in conversations[EB/OL]. 2021: 2106.01978. DOI: 10.18653/v1/2021.acl-long.547 .

[27]

HU DBAO Y NWEI L Wet al. Supervised adversarial contrastive learning for emotion recognition in conversations[EB/OL]. 2023: 2306.01505. DOI: 10.18653/v1/2023.acl-long.606 .

[28]

GHOSAL DMAJUMDER NGELBUKH Aet al. COSMIC: COmmonSense knowledge for eMotion Identification in Conversations[EB/OL]. 2020: 2010.02795. DOI: 10.18653/v1/2020.findings-emnlp.224 .

[29]

XU YYANG M. MCM-CSD: Multi-granularity context modeling with contrastive speaker detection for emotion recognition in real-time conversation[C]//ICASSP 2024―2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). New York: IEEE Press, 2024: 11956-11960. DOI: 10.1109/ICASSP48485.2024.10446410 .

[30]

LIU Y JLI JWANG X Pet al. EmotionIC: Emotional inertia and contagion-driven dependency modeling for emotion recognition in conversation[J]. Science China Information Sciences202467(8): 182103. DOI: 10.1007/s11432-023-3908-6 .

[31]

LI JWANG X PLV G Qet al. GraphCFC: A directed graph based cross-modal feature complementation approach for multimodal conversational emotion recognition[J]. IEEE Transactions on Multimedia202326: 77-89. DOI: 10.1109/TMM.2023.3260635 .

AI Summary AI Mindmap
PDF (3230KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/