基于统一循环瓶颈网络的多模态情感识别算法

胡锦宗 ,  陈嘉豪 ,  龙怡梅 ,  田欣 ,  钱程 ,  陈雅茜

西南民族大学学报(自然科学版) ›› 2026, Vol. 52 ›› Issue (2) : 214 -221.

PDF (1286KB)
西南民族大学学报(自然科学版) ›› 2026, Vol. 52 ›› Issue (2) : 214 -221. DOI: 10.26978/j.cnki.xnmdzk.2026.02.012
信息科学

基于统一循环瓶颈网络的多模态情感识别算法

作者信息 +

Multimodal emotion recognition algorithm based on unified recurrent bottleneck network

Author information +
文章历史 +
PDF (1316K)

摘要

多模态情感识别是人机交互与智能系统领域的关键技术之一,通过整合文本、语音、视觉等多种模态信息以提升情感识别的准确性与鲁棒性.然而,现有方法在处理多模态数据的异质性、特征融合的高效性方面仍面临挑战.为此,提出了一种新颖的多模态统一循环瓶颈网络(Multimodal Unified Recurrent-Bottleneck Network,MURBN).该网络采用“先编码对齐、后融合提炼”的两阶段处理策略,首先通过共享参数的循环单模态编码网络(Recurrent Unimodal Modulation Network,RUMN)对各模态时序特征进行上下文编码以缓解异质性问题,随后利用非对称瓶颈融合网络(Asymmetric Bottleneck Fusion Network,ABFN)实现高效、低噪的跨模态信息交互与融合.在IEMOCAP和MELD两个公开数据集上的实验结果表明,MURBN模型在情感识别准确率和F1分数等指标上均显著优于现有基线方法,尤其在中性情感类别的识别上取得了明显提升.

Abstract

Multimodal emotion recognition is one of the key technologies in the field of human-computer interaction and intelligent systems. It integrates multiple modal information such as text, speech, and vision to improve the accuracy and robustness of emotion recognition. However, existing methods still face challenges in dealing with the heterogeneity of multimodal data, the efficiency of feature fusion, and the computational complexity. In this paper, a novel Multimodal Unified Recurrent Bottleneck Network (MURBN) was proposed. First, the Recurrent Unimodal Modulation Network (RUMN) with shared parameters was used to contextually encode the temporal features of each modality to alleviate the heterogeneity problem. Then, the Asymmetric Bottleneck Fusion Network (ABFN) was employed to achieve efficient and low-noise cross-modal information interaction and fusion. Experiments on the two public datasets IEMOCAP and MELD showed that the proposed model was significantly superior to the existing methods in terms of emotion recognition accuracy and F1 score, especially in difficult categories such as neutral emotion recognition. This study provided an innovative and efficient solution for the field of multimodal emotion recognition.

Graphical abstract

关键词

多模态 / 情感识别 / 循环瓶颈网络 / 特征融合

Key words

multi-modal / emotion recognition / recurrent-bottleneck network / feature integration

引用本文

引用格式 ▾
胡锦宗,陈嘉豪,龙怡梅,田欣,钱程,陈雅茜. 基于统一循环瓶颈网络的多模态情感识别算法[J]. 西南民族大学学报(自然科学版), 2026, 52(2): 214-221 DOI:10.26978/j.cnki.xnmdzk.2026.02.012

登录浏览全文

4963

注册一个新账户 忘记密码

多模态情感识别(Multimodal Emotion Recognition,MER)作为人机交互领域的重要研究方向,通过融合语音、面部表情、身体语言和生理信号等多种模态信息来识别用户的情感状态1,在智能客服、心理健康监测、教育评估和虚拟人交互等领域展现出广泛潜力2.然而,多模态情感识别技术在实际应用中仍面临三类关键挑战:①多模态数据的异质性强,不同模态的数据分布差异显著,难以实现有效融合;②传统特征融合方法计算复杂度高,易引入信息噪声;③现有模型对情感动态变化的捕捉能力有限,难以准确刻画情感的时序演变过程3-6.尤其在多模态数据融合方面存在明显局限7:特征级融合方法虽然简单,但往往忽视了模态间的差异;决策级融合虽可体现模态特异性,但未能充分挖掘跨模态特征相关性;而模型级融合方法通常依赖复杂网络结构,导致计算开销较大8-10.此外,现有研究大多关注单模态特征提取,缺乏针对多模态数据异质性的有效处理机制,制约了融合性能的进一步提升11.
为解决上述问题,本文提出多模态统一循环瓶颈网络(MURBN),引入基于递归的单模态编码网络(RUMN)和非对称瓶颈融合网络(ABFN)两大核心模块.RUMN通过共享参数机制对各模态进行独立编码,有效缓解不同模态间的特征分布差异;ABFN借助中心化瓶颈单元和瓶颈引导查询机制,降低计算复杂度的同时抑制噪声干扰,实现高效且鲁棒的跨模态信息交互与融合.

1 相关工作

多模态情感识别技术主要架构如图1所示.首先,分别从各模态原始数据中提取出能表征情感的特征向量;随后,采用特定的融合策略将这些异构的特征向量整合为一个统一的、信息丰富的多模态表征;最后,基于该融合表征进行情感类别的判定12-15.

特征提取的核心是从原始数据中获取具有判别性的情感表征16.文本模态广泛采用BERT17等基于Transformer的预训练模型来捕获深层语义18.语音模态则从波形中提取MFCC等声学特征,并采用如SincNet19等专用网络进行处理.视觉模态通常依赖于VGG等预训练卷积网络提取高级表情特征20.生理信号则需采用频域分析等方法进行特征构建21.然而,这些方法通常针对单一模态进行独立优化,缺乏对跨模态关联性的考量,导致提取的特征在语义空间中存在分布差异,为后续融合带来了固有的异质性挑战.

在获得各模态特征后,融合策略是提升性能的关键.现有方法大致可分为三类:①特征级融合(Feature-Level Fusion)通过拼接或降维将不同模态特征映射至同一空间,但忽略了模态间的时序异步性与语义鸿沟,容易引入噪声并导致信息冗余.②决策级融合(Decision-Level Fusion)会在每个模态上独立训练模型,然后对各模态的识别结果进行投票或加权平均.Rutuja等人22在决策级融合阶段强调了不同模态特征之间的差异性,并为每种模态选择了最适合的分类器.然而,该研究未能充分考虑特征之间的相关性,学习过程耗时较长.③模型级融合(Model-level fusion)依赖于不同模态间的数据相关性.通过多模态信息融合模型得到识别结果.模型级融合的实现依赖于所使用的模型,它学习模型内的多通道交互,并构建表示的共享空间23-25.

现有研究在如何有效对齐异构模态特征、降低融合过程中的计算与噪声冗余,以及精细化建模情感动态等方面仍存在明显不足.这些缺陷限制了多模态情感识别模型性能的进一步提升,因此有必要对多模态情感识别算法进行研究.

2 多模态统一循环瓶颈网络

针对多模态情感识别中存在的模态异构性、融合过程中计算与噪声冗余等核心挑战,本文设计了多模态统一循环瓶颈网络(Multimodal Unified Recurrent-Bottleneck Network,MURBN),如图2所示.该网络遵循“先编码对齐、后融合提炼”的两级处理思想.首先,模型采用基于递归的单模态编码网络(RUMN)作为前端处理器,负责对各模态独立的时序特征进行深度上下文编码,并通过其独特的共享参数机制,有效缓解多模态数据的异质性问题.随后,编码后的特征将被送入非对称瓶颈融合网络(ABFN)中,该网络通过创新的中心化瓶颈单元和瓶颈引导查询机制,实现高效、低噪的跨模态信息交互与融合.

2.1 基于递归的单模态编码网络

为了提取对话层面的语境情感线索,本文采用基于递归的单模态编码器(RUMN)对三种模态进行话语编码.在RUMN中添加全连接网络和残差运算,以提高递归神经网络(RNN)的表达能力和稳定性.单模编码器如图3所示.

RUMN的结构可以形式化为:

Xrr=LNX+RNNX.
Xfr=LNX+Xrr+FFXrr.

其中X表示所有话语的特征矩阵,RNN(·)LN(·)FF(·)分别表示RNN、归一化和前馈网络层.在这项工作中,RNN(·)LN(·)默认为双向GRU和层归一化;rr表示“recurrent residual”(递归残差),fr表示“feed-forward residual”(前馈残差).

前馈网络由两个全连接层组成,可以表示为:

FFXrr=DPFCDPαFCXrr.

其中FC(·)DP(·)分别表示全连接网络和Dropout操作,α(·)表示激活函数.为了减轻多模态数据的异质性问题,我们对所有模态共享RUMN编码器参数,以拉近各模态在特征空间中的分布.

Xfrm=RUMN(Xm),mT,V,A.

2.2 非对称瓶颈融合网络

在RUMN模块完成对各模态特征的初步编码后,为实现模态间特征的高效融合,同时克服传统Transformer架构因直接拼接多模态特征而导致的计算冗余与信息噪声问题,本文设计了非对称瓶颈融合网络(Asymmetric Bottleneck Fusion Network, ABFN).其核心思想是引入一个中心化的瓶颈单元,以约束和引导跨模态信息交互,同时增强文本模态的表示能力.该网络的详细结构如图4所示,其工作流程可分为5个关键步骤.

网络采用与标准Transformer一致的注意力计算机制,基于查询(Q)、键(K)和值(V)矩阵进行信息聚合,如公式(5)所示,其中dk是键(K)的维度:

AttentionQ,K,V=softmaxQKTdkV.

① 单模态自注意力编码

将RUMN模块输出的视觉(FV)、文本(FT)、音频(FA)三路模态特征分别输入独立的自注意力模块,进行各模态内部的信息聚合.对于每个模态 MV,T,A,其处理过程如下:

FM'=LNAttentionFM+FM.

此步骤通过残差连接和层归一化操作,增强模态内的上下文依赖关系,从而得到优化后的单模态表征FM'.

②中心化瓶颈信息聚合

此步骤是实现高效跨模态融合的关键.将经过自注意力编码的三路模态特征输入一个共享的瓶颈单元,通过对复杂特征信息的蒸馏和压缩,提取最具代表性的跨模态共享信息,形成一个紧凑的瓶颈表征Bout

Bout=BottleneckUnitConcatFV',FT',FA'.

③瓶颈引导的跨模态查询

区别于传统的自由交互模式,本网络采用瓶颈引导的查询机制.将瓶颈单元输出的紧凑表征Bout作为统一查询向量,通过三个并行的注意力模块分别从各原始模态中提取相关信息.对于每个模态M,其输出HM的计算如下:

HM=AttentionQ=Bout,K=FM',V=FM'.

其中,HM表示在经过瓶颈信息引导后得到的特定模态M的精炼特征输出.

④特征级联与文本模态增强

在获得各模态的注意力输出后,通过特征级联操作形成初步融合的多模态特征向量Hfused.

Hfused=ConcatHV,HT,HA.

为进一步强化语义理解,引入残差连接将原始文本特征FT与融合向量相加,这一文本增强操作确保了核心语义信息在融合过程中得到有效保持和加强.

Henhanced=Hfused+FT.

⑤深度非线性编码与输出

将增强后的融合向量Henhanced输入前馈网络进行深度非线性变换,通过残差连接和层归一化学习特征间的复杂组合关系:

Hout=LNFFNLNHenhanced+Henhanced.

最终的情感表征向量Hout经由线性分类器和Softmax函数处理,输出最终的情感预测结果.

3 损失函数

本模型的损失函数由交叉熵损失和L2正则化项两部分组成,旨在平衡分类精度与模型泛化能力.

①交叉熵损失函数

作为多分类任务中最常用的损失函数,交叉熵损失函数通过衡量预测概率分布与真实标签分布之间的差异来指导模型优化.

②L2正则化项

为防止过拟合,引入L2正则化项对模型参数进行约束,通过权重衰减提升模型的泛化性能.

③总体损失函数

最终损失函数为以上两项的加权和,在训练过程中同步优化分类准确率和模型复杂度.

4 实验结果与分析

4.1 数据集

实验采用IEMOCAP和MELD两个公开数据集进行验证,信息如表1所示.IEMOCAP数据集包含5个会话对话,标注四种基本情感类别24;MELD数据集规模较大,包含7种情感类别25.按照7∶1∶2的比例将数据划分为训练集、验证集和测试集.

4.2 实验环境

所有实验均在基于Linux操作系统的服务器上进行,具体配置如表2所示.硬件环境搭载Intel Xeon Platinum 8358P 处理器与NVIDIA RTX 3090图形处理器(GPU).软件实验环境基于Python 3.9编程语言,使用PyTorch 2.1深度学习框架构建模型,并行计算加速采用CUDA 12.1及cuDNN 8.2.0.

4.3 实验评价指标

对于IEMOCAP数据集,采用准确率(Acc)和F1分数(F1-Score)作为评价指标.对于MELD数据集,采用平均绝对误差(MAE)、皮尔逊相关系数(Corr)、二分类准确率、七分类准确率以及F1-Score等五项指标.

准确率Acc计算公式如公式(12)所示:

Acc= TP+TNTP+TN+FP+FN .

TP表示正确预测为正样本;FP表示错误预测为正样本;TN表示正确预测是负样本;FN表示错误预测是负样本.

F1分数计算公式如公式(13)所示:

precision= TPTP+FP .
recall= TPTP+FN  .
F1= 21/precision+ 1/recall  .

MAE平均绝对误差的计算方法如公式(14)所示:

MAE= 1Ni=1Nyi^-yi .

皮尔逊相关系数的计算公式如公式(15)所示:

Corr= i=1N(Xi-X¯)(Yi-Y¯)i=1N(Xi-X¯)2i=1N(Yi-Y¯)2  .

4.4 模型对比实验及结果分析

为验证本文提出的多模态统一循环瓶颈网络(MURBN)的有效性,我们将其与近年来在该任务上表现优异的5个主流模型进行了对比实验.

①AGHMN (自适应图层次多模态网络):通过构建多层次图结构显式建模模态间局部与全局关系26.

② I-GCN (跨模态图卷积网络):将时序特征节点化并在图结构中添加跨模态连边,通过图卷积实现模态间消息传递27.

③MMGCN (多粒度多模态图卷积网络):在不同时间尺度和粒度上构造图结构,全面捕获模态内部动态与跨模态异步交互28.

④ MM-DFN (多模态动态融合网络):采用动态门控机制与跨模态注意力,自适应调整各模态的贡献度29.

⑤ RAVEN(循环参与变异嵌入网络):利用三个BiGRU网络捕获模态上下文,并引入成对跨模态注意力机制,同时预测情感与情绪30.

表3展示了各模型在MELD数据集上的实验结果.可以看到,本文提出的方法在Acc-7、Acc-2、F1及Corr等大多数指标上均取得了最优性能.

表4展示了各模型在IEMOCAP数据集上的对比实验结果.本文提出的MURBN模型在各项情感类别的准确率和F1分数上均达到最优,相较于基线方法平均提升约2.7%.尤其在传统模型识别困难的中性情感类别上,MURBN取得了最为显著的提升.这验证了该模型在弥合多模态数据异质性方面的有效性.

5 总结及展望

本文针对多模态情感识别中存在的模态异质性、融合噪声与计算冗余等问题,提出了一种基于统一循环瓶颈网络(MURBN)的情感识别算法.该模型通过递归单模态编码网络(RUMN)对文本、语音和视觉模态进行上下文编码与分布对齐,有效缓解了模态间的异质性问题;进一步通过非对称瓶颈融合网络(ABFN)中的中心化瓶颈单元与瓶颈引导查询机制,实现了高效、低噪的跨模态信息融合与文本增强.

在IEMOCAP和MELD数据集上的实验结果表明,相较于AGHMN、MMGCN、MM-DFN等基线模型,MURBN在准确率(Acc)、F1分数(F1-Score)、皮尔逊相关系数(Corr)等评价指标上均表现出更优的性能,尤其在传统方法表现较弱的中性情感识别任务中取得了显著提升.这充分验证了所提模型在特征对齐、融合效率和语义保持方面的有效性与先进性.

针对当前模型对长时序情感动态演化建模能力仍有不足以及模态扩展性的问题,未来研究可考虑以下方向:①探索更高效的特征提取方法,例如集成更先进的预训练模型或引入针对情感任务的表征学习技术,以进一步提升模型的表征能力;②将模型扩展到更丰富的模态组合,如加入生理信号、眼动追踪等多源数据,以应对更复杂的应用场景;③结合情感动态建模技术,例如引入层次化循环结构或显式的时序注意力机制,以更精细地捕捉情感的时序演变规律.

参考文献

[1]

SIRIWARDHANA SREIS AWEERASEKERA Ret al. Jointly fine-tuning “BERT-like” self supervised models to improve multimodal speech emotion recognition[EB/OL]. 2020arXiv: 2008.06682. (2020-8-15) [2024-11-1].

[2]

LIU YSUN H QGUAN W Bet al. Multi-modal speech emotion recognition using self-attention mechanism and multi-scale fusion framework[J]. Speech Communication2022139: 1-9.

[3]

李佳泽,梅红岩,贾丽云,.动态时间序列建模的多模态情感识别方法[J].计算机工程与应用202561(1):196-205.

[4]

CHOWDARY M KNGUYEN T NHEMANTH D J. Deep learning-based facial emotion recognition for human-computer interaction applications[J]. Neural Computing and Applications202335(32): 23311-23328.

[5]

GUPTA SKUMAR PTEKCHANDANI R K. Facial emotion recognition based real-time learner engagement detection system in online learning context using deep learning models[J]. Multimedia Tools and Applications202382(8): 11365-11394.

[6]

JIANG XPENG X LZHANG Yet al. Universal speech token learning via low-bitrate neural codec and pretrained representations[J]. IEEE Journal of Selected Topics in Signal Processing202418(8): 1477-1489.

[7]

CAI Y JWANG Y WZHU Y Het al. A unified 3D human motion synthesis model via conditional variational auto-encoder[C]//2021 IEEE/CVF International Conference on Computer Vision (ICCV). Montreal, QC, Canada:IEEE, 2022: 11625-11635.

[8]

BIE MXU HGAO Yet al. Swin-FER: Swin transformer for facial expression recognition[J]. Applied Sciences202414(14):2076-3417.

[9]

ZHANG S BALSHURAFA N. Deep generative cross-modal on-body accelerometer data synthesis from videos[C]. //UbiComp/ISWC '20 Adjunct: Adjunct Proceedings of the 2020 ACM International Joint Conference on Pervasive and Ubiquitous Computing and Proceedings of the 2020 ACM International Symposium on Wearable Computers. Virtual Event Mexico:ACM, 2020:223-227.

[10]

KHAN MTRAN P NPHAM N Tet al. MemoCMT: Multimodal emotion recognition using cross-modal transformer-based feature fusion[J]. Scientific Reports202515(1): 5473.

[11]

沈旭东,黄贤英,邹世豪.基于时序感知DAG的多模态对话情绪识别模型[J].计算机应用研究202441(1):51-58.

[12]

GARCIA-GARCIA J MLOZANO M DPENICHET V M Ret al. Building a three-level multimodal emotion recognition framework[J]. Multimedia Tools and Applications202382(1): 239-269.

[13]

MAMIEVA DABDUSALOMOV A BKUTLIMURATOV Aet al. Multimodal emotion detection via attention-based fusion of extracted facial and speech features[J]. Sensors202323(12): 1018-1025.

[14]

GEETHA A VMala TPRIYANKA Det al. Multimodal Emotion Recognition with Deep Learning: Advancements, challenges, and future directions[J]. Information Fusion2024105:11-36.

[15]

EZZAMELI KMAHERSIA H. Emotion recognition from unimodal to multimodal analysis: A review[J]. Information Fusion202399:36-69.

[16]

RUGGIERO GTESTA MVAN DE WALLE Jet al. Eta-WavLM: Efficient speaker identity removal in self-supervised speech representations using a simple linear equation[EB/OL]. 2025arXiv: 2505.19273.

[17]

ACHEAMPONG F ANUNOO-MENSAH HCHEN W Y. Transformer models for text-based emotion detection: A review of BERT-based approaches[J]. Artificial Intelligence Review202154(8): 5789-5829.

[18]

ZHANG S QTAO XCHUANG Y Let al. Learning deep multimodal affective features for spontaneous speech emotion recognition[J]. Speech Communication2021127: 73-81.

[19]

LOWEIMI EBELL PRENALS S. On learning interpretable CNNs with parametric modulated kernel-based filters [C]// Nineteenth annual conference of the international speech communication association. Baixas, France: Interspeech, 2019:3480-3484.

[20]

SADOUGHI NBUSSO C. Speech-driven expressive talking lips with conditional sequential generative adversarial networks[J]. IEEE Transactions on Affective Computing202112(4): 1031-1044.

[21]

AYATA DYASLAN YKAMASAK M E. Emotion recognition from multimodal physiological signals for emotion aware healthcare systems[J]. Journal of Medical and Biological Engineering202040(2): 149-157.

[22]

STAHLSCHMIDT S RULFENBORG BSYNNERGREN J. Multimodal deep learning for biomedical data fusion: A review[J]. Briefings in Bioinformatics202223(2):569-789.

[23]

PATIL R RKUMAR S. Rice-fusion: A multimodality data fusion framework for rice disease diagnosis[J]. IEEE Access202210: 5207-5222.

[24]

BUSSO CBULUT MLEE C Cet al. IEMOCAP: Interactive emotional dyadic motion capture database[J]. Language Resources and Evaluation200842(4): 335-359.

[25]

PORIA SHAZARIKA DMAJUMDER Net al. MELD: A multimodal multi-party dataset for emotion recognition in conversations[C]//Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. ACL, 2019: 527-536.

[26]

JIAO W X, LYU M, KING I. Real-time emotion recognition via attention gated hierarchical memory network[J]. Proceedings of the AAAI Conference on Artificial Intelligence202034(5): 8002-8009.

[27]

NIE W ZCHANG R HREN M Jet al. I-GCN: Incremental graph convolution network for conversation emotion detection[J]. IEEE Transactions on Multimedia202224: 4471-4481.

[28]

WEN J FQIN Y HSU X Wet al. Video recommendation method based on multi-attention mechanism and heterogeneous information network[C]//2023 4th International Conference on Computer Engineering and Application (ICCEA). China:IEEE, 2023: 669-674.

[29]

HU DHOU X LWEI L Wet al. MM-DFN: Multimodal dynamic fusion network for emotion recognition in conversations[C]//ICASSP 2022 - 2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). Singapore:IEEE, 2022: 7037-7041.

[30]

WANG Y SSHEN YLIU Zet al. Words can shift: Dynamically adjusting word representations using nonverbal behaviors[J]. Proceedings of the AAAI Conference on Artificial Intelligence AAAI Conference on Artificial Intelligence201933(1): 7216-7223.

基金资助

西南民族大学中央高校优秀学生培养工程项目(ZYN2024116)

西南民族大学横向项目(横20240096)

2024-2026年四川省高等教育人才培养质量和教学改革项目(409)

四川省教育评价改革研究专题课题(2024JPG-B-004)

AI Summary AI Mindmap
PDF (1286KB)

107

访问

0

被引

详细

导航
相关文章

AI思维导图

/