基于褶纹基元关系感知的高效面部表情识别方法

刘婷婷 ,  王敏红 ,  邓李茜 ,  周启云 ,  刘海 ,  杨兵

武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (5) : 652 -666.

PDF (8970KB)
武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (5) : 652 -666. DOI: 10.14188/j.1671-8836.2025.0014
智能分析技术

基于褶纹基元关系感知的高效面部表情识别方法

作者信息 +

Pleated Primitive-Aware Semantic Relationship Learning for Efficient Facial Expression Recognition via Transformers

Author information +
文章历史 +
PDF (9185K)

摘要

面部表情识别(Facial Expression Recognition,FER)是计算机视觉领域的重要研究方向,但在教育场景的实际应用中仍面临诸多挑战,如遮挡、光照变化和头部姿态干扰等问题。本文定义了褶纹基元和褶纹基元关系;采用褶纹基元刻画面部局部区域因肌肉形变引发的方向性纹理特征,利用褶纹基元关系刻画其几何关联;指出褶纹基元具有高斯亲和、类间共享和类内不变特征。在此基础上,提出一种基于褶纹基元感知的高效面部表情识别模型P2FER(Pleated Primitive for Facial Expression Recognition)。在该模型中,设计了高斯亲和褶纹基元提取模块,用于捕获面部表情特征的多样性。通过引入高斯亲和褶纹基元,模型能够学习更具区分性的特征,增强特征空间的多样性,从而对不同类别表情的分类起到关键作用。为进一步增强模型对不同表情特征的建模能力,本文提出褶纹基元线索感知模块。该模块通过构建正负样本对,结合类关系设计了一种新颖的损失函数,实现类间共享褶纹基元与类内不变褶纹基元的协同挖掘,借助于不同类别间褶纹基元关联关系建模。该模块显著提升了模型对表情的识别能力。在RAF-DB和FERPlus数据集上的实验表明,本文模型在多项指标上均优于现有方法,性能提升显著。实验结果验证了高斯亲和褶纹基元提取模块与褶纹基元线索感知模块的有效性,表明用褶纹基元关系建模可增强模型的泛化能力。

Abstract

Facial Expression Recognition (FER) is an important research direction in the field of computer vision. However, it still faces many challenges in practical applications in educational scenarios, such as occlusion, illumination changes, and interference from head postures. This paper defines pleated primitives and pleated primitive relationships. Pleated primitives are used to characterize directional texture features in local facial regions induced by muscle deformations, while pleated primitive relationships are employed to depict their geometric correlations. It is indicated that pleated primitives possess Gaussian affinity, inter-class sharing,and intra-class invariance characteristics. On this basis, an efficient facial expression recognition model P2FER(Pleated Primitive for Facial Expression Recognition) based on pleated primitive perception is proposed. In this model, a Gaussian affinity pleated primitive extractor was designed to capture the diversity of facial expression features. By introducing Gaussian affinity pleated units, the model can learn more discriminative features and enhance the diversity of the feature space, thereby playing a key role in the classification of different types of expressions. To further enhance the modeling ability of the model for different expression features, this paper proposes a pleated primitive clue perception model. This model constructs positive and negative sample pairs and designs a novel loss function in combination with class relationships to achieve the collaborative mining of shared pleated primitives between classes and invariant pleated primitives within classes. With the modeling of the correlation relationship of pleated primitives among different categories, this module significantly improves the model's ability to recognize expressions. Experiments on the RAF-DB and FERPlus datasets show that the model proposed in this paper outperforms existing methods in multiple indicators and has significant performance improvement. The experimental results verified the effectiveness of the Gaussian affinity pleated primitive extractor and the pleated primitive cue perception module and proved that modeling using the pleated primitive relationship can enhance the generalization ability of the model.

Graphical abstract

关键词

面部表情识别 / 褶纹基元 / 关系感知 / 长距离依赖 / Transformer / 图像理解

Key words

facial expression recognition / pleated primitive / relationship perception / long distance dependence / transformer / image understanding

引用本文

引用格式 ▾
刘婷婷,王敏红,邓李茜,周启云,刘海,杨兵. 基于褶纹基元关系感知的高效面部表情识别方法[J]. 武汉大学学报(理学版), 2025, 71(5): 652-666 DOI:10.14188/j.1671-8836.2025.0014

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

面部表情作为一种非言语行为,是情感交流最重要的方式之一。面部表情识别(Facial Expression Recognition,FER)在人机交互[1]、医疗健康[2]和智慧教育[3]等众多领域展现出了极大的应用价值。随着大数据的日益普及,越来越多的大规模现实场景数据集也随之产生,但传统手工提取特征的方式无法捕捉到数据集中潜在的有效信息。深度学习的方法能够以端到端的方式自动提取判别特征因而成为面部表情识别任务的主流。近十年来,基于深度学习技术的特征提取在面部表情识别领域取得了显著进展,涵盖了多个方向。然而,尽管取得了诸多成果,仍然存在一些挑战,如面部遮挡、光照变化以及标签不确定性等问题,这些问题仍然影响着表情识别的精度和鲁棒性。

为了缓解上述问题,研究者们提出了许多成功的解决方案。现有的FER方法主要分为基于CNN(Convolutional Neural Networks)的FER和基于Transformer的FER两类。

基于CNN的FER方法:2019年,Wang等[4]开发的LS(Local and mutil-Scale)-CNN提出将多尺度特征提取、空间注意和通道注意相结合改进人脸识别,在各种人脸识别任务中表现优异。Li等[5]开发了一种新颖的带有注意力模型的卷积神经网络,用于面部表情识别,该网络利用局部二元模式(LBP)提取图像纹理信息,捕捉面部细微动作,提高网络性能。Liu等[6]提出BPMB(Bayesian Convolutional Neural Network with Perturbal Mutil-Branch Structrue)模型,通过结合变分推断和贝叶斯反向传播,有效量化了人脸表情识别中的不确定性,并通过引入扰动多分支结构和Dropout机制,在训练过程中增强了模型的鲁棒性,提升了深层特征的提取能力,从而在噪声数据和不确定性环境下实现了更稳健的表现。

基于Transformer的FER,2021年,Xue等[7]设计了TransFER模型,研究了ViT(Vision Transformers)和局部斑块关系感知在面部表情识别任务中的重要性。为了给推理提供更清晰的数据,Li等[8]提出了一种完全基于Transformer的Mask Vision Transformer (MVT)。所提出的掩码生成网络生成的掩码能够有效滤除复杂背景和遮挡。Lee等[9]提出的Latent-OFER利用ViT检测面部遮挡,以提高真实遮挡情况下的准确性。Ye等[10]提出了一种用于抑郁症患者面部表情识别的模型Dep-FER,基于ViT架构,并引入多种损失函数以刻画抑郁与正常样本之间的内在关联关系。该方法在多个指标上均优于现有主流模型,表现出较强的识别性能与泛化能力。Ma等[11]针对自然场景中的面部表情识别问题,提出了Transformer增强网络TAN与OLC,结合局部与全局特征建模,显著提升了模型的鲁棒性与识别性能。

在自然场景中,面部区域通常呈现出强烈的空间几何结构特性,不同面部纹理之间存在复杂且富有语义的集合关系。这些关系为面部表情的识别提供了辅助线索,因此,研究面部图像中蕴含的高层语义结构变得尤为重要。高层语言关系不仅有助于建模表情之间的内在联系,也能够显著提升面部表情识别的精度。然而,已有的研究[48-9]普遍忽略了对这类高级语义关系的深入建模。据作者了解,未有关于面部表情识别的褶纹基元关系相关工作的报道。因此,本文的动机在于设计一个新颖的面部表情识别框架,能够有效融合来自面部图像的三类关键信息:1) 全局表情信息,用于捕捉面部表情的整体状态;2) 局部视觉特征,用于提取面部区域的细节纹理与局部表征;3) 褶纹信息,专门用于分析面部褶纹的形态与分布,以及它们与表情变化之间的关系。通过综合考虑这三类信息,构建一个更加精准和高效的面部表情识别模型。

为此,本文定义了4个基本概念,并提出基于褶纹基元感知的高效面部表情识别方法(P2FER: Pleated Primitive for Facial Expression Recognition),旨在利用面部表情类间类内的褶纹基元及其关系帮助模型提升对高层语义信息的挖掘与建模能力。该方法主要包括两个模块:高斯亲和褶纹基元提取模块(GAE)和褶纹基元线索感知模块(PPCS)。GAE能够保证面部表情特征空间的多样性和可鉴别性,学习到的高斯亲和特征有助于面部表情的分类;PPCS通过构造正负样本对和基于类关系的损失,促进模型学习到类间的潜在共享特征和类内的潜在不变特征,探索同一类别以及不同类别之间褶纹基元的关系,促进面部表情的识别。

1  面部表情图像特征分析

1.1 问题陈述

所谓面部表情识别是指在给定的一幅图像或视频中,利用计算机准确识别出指定对象的情绪或情感。在自然场景中,面部表情识别仍面临诸多挑战,如头部姿态多变、面部遮挡和环境光线变化等问题,如图1所示。这些因素显著影响了模型对表情特征的稳定提取与准确判别。因此,如何克服这些挑战,提升在自然场景下的表情识别准确性,成为了该领域亟待解决的问题。

1.2 重要概念

通过对面部表情的图像样本进行分析,我们发现每种类别的面部表情图像都具有一些局部的亲和特征。基于此,本文定义了以下几个概念。

定义1 褶纹基元:当人类做出特定表情(如生气、惊讶)时,眉毛、眼周、口周等区域的肌肉运动(如内眉下降、外眉上扬、嘴角拉伸)会导致皮肤纹理产生具有方向性的形变,此类携带语义信息的局部纹理单元即为“褶纹基元”。

褶纹基元可以刻画面部局部区域因肌肉形变引发的方向性纹理特征及其几何关联。

定义2 褶纹基元关系:褶纹基元关系是指多个褶纹基元在面部表情演化过程中呈现出的空间联动与几何关联模式。

图2(a)和图2(b)的区分,可借助嘴部张开所引起的褶纹变化与眉间褶纹之间的关系进行判别。因为张口所导致的嘴角及面部周围褶纹,与眉间褶纹的联动,可成为判断表情的重要线索。在图2(c)展示的样本中,尽管由于年龄因素,面部出现了明显的皱纹,模型依然能够有效地学习眉间褶纹与嘴部周围褶纹之间的关系。

定义3 高斯亲和褶纹基元:指面部不同区域因肌肉协同运动产生的、具有局部亲和特性的褶纹基元。这类基元通过方向性纹理特征刻画表情的局部语义,其“亲和性”体现为同一表情中不同面部区域的褶纹基元在空间上的稳定联动与几何关联,是褶纹基元(定义1)在局部特征协同层面的具体表征。

图2(b)的生气表情为例,内眉毛下降、外眉毛上扬与眼周肌肉拉伸形成的纹理单元,因共同受皱眉肌与眼轮匝肌运动驱动,在眉眼区域呈现显著的局部亲和性;同时,嘴部拉伸与面颊形变构成的褶纹基元,通过面部肌肉链的联动与眉眼区域形成跨区域协同(如图2所示)。这种亲和性既反映单一区域内纹理的方向性(如眉毛走势、皱纹方向),也体现多区域基元间的动态关联,为通过褶纹基元关系(定义2)建模表情的高层语义提供了底层特征基础。

定义4 褶纹基元的类间共享与类内不变特征:类间共享特征是指在不同表情类别之间具有相似几何形态与空间分布的褶纹区域;类内不变特征则是指在同一表情类别中,跨样本稳定存在的特征区域。

基于上述定义,具有类间共享特征的褶纹基元称为类间共享褶纹基元,具有类内不变特征的褶纹基元称为类内不变褶纹基元。通过对样本间关系的探索,类间共享特征和类内不变特征也可以通过高斯亲和褶纹基元进行建模。如图2所示,在不同的面部表情类别(类间样本)中,例如惊讶、高兴和生气类别,张开嘴巴的区域表现为类间共享特征。高斯亲和褶纹基元可以通过对这些特征的空间分布进行统一描述,捕捉它们在几何模式上的相似性。而在相同类别的面部表情样本(类内样本)中,例如生气类别中皱眉区域的特征,高斯亲和褶纹基元提取模块能够通过稳健的参数拟合,提取这些始终存在的局部特征,作为类内不变特征。通过将高斯亲和褶纹基元与类间共享特征和类内不变特征相结合,可以更全面地理解面部表情的形成机制。这不仅能够提升表情识别的鲁棒性和泛化能力,还为探索更复杂的表情生成与分析提供了理论支持。

2  本文方法

2.1 整体架构设计

基于褶纹基元感知的高效面部表情识别P2FER模型整体架构如图3所示。实现步骤如下:

首先,从输入的面部表情图像批次中随机选取一幅图像,输入至高斯亲和褶纹基元提取模块,获取其局部亲和性褶纹基元。随后,采用数据增强方式生成图像的两个变体,构造正样本对;再将其与批次中其他样本的增强图像配对,构造负样本对。正负样本对随后输入至褶纹基元线索感知模块,通过多头注意力机制建模样本间的长距离依赖,学习类间共享特征和类内不变特征。最终,融合高斯亲和褶纹基元与学习到的共享、不变褶纹基元作为分类器输入,实现面部表情识别。

2.2 高斯亲和褶纹基元提取模块

考虑到卷积网络由于其可变的感受野和优秀的局部建模能力在很多计算机视觉领域都取得了非常先进的性能,因此,本文选用ResNet50对局部亲和褶纹基元进行提取。

给定一个含有b个样本的面部表情图像批次B={(xk,yk)}k=1b,从中随机选择一幅原始图像(xk,yk)作为高斯亲和特征提取模块的输入。原始图像xk是分辨率为224×224的RGB图像,从ResNet50中提取局部特征的过程可以表示为:

zl=fθxk

其中,fθ表示卷积特征提取模块,θ表示特征提取器的参数。

不同的面部表情具有局部的亲和特征,因此给定一个从d维高斯分布中随机抽取的类中心cRn×d,本文定义了一个高斯亲和损失函数使得类间距离最大且类内距离最小。在每次训练过程中,更迭参数,使特征趋近于它们所述的类中心;与此同时,将不同的类别分开,从而保证面部表情特征空间的多样性和可鉴别性。高斯亲和损失函数的表达式为:

GA=i=1Nzl-cyk22σc2
cyk=1Nki=1Nkzli
σc2=1Kk=1K1Nki=1Nkzl-cyk22

其中,N表示标签空间的维度,zl表示第l个样本的特征表示,cyk是第k类的类别中心,d表示类中心的维度,σc2表示类中心的标准差,K表示类别数量,Nk表示第k类数据的总数,22表示L₂范数;参数σcyk均在模型训练中计算得出。

2.3 褶纹基元线索感知模块

通过对样本间的关系进行探索,可以挖掘出类间样本关系存在潜在的共享特征,类内样本间关系存在潜在的不变特征,这些特征将会为面部表情的识别提供重要线索。如果从不同的类别中学习到共享特征,在语义层面能够增强样本的特征表示。然而,不同样本之间的关系是复杂多样的,对不同的输入图像,之前主要采用联合操作、元嵌入等方法探索样本间关系,这些方法需要明确地定义样本间关系,无法自动地对样本间关系进行表示学习。为了让深度神经网络以端到端的方式自动学习每个批次样本中的关系,我们提出了褶纹基元线索感知模块,该模块利用Transformer的多头注意力机制对不同样本之间的关系进行建模,让模型本身具有从每个数据中学习样本关系的能力。

阶段Ⅰ:将图像切分为图像小块。输入一个含有b个面部表情图像批次B={(xk,yk)}k=1b,通过对B进行两次随机弱增强生成一个增强的批次B˜={(x˜k,y˜k)}k=12bx˜kx˜j表示如下:

x˜k =WAxkx˜j =WAxj

其中,(x˜k,y˜k)x˜j,y˜j是通过对随机选择的原始面部表情样本(xk,yk)进行数据弱增强WA所生成的与原始图像具有较高相似程度的样本对。

为了增强自注意力机制的理解能力,Transformer引入了多头注意力机制,这种机制允许模型在不同层次上捕捉输入序列的不同依赖关系,从而提升模型的表示能力。在PPCS中,将(x˜k,y˜k)(x˜j,y˜j)分别送入两个基于Vision Transformer的分支中,设计了平衡对比学习的策略,引导模型在训练过程中显式感知不同类别之间的潜在共享褶纹基元,以及同一类别内部的不变褶纹结构。首先将x˜kRC×H×Wx˜jRC×H×W进行图像的Patch嵌入表示(Patch embedding),其中,C表示特征图的通道数,H表示特征图高度,W表示特征图宽度;再添加位置编码后生成视觉tokens,具体表示为,

visual=v1+p1, v2+p2, , vm+pm

其中,m=HPh×WPw表示视觉token的个数,vm表示第m个视觉token,pm表示第m个视觉token上对应的位置编码。

阶段Ⅱ:频域特征表示。图像中灰度变化强烈程度由图像的频率进行表征,例如,当面部肌肉运动缓和甚至没有运动时,面部皮肤纹理平滑,面部表情为中性类别的图像灰度变化较为缓慢,对应较低的频率值;面部肌肉运动比较剧烈时,面部皮肤纹理变化强烈,图像灰度变化剧烈,对应较高的频率值。受傅里叶频域特征建模的启发,本文在频域层对图像进行快速傅里叶变换(FFT),将面部表情图像从空间域转换到频域,通过分析图像的频谱特征可以捕获图像的能量分布情况从而提取面部表情图像中的局部纹理特征。对图像进行快速傅里叶变换的过程表示为:

Fu,v=x=0H-1y=0W-1gx,ye-j2πuxH+vyW

其中,g(x,y)表示一幅大小为H×W的面部表情图像;uv代表频率量,u0,H-1,v0,W-1;由Fu,v表示g(x,y)的二维离散傅里叶变换。经FFT变化后,加上对应的位置编码生成褶纹token,具体表示为:

pleats=f1+p1', f2+p2', , fn+pn'

其中,n=Hfh×Wfw为褶纹token的个数,fn为第n个褶纹token,pn'为第n个褶纹token对应的位置编码。

阶段Ⅲ:褶纹基元关系挖掘。在对输入的图像进行线性映射后,在输入序列中引入一个可学习的类token,该类token逐层融合图像的全局信息,最终作为整图语义的表达用于分类任务。

将类token(记作cls)、视觉token(记作visual)以及褶纹token(记作pleats)共同作为输入送入Transformer中,通过两个对比分支建模面部表情样本间复杂的关系。该token序列表示为:

S=cls, visual, pleats

通过观察发现,在面部表情样本中,不同类别间存在某些共享的特征,相同类别的样本具有某些稳定的不变特征。如果神经网络能够有效学习样本之间的结构化关系,便能够通过对比分支挖掘出类间潜在的共享特征以及类内潜在的不变特征。为了增强模型对这类结构的建模能力,本文提出一种基于类关系的损失函数——样本关系损失函数,用以捕获面部表情样本中的类间与类内相关性。通过同时建模这两类结构性关系,增强模型对类共享模式和类内稳定表示的刻画能力,从而提升面部表情识别的整体性能。类间关系体现两个不同对比分支的预测概率之间所呈现的相关性,而类内关系则体现每个类别内部所有实例的概率相关性,如图4所示。

类token预测分数代表不同分支对于所有表情类别的置信度。在推理过程中,通常关心类间的关系和类内的关系,而皮尔逊相关系数作为一种统计工具,能够衡量两个变量是否呈现线性关系,取值范围在-1到1之间,且不依赖于变量的尺度或者量纲,只考虑变量之间的关系,这意味着无论数据是连续的、离散的,还是以任何其他方式测量的,都可以使用皮尔逊相关系数。皮尔逊相关距离则基于皮尔逊相关系数衡量两个数据点之间的相似性或差异性。皮尔逊相关距离的公式如下:

du,v=1-ρu,v

如果两个数据点的皮尔逊相关系数很高(接近1),那么它们的皮尔逊相关距离就会很小(接近0),表示它们非常相似;反之表示它们有很大的差异或几乎没有关系。皮尔逊相关系数的计算公式如下:

ρu,v=Covu,vStduStdv=i=1Cui-u¯vi-v¯i=1Cui-u¯2i=1Cvi-v¯2

其中,Covu,v表示变量uv之间的协方差,StduStdv分别表示uv的标准差。uivi分别表示样本数据中第i对观测值,u¯v¯分别表示uv的均值。

利用皮尔逊相关系数及其衍生的相关距离,可以将面部表情识别任务中的类间关系与类内关系形式化为一种可度量的相关性结构,从而为后续的损失函数设计提供理论支持。

对于每一对预测向量(Yi1Yi2),类间关系损失函数可以表示为:

inter=1#BdYi1,Yi2

其中,#B表示一个批次的样本数量,Yi1Yi2分别表示第一个分支和第二个分支对第i个样本的预测向量,类内损失可以表示为:

intra=1#CdYj1,Yj2

其中,#C表示面部表情数据集的类别数量,Yj1Yj2分别表示第一个分支和第二个分支对第j个类别的预测向量。

最后,得到样本关系损失函数SR,其形式如下:

SR=βinter+γintra

其中,βγ是对样本关系损失函数的平衡因子,分别用于调节类间关系损失inter和类内关系损失intra对总损失的贡献。通过联合优化这两个部分,模型能够更好地捕捉预测向量之间的结构关系。

x˜kx˜j分别经过两个Transformer编码器分支及MLP(Multilayer Perceptron)映射头转化到同一维度的空间表示z˜kz˜j,在这两个表示之间构造平衡对比损失函数衡量两个特征向量之间的相似度。对比学习的核心思想是减少某一个锚点与其正样本之间的距离,同时,增大与该锚点其他负样本之间的距离。通常自监督对比学习将一个批次中所选的增强数据作为正样本,其他数据都构造为负样本。而本文采用有监督对比学习,将一个批次中同一个类别的数据及增强数据都作为正样本,不同类别的数据构造为负样本。因此,设计的平衡对比损失函数,使每个锚点可以有多个正对,将所有标签信息相同的子样本都视为正样本,计算x˜k与其所有正对之间的相似性,之后进行加权平均。平衡对比损失函数BC公式如下:

BC=-12By˜k-1j=12#BIkjIy˜ky˜jlogexpz˜kz˜jτi2#BIkiexp z˜kz˜jτ

其中,z˜kz˜j表示MLP映射头转化到同一维度的空间表示,I[kj]是一个指示函数,当且仅当k=j的时候取0,否则为1;I[y˜ky˜j]表示当且仅当y˜k=y˜j时取0,否则为1;I[ki]代表当且仅当k=i的时候取0,否则为1;τ代表进行优化的温度参数。该对比损失具有足够多的负对与正对,形成鲜明对比,有效平衡了特征空间,使得表示空间更均匀,有助于模型更好地理解输入数据和相应标签之间的关系,扩大类间距离并缩小类内距离。

2.4 融合分类

将高斯亲和褶纹基元模块的亲和特征zl以及褶纹基元线索感知模块分支提取的特征z˜kz˜j进行融合,融合后的特征表示如下:

zf=zl+z˜k+z˜j

则最终的面部表情识别结果可表示为:

y^=FCzf

其中,FC表示全连接层网络。实际概率分布与预测概率分布之间的差异通常由交叉熵损失函数进行衡量,用于评估面部表情分类模型的性能。在面部表情识别中,交叉熵越小,表明预测分布越接近真实的分布,模型的性能越好。交叉熵损失函数计算公式如下:

CE=-1#Bi=1#Bc=1#Cycilogy^ci

其中,y^c(i)表示第i个样本预测为c类别的概率,yc(i)表示第i个样本为c概率的真实值。

2.5 总损失函数

褶纹基元线索感知模块中所提出的平衡对比损失函数有效地平衡了特征空间,使得表示空间更均匀,有助于模型更好地理解输入数据和相应标签之间的关系,扩大类间距离并缩小类内距离。所提出的样本间关系损失函数能够捕获类内和类间的相关性,从而促进样本间学习到潜在的共享特征及潜在的不变特征。将高斯亲和损失函数、平衡对比损失函数和样本关系损失函数与交叉熵损失函数结合起来,得到总损失函数,表示如下:

total=GA+BC+SR+CE

3  实验结果及分析

3.1 数据集

本文选取了两种在现实场景中广泛应用的公开数据集RAF-DB[12]和FERPlus[13]进行实验,图5展示了这两种面部表情数据集中的部分样本图像。

RAF-DB数据集[12]中的面部图像有显著的差异,例如性别、年龄、表情等。每一幅图像都经过大约40名标注者的独立标注,确保了标注的准确性。该数据集包括高兴(HA)、中性(NE)、惊讶(SU)、恐惧(FE)、厌恶(DI)、悲伤(SA)、生气(AN)等7种基本表情类别,以及12种复合情感标签,面部表情数据丰富多样。

FERPlus数据集[13]是由Google搜索引擎收集的一个大规模的现实场景下的数据集,数据集中的每幅图像的尺寸均为48×48像素。该数据集共包含35 887幅图像,分为三个部分:训练集,验证集和测试集。训练集的数据量约占80%,验证集的数据量约占10%,测试集的数据量约占10%。FERPlus数据集的标签为高兴(HA)、中性(NE)、惊讶(SU)、恐惧(FE)、厌恶(DI)、悲伤(SA)、生气(AN)和蔑视(CO),共8种面部表情类别。

3.2 实验环境与参数设置

实验设置批量大小为64,学习率为0.01,训练周期为60。模型的优化采用SGD优化器,其权重衰减设置为1E-4,动量设置为0.9。模型选择StepLR学习率调度器,gamma设置为0.1,间隔设置为10。本文利用Pytorch框架对提出的模型进行实现,在NVIDIA RTX A5000 GPU和Intel i7 CPU服务器上进行训练。

3.3 结果分析

3.3.1 与已有方法的比较

1) RAF-DB数据集上的实验结果

表1展示了本文模型在RAF-DB数据集上与各模型对每种面部表情类别的识别的准确率及平均准确率。从结果可以看出,同一模型在不同表情类别的识别准确率存在差异,表明模型对不同表情类别的学习能力存在差异性。其中,本文方法在“高兴”(94.32%)、“惊讶”(88.68%)和“悲伤”(85.33%)类别的准确率相对较高,这是因为这些类别的数据量较大,本文的模型能更充分地学习到其稳定且明显的特征,表明P2FER能够较好地从多数类中提取关键特征。消极类别如生气、厌恶和恐惧属于数据量较少的尾类表情,通常对模型的泛化能力提出更高要求。从表1中结果可见,我们的方法在这些类别上取得了明显优势。“生气”类别达到84.97%,优于大部分对比方法,说明P2FER在该类具有较强的区分能力;更具挑战的“厌恶”和“恐惧”类别中,尽管所有模型整体表现不高,但P2FER分别达到76.34%和78.95%,显著高于其他方法,体现出模型对尾类表情的不确定性特征具有较强的建模和区分能力,显示出对长尾问题的有效缓解。总体而言,P2FER在RAF-DB数据集上平均准确率84.71%,优于所有对比方法,验证了其在特征表达稳定性与尾类建模方面的综合优势,进一步说明高斯亲和褶纹基元建模与褶纹基元关系线索感知的有效性。

2) FERPlus数据集上的实验结果

表2呈现了P2FER与9种先进方法在FERPlus数据集上的准确率对比。其中“蔑视”“厌恶”“恐惧”这三类尾类表情样本数量最少,训练过程中识别难度较高。然而,我们的方法在这三类表情上的识别准确率分别达到了83.33%、87.50%和86.79%,相较于其他方法实现了显著提升。这种性能优势主要得益于我们在模型设计中通过对特征空间中类中心的约束,强化了尾类样本在嵌入空间中的聚集性,有效缓解了长尾数据中尾类样本分布离散的问题。同时,褶纹基元建模策略能够深入捕捉面部局部纹理之间的细微变化,特别对“蔑视”“厌恶”“恐惧”等表情所对应的细小皮肤纹理差异具备更强的判别能力。相较之下,“高兴”作为样本数量最多的头类,在训练过程中具有充分的学习优势,我们的方法在该类别上取得了92.99%的识别准确率。此外,“生气”“惊讶”“中性”等类别的识别准确率也均超过86%。尽管在这些头部类别上,我们的方法并未在所有指标上均取得绝对最优,但由于模型整体设计更侧重于尾类性能优化与平均精度提升,因此在个别头类上的表现不是最优。总体来看,P2FER在保持头类识别性能的同时,有效提升了对尾类表情的判别能力,显著优于其他对比方法,展现出较强的泛化能力。

3.3.2 消融实验结果分析

1) 关键模块的有效性

为了验证模型中GAE和PPCS模块的有效性,在两个数据集(RAF-DB和FERPlus)上设计了消融实验,如表3所示。表3的第1行表示无GAE和PPCS模块的基线模型。从表3中可以观察到,设置ⅱ,增加了GAE模块,使得模型准确率在两个数据集中相比基线模型分别提升了0.67和1.57个百分点。设置ⅲ中,仅增加了PPCS模块,使得所提出的模型在两个数据集中的准确率有大幅下降,说明没有GAE模块的高斯亲和褶纹特征提取能力,PPCS模块的褶纹基元关系挖掘作用不能较好地发挥。在设置ⅳ时,模型与基线模型相比增加了GAE和PPCS模块,在两个数据集中准确率分别提升了1.31和1.90个百分点。经过以上实验和分析,可以得出结论:GAE和PPCS模块可以有效提高面部表情识别的性能。

2) 平衡对比损失温度参数τ

在PPCS模块中,平衡对比损失函数中含有温度参数τ,选择合适的τ对于平衡模型对困难样本的关注程度和防止过拟合至关重要。如图6(a)所示,当τ取0.6时在两个数据集上均达到了最佳性能,这表明我们提出的模型在τ=0.6时有助于模型更好地学习数据内在的结构和表示。因此,在本文模型中,将τ设置为0.6。

3) 编码器数量和多头注意力头数

在ViT中,多头注意力机制和前馈神经网络是编码器的重要组成部分。编码器的数量及多头注意力机制中的头数量对模型的性能和效果有一定的影响。如果编码器数量过多,可能会导致模型的过拟合并降低计算效率;相反,如果编码器数量过少,可能会无法捕获到充分的信息,导致模型的表示能力受限。多头注意力的头数也影响着模型的处理能力和信息抽取的能力,如果头数过多,每个头之间的注意力计算虽更精确,但会增加复杂度和计算量;如果头数过少,则可能无法学习到更具有泛化性的特征。因此,分别在RAF-DB和FERPlus数据集上对编码器数量e和多头注意力的头数h设计了消融实验,将e设置为[2,8],h设置为[2,12]。如图6(b)(c)所示,从消融实验中可以看出灰色的箭头表示参数的最佳组合。因此,本文在RAF-DB和FERPlus数据集上设置h为6,e为4。

4) 特征分布可视化

为了验证损失函数的有效性,在RAF-DB和FERPlus数据集上利用t-SNE方法[30]将特征分布可视化,如图7。从图7中可以发现,在使用总损失函数后,模型增大了不同类别的面部表情之间的距离,这表明本文所提出的损失函数能够帮助模型提高面部表情识别的性能。

5) 混淆矩阵

混淆矩阵是一种广泛用于评估分类器性能的工具,能够直观地揭示真实值与预测值之间的一致性和差异性。本研究针对RAF-DB和FERPlus数据集,采用P2FER模型进行了表情分类性能测试,并构建了混淆矩阵以分析分类效果。如图8所示,混淆矩阵的纵轴表示表情类别的真实值,横轴表示表情类别的预测值。矩阵中颜色的深浅代表了分类的准确率,颜色越深表明分类性能越好。图8(a)~(c)为RAF-DB数据集的混淆矩阵,图8(d)~(f)为FERPlus数据集的混淆矩阵。从图8可看到,P2FER模型在“厌恶”“恐惧”(两个数据集上)和“蔑视”(FERPlus数据集上)等类别的分类性能显著优于其他模型,进一步验证了其在表情分类任务中的优势。

6) 类关系热力图

为了进一步验证所提出的模型能够有效区分不同的表情,本节通过热力图展示RAF-DB数据集在训练过程中各个类别中心的相似度变化,如图9所示。通过观察不同迭代周期下类别中心之间的相似度,我们能够直观地了解模型在区分不同表情时的学习进展和表现。随着训练的进行,类别中心之间的相似度逐渐降低,表明模型在不同表情之间的判别能力不断增强。此外,通过这些热力图的展示,可以更清晰地观察到模型在迭代的过程中能够在各个表情类别之间逐渐建立起明显的区分度。

7) 注意力可视化

为了进一步验证所提出的模型能够学习到面部表情的亲和特征以及类间的共享特征和类内的不变特征,本节通过Grad-CAM[31]在RAF-DB数据集上可视化了模型的注意力特征图,如图10所示。图10中第1列表示面部表情的原始图像,第2列至第6列代表不同模型的注意力特征图可视化。对可视化结果进行分析,ResNet仅能学习到面部表情的局部特征,而没有关注样本间的特征关系及样本内的特征关系;ResNet+GAE模型学习到了面部表情的亲和特征,例如高兴的面部表情关注到了嘴角的向上拉伸及面颊的变化,恐惧类别的嘴巴张大引起的面颊肌肉的变化;P2FER(ResNet+GAE+PPCS)模型可以学习到面部表情的类内不变特征,例如中性表情的嘴巴是无变化的,惊讶表情的嘴巴是张开的;模型也可以学习到类间的共享特征,例如生气、厌恶、悲伤都具有皱眉这一共享特征。同时,在RAF-DB数据集中包含各种各样的头部姿态变化、遮挡和光线变化的面部图片,本文方法依旧能够很好地学习到褶纹基元特征,并且挖掘褶纹基元之间的关系。如图10(c),即使出现头部姿态变化,导致面部部分特征不可得的情况,模型依旧能够专注于张大的嘴巴,学习到嘴巴周围的褶纹基元。

8) 挑战场景下的可视化

为了验证本文模型在挑战性场景中的表现,本节对RAF-DB数据集中一些具有挑战性的图像进行了可视化。如图11所示,尽管在遮挡、极端姿势、低光照等情况下,面部部分信息缺失且难以估计,本文方法依然能够有效地学习到面部部位之间的褶纹基元关系。在这些场景中,其他方法由于面部信息缺失,表现较差,无法有效聚焦于关键部分。图11第2行展示了在手的遮挡的情况下,相较于其他方法仅关注手部和嘴巴部位,本文方法通过识别嘴角的褶纹基元,实现了更准确的预测。第4行则显示,在光照变化导致部分特征不可见的情况下,即使右侧面部区域变暗,本文方法仍能成功揭示生气表情中的褶纹基元。

热图可视化结果表明本文方法在面部表情识别中具有强大的鲁棒性,能够在面部信息不完整的情况下,依然准确地推断出关键信息。

4  扩展性实验

本文方法也可以扩展到教育领域的多人场景中用于教育场景中学生表情识别。无论是单人场景还是多人场景,面部表情识别都可利用面部不同的褶纹基元之间的关系。模型P2FER的效果如图12所示。本文对在多人场景中的部分人的面部图像进行了分类实验,图13中(e)~(h)分别为(a)~(d)的分布概率。从图13中可以看出,与现有的主流表情识别方法相比,P2FER在大多数表情类别中均取得了更高的分类概率,尤其在处理具有歧义性的表情时,如图13(c)所示,其面部特征介于中性与轻微微笑之间,表情边界模糊,缺乏显著的情感表达特征。由于中性状态下个体面部自然放松的差异性,以及轻度微笑所带来的嘴角变化较小,容易产生分歧判断。在这种表情处理中,依然能够做出较为准确的判断,显示出良好的判别能力和泛化性能。

5  结 语

本文提出了一种基于褶纹基元感知的高效面部表情识别方法。通过对表情样本的分析发现,不同类别的表情图像中存在一些局部的亲和褶纹基元,其中类间样本可能共享潜在的褶纹模式,而类内样本则包含潜在的不变褶纹特征。基于这一观察,我们设计了高斯亲和褶纹基元模块(GAE),以增强模型提取特征的多样性和可鉴别性。同时,引入了褶纹基元线索感知模块(PPCS),通过构建正负样本对并结合类关系引导的对比损失,有效提升了模型对类间共享特征和类内不变特征的建模能力。在多个基准数据集上的实验结果表明,所提方法在整体性能和平均识别准确率方面均优于现有主流方法,验证了其有效性和先进性。尽管本方法取得了较好的识别效果,但在计算效率方面仍有优化空间,对于需要实时处理的场景,例如人机交互,模型可能需要在计算资源和响应时间之间找到平衡,而目前方法在这方面的表现可能不尽如人意。未来,研究可以从以下几个方面展开:1) 提高方法的计算效率,以应对实际应用中对实时性和大规模数据处理的需求;2) 针对微表情和连续面部表情识别的挑战,进一步提升对细微表情变化的捕捉能力,以处理更为复杂的情感状态;3) 可以探索跨领域的协同建模,结合视觉与语言模型,以实现更加全面的情感推理和人类行为理解,从而推动情感计算、人机交互以及智能监控系统的发展。

参考文献

[1]

JIANG C SLIU Z TWU Met al. Efficient facial expression recognition with representation reinforcement network and transfer self-training for human-machine interaction[J]. IEEE Transactions on Industrial Informatics202319(9): 9943-9952. DOI: 10.1109/TII.2022.3233650 .

[2]

BISOGNI CCASTIGLIONE AHOSSAIN Set al. Impact of deep learning approaches on facial expression recognition in healthcare industries[J]. IEEE Transactions on Industrial Informatics202218(8): 5619-5627. DOI: 10.1109/TII.2022.3141400 .

[3]

徐亚萍, 李艳燕, 郭威彤, . 行为与情感分析的课堂学习投入智能评估 [J/OL]. 武汉大学学报(理学版)2025: 1-13. DOI:10.14188/j.1671-8836.2024.0164 .

[4]

XU Y PLI Y MGUO W Tet al. Intelligent assessment of classroom learning engagement integrating behavior and emotion analysis [J/OL]. J Wuhan Univ (Nat Sci Ed)2025: 1-13. DOI:10.14188/j.1671-8836.2024.0164(Ch ).

[5]

WANG Q CGUO G D. LS-CNN: Characterizing local patches at multiple scales for face recognition[J]. IEEE Transactions on Information Forensics and Security201915: 1640-1653. DOI: 10.1109/TIFS.2019.2946938 .

[6]

LI JJIN KZHOU D Let al. Attention mechanism-based CNN for facial expression recognition[J]. Neurocomputing2020411: 340-350. DOI: 10.1016/j.neucom.2020.06.014 .

[7]

LIU S SZHAO D XSUN Z Bet al. BPMB: BayesCNNs with perturbed multi-branch structure for robust facial expression recognition[J]. Image and Vision Computing2024143: 104960. DOI: 10.1016/j.imavis.2024.104960 .

[8]

XUE F LWANG Q CGUO G D. TransFER: Learning relation-aware facial expression representations with transformers[C]//2021 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2021: 3581-3590. DOI: 10.1109/ICCV48922.2021.00358 .

[9]

LI H TSUI M ZZHAO Fet al. MVT: Mask vision transformer for facial expression recognition in the wild [EB/OL]. [2025-01-02].

[10]

LEE ILEE EYOO S B. Latent-OFER: Detect, mask, and reconstruct with latent vectors for occluded facial expression recognition[C]//2023 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2023: 1536-1546. DOI: 10.1109/ICCV51070.2023.00148 .

[11]

YE J YYU Y HZHENG Y Set al. Dep-FER: Facial expression recognition in depressed patients based on voluntary facial expression mimicry[J]. IEEE Transactions on Affective Computing202415(3): 1725-1738. DOI: 10.1109/TAFFC.2024.3370103 .

[12]

MA F YSUN BLI S T. Transformer-augmented network with online label correction for facial expression recognition[J]. IEEE Transactions on Affective Computing202415(2): 593-605. DOI: 10.1109/TAFFC.2023.3285231 .

[13]

LI SDENG W HDU J P. Reliable crowdsourcing and deep locality-preserving learning for expression recognition in the wild[C]//2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2017: 2584-2593. DOI: 10.1109/CVPR.2017.277 .

[14]

BARSOUM EZHANG CFERRER C Cet al. Training deep networks for facial expression recognition with crowd-sourced label distribution[C]//Proceedings of the 18th ACM International Conference on Multimodal Interaction. New York: ACM, 2016: 279-283. DOI: 10.1145/2993148.2993165 .

[15]

ZHAO S WCAI H BLIU H Het al. Feature selection mechanism in CNNs for facial expression recognition [EB/OL]. [2025-02-03].

[16]

KUO C MLAI S HSARKIS M. A compact deep learning model for robust facial expression recognition[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW). New York: IEEE Press, 2018: 2202-22028. DOI: 10.1109/CVPRW.2018.00286 .

[17]

FAN Y RLAM J C KLI V O K. Multi-region ensemble convolutional neural network for facial expression recognition[M]//Artificial Neural Networks and Machine Learning ― ICANN 2018. Cham: Springer International Publishing, 2018: 84-94. DOI: 10.1007/978-3-030-01418-6_9 .

[18]

LI H YWANG N NYU Yet al. LBAN-IL: A novel method of high discriminative representation for facial expression recognition[J]. Neurocomputing2021432: 159-169. DOI: 10.1016/j.neucom.2020.12.076 .

[19]

PU TCHEN T SXIE Yet al. AU-expression knowledge constrained representation learning for facial expression recognition[C]//2021 IEEE International Conference on Robotics and Automation (ICRA). New York: IEEE Press, 2021: 11154-11161. DOI: 10.1109/icra48506.2021.9561252 .

[20]

HUANG Q HHUANG C QWANG X Zet al. Facial expression recognition with grid-wise attention and visual transformer[J]. Information Sciences2021580: 35-54. DOI: 10.1016/j.ins.2021.08.043 .

[21]

FARZANEH A HQI X J. Facial expression recognition in the wild via deep attentive center loss[C]//2021 IEEE Winter Conference on Applications of Computer Vision (WACV). New York: IEEE, 2021: 2401-2410. DOI: 10.1109/wacv48630.2021.00245 .

[22]

LI Y JLU G MLI J Xet al. Facial expression recognition in the wild using multi-level features and attention mechanisms[J]. IEEE Transactions on Affective Computing202314(1): 451-462. DOI: 10.1109/TAFFC.2020.3031602 .

[23]

WANG KPENG X JYANG J Fet al. Suppressing uncertainties for large-scale facial expression recognition[C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2020: 6896-6905. DOI: 10.1109/CVPR42600.2020.00693 .

[24]

ZHOU B YCUI QWEI X Set al. BBN: Bilateral-branch network with cumulative learning for long-tailed visual recognition[C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE, 2020: 9716-9725. DOI: 10.1109/cvpr42600.2020.00974 .

[25]

ZHANG Y HLI Y QQIN L Xet al. Leave no stone unturned: Mine extra knowledge for imbalanced facial expression recognition [EB/OL]. [2025-03-01]. DOI: 10.1109/iciecs.2009.5362811 .

[26]

CHEN X CZHENG X WSUN Ket al. Self-supervised vision transformer-based few-shot learning for facial expression recognition[J]. Information Sciences2023634: 206-226. DOI: 10.1016/j.ins.2023.03.105 .

[27]

CHEN D LWEN G HLI H Het al. Multi-relations aware network for in-the-wild facial expression recognition[J]. IEEE Transactions on Circuits and Systems for Video Technology202333(8): 3848-3859. DOI: 10.1109/TCSVT.2023.3234312 .

[28]

MA F YSUN BLI S T. Facial expression recognition with visual transformers and attentional selective fusion[EB/OL]. 2021: 2103.16854. DOI: 10.1109/taffc.2021.3122146 .

[29]

ZHANG Y HWANG C RLING Xet al. Learn from all: Erasing attention consistency for noisy label facial expression recognition[C]//Computer Vision ― ECCV 2022. Cham: Springer, 2022: 418-434. DOI: 10.1007/978-3-031-19809-0_24 .

[30]

ZHENG CMENDIETA MCHEN C. POSTER: A pyramid cross-fusion transformer network for facial expression recognition[C]//2023 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW). New York: IEEE Press, 2023: 3138-3147. DOI: 10.1109/ICCVW60793.2023.00339 .

[31]

MAATEN LDER VANHINTON G. Visualizing data using t-SNE [J]. Journal of Machine Learning Research20089(86): 2579-2605.

[32]

SELVARAJU R RCOGSWELL M, DAS A, et al. Grad-CAM: Visual explanations from deep networks via gradient-based localization[J]. International Journal of Computer Vision2020128(2): 336-359. DOI: 10.1007/s11263-019-01228-7 .

基金资助

国家自然科学基金(62577020)

国家自然科学基金(62477024)

国家自然科学基金(62377037)

国家自然科学基金(62277041)

国家自然科学基金(62173286)

国家自然科学基金(62177019)

国家自然科学基金(62177018)

中国高等教育学会高等教育研究专项(23XXK0403)

湖北省教育厅哲学社会科学研究项目(23G130)

湖北省教育厅科学技术研究计划指导性项目(B2023316)

湖北省自然科学基金(2025AFD621)

湖北省自然科学基金(2022CFB971)

湖北省自然科学基金(2022CFB529)

江西省自然科学基金(20252BAC220007)

江西省自然科学基金(20252BAC240201)

江西省自然科学基金(20242BAB2S107)

江西省自然科学基金(20232BAB212026)

江西省高等学校教育教学改革研究课题(JXJG-23-27-6)

深圳市自然科学基金面上项目(JCYJ20230807152900001)

广东省基础与应用研究基金(2025A1515010266)

中央高校基本科研业务费项目(CCNU25ai012)

AI Summary AI Mindmap
PDF (8970KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/