基于深度残差网络的多模态人脸快速辨识算法

刘河潮 ,  刘明堂 ,  张瑞姣

吉林大学学报(工学版) ›› 2026, Vol. 56 ›› Issue (4) : 1113 -1118.

PDF (1750KB)
吉林大学学报(工学版) ›› 2026, Vol. 56 ›› Issue (4) : 1113 -1118. DOI: 10.13229/j.cnki.jdxbgxb.20250095
计算机科学与技术

基于深度残差网络的多模态人脸快速辨识算法

作者信息 +

Multi modal facial recognition algorithm based on deep residual Network

Author information +
文章历史 +
PDF (1791K)

摘要

通过有效融合不同模态的人脸特征,能够减少外界环境变化对人脸辨识的干扰,进而提升人脸辨识效果。因此,本文提出了一种基于深度残差网络的多模态人脸快速辨识算法。该算法运用二维经验模态分解(BEMD)方法,在多个尺度上分解人脸图像,获取多模态特征表示。这些特征输入深度残差网络,经特征提取、强化与选择后,快速输出辨识结果。实验证明,该方法不仅能有效表示人脸图像的多模态特征,且残余分量不含人脸信息,显示了强大表示能力;同时,它能有效辨识不同表情和角度的人脸,响应时间短,并可实现快速人脸辨识,应用效果显著。

Abstract

By effectively integrating facial features from different modalities, the interference of external environmental changes on facial recognition can be reduced, thereby improving the effectiveness of facial recognition. Therefore, a multi-modal facial recognition algorithm based on deep residual networks is proposed. This algorithm uses the BEMD method to decompose facial images at multiple scales and obtain multimodal feature representations. These features are input into a deep residual network, which quickly outputs identification results after feature extraction, reinforcement, and selection. Experimental results have shown that this method can effectively represent the multimodal features of facial images, and the residual components do not contain facial information, demonstrating strong representation capabilities; At the same time, it can effectively recognize faces with different expressions and angles, with short response time, achieving fast face recognition and significant application effects.

Graphical abstract

关键词

深度残差网络 / BEMD算法 / 多模态特征 / 注意力机制 / 膨胀腐蚀

Key words

deep residual network / BEMD algorithm / multimodal features / attention mechanism / expansion corrosion

引用本文

引用格式 ▾
刘河潮,刘明堂,张瑞姣. 基于深度残差网络的多模态人脸快速辨识算法[J]. 吉林大学学报(工学版), 2026, 56(4): 1113-1118 DOI:10.13229/j.cnki.jdxbgxb.20250095

登录浏览全文

4963

注册一个新账户 忘记密码

0 引 言

在当今信息技术飞速发展的时代,多模态人脸快速辨识算法已成为计算机视觉与人工智能交叉领域中的一个热点和难点。作为生物识别技术的重要组成部分1,人脸识别技术凭借其独特的优势,在众多领域展现出了巨大的应用潜力。该技术无需与被识别对象直接接触,识别过程自然流畅,极大地提升了用户体验。在身份验证场景中,人脸识别技术为门禁系统、金融交易等提供了安全可靠的保障;在人机交互方面,能够快速准确识别人脸,实现更智能、便捷的互动体验。因此,人脸识别技术正逐渐成为推动各行业智能化发展的关键力量。然而,在实际应用中,传统的单模态人脸识别技术通常受到光照条件、姿态变化、遮挡等多种因素的制约,导致识别精度和鲁棒性难以达到预期23。为了克服单模态信息的局限性,探索多模态信息融合的人脸识别技术已成为当前研究的重要方向。众多学者在这一领域进行了深入研究,提出了多种人脸识别方法。李云红等4提出了基于超分辨率重建的人脸识别方法,该方法通过重构人脸图像获得清晰的人脸特征,并将其输入生成对抗神经网络模型进行识别。然而,基于学习的超分辨率重建方法虽然能够学习到图像的先验知识,但训练数据的质量和多样性对重建效果具有显著影响,尤其是在低光照条件下,该方法难以准确恢复人脸细节特征,从而影响后续的人脸识别精度。王奇等5提出了3D人脸识别方法,该方法利用局部特征描述子提取人脸图像特征,并通过关键特征增强机制进行增强,最后通过分类方法实现识别。然而,所采用的分类方法在处理3D人脸特征的高维性和复杂性方面存在局限。3D人脸特征包含几何形状、纹理等多种信息,如果分类器不能有效处理这些高维特征,容易导致分类错误。王海勇等6提出了混合自适应函数的人脸识别方法,该方法使用卷积神经网络进行特征提取和分类。然而,该卷积神经网络在运行过程中容易出现过拟合现象,导致获取的人脸特征细节不足,识别结果不够准确。李溪等7提出了基于Gabor小波的遮挡人脸识别方法,该方法对人脸图像进行分区处理,使用Gabor滤波器提取图像中的人脸特征,并通过特征匹配实现识别。然而,Gabor滤波器对光照变化和噪声较为敏感。在实际应用中,光照变化可能改变人脸的灰度分布,导致Gabor 滤波器提取的特征发生扭曲,从而影响人脸识别结果的准确性。

深度残差网络(ResNet)作为深度学习发展进程中的关键,其创新的残差学习理念有效解决了传统深度神经网络在层数增加时面临的梯度消失或梯度爆炸问题8。通过引入残差模块和跨层跳跃连接,深度残差网络使网络能够直接学习输入与输出的残差,从而简化了优化过程,使网络深度的大幅拓展成为可能。例如,用于图像识别的ResNet-50凭借50层的深度,能够精准提取图像中复杂特征。基于此,本研究以深度残差网络为基础,研究基于深度残差网络的多模态人脸快速辨识算法,旨在为人脸辨识提供有效方法。

1 多模态人脸快速辨识算法研究

1.1 基于BEMD的人脸图像多模态表示

二维经验模态分解(Bidimensional empirical mode decomposition,BEMD)建立在一维经验模态分解的基础上,能够将图像中的复杂非平稳信号分解为多个具有不同特征尺度的平稳数据分量以及一个趋势项的叠加,从而提取出图像在各个尺度上的多模态特征信息9

BEMD通过迭代搜寻图像的局部极大值和极小值点,构建上下包络线并计算均值以提取单个本征模态函数分量。这一过程不断重复,直至剩余信号符合预设的停止准则,最终生成一系列IMF分量及一个趋势项。在人脸识别领域,BEMD不仅能从图像的多尺度中精准抽取多模态特征信息,有效描绘人脸的局部与全局特性,而且凭借其基于图像局部特性的自适应分解能力,对光照、表情及姿态变化展现出强大的鲁棒性。此外,BEMD还能有效缩减图像冗余,显著提升人脸识别的效率与精确度。使用BEMD方法对待识别的人脸图像进行多模态表示,其具体实现过程如下。

g(x,y)表示待辨识的人脸图像,其中xy为像素坐标,BEMD方法对该待辨识人脸图像本征模态分量筛选k次,则第l个待辨识人脸图像本征模态分量可由rl,k(x,y)表示,使用形态学重构方法进行腐蚀和膨胀处理,其表达公式如下:

g˙(x,y)=(x,y):U(x,y)Φ
g¨(x,y)=(x,y):U(x,y)

式中:U(x,y)表示待辨识人脸图像本征模态分量的结构元素;Φ表示待辨识人脸图像空间;g˙(x,y)g¨(x,y)分别表示膨胀和腐蚀后待辨识人脸图像本征模态分量。

公式(1)(2)基础上,使用数学形态重构方法对待辨识人脸图像本征模态分量进行拟合,并依据其上、下包络曲面,计算待辨识人脸图像本征模态分量包络均值meanl,k(x,y),其表达公式如下:

meanl,k(x,y)=Zmaxl,k(x,y)+Zminl,k(x,y)2

式中:Zmaxl,k(x,y)Zminl,k(x,y)分别表示待辨识人脸图像本征模态分量上、下包络曲面。

对待辨识人脸图像本征模态分量可由Ql,k(x,y)和待辨识人脸图像本征模态分量包络均值进行作差处理,得到待辨识人脸图像本征模态分量分解结果hl,k(x,y),公式为:

hl,k(x,y)=Ql,k(x,y)-meanl,k(x,y)

设置待辨识人脸图像本征模态分量分解的约束条件SD,当式(4)结果满足该约束条件时1011,则作为第l个待辨识人脸图像本征模态分量,反之则重新对Ql,k(x,y)进行膨胀和腐蚀处理。

对待辨识人脸图像本征模态分量进行分解后,存在残余分量QL(x,y),该分量计算公式如下:

QL(x,y)=Ql(x,y)-hl(x,y)

在上述公式基础上,使用BEMD对待辨识人脸图像进行分解处理,其表达式如下:

Γ(x,y)=l=1Lcl(x,y)+l=1LQL(x,y)

式中:Γ(x,y)表示经过BEMD分解后的待辨识人脸图像多模态分量。

1.2 深度残差网络模型构建

构建的深度残差网络模型结构如图1所示。

深度残差网络模型由多个网络层构成,专门用于处理经过BEMD分解的待辨识人脸图像多模态分量。模型以这些分量为输入,首先通过Conv层(采用3×3卷积核,步长为1,填充为1,输出通道数根据具体任务调整)和自定义的ARBU层(自适应残差块单元,包含一定数量的卷积层和可能的注意力机制模块,具体参数依据实验确定),有效提取人脸图像的多模态特征。在特征提取阶段,融入注意力机制1213,通过动态调整特征图的权重,实现特征的选择与优化,增强模型对关键信息的捕捉能力。再使用BN层进行特征归一化,ReLU激活层引入非线性特征,以及全局平均池化层减少参数数量,避免过拟合,并对特征进行进一步筛选与处理。最终,经过上述处理的多模态特征被传递给输出层的全连接网络,通过Softmax函数快速输出多模态人脸的辨识结果,完成整个识别流程。

在深度残差网络模型的内部结构中,Conv层主要负责对输入的人脸图像多模态分量进行卷积运算,其输出结果即为这些分量经过卷积处理后的特征图:

yj=iMjΓi(x,y)×ϑij+bj

式中:ij为网络通道;yj为第j个深度残差网络通道输出的人脸图像多模态分量卷积结果;Mj为通道集合;ϑb分别为卷积核和偏置项。

式(7)结果输入到3个ARBU层内,通过其输出n个更深层次的人脸图像多模态分量特征Γn(x,y)后,将其输入BN层内,BN层将深度残差网络空间内人脸图像多模态分量特征Γn(x,y)调整到理想分布状态,BN层输出表达式为:

yn=λΓ^n(x,y)+J
Γ^n(x,y)=Γn(x,y)α2+ε-μα2+ε

式中:ε表示常数;λJ表示缩放调节因子;α为深度残差网络自适应系数。

然后运用注意力机制层从通道和空间两个方面对ARBU层输出结果进行强化处理14,强化得到的人脸图像多模态分量特征表达式如下:

Me(yn)=σ(MLP(AvgPool(yn))+MLP(MaxPool(yn)))yn

式中:Me(yn)表示强化后的人脸图像多模态分量特征;σ()表示非线性激活函数;MLP()表示注意力机制多层感知网络函数;AvgPool()MaxPool()分别表示平均池化和最大池化函数;表示乘积运算符。

式(10)结果输入到ReLU激活层,通过该层内非线性关系对人脸图像多模态分量特征进行学习15,ReLU激活层输出结果表达式如下:

y=maxMe(yn),0

再将ReLU激活层输出结果输入到全局平均池化层,该层输出结果表达式如下:

y˜=m=0γ-1n=0γ-1yas+V1,cs+V2γ2

式中:γ表示池化核大小;ac表示人脸图像多模态分量在人脸辨识图像内的位置索引;V1V2表示用于遍历池化窗口元素的参数。

ReLU激活层输出结果输入到输出全连接层内,通过该网络层输出多模态人脸辨识结果,其表达式如下:

F=j=1Mjwjy˜+bj

式中:F表示多模态人脸辨识结果;wj表示第j个网络通道权重。

2 实验分析

实验以CMU Multi-PIE公开人脸数据库中的人脸图像作为实验对象。该数据库包含337位志愿者拍摄的超过75 000张不同表情和不同光照条件下的人脸图像,是验证人脸辨识算法性能的重要数据集。本文算法基于这一数据库进行验证。

选取数据库内一幅人脸图像作为实验对象,使用本文算法对该人脸图像进行多模态表示,结果如图2所示。

图2中可以清晰看出,本文所采用的方法具有显著优势,能够有效提取待辨识人脸图像中的各个本征模态分量。值得注意的是,每个本征模态分量都精准呈现出待辨识人脸图像在不同尺度下的特征。这些特征丰富多样,包括人脸整体轮廓的大尺度特征,面部纹理、五官细节等小尺度特征。通过对这些不同本征模态分量的深入挖掘与分析,为后续的多模态人脸快速辨识工作提供了坚实基础。

为进一步验证本文算法对人脸图像的多模态表示能力,选择一幅人脸图像作为实验样本,使用本文算法对其进行多模态表示,并观察多模态提取后的残余分量情况,结果如图3所示。

深入分析图3,可以清晰看出本文算法在人脸图像多模态表示方面的卓越表现。经过多模态处理后的人脸图像,其残余分量图像中的残余信息与人脸特征完全无关,这一现象具有重要意义。它有力地证明了本文算法能够精准且高效地提取所有人脸特征,确保残余部分不包含任何人脸特征信息。这不仅直接展示了该方法在人脸图像多模态表示上的高精度,还从侧面反映了其强大的特征提取能力,表明本文算法在辨识人脸时能够达到较强的能力水平,为后续人脸辨识工作提供了坚实可靠的保障。

以一个表情变化的人脸作为实验对象,使用本文算法进行快速辨识,辨识结果如图4所示。

图4展示的辨识结果表明,在涉及悲伤、惊讶以及微笑这三种截然不同表情状态的实验中,本文方法在多个人脸图像构成的复杂场景中,均成功且高效地识别出了目标人物。这一结果表明本文方法在快速人脸识别图像中具有极高的稳定性,几乎不受人脸表情的影响,彰显出强大的快速人脸识别能力。

为进一步验证本文算法的快速人脸识别能力,选取侧面姿态的人脸作为待识别图像,使用本文算法对人脸图像进行快速辨识,辨识结果如图5所示。

通过图5可以看到,无论面对何种复杂情境,本文算法都能凭借侧面姿态的人脸图像,迅速且精准地从庞大的数据库中定位到目标人物。实验结果表明,该方法在应对不同人脸姿态时具有优秀的适应力。即便人脸并非正面朝向,本文算法依然能够高效运作,实现精准识别。表明在实际应用中,无论是监控捕捉到行人的侧脸,还是安检时人员以非正面姿态面对设备,该方法都不会受到干扰,能始终保持高水平的识别能力,验证了其在人脸姿态辨识方面的极强鲁棒性。

为了验证本文算法在人脸识别过程中的快速性,本文以响应时间作为衡量指标,测试在数据库中人脸图像数量不同的情况下,本文算法的人脸的辨识响应时间,设置响应时间限值为5 s,测试结果如图6所示。

图6中可以看出,随着数据库中人脸图像数量从50×102逐步增加到550×102,响应时间整体呈现出上升趋势。然而,即便在人脸图像数量达到最多的情况下,响应时间依然保持在2~3 s间,并未超过预设的5 s限值。这一结果表明,无论数据库规模如何变化,本文算法都能在较短时间内完成人脸辨识任务,有效验证了该方法在人脸识别过程中的时效性。此外,这也显示出本文算法在不同数据量下均具有良好的适应性和高效性,在实际应用中,即便是面对大规模的人脸数据库,也能保证较快的识别速度。

3 结束语

本文提出了一种基于深度残差网络的多模态人脸快速辨识算法。实验验证结果表明,该算法在多种复杂场景下均表现出色。具体而言,在面对人脸表情变化时,该算法能够有效辨识目标人物,不受表情因素的干扰;同时,对于侧面姿态的人脸图像,也展现出了强大的姿态鲁棒性。在测试其时效性方面,以响应时间为衡量指标,结果表明,即便在处理大规模数据库时,该算法也能保证在较短的响应时间内满足实际应用的需求。

参考文献

[1]

Alabdan R, Alsamri J, Hassine S . et al. Unmasking gan-generated faces with optimal deep learning and cognitive computing-based cutting-edge detection system[J]. Cognitive Computation, 2024, 16(6): 2982-2998.

[2]

陈岸明, 林群雄, 刘伟强. 基于对比学习的多特征融合戴口罩人脸识别[J]. 计算机应用研究, 2024, 41(1): 277-281, 287.

[3]

Chen An-ming, Lin Qun-xiong, Liu Wei-qiang.Multi feature fusion for masked face recognition based on contrastive learning[J]. Application Research of Computers,2024, 41(1): 277-281, 287.

[4]

Abate A F, Cimmino L, Lorenzo-Navarro J. An ablation study on part-based face analysis using a multi-input convolutional neural network and semantic segmentation[J]. Pattern Recognition Letters, 2023, 173: 45-49.

[5]

李云红, 刘杏瑞, 谢蓉蓉, . 基于超分辨重建和公共特征子空间的低分辨率人脸识别[J]. 西北大学学报: 自然科学版, 2023, 53(2): 241-247.

[6]

Li Yun-hong, Liu Xing-rui, Xie Rong-rong,et al.Low-resolution face recognition based on super-resolution reconstruction and common feature subspace[J]. Journal of Northwest University (Natural Science Edition), 2023, 53(2): 241-247.

[7]

王奇, 钱伟中, 雷航, . 基于关键特征增强机制的3D人脸识别[J]. 电子科技大学学报, 2024, 53(2):252-258.

[8]

Wang Qi, Qian Wei-zhong, Lei Hang, et al.3D face recognition based on key feature enhancement mechanism[J]. Journal of University of Electronic Science and Technology of China, 2024, 53(2): 252-258.

[9]

王海勇, 潘海涛. 基于混合自适应损失函数的人脸识别方法[J]. 计算机科学与探索, 2024, 18(6): 1627-1636.

[10]

Wang Hai-yong, Pan Hai-tao. Face recognition method based on hybrid adaptive loss function[J]. Journal of Frontiers of Computer Science & Technology,2024, 18(6): 1627-1636.

[11]

李溪, 杨明, 杜雅婷. 基于分区选择和Gabor小波的遮挡人脸识别[J]. 微电子学与计算机, 2023, 40(5): 39-46.

[12]

Li Xi, Yang Ming, Du Ya-ting.Occlusion face recognition based on partition selection and gabor wavelet[J]. Microelectronics & Computer,2023, 40(5): 39-46.

[13]

Khan Z, Boragule A, D'Auriol B J J M. Improvised contrastive loss for improved face recognition in open-set nature[J]. Pattern Recognition Letters, 2024, 180: 120-126.

[14]

Jalal A S, Tripathi R. Face recognition under large age gap using age face generation[J]. International Journal of Biometrics, 2023, 15(2): 233-250.

[15]

赵骁, 陈勇, 李一洋. 基于超分辨率重建的低分辨率人脸识别[J]. 火力与指挥控制, 2024, 49(3): 151-155, 164.

[16]

Zhao Xiao, Chen Yong, Li Yi-yang. Low-resolution face recognition based on super-resolution reconstruction[J]. Fire Control & Command Control, 2024, 49(3): 151-155, 164.

[17]

Sardar A, Umer S, Rout Ranjeet K R,et al. A secure face recognition for iot-enabled healthcare system[J]. ACM Transactions on Sensor Networks, 2023, 19(3): 1.1-1.23.

[18]

李小薪, 丁伟杰, 方怡, . 基于图像深度先验和鲁棒马尔可夫随机场的有遮挡人脸识别[J]. 计算机科学, 2024, 51(7): 244-256.

[19]

Li Xiao-xin, Ding Wei-jie, Fang Yi,et al.Occluded face recognition based on deep image prior and robust Markov random field[J]. Computer Science,2024,51(7):244-256.

[20]

Venkateswarlal P, Nitta G R, Prasad A. Retracted article: ensemble of texture and shape descriptors using support vector machine classification for face recognition[J]. Journal of Ambient Intelligence and Humanized Computing, 2024,15(): 4589-4602.

[21]

翁存福, 朱喜顺. 复杂背景下基于SIFT算法的局部遮挡人脸识别[J]. 计算机仿真, 2024, 41(2): 232-236.

[22]

Weng Cun-fu, Zhu Xi-shun.Partial occlusion facal recognition based on SIFT algorithm in complex background[J]. Computer Simulation,2024,41(2):232-236.

[23]

张中伟, 陈浩. 基于边缘计算的人脸识别模型研究[J]. 中国电子科学研究院学报, 2023, 18(4): 363-371.

[24]

Zhang Zhong-wei, Chen Hao.Research on face recognition model based on edge computing[J]. Journal of China Academy of Electronics and Information Technology, 2023, 18(4): 363-371.

基金资助

国家自然科学基金项目(62275080)

河南省青年基金项目(242300420689)

AI Summary AI Mindmap
PDF (1750KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/