基于音脸协同对比学习的深度伪造检测算法

李志鲲 ,  叶登攀

武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (2) : 173 -186.

PDF (2334KB)
武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (2) : 173 -186. DOI: 10.14188/j.1671-8836.2023.0079
信息安全与密码学

基于音脸协同对比学习的深度伪造检测算法

作者信息 +

Deepfake Detection Algorithm Based on Speech-Face Synergy Contrastive Learning

Author information +
文章历史 +
PDF (2389K)

摘要

主流的伪造检测方法从视觉单模态出发,通过检测视频帧中的伪影进行伪造检测,然而不同伪造方法会引入不同的伪影,导致这类方法有受限的性能和较差的泛化能力。同时,当前利用音频信息进行伪造检测的工作并没有充分利用音频信息发掘视觉模态的篡改。观察到自然视频中的音频和人脸具有内在协同性,而伪造方法均会对这种特性造成破坏,因此本文提出了一种音脸协同驱动的深度伪造检测算法,称为SFSD(Speech-Face Synergy Detect)。该算法提出了音脸协同对比学习策略,在通用视频数据集上构建样本,模拟伪造方法对音脸协同性的破坏,实现了对大量无标注真实视频的利用,提升了模型性能和泛化能力。算法构建了多模态模型SFformer(Speech-Face Transformer),其通过注意力瓶颈引导音脸模态浓缩并交融必要的信息,减少冗余信息的干扰,提升了模型的特征提取能力并改进了检测性能。在公开数据集FakeAVCeleb上的大量实验表明,SFSD在预训练后准确率为72.12%,超越部分基准方法;在经过迁移训练后准确率达到89.51%,高于先前工作,并且泛化能力有所提升。

Abstract

Most mainstream deepfake detection methods are based on visual single-modality, which detects deepfake videos by identifying fake artifacts in video frames. However, different deepfake methods may introduce different artifacts; therefore such methods have limited performance and poor generalization ability. Meanwhile, the current work utilizing audio information does not fully leverage audio information to uncover tampering in the visual modality. Natural videos have intrinsic synergy between speeches and faces, and deepfake methods this disrupt the intrinsic synergy between speeches and faces; this paper proposes a speech-face synergy-driven deepfake detection algorithm, called SFSD (Speech-Face Synergy Detection). The core of the algorithm is the audio-face synergy contrastive learning strategy, which constructs samples on a general video dataset to simulate the disruption of audio-face synergy using forgery methods and pre-trains the detection model on these samples. This strategy utilizes a large number of unlabeled real videos and enhances model performance and generalization capability. A multimodal model named SFformer (Speech-Face Transformer) is constructed, which utilizes an attention bottleneck to guide the condensation and fusion of essential information in the audio-face modality, reduces interference from redundant information, improves the model's feature extraction capability, and enhances detection performance. Numerous experiments on the public dataset FakeAVCeleb demonstrate that the accuracy of SFSD can reach 72.12% after pre-training, surpassing some benchmark methods, and the accuracy reaches 89.51% after transfer learning, which is higher than that of previous studies, and improves the generalization ability.

Graphical abstract

关键词

伪造检测 / 对比学习 / 多模态融合

Key words

deepfake detection / contrastive learning / multimodal fusion

引用本文

引用格式 ▾
李志鲲,叶登攀. 基于音脸协同对比学习的深度伪造检测算法[J]. 武汉大学学报(理学版), 2025, 71(2): 173-186 DOI:10.14188/j.1671-8836.2023.0079

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

基于生成对抗网络[1]和变分自编码器[2]的深度伪造(Deepfake)技术可以合成虚假的人物肖像或者声音[3-6],使得真实视频中的人物身份、面部表情或者唇部运动遭到篡改。Deepfake技术在动画、虚拟人和在线教育等领域的应用,吸引了学术界和工业界越来越多从业者的目光。然而,该项技术的滥用也会引发严重问题,非专业人员可以使用易获取的公开应用程序,如DeepFaceLab[7],方便地伪造逼真的人脸,部分恶意用户会利用此技术制作色情视频,损害公民的肖像权和名誉权,挑战社会道德和秩序,甚至危害国家安全。因此,设计伪造检测方法,辨别互联网上泛滥的伪造视频很有必要。目前已经有许多工作[8-11]致力于检测深度伪造视频。其中,基于视觉单模态伪造检测方法是一种被广泛应用的方法,它将深度伪造检测视为一个图像二分类的任务,通过深度伪造图像中的伪影(如上采样过程中带来的色域和频域空间的变化和后处理过程给图像引入的痕迹)辨别伪造视频帧,实现视频伪造检测。然而这类方法存在显著的缺陷,即过于依赖视频帧中的伪造特征进行检测,而不同的伪造方法因为使用不同的生成模型和后处理过程,会给图像引入不同的伪造特征,因此这类工作会严重过拟合于训练数据集,很难学习到具有泛化能力的特征,导致性能受限,并且对未知的伪造方法检测性能较差。

由于上述基于视觉单模态伪造检测方法的缺陷,近年来一些学者尝试利用音频信息,辅助视觉信息更好地发掘视觉模态的篡改,增强伪造检测方法的性能,如Chugh等[12]利用小时间段内的模态不和谐分数判别视觉模态是否存在伪造,Cheng等[13]利用伪造方法会破坏视频中音脸身份一致性的特点进行伪造检测,Mittal等[14]通过检测视频中音频与人脸表达出的情感倾向是否一致来辨别伪造视频。不过这些工作仍有不足之处:自然视频中音脸之间的协同特性是多种方面的,而这些工作中的方法局限于使用一个方面的协同特性进行伪造检测。当伪造手段对这种单一特性破坏程度较少,如利用相同人的语音修改唇形并未对身份一致性和情感匹配性造成破坏时,这些方法会受限;与此同时,这些方法对音脸信息单独进行特征提取,没有利用音脸互补信息增强特征提取能力。

当前的伪造方法不仅会对面部进行篡改,还会对视频中的音频模态进行篡改。因此,有工作研究同时检测视频中是否存在一种或两种模态被篡改。这类工作虽然扩充了视觉单模态伪造检测任务,聚焦于检测多个模态的篡改,但并没有研究如何利用音频信息更好地发掘视觉模态的伪造。此外,这类方法共性问题在于,伪造数据集中的视频规模有限,仅仅利用伪造数据集进行训练不利于让模型学习视频中音脸关系表征。因此需要设计一种方案,合理地使用网络空间中存在的大量未标注的真实视频,让模型学习到自然视频丰富的音脸内在表示。

为了解决以上问题,本文设计了音脸协同检测(Speech-Face Synergy Detect)的算法,提出利用视频间音脸协同特性进行伪造检测,以更加全面地利用音频信息发掘视觉模态伪造。本文认为视频中音脸协同性表现在以下两个方面:1) 语音与人脸的身份性应当是一致的;2) 语音内容与人脸面部运动应当是同步的。而深度伪造方法会对这种特性造成破坏。为了引导网络学习到真实视频和伪造视频的音脸协同性差异,本文提出了音脸协同对比学习策略,依据上述定义的协同性,在完全真实的视频数据集上构建样本,模拟伪造方法对视频音脸协同性的破坏,并对模型进行预训练。该策略建立在以下共识基础上:首先,伪造数据集的规模远小于真实音视频数据集,因此利用对比学习的方法构建样本,可以增大模型的数据投喂量,让模型更具有泛化能力,防止模型过拟合;其次,通过对比学习预训练,模型可以学习到更好的参数分布,在迁移至伪造数据集上训练时能够得到更佳的性能。

为了更好地利用语音与人脸模态的互补信息,并对音脸间的协同性进行建模、提取音脸融合特征进行伪造检测,本文基于Transformer[15]结构构建了SFformer(Speech-Face Transformer),引入多模态融合学习思想[16],在网络的前半部分对语音和人脸分别进行特征提取,在网络的后半部分实现模态信息的融合与交换。由于音脸跨模态的信息是彼此互补与冗余的,为了让音脸间交换必要的信息、减少冗余信息的使用并降低计算量,设计了基于注意力瓶颈(Attention Bottleneck)[17]的信息交换与融合层。不同于其他的多模态融合方法,注意力瓶颈可以引导模态浓缩并交换对另一个模态而言必要的信息,融合音脸间对伪造检测而言更有效的信息。本文将最终的音脸融合特征作为视频的音脸协同性表征,并利用此表征进行伪造检测。

1  相关工作

1.1 深度伪造

深度伪造在学术界和工业界已经成为研究热门。现有的伪造算法均基于图像,利用图像-图像转换的过程完成伪造人脸的合成,并合成伪造视频。早期的换脸算法需要为每一对互换的人脸训练编码器-解码器网络[18],不能实现任意人脸互换。随着技术发展,出现可以实现高质量的任意人脸互换算法,如Korshunova等[3]将换脸视作图像风格迁移的过程,实现了任意人脸互换;Nirkin等[4]提出FSGAN,利用插值引导的姿态转换网络、身份交换网络和人脸修复网络,解决了姿态差异过大带给换脸过程的困难并能降低换脸区域与背景区域的边界差异;Li等[19]提出FaceShifter,利用级联AAD块在多个特征级别内集成身份和人脸属性,生成逼真的人脸。除了人脸交换外,有的深度伪造方法尝试利用音频驱动视频中说话人的唇形,Jamaludin等[20]提出Speech2Vid模型,利用音频驱动静止人脸合成说话人视频;Prajwal等[6]提出Wav2Lip,利用了唇形同步鉴别器,监督网络合成具有良好的语音唇形同步的说话人视频;Zhou等[21]提出PC-AVS模型,在利用音频驱动唇形的基础上,实现对说话人的姿态控制。伪造算法虽然不断更新,可以实现合成越来越逼真的面部,但其不可避免地会对音频与人脸的协同性造成破坏:换脸算法会改变说话人的身份,因此对音脸的身份一致性造成破坏;而伪造方法均是将视频切分为帧后,逐帧生成伪造人脸,伪造人脸的运动在时域上难以维持和真实视频一样的连贯性,因此伪造方法也会对人脸与语音的运动同步性造成破坏。

1.2 伪造检测技术

深度伪造检测任务通常被看作是一个二分类任务(真或假)。主流的伪造检测方法基于视觉单模态信息,通过检测伪造伪影进行伪造检测[10]。孙鹏等[22]提出利用伪造方法后处理过程带来的拼接部位色彩偏移量不一致进行伪造取证,张怡暄等[23]通过伪造方法引入的时域帧间差异进行人脸篡改视频检测,Masi等[24]提出双分支网络,同时提取颜色域和频域的伪影来进行伪造检测。Nguyen等[8]将胶囊网络引入至伪造检测任务中。SSTNet[25]通过空间、隐写分析和时间特征检测编辑过的人脸。Qian等[26]提出F3Net,利用图像频率感知、图像分解分量和局部频率统计特征进行伪造检测。基于视觉单模态的方法具有一定的效果,但忽视了伪造方法给图像引入的伪造特征是不同的:1) 从合成人脸融合至原图时,经过的后处理过程不同,因此伪造图像拥有不同的拼接痕迹;2) 生成器会给图像带来独特的频域变化,被称为指纹[27],不同的伪造方法会使用不同结构的生成网络,因此带给图像的指纹也不同。所以基于视觉单模态的方法往往会陷入过拟合的困境:其通过训练集无法学习如何提取具有良好泛化性的特征,不仅在测试集上会展现出受限的性能,在面对未知的伪造方法时性能更是会严重下降。

为了解决上述缺陷,有学者尝试利用音频信息更好地发掘视觉模态的篡改。如Chugh等[12]利用小时间段内的模态不和谐分数判别视觉模态是否存在伪造,Mittal等[14]提出了利用音频与人脸的情感线索特征进行伪造检测,因为正常视频中的音频与人脸具有相同的情感偏见,因此利用音频与人脸的情感差异线索可以辅助伪造检测,但由于人类表达情感方式是多样的,这种情感差异并不存在于所有的伪造视频中。Cheng等[13]提出了VFD,通过视频中语音与人脸的身份相似性判别视频是否经过篡改。该方法仅利用了音频与人脸单一方面的匹配特性,忽视了音频信息同样可以反映人脸运动是自然连贯的,因此对音频信息的利用并不充分。同时,部分深度伪造视频并不会对音脸的身份一致性造成破坏,如用同一个人的音频驱动说话面部的合成,这种情况下该方法会失效。上述方法的共同缺陷在于,他们对音频与人脸特征单独进行特征提取,并利用向量的距离判别真假,但人类对模态信息的感知是同时进行的[16],因而忽视了利用模态间的互补信息。

还有一些学者尝试进行多模态深度伪造检测,同时检测视频中是否存在一个或两个模态的篡改。Zhou等[28]提出了联合视听篡改检测,利用视觉和听觉的内在同步流检测是否存在视觉或听觉模态的篡改。Ilyas等[29]提出AVFakeNet,利用SwinTransformer结构[30]检测视频流或语音流是否经过伪造。Cai等[31]提出基于边界感知时域检测的多模态伪造检测方法,并构建了一个包含视觉与听觉模态篡改的数据集Localized Audio Visual DeepFake进行实验。Yang等[32]提出了AVoiD-DF,探索时间与空间上的视听不一致性进行多模态深度伪造检测,并且构建了大规模多模态伪造数据集DefakeAVmiT进行实验,取得了很好的效果。但这类方法更多的是将伪造检测任务扩充为多模态检测任务,并没有更深入地探究如何利用音频模态信息增强视觉模态的篡改检测性能。同时,这些工作没有探究如何利用网络空间中存在着的大量未标注的自然视频,让模型学习到更丰富的音脸内在表示。

从以上方法得到启发,本文提出通过音脸间的协同性进行伪造检测。音脸协同性在音脸身份一致性上进行了扩展,加入了音频与人脸的运动同步性,更加充分地利用了音频信息。为了引导网络学习到伪造视频对音脸协同性的破坏,设计了音脸协同对比学习策略,在真实的音视频数据集上构建正负样本对模型进行预训练,增强了模型的性能和泛化能力。最后,本文基于注意力瓶颈机制,构建了多模态模型SFformer,与通常的多模态融合方式不同,基于注意力瓶颈机制的多模态交融能够使得音脸间更加有效地交换必要的互补信息,避免冗余信息的干扰,因而增强了模型的检测性能。

2  音脸协同驱动的伪造检测

2.1 方法依据

本文利用音脸协同性进行伪造检测,主要基于以下两点:1) 音脸协同性存在于自然视频中,并且可以定义为身份一致性和运动同步性;2) 伪造视频与真实视频的音脸协同性存在显著差异。

音脸协同性可以从多个先前研究中得到验证。人类的感知和神经学研究发现,可以从一个人的声音勾勒出一个人的外表,反之亦然[33]。因此,自然视频中的音脸存在着身份一致性。2018年,Nagrani等[34]提出了音脸跨模态匹配的任务,通过多路分类器,判断输入的多个人脸哪一个最可能与某个音频片段来源于相同身份。随后,不断有研究致力于音脸匹配的任务[35-36],不过通常做法是,将人脸与语音嵌入特征空间中,通过向量距离判别与语音最接近的人脸图像。自动唇读任务(Lip-Reading)、语音识别任务(Speech-Recognition)分别将视频中的视觉和语音信息转变为文字输出[37-38],因此可以推断,视频中的人脸运动与语音内容存在着同步性,Chung等[39]的唇形同步研究更是验证了这一点。在Zhou等[40]的说话人脸合成研究中,将人脸和语音信息解耦合为身份特征向量和语音内容向量,再将身份特征向量与另一段音频的语音内容向量重新耦合,生成与这段音频同步的说话人脸,因此可以说明,这两种特性存在于同一种特征空间中,属于相互耦合的状态。综上所述,将音脸协同性定义为身份上一致性与运动上同步性有充足的理论依据(图1)。

因此,可以从身份一致性和运动同步性分别验证伪造视频的协同性与真实视频有明显差异。文献[13]已经用实验验证了伪造方法会破坏真实视频的音脸身份一致性,因此只需进一步验证伪造方法会破坏真实视频中音脸间的运动同步性差异即可。本文使用SyncNet[39]结构进行了实验,SyncNet[39]是一个唇形同步鉴别网络,可以鉴别语音内容与唇形运动是否同步。随机抽取一定数量的真实视频和伪造视频,并用SyncNet计算音脸运动同步度,结果如图2所示。从实验结果可以看出,伪造视频的音脸同步性明显弱于真实视频。再结合文献[13]的结论,说明伪造视频的音脸协同性差于真实视频,这为利用音脸的协同特性进行伪造检测提供了基础。

2.2 SFformer结构

为了对视频的音脸协同性进行建模,本文提出了如图3所示的SFformer结构,由四部分组成:数据预处理层、特征提取层、信息交换与融合层以及分类层。SFformer基于多模态融合中的中期融合思想构建[16],输入为一串人脸帧序列和对应的音频段,首先在数据预处理层中,将输入转变为符合Transformer结构输入的样式,随后在特征提取层中,人脸模态和音频模态将分别进行特征处理。紧接着,在信息交换与融合层中,音脸模态信息会进行模态信息交流与融合,最终给出模态各自的特征以及音脸融合特征,该音脸融合特征即代表视频的音脸协同性表征。最后在分类层中对音脸融合特征通过多层感知机进行二分类,以判断视频是否经过篡改。

2.2.1 数据预处理

通常的伪造检测任务中,对数据集中视频的预处理方式是将其切分为视频帧,以图片为单位进行伪造检测。单张人脸图片也足以反映人脸身份信息,因此在文献[13]中也使用单张图片作为基本单位。但单张人脸图片无法反映出人脸的运动特性,因此本文采用与文献[639]相同的做法,将视频以5帧一组切分,以连续的5张视频帧作为视觉模态输入和检测的单位。同时,截取相应的音频片段作为听觉模态输入。随后,对其进行预处理过程,以符合模型的输入形式。

本文将这5张视频帧通过人脸检测算法截取人脸区域并缩放为相同大小的人脸图片,作为模型视觉模态的输入。而对于输入语音片段,则按照其他音脸任务的通常做法[620-2139],将其转变为梅尔语谱图(Mel Spectrum)的形式。语谱图(Spectrum)是声音波形的频率表示形式,其在频率上是线性分布的,而人耳对声音的感受则是对数变化的,因此梅尔语谱图将语谱图的频率刻度进行了对数化,以更符合人耳的感受模式,更加适合音脸任务。

由于Transformer结构需要一组具有相同维度的向量作为输入,称为tokens,因此将人脸图像和语谱图映射为维度为dim的tokens,映射流程如图4所示。对于宽和高为HW的人脸图像,用输入通道数与图像通道数相同、输出通道数为dim,卷积核大小和步长均为p的卷积对图像进行一次卷积操作,即将一张图像转换为HP×WP个大小为dim的tokens。为了保留输入序列的时序信息,原始的Transformer结构会一次性处理所有输入的tokens,并为输入序列添加余弦位置编码。然而,这种方式并不适用于图像这种高度结构化的数据。为此,ViT[41](Visiual Transformer)使用了一组可学习的随机参数与tokens相加作为位置编码。而由于SFformer的输入是一段视频帧,需要保留帧之间的时序信息,因此除了在图像内随机化一组可学习参数外,还要将来自第i帧的tokens与tokens维度相同、全为整数i的向量相加,以保留帧之间的位置信息(i以将这一组连续帧的起始帧视为第0帧得到)。按照与ViT[41]相同的方式,随机初始化一个CLS_Token与这些来自图像块的tokens合并作为特征提取层的输入,这个输入代表了视觉模态的整体特征。

梅尔语谱图的两个维度分别为时间和频率,为了保留时域上的特征,将其按照不同的频率分段,拉平为一维向量,并经过线性映射变换后,加入随机位置编码转变为输入的tokens。同样地,随机初始化一个CLS_Token,与来自语谱图的tokens合并,用其代表听觉模态的整体特征。

2.2.2 基于Transformer的特征提取

在网络的前N层中,使用Transformer块进行人脸和语音的特征提取。Transformer块结构如图4所示,由层归一化(Layer Norm)、多头自注意力(Multi-Head Self-Attention,MSA)、多层感知机(Multilayer Perceptron,MLP)和跳跃连接(Resdiual Connection)组成,前向传播的过程可形式化表示如下:

Zi*=MSA(LN(Zi-1))+Zi-1,i=0,1,,N,
Zi=MLP(LN(Zi*))+Zi*,i=0,1,,N

其中,Zi为经过i-1层Transformer块后的tokens,Zi*为经过残差结构得到的中间结果。因此,在信息交换与融合层前,模型的整个前向传播过程如下:

Zfaces=conv(faces)E,
Zspeeches=linear(mels)E,
Zfaces0=[CLSfaces||Zfaces],
Zspeeches0=[CLSspeeches||Zspeeches],
Zfacesi=Transformer(Zfacesi-1;θfacesi),i=1,2,,N,
Zspeechesi=Transformer(Zspeechesi-1;θspeechesi),i=1,2,,N

其中,表示逐元素相加,E表示位置编码。faces代表输入人脸帧,mels为对应的梅尔语谱图,Zfaces代表视觉模态的tokens,Zspeeches代表听觉模态的tokens,θ代表Transformer块的参数,||表示将tokens合并。

2.2.3 基于注意力瓶颈的信息交融

在网络的后M层中,本文引入了注意力瓶颈(Attention Bottleneck)机制[17],用以实现音脸模态的信息交换与融合。通常的多模态Transformer会将所有模态的tokens进行合并,放入Transformer块中进行学习。但这样的做法存在缺陷,并且并不适合伪造检测任务。原因在于:1) 多头自注意力机制会对所有tokens两两进行计算,而模态间存在许多冗余的信息,因此将所有tokens一起合并,会导致网络难以学习到重要的特征;2) 模态间的表示、大小均不同,由于模型输入的视觉图像大小远大于语谱图的大小,因此来自视觉模态的tokens数量也远多于来自听觉模态的tokens数量,将其一起合并,会导致网络忽略来自听觉模态的信息,并且会干扰视觉模态的特征提取;3) 伪造检测任务不同于一般的多模态分类任务,所提出的策略期望利用音频增强视觉模态的篡改检测性能,但音频模态在本质上并没有区分,所以用所有的听觉模态tokens进行信息交换与融合会干扰网络学习到与视觉模态伪造相关的特征。因此本文使用注意力瓶颈机制进行信息交融的过程。

在模型初始化时,随机生成K个与输入tokens维度一致的bottleneck tokens,但其在网络的特征提取层不参与训练。bottleneck tokens在音脸模态完成单独的特征提取后,分别与音脸模态tokens拼接,送入后续的Transformer块中:

[Zfacesi||Zbottlesi*]=Transformer([Zfacesi-1=||Zbottlesi-1];θfacesi),i=N+1,N+2,,K,[Zspeechesi||Zbottlesi]=Transformer([Zspeechesi-1||Zbottlesi*];θspeechesi),i=N+1,N+2,,K

其中,Zbottles代表bottleneck tokens。引入bottleneck tokens后,音脸模态间的信息交流与融合将只会通过bottleneck tokens进行。此时语音和人脸模态的tokens不再是并行地进入Transformer块中进行处理,而是以串行的方式:首先将语音tokens与bottleneck tokens拼接,送入Transformer块中,更新一次人脸tokens和bottleneck tokens,然后再将bottleneck tokens与语音tokens拼接送入Transformer块中,更新一次语音tokens和bottleneck tokens。bottleneck tokens的数量被设置为远少于音脸模态tokens的数量,此时跨模态的注意力必须通过这些瓶颈进行,因此会迫使模态浓缩自己的信息,并只共享必要的信息、减少冗余信息的流动,因此可以在降低计算量的同时提升多模态特征融合能力。

bottleneck tokens不仅能够实现音脸模态信息的交流,也实现了音脸模态信息的融合。在前向传播过程中,由于其不仅学习到了人脸模态信息,而且学习到了听觉模态信息,因此在bottleneck tokens中实现了音脸模态信息的融合。在模型的最后,通过平均池化层获取视频的音脸融合特征表示,这个特征向量代表了音脸协同性表征,将其送入多层感知机中获取二分类结果:

Ffusion=AVG(Zbottles)
result=MLP(Ffusion)

其中,AVG(*)表示平均池化,Ffusion代表音脸融合特征,MLP(*)代表多层感知机,result为分类结果。

2.3 音脸协同对比学习

对比学习(Contrastive Learning)是一种机器学习方法,旨在通过学习相似和非相似的样本之间的差异来学习数据的表示。对比学习使用正样本和负样本两类样本,并将其嵌入到特征空间中,使用一个损失函数度量相似性和非相似性。该损失函数使相似的样本在特征空间中距离更近,非相似的样本在特征空间中距离更远。对比学习常用于无监督学习,其优势在于:1) 可以利用未经过标注的数据进行学习;2) 可以学习到更加通用的特征表示,提高模型的泛化能力。

对于伪造检测任务而言,由于视觉内容差异不明显,构建正负样本较为困难。而音频信息的引入,使得这一过程变得容易起来。因此,本文设计了一种音脸协同对比学习策略,利用规模较大的真实视频数据集构建样本,模拟伪造方法对视频的音脸协同性的破坏并对模型进行预训练,使模型提取更具泛化能力的特征;同时,也能够让模型拥有更好的初始参数分布,相较于直接在伪造数据集上训练,它获得更优秀的性能。

2.3.1 正负样本选取

由于本文将音脸协同性定义为身份特征一致性与运动特征同步性,因此正负样本的选取基于这两方面考虑。对于一组选定的人脸帧,如图5所示,将其对应的语音片段作为锚(Anchor),人脸帧作为正样本(Positive Samples)。为了模拟深度伪造方法对身份一致性的破坏,从来自不同身份演讲者的视频中选取一组人脸帧,作为一类负样本;为了模拟深度伪造方法对人脸面部运动与语音内容同步性的破坏,在相同视频中,移动0.2~0.5 s,选择一组人脸帧作为另一类负样本。

2.3.2 损失函数设计

在生成正负样本后,需要构建对比损失对模型进行预训练。由于本文所构建的SFformer最终会给出三个特征:语音特征、人脸特征以及音脸融合特征,因此,可以利用传统对比损失,让SFformer学习将正样本对嵌入相近的特征向量中,将负样本对嵌入较远的特征向量中。由于注意力瓶颈的作用,协同性信息会随注意力计算过程,流动至音脸融合特征中,因此最后对音脸融合特征使用交叉熵损失进行二分类。对比损失为InfoNCE损失[42]和约束损失之和。InfoNCE损失计算如下:

LInfoNCE=-log[edis(v,f+)/τedis(v,f+)+i=1Nedis(v,fi-)]

其中,v为语音特征向量,作为锚;f+为正样本得到的人脸特征向量,fi-为负样本得到的人脸特征向量,下标i表示负样本标号;τ为温度系数,其为一个超参数;dis(*,*)表示计算向量距离,这里使用余弦相似度计算。

直接使用InfoNCE损失会导致网络只针对面部运动特征进行优化。由于很容易获取到同一个人说不同话的样本,但是获取不同人说相同话的样本却难以获得,而预期是想让网络同时针对身份特征和面部运动特征进行学习,输入不同身份的负样本中的面部运动也是不同的。因此本文设计了另外一个度量损失用以约束。假设N个负样本中与正样本身份相同的有j个,那么约束损失如下:

Ls=log[1+i=0N-jexp(dis(fT,fi-)-dis(fT,1jk=0jfk+))]

其中,fT是与语音片段相匹配的视频帧的特征向量,fi-为负样本中身份与fT不相同的样本的特征向量,fk+为与身份相同的样本的特征向量。此损失函数意图在于不让网络忽视对身份特征的学习。综上,预训练阶段总体的对比损失计算如下:

Lcon=LInfoNCE+λ1Ls

其中,λ1为超参数。对比损失让网络学习到了提取音脸协同性相关特征,通过信息交融层后,音脸融合特征中包含了协同性信息,因此可以让网络直接通过音脸融合特征判别输入的人脸帧与语音是否匹配,最终的预训练阶段的音脸协同损失函数为二分类交叉熵损失与对比损失的叠加:

Lpre=Lcls+λ2Lcon

其中,Lpre代表预训练损失,Lcls代表二分类交叉熵损失,λ2为超参数。

在迁移至深度伪造数据集上进行训练时,此时的输入变为人脸帧与其对应的语音切片,一段语音切片只对应一组相应的人脸帧,因此不能直接使用公式(6)作为正式训练的对比损失函数。本文使用修改过后的度量损失作为正式训练阶段的损失函数,称为音脸协同对比损失(Voice-Face Synergy Loss,VFSL)。定义如下的样本距离:

Vpos=d (fspeechesreal,ffacesreal)Vneg=d (fspeechesfake,ffacesfake)

其中,Vpos代表真实视频的音脸协同相似度,Vneg代表伪造视频的音脸协同相似度,VFSL的损失如下:

LVFSL=-Plog(softmax([Vpos,Vnegi]))

其中,P为长度与样本数量相等的一维向量,第0位为1,其余为0,该损失会使得真实视频的音脸协同相似度增大,而伪造视频的音脸协同相似度变小。与预训练阶段类似,正式阶段的总体损失同样为二分类交叉熵损失叠加上述的音脸协同对比损失:

L=Lcls+λ3LVFSL

其中的Lcls为二分类交叉熵损失,λ3为超参数。

3  实验结果与分析

3.1 数据集

在预训练阶段,本文使用了两种数据集训练网络。

1) VoxCeleb2数据集[43]。VoxCeleb2数据集是一个从YouTube视频中收集的通用视听数据集,包含了来自6 000多名演讲者的100多万个演讲视频。

2) LRS2(Lip Reading Sentence2)数据集[44]。该数据集包含了从BBC电视节目中收集的数千个说话人视频。

预训练阶段主要使用VoxCeleb2数据集,对于每名演讲者,随机选取10 s的片段进行作为预训练数据集,由于LRS2数据集中没有标注视频身份,因此在预训练阶段从LRS2数据集中获取数据作为负样本的补充。训练集、验证集、测试集大小比例为8∶1∶1。

在正式训练和测试阶段,使用了以下两种深度伪造数据集:

1) FakeAVCeleb数据集[45]。该数据集是一个视频多模态深度伪造数据集,于2021年公开,使用了4种不同的伪造方法,从500个真实视频中生成了19 500个伪造视频。同时该视频具有高度的种族性别平衡比例以消除歧视问题。由于该数据集的真实视频数量远小于伪造视频数量,为了解决数据不平衡问题,从VoxCeleb2数据集中选取了相同身份说话人的7 500个视频,将真实视频数量扩充到8 000个。然后将300位说话人的真实视频和相应的伪造视频作为训练集,将100位说话人的真实视频和相应的伪造视频作为验证集,剩余的视频作为测试集。在模型的预训练、正式训练、验证和测试阶段均不包含来自相同身份演讲者的视频。

2) DeepfakeTIMIT数据集[46]。该数据集于2018年公开,包含两个子集,即64×64分辨率大小的LQ集以及128×128大小的HQ集,每个子集包括16对看起来相似的受试者的10个换脸视频。从VidTIMIT数据集[47]上下载了真实视频进行实验。

为了防止信息泄露,实验的预训练阶段和训练阶段中,训练集、验证集、测试集均不包含来自相同身份的视频。

3.2 实验环境及参数设置

本文在pytorch1.9环境下搭建网络并且进行实验,训练过程中使用默认参数的Adam优化器[48]对参数进行优化。在预训练阶段,为了达到最好的训练效果,设定初始的学习率为1.0×10-4,在训练100个epoch后将学习率降低为1.0×10-5。在微调阶段,设定全程的学习率为1.0×10-5。与文献[13]相同,网络参数用均值为0,标准差为0.02的随机正态分布初始化,并且将公式(5)中的温度系数设为0.1。损失函数的超参数中,考虑到交叉熵损失函数为主要损失函数,对比损失函数为辅助函数,经过实验后,将损失函数的超参数设为0.1时取得最优的结果,因此损失函数的超参数设定为0.1。参照文献[13]的经验,每种类型的负样本数量均为2。与其他伪造检测工作相同[1013],输入视频帧通过人脸检测算法提取面部区域后,统一调整大小为224×224,而输入的语音切片根据文献[6]的经验,用80×16大小的梅尔频谱图表示。模型在两块3090显卡上以批量大小为64进行训练。

模型设置方面,综合考虑文献[17]的经验和任务实际,为达到最优的效果,经过实验后,设置输入tokens的维度为1 024。对于输入的人脸帧,经过输入通道为15、输出通道为1 024、卷积核大小为28的卷积变换为维度为1 024的输入tokens,并与通过标准正态分布生成的CLS_Token进行拼接,因此输入视觉tokens的总数为65。对于输入的语音样本,在频率维度上以10为步长进行分块,通过全连接层后变为长度为1 024的tokens,并与通过标准正态分布生成的CLS_Token进行拼接,因此输入的听觉tokens总数为11。多头自注意力机制中设置了16个注意力头,网络的前六层为特征提取层,后六层为信息交换和融合层。信息交换和融合层中,通过均值为0、标准差为0.02的高斯分布生成了两个bottlenecks token。

3.3 实验结果

使用ACC(Accuracy,准确率)和AUC(Area Under Curve)作为评判指标。

与多个先前的优秀研究工作进行了比较,这些方法可以分为利用单模态视觉信息检测和利用音频信息辅助的多模态检测两类。

单模态的方法:该方法仅利用视觉信息检测视频帧中的伪影,对比的工作包括Meso-4[11]、MesoInception-4[11]、Xception[10]、Capsule[8]、F3-Net[26]和ViT[41]

多模态检测的方法:该方法引入了音频作为辅助信息进行伪造检测,对比的方法有:Emotional Forensics[14]、MesoInception-4_MM[49]、EfficientNet_MM[49]、VGG16_MM[49]、VFD[13]和MDS[12]

3.3.1 对比实验结果

表1展示了在FakeAVCeleb和DeepfakeTIMIT数据集上的结果。

可以看出,SFSD没有在伪造数据集上进行正式训练,仅经过预训练的情况下,在FakeAVCeleb数据集上准确率便达到了72.12%,AUC达到了74.57%,超过了基准方法Meso-4,说明仅经过预训练后,模型就具有了一定的伪造检测能力,验证了所提出的音脸协同对比学习策略的有效性。在迁移至伪造数据集上进行训练后,在FakeAVCeleb数据集上准确率达到了89.51%,AUC达到了92.48%,高于所有基于视觉单模态的方法。对比使用了音频信息的工作中表现最好的方法VFD,SFSD准确率提升了3.91个百分点,AUC提升了5.8个百分点,验证了SFSD方法的可行性。在DeepfakeTIMIT数据集上,SFSD的AUC值均高于Emotional Forensics,其中在LQ集上提升了4.94个百分点,在HQ集上提升了3.6个百分点。DeepfakeTIMIT数据集提出时间较早,伪造方法造成的伪造痕迹较重,因此所有方法的AUC均达到了不错的结果。而FakeAVCeleb数据集较新,使用的伪造方法更为先进,伪造痕迹并不明显,而SFSD达到了最高的准确率和AUC值。

3.3.2 泛化能力测试

FakeAVCeleb中包含了两种视频深度伪造方法:一种为换脸,使用了FaceSwap和FSGAN;另一种为语音驱动说话人脸,使用了Wav2Lip。本文将其按此分为两种子集,一种仅使用了换脸算法,另一种则使用了Wav2Lip。将模型在单个子集上进行训练,然后直接迁移至某一个子集上进行测试,结果如表2所示。

表2的实验结果可以看出,SFSD在FakeAVCeleb的两个子集上同样达到了最佳的准确率,分别为89.58%和88.74%。训练集为换脸集时,所有方法在Wav2Lip集上的准确率都低于换脸集,这是由于Wav2Lip集仅仅对图像的唇部运动进行了篡改,相较于对整个面部进行篡改的换脸算法而言伪造痕迹较小。泛化性方面,所提出的SFSD不仅迁移至另一子集测试后准确率仍旧最高,并且准确率下降幅度小于其他方法,从换脸集迁移至Wav2Lip集时下降了13.57个百分点,而从Wav2Lip集迁移至换脸集则下降了11.39个百分点。同样使用了语音信息的VFD,准确率下降幅度大于SFSD,说明其泛化能力弱于SFSD。该实验表明,本文所提出的算法对音频信息利用更加充分,并且基于注意力瓶颈层的SFformer信息利用能力更强,有更好的特征提取与交融能力。

3.3.3 鲁棒性测试

视频在传播的过程中,常常会受到各种因素的干扰,导致原始视频画面失真,给伪造检测带来困难。为了进一步验证基于音脸协同特征进行伪造检测的优越性,本文进行了如下的鲁棒性测试。将在原始数据集上训练好的模型,迁移至加入了JPEG压缩和高斯模糊的测试集上进行测试,用以验证模型的抗干扰能力,结果如表3所示。

本文在测试阶段使用了Albumentations库分别对测试集进行了强度为60的JPEG压缩增强和高斯模糊增强,但是在训练阶段并未引入相应的数据增强方法,而是直接使用在原始数据集上训练完毕的模型直接迁移测试。从测试结果可以看出,本文所提出的SFSD在加入干扰后准确率仍保持最高,并且下降幅度最小,VFD准确率下降幅度大于本文所提算法,说明了SFSD抗干扰能力强于其他方法,具有更强的鲁棒性。

3.3.4 消融实验

本节对模型进行了一系列消融实验以验证所提各项策略的有效性。

本文所提出的SFformer进行音脸融合的方式,在多模态领域中属于中期融合(middle fuse),即对模态特征进行单独的特征提取后,再对特征进行融合。在多模态领域中也存在着早期融合(early fuse)和后期融合(late fuse)的特征融合方式,因此本文同时构建了基于早期融合的SFformer和基于后期融合的SFformer进行了对比实验。在早期融合中,不单独进行特征提取,而是将所有的模态tokens一起合并输入到后续Transformer块中;在后期融合中,音脸模态分别进行特征提取后,直接将特征向量拼接作为音脸融合特征。对比结果如表4所示。

表4中可知,在基于早期融合的SFformer上,预训练策略并没有起到作用,准确率仅为51.67%,原因在于预训练阶段,利用对比学习的方式生成的正负样本,本质上均为真实内容,而早期融合的方式在一开始混合了来自两个模态的信息,视觉模态的tokens输入远多于听觉模态,导致网络只关注了来自视觉模态的内容,因而预训练策略失败。因此同样地,迁移至伪造数据集后,基于早期融合的SFformer也并没有取得较好的效果,准确率为82.68%,仅比基于纯视觉信息的ViT高出1.03个百分点,表明模型并没有很好地利用音频信息。而在基于后期融合的SFformer上,预训练策略取得了一定的效果,可以在经过预训练的情况下准确率达到60.54%,不过基于后期融合的方法仍存在缺陷,即音脸模态的特征提取中没有利用到彼此的互补信息,并且不同模态的输入大小和表示不同,给特征融合带来困难:语音信息通过语谱图的形式输入,是一个频率矩阵,而视觉信息以图像的形式输入,是一个像素矩阵,对应0.2 s的视频段而言,输入的图像矩阵大小为15×224×224,而语谱图的大小仅为1×80×16,相较而言,视觉内容的表示更为稠密,而听觉内容更加稀疏,将这两个模态的特征向量直接拼接送入分类器,会让分类器偏向于某一个模态的信息,而对另一个模态的信息没有加以利用,这就给跨模态的信息交流带来了困难,因而准确率较低。而基于中期融合的SFformer中,模态特征先进行了单独提取,而后半部分利用注意力瓶颈进行音脸信息的交融,避免了模态间冗余信息的干扰,充分利用了模态间的互补信息,取得了最优的效果。此外,经过预训练的SFformer相较于未经过预训练、直接在伪造数据集上开始训练的SFformer,准确率提升了2.84个百分点,同时验证了所提出的音脸协同对比学习策略能够有效地提升模型性能。

为了验证所提出的对比损失的有效性,分别对对比学习中常用的对比损失:三元组损失、N-Pairs损失、InfoNCE损失进行了实验,结果如表5所示(表5中均为仅在真实数据集上预训练,随后直接迁移至伪造数据集测试的结果)。

表5可以看出,三元组损失的效果最差,准确率仅为65.18%。这是因为三元组损失中仅能使用一个正样本和一个负样本,负样本数量过少,网络未能充分训练。N-Pairs损失和InfoNCE损失中均采用多个负样本,其性能比较接近,准确率都比三元组损失高。由于2.3.2节中提到的负样本选取问题,单纯的InfoNCE损失效果差于本文提出的叠加了约束损失的效果,本文构建的损失函数准确率相较于InfoNCE损失提升了2.06个百分点。该实验表明本文提出的对比损失的有效性。

最后,本文探究了信息交融层中,注意力瓶颈的数量对模型的影响,结果如图6所示。

实验所用模型均没有经过预训练,从图6可以看出,bottlenecks数量在1~4时,模型的准确率都达到了85%以上,在bottlenecks数量为2时最高,但是在数量超过5后,模型的准确率显著降低,这是因为在bottlenecks数量远少于输入的音脸模态tokens时,可以通过bottlenecks减少冗余信息的交换,迫使模态浓缩必要的信息,因而提升模型性能。当bottlenecks数量超过4后,由于输入的听觉模态tokens数量为11,此时通过随机化生成的bottlenecks数量过多,不仅不能起到信息交换的作用,多余的bottlenecks还会被当作噪声,干扰网络的训练。

4  结 语

本文从深度伪造方法对音脸协同性破坏的角度出发,设计了一种音脸协同驱动的深度伪造检测方案(SFSD)。为了解决基于视觉单模态的检测模型检测性能受限和泛化能力差的问题,提出利用音脸的协同特性进行伪造检测,并从理论与实验上验证了伪造方法会破坏音脸的协同性。为了实现对音脸互补信息的充分利用,提出了基于中期融合和注意力瓶颈的SFformer网络,该网络首先对音脸模态单独进行特征提取,随后利用注意力瓶颈进行音脸信息的交流与融合过程。为了增强模型的性能和泛化能力,设计了一种基于音脸协同对比学习的预训练方法,可以在完全真实的视频数据集上构建样本,模拟伪造方法对音脸协同性的破坏,并对网络进行预训练,增强其性能和泛化能力。在伪造数据集上进行的大量实验表明,SFSD在仅经过预训练的情况下准确率可以达到72.12%,验证了预训练策略的有效性,经过迁移后准确率可以达到89.51%,超越了其他的伪造检测工作。泛化实验、鲁棒性测试表明,基于音脸协同性设计的SFSD算法有优秀的泛化能力和抗干扰能力。最后,消融实验验证了所提出策略的有效性。

伪造方法虽然会引入不同的伪造特征,但均会对自然视频的自然语义产生破坏,所提出的音脸协同性仅是一种初探,未来可以从更多方向考虑如何让模型学习自然视频与伪造视频的高级语义差异。此外,所提出的方法需要用音频输入,然而互联网中存在着许多没有音频的视频,在这种情况下,使用了音频信息的伪造检测方法将会失效。因此未来可以考虑知识蒸馏策略,让模型利用音频信息学习到的视觉篡改特征,通过蒸馏策略指导纯视觉模型更好地识别视觉篡改。

参考文献

[1]

GOODFELLOW IPOUGET-ABADIE JMIRZA Met al. Generative adversarial networks[J]. Communications of the ACM202063(11): 139-144. DOI: 10.1145/3422622 .

[2]

KINGMA D PWELLING M. Auto-encoding variational Bayes [EB/OL]. 2013arXiv: 1312.6114.

[3]

KORSHUNOVA ISHI W ZDAMBRE Jet al. Fast face-swap using convolutional neural networks[DB/OL]. [2023-02-02]. DOI: 10.1109/iccv.2017.397 .

[4]

NIRKIN YKELLER YHASSNER T. FSGAN: Subject agnostic face swapping and reenactmen[DB/OL]. [2023-02-02]. DOI: 10.1109/iccv.2019.00728 .

[5]

KOUJAN M RDOUKAS M CROUSSOS Aet al. Head2Head: Video-based neural head synthesis[C]//2020 15th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2020). New York: IEEE Press, 2020: 16-23. DOI: 10.1109/FG47880.2020.00048 .

[6]

PRAJWAL K RMUKHOPADHYAY RNAMBOODIRI V Pet al. A lip sync expert is all you need for speech to lip generation in the wild[DB/OL]. [2023-02-02]. DOI: 10.1145/3394171.3413532 .

[7]

PEROV IGAO D HCHERVONIY Net al. DeepFaceLab: Integrated, flexible and extensible face-swapping framework[EB/OL]. 2020arXiv: 2005.05535.

[8]

NGUYEN H HYAMAGISHI JECHIZEN I. Capsule-forensics: Using capsule networks to detect forged images and videos[C]//2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). New York: IEEE Press, 2019: 2307-2311. DOI: 10.1109/ICASSP.2019.8682602 .

[9]

LI Y ZLYU S W. Exposing DeepFake videos by detecting face warping artifacts[EB/OL]. 2018arXiv: 1811.00656. DOI: 10.1109/wifs.2018.8630787 .

[10]

RÖSSLER ACOZZOLINO DVERDOLIVA Let al. FaceForensics ++: Learning to detect manipulated facial images[DB/OL]. [2023-01-12]. DOI: 10.1109/iccv.2019.00009 .

[11]

AFCHAR DNOZICK VYAMAGISHI Jet al. MesoNet: A compact facial video forgery detection network[C]//2018 IEEE International Workshop on Information Forensics and Security (WIFS). New York: IEEE Press, 2018: 1-7. DOI: 10.1109/WIFS.2018.8630761 .

[12]

CHUGH KGUPTA PDHALL Aet al. Not made for each other- audio-visual dissonance-based deepfake detection and localization[DB/OL]. [2023-02-03]. DOI: 10.1145/3394171.3413700 .

[13]

CHENG HGUO Y YWANG T Yet al. Voice-face homogeneity tells deepfake [EB/OL]. 2022arXiv: 2203.02195.

[14]

MITTAL TBHATTACHARYA UCHANDRA Ret al. Emotions don’t lie: An audio-visual deepfake detection method using affective cues[DB/OL]. [2023-02-01]. DOI: 10.1145/3394171.3413570 .

[15]

VASWANI ASHAZEER NPARMAR Net al. Attention is all you need[DB/OL]. [2024-10-11].

[16]

XU PZHU X TCLIFTON D A. Multimodal learning with transformers: A survey[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence202345(10): 12113-12132. DOI: 10.1109/TPAMI.2023.3275156 .

[17]

NAGRANI AYANG SARNAB Aet al. Attention bottlenecks for multimodal fusion[EB/OL]. 2021arXiv: 2107.00135.

[18]

NGUYEN T TNGUYEN Q V HNGUYEN D Tet al. Deep learning for deepfakes creation and detection: A survey[J]. Computer Vision and Image Understanding2022223: 103525. DOI: 10.1016/j.cviu.2022.103525 .

[19]

LI L ZBAO J MYANG Het al. Advancing high fidelity identity swapping for forgery detection[C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2020: 5074-5083. DOI: 10.1109/CVPR42600.2020.00512 .

[20]

JAMALUDIN ACHUNG J SZISSERMAN A. You said that: Synthesising talking faces from audio[J]. International Journal of Computer Vision2019127(11): 1767-1779. DOI: 10.1007/s11263-019-01150-y .

[21]

ZHOU HSUN Y SWU Wet al. Pose-controllable talking face generation by implicitly modularized audio-visual representation[C]//2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2021: 4176-4186. DOI: 10.1109/CVPR46437.2021.00416 .

[22]

孙鹏, 郎宇博, 巩家昌, . 拼接篡改伪造图像的色彩偏移量不一致取证方法[J]. 计算机辅助设计与图形学学报201729(8): 1408-1415.

[23]

SUN PLANG Y BGONG J Cet al. Authentication method for splicing manipulation with inconsistencies in color shift[J]. Journal of Computer-Aided Design & Computer Graphics201729(8): 1408-1415 (Ch).

[24]

张怡暄, 李根, 曹纭, . 基于帧间差异的人脸篡改视频检测方法[J]. 信息安全学报20205(2): 49-72. DOI: 10.19363/J.cnki.cn10-1380/tn.2020.02.05 .

[25]

ZHANG Y XLI GCAO Yet al. A method for detecting human-face-tampered videos based on interframe difference[J]. Journal of Cyber Security20205(2): 49-72. DOI: 10.19363/J.cnki.cn10-1380/tn.2020.02.05 (Ch ).

[26]

MASI IKILLEKAR AMASCARENHAS R Met al. Two-branch recurrent network for isolating deepfakes in videos[M]// Computer Vision - ECCV 2020. Cham: Springer International Publishing, 2020: 667-684. DOI: 10.1007/978-3-030-58571-6_39 .

[27]

WU XXIE ZGAO Y Tet al. SSTNet: Detecting manipulated faces through spatial, steganalysis and temporal features[C]//2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). New York: IEEE Press, 2020: 2952-2956. DOI: 10.1109/ICASSP40776.2020.9053969 .

[28]

QIAN Y YYIN G JSHENG Let al. Thinking in frequency: Face forgery detection by mining frequency-aware clues[C]//European Conference on Computer Vision. Cham: Springer, 2020: 86-103.10.1007/978-3-030-58610-2_6. DOI: 10.1007/978-3-030-58610-2_6 .

[29]

WANG S YWANG OZHANG Ret al. CNN-generated images are surprisingly easy to spot for now[DB/OL]. [2023-01-05]. DOI: 10.1109/cvpr42600.2020.00872 .

[30]

ZHOU Y PLIM S N. Joint audio-visual deepfake detection[C]//2021 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2021: 14780-14789. DOI: 10.1109/ICCV48922.2021.01453 .

[31]

ILYAS HJAVED AMALIK K M. AVFakeNet: A unified end-to-end Dense Swin Transformer deep learning model for audio-visual​deepfakes detection[J]. Applied Soft Computing2023136: 110124. DOI: 10.1016/j.asoc.2023.110124 .

[32]

LIU ZLIN Y TCAO Yet al. Swin Transformer: Hierarchical vision transformer using shifted windows[C]//2021 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2021: 9992-10002. DOI: 10.1109/ICCV48922.2021.00986 .

[33]

CAI Z XSTEFANOV KDHALL Aet al. Do you really mean that? content driven audio-visual deepfake dataset and multimodal method for temporal forgery localization[C]//2022 International Conference on Digital Image Computing: Techniques and Applications (DICTA). New York: IEEE Press, 2022: 1-10. DOI: 10.1109/DICTA56598.2022.10034605 .

[34]

YANG W YZHOU X YCHEN Z Ket al. AVoiD-DF: Audio-visual joint learning for detecting deepfake[J]. IEEE Transactions on Information Forensics and Security202318: 2015-2029. DOI: 10.1109/TIFS.2023.3262148 .

[35]

KAMACHI MHILL HLANDER Ket al. Putting the face to the voice: Matching identity across modality [J]. Current Biology200313(19): 1709-1714. DOI: 10.1016/j.cub.2003.09.005 .

[36]

NAGRANI AALBANIE SZISSERMAN A. Seeing voices and hearing faces: Cross-modal biometric matching[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2018: 8427-8436. DOI: 10.1109/CVPR.2018.00879 .

[37]

WANG RLIU XCHEUNG Y Met al. Learning discriminative joint embeddings for efficient face and voice association[DB/OL]. [2023-04-02]. DOI: 10.1145/3397271.3401302 .

[38]

ZHU B QXU K LWANG C Jet al. Unsupervised voice-face representation learning by cross-modal prototype contrast[DB/OL]. [2023-03-12]. DOI: 10.24963/ijcai.2022/526 .

[39]

MALIK MMALIK M KMEHMOOD Ket al. Automatic speech recognition: A survey[J]. Multimedia Tools and Applications202180(6): 9411-9457. DOI: 10.1007/s11042-020-10073-7 .

[40]

CHUNG J SSENIOR AVINYALS Oet al. Lip reading sentences in the wild[DB/OL]. [2023-03-14]. DOI: 10.1109/cvpr.2017.367 .

[41]

CHUNG J SZISSERMAN A. Out of time: Automated lip sync in the wild[DB/OL]. [2023-01-23]. DOI: 10.1007/978-3-319-54427-4_19 .

[42]

ZHOU HLIU YLIU Z Wet al. Talking face generation by adversarially disentangled audio-visual representation[J]. Proceedings of the AAAI Conference on Artificial Intelligence201933(1): 9299-9306. DOI: 10.1609/aaai.v33i01.33019299 .

[43]

DOSOVITSKIY ABEYER LKOLESNIKOV Aet al. An image is worth 16x16 words: Transformers for image recognition at scale[EB/OL]. 2020arXiv: 2010.11929.

[44]

HE K MFAN H QWU Y Xet al. Momentum contrast for unsupervised visual representation learning[DB/OL]. [2023-02-06]. DOI: 10.1109/cvpr42600.2020.00975 .

[45]

CHUNG J SNAGRANI AZISSERMAN A. VoxCeleb2: Deep speaker recognition[DB/OL]. [2023-02-03].DOI: 10.21437/interspeech.2018-1929 .

[46]

AFOURAS TCHUNG J SSENIOR Aet al. Deep audio-visual speech recognition[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence202244(12): 8717-8727. DOI: 10.1109/TPAMI.2018.2889052 .

[47]

KHALID HTARIQ SKIM Met al. FakeAVCeleb: A novel audio-video multimodal deepfake dataset[EB/OL]. 2021arXiv: 2108.05080. DOI: 10.1145/3476099.3484315 .

[48]

KORSHUNOV PMARCEL SKORSHUNOV Pet al. DeepFakes: A new threat to face recognition? assessment and detection[EB/OL]. 2018arXiv: 1812.08685.

[49]

SANDERSON CLOVELL B C. Multi-region probabilistic histograms for robust and scalable identity inference[C]//International Conference on Biometrics. Heidelberg: Springer, 2009: 199-208. DOI: 10.1007/978-3-642-01793-3_21 .

[50]

KINGMA D PBA JHAMMAD M M. Adam: A method for stochastic optimization[EB/OL]. 2014arXiv: 1412.6980.

[51]

KHALID HKIM MTARIQ Set al. Evaluation of an audio-video multimodal deepfake dataset using unimodal and multimodal detectors[DB/OL]. [2023-02-10]. DOI: 10.1145/3476099.3484315 .

基金资助

国家自然科学基金(62072343)

国家自然科学基金(U1736211)

国家重点研发计划(2019QY(Y)0206)

AI Summary AI Mindmap
PDF (2334KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/