CMBA:基于复杂映射的神经网络后门攻击

李学 ,  何琨 ,  陈晶 ,  杜瑞颖

武汉大学学报(理学版) ›› 2024, Vol. 70 ›› Issue (4) : 421 -430.

PDF (1688KB)
武汉大学学报(理学版) ›› 2024, Vol. 70 ›› Issue (4) : 421 -430. DOI: 10.14188/j.1671-8836.2023.0008
网络空间安全

CMBA:基于复杂映射的神经网络后门攻击

作者信息 +

CMBA: Backdoor Attack of Neural Networks Based on Complex Mapping

Author information +
文章历史 +
PDF (1728K)

摘要

现有的大多数后门攻击研究仅考虑了all-to-one等简单的后门映射策略,忽视了现实攻击场景中对其他更加复杂的映射策略的需求,限制了后门攻击的灵活性。针对这一问题,提出了映射策略可调的后门攻击框架,并在此框架下实现了一类基于复杂映射的后门攻击CMBA。引入了逃逸类别和多目标类别的设置,使CMBA攻击不仅能够精准地控制后门攻击的影响范围,还可以在不同原始类别和多个目标类别之间建立复杂的对应关系,提升了攻击的灵活性。实验结果表明,CMBA攻击在3个数据集上都展示了良好的攻击效果。此外,通过引入更多逃逸类别和目标类别,CMBA攻击获得了更好的隐蔽性能,能够成功绕过目前的一些主流后门防御的检测。

Abstract

Most existing research on backdoor attacks has primarily focused on simple backdoor mapping strategies, such as all-to-one mapping. This approach overlooks the need for more complex mapping strategies in real-world attack scenarios, thereby limiting the flexibility and effectiveness of backdoor attacks. To solve the problem, this article proposes a backdoor attack framework with an adjustable mapping strategy, and implements a backdoor attack based on complex mapping, called CMBA. By introducing evasion classes and the multi-target setting, CMBA can precisely control the attack scope, and establish complex correspondences between different original classes and multiple target classes, thereby improving the flexibility of attacks. The experimental results show that CMBA performs well on three datasets. In addition, by introducing more evasion classes and target classes, CMBA becomes stealthier and successfully bypasses the detection of several current mainstream backdoor defenses.

Graphical abstract

关键词

人工智能 / 深度学习 / 后门攻击 / 映射策略

Key words

artificial intelligence / deep learning / backdoor attack / mapping strategy

引用本文

引用格式 ▾
李学,何琨,陈晶,杜瑞颖. CMBA:基于复杂映射的神经网络后门攻击[J]. 武汉大学学报(理学版), 2024, 70(4): 421-430 DOI:10.14188/j.1671-8836.2023.0008

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

近年来,深度学习技术在许多领域取得了丰硕的成果,比如计算机视觉[12]、语音识别[3]等。训练一个表现良好的深度学习模型通常需要海量的数据和计算资源,然而大多数企业和个人没有足够的训练资源。因此,越来越多的企业和个人选择将训练任务外包出去或者使用第三方收集的数据训练模型。这就给攻击者提供了可乘之机。攻击者可以通过修改一部分训练数据向模型中植入后门,使受害模型在测试阶段正常预测干净输入,而将添加了触发器的输入错误预测为攻击者指定的目标类别。当前,深度学习模型在自动驾驶、人脸识别等安全敏感的领域被广泛使用。如果这些基于深度学习模型被植入后门,会造成严重的安全后果。为了确保此类应用的安全,对神经网络后门攻击进行研究是十分必要的。

以往的大多数后门攻击研究[4~7]针对的是all-to-one类型的攻击。这类攻击潜在地假设任意原始类别的后门输入(即添加了触发器的输入)都会被受害模型预测为攻击者事先指定的单个目标类别。只有少部分工作考虑了其他形式的映射策略,如:Gu等[8]发动了all-to-all攻击,将每个原始类别的后门输入分别映射到一个不同的目标类别。此外,部分研究者[9~11]试图只攻击一个原始类别,即让受害模型仅仅将单个指定类别的后门输入错误分类到目标类别。然而,他们采用的攻击方案过于简单,导致非指定类别的输入添加触发器后仍然被受害模型以较高的概率错误预测为目标类别。也就是说,其实现的攻击依旧是一种all-to-one类型的后门攻击。

在现实世界中,攻击者可能想让受害模型学习更加复杂的映射策略。这将产生多种攻击形式,增强后门攻击的灵活性。当前,由于缺乏相关研究,我们尚不清楚深度学习模型对其他更复杂的后门映射策略的学习能力以及对应攻击能否绕过现有的后门防御。

因此,本文从映射策略的角度对后门攻击进行了研究,提出了一种映射策略可调的后门攻击框架,丰富了攻击的形式。攻击者可以在该框架下设计更加灵活的后门攻击。一方面,攻击者可以通过改变映射策略和训练集投毒方式调整攻击的范围,使部分类别(称为逃逸类别)免受攻击的影响。逃逸类别的输入即使添加了触发器,也不会被受害模型错误预测到其他类别,而是被正常预测为其真实类别。同时,受害模型不会将其他类别的后门输入错误预测为逃逸类别。另一方面,在目标类别的选择上,该框架允许设置任意个数的目标类别。根据此攻击框架,本文实现了一类新的后门攻击CMBA。

1  威胁模型

目前,发动后门攻击的方式主要分为两类:一类是直接对模型的参数或结构进行修改[1213],一类是修改部分训练数据[1415],即在训练阶段实施数据投毒。第一种方式要求攻击者完全了解模型,且有能力对模型做出任意修改。然而,在现实场景中通常很难满足这一条件。因此,本文的攻击框架采用了更具实践性的第二种攻击方式。下文将从攻击者的目的、能力、获取知识情况三个方面描述该框架下攻击的威胁模型并阐述对应的现实攻击场景。

1.1 攻击者的目的

攻击者旨在通过训练集投毒的方式向模型中植入后门,使受害模型在添加了触发器的输入上输出攻击者指定的目标预测,同时在未经过任何修改的干净输入上进行正常分类。和以往的工作不同,本文假设攻击者可以通过调整映射策略实现更加灵活的攻击目标,而不是始终将后门输入错误预测为单个目标类别。

1.2 攻击者的能力

攻击者可以修改一部分训练样本。具体而言,他可以对这部分样本的数据和标签进行任何修改。但攻击者不能对模型的训练过程进行干预,比如修改模型的训练方法、训练使用的损失函数和训练的超参数等。在测试环节,攻击者有能力访问受害模型,可以将任意图像送入受害模型进行预测。

1.3 攻击者的知识

本文考虑的是黑盒的攻击场景。攻击者不清楚模型的内部参数和结构,因此无法得到模型的中间输出等。这一假设主要考虑了在实际场景下,模型的结构和参数可能被作为一种知识产权来进行保护,因此模型拥有者通常不会透露相关信息。

1.4 对应的现实攻击场景

上述针对攻击者的假设,可能发生在使用第三方提供的数据进行模型训练的场景中,比如某一用户由于缺乏足够的训练数据,使用从网上收集的一部分数据用于训练自己的模型,而这些数据可能是攻击者发布的恶意数据。

2  策略可调的后门攻击框架

以往的多数后门攻击研究只考虑了较简单的映射策略,而忽视了对其他更加复杂的映射策略的研究。针对这一问题,本文提出了一种映射策略可调的后门攻击框架。下文将对其进行详细描述。首先概述该框架下发动后门攻击的流程和攻击目标,然后分别介绍攻击流程中投毒样本的生成、后门植入和后门激活。

2.1 攻击流程概述

图1所示,攻击的整体流程包括三个步骤:训练集投毒、后门植入和后门激活。

设原始训练集为:

Dtrain=xi,yixiX,yiYi=1N

其中,X是输入空间,Y是类别空间,N是训练样本的总数。攻击者从原始训练集中选择一部分训练样本作为初始投毒集合Dmodify,依次修改其中的样本生成投毒样本集合:

Dpoison=xi',yi'xi'=Mxi,yi'=Lyi,xi,yiDmodifyi=1R

其中,M表示为输入添加触发器的操作;L是攻击的类别映射函数,它表示原始类别到目标类别的映射;R是构造的投毒样本总数。剩余干净训练样本的集合Dclean=D-trainDmodify

攻击者构造的投毒训练集Dtrainadv包括投毒样本集合Dpoison以及剩余的干净样本集合Dclean,即:Dtrainadv=DpoisonDclean。后门攻击的投毒比例η定义为投毒训练集Dtrainadv中投毒样本的比例,即:η=R/N

模型fθ:XY在投毒训练集Dtrainadv上训练之后,就被攻击者植入了后门。本文假设攻击者不能控制训练过程,所以模型的训练和后门植入实际上是由用户完成的。在测试阶段,攻击者使用带有触发器的输入去查询受害模型,以激活受害模型内部的后门。最终受害模型将输出攻击者指定的目标预测。

一个成功的后门攻击需要满足以下的目标:1) 受害模型能正确地分类干净输入;2) 受害模型预测添加触发器的后门输入时,将根据输入的原始类别和类别映射函数,输出相应的目标预测。以上目标可以形式化地描述为:对于任意干净的输入xX以及它的真实类别yY,受害模型将做出如下的预测:

fθx=y
fθMx=Ly

2.2 投毒样本生成

为了构造投毒样本集合Dpoison,攻击者需要同时修改训练图像及其标签。下文将从投毒图像的生成方式和投毒图像的标签映射策略两方面介绍投毒样本的生成过程。

首先,对于Dmodify中的每张图像x,攻击者按照M为其添加后门触发器。触发器由三个部分构成:掩模m、样式p和透明度α。掩模m是一个二值矩阵,标记了触发器的位置;样式p表示触发器的像素颜色深度;透明度α0,1表示图像和触发器的融合比例。由上述定义,M可形式化为:

Mx=1-mx+mαx+1-αp

其中表示按像素乘。然后,攻击者根据类别映射函数L修改投毒图像的标签。实际上,L表示了攻击者的攻击目的,因为其指定了受害模型在不同原始类别的后门输入上的目标预测结果。以图像分类任务为例,若类别映射函数被攻击者设置为AB,受害模型就会将添加触发器图案的类别A的图像错误识别为类别B。在以往的攻击中,受害模型学习的映射策略比较简单,其使用的类别映射函数往往是常值函数等简单函数。例如,all-to-one后门攻击采用的映射函数是Ly=yt,其中yt是攻击者指定的目标类别。而对于all-to-all后门攻击,其映射函数为Ly=y+1modS,其中S代表分类任务的类别总数。

与先前的工作不同,本文的框架不对攻击者使用的映射策略进行任何限制,攻击者可以将攻击的类别映射函数L设置为从原始类别到目标预测类别的任意映射函数。也就是说,在本文的攻击框架下,攻击者不仅可以实现以往的all-to-one攻击和all-to-all攻击,还可以通过改变映射函数和投毒方法来设计新的攻击类型,实现多种攻击目的。本文框架下的部分映射策略如图2所示。攻击者可以像图2(a)中展示的那样,使受害模型将所有原始类别的后门输入错误映射到多个目标类别。除了攻击所有类别外,攻击者也可以将攻击的影响范围精准地控制在部分类别上。比如在人脸识别任务中,攻击者可能只想授予部分人员利用触发器激活后门的权利,只有那些被允许的人才能利用受害模型内植入的后门实现获取更高权限人员身份等恶意目的。此时,攻击者可以采用类似图2(b)和图2(c)展示的映射策略实现其攻击目标,使受害模型将部分类别的后门输入映射为单个或多个目标类别,其余类别的后门输入则仍正常分类为原始类别。因此,在本文的框架下,攻击者可以根据其攻击目的灵活地选择不同的映射策略,而非局限于一两种简单映射策略,让受害模型学习更加复杂的后门功能。

2.3 后门植入和激活

攻击者将投毒样本注入到训练集后,用户在投毒训练集Dtrainadv上通过最小化交叉熵损失C训练模型fθ:XY,即:

θ*=arg minθj=1NCfθxj,yj

其中,xj,yjDtrainadv。根据之前对Dtrainadv的定义,它包含剩余的干净训练样本集合Dclean和投毒样本集合Dpoison,因此可以将(4)式拆分成如下的形式:

θ*=arg minθxj,yjDcleanCfθxj,yj+Mxj,LyjDpoisonCfθMxj,Lyj

由上述训练目标,受害模型在训练过程中同时学习了如何正确地分类干净输入和后门映射函数。

在测试阶段,攻击者将触发器添加到测试输入x上,生成后门输入Mx,然后将其送入受害模型进行预测。由于受害模型内植入的后门被激活,攻击者将获得预期的目标输出Ly

3  基于复杂映射的后门攻击CMBA

在策略可调的后门攻击框架下,本文实现了一类基于复杂映射的后门攻击CMBA。

3.1 CMBA攻击概述

CMBA攻击让受害模型学习更加复杂的后门功能,并且可以控制攻击的影响范围。从攻击效果上看,CMBA攻击让受害模型将部分类别(称为被攻击类别)的后门输入错误分类为多个目标类别。此外,其允许一些类别作为逃逸类别。逃逸类别的分类不受后门攻击的影响,即:逃逸类别的输入在添加触发器后仍然被受害模型以较高的准确率识别为原始类别,同时其余类别的输入在添加触发器后不会被受害模型错误分类到逃逸类别。图2(c)展示了CMBA攻击的一种具体映射方式。

图3所示,在CMBA攻击中,受害模型实际上学习了三种工作模式:干净模式、攻击模式和逃逸模式。在干净模式下,受害模型准确地分类干净输入;在攻击模式下,受害模型将原属于被攻击类别的后门输入错误分类为攻击者指定的目标类别;在逃逸模式下,受害模型将原属于逃逸类别的后门输入正确分类为其真实类别。

已有的all-to-one后门攻击是与输入无关的,因为受害模型总是将任意类别的后门输入错误预测为同一目标类别。正是由于这个特点,all-to-one后门容易被现有的后门防御算法检测出来。与all-to-one攻击不同,本文提出的CMBA攻击引入了逃逸类别和多目标类别的设置。一方面,攻击者可以实现更灵活的攻击目标,因为他既可以通过改变逃逸类别的数量控制攻击的影响范围,也可以将被攻击类别的后门输入任意映射到多个目标类别。另一方面,CMBA攻击的隐蔽性较好。CMBA攻击只攻击部分类别,逃逸类别的存在让受害模型和干净模型(干净训练样本上训练的模型)在后门输入上的行为变得相似,所以更难以检测。同时,CMBA攻击设置了多个目标类别,后门输入被预测到哪个目标类别取决于其原始类别。这将原始类别和对应的目标类别之间建立了较强的联系,使受害模型对后门输入的判断更加依赖于输入图像的原始内容,从而可以绕过一些现有的后门防御。对比all-to-one攻击和all-to-all攻击,本文的CMBA攻击只对部分类别进行攻击,能实现对攻击影响范围的精准控制以及建立从原始类别到多个目标类别的复杂映射关系(表1)。在CMBA攻击中,受害模型可以学习更复杂的后门功能,实现多样化的攻击目标。

3.2 CMBA攻击的投毒方法

为了让受害模型学习CMBA攻击的三种模式,攻击者需要构造两类投毒样本:普通投毒样本和辅助逃逸的投毒样本。攻击者将触发器添加到被攻击类别的部分训练图像上,然后将他们的标签修改为对应的目标类别,这样就生成了普通投毒样本。此外,攻击者还要制作一些辅助逃逸的投毒样本,即:将逃逸类别的部分训练图像添加上触发器同时保持其标签不变。

因此,在CMBA攻击中,投毒训练集可划分为三个子集:普通投毒样本集合Dpoisonnormal、辅助逃逸的投毒样本集合Dpoisonevasion和剩余的干净训练样本集合Dclean。故(5)式可以进一步分解成以下形式:

θ*=arg minθLclean+Lattack+Levasion
Lclean=xj,yjDcleanCfθxj,yj
Lattack=Mxj,LyjDpoisonnormalCfθMxj,Lyj
Levasion=Mxj,yjDpoisonevasionCfθMxj,yj

由以上式子可知,受害模型在训练阶段的学习目标为对干净模式、攻击模式、逃逸模式这三种工作模式的学习。其中,普通投毒样本的作用是让受害模型学习攻击模式,辅助逃逸的投毒样本则让受害模型保持攻击效果的同时学习逃逸模式,在逃逸类别和被攻击类别的后门输入上做出不同的行为。

此前,部分研究者[91116]也曾试图控制攻击的影响范围,即:让受害模型仅将一个指定的原始类别错误分类到单个目标类别。为了实现此攻击,这些研究者只使用指定原始类别的训练数据来制作普通投毒样本。该方法潜在地假设:如果攻击者不对非指定类别的训练数据进行任何修改,那么受害模型在测试阶段就不会将非指定类别的后门输入错误预测到目标类别。然而实验结果证明,此假设是不成立的。这一简单的投毒方法无法将攻击的影响范围限制在指定类别的后门输入上,受害模型仍然会将非指定类别的后门输入错误分类到目标类别。深度学习模型倾向于通过学习简单的规则来进行分类。虽然触发器只被添加到指定类别的训练图像上,但是触发器通常是一个易于学习的特征。受害模型将触发器当作识别目标类别的一种捷径,所以无论后门输入的原始类别是什么,都会被错误预测为目标类别。为了解决这一问题,CMBA攻击引入了辅助逃逸的投毒样本来纠正受害模型过度依赖触发器的行为。在训练过程中,受害模型要拟合辅助逃逸的投毒样本,就不能仅仅依赖于触发器进行后门输入的预测,而是需要根据输入的原始类别做出不同的行为。这样就实现了对攻击范围的控制,让受害模型学会了逃逸模式。

4  实 验

4.1 实验设置

本文选用了3个在后门攻击研究中常用的图像数据集。

1) MNIST[17],它是手写数字识别的数据集,包含0~9这10个数字的手写图像及其标签。每张图像均为28×28的灰度图像。MNIST数据集包括训练集和测试集,分别对应60 000和10 000个样本。

2) CIFAR10[18],它是彩色图像识别数据集,一共10个类别。它包含60 000张32×32大小的图像及其标签,其中训练集有50 000个样本,测试集有10 000个样本。

3) GTSRB[19],它是交通标志识别的基准数据集,包括43种交通标志牌图像。每张图像的大小介于15×15到250×250之间,实验中将图像统一预处理为32×32的大小。GTSRB可分为包含39 209个样本的训练集以及包含12 630个样本的测试集。

在MNIST数据集上使用和文献[8]中相同的小型CNN模型,它包含两个卷积层和两个全连接层;在CIFAR10数据集上使用Pre-activation Resnet-18模型[20];在GTSRB数据集上使用文献[21]中相同的CNN模型,它包括6个卷积层和两个全连接层。

在发动CMBA后门攻击时,从训练集的每个类别随机选择10%的样本来制作投毒数据。如图4所示,实验中使用了4种触发器,分别是:灰度触发器、随机彩色触发器、水印触发器[22]和方形彩色触发器[22]。在MNIST数据集上使用一个3×3的灰度触发器,在CIFAR10数据集上使用一个4×4的随机彩色触发器和水印触发器[22],在GTSRB数据集上使用同样的随机彩色触发器以及方形彩色触发器[22]

实验的评估指标包括以下三种:1) 模型在干净测试数据上的分类准确率;2) 后门攻击的攻击成功率,即被攻击类别的后门输入中成功被模型误分类为对应目标类别的概率;3) 模型在逃逸类别的后门输入上的分类准确率。

4.2 攻击效果评估

根据类别映射函数的具体设置不同,可以发动很多种CMBA攻击。因此,对于每个数据集和触发器组合,实验随机发动5次CMBA攻击,统计各项指标并计算其平均值。实验结果如表2所示。可以看到,在三个数据集上,不论使用何种触发器,CMBA攻击都达到了较高的攻击成功率。同时,受害模型在干净测试数据上的准确率和干净模型差不多。此外,受害模型能够准确地分类逃逸类别的后门输入。上述结果证明了攻击的有效性。受害模型成功地学会了CMBA攻击的三种工作模式,实现了对复杂映射规则的学习。

接下来评估可能影响攻击效果的三个因素:触发器大小、触发器透明度和辅助逃逸的投毒样本。首先评估触发器大小对攻击效果的影响。此时评估使用的是随机彩色触发器,其形状为正方形,因此触发器边长越大,意味着其面积也更大。如图5所示,随着触发器边长的增加,攻击成功率先上升后下降。这可能是由于在CMBA攻击中,为了实现对不同原始类别的后门输入的差异化映射,受害模型需要同时关注原始图像和触发器的特征。当触发器很小的时候,稍微增大触发器的大小,受害模型能够更好地学习原始图像和触发器的复合特征。然而随着触发器继续增大,它将占据图像更多区域,可能会遮挡原始图像的内容,导致受害模型无法较好地学习二者的特征,攻击表现也因此变差。

接着探究触发器透明度对攻击表现的影响。实验结果如图6所示。更高的透明度可以使攻击在视觉上的隐蔽性增强,但是也会降低CMBA攻击的攻击成功率。因此在设置触发器透明度时,需要权衡攻击成功率和视觉隐蔽性。

最后评估辅助逃逸的投毒样本对攻击表现的影响。首先使用被攻击类别的部分训练数据生成普通投毒样本。然后分别采取两种方式:一种是不对逃逸类别的训练数据进行任何修改,一种是使用逃逸类别的部分训练数据生成辅助逃逸的投毒样本。通过对比这两种投毒方式实现的后门攻击的表现,探究辅助逃逸的投毒样本对攻击效果的影响。实验结果如表3所示。不添加辅助逃逸的投毒样本时,受害模型无法以较高的准确率将逃逸类别的后门输入分类为其真实类别。尤其是在GTSRB数据集上,绝大多数逃逸类别的后门输入都被受害模型预测错误。对比之下,添加辅助逃逸的投毒样本之后,受害模型能够准确地分类逃逸类别的后门输入。以上结果表明,为了让受害模型学习CMBA攻击的逃逸模式,控制攻击影响的范围,在训练集投毒阶段加入辅助逃逸的投毒样本是非常必要的。

4.3 绕过后门防御的能力评估

本小节将评估CMBA攻击绕过几种主流后门防御的能力,包括训练前的防御Spectral Signatures[23]、针对模型的防御Fine-Pruning[24]、Neural Cleanse[25]以及测试阶段基于模型可解释性的后门防御[26]。实验中对逃逸类别的数量e和目标类别的数量t进行调整,分别实现不同攻击设置下的CMBA攻击,并比较其绕过几种后门防御的能力。

Spectral Signatures是在训练前针对训练数据进行检测的后门防御。它基于干净输入和后门输入在后门模型的特征空间上的差异来检测训练集中可能存在的投毒样本并进行移除。首先,通过改变攻击设置,即逃逸类别的数量e以及目标类别的数量t,构造不同的投毒训练集,训练得到几种CMBA攻击对应的受害模型。然后使用Spectral Signatures方法对每个被投毒训练集进行检测,移除那些可疑的样本。防御的结果如表4所示。表4中的投毒样本移除率表示普通投毒样本中被Spectral Signatures检测方法移除的比例。可以发现,增加逃逸类别的数量可以帮助CMBA后门绕过Spectral Signatures的检测。而增加目标类别的数量对于CMBA攻击绕过Spectral Signatures的能力没有明显提升。这可能是因为逃逸类别增加时,CMBA攻击影响的类别变少,后门输入和干净输入在特征空间上的差异变小了。

Fine-Pruning防御认为后门输入倾向于激活干净输入很少激活的神经元,即休眠神经元。它首先对休眠神经元进行剪枝移除后门相关的可疑神经元,然后在一部分干净数据上对模型进行微调进一步消除后门和缓解剪枝操作对模型准确率的影响。表5展示了在施加防御后模型干净准确率降低不超过4%的情形下,Fine-Pruning在不同攻击设置的CMBA后门模型上的防御结果。可以发现,当逃逸类别和目标类别的数量较少时(e=1,t=2),CMBA后门较容易被Fine-Pruning防御消除。特别是在MNIST和GTSRB数据集上,攻击成功率下降到了0.05以下。但如果增加逃逸类别或目标类别的数量,CMBA攻击绕过Fine-Pruning防御的能力就变强了。这可能是因为当逃逸类别或目标类别的数量增多时,受害模型需要更多地依赖后门输入的原始类别来决定应该如何进行预测,所以后门输入也会激活一些与原始类别特征识别相关的神经元,干净输入和后门输入激活的神经元就变得更加相似了。此时,Fine-Pruning防御很难在保持较高干净准确率的同时移除受害模型中植入的后门。

Neural Cleanse是基于触发器逆向的后门检测方法。它首先对每个类别计算使模型将其他类别的输入全部错误分类到该类别所需的最小扰动,将其作为该类别对应的候选触发器;然后通过判断其中是否存在异常小的触发器来检测后门模型。实验结果如表6所示,可以看到,当引入更多逃逸类别或增加目标类别的数量时,CMBA攻击能够成功绕过Neural Cleanse的检测。目标类别的增多使原始类别和目标类别之间的映射关系变得更复杂。不同原始类别的后门输入被受害模型错误分类到多个目标类别,因此想要使受害模型将其他类别的输入都错误分类到某个类别,需要更大的扰动。当增加逃逸类别的个数时,不同类别的后门输入被分类到同一个类别的情况也减少了,想让受害模型将其他类别都错误分类到某个类别,同样需要更大的扰动,因此Neural Cleanse无法检测对应的后门。

基于模型可解释性的后门防御使用Grad-CAM[27]技术定位输入图像中对于分类最关键的区域,并将该区域作为后门触发器的可疑位置。实验结果如图7所示。当CMBA攻击设置的目标类别和逃逸类别的个数较少时,Grad-CAM技术能够准确地定位到触发器所在的位置。但是当目标类别或逃逸类别的数量增加时,就很难通过Grad-CAM技术定位到后门触发器了。因为当这两种类别增多时,为了正确地实现后门映射规则,受害模型对后门输入的分类会更加依赖于其原始类别的特征,而不是仅仅依赖于后门触发器,所以Grad-CAM后门防御定位触发器的能力变差了。

5  结 语

本文提出了一种策略可调的后门攻击框架,并根据此框架实现了一类基于复杂映射的后门攻击CMBA。本文的攻击框架允许攻击者通过调整后门映射策略和投毒方式来设计新的后门攻击,实现多样化的后门功能。在这一框架下实现的CMBA攻击相比以往的all-to-one后门攻击,能够实现更加灵活的攻击目标,包括控制攻击的影响范围以及在原始类别和多个目标类别之间建立任意的复杂映射关系,同时面对后门检测具有更好的隐蔽性。在多个数据集上的实验表明深度学习模型有能力学习更复杂的后门映射策略,且对应的后门攻击可以成功绕过现有的流行后门防御,但是本文的研究仅涉及图像分类领域。未来,将继续在语音、文本等领域中探索实现复杂后门映射策略的可能性,还将尝试研究利用不同映射策略的后门攻击的特点,设计针对任意映射策略的通用防御方案。

参考文献

[1]

KRIZHEVSKY ASUTSKEVER IHINTON G E. ImageNet classification with deep convolutional neural networks[J]. Communications of the ACM201760(6): 84-90. DOI: 10.1145/3065386 .

[2]

HE K MZHANG X YREN S Qet al. Deep residual learning for image recognition[C]//2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2016: 770-778. DOI: 10.1109/CVPR.2016.90 .

[3]

GRAVES AMOHAMED A RHINTON G. Speech recognition with deep recurrent neural networks[C]//2013 IEEE International Conference on Acoustics, Speech and Signal Processing. New York: IEEE Press, 2013: 6645-6649. DOI: 10.1109/ICASSP.2013.6638947 .

[4]

ZHAO S HMA X JZHENG Xet al. Clean-label backdoor attacks on video recognition models[C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2020: 14431-14440. DOI: 10.1109/CVPR42600.2020.01445 .

[5]

LIU Y FMA X JBAILEY Jet al. Reflection backdoor: A natural backdoor attack on deep neural networks[C]//European Conference on Computer Vision. Cham: Springer, 2020: 182-199.10.1007/978-3-030-58607-2_11. DOI: 10.1007/978-3-030-58607-2_11 .

[6]

CHENG S YLIU Y QMA S Qet al. Deep feature space Trojan attack of neural networks by controlled detoxification[J]. Proceedings of the AAAI Conference on Artificial Intelligence202135(2): 1148-1156. DOI: 10.1609/aaai.v35i2.16201 .

[7]

LI Y ZLI Y MWU B Yet al. Invisible backdoor attack with sample-specific triggers[C]//2021 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2022: 16443-16452. DOI: 10.1109/ICCV48922.2021.01615 .

[8]

GU T YLIU KDOLAN-GAVITT Bet al. BadNets: Evaluating backdooring attacks on deep neural networks[J]. IEEE Access20197: 47230-47244. DOI: 10.1109/ACCESS.2019.2909068 .

[9]

TRUONG LJONES CHUTCHINSON Bet al. Systematic evaluation of backdoor data poisoning attacks on image classifiers[C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW). New York: IEEE Press, 2020: 3422-3431. DOI: 10.1109/CVPRW50498.2020.00402 .

[10]

XIANG ZMILLER D JKESIDIS G. A benchmark study of backdoor data poisoning defenses for deep neural network classifiers and a novel defense[C]//2019 IEEE 29th International Workshop on Machine Learning for Signal Processing (MLSP). New York: IEEE Press, 2019: 1-6. DOI: 10.1109/MLSP.2019.8918908 .

[11]

LI S FXUE M HZHAO B Z Het al. Invisible backdoor attacks on deep neural networks via steganography and regularization[J]. IEEE Transactions on Dependable and Secure Computing202118(5): 2088-2105. DOI: 10.1109/TDSC.2020.3021407 .

[12]

RAKIN A SHE Z ZFAN D L. TBT: Targeted neural network attack with bit Trojan[C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2020: 13195-13204. DOI: 10.1109/CVPR42600.2020.01321 .

[13]

LI Y CHUA J YWANG H Yet al. DeepPayload: Black-box backdoor attack on deep learning models through neural payload injection[C]//2021 IEEE/ACM 43rd International Conference on Software Engineering (ICSE). New York: IEEE Press, 2021: 263-274. DOI: 10.1109/ICSE43902.2021.00035 .

[14]

ZHANG QDING Y FTIAN Y Qet al. AdvDoor: Adversarial backdoor attack of deep learning system[C]//Proceedings of the 30th ACM SIGSOFT International Symposium on Software Testing and Analysis. New York: ACM, 2021: 127-138. DOI: 10.1145/3460319.3464809 .

[15]

NGUYEN T ATRAN A. Input-aware dynamic backdoor attack[J]. Advances in Neural Information Processing Systems202033: 3454-3464.

[16]

KOLOURI SSAHA APIRSIAVASH Het al. Universal litmus patterns: Revealing backdoor attacks in CNNs[C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2020: 298-307. DOI: 10.1109/CVPR42600.2020.00038 .

[17]

LECUN YBOSER BDENKER J Set al. Backpropagation applied to handwritten zip code recognition[J]. Neural Computation19891(4): 541-551. DOI: 10.1162/neco.1989.1.4.541 .

[18]

KRIZHEVSKY ANAIR VHINTON G. CIFAR10[EB/OL]. [2023-01-01].

[19]

STALLKAMP JSCHLIPSING MSALMEN Jet al. The German traffic sign recognition benchmark: A multi-class classification competition[C]//The 2011 International Joint Conference on Neural Networks. New York: IEEE Press, 2011: 1453-1460. DOI: 10.1109/IJCNN.2011.6033395 .

[20]

HE K MZHANG X YREN S Qet al. Identity mappings in deep residual networks[C]//European Conference on Computer Vision. Cham: Springer, 2016: 630-645.10.1007/978-3-319-46493-0_38. DOI: 10.1007/978-3-319-46493-0_38 .

[21]

YAO Y SLI H YZHENG H Tet al. Latent backdoor attacks on deep neural networks[C]//Proceedings of the 2019 ACM SIGSAC Conference on Computer and Communications Security. New York: ACM, 2019: 2041-2055. DOI: 10.1145/3319535.3354209 .

[22]

LIU Y QMA S QAAFER Yet al. Trojaning attack on neural networks[C]//Proceedings 2018 Network and Distributed System Security Symposium. 2018: 1-15. DOI: 10.14722/ndss.2018.23291 .

[23]

TRAN BLI JMADRY A. Spectral signatures in backdoor attacks[EB/OL]. 2018arXiv: 1811.00636.

[24]

LIU KDOLAN-GAVITT BGARG S. Fine-pruning: Defending against backdooring attacks on deep neural networks[C]//International Symposium on Research in Attacks, Intrusions, and Defenses. Cham: Springer, 2018: 273-294. DOI: 10.1007/978-3-030-00470-5_13 .

[25]

WANG B LYAO Y SSHAN Set al. Neural cleanse: Identifying and mitigating backdoor attacks in neural networks[C]//2019 IEEE Symposium on Security and Privacy (SP). New York: IEEE Press, 2019: 707-723. DOI: 10.1109/SP.2019.00031 .

[26]

DOAN B GABBASNEJAD ERANASINGHE D C. Februus: Input purification defense against Trojan attacks on deep neural network systems[C]//ACSAC'20: Annual Computer Security Applications Conference. New York: ACM, 2020: 897-912. DOI: 10.1145/3427228.3427264 .

[27]

SELVARAJU R RCOGSWELL M, DAS A, et al. Grad-CAM: Visual explanations from deep networks via gradient-based localization[C]//2017 IEEE International Conference on Computer Vision (ICCV). New York: IEEE Press, 2017: 618-626. DOI: 10.1109/ICCV.2017.74 .

基金资助

国家重点研发计划(2021YFB2700200)

国家自然科学基金(62076187)

国家自然科学基金(62172303)

AI Summary AI Mindmap
PDF (1688KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/