基于蒙特卡洛梯度估计的黑盒神经网络后门检测

刘叶, 叶高含, 刘旦

武汉大学学报(理学版) ›› 2023, Vol. 69 ›› Issue (1) : 8 -18.

PDF (1717KB)
武汉大学学报(理学版) ›› 2023, Vol. 69 ›› Issue (1) : 8 -18. DOI: 10.14188/j.1671-8836.2022.0071
信息安全

基于蒙特卡洛梯度估计的黑盒神经网络后门检测

    刘叶, 叶高含, 刘旦
作者信息 +

Backdoor Detection for Black-Box Deep Neural Networks Based on Monte Carlo Gradient Estimation

    Ye LIU, Gaohan YE, Dan LIU
Author information +
文章历史 +
PDF (1757K)

摘要

现有的后门检测方法研究主要聚焦于白盒场景,然而现实中很难获得对模型的完全访问权限。为此,本文研究了基于蒙特卡洛梯度估计的黑盒神经网络后门检测方法。通过将黑盒场景下后门触发器的逆向视作零阶优化问题,提出了黑盒触发器逆向算法来检测黑盒神经网络是否被植入后门,利用重要性采样结合规范化判断标准和早停策略,进一步提出了快速黑盒后门检测算法以降低黑盒后门检测的开销。在3个流行图像数据集上的实验结果均表明提出的方法能准确区分正常模型与植入后门的模型,且可以得到有效的后门触发器。

Abstract

Existing studies on backdoor detection mainly focus on white-box settings. However, internal information is not always exposed to the security auditors. To bridge this gap, we investigated the black-box backdoor detection based on Monte-Carlo gradient estimation. We propose a black-box trigger reversing method to determine whether a model is infected with a backdoor attack by regarding the black-box trigger reversing problem as a zeroth-order optimization. Furthermore, we propose a fast black-box backdoor detection method to reduce the detection overhead by using the importance sampling technique, a regularized criterion, and an early stopping strategy. Experimental results on three popular image datasets show that the proposed method can accurately distinguish benign and infected models and obtain effective backdoor triggers.

Graphical abstract

引用本文

引用格式 ▾
刘叶, 叶高含, 刘旦. 基于蒙特卡洛梯度估计的黑盒神经网络后门检测[J]. 武汉大学学报(理学版), 2023, 69(1): 8-18 DOI:10.14188/j.1671-8836.2022.0071

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

随着深度学习技术的研究取得巨大进展,深度神经网络(deep neural network,DNN)凭借其卓越的表现和算法通用性越来越广泛地被用于各种不同的任务,如人脸识别[1]、目标检测[2]、自动驾驶[3]、医疗诊断[45]等。尽管深度神经网络技术的应用取得了巨大的成功,其原理仍未被完全探明,深度神经网络的训练和推理过程如同黑箱一般,这为当前和未来的众多人工智能应用埋下了安全隐患。过去5到10年的研究发现神经网络存在大量安全问题,神经网络后门便是其中的一个典型问题[67],它严重阻碍了深度学习模型的传播和共享。

在典型的神经网络后门攻击(backdoor attack)中,攻击者通过数据投毒(data poisoning)的方式,在训练集中加入含有特定图案和错误标签的中毒样本(poisoned data),使训练好的后门模型遇到带有特定图案的输入时输出攻击者指定的标签,同时不影响模型识别正常样本的准确率,其中的特定图案被称为后门触发器(trigger)。这种攻击方式类似于在传统软件中植入恶意代码和后门,被植入后门的模型平时不会表现出异常,只有攻击者主动输入中毒样本才会引发其恶意行为,因此神经网络后门攻击具有较高的隐蔽性。攻击者诱骗普通用户信任一个被植入后门的模型可能会带来严重的后果,例如让一辆在道路上行驶的智能汽车把限速标志识别为停车标志,从而引发交通事故。因此,针对神经网络攻击的防御措施亟待研究。

检测给定的神经网络模型是否被植入后门是神经网络后门防御的重要一环。现有神经网络后门检测的研究主要关注于白盒场景,白盒场景下安全审查人员可以访问模型的所有部分,包括模型的网络结构、权重、梯度。然而实际应用很难满足白盒场景的假设,由于提供模型内部结构和梯度信息可能造成技术和隐私数据的泄露,神经网络模型的拥有者往往只开放对模型的查询权限,白盒假设在很多时候不切实际,需要进一步研究黑盒场景下的神经网络后门检测方法。目前只有少数研究利用元分类器的方法实现了黑盒场景下的后门检测,这类方法使一个神经网络模型的安全性依赖于另一个神经网络模型的判断,存在假阳性和低效率的问题。

本文基于触发器逆向的思路在黑盒场景下检测神经网络模型是否被植入后门。对于给定的模型,如果成功得到有效的后门触发器,将其添加到任意输入上都能使模型输出一个特定类,就可以断定模型被植入了后门。触发器逆向通常被归类为优化问题,已有的触发器逆向方法都需要获取目标模型的梯度,而在黑盒场景下安全审查人员不能访问模型的内部信息,为突破访问条件的限制,本文将黑盒触发器逆向视作零阶优化问题,引入基于均匀采样的蒙特卡洛梯度估计方法,实现不访问梯度的黑盒触发器逆向算法。为进一步减少开销,本文通过重要性采样将均匀分布转换为更适合触发器逆向问题的分布以加快优化算法收敛的速度,结合规范化判断标准和早停策略,无需等待触发器逆向算法完全收敛就能判断神经网络模型是否被植入后门,显著提高了整个检测过程的效率。

1  相关研究

1.1 神经网络后门攻击

2019年,Gu等[6]首次提出了神经网络后门攻击的概念,并且展示了一种基于数据投毒的攻击方法BadNets,图1为这种最典型的神经网络后门攻击方法。攻击者先随机生成一些中毒数据样本,中毒数据样本由正常样本加上特定图案(触发器)得到,其标签被修改为攻击的目标类,将中毒数据样本和正常样本混合作为训练集,训练好的神经网络以高置信度将带有触发器的输入识别为目标类。Liu等[7]提出了不需要访问训练集的攻击方案Trojaning Attack,攻击者选定模型内部的一些神经元,通过最大化这些神经元的激活值生成相应的触发器。最近又有一些后门攻击的方法被提出[8~10],这些攻击方法基于已有的研究,具体的攻击手段存在区别,关注神经网络后门攻击在迁移学习等特定场景下的攻击效果,但最终都会使训练好的后门模型包含类似的特征。

1.2 神经网络后门防御

学者们对防御神经网络后门攻击已做了许多研究。其中,一部分研究围绕异常的输入样本展开,Chou等[11]和Gao等[12]分别提出了在线防御方法SentiNet和STRIP,通过输入样本的鲁棒性来判断其是否为中毒样本,该类方法需要在模型部署后被动等待敌方发起攻击,并且由于推断输入样本的鲁棒性需要对模型发起额外的查询,降低了模型的平均性能。文献[1314]提出了在训练阶段识别训练集中中毒样本的方法,适用于联邦学习(federated learning)场景。对于后门检测问题,Wang等[15]提出了NC(neural cleanse),基于后门触发器逆向的思路,从未知来源的神经网络模型还原出攻击者使用的触发器从而检测该模型是否被植入后门。类似地,Chen等[16]提出了DeepInspect方法,使用生成对抗网络(generative adversarial network,GAN)生成后门触发器以检测后门。此外,Liu等[17]提出了ABS,通过直接检查神经元的异常激活值来检测后门。上述后门检测方法均基于白盒访问条件,无法处理黑盒后门检测的问题。

黑盒后门检测方案的匮乏得到了部分研究者的关注,Xu等[18]和Kolouri等[19]分别独立地提出了两个基于元分类器的方案Meta Neural Trojan Detection(MNTD)和Universal Litmus Patterns(ULP)。基于元分类器的方案要求安全审查者提供可观的计算资源,提前训练许多正常模型和后门模型,然后再训练一个元分类器模型判断待检测模型是否含有后门,其输入为待检测模型或提取的待检测模型的特征。基于元分类器的方案可以达到较高的检测准确率,但由于元分类器模型本身就是一个神经网络,它可能受到对抗样本攻击[20],而且神经网络的可解释性差,使得它没有办法对最终输出做出任何解释,检测结果存在假阳性的可能性,一旦元分类器的判断结果出错,安全审查者缺乏其他可用方法来校验检测的结果。本文基于触发器逆向的思路提出了一种新的黑盒后门检测方法,提供逆向得到的触发器来帮助安全审查者验证检测结果。

2  黑盒后门检测方法

2.1 防御目标

记神经网络模型的输入空间为𝒳Rd,输出空间为𝒴RK,给定任意正常输入样本x𝒳,形式化定义添加后门触发器的操作A

x˜=A(x,Δ,m)=mΔ+(1-m)x

其中,x˜为添加触发器后的中毒样本,ΔRd表示后门触发器样式,与原始输入样本x形状相同,m{0,1}d表示触发器掩码,决定触发器覆盖原始图像的范围,表示哈达玛积(逐项积)。

本文考虑两个防御目标。给定一个神经网络模型f:𝒳𝒴和一个目标类t,第一个防御目标是给出二元判断,Φ(f,t)=1表示模型被植入后门,Φ(f,t)=0表示模型未被植入后门;第二个防御目标是在Φ(f,t)=1的情况下,给出有效的后门触发器Δ及其掩码m,使任意合法的输入样本x𝒳经过变换得到的中毒样本被识别为目标类,即f(x˜)=f(A(x,Δ,m))=t,以证明模型存在后门。

2.2 黑盒触发器逆向

受白盒方法NC[8]的启发,本文基于后门触发器逆向的思路检测神经网络模型是否被植入后门,将黑盒触发器逆向归类为零阶优化问题,通过引入基于蒙特卡洛采样的梯度估计方法进行优化。

对比分析正常模型和后门模型发现:对于正常模型,修改某一个类的输入样本使输出变为另一个类的标签,需要对输入样本进行较大的修改,而在植入后门的模型中,所有类的样本周围都有目标类的识别区域,只需要对输入做较小的修改(添加触发器)就可以将输出结果变为目标类。于是后门触发器逆向可以被表述为具有两个目标的优化问题,第一个目标为让任意输入添加触发器后被待检测模型误分类为某个目标类,第二个目标是最小化触发器掩码mL1范数,即让触发器的尺寸尽可能小,损失函数为

F(x,Δ,m)=(f(A(x,Δ,m),t))+λm1

其中,(·)是交叉熵损失函数,m1mL1范数,λ是权衡两个优化目标的参数。优化目标为最小化损失函数F以得到触发器Δ和掩码m

minΔ,mF(x,Δ,m)  for  x𝒳

在白盒方法中可以基于链式求导法则得到损失函数FΔm的梯度,而黑盒场景下检测者只能访问神经网络f()的输出值,无法访问其内部权重,因此也无法直接计算损失函数FΔm的梯度。本文通过蒙特卡洛方法采样随机扰动以估计FΔ的梯度:

ΔF^=Ee~p(e)F(x,Δ+δe,m)-F(x,Δ,m)δe=p(e)F(x,Δ+δe,m)-F(x,Δ,m)δede1Bi=1BF(x,Δ+δei,m)-F(x,Δ,m)δei

其中,ei服从预先指定的均值为0、协方差矩阵为单位矩阵的随机分布,控制随机扰动的方向;δ是一个很小的正数,控制扰动的大小;B为采样次数。利用泰勒公式易证,当δ0+时,上式为ΔF的渐进无偏估计,即limBΔF^=ΔF。类似地,以用同样的方式估计Fm的梯度

mF^1Bi=1BF(x,Δ,m+δei)-F(x,Δ,m)δei

获得梯度后,用Adam[21]优化器进行优化,最后根据优化得到触发器的尺寸来判断模型是否被植入后门,完整的黑盒触发器逆向算法描述如算法1

文献[8]已经验证了白盒触发器逆向方法的有效性,所以算法1的有效性主要取决于梯度估计的误差是否会对优化过程造成影响。而随机梯度下降(stochastic gradient descent,SGD)和Adam等一阶优化算法的广泛实践已经证明了只要梯度的期望正确,梯度中的噪声反而有助于避免损失函数逃离鞍点和局部最低点,提升泛化性能,最终达到比较好的拟合效果,文献[22]和文献[23]详细分析了其原理。此外,零阶优化方法的收敛性也已经在关于优化方法的研究[2425]和关于对抗样本攻击的实验[2627]中得到验证。本文主要通过实验测试算法1的效果。

2.3 快速黑盒后门检测

2.3.1 重要性采样

上一节提出的黑盒触发器逆向算法在理论上已经可以实现黑盒后门检测,但考虑到估计梯度时需要多次查询目标模型,本文希望进一步提高算法的效率。(4)式和(5)式要求扰动ei服从预先指定的均值为0、协方差矩阵为单位矩阵的随机分布,符合要求的分布在输入的所有维度上都是对称的,然而考虑到后门触发器只占据输入的极少部分维度,如果能优先对这些维度优先采样就可以提高优化算法收敛的速度。

为了更容易控制采样的维度,令随机采样的ei满足如下的离散型概率分布

p(e=ni+)=p(e=ni-)=12d

其中,ni+Rd(1id)表示第i维为1,其他维度为0的向量,ni-Rd(1id)表示第i维为-1,其他维度为0的向量。通过引入重要性采样将均匀分布p(e)转换成非均匀分布π(e)而不影响估计的无偏性,具体计算公式为

ΔF^=p(e)F(x,Δ+δe,m)-F(x,Δ,m)δede=π(e)p(e)π(e)F(x,Δ+δe,m)-F(x,Δ,m)δede1Bi=1Bp(ei)π(ei)F(x,Δ+δei,m)-F(x,Δ,m)δei

估计Fm的梯度时,也采用同样的方式处理:

mF^1Bi=1Bp(ei)π(ei)F(x,Δ,m+δei)-F(x,Δ,m)δei

本文提出了一个启发式的策略在触发器逆向过程中动态调整π(e),优先采样触发器可能存在的位置。初始的触发器掩码m的所有维度都为随机值,随着算法执行,触发器掩码的L1范数逐渐减小,其各维度的值开始出现差异。触发器出现在m值大的维度的概率高于m值小的维度的概率,因此可以按照m值更新π(e),即每次执行梯度下降后令π(e)=mm1

2.3.2 规范化判断标准和早停策略

黑盒触发器逆向方法的另一个缺陷是需要根据攻击成功率调整λ的值,否则最终可能得到一个攻击成功率很低的无效触发器,但如果过于频繁地调整λ,又会导致损失函数不断振荡,减慢触发器逆向算法的收敛速度。为了快速检测目标模型是否被植入后门,本文将λ设为定值,相对地,本文定义了触发器的规范化尺寸分数

H=m1/asr

通过触发器的规范化尺寸分数H而不是m1判断待检测神经网络模型是否被植入后门。其中asr为触发器在一次迭代中的攻击成功率。H结合了触发器的攻击成功率和触发器掩码的L1范数,如果触发器的攻击成功率较低,即使触发器掩码的L1范数较小,依(9)式计算得到的规范化尺寸分数H也是一个较大值,不会误判模型被植入了后门。

此外,为了进一步减少黑盒后门检测的开销,在快速黑盒后门检测方法中应用早停策略,在触发器逆向过程中持续监控规范化尺寸分数H,如果规范化尺寸分数H小于一定值,就提前判断待检测模型被植入后门。

将重要性采样方法、规范化判断标准和早停策略植入到黑盒触发器逆向过程中形成快速黑盒神经网络后门检测算法。完整的快速黑盒神经网络后门检测算法描述如算法2

快速黑盒后门检测方法只输出检测的结果,无法得到可以添加到数据集样本上形成有效中毒样本的后门触发器,不具有较强的说服力,其主要优势在于大幅度节省了开销,适合于前期的快速筛选。对于快速后门检测判断存在后门的模型,再继续执行黑盒触发器逆向算法逆向出有效的后门触发器,确认模型被植入后门,图2展示了两个算法结合使用的过程。

3  实验评估

3.1 实验环境和数据集

本文的所有实验在 Ubuntu 平台上采用 Python 语言实现,实验机器的处理器为 Intel(R) Xeon(R) Gold 5117 CPU@ 2.00 GHz,处理器核心数为 32,运行内存为120 GB,GPU 为 Nvidia GeForce RTX 2080,操作系统版本为64位 Ubuntu 18.04.5 LTS,使用Facebook的人工智能研究团队开发的PyTorch机器学习库构建图像分类模型,对提出的黑盒神经网络后门检测方法进行实现与测试。

本文使用的图像数据来自3个常用的公开图像数据集,分别为MNIST‍‍[28]、CIFAR-10[29]和GTSRB‍‍[30]。MNIST是著名的手写数字识别数据集,有阿拉伯数字0到9共10个类,训练集包含60 000张单通道图片,测试集包含10 000张单通道图片,每张图片的大小为28×28。CIFAR-10数据集包含60 000张32×32的彩色图片,均为常见动物或交通工具,其中训练集包含50 000张图片,测试集包含10 000张图片,共10个类。GTSRB为德国交通标志牌数据集,其中的图片一共分为43类,均为在道路上实拍的交通标志牌,而正确识别交通标志牌是自动驾驶任务一个关键部分,GTSRB数据集的训练集包含39 209张彩色图片,测试集包含12 630张彩色图片。

3.2 攻击方法

本文实现了BadNets[6]后门攻击方法,在3个数据集上分别训练图像分类模型作为待检测模型以测试提出的黑盒后门检测方法的性能。对于MNIST数据集,由于其中的图片包含的关键特征不多,本文使用一个相对较浅的神经网络模型,其网络结构包含2个卷积层和2个全连接层。对于CIFAR-10和GTSRB数据集,本文使用深度残差网络ResNet[31]来训练待检测模型,深度残差网络的特点为在网络中插入了跳层连接避免梯度爆炸和梯度消失现象,使整个深度神经网络的训练变得更容易拟合,因其卓越的性能而成为了当前最流行的卷积神经网络的基础结构。本文采用了文献[31]中介绍的ResNet-18结构,该网络的浮点计算次数达到1.8×109,其表达能力适合在CIFAR-10和GTSRB两个图像数据集上的分类任务。

为了防止样本数不足使结果具有偶然性,在每个数据集上都训练了200个模型,其中既包含被植入后门的模型,也包含正常模型。对于每个数据集,本文训练50个正常模型和150个被植入后门的模型,后门触发器有3种不同的尺寸,分别为边长1、2、3的正方形,触发器随机分布在图片上所有位置。将训练集中中毒样本的比例设为0.01,对于MNIST和CIFAR-10,后门模型的训练集中包含50 000个正常样本和500个中毒样本;对于GTSRB,后门模型中包含39 209个正常样本和392个中毒样本。表1展示了600个待检测模型的分类准确率和后门攻击的成功率(取平均值)。在3个数据集上,被植入后门的模型识别正常样本的准确率相比于正常模型无明显差别,而攻击成功率(识别中毒样本为后门攻击的目标类的比例)均超过97%,大部分情况下非常接近100%。

3.3 黑盒触发器逆向方法的效果

黑盒触发器逆向方法有两个防御目标,分别为判断模型是否被植入后门和给出有效的后门触发器。本文首先查看逆向算法在不同数据集的模型上逆向得到的触发器,与原始触发器进行比较,图3展示了这一结果,其中左侧第一列为逆向正常模型得到的触发器,其图案散乱分布在整个输入空间上,没有明显规律,且L1范数较大;第二列为在后门模型上逆向得到的触发器,其图案只出现在非常小的区域内,L1范数明显小于正常模型;第三列是攻击者使用的原始触发器,比较原始触发器和实验中逆向的触发器可以发现它们的形状、大小、颜色接近,但位置不完全相同,且逆向的触发器加到正常图片上也能成功发起攻击,这是因为图像分类模型中的卷积层和池化层可以捕捉到图像中不同位置的特征,所以对输入的后门触发器的位置不敏感。

本文在训练的模型上进行了大规模实验,测试基于黑盒触发器逆向的后门检测方法能否达到两个防御目标。以白盒触发器逆向方法NC[8]作为基准方法进行比较,在实验中NC方法通过链式法则反向传播计算输入的梯度,而黑盒触发器逆向方法只能访问神经网络的输出值。两种方法都只允许访问测试集而不能访问模型的原始训练集。考虑到黑盒方法的效率低于白盒,为了限制黑盒触发器逆向方法的开销,令黑盒触发器逆向方法只优化5轮,而NC方法优化到收敛为止,在本文的实验环境中两种方法的耗时接近。

图4展示了逆向得到触发器的L1范数的分布情况。在正常模型和后门模型上逆向得到的触发器的L1范数分布存在明显区别,且基本没有重合,因此利用逆向的触发器能准确地区分开正常模型和后门模型。

采用检测准确率和AUROC(the area under receiver operating curve)常用于分类任务中的指标来评估最终的检测结果。检测准确率只考虑检测正确的样本占所选样本集合的比例,而AUROC综合考虑正类样本和负类样本被区分开的程度,最理想的情况下这两个指标都达到最大值1.0。表2展示了最终的检测结果,白盒方法NC在3个数据集上的检测准确率达到了100%,AUROC值达到1.0,而黑盒触发器逆向方法在MNIST和GTSRB数据集上的检测准确率达到了100%,AUROC值达到1.0,在CIFAR-10数据集上出现了少量错误,检测准确率和AUROC值分别为99.5%和0.996。这个结果说明基于黑盒触发器逆向的后门检测方法具有非常好的分类性能,接近于白盒方法,达成了判断模型是否被植入后门的防御目标。

此外,尽管检测过程中黑盒触发器逆向方法没有将触发器逆向到完全收敛,只迭代了5轮数据集,但仍然能生成有效的后门触发器。表3展示了NC和黑盒触发器逆向方法得到触发器的攻击成功率。在MNIST上黑盒逆向方法得到触发器的攻击成功率大于99%,在CIFAR-10和GTSRB上黑盒后门检测方法逆向得到触发器的攻击成功率高于97%,也就是说几乎所有的图片样本添加逆向得到的触发器之后都会被识别为目标类。虽然攻击成功率略低于白盒方法,但也足以证明模型中存在后门,黑盒触发器逆向方法达成了确认后门存在的防御目标。

3.4 快速黑盒后门检测方法的效果

快速黑盒后门检测方法只需要判断输入模型是否被植入后门,实验重点分析重要性采样能否加快黑盒触发器逆向算法的收敛速度,以及利用规范化判断标准区分正常模型和后门模型的效果。图5展示了使用均匀采样和重要性采样时黑盒触发器逆向算法的收敛速度,结果显示使用重要性采样时能更快得到有效的后门触发器。

快速黑盒后门检测算法开始执行后,每从数据集采样一批数据都检查一次触发器的规范化尺寸分数H是否小于指定的阈值。前期的小规模测试发现在抽取的正常模型上检测不到较小的H,而后门模型都能在一轮对数据集的完整迭代以内被检测到较小的H。因此本文考虑以迭代一轮数据集为界限,认为在快速黑盒后门检测算法完整迭代一轮数据集期间被检测到出现较小规范化触发器尺寸分数的模型是含有后门的,反之则认为是正常模型,在此设置下对所有模型进行检测。图6展示了在后门模型上检测到较小的规范化触发器尺寸分数时已迭代样本数的分布情况,纵轴的频率代表对应区间的模型数占总模型数的比例,其中所有迭代一轮时还未被检测到较小规范化触发器尺寸分数的模型所在柱被标为紫色。大部分后门模型都在一轮迭代以内被检测出了较小的规范化触发器尺寸分数,证明规范化触发器尺寸分数与后门攻击确实存在非常强的关联,可被用于后门检测。

表4展示了快速黑盒后门检测方法以一轮迭代为界限的AUROC值检测等结果。与表2中黑盒触发器逆向方法相比,快速黑盒后门检测方法判断后门模型的准确率仍然很高,而判断正常模型准确率有所下降。本文的方案优先保证了判断后门模型的准确率,因为将正常模型识别为后门模型不会带来严重的后果,还需要继续通过黑盒触发器逆向算法逆向出有效的触发器才能确认模型被植入了后门,而对正常模型98%的检测准确率意味着快速黑盒后门检测方法仍然可以快速筛选出大部分正常模型,节约整个检测过程的开销。在本文的实验环境下,黑盒触发器逆向方法对所有10个类优化5轮需要约105 min,而快速黑盒后门检测方法最多只用优化1轮,需要约21 min,节省了约80%的计算开销。

3.5 与两种元分类器方法的效果对比

为了进一步展示本文提出的黑盒触发器逆向方法和快速检测方法的效果,将这两种方法与两种元分类器方法进行了对比,表5中MNTD[18]和ULP[19]方法的数据测试了与本文相同的攻击方法与数据集,其他实验设置与本文不完全相同,但仍然能发现本文提出的两个方法和两种元分类器方法的分类性能没有明显差距。同时,本文通过逆向得到了有效的触发器,可用于进一步分析检测的结果,而两种元分类器方法只能输出分类结果。

综上所述,本节通过在3个数据集上的实验评估分析,验证了本文提出的黑盒触发器逆向方法和快速黑盒检测方法的有效性,两种方法结合能以较高的效率和准确率在黑盒场景下审查深度神经网络模型是否含被植入后门。

4  结 语

神经网络后门攻击的发现给深度学习技术的应用带来了很大的风险,本文研究了黑盒场景下的神经网络后门检测方法,首先通过基于蒙特卡洛采样的梯度估计技术实现了黑盒触发器逆向算法,然后又引入重要性采样,结合规范化判断标准和早停策略实现了快速黑盒后门检测方法,两种方法结合使用可以高效准确地检测模型是否被植入后门。本文对提出的方法进行了详细的论述,并在3个流行数据集的600个图像分类模型上测试了提出方法的效果。结果显示两种方法的检测准确率都不低于98%,并且黑盒触发器逆向算法成功还原出了发起后门攻击的触发器,可作为证明模型遭受后门攻击的有力证据。

本文没有考虑最新提出的一些能绕过后门检测方法的隐蔽攻击方法,目前对此类攻击方法的防御研究均在白盒场景下进行,未来的研究工作可以考虑借鉴这些研究工作,实现黑盒场景下的抗隐蔽后门的检测方法。本文没有考虑可用数据集与原始训练数据集的分布存在较大差异的情况,未来可以考虑使用替代数据集结合数据增强的方法来逆向后门触发器,在更严苛的条件下实现神经网络后门检测。此外,目前神经网络后门的研究主要在图像识别任务上展开,未来可以针对语音识别等更复杂的任务进行研究。

参考文献

[1]

WANG MDENG W H. Deep face recognition: A survey [J]. Neurocomputing2021429: 215-244. DOI:10.1016/j.neucom.2020.10.081 .

[2]

LIU LOUYANG W LWANG X Get al. Deep learning for generic object detection: A survey [J]. International Journal of Computer Vision2020128(2): 261-318. DOI:10.1007/s11263-019-01247-4 .

[3]

GRIGORESCU STRASNEA BCOCIAS Tet al. A survey of deep learning techniques for autonomous driving[J]. Journal of Field Robotics202037(3): 362-386. DOI:10.1002/rob.21918 .

[4]

SHEN D GWU G RSUK H I. Deep learning in medical image analysis [J]. Annual Review of Biomedical Engineering201719: 221-248. DOI:10.1146/annurev-bioeng-071516-044442 .

[5]

HASKINS GKRUGER UYAN P K. Deep learning in medical image registration: A survey [J]. Machine Vision and Applications202031(1/2): 1-18. DOI:10.1007/s00138-020-01060-x .

[6]

GU T YLIU KDOLAN-GAVITT Bet al. BadNets: Evaluating backdooring attacks on deep neural networks [J]. IEEE Access20197: 47230-47244. DOI:10.1109/ACCESS.2019.2909068 .

[7]

LIU Y QMA S QAAFER Yet al. Trojaning attack on neural networks [C]//Proceedings 2018 Network and Distributed System Security Symposium. Reston: Internet Society, 2018:3A5. DOI:10.14722/ndss.2018.23291 .

[8]

SAHA ASUBRAMANYA APIRSIAVASH H. Hidden trigger backdoor attacks [J]. Proceedings of the AAAI Conference on Artificial Intelligence202034(7): 11957-11965. DOI:10.1609/aaai.v34i07.6871 .

[9]

TURNER ATSIPRAS DMADRY A. Label-consistent backdoor attacks [EB/OL]. [2019-12-06].

[10]

YAO Y SLI H YZHENG H Tet al. Latent backdoor attacks on deep neural networks[C]//Proceedings of the 2019 ACM SIGSAC Conference on Computer and Communications Security. New York: ACM, 2019: 2041-2055. DOI:10.1145/3319535.3354209 .

[11]

CHOU ETRAMÈR FPELLEGRINO G. SentiNet: detecting localized universal attacks against deep learning systems [C]//2020 IEEE Security and Privacy Workshops. New York: IEEE Press, 2020: 48-54. DOI:10.1109/SPW50608.2020.00025 .

[12]

GAO Y SXU C GWANG D Ret al. STRIP: A defence against Trojan attacks on deep neural networks[C]//Proceedings of the 35th Annual Computer Security Applications Conference. New York: ACM, 2019: 113-125. DOI:10.1145/3359789.3359790 .

[13]

TRAN BLI JMADRY A. Spectral signatures in backdoor attacks [C]//Proceedings of Advances in Neural Information Processing Systems 31: Annual Conference on Neural Information Processing Systems 2018. Montréal: MIT Press. 2018: 8011-8021.

[14]

YAO Y SLI H YZHENG H Tet al. Latent backdoor attacks on deep neural networks [EB/OL].[2019-01-20]. DOI: 10.1145/3319535.3354209 .

[15]

WANG B LYAO Y SSHAN Set al. Neural cleanse: Identifying and mitigating backdoor attacks in neural networks[C]//2019 IEEE Symposium on Security and Privacy. New York: IEEE Press, 2019: 707-723. DOI:10.1109/SP.2019.00031 .

[16]

CHEN H LFU CZHAO J Set al. DeepInspect: A black-box Trojan detection and mitigation framework for deep neural networks [C]//Proceedings of the 28th International Joint Conference on Artificial Intelligence. New York: ACM, 2019: 4658-4664. DOI:10.24963/ijcai.2019/647 .

[17]

LIU Y QLEE W CTAO G Het al. ABS: scanning neural networks for back-doors by artificial brain stimulation [C]//Proceedings of the 2019 ACM SIGSAC Conference on Computer and Communications Security. New York: ACM, 2019: 1265-1282. DOI:10.1145/3319535.3363216 .

[18]

XU X JWANG QLI H Cet al. Detecting AI Trojans using meta neural analysis[C]//2021 IEEE Symposium on Security and Privacy. New York: IEEE Press, 2021: 103-120. DOI:10.1109/SP40001.2021.00034 .

[19]

KOLOURI SSAHA APIRSIAVASH Het al. Universal litmus patterns: Revealing backdoor attacks in CNNs [C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2020: 298-307. DOI:10.1109/CVPR42600.2020.00038 .

[20]

SZEGEDY CZAREMBA WSUTSKEVER Iet al. Intriguing Properties of Neural Networks [DB/OL]. [2021-02-20].

[21]

KINGMA D PBA J L. Adam: A Method for Stochastic Optimization [DB/OL].[2021-02-20].

[22]

BOTTOU LCURTIS F ENOCEDAL J. Optimization methods for large-scale machine learning [J]. SIAM Review201860(2): 223-311. DOI:10.1137/16m1080173 .

[23]

GE RHUANG F RJIN Cet al. Escaping from Saddle Points — Online Stochastic Gradient for Tensor Decomposition [EB/OL]. 2015arXiv: 1503.02101.

[24]

GHADIMI SLAN G H. Stochastic first- and zeroth-order methods for nonconvex stochastic programming [J]. SIAM Journal on Optimization201323(4): 2341-2368. DOI: 10.1137/120880811 .

[25]

NESTEROV YSPOKOINY V. Random gradient-free minimization of convex functions [J]. Foundations of Computational Mathematics201717(2): 527-566. DOI:10.1007/s10208-015-9296-2 .

[26]

CHEN P YZHANG HSHARMA Yet al. ZOO: Zeroth order optimization based black-box attacks to deep neural networks without training substitute models [C]// Proceedings of the 10th ACM Workshop on Artificial Intelligence and Security. New York:Association for Computing Machinery, 2017: 15-26. DOI:10.1145/3128572.3140448 .

[27]

CHEN J BJORDAN M IWAINWRIGHT M J. HopSkipJumpAttack: A query-efficient decision-based attack[C]//2020 IEEE Symposium on Security and Privacy. New York: IEEE Press, 2020: 1277-1294. DOI:10.1109/SP40000.2020.00045 .

[28]

LECUN YBOTTOU LBENGIO Yet al. Gradient-based learning applied to document recognition [J]. Proceedings of the IEEE199886(11): 2278-2324. DOI:10.1109/5.726791 .

[29]

KRIZHEVSKY A. Learning Multiple Layers of Features from Tiny Images [EB/OL].[2022-04-01]. DOI: 10.1016/j.tics.2007.09.004 .

[30]

HOUBEN SSTALLKAMP JSALMEN Jet al. Detection of traffic signs in real-world images: The German traffic sign detection benchmark[C]//The 2013 International Joint Conference on Neural Networks (IJCNN). New York: IEEE Press, 2013: 1-8. DOI:10.1109/IJCNN.2013.6706807 .

[31]

HE K MZHANG X YREN S Qet al. Deep residual learning for image recognition[C]//2016 IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2016: 770-778. DOI:10.1109/CVPR.2016.90 .

AI Summary AI Mindmap
PDF (1717KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/