TextLeak:基于决策的单词级黑盒文本对抗攻击方法

胡晓雪 ,  占一可

武汉大学学报(理学版) ›› 2024, Vol. 70 ›› Issue (4) : 431 -440.

PDF (1094KB)
武汉大学学报(理学版) ›› 2024, Vol. 70 ›› Issue (4) : 431 -440. DOI: 10.14188/j.1671-8836.2023.0031
网络空间安全

TextLeak:基于决策的单词级黑盒文本对抗攻击方法

作者信息 +

TextLeak: Decision-Based Word-Level Black-Box Text Adversarial Attack Method

Author information +
文章历史 +
PDF (1119K)

摘要

现有的基于决策的黑盒文本对抗攻击方案无法兼顾攻击效果和攻击效率,因此,提出了一种简单而高效的基于决策的单词级黑盒文本对抗攻击方法TextLeak。该方法的核心思想是通过多级搜索的方式寻找最小扰动以生成对抗样本,即先通过粗粒度搜索确定目标区域,然后基于该目标区域通过细粒度搜索找到最优解作为对抗样本。以攻击成功率、扰动率以及查询次数为主要评估指标,在相同的数据集和模型下,选取了三个目前效果最好的基于决策的黑盒文本对抗攻击作为基线方法进行实验对比。实验结果表明,TextLeak在文本分类任务上平均查询次数约为368次,平均攻击成功率约为96.0%,与基于种群的方法(Population-Based Optimization Algorithm, POA)相比,在攻击成功率相当的情况下,TextLeak的平均查询次数约为POA的5.25%。这表明TextLeak具有高攻击成功率和高查询效率,是一种简单、高效且实用的文本对抗攻击方法,具有广泛的应用前景。

Abstract

Existing decision-based black-box text adversarial attack methods cannot balance attack effectiveness and efficiency. Therefore, a simple and efficient decision-based word-level black-box text adversarial attack method called TextLeak is proposed. The fundamental concept of this method involes searching for the minimum perturbation required to generate adversarial examples through a multi-level search. Specifically, it begins with a coarse-grained search to identify the target area. Then, it uses fine-grained search based on this target area to find the optimal solution as the adversarial example. The main evaluation metrics are attack success rate, perturbed rate, and query number. Three state-of-the-art decision-based black-box text adversarial attacks are selected as baseline methods for experimental comparison on the same dataset and model. The experimental results show that TextLeak has an average query number of about 368 times and an average attack success rate of about 96.0% on text classification tasks. Compared with the population-based optimization algorithm(POA), TextLeak has an average query number of about 5.25% of POA while maintaining a comparable attack success rate. This demonstrates that TextLeak has a high attack success rate and query efficiency, and it is a simple, efficient, and practical text adversarial attack method with broad application prospects.

Graphical abstract

关键词

自然语言处理 / 对抗攻击 / 黑盒攻击

Key words

natural language processing / adversarial attacks / black-box attacks

引用本文

引用格式 ▾
胡晓雪,占一可. TextLeak:基于决策的单词级黑盒文本对抗攻击方法[J]. 武汉大学学报(理学版), 2024, 70(4): 431-440 DOI:10.14188/j.1671-8836.2023.0031

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

深度神经网络(Deep Neural Network, DNN)在图像分类[1]、语音识别[2]和自然语言处理[3](Natural Language Processing, NLP)等各种具有挑战性的领域取得了显著的成就。同时,DNN的安全性也受到了广大研究者的关注。Szegedy[4]首次提出DNN容易受到对抗攻击,这给基于深度神经网络的应用带来了巨大的挑战和威胁。对抗攻击是指攻击者对模型的输入添加精心构造的扰动,以便经过修改的输入能够轻易地欺骗深度学习模型,导致模型产生错误的输出结果。其中,文本对抗攻击由于文本模型独特的离散性质,给研究者带来了巨大的挑战。

文本对抗攻击根据攻击者获得目标模型的多少,可以分为白盒文本对抗攻击和黑盒文本对抗攻击。其中,白盒文本对抗攻击需要攻击者掌握完整的目标模型的内部信息,包括模型架构和参数等;而黑盒文本对抗攻击,攻击者不能获得模型的内部信息,但可以通过发送查询来探测目标模型的输出结果。黑盒文本对抗攻击根据返回的输出结果的类型可以细分为基于分数的黑盒文本对抗攻击和基于决策的黑盒文本对抗攻击两类。从应用的角度来看,基于决策的黑盒文本对抗攻击比基于分数的黑盒文本对抗攻击更实用,因为它仅依赖于最终决策,而大多数商业文本服务仅为用户提供决策输出,这使得攻击者掌握的信息有限,更难发起攻击。在实际场景中,在有限的查询次数内进行黑盒文本对抗攻击十分重要。因为攻击者无法无限次查询目标模型;同时,减少查询次数不仅可以大大节省时间和成本、提高攻击效率,而且更具隐蔽性。此外,需要大量查询的攻击将受限于大规模应用,例如,商业系统会出于安全考虑部署入侵检测系统。因此,设计查询效率高的黑盒文本对抗攻击具有重要的现实意义。

本文在基于决策的黑盒设置下提出了一种简单而高效的单词级文本对抗攻击TextLeak,在只利用模型最终决策输出的情况下使用有限的查询次数构建对抗样本。具体来说,TextLeak通过快速添加大量扰动找到初始对抗样本,然后通过回溯扰动词降低扰动率,并通过多级搜索减少查询次数。本文的主要贡献如下:

1) 提出了一种简单而有效的攻击TextLeak,在基于决策的黑盒设置中生成语法正确的对抗样本。由于大多数商业系统通过查询仅返回基于决策的结果,因此基于决策的黑盒设置可以确保TextLeak应用于几乎任何商业NLP系统。

2) 设计了一种多级搜索的方法寻找最优解。多级搜索指的是先通过粗粒度搜索得到合适的目标区域,然后通过细粒度搜索得到合适的解。该方法极大地优化了搜索空间,减少了对目标模型的查询次数,提高了攻击效率。

1  相关工作

早期对抗攻击相关的工作主要集中在白盒设置下,攻击者可以获取模型的架构、参数和梯度等信息,这些信息可用于进行连续的优化。Papernot等[5]最早在白盒设置下攻击文本分类模型,虽然他们的攻击能够欺骗分类模型,但由于未对语义进行约束,单词级别的变化显著影响了文本的原始含义;随后,Ebrahimi等[6]提出了文本分类的白盒对抗样本(HotFlip),该方法使用方向导数查找最有可能影响分类结果的有效位,通过字符级修改生成对抗样本,但这种方法容易产生拼写错误;2022年Wang等[7]提出了基于单词级修改的白盒文本对抗攻击SemAttack,该方法生成的上下文扰动不需要借助外部的知识,且可以适用不同的语言,是一种统一的对抗攻击框架。虽然,白盒文本对抗攻击已经获得了接近100%的攻击成功率,但是其在实际应用中并不适用,因为服务提供商往往只提供一个接口供用户进行查询,攻击者无法获取服务提供商使用的模型的参数信息。因此,黑盒文本对抗攻击受到了更多的关注。在黑盒设置下,攻击者只能通过接口输入信息,然后获取模型返回的输出结果。图1展示了深度学习模型在进行文本分类的过程中,攻击者在三种不同的场景下可访问的目标模型组件。由图1可知,基于分数的黑盒文本对抗攻击场景下攻击者可以获得模型的概率输出和决策输出,而基于决策的黑盒文本对抗攻击场景下攻击者仅能获得决策输出。

1.1 基于分数的黑盒文本对抗攻击

在基于分数的黑盒设置下,攻击者可以获取输入文本在不同类别下的预测得分。因此常用的攻击策略为贪婪算法,大多数方案通过找到对模型预测得分影响很大的重要单词,然后使用单词替换生成对抗样本。例如,Alzantot等[8]提出了一种基于种群的遗传算法,使用目标模型的预测概率作为适应度函数;文献[9]中提出的TextFooler通过删除单词后预测概率的变化进行重要度排序;概率加权单词显著性(Probability Weighted Word Saliency,PWWS)方法[10]利用改进的显著性分数选择候选词;文献[11]中提出的TextBugger 首先通过找到文本中最重要的句子,然后使用一个评分函数确定这些句子中的关键词。Lee等[12]在贝叶斯优化中使用自动相关确定(Automatic Relevance Determination,ARD)分类核动态计算文本中的重要位置。这些基于分数的黑盒文本攻击可以通过查询模型返回的预测分数的变化对单词进行重要度排序,攻击者掌握的信息越丰富,越容易发起对抗攻击。

然而,攻击者并不总是能获取到模型输出的预测分数信息,例如机器翻译任务中模型输出为文本序列,所以基于分数的黑盒文本攻击方法的应用场景有限。此外,这些对文本中单词重要度排序的方法无法直接应用到基于决策的黑盒文本攻击中,例如,二分类模型决策输出的变化仅为0和1,分别表示输出类别无变化和有变化,此时,多个单词的变化可能相同,无法用于排序。

1.2 基于决策的黑盒文本对抗攻击

在基于决策的黑盒设置下,攻击者仅能获取模型输出的决策结果,例如情感分析中的“正向”和“负向”。以二分类模型为例,在模型进行输出时,基于分数的黑盒设置下,攻击者得到的信息可能是分类为0的概率为0.323,分类为1的概率为0.677,而基于决策的黑盒设置下,攻击者仅能获取模型输出为0或者1。从信息熵的角度可知,基于决策的黑盒设置下攻击者所能获取的信息更少,成功发起攻击更困难。Zhao等[13]是首个提出黑盒设置下文本对抗攻击的学者,他们使用生成对抗网络生成自然对抗样本。然而,生成对抗网络很难训练,并且需要关于训练数据集的信息,因此Maheshwary等[14]提出了基于种群的优化算法(Population-based Optimization Algorithm,POA)进行迭代生成对抗样本,这种方法需要对模型进行大量的查询才能收敛(约7 000次)。现实商业系统往往对查询次数进行了限制,例如Paralleldots限制用户每天查询次数的上限为6 000次,每分钟上限为60次。因此,Saxena[15]提出了TextDecepter系统,该方法针对二分类模型设计了基于单词重要度排序和同义词替换的攻击,但是其平均攻击成功率仅为60%。此后,基于梯度的优化方法LeapAttack[16]被提出,虽然这种方法在平均攻击成功率上有较大的提升,但由于在梯度估计时引入了随机性,该方法的查询次数较高。因此,目前基于决策的黑盒文本对抗攻击查询次数较高,难以满足高效率的需求。

2  TextLeak算法

2.1 问题定义

给定一个预训练的自然语言处理模型,其推理过程描述为F:XY,其中,X表示输入空间,Y表示输出空间。给定一个原始样本xX,其对应的真实标签为yYF(x)=y。攻击者的目标是获得被误分类的对抗样本xadvδ为添加在原始样本x上的微小扰动,对抗样本的定义为:

xadv=x+δ,s.t. F(xadv)y

优化过程为:

minPxadv,x,s.t. Fxadvy,Dxadv,xϵ

其中,Dxadv,x表示对抗样本和原始样本之间的距离;ϵ表示对抗样本与原始样本之间的预设距离,ϵ用来约束Dxadv,x的参数;P(xadv,x)表示xadvx的基础上修改的单词数的比例,其计算公式如下:

Pxadv,x=x-xxadvx

其中,x表示原始样本x中包含的单词数量;xxadv表示原始样本x和对抗样本xadv相同单词的数量。

在图像领域,扰动是指对一个或者多个像素值进行修改,通常使用Lp范数度量对抗样本和原始样本之间的距离,p0,1,2;而在文本领域,扰动通常是基于字符或者单词,这容易使文本的语义发生极大的改变,例如“yes”改成“no”。因此,文本对抗样本比图像对抗样本增加了一个要求:对抗样本与原始样本的语义保持一致性,即保持较高的语义相似度的情况下使模型识别错误。本文使用余弦相似度来衡量对抗样本和原始样本之间的距离:

Dxadv,x=-Sima, b

其中,a=a1,a2,,akxadv对应的词向量,b=b1,b2,,bkx对应的词向量,Sim(a,b)表示两个词向量的余弦相似度:

Sima, b=abab=i=1kai×bii=1k(ai)2×i=1k(bi)2

2.2 方法概述

在进行详细介绍前,首先对TextLeak方法进行概述。本文的目标是求解公式(2),其中包括不等式约束Fxadvy,我们首先通过迭代进行同义词替换找到满足这个约束条件的对抗样本。如图2所示,决策边界与原始样本x之间的距离并不是处处相等的。即使两个对抗样本xc1xc2与原始样本x距离相同时,优化至决策边界附近后与原始样本的距离也不一定相同(l1>l2)。因此,我们设计了一种新的方法,称为多级搜索,包括粗粒度搜索和细粒度搜索两部分。其中粗粒度搜索的目的是找到一个更有价值的区域使决策边界附近的样本更接近原始样本。结合图2,粗粒度初始对抗样本xc1xc2优化至决策边界后为xc1'xc2',通过比较其与原始样本x之间的距离选择了xc2所在区域;细粒度搜索的目的是在选定的区域中找到最优样本,从xc2所在的区域出发进行细粒度搜索得到xf1xf2,优化至决策边界后为xf1'xf2',通过比较xc1',xc2',xf1',xf2'这四个样本与原始样本x之间的距离,确定了xf1'为最优样本。多级搜索的流程图如图3所示。

2.3 粗粒度搜索

粗粒度搜索的目的是找到使决策边界附近的样本更接近原始样本的目标区域。本文通过在决策边界外随机采样的方法获得多个对抗样本。为了保证对抗性样本的多样性,我们在原始样本中加入了不同的随机噪声。这些随机噪声为添加到原始样本中的扰动,但并非所有扰动都是有意义的,因此我们采用回溯来优化扰动。通过比较优化后的对抗样本与原始样本之间的距离,找到合适的对抗区域。

TextLeak用同义词替换的方式给原始样本添加噪声,确保生成的对抗样本与原始样本的语义保持一致性。对于原始样本x,只有与原始样本标签一致的句子才对文本的预测有贡献。此外,每个句子中的实词对句子的语义影响较大,虚词对语义影响较小,但如果对虚词进行替换很可能导致搭配不当从而产生语法错误。因此,我们首先对文本中的句子进行筛选,得到与原始样本标签一致的句子;然后对筛选出的句子进行词性检查,筛选得到扰动单词集W,对于W中的每个单词wPOS(w)adj,adv,n,vPOS为词性检查函数;最后,为了得到W中的每个单词w的同义词候选集,从词嵌入向量集合[17]中选择与w余弦相似度排名前50的单词,在经过词性筛选后作为同义词候选集,记为Synw,其中wW。词性筛选只保留与原始单词词性相同的同义词,避免产生语法错误。粗粒度搜索的具体步骤如下:

1) 初始化对抗样本:对原始样本x,从其对应的扰动单词集W中依次选取单词,随机替换为Synw中的候选词,直至产生对抗样本。同时保证对抗样本与原始样本的距离小于ϵ,即保证语义一致性。将该过程重复n次,得到粗粒度初始对抗样本集:Xc={xc1,xc2,,xcn}

2) 优化至决策边界:对每个xciXc,依次计算将每个扰动词还原后与原始样本x的距离D(xci,x),按照距离从大到小的顺序用贪婪算法进行试探性还原,即还原后检查样本是否还具有对抗性,如果是,则继续还原;如果否,则停止操作。通过以上操作得到粗粒度优化对抗样本集:Xc'={xc1',xc2',,xcn'}

3) 选择目标区域:对每个xci'Xc',计算与原始样本x之间修改的单词数的比例P(xci',x),选择修改的单词数比例P(xci',x)最小的样本xci'对应的xci所在的区域为目标区域。为了便于表示,用xci代表目标区域中的样本。

2.4 细粒度搜索

在图像领域,可以通过在原始样本和对抗样本之间进行二分搜索逼近决策边界。图像可以直接对像素值进行数值运算,然而文本具有离散性,二分搜索无法直接应用。尽管单词也可以映射到词向量空间,但对词向量的某个数值进行修改后却不一定能映射回一个单词,即使在数字域,词向量之间仍然具有离散性。

从粗粒度搜索找到的xci出发,添加多个微小噪声生成一批新的对抗样本。在粗粒度搜索生成初始对抗样本时,并没有限制扰动单词的数量,扰动单词集W中的单词都可以被同义词替换。在细粒度搜索时,将扰动单词数的比例进行限制,这个比例记为σ。通过对比粗粒度初始对抗样本xci与原始样本x,可以将对应的扰动单词集W分为已修改Wc和未修改Wu两部分。此时针对xci添加的噪声包括两种操作:还原Wc中已被同义词替换的部分单词和替换Wu中未修改的部分单词。这两种操作都受到参数σ的限制。经过实验得出,σ取值为20%。细粒度搜索的具体步骤如下:

1) 部分扰动与还原:对于粗粒度搜索找到的xci,依次进行扰动和还原操作,扰动操作随机从同义词候选集Synw中选取。若已达到比例σ,但还未找到对抗样本,则同时随机选取比例为σ的单词进行扰动和还原操作。过程重复m次,得到细粒度初始对抗样本集:Xf={xf1,xf2,,xfm}

2) 优化至决策边界:对每个xfiXf,依次计算将每个扰动词还原后与原始样本的距离D(xci,x),按照距离从大到小的顺序用贪婪算法进行试探性还原,即还原后检查样本是否还具有对抗性,如果是,则继续还原;如果否,则停止操作。通过以上操作得到细粒度优化对抗样本集:Xf'={xf1',xf2',,xfm'}

3) 选择最优解:对每个xfi'Xf',计算与原始样本x之间修改的单词数的比例P(xfi',x);然后,基于各P(xci',x)P(xfi',x),从Xc'Xf'中选择与原始样本x修改的单词数的比例最小的样本作为最优解xadv

3  实验评估

3.1 实验设置

3.1.1 数据集

在实验中,我们共采用了5个文本分类常用的公开数据集进行实验:

1) AG News[18]:句子级别的新闻数据集,包括四个类别:世界、运动、商业和科学/技术。

2) IMDB[19]:句子级别的电影评论数据集,包括两个类别:正向和负向。

3) MR[20]:句子级别的电影评论数据集,包括两个类别:正向和负向。

4) Yahoo Answers[18]:文档级别的分类数据集,将雅虎问答的问题和答案归类到指定类别,包括十个类别:社会和文化、科学和数学、健康、教育和参考、计算机和互联网、运动、商业和金融、娱乐和音乐、家庭和关系、时政。

5) Yelp Reviews[18]:文档级别的情感分类数据集,包括两个类别:正向和负向。

其中,IMDB、MR和Yelp Reviews数据集都是电影评论类,区别在于文本长度不同。这三个数据集的平均文本长度分别为215、20和152个单词。

3.1.2 目标模型

在文本分类任务中,目标模型为WordCNN[21],WordLSTM[22]和Bert[23]。我们对这些目标模型在五种数据集下进行了预训练。WordCNN模型用于提取特征的窗口大小设置为3、4和5,每种窗口大小150个过滤器,dropout设置为0.3。WordLSTM模型包含一个双向LSTM层,隐藏单元有150个,dropout设置为0.3。Bert模型有12层,768个隐藏单元,12个头。本文的实验设定为最严格的黑盒场景,所以即使对于这些开源模型,我们也会通过向目标模型发送查询来发起攻击,并且只获得模型查询的最终决策输出。

3.1.3 实验环境

本文所有实验均在Ubuntu平台下完成,操作系统版本为Ubuntu 18.04.5 LTS,CPU型号为Intel(R) Xeon(R) Gold 5117 CPU @ 2.00 GHz,核心数32,运行内存为120 GB,GPU型号为Nvidia GeForce RTX 2080,CUDA版本为11.0。文本实验代码采用Python语言编写,版本为3.7.9,使用的机器学习框架为Tensorflow 2.2.3。

3.1.4 基线方法

本文选取三个目前效果最好的基于决策的黑盒文本对抗攻击作为基线方法进行实验对比。为了确保实验的公平性,我们在相同的数据集和模型下对基线方法进行了复现。

POA[14]:POA通过种群优化算法通过对原始样本进行交叉和变异操作生成对抗样本。交叉操作将两个候选文本中的部分句子进行交换,变异操作在候选文本中随机选择一个单词进行同义词替换。

TextDecepter[15]:这个方法讨论了文本分类任务下的文本对抗攻击。该方法首先对原始样本中的每个句子进行重要度排序,删除与原始样本的标签不同的句子,然后对每个句子中的单词进行重要度排序,选择重要度高的单词进行同义词替换。TextDecepter仅在两个数据集上进行了实验,为了进行更加全面和公平的比较,本文在复现时将此方法扩展到了五个数据集。

LeapAttack[16]:它是一个基于梯度优化的方法,但是攻击者无法获取目标模型的梯度信息,仅能获取模型的决策输出。这个方法首先随机初始化对抗样本,然后通过将扰动词放回来靠近决策边界,接着通过候选词采样估计梯度,从而更新扰动。

3.1.5 评估指标

本文实验设置了三个评价指标:攻击成功率、扰动率和查询次数。

攻击成功率(Attack Success Rate, ASR):攻击成功的样本占总实验样本数的比例。攻击成功率用来衡量我们提出的攻击方法的有效性,其值越高表示攻击方法的有效性越好。

扰动率(Perturbed Rate, PR):攻击成功的对抗样本中,扰动单词占文本总单词数的比例。扰动率用来衡量生成的对抗样本的质量,较高的扰动率会影响生成的对抗样本的质量。

查询次数(Query Number, QN):攻击成功的对抗样本需查询目标模型的次数。查询次数用来衡量攻击的效率,查询次数越少攻击效率越高。过高的查询次数会导致攻击方法无法拓展到实际应用。

3.1.6 参数设置

实验中的参数均通过大量消融实验得到。

参数ϵ用于约束原始样本与对抗样本之间的距离。实验中设置为ϵ=-0.6ϵ越小,表明原始样本与对抗样本之间的距离越近,即语义相似度越高。

粗粒度搜索中初始化对抗样本的数量n。初始化对抗样本的数量越多,所消耗的查询次数越多。n不是越大越好,实验中,n=3。当n超过4时,消耗的查询次数成倍增长,而样本集整体的扰动率不再减少。

细粒度搜索中生成的对抗样本集大小为m。与粗粒度搜索相似,m的取值不能无限增大。通过实验得出m=4时扰动率达到零界点。

3.2 实验结果

3.2.1 TextLeak攻击效果

本文从5个公开数据集中分别随机挑选了1 000个样本进行实验验证。TextLeak生成的对抗样本使目标模型识别错误则证明攻击成功。表1为TextLeak在不同数据集和模型下生成的对抗样本示例。例如,“stay away”和“stay back”均表示退后、远离的意思,然而模型的识别结果从负向变为了正向。TextLeak在几乎不改变原始样本语义的情况下生成了使模型识别错误的对抗样本,且仅修改了少量的单词。

3.2.2 TextLeak有效性分析

表2对比了在文本分类任务下,TextLeak与基线方法POA、TextDecepter和LeapAttack在攻击成功率(ASR)、扰动率(PR)和查询次数(QN)三个指标上的表现。每个数据集均随机选择1 000条样本进行测试。

表2中可以看出,无论哪种数据集和模型下,TextLeak的攻击成功率都能达到90%以上。在三种模型和五种数据集下,TextLeak的平均攻击成功率约为96.0%,消耗的查询次数平均约为368次,平均扰动率约为8.3%;POA平均攻击成功率约为98.1%,平均查询次数约为7 006次,平均扰动率为8.3%;TextDecepter平均攻击成功率约为58.2%,平均查询次数约为762次,平均扰动率约为7.0%;LeapAttack的平均攻击成功率约为98.2%,平均查询次数约为2 648次,平均扰动率约为7.0%。TextLeak的平均查询次数分别约为三种基线方法POA、TextDecepter、LeapAttack的5.25%、48.29%、13.90%。

在攻击成功率这个指标上,本文提出的TextLeak与POA和LeapAttack相近,远高于TextDecepter;TextDecepter方法对单词进行重要度排序时仅以词性作为评估标准,从而导致句子中许多单词的重要度相同,使得在原始样本上添加的噪声不够精确,从而无法获得高攻击成功率。在平均扰动率这个指标上,TextLeak与三个基线方法的表现不相上下。而在查询次数这个指标上,TextLeak的表现远远优于三个基线方案;POA在进行交叉和变异操作时引入了随机性,LeapAttack在候选词采样的过程引入了随机性,这导致需要大量的查询次数才能得到和原始样本具有高语义相似度的对抗样本,且受限于成本和效率因素,POA和LeapAttack在现实场景中并不适用。以IMDB数据集下攻击Bert模型为例,TextLeak与POA方法的攻击成功率和平均扰动率相当,而平均查询次数约为POA方法的5%;TextLeak的平均攻击成功率比TextDecepter高约35%,而平均查询次数约为TextDecepter的35%;TextLeak与LeapAttack方法的攻击成功率和平均扰动率相当,而平均查询次数约为LeapAttack方法的14%。

3.2.3 显著性检验

为了更直观地将TextLeak与基线方法进行对比,本节进行了显著性检验。采用单因素方差分析进行比较,假设TextLeak和基线方法的均值相等,即不存在显著性差异。设定显著性水平α=0.01,即如果P值小于0.01,则拒绝原假设并认为两组数据的均值存在显著性差异。采用F检验来检验两组数据的均值是否有显著性差异。如果F值越大,说明组间方差相对较大,即两组数据的均值之间存在较大的差异。相反,如果F值越小,说明组间方差相对较小,即两组数据的均值之间存在较小的差异。

表3为文本分类任务下TextLeak和三种基线方法(POA、TextDecepter和LeapAttack)在攻击成功率、扰动率和查询次数三个指标上的显著性检验结果。从表3可以看出,三种基线方法在扰动率上不存在显著性差异,但在查询次数上存在显著性差异,结合表2可知TextLeak成功实施攻击所需的查询次数远小于POA、TextDecepter和LeapAttack。在攻击成功率上,TextLeak与POA、LeapAttack不存在显著性差异,与TextDecepter存在显著性差异,结合表2得出TextLeak的攻击成功率位于前列,可用于现实场景。总体来说,本文提出的TextLeak结合了三种基线方法的优点,在攻击成功率和扰动率上都达到了最先进的水平,同时成功实施攻击所消耗的查询次数远少于三种基线方法。

3.2.4 对抗样本质量检验

由对抗样本的定义可知,一个好的对抗样本必须满足以下条件:1)隐蔽性,即仅在原始样本上添加微小扰动;2)有效性,使目标模型识别错误。对于文本而言,要保证对抗样本的质量,还需增加两个条件:3)语法正确性,即对抗样本不会在原始样本的基础上增加语法错误;4)语义一致性,即对抗样本与原始样本的语义保持一致。

本文用扰动率来衡量对抗样本的隐蔽性,用攻击成功率来表示对抗样本的有效性,在实验中用ϵ参数保持语义一致性。由3.2.2和3.2.3节的数据可知,基于本文方法生成的对抗样本已经满足条件1)、2)和4)。为了验证基于本文方法生成的对抗样本是否满足条件3),本文通过在线语法检查工具LanguageTool对比对抗样本比原始样本增加的语法错误。对比结果表明,在所有模型和数据集下,对抗样本的语法错误增加率平均为0.8%,即TextLeak生成的对抗样本几乎不会增加新的语法错误,满足条件3)。

3.2.5 防御性实验

为了检验TextLeak是否对检查模型鲁棒性有贡献,本节对TextLeak进行了防御性实验。目前针对文本对抗攻击的防御方法主要包括拼写检查和对抗训练。拼写检查适用于字符级的文本对抗攻击,本文采用的单词级扰动,拼写检查并不适用。因此,我们采用对抗训练的防御方法。

对抗训练[24]是指将对抗样本按照一定的比例加入到模型的训练中,使模型在训练中学习对抗样本的特征。PGD[25]是一种图像领域经典的对抗攻击和用于对抗训练的方法,使用PGD进行对抗训练时模型的损失与正常训练时是类似的。本文将PGD扩展到文本领域,用于训练更加鲁棒的模型。

以WordCNN作为目标模型,在IMDB数据集下对模型进行对抗训练,模型架构和参数与攻击实验保持一致。实验结果表明,在进行对抗训练前模型的准确率为85.7%,进行对抗训练后模型的准确率为86.0%。用TextLeak对对抗训练后的模型进行攻击,攻击成功率为97.5%,与攻击对抗训练前的模型相比仅下降了1.2%。可见,对抗训练对本文提出的TextLeak的攻击效果影响不大。

4  结 语

受限于文本离散的特性,基于决策的黑盒攻击比白盒攻击和基于分数的黑盒攻击更具挑战性。本文提出的一种新的基于决策的单词级黑盒文本攻击TextLeak,通过多级搜索的方式能快速生成语法正确、语义流畅的对抗样本。同时,通过在多种模型和数据集下的实验,验证了TextLeak的有效性和高效性。在文本分类任务下,TextLeak的平均攻击成功率约为96.0%,且在保证高攻击率和低扰动率的前提下,TextLeak的平均查询次数约为三个同样设置下的基线方法POA、TextDecepter、LeapAttack的5.25%、48.29%和13.90%。平均查询次数少表明TextLeak的高效性,使其能够更广泛地应用到商业系统中。除此之外,本文还通过防御性实验验证了TextLeak是一种新的评估模型鲁棒性的基线方法,通过TextLeak可以深入了解深度学习模型对对抗攻击的敏感性,从而确定需要改进的方向。

目前文本对抗攻击主要对文本进行字符级、单词级或者句子级的修改,后续工作可以拓展到多种修改方式并存,使攻击更具灵活性。当然,只要对文本进行了修改都会产生暴露的风险,探索不修改文本也可以攻击模型的方式很有意义。同时,文本领域防御对抗攻击的方法大多具有局限性,只能防御一种或者一类文本对抗攻击。未来的研究工作可以总结目前文本对抗攻击的机理,制定有效、全面的防御框架。

参考文献

[1]

KRIZHEVSKY ASUTSKEVER IHINTON G E. ImageNet classification with deep convolutional neural networks[J].Communications of the ACM201760(6): 84-90. DOI:10.1145/3065386 .

[2]

GRAVES AMOHAMED A RHINTON G. Speech recognition with deep recurrent neural networks[C]//2013 IEEE International Conference on Acoustics, Speech and Signal Processing. New York: IEEE Press, 2013: 6645-6649. DOI: 10.1109/ICASSP.2013.6638947 .

[3]

MIKOLOV TKARAFIÁT MBURGET Let al. Recurrent neural network based language model[EB/OL]. [2021-09-23]. DOI: 10.21437/interspeech.2010-343 .

[4]

SZEGEDY CZAREMBA WSUTSKEVER Iet al. Intriguing properties of neural networks[EB/OL]. [2021-10-16].

[5]

PAPERNOT NMCDANIEL PSWAMI Aet al. Crafting adversarial input sequences for recurrent neural networks[C]// MILCOM 2016-2016 IEEE Military Communications Conference. New York: IEEE Press, 2016: 49-54. DOI: 10.1109/MILCOM.2016.7795300 .

[6]

EBRAHIMI JRAO A YLOWD Det al. Hotflip: White-box adversarial examples for text classification[C]//Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics(Volume 2: Short Papers). Stroudsburg: Association for Computational Linguistics, 2018: 31-36. DOI: 10.18653/v1/p18-2006 .

[7]

WANG B XXU C JLIU X Yet al. SemAttack: Natural textual attacks via different semantic spaces[C]//Findings of the Association for Computational Linguistics: NAACL 2022. Stroudsburg: Association for Computational Linguistics, 2022: 176-205. DOI: 10.18653/v1/2022.findings-naacl.14 .

[8]

ALZANTOT MSHARMA YELGOHARY Aet al. Generating natural language adversarial examples[C]// Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing. Stroudsburg: Association for Computational Linguistics, 2018: 2890-2896. DOI: 10.18653/v1/d18-1316 .

[9]

JIN DJIN Z JZHOU J Tet al. Is BERT really robust? A strong baseline for natural language attack on text classification and entailment[J]. Proceedings of the AAAI Conference on Artificial Intelligence202034(5): 8018–8025. DOI: 10.1609/aaai.v34i05.6311 .

[10]

REN S HDENG Y HHE Ket al. Generating natural language adversarial examples through probability weighted word saliency[C]//Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. Stroudsburg: Association for Computational Linguistics, 2019: 1085-1097. DOI: 10.18653/v1/p19-1103 .

[11]

LI J FJI S LDU T Yet al. TextBugger: Generating adversarial text against real-world applications[C]//Proceedings 2019 Network and Distributed System Security Symposium. Reston: Internet Society, 2019: 1-15. DOI: 10.14722/ndss.2019.23138 .

[12]

LEE DMOON SLEE Jet al. Query-efficient and scalable black-box adversarial attacks on discrete sequential data via Bayesian optimization[EB/OL]. 2022arXiv: 2206.08575.

[13]

ZHAO Z L, DUA D, SINGH S. Generating natural adversarial examples[EB/OL]. 2017arXiv: 1710.11342.

[14]

MAHESHWARY RMAHESHWARY SPUDI V. Generating natural language attacks in a hard label black box setting[J]. Proceedings of the AAAI Conference on Artificial Intelligence202135(15):13525-13533. DOI: 10.1609/aaai.v35i15.17595 .

[15]

SAXENA S. TextDecepter: Hard label black box attack on text classifiers[EB/OL]. 2020arXiv: 2008.06860.

[16]

YE M CCHEN J HMIAO C Let al. LeapAttack: Hard-label adversarial attack on text via gradient-based optimization[C]//Proceedings of the 28th ACM SIGKDD Conference on Knowledge Discovery and Data Mining. New York: ACM, 2022: 2307-2315. DOI: 10.1145/3534678.3539357 .

[17]

MRKŠIĆ NSÉAGHDHA D ÓTHOMSON Bet al. Counter-fitting word vectors to linguistic constraints[C]//Proceedings of the 2016 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies. Stroudsburg: Association for Computational Linguistics, 2016: 142-148. DOI: 10.18653/v1/n16-1018 .

[18]

ZHANG XZHAO JLECUN Y. Character-level convolutional networks for text classification[EB/OL]. [2020-06-15]. DOI: 10.48550/arXiv.1509.01626 .

[19]

MAAS A LDALY R EPHAM P Tet al. Learning word vectors for sentiment analysis [C]//Proceedings of the 49th Annual Meeting of the Association for Computational Linguistics: Human Language Technologies - Volume 1. New York: ACM, 2011: 142–150. DOI: 10.5555/2002472.2002491 .

[20]

PANG BLEE L. Seeing stars: Exploiting class relationships for sentiment categorization with respect to rating scales [C]//Proceedings of the 43rd Annual Meeting on Association for Computational Linguistics. New York: ACM, 2005:115-124. DOI: 10.3115/1219840.1219855 .

[21]

KIM Y. Convolutional neural networks for sentence classification[C]//Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing (EMNLP). Stroudsburg: Association for Computational Linguistics, 2014: 1746–1751. DOI: 10.3115/v1/d14-1181 .

[22]

HOCHREITER SSCHMIDHUBER J. Long short-term memory[J]. Neural Computation19979(8): 1735-1780. DOI: 10.1162/neco.1997.9.8.1735 .

[23]

DEVLIN JCHANG MLEE Ket al. Bert: Pre-training of deep bidirectional transformers for language understanding[C]//Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics. Stroudsburg: Association for Computational Linguistics, 2019: 4171-4186. DOI: 10.18653/v1/N19-1423 .

[24]

MIYATO TDAI A M, IAN G. Adversarial training methods for semi-supervised text classification[EB/OL]. [2022-09-13].

[25]

MADRY AMAKELOV ASCHMIDT Let al. Towards deep learning models resistant to adversarial attacks[EB/OL]. [2019-03-24]. DOI: 10.48550/arXiv.1706.06083 .

基金资助

国家自然科学基金(U20B2049)

AI Summary AI Mindmap
PDF (1094KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/