面向分类任务的藏文对抗样本生成

李嘉俊 ,  曹玺 ,  群诺 ,  张佳亮 ,  尼玛扎西null

高原科学研究 ›› 2025, Vol. 9 ›› Issue (4) : 118 -128.

PDF (1050KB)
高原科学研究 ›› 2025, Vol. 9 ›› Issue (4) : 118 -128. DOI: 10.16249/j.cnki.2096-4617.2025.04.012
高原交通与信息处理

面向分类任务的藏文对抗样本生成

作者信息 +

Tibetan Adversarial Sample Generation for Classification Tasks

Author information +
文章历史 +
PDF (1075K)

摘要

为全面评估藏文语言模型的鲁棒性,文章提出一种藏文对抗样本生成方法DAAttacker。该方法基于字丁级与音节字级多粒度扰动策略,设计了插入、删除、替换等6种扰动方式以生成多样化的对抗样本。在白盒攻击场景下,DAAttacker能精准选择关键藏文音节字进行扰动,并借助生成扰动的评分机制择优生成最优扰动,同时通过相似度阈值约束样本的语义相似度,从而保障对抗样本在自然性与隐蔽性方面的平衡。实验结果显示,DAAttacker在多个藏文分类模型上获得了超过90%的攻击成功率,生成的对抗样本在语义流畅性和隐蔽性方面表现优异,为低资源语言的对抗样本生成和模型鲁棒性提升提供了新思路。

Abstract

To comprehensively assess the robustness of Tibetan language models, this study introduces a Tibetan adversarial sample generation method named DAAttacker. This approach employs a multi-granularity perturbation strategy at both the character and syllable levels, incorporating six types of perturbations, including insertion, deletion, and substitution, to generate diverse adversarial samples. Under a white-box attack setting, DAAttacker accurately identifies critical Tibetan syllables for perturbation and utilizes a scoring mechanism to obtain optimal perturbations, while a similarity threshold is applied to maintain semantic fidelity and ensure balance between naturalness and stealthiness. Experimental results on multiple Tibetan classification models show that DAAttacker achieves attack success rates exceeding 90%, and the generated adversarial samples exhibit notable fluency and concealment. These findings provide new insights into adversarial sample generation and model robustness enhancement for low-resource languages.

Graphical abstract

关键词

藏文语言模型 / 对抗文本生成 / 文本对抗攻击 / 鲁棒性

Key words

Tibetan language models / adversarial text generation / text adversarial attacks / robustness

引用本文

引用格式 ▾
李嘉俊,曹玺,群诺,张佳亮,尼玛扎西null. 面向分类任务的藏文对抗样本生成[J]. 高原科学研究, 2025, 9(4): 118-128 DOI:10.16249/j.cnki.2096-4617.2025.04.012

登录浏览全文

4963

注册一个新账户 忘记密码

引 言

近年来,深度神经网络在计算机视觉[1]、自然语言处理[2]、数据挖掘[3]和机器翻译[4]等领域取得了显著进展,有力推动了相关行业的技术创新。然而,尽管在精度和效率方面表现优异,此类模型在可解释性与鲁棒性方面依然面临诸多挑战。为系统评估并提升模型可靠性,研究者引入了对抗攻击方法[5],即通过对输入数据添加精心设计的微小扰动使模型产生错误输出,被扰动后的输入样本称为对抗样本,其中衡量深度神经网络模型抵抗攻击能力的主要指标为对抗鲁棒性。对抗样本生成过程中,训练数据中潜在的偏差可能导致模型输出中出现诸如种族主义、少数歧视等偏见[6],这也进一步引发了学界对模型可靠性及其所承载价值观问题的广泛关注。已有相关研究主要关注英文文本,如,Jia等[7]在2017年首次提出了针对英文数据集生成对抗样本的策略,并从鲁棒性角度评估NLP模型的效果。此后,基于不同扰动策略的对抗攻击方法不断涌现,包括字丁级、单词级和句子级的攻击方式。如,Ebrahimi等[8]在2018年提出的HotFlip方法通过对字进行梯度修改实现白盒攻击;Gao等[9]提出的DeepWordBug则采用贪心算法进行黑盒攻击;Wallace等[10]提出的UAT是基于梯度的单词级白盒攻击;Li等[11]于2018年提出的TextBugger则是单词级黑盒攻击方法,引入了近义词替换、阈值控制等概念,成为众多后续研究的基线方法。随着机器理解中文语言特性和语法结构的逐渐深入,近年来也陆续出现了一些针对中文文本的对抗样本生成方法。如,Tong等[12]在2020年提出的CWordAttacker方法,结合拼音和传统汉字替换,采用基于目标删除打分机制的词级黑盒攻击方法生成对抗样本;Han等[13]在2023年提出的MCGC方法则考虑中文的语法和语义特性,对其视觉相似度与语义相似度施加有效约束。目前,针对中国少数民族语言的文本对抗攻击研究方面,Cao等[14]在2023年提出的TSAttacker是基于藏文音节字级的黑盒对抗攻击方法。该方法使用音节字的余弦距离和评分机制,在生成对抗样本时成功扰乱了多个模型,为藏文文本的对抗攻击提供了一种有效的思路,但在攻击过程中其仍存在弊端,生成的对抗样本质量在某些任务中并不理想,且模型的鲁棒性仍有待进一步提升。

总之,好的对抗样本应满足以下两个核心要求:一是能够有效扰乱分类器的预测;二是保证对抗样本在语义上与原始文本保持一致,并具备良好的可读性[15]。本文遵循这一指导思想,在提升对抗样本攻击成功率的同时,特别关注其在视觉和语义层面上与原始文本的差异。

随着藏文预训练语言模型不断成熟[16,17],藏文在自然语言处理中的应用前景日益广阔,但对藏文的对抗攻击研究仍非常稀缺。因此,针对藏文模型开展对抗攻击下的鲁棒性评估,并提出有效的防御策略,已成为当前亟待解决的关键问题。针对上述问题,本文提出了一种基于白盒的藏文文本对抗样本生成方法——动态自适应对抗攻击法(Dynamic Adaptive Attacker, DAAttacker),该方法充分结合藏文特有的语言结构特点,设计了适配藏文书写规则的扰动策略。其核心流程为:首先通过雅可比矩阵梯度与马氏距离加权的评分机制筛选对分类结果影响显著的核心音节字,随后采用6种藏文适配扰动策略生成候选扰动,再结合Jaccard相似度与预测差异的加权机制选择最优扰动,并以语义相似度为阈值控制样本生成,最终在干扰模型预测的同时,保持对抗样本的可读性与语义一致性。该方法在多个藏文分类任务中表现出优异的攻击成功率和优良的样本生成质量。

1 研究方法

1.1 针对文本分类的对抗攻击

在文本分类任务中,设x为原始输入文本(x∈XX包含所有可能的输入文本),F为分类器,Fx的输出标签为yy∈YY包含所有可能的输出标签),记作y=F(x)[6]。令Flaw表示对x的扰动,x′表示经过扰动后的输入文本,那么x′=x+Flaw,Py*|x'为给定输入x'条件下,模型将其预测为候选标签y*的后验概率。通过精心设计Flaw,使输入文本的语义基本上保持不变。当满足以下条件时,攻击者实现了一次成功的文本对抗攻击。公式如下:

Fx'=arg maxy*Y Py*|x'y

攻击者在白盒攻击场景下能够获取目标模型的结构和参数等关键信息。依托对模型决策机制的深度解析,攻击者能够利用梯度信息设计定向扰动策略,可显著提升攻击的成功率与扰动效率。

同时,攻击者使用特定的相似度函数sim来约束生成的对抗样本,即要求生成的对抗样本满足sim(x, x′) ≥ ϵR。其中,ϵR是用于保证样本间的相似度在可接受的范围内。

1.2 藏文文本特征

藏文作为元音附标文字,由30个辅音字丁和4个元音字丁构成,每个字丁对应唯一的Unicode编码。字丁需要严格按照固定规则组成藏文音节字,一个或者多个音节字由Tsheg(藏文音节字分隔符)分隔,组成藏文词,每个藏文音节字可由1~7个字丁构成(图1)。因此,与英文(字母、单词和句子)及中文(汉字、词语和句子)有所不同,藏文的语言结构粒度层次包括字丁、音节字、单词和句子。本文首先使用分词工具TibetSegEYE将原始文本中的句子进行分词。设原始输入文本x中的音节字为s(忽略Tsheg),则输入文本的表达公式为:

x=s1s2. . .si. . .sm

1.3 关键音节字重要性评分机制

在文本对抗样本生成过程中,关键音节字的选择直接影响攻击成功率和隐蔽性。为精准评估音节字对模型预测结果的重要性,本文提出了一种结合模型梯度信息与马氏距离加权的音节字重要性评分机制。该机制通过量化音节字对模型输出的影响,帮助攻击者优先选择关键音节字进行扰动,从而优化对抗样本的攻击效果。

1.3.1 计算梯度信息

白盒攻击是指攻击者能够完全获取目标模型的结构、参数及训练细节的攻击场景[8],在该攻击场景下,攻击者可通过模型的梯度信息量化输入特征(如藏文音节字)对分类器预测结果的影响程度。梯度值反映了输入特征变化对损失函数的敏感度,梯度越大,表示该特征对模型预测的影响越显著,越易成为攻击者优先扰动的目标。白盒攻击不仅能揭示模型在实际使用中的脆弱性,还可以帮助开发者在部署攻击之前有针对性地加固模型,从而提升其在面对恶意攻击时的鲁棒性。

假设x为输入文本,L(x)为损失函数,则每个音节字si 对模型输出的影响ΔPi, 可以通过损失函数对输入音节字的梯度来衡量,即:

ΔPi = si Lx

在多类别分类问题中,模型的输出是一个包含多个类别预测概率的向量y =[y1,y2,…,yk],其中k为类别的数量。为了更细致地捕捉每个音节字对各个类别输出的影响,本文借鉴Papernot等[18]提出的基于雅可比矩阵的显著性图(Saliency Map)思想,引入雅可比矩阵JF (x),量化每个藏文音节字对分类决策的敏感度。雅可比矩阵的元素表示模型输出相对于输入音节字的偏导数,计算公式如下:

JFx=Fjxsii=1,,N;j=1,,M

式中,N是输入文本中的总单词数(或音节字数),M是分类器的输出类别数量,Fj (x)是模型对类别j的预测输出,第i个音节字对模型输出的影响ΔPi 对应于雅可比矩阵的第i列向量。雅可比矩阵JF (x)描述了输入音节字对多个类别预测的影响,攻击者可以通过计算雅可比矩阵来识别对目标类别影响最大的音节字。

1.3.2 马氏距离

马氏距离作为一种基于协方差矩阵的度量,广泛用于衡量数据点在高维空间中的相似性[19]。计算公式如下:

 md=σ-μTΣ-1σ-μ

式中,σ为待测数据点的向量,μ为均值向量,Σ-1为协方差矩阵的逆矩阵。若使用传统的欧氏距离计算扰动,往往会忽略特征之间的相关性和尺度差异。引入马氏距离构建梯度加权机制后,在筛选关键音节字时,不仅有效评估了单个音节字对分类器输出的影响,还考虑了音节字之间的联合分布,从而更准确地识别对分类结果影响最大的音节字。

1.3.3 重要性评分与排序

基于前述计算得到的加权梯度,为每个音节字分配一个重要性评分,该评分正相关于该音节字对模型预测结果的贡献大小。每个音节字的最终重要性评分PT(si )公式如下:

PTsi=|siLx|×mdsi

根据评分对所有音节字进行排序,选出对模型输出影响最大的音节字。

1.4 最优扰动的得分机制

1.4.1 Jaccard相似度

为了确保生成的对抗样本在语义和结构上尽可能保留原文本的信息,本文引入了Jaccard相似度来衡量音节字替换对文本结构的扰动。Jaccard相似度是一种衡量两个集合相似度的指标[20],计算公式如下:

JaccardA,B=|AB||AB|

式中,A表示原始文本中的音节字集合,B表示生成的对抗样本中的音节字集合。

1.4.2 结合分类器预测概率的最优扰动得分机制

在对抗样本生成过程中,扰动对分类器预测结果的影响尤为重要。Ren等[21]提出了基于预测概率变化(Probability Weighted Word Saliency,PWWS)的词重要性排序策略,证明了该指标能有效筛选出最具攻击性的词汇。因此,通过计算扰动前后的预测概率变化ΔP来进一步评估扰动效果。本文通过加权Jaccard相似度和预测概率变化的综合得分来评估每个扰动的效果。综合得分指标S可以表示为:

S=αJaccard+βΔp

其中,αβ为权重系数,分别控制Jaccard相似度和预测概率变化在总得分中的相对重要性。这一综合得分机制构建了最优扰动评分标准,借助该评分,攻击者可筛选出同时满足攻击强度达标与样本隐蔽性合格的扰动操作,为生成高质量对抗样本提供保障。

2 藏文对抗样本生成算法

2.1 藏文音节字向量

Grave等[22]发布了157种高质量语言预训练词向量,这些预训练词向量是在Wikipedia和CommonCrawl组成的数据集上使用fastText训练得到,其中包含了藏文音节字对应的300维向量,这些预训练词向量在大规模藏文语料上进行训练,包含了丰富的语义信息。本文首先引入了该300维藏文音节字向量,在此基础上利用词向量中的语义特征构建马氏距离的协方差矩阵,使其能够更准确地捕捉音节字间的相关性。这一特性在加权梯度的计算过程中尤为重要,能够确保模型在特征选择时权衡不同的音节字对预测结果的影响。

另外,在进行近似音节字扰动这一策略的对抗样本生成之前,也需加载预训练的藏文词向量,即对于需要进行扰动的关键音节字,通过计算词向量之间的角度距离(Angle Distance)相似度来衡量音节字之间的语义相似性,计算公式如下:

Angle Distancev1,v2=arccosv1v2v1v2π

式中, v1v2为两个词向量。相关研究表明基于角度距离的相似度比传统余弦相似度的平均表现更好[23]

基于此角度距离,本研究定义了相似函数sim( v1v2)来衡量两个向量的相似度,sim函数的值越接近1,表示两个向量越相似,公式如下:

simv1,v2=1-Angle Distancev1,v2

2.2 生成算法

对抗文本的生成算法主要包括音节字重要性评分、备选扰动(Flaw)的生成,以及基于相似度阈值约束的扰动筛选等步骤,具体流程见图2

2.2.1 寻找关键音节字

本文关键音节字的识别依赖于前述的音节字重要性评分机制。通过计算每个音节字对分类结果的影响,以及结合马氏距离加权的梯度信息计算出评分PT(si )。选择评分前4的音节字,并按评分降序排列形成备选重要音节字列表C。这些音节字为后续的对抗样本生成提供高价值扰动目标。

2.2.2 对筛选出来的重要藏文音节字生成对应的备选Flaw

本文中“Flaw”指的是在对抗攻击过程中对输入文本进行的修改性扰动,其共有6种类型:①近似音节字替换;②音节字交换;③藏文键盘邻近音节字替换;④字丁交换;⑤字丁插入;⑥字丁删除。对应生成的对抗样本示例如表1所示,表中的“标签”是指在情感分析下游任务中对文本的预测结果,positive代表预测结果为积极的,negative代表预测结果为消极的,经过本文提出的DAAttacker的对抗攻击后,成功误导模型预测结果发生变化。在生成的对抗样本中,Flaw部分已通过文字加黑并加下划线进行突出显示。

2.2.3 基于相似度阈值约束的对抗样本生成

在对抗样本生成过程中,本文采用贪心算法从重要音节字列表中依次选择每个音节字,并为其生成多个备选Flaw。每个Flaw通过结合Jaccard相似度和分类器预测概率变化的评分机制,根据得分选择最优Flaw替换到原始文本中,生成一个新的扰动文本。

对于每个生成的扰动文本,首先计算了原始文本和对抗文本的平均音节字向量 vxvx ',计算公式如下:

vx=1n1nvi         ,      vx'=1n1nvi'

式中, vi 为原始文本中每个音节字si 对应的词向量,vi ′为生成的对抗样本;当部分音节字si 被替换为扰动音节字si ′时, vi'表示对应的词向量。如果最终生成的对抗样本能够误导分类器(标签变化),并且与原文本的语义相似度(通过角度距离度量)高于设定阈值ϵ(即sim( vx, vx ′)≥ϵ),则认为对抗样本生成成功。如果未满足上述条件,算法将继续遍历其他重要音节字进行替换;若遍历完所有音节字仍未成功生成对抗样本,则选取当前评分最高的对抗样本,通过迭代调整扰动幅度进行优化,直至生成成功或达到最大迭代次数后终止攻击。

3 实验

3.1 数据集

本实验采用的数据集为TNCC-title与TU_SA。其中,TNCC-title是由Qun等[24]于2017年开源的藏文新闻分类语料库(Tibetan News Classification Corpus, TNCC),该语料库的原始文本主要采集自中国涉藏地区的各类在线网站。TNCC-title是一个短文本数据集,共包含9 276个样本,分为12个类别:政治(Politics)、经济(Economics)、教育(Education)、旅游(Tourism)、环境(Environment)、语言(Language)、文学(Literature)、宗教(Religion)、艺术(Arts)、医学(Medicine)、习俗(Customs)和乐器(Instruments)。TU_SA是由Zhu等[25]从公开的中文情感分析数据集weibo_senti_100k和ChnSentiCorp中选取10 000个句子,并通过专业人工翻译与校对转换为高质量的藏文文本,最终形成包含10 000个样本、正面(positive)与负面(negative)情感各占一半的藏文情感分析数据集。

3.2 受害者模型

受害者模型(Victim Model)通常是指在对抗攻击中被攻击的目标模型,这些模型在面对微小而精确的扰动时,可能会表现出脆弱性,导致模型的鲁棒性降低。本文采用预训练语言模型(PLMs),其中包括专门针对藏文的单语PLM——Tibetan-BERT,以及包含藏文的多语种PLM系列——CINO系列模型,即选用了CINO-base-v2、CINO-large-v2、CINO-small-v2和Tibetan-BERT等4个预训练语言模型,并用“PLMs + 微调”[16]范式构建受害者语言模型,在TNCC-title 和 TU_SA 两个数据集的训练集、验证集上进行微调生成了8个受害者语言模型,最后在上述两个数据集的测试集上对这8个受害者语言模型进行攻击测试。

3.3 评估指标

为系统评估本文所提DAAttacker方法在藏文文本对抗攻击任务中的综合性能,本研究从攻击有效性与样本质量两个核心维度,选取准确率下降值(Accuracy Drop Value, ADV)、攻击成功率(Attack Success Rate, ASR)及编辑距离(Levenshtein Distance, LD)作为关键评估指标。其中,准确率下降值(ADV)用于量化攻击前后目标藏文分类模型准确率的差异,其能够直观反映攻击对模型性能的破坏程度,ADV值越大,表明攻击越有效,模型的鲁棒性越差;攻击成功率(ASR)用于统计对抗样本使模型预测结果偏离原始标签的比例,可有效衡量攻击策略的有效性,ASR值越大,表明攻击越成功,模型的鲁棒性越差;编辑距离(LD)主要用来评估对抗样本的质量,是原始文本与对抗样本之间的最小编辑距离,即将一个文本转化为另一个文本所需的最小字丁编辑次数(包括插入、删除或替换),LD值越小,表明对抗样本的质量越高,扰动的隐蔽性更强。上述评估指标计算公式分别如下:

ADV=AccuracyPre-AccuracyPost
ASR=NumFxFx'Num
LD x,x'(i,j)= max i,j                                        ifmin i,j=0                                               minLDx,x'i-1,j+1      LDx,x'i,j-1+1       LDx,x'i-1,j-1+1        otherwise                          

3.4 实验结果

本文采用Cao等[14]提出的藏文文本对抗攻击方法TSAttacker作为基线进行对比实验,并选取了DeepWordBug[9]攻击方法作为参照。在对比实验中,分别在TNCC-title和TU_SA数据集上进行了评估,并通过相应的指标对各方法的攻击效果进行了详细比较,实验结果见表2表3表2表3分别呈现了在不进行语义相似度阈值控制的情况下各个模型在TNCC-title和TU_SA数据集上攻击结果。其中,加粗并加下划线的值代表最优结果。从表中可以看出,不管是在TNCC-title还是在TU_SA数据集上,DAAttacker方法在准确率下降值高于基线水平的情况下,表现出比基线更高的攻击成功率。

本研究基于TNCC-title数据集,选取了TSAttacker、DeepWordBug和UAT3种算法作为对照,分析了不同攻击算法在各模型上的阈值控制效果的语义相似度阈值-攻击成功率(ASR)关系,具体见图3。图中纵坐标表示攻击成功率,横坐标表示对抗样本的最低语义相似度阈值。从图3可以看出,DAAttacker在未对语义相似度设限与在语义相似度达到0.85时相比,攻击成功率的变化几乎趋于平稳,这表明生成的绝大多数对抗样本的语义相似度均高于0.85。这一结果表明,DAAttacker生成的绝大多数对抗样本语义相似度可维持在0.85以上;从文本可读性角度分析,0.85的语义相似度阈值能够保障对抗样本与原始文本的核心语义一致性,不会对人类的文本理解造成显著偏差;而当语义相似度高于0.9时,对抗样本与原始文本的语义差异已足够微小,可实现近乎无感知的人类阅读体验。

4 消融实验

为了验证本文所提出攻击策略的有效性,设计了一系列消融实验。选择CINO-small-v2、CINO-base-v2、CINO-large-v2和Tibetan-BERT预训练语言模型在TNCC-tittle数据集上微调所构建的受害者模型,在不设置语义相似度阈值的情况下通过对DAAttacker的Flaw生成策略进行组合,评价不同的Flaw生成策略对攻击效果的影响,实验结果见表4,表中的加粗、加下划线的值表示最优结果。

表4中的实验1~实验6为单独攻击策略对模型的影响。结果表明,近似音节字替换、音节字交换和字丁交换策略的攻击成功率较高,以上策略的Flaw具有较强的多样性和隐蔽性。值得注意的是,尽管藏文键盘邻近字丁替换和插入字丁策略在单独攻击的情况下攻击成功率较低,但在实验9与实验10中,这两种策略的加入使得攻击成功率能够达到并维持在较高水平(90%),证明了其有效性。此外,藏文键盘邻近字丁替换和插入字丁策略能够模拟现实中藏文打字过程中的常见输入错误,其对对抗样本的语义影响较小,因此具有较高的实际应用价值。维持文本可读性的同时,能够有效提高攻击的隐蔽性和实用性。

结 语

本文提出了一种基于白盒的藏文对抗样本生成方法,该方法结合多种扰动策略和音节字重要性评分机制,精确筛选关键音节字进行扰动,从而实现对分类器的有效误导。通过引入基于角度距离的相似函数阈值机制,约束对抗样本的语义相似度。实验结果表明,该攻击方法在多个藏文分类任务中表现出较高的攻击成功率和较强的普适性。同时,本文研究存在一定局限性:当前扰动策略聚焦于音节字及字丁的细粒度层级,未进一步探索句法级别粗粒度的对抗策略,对藏文文本句法结构的利用不足,可能限制了复杂句式下的攻击效果。后续研究将围绕上述方向推进:一方面,结合藏文句法规则设计句法级扰动策略,提升方法对复杂文本的攻击适配性;另一方面,整理实验中生成的对抗样本,构建包含多任务场景的藏文对抗性数据集,为藏文模型的鲁棒性优化提供数据支撑。

参考文献

[1]

Krizhevsky A, Sutskever I, Hinton G E. ImageNet classification with deep convolutional neural networks[J]. Communications of the ACM, 2017, 60(6):84-90.

[2]

Bowman S, Vilnis L, Vinyals O, et al. Generating sentences from a continuous space[C]. Proceedings of the 20th SIGNLL conference on computational natural language learning, 2016: 10-21..

[3]

Milne D, Witten I H. An open-source toolkit for mining Wikipedia[J]. Artificial Intelligence, 2013, 194: 222-239.

[4]

Ehsan U, Harrison B, Chan L, et al. Rationalization: A neural machine translation approach to generating natural language explanations[C]. Proceedings of the 2018 AAAI/ACM Conference on AI, Ethics, and Society, 2018: 81-87.

[5]

Iyer N, Pradhan A. " Was there Bias in your response?": LLM anthropomorphic traits in context of ability Bias questioning[C]. Companion Publication of the 2025 Conference on Computer-Supported Cooperative Work and Social Computing, 2025: 471-476.

[6]

Ling L, Rabbi F, Wang S, et al. Bias revealed: Investigating social bias in LLM-Generated Code[C]. Proceedings of the AAAI Conference on Artificial Intelligence. 2025, 39(26): 27491-27499.

[7]

Jia R, Liang P. Adversarial examples for evaluating reading comprehension systems[C]. Proceedings of the 2017 Conference on Empirical Methods in Natural Language Processing, 2017: 2021-2031.

[8]

Ebrahimi J, Rao A, Lowd D, et al. Hotflip: White-box adversarial examples for text classification[C]. Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics (Volume 2: Short Papers), 2018: 31-36.

[9]

Gao J, Lanchantin J, Soffa M L, et al. Black-box generation of adversarial text sequences to evade deep learning classifiers[C]. 2018 IEEE Security and Privacy Workshops (SPW) IEEE, 2018: 50-56.

[10]

Wallace E, Feng S, Kandpal N, et al. Universal adversarial triggers for attacking and analyzing NLP[C]. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-JCNLP), 2019:2153-2162.

[11]

Li J, Ji S, Du T, et al. Textbugger: Generating adversarial text against real-world applications[J]. arXiv preprint arXiv:2018.

[12]

Tong X, Wang L, Wang R, et al. A generation method of word-level adversarial samples for Chinese text classification[J]. Netinfo Secur, 2020, 20(9): 12-16.

[13]

Han Z Y, Wang W, Xuan S C. Chinese adversarial example generation guided by multi-constraints[J]. Journal of Chinese Information Processing, 2023, 37(2): 41-52.

[14]

Cao X, Dawa D, Qun N, et al. Pay attention to the robustness of Chinese minority language models! Syllable-level textual adversarial attack on Tibetan script[C]. Proceedings of the 3rd Workshop on Trustworthy Natural Language Processing (TrustNLP 2023), 2023: 35-46.

[15]

Wang C, Zeng J, Wu C. Generating fluent Chinese adversarial examples for sentiment classification[C]. 2020 IEEE 14th International Conference on Anti-counterfeiting, Security, and Identification (ASID). IEEE, 2020: 149-154.

[16]

Zhang J, Kazhuo D, Gadeng L, et al. Research and application of tibetan pre-training language model based on bert[C]. Proceedings of the 2022 2nd International Conference on Control and Intelligent Robotics, 2022: 519-524.

[17]

Yang Z, Xu Z, Cui Y, et al. CINO: A Chinese minority pre-trained language model[J]. arXiv preprint arXiv:2022.

[18]

Papernot N, McDaniel P, Jha S, et al. The limitations of deep learning in adversarial settings[C]. 2016 IEEE European Symposium on Security and Rrivacy (EuroSP). IEEE, 2016: 372-387.

[19]

Ghorbani H. Mahalanobis distance and its application for detecting multivariate outliers[J]. Facta Universitatis, Series: Mathematics and Informatics, 2019: 583-595.

[20]

Fletcher S, Islam M Z. Comparing sets of patterns with the Jaccard index[J]. Australasian Journal of Information Systems, 2018, 22.

[21]

Ren S, Deng Y, He K, et al. Generating natural language adversarial examples through probability weighted word saliency[C]. Proceedings of the 57th annual meeting of the association for computational linguistics, 2019: 1085-1097.

[22]

Grave E, Bojanowski P, Gupta P, et al. Learning word vectors for 157 languages[C]. Proceedings of the Eleventh International Conference on Language Resources and Evaluation (LREC 2018),2018:1690-1696.

[23]

Cer D, Yang Y, Kong S, et al. Universal sentence encoder for English[C]. Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing: System Demonstrations, 2018: 169-174.

[24]

Qun N, Li X, Qiu X, et al. End-to-end neural text classification for tibetan[C]. International Symposium on Natural Language Processing Based on Naturally Annotated Big Data. Cham: Springer International Publishing, 2017: 472-480.

[25]

Zhu Y, Deji K, Qun N, et al. Sentiment analysis of tibetan short texts based on graphical neural networks and pre-training models[J]. Journal of Chinese Information Processing, 2023, 37(2): 71-79.

基金资助

西藏自治区自然科学基金重点项目(XZ202401ZR0040)

新一代人工智能国家科技重大专项项目(2022ZD0116100)

AI Summary AI Mindmap
PDF (1050KB)

39

访问

0

被引

详细

导航
相关文章

AI思维导图

/