基于动态-分层-对抗协同优化的知识增强BERT文本分类模型

孙豪 ,  蒲亦非

四川大学学报(自然科学版) ›› 2026, Vol. 63 ›› Issue (03) : 250213 -250213.

PDF (929KB)
四川大学学报(自然科学版) ›› 2026, Vol. 63 ›› Issue (03) : 250213 -250213. DOI: 10.19907/j.0490-6756.250213
计算机科学

基于动态-分层-对抗协同优化的知识增强BERT文本分类模型

作者信息 +

Classification: A triple enhancement framework combining dynamic, hierarchical, and adversarial mechanisms

Author information +
文章历史 +
PDF (950K)

摘要

像BERT这样的预训练语言模型擅长捕捉通用语言模式,但由于缺乏结构化知识,在特定领域的文本分类中表现不佳。为了使模型在特定领域拥有出色的推理能力,知识注入逐渐成为主流。然而,过度的知识融合会改变句子的正确含义,导致知识噪声(Knowledge Noise, KN)问题。为了克服领域特定知识缺口和知识噪声在文本分类领域的影响,本文提出了一个三重增强的BERT框架,具体包括: 1) 知识增强动态注意力(Knowledge-Enhanced Dynamic Attention, KEDA); 2) 分层知识融合网络(Hierarchical Knowledge Fusion Network, HKFN); 3) 对抗性知识正则化(Adversarial Knowledge Regularizer,AKR)。在7个不同领域的语料库上进行的文本分类实验表明,本文所提模型与之前的模型相比,性能有显著提升。

Abstract

Pre-trained language models like BERT excel at capturing general linguistic patterns but often underperform in domain-specific text classification due to a lack of structured knowledge. To enhance reasoning capabilities in specialized domains, knowledge injection has emerged as a mainstream approach. However, excessive knowledge fusion may distort the original semantics of sentences, leading to Knowledge Noise (KN). To address domain-specific knowledge gaps and mitigate the impact of KN in text classification, we propose a triple-enhanced BERT framework that integrates a Knowledge-Enhanced Dynamic Attention (KEDA),a Hierarchical Knowledge Fusion Network (HKFN), and an Adversarial Knowledge Regularizer (AKR). Experimental results on seven diverse domain-specific corpora demonstrate that our model significantly outperforms existing baselines.

Graphical abstract

关键词

知识增强 / 动态注意力 / 分层知识融合 / 知识正则化 / 文本分类

Key words

knowledge-enhanced / dynamic attention / hierarchical knowledge fusion / knowledge regularization / text classification

引用本文

引用格式 ▾
孙豪,蒲亦非. 基于动态-分层-对抗协同优化的知识增强BERT文本分类模型[J]. 四川大学学报(自然科学版), 2026, 63(03): 250213-250213 DOI:10.19907/j.0490-6756.250213

登录浏览全文

4963

注册一个新账户 忘记密码

文本分类是自然语言处理(Natural Language Processing,NLP)中的一项关键任务,广泛应用于观点挖掘、社交媒体分析和客户反馈评估1-3。传统方法依赖基于词典的方法4和带有人工特征的机器学习模型5。然而,这些方法难以处理语义复杂且依赖上下文的情感表达6
随着深度学习的兴起,神经网络尤其是像 BERT7 这样的预训练语言模型,显著提升了文本分类的性能。近期研究探索了各种方法来增强 BERT的文本分类能力,包括知识注入8-9、分层建模10-12和对抗训练13。例如,Zhu等将情感词典集成到BERT中以改进极性检测14。Liu等提出了K-BERT模型8,将知识图谱中的实体和关系信息融入模型输入,以增强模型的知识表示能力;而 Yang等提出了一个分层注意力网络来捕捉文档级别的情感结构15。此外,对抗训练技术16已被用来增强模型对噪声和对抗输入的鲁棒性。
我们在7个开放领域中文NLP基准数据集上评估了本文模型,包括Book_review单句分类数据集、LCQMC双句分类数据集以及LSHT长文本分类数据集。实验结果表明,本文模型在大多数数据集上都取得了更好的性能,在Book_review和LCQMC数据集上的F1分数分别比基线BERT模型提高了2.8%和2.6%.消融研究进一步证实,每种增强机制都对整体性能有显著的贡献,从而验证了它们的互补性。

1 相关工作

我们的工作基于文本分类的3个关键研究方向:1) 知识增强型语言模型;2) 分层情感模型;3) 自然语言处理中的对抗鲁棒性。我们回顾了每个领域最相关的研究,并重点介绍了我们的方法在相关领域是如何发挥作用的。

传统的文本分类依赖于基于词典的方法5和带有人工设计特征的统计模型17。随着深度学习的出现,研究人员开始将外部知识融入神经网络。Kim提出使用情感词典来增强CNN模型18,而 Zhou等则为LSTM开发了基于知识的注意力机制19。近期的研究重点是将知识融入预训练的语言模型中。Liang提出一种在医学知识图谱中建模子图的方法20,将学习到的知识与预训练语言模型相结合,从而泛化知识,并在医学领域的自然语言处理任务中展现出更高的性能。然而,大多数现有方法采用静态知识集成,无法适应不同的上下文环境。我们的知识增强动态注意力(Knowledge-Enhanced Dynamic Attention,KEDA)通过根据上下文相关性动态调整知识整合21,解决了这一局限性。

分层方法已被证明对文档级文本分类有效。Yang 等率先提出了分层注意力网络15,分别对单词级和句子级特征进行建模。后续研究将其扩展到多粒度文本分类22,最近的方法采用基于图的架构来捕捉语言单元之间的关系23。尽管这些方法表现出良好的效果,但它们通常是按顺序处理而不是联合处理不同级别,这可能导致误差的传播。我们提出的分层知识融合网络(Hierarchical Knowledge Fusion Network, HKFN)创新之处在于,它通过统一的注意力机制同时对多个语言层级进行建模,并在每个网络深度自动选择合适的知识类型。

对抗训练已成为提升模型鲁棒性的有力技术24。早期研究将通用对抗训练应用于文本分类25-26,而后期方法则开发了针对特定情绪的对抗样本27。然而,当前方法通常会产生扰动,没有考虑特定情绪的漏洞28。我们的对抗性知识正则化 (Adversarial Knowledge Regularizer, AKR)通过引入知识鉴别器来推进这项工作,该鉴别器确保所选知识与文本语义保持一致,同时专门的损失函数则可抵御针对特定情绪的攻击。

有研究尝试结合多种增强策略。例如,一些系统将知识注入与分层建模相结合29,而另一些系统将知识图谱与对抗训练相结合30。然而,这些方法通常只涉及我们考虑的3个关键方面中的2个。我们的框架首次将动态知识适应、分层知识融合和对抗性知识正则化同时纳入统一架构,这已由全面的实验结果证实。

2 方法

我们提出的模型引入了3项关键创新,以提升知识增强型BERT在文本分类任务中的表现:1) 知识增强动态注意力(KEDA); 2) 分层知识融合网络(HKFN); 3) 对抗性知识正则化(AKR)。图1展示了我们模型的整体架构。该架构将这些组件与BERT主干模型集成,以在知识密集型分类任务中取得卓越的性能。

2.1 知识增强动态注意力

Transformer 模型中的传统注意力机制通常仅关注文本上下文,而忽略了外部知识库中丰富的语义信息。我们的 KEDA 模块通过学习门控机制31,在基于文本和基于知识的表示之间实现动态平衡。

2.1.1 投影层

我们首先将两种表示投影到共同的语义空间,然后投影层执行仿射变换。

T'=tanh Wt T+bt
K'=tanh WkK+bk

式(1)式(2)中,WtWkRh×h为可学习的投影矩阵,btbkRh为偏置项,tanh确保输出的正则化。通过独立的线性变换,将异构的文本T和知识表示K映射到统一的语义空间。当文本和知识向量来自不同的预训练模型(例如BERT文本向量和TransE知识向量)时,此操作可以消除表示差异。

2.1.2 门控机制

注意力权重gRb×s×1 的计算如式(3)所示。

g=σWgT';K'+bg

其中,WgR2h×1为可学习的门控权重矩阵,σ为sigmoid激活函数。通过门控值g[0,1]b×s×1实现细粒度的token级融合。激活函数选择sigmoid是因为它允许两种模式同时被激活,并且冲突信息会保持动态平衡(门控值稳定)。

2.1.3 融合操作

最终输出结合了两种表示形式,如式(4)所示。

O=gT'+1-gK'

其中,表示乘以元素。门控机制生成两条梯度路径,如式(5)式(6)所示。

T'=gO
K'=1-gO

其中,T'控制文本特征T'的更新强度:门控值g越大,更新的文本特征越多。同理,K'控制知识特征K'的更新强度:门控值1-g越大,更新的知识特征越多,该特性可以缓解多任务学习中的梯度冲突问题。

2.2 分层知识融合网络

HKFN以3种粒度处理知识,如表1所示。

2.2.1 词级融合

Hw=LayerNormReLUWwTKwbw

式(7)中, TRb×s×h表示文本输入向量,KwRb×s×h表示词级知识向量。文本表征 TRb×s×h和词级知识向量KwRb×s×h通过级联操作合并到特征维度,形成增强表征Rb×s×2h。这种设计使得模型能够明确地学习词单元与其对应知识实体(例如WordNet同义词集)之间的细粒度关联。

2.2.2 短语级处理

Hp=BiLSTMHw+Kp

式(8)中,KpRb×s×h表示通过残差连接注入的短语级别的知识嵌入。双向LSTM可正向和反向处理序列。输出Hp编码了语法结构和领域知识的联合表示。

2.2.3 文档级聚合

Hd=LayerNormCNNHp+Kd

式(9)中,KdRb×h表示文档级别的知识向量。一维卷积用于捕获长距离依赖关系,自适应最大池化用于将变长序列转换为定维表示,文档级别知识Hd作为偏差项来调整全局表示。

HKFN的模型框架结构以及数据处理流程如图2所示。在输入阶段,将文本向量T与词级知识Kw进行连接融合。在短语建模阶段,将BiLSTM处理后的输出逐位置添加到Kp中。最后,在文档聚合阶段,CNN提取全局特征并与Kd进行融合。梯度传播路径如式(10)所示。

Kw=HdHdHpHpHwHwKw

2.3 对抗性知识正则化

这部分通过对抗训练来优化知识选择,包括知识生成器G(生成知识表示)和知识鉴别器D(区分有用知识和噪声)两部分,如式(11)式(12)所示。

G:RhRh,Κ^=GΤ¯;θg=W2ReLUW1Τ¯+b1+b2
D:Rh0,1,p=DK;θd=σW4ReLUW3K+b3+b4

其中,Τ¯是文本的平均向量,Κ是真实知识,Κ^是生成知识。从全局文本特征中合成伪知识向量,迫使判别器学习更多判别性特征。p(0,1)是样本概率的准确率估计。

训练目标有两个,分别是对抗性损失和一致性损失,如式(13)式(14)所示。对抗性损失函数实现判别器D试图区分真实知识Κ和生成知识 Κ^,生成器G试图生成与真实知识分布一致的Κ^。一致性损失函数约束生成知识与真实知识之间的欧氏距离,梯度惩罚项λ用于提高训练的稳定性,防止模式崩溃。

adv=EKpdata[log D(K)]Maximize the discriminator+EΤ¯ptext[log (1-D(G(Τ¯)))]Minimize the generator
con=Κ^-Κ22+λΤ¯DGΤ¯2

3 实验

在本节中,为了评估我们提出的知识增强型BERT模型的有效性,我们对多个中文文本分类和自然语言理解任务进行了全面的实验。

3.1 实验设置

3.1.1 数据集

本文中,我们在7个开放领域中文NLP基准数据集上评估了我们的模型。其中,Book_review、Chnsenticorp、Shopping和Weibo是单句分类任务,LSHT是长文本分类任务,XNLI32和LCQMC33 是双句分类任务。

1) Book_review该数据集包含来自豆瓣的20 000条正面和20 000条负面评论样本,且分布均衡。

2) Chnsenticorp。该数据集是一个均衡的情绪分析数据集,包含12 000条酒店评论,其中6000条正面和6000条负面情绪标签样本分布均衡。

3) Shopping。该数据集是一个全面的电商评论语料库,汇集了40 000条带有情绪极性标注的产品评价。其中21 111条样本被归类为正面情绪,18 889条样本被归类为负面情绪。

4) Weibo。微博情绪分析语料库包含来自新浪微博的120 000条微博,其情绪标注均衡,包含60 000个正面和60 000个负面标注实例。

5) LSHT。该数据集是LongBench34数据集下的一个新闻文章长文本二分类数据集,包含24个类别共200条数据。每条数据实例的平均长度为22 337个token,标注科学合理。

6) XNLI。跨语言自然语言推理语料库是一个基准数据集,旨在评估跨语言语言理解能力。每个数据实例由标注了3种可能的语义关系之一的句子对组成:蕴涵、矛盾或中性,任务是确定它们之间的关系。

7) LCQMC。大规模中文问题匹配语料库是一个基准数据集,专门用于检测普通话问题对之间的语义等值性。该任务的目标是确定两个问题是否具有相似的意图。

上述每个数据集都分为3部分:训练集(Train)、验证集(Dev)和测试集(Test)。我们使用 Train部分对模型进行微调,然后在Dev和Test部分评估其性能。

3.1.2 知识图谱

我们采用了两个中文知识图谱:CN-DBpedia 和 HowNet。知识注入是在模型微调过程中进行的,而非预训练阶段,旨在避免通用语言表征中出现的语义扭曲。

1) CN-DBpedia35是由复旦大学知识工作实验室开发的一套全面的开放领域百科知识图谱,它涵盖了丰富的实体和关系,覆盖了数千万个实体和数亿个关系。本文对原始的CN-DBpedia 进行了处理,过滤了实体名称少于2个字符或包含特殊字符的三元组。最终,处理后的CN-DBpedia 包含超过500万个高质量的三元组,为后续分析提供了更可靠的可靠性和适用性。

2) HowNet36是一个涵盖中文词汇和概念表征的综合性语言知识库,其中每个中文词汇条目都由细粒度的语义单元系统地标注。通过将语义关系形式化为{word,contains,sememe}形式的三元组,HowNet可以在结构上表示为一个专门的语言知识图谱。

本研究通过严格的过滤标准对原始 HowNet知识库进行了严格的优化: a) 删除包含少于两个字符的词汇条目的三元组; b) 删除包含特殊字符的三元组。经过一系列处理,最终生成了一个包含超过 52 000 个三元组的HowNet版本。

3.1.3 对比模型

我们与最先进的预训练语言模型和知识增强变体进行了全面的比较,以严格评估我们的知识增强型BERT 框架。

1) BERT。作为基础基线,我们将其与在维基百科文本上预先训练的原始中文 BERT 模型进行比较。该模型通过其深度双向 Transformer 架构和掩码语言建模目标建立了基本的性能基准,无需任何显式的知识集成机制。

2) K-BERT。Liu等提出的 K-BERT变体8通过基于知识三元组的句子树转换、用于保留原始语义的软位置嵌入以及用于控制知识范围的可视化矩阵,构建了结构化知识图谱。与本文方法不同,K-BERT采用静态知识注入,没有动态注意力机制或逐层融合。

3) RoBERTa。该模型引入了Liu等37提出的模型的优化版本,通过在预训练期间使用动态掩蔽模式、增加批量大小和延长训练时间以及移除下一个句子预测目标,实现了卓越的性能。此比较有助于区分我们的知识增强和优化训练策略的优势。

4) ERNIE。百度的Sun等38开发的模型代表了一种替代的知识集成方法,其特点包括预训练期间的实体级掩蔽、多粒度语义单元和语篇关系学习。ERNIE 的知识模式对比学习与我们基于图的显式增强方法有着根本的不同。如表2所示,架构差异导致知识利用的特点不同。

5) ERNIE3.0。百度的Sun等在ERNIE的基础上研发的多范式统一框架9,通过实体级、短语级和文档级的三阶段掩码策略,在预训练中实现知识的多粒度融合,采用动态回放缓冲区缓解知识遗忘问题,在增量式知识注入场景中表现突出。该模型的知识模式对比我们模型的显式增强方法还是存在根本的不同。

6) DeepSeek-v3。深度求索发布的MoE架构大模型39,该模型基于200万条中文分类指令数据,采用三阶段微调策略(通用指令→领域适应→任务专项),显著提升零样本分类能力。此比较主要是对比零样本能力和知识增强必要性40

7) ROME-TC全称是“ROME for Text Classification”,指基于 ROME(Rank-One Model Editing)41知识编辑方法改造的文本分类专用模型,而ROME是斯坦福大学提出的知识编辑方法,核心思想是通过低秩分解直接修改预训练模型的参数,无需微调即可动态更新知识。此比较在知识更新粒度层面比较参数级编辑和表示层动态融合两种不同的动态性实现方式的优劣。

表2中,√表示完全支持,△表示部分支持,×表示不支持。这个系统化的比较框架使我们能够将性能提升精确地归因于我们具体的架构创新,而非所有基于 Transformer 的模型所共有的通用优化技术。

3.1.4 参数设置和训练细节

我们的知识增强型BERT模型的超参数详情如表3所示。

我们根据开发集上的表现,将对抗损失权重设置为0.5,一致性损失权重设置为0.1。所有实验均在NVIDIA V100 GPU上进行,并采用混合精度训练以加速收敛。

3.2 实验结果

我们在7个中文NLP基准上对所有模型进行了评估,结果如表4表5所示。为了进行完整的比较,我们展示了开发(Dev)和测试(Test)集在多个指标上的性能。

表4表5中,CN代表CN-DBpedia,HN代表HowNet。每组中相对最优的结果以粗体显示。BERT表示相对于BERT基线的F1分数改进。指标报告为5次运行的平均值±标准差。我们的实验揭示了不同模型架构在不同任务中的差异化性能。RoBERTa在微博(Test 98.7%准确率)任务中表现最佳,这得益于其动态掩蔽策略对社交媒体文本和推理任务的适应性,以及其在短文本中捕捉上下文信息的能力。ERNIE在Book_review(Test 88.5%准确率)任务中取得了较好的成绩,验证了其实体级预训练对细粒度书评分析的有效性。ERNIE3.0在长文本任务(LSHT,Test 86.9%准确率)和书评分类(Book_review,Test 88.9%准确率)中表现突出,验证了其多粒度掩码策略和动态回放缓冲区对长文本建模的有效性(LSHT F1较BERT提升3.4%)。DeepSeek-v3在语义匹配任务(LCQMC,Test 89.2% F1)中表现优异,得益于其指令微调策略对零样本任务的适配性(较BERT提升2.3%)。K-BERT系列整体优于BERT,但在大多数领域落后于ERNIE/RoBERTa,这表明原有的知识注入方法存在局限性,可能由于过度依赖知识而降低微博等短文本的性能。当任务需要外部知识时,K-BERT可能表现更好,但需要知识图谱质量的支撑。

尽管模型性能与KG质量相关,但我们的知识增强动态注意力机制(KEDA)通过门控权重实现了知识的选择性融合。如表4所示,在HowNet覆盖率较低的Shopping数据集(事实密集型任务)中,模型(HN)性能仍优于静态知识注入的K-BERT(97.3% vs 97.0%),表明动态机制能有效过滤低质量知识。此外,对抗性知识正则化(AKR)通过知识鉴别器[式(12)]进一步抑制噪声,消融实验(表7)显示AKR移除后Chnsenticorp任务F1分数下降0.4%,验证了其对知识一致性的保障作用。

我们的模型显示出知识类型与任务特征之间的显著相关性。我们的模型(CN)在事实密集型任务购物(97.7% Test)和LCQMC(88.3% Test)中取得了最佳结果,这得益于其百科三元组提供了实体关系支持[=1.4% vs K-BERT (CN)]。产品属性识别(Shopping)的准确率提升尤为显著(2.1% vs ERNIE)。得益于语义网络对情感极性词的细粒度建模,我们的模型(HN)在Chnsenticorp文本分类(96.6% Test)中表现最佳。XNLI推理任务(77.4% Test)的提升超过了CN-DBpedia版本(77.5% vs 77.4%),但差异并不显著。从表4表5可以发现,ROME-TC采用参数级编辑(低秩分解修改模型参数),虽支持动态知识更新,但在复杂任务(如LCQMC)中表现并不稳定。我们的模型通过表示层动态融合(KEDA门控机制),在保留原始语义的同时,自适应调整知识权重,避免参数篡改导致的语义失真(如Weibo任务中98.6% vs ROME-TC 97.9%)。

此外,从表5可以看出,我们的模型(CN)在所有Book_review任务和LCQMC任务中都表现出最佳的精确度-召回率平衡。在Book_review数据集中,精确度(89.1%)与召回率(88.3%)的差异仅为0.8%,显著小于BERT的1.5%,表明知识增强有效缓解了情感极性的误判问题。在LCQMC数据集中,在保持较高精确度(90.1%)的同时,召回率提升了3.0%,这表明CN-DBpedia关系三元组能够提升问答对的深度语义匹配能力。对于百科知识(CN-DBpedia),我们的模型在事实类任务LCQMC中取得了最高的F1值(88.8%),这主要得益于准确率的提升(1.2% vs ERNIE),并通过实体关系消歧降低了产品属性的误判率。值得注意的是,从表4表5的数据可见,ERNIE3.0在LSHT任务上的F1分数为86.7%,而我们的模型(CN)为86.3%(差距0.4%)。这一差异可能ERNIE3.0采用三阶段掩码策略(实体→短语→文档级)和动态回放缓冲区,有效缓解长文本中的知识遗忘问题。相比之下,我们的模型虽通过分层知识融合网络(HKFN)捕捉多粒度特征,但在超长序列的全局知识整合上可能稍显不足。此外,ERNIE3.0在预训练阶段显式优化了长文档建模(如篇章关系学习),而本文方法侧重于微调阶段的知识增强,对长距离依赖的建模可能不够充分。DeepSeek-v3在零样本任务(如LCQMC,Test 88.0% F1)上表现优异,但其依赖指令微调(200万条指令数据),在知识密集型任务(如Shopping)上弱于本文的模型(97.7% vs 96.8%)。DeepSeek-v3未显式集成知识图谱,而本文模型通过CN-DBpedia/HowNet的结构化知识增强,在实体关系推理(如LCQMC)和情感分析(如Book_review)任务中表现更稳定(F1波动标准差≤0.3%)。

本文模型在大多数任务上取得了最优或相当最优的效果。知识图谱的选择应遵循“事实任务用百科,语义任务用词典”的原则。动态融合机制显著优于静态注入(K-BERT)和参数编辑(ROME-TC)。传统模型(例如RoBERTa)在特定领域仍然具有竞争力,但我们的模型表现出更稳定的跨任务适应性。

表6中可以发现,我们的模型参数量(135×106)介于ERNIE(130×106)和ERNIE3.0(140×106)之间,计算复杂度(3.2×10-9 FLOPs)略高于RoBERTa(2.7×10-9),但低于ERNIE3.0(3.5×10-9)。这一设计在引入知识增强动态注意力(KEDA)、分层知识融合网络(HKFN)和对抗性知识正则化(AKR)的同时,通过门控机制和梯度路径优化控制了计算开销,使其在性能提升与效率之间达到平衡。相较于静态知识注入的K-BERT(2.8×10-9 FLOPs),我们的动态融合策略虽增加少量计算,但显著提升了任务适应性(如LCQMC任务F1+2.6%)。

3.3 消融实验

为了了解框架中每个组件的贡献,我们进行了消融实验,每次移除一个模块,同时保留其他组件。实验结果如表7所示。括号中的值表示相对于完整模型的性能下降。结果取5次运行的平均值,标准差0.4%。

表7可知:1) KEDA对结果的影响最大,消融研究揭示了清晰的性能影响层次:KEDAHKFNAKR,性能下降最大的情况是移除知识增强注意力(LCQMC上的F1为-2.3%),凸显了其作为我们架构基石的作用;2) 这些组件在不同任务类型中表现出不同的重要性,KEDA在语义匹配任务(LCQMC/XNL)中占据主导地位,其影响力是文本分类任务的2.1倍,HKFN在所有任务中都表现出一致的优势,反映了分层知识整合的普遍价值,AKR对情感任务至关重要(Chnsenticorp的F1下降了0.4%,LCQMC的F1下降了0.9%),这可能是由于情感表达的高度主观性;3) 虽然AKR对峰值性能的影响有限,但它显著增强了模型的鲁棒性。总的来说,这些发现为知识增强型Transformer的设计提供了重要的指导原则42,即优先考虑知识的动态选择和分层融合,并辅以稳定性优化43。未来的工作可以进一步探索组件间非线性相互作用的机制。

4 结论

本文提出一个基于知识增强的BERT文本分类框架,该框架集成了知识增强动态注意力(KEDA)、分层知识融合网络(HKFN)和对抗性知识正则化(AKR)。在7个中文自然语言处理基准测试的实验结果显示,该框架相较于基线模型取得了显著提升,验证了本文的核心假设:自适应知识集成、多粒度特征学习和情感感知对抗训练能够共同提升模型在特定领域文本分类中的表现。

尽管我们的模型具有诸多优势,但也存在局限性:1) 知识依赖性:性能随知识图谱(KG)质量而变化(例如,CN-DBpedia在事实类任务中表现出色,而HowNet在语义类任务中表现出色),低覆盖率的知识图谱可能会限制泛化能力;2) 计算成本:三重增强会增加参数(表6),这可能会阻碍在资源受限的环境中部署;3) 语言和领域限制:实验主要针对中文;跨语言适用性(例如,使用 XNLI1)尚待探索。4) 对长文本44可能会出现冗余token的大量注入问题,会导致理解上出现偏差。在未来的工作中,我们将深入研究上述问题,探索混合知识源、自监督知识对齐和交互式对抗性训练,以进一步提升模型的文本分类能力和实用性。具体来说,我们继续研究将模型扩展到多语言/多模态环境(例如,结合视觉/音频线索),开发轻量级变体(例如,通过知识蒸馏)以提高效率,研究细粒度的对抗防御(例如,针对讽刺/反语)。

参考文献

[1]

Zhu XSobihani PGuo H.Long short-term memory over recursive structures [C]//International Conference on Machine Learning, 2015: 1604-1612.

[2]

Yao LMao CLuo Y.Graph convolutional networks for text classification [C].Proc AAAI Conf Artif Intell, 201933(1): 7370-7377.

[3]

Liu X MLi C Z XWu S Cet al.A survey on text classification algorithms and their application scenarios [J].Chinese Journal of Computers202447(6): 1244-1287.

[4]

Lewis DRinguette M.A comparison of two learning algorithms for text categorization [C]//Proceedings of the Third Annual Symposium on Document Analysis and Information Retrieval, 1994: 81-93.

[5]

Zhang YJin RZhou Z H.Understanding bag-of-words model: A statistical framework [J].Int J Mach Learn Cybern20101(1): 43-52.

[6]

Bengio YSchwenk HSenécal J Set al.Neural probabilistic language models [M]//Holmes D, Jain L C.Innovations in machine learning: Theory and applications.Berlin,Heidelberg:Springer, 2006: 137-186.

[7]

Devlin JChang M WLee Ket al.BERT: Pre-training of deep bidirectional transformers for language understanding [C]//Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL-HLT 2019), 2019: 4171-4186.

[8]

Liu WZhou PZhao Zet al.K-BERT: Enabling language representation with knowledge graph [C].Proceedings of the AAAI Conference on Artificial Intelligence, 202034(3): 2901-2908.

[9]

Sun YWang SFeng Set al.Ernie 3.0: Large-scale knowledge enhanced pre-training for language understanding and generation [PP/OL].V1.arxiv(2021-07-05)[2025-06-11].

[10]

Yekrangi MNikolov N S.Domain-specific sentiment analysis: An optimized deep learning approach for the financial markets [J].IEEE Access202311: 70248-70262.

[11]

Kong JWang JZhang X.Hierarchical BERT with an adaptive fine-tuning strategy for document classification [J].Knowl Based Syst2022238: 107872.

[12]

Onan A.Hierarchical graph-based text classification framework with contextual node embedding and BERT-based dynamic fusion[J].J King Saud Univ Comput Inf Sci202335(7): 101610.

[13]

Karimi ARossi LPrati A.Adversarial training for aspect-based sentiment analysis with BERT [C]//2020 25th International Conference on Pattern Recognition (ICPR), 2021: 8797-8804.

[14]

Zhu WCheung D.Lex-BERT: Enhancing bert based ner with lexicons [PP/OL].V2.arXiv(2021-04-16)[2025-06-11].

[15]

Yang ZYang DDyer Cet al.Hierarchical attention networks for document classification [C]//Proceedings of the 2016 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL- HLT 2016), 2016: 1480-1489.

[16]

Zhang TLin HXu Bet al.Adversarial neural network with sentiment-aware attention for detecting adverse drug reactions [J].J Biomed Inform2021123: 103896.

[17]

Salton GBuckley C.Term-weighting approaches in automatic text retrieval [J].Inf Process Manag198824(5): 513-523.

[18]

Kim Y.Convolutional neural networks for sentence classification [C]//Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing (EMNLP), 2014: 1746-1751.

[19]

Zhou PShi WTian Jet al.Attention-based bidirectional long short-term memory networks for relation classification [C]//Proceedings of the 54th Annual Meeting of the Association for Computational Linguistics (ACL 2016), 2016: 207-212.

[20]

Liang BSu HGui Let al.Aspect-based sentiment analysis via affective knowledge enhanced graph convolutional networks [J].Knowl Based Syst2022235: 107643.

[21]

Yin DMeng TChang K W.SentiBERT: A transferable transformer-based architecture for compositional sentiment semantics [C]//Findings of the Association for Computational Linguistics: ACL 2020, 2020: 2499-2510.

[22]

Fan FFeng YZhao D.Multi-grained attention network for aspect-level sentiment classification [C]//Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing (EMNLP 2018), 2018: 3433-3442.

[23]

Yao LMao CLuo Y.Graph convolutional networks for text classification [C].Proc AAAI Conf Artif Intell, 201933(1): 7370-7377.

[24]

Liu Y WSun Z W. Intrusion detection model based on generative adversarial networks in IWSN against adversarial attacks [J].Journal of Jiangsu University(Natural Science Edition)202546(5): 562-569.

[25]

刘悦文,孙子文.抵御对抗攻击的生成对抗网络IWSN入侵检测模型[J].江苏大学学报(自然科学版)202546(5): 562-569.

[26]

Miyato TDai A MGoodfellow Iet al.Virtual adversarial training: A regularization method for supervised and semi-supervised learning [J].IEEE T Pattern Anal201941(8): 1979-1993.

[27]

Guo CSablayrolles AJégou Het al.Gradient-based adversarial attacks against text transformers [C]//Advances in Neural Information Processing Systems 34 (NeurIPS 2021), 2021: 16899-16910.

[28]

Zhang W ESheng Q ZAlhazmi Aet al.Adversarial attacks on deep-learning models in natural language processing: A survey [J].ACM T Intell Syst Tec202011(3): 1-41.

[29]

Hu DBao YWei Let al.Supervised adversarial contrastive learning for emotion recognition in conversations [PP/OL].V2.arxiv(2023-07-09)[2025-06-04].

[30]

Sun SSun QZhou Ket al.Hierarchical attention prototypical networks for few-shot text classification [C]//Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP 2019), 2019: 476-485.

[31]

Zhu CXu YRen Xet al.Knowledge-augmented methods for natural language processing [C]//Proceedings of the Sixteenth ACM International Conference on Web Search and Data Mining, 2023: 1228-1231.

[32]

Apté CDamerau FWeiss S M.Automated learning of decision rules for text categorization [J].ACM T Inform Syst199412(3): 233-251.

[33]

Conneau ALample GRinott Ret al.XNLI: Evaluating cross-lingual sentence representations [C]//Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing, 2018: 2475-2485.

[34]

Liu XChen QDeng Cet al.LCQMC: A large-scale Chinese question matching corpus [C]//Proceedings of the 27th International Conference on Computational Linguistics (COLING 2018), 2018: 1952-1962.

[35]

Bai YTu SZhang Jet al.LongBench v2: Towards deeper understanding and reasoning on realistic long-context multitasks [PP/OL].V2.arXiv(2025-01-03)[2025-06-04].

[36]

Xu BXu YLiang Jet al.CN-DBpedia: A never-ending Chinese knowledge extraction system [M]//Advances in artificial intelligence: From theory to practice.Cham: Springer, 2017: 428-439.

[37]

Dong ZDong Q.HowNet-a hybrid language and knowledge resource [C]//Proceedings of the International Conference on Natural Language Processing and Knowledge Engineering, 2023: 820-825.

[38]

Liu YOtt MGoyal Net al.RoBERTa: A robustly optimized BERT pretraining approach [C/OL]//ICLR, 2020.

[39]

Sun YWang SLi Yet al.ERNIE: Enhanced representation through knowledge integration [PP/OL].V1.arXiv(2019-04-19)[2025-06-11].

[40]

Liu AFeng BXue Bet al.DeepSeek-V3 technical report[PP/OL].V2.arXiv(2025-02-18)[2025-06-04].

[41]

Chen Y YLi W J.Dialogue emotion recognition based on dual-graph fusion integrating time series and knowledge enhancement [J].Journal of Chongqing University of Posts and Telecommunications(Natural Science Edition)202436(5): 974-982.

[42]

陈晏伊,李卫疆.融合时间序列和知识增强的双图融合对话情感识别[J].重庆邮电大学学报(自然科学版)202436(5): 974-982.

[43]

Andonian ABau DBelinkov Yet al.Locating and editing factual associations in GPT [C]//NeurIPS, 202235: 17359-17372.

[44]

Xia YChen H.Trajectory classification network fusing Transformer and convolutional LSTM [J].Journal of Chongqing University of Posts and Telecommunications(Natural Science Edition)202436(1): 29-38.

[45]

夏英,陈航.融合Transformer和卷积LSTM的轨迹分类网络[J].重庆邮电大学学报(自然科学版)202436(1): 29-38.

[46]

Jiang HHe PChen Wet al.SMART: Robust and efficient fine-tuning for pre-trained natural language models through principled regularized optimization [C]//Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, 2020: 2179-2190.

[47]

Beltagy IPeters M ECohan A.Longformer: The long-document transformer [J].T Assoc Comput Ling20219: 663-681.

基金资助

国家自然科学基金面上项目(62171303)

中国兵器装备集团(成都)火控技术中心项目(非密)(HK20-03)

国家重点研发项目(2018YFC0830300)

AI Summary AI Mindmap
PDF (929KB)

183

访问

0

被引

详细

导航
相关文章

AI思维导图

/