融合大语言模型和证据抽取的事实核查模型

何富威, 张仕斌, 卢嘉中, 李晓瑜

武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (4) : 485 -494.

PDF (1197KB)
武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (4) : 485 -494. DOI: 10.14188/j.1671-8836.2024.0067
人工智能与深度学习

融合大语言模型和证据抽取的事实核查模型

    何富威1, 2, 3, 张仕斌1, 2, 3, 卢嘉中1, 2, 3, 李晓瑜4
作者信息 +

Fact Verification Model Integrating on Large Language Model and Evidence Extraction Modules

    Fuwei HE1, 2, 3, Shibin ZHANG1, 2, 3, Jiazhong LU1, 2, 3, Xiaoyu LI4
Author information +
文章历史 +
PDF (1225K)

摘要

基于事实信息的核查是目前不实信息核查研究的主流方法,但现有研究成果还存在文档检索中抽取的文档内容与待检测声明相关度不高、证据检索中忽略了句子间的内在联系以及声明验证中小语言模型的逻辑推理能力不足等问题。基于此,提出了一种融合大语言模型和证据抽取的事实核查模型。为提高待检测声明与文档内容的相关度,提出了DRCV(Document Retrieving for Claim Verification)文档检索算法;为了从文档中提取与声明最相关的句子作为证据,构建了“文档-声明对”训练证据检索模型,提出了基于关键词-注意力机制的证据检索方法;为增强模型的逻辑推理能力和提高事实核查的准确度,开发了基于大语言模型的声明验证模型,该模型选取参数量从5亿至1 300亿的七款大语言模型对声明进行验证,并利用其逻辑推理能力核查声明的事实性。基于真实数据集对提出的事实核查模型进行仿真实验,结果表明该模型进行事实核查的准确率比仅使用大语言模型高0.1%~34.0%,且比现有效果最好的模型准确率高1.8%。

Abstract

Fact-based verification is currently the mainstream method used in research on misinformation verification. However, existing research results have issues such as the low relevance between the document content extracted during document retrieval and the statements to be verified, the neglect of the intrinsic connections between sentences in evidence retrieval, and the insufficient logical reasoning ability of small language models in statement verification. To address these issues, a fact-checking model that integrates large language models and evidence extraction has been proposed. To enhance the relevance between the statements to be verified and the document content, a document retrieval for claim verification(DRCV) document retrieval algorithm was introduced. To extract the most relevant sentences from documents as evidence, a “document-statement pair” training evidence retrieval model was constructed, along with a keyword-attention mechanism-based evidence retrieval method. To improve the model’s logical reasoning capability and increase the accuracy of fact-checking, a statement verification model based on large language models was developed. This model selects seven large language models with parameter sizes ranging from 500 million to 130 billion to verify statements and utilizes their logical reasoning abilities to check the facts of statements. Simulation experiments was conducted on real datasets to evaluate the proposed fact-checking model. The results indicate that the accuracy of fact-checking using this model is 0.1% to 34.0% higher than that of models using only large language models, and it surpasses the accuracy of the currently best-performing model by 1.8%.

Graphical abstract

引用本文

引用格式 ▾
何富威, 张仕斌, 卢嘉中, 李晓瑜. 融合大语言模型和证据抽取的事实核查模型[J]. 武汉大学学报(理学版), 2025, 71(4): 485-494 DOI:10.14188/j.1671-8836.2024.0067

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

近年来,随着互联网及应用飞速发展,虚假信息在网络上快速蔓延,给政治[1]和公共卫生[2]等领域带来了巨大的负面影响。尽管专业事实核查人员能够识别互联网中的虚假信息,但传统人工核查方式难以跟上互联网中虚假信息的日益泛滥。因此,研究者们开始研究利用人工智能技术对虚假信息进行自动化核查[3-5]。虚假信息自动化核查一般分为两类:基于内容模式的事实核查和基于事实信息的事实核查[6]。基于内容模式的事实核查侧重于学习训练数据集中待检测信息的各种特征(如语言特征[3]、情绪模式[4]和传播模式[5]等),虽然该方法已取得了一些成果,但其学习特征依赖于特定数据集,验证效果可能因平台而异[7],且数据集的时效性和大语言模型的出现也可能导致新出现的虚假信息难以识别[8-10]

为了解决这些问题并提高核查的准确率,研究者们转向基于事实信息的事实核查方法,并提出了多种基于事实信息的事实核查模型[11-17]。该类模型通过比对声明中所描述的各种事实信息(如时间、地点、人物等)核查事实的真伪。基于事实信息的核查通常包括文档检索、证据检索和声明验证三个步骤[11]。然而,现有的文档检索方法[11-12]抽取的文档内容与待检测声明相关度不高;在证据检索中,现有方法[1113]忽略了文档句子间的内在联系,导致检索的句子不足以作为证据来核查待检测声明内容;在声明验证中,现有方法[11-14]均使用小语言模型,与现有的大语言模型数十亿级的参数量和TB级的预训练数据集[18-19]相比,小语言模型的参数量和预训练数据集与大语言模型存在1~3个数量级的差距,因此在声明验证这种复杂逻辑任务上,由于小语言模型缺乏足够强的逻辑推理能力[20],难以准确分析检索到的证据。

因此,本文对基于事实信息的核查方法的三个步骤进行了优化,提出了一种融合大语言模型和证据抽取的事实核查模型。为提高待检测声明与从海量文档中抽取出的文档内容的相关度,提出了DRCV(Document Retrieving for Claim Verification)文档检索算法;将文档内容视为整体,构建了“文档-声明对”训练证据检索模型,并提出了基于关键词-注意力机制的证据检索方法,以筛选出与声明最相关的句子作为证据;为提高事实核查的准确率,本文将检索到的句子证据和声明进行组合,选取参数量从5亿至1 300亿的七款大语言模型度对声明进行验证,并利用其逻辑推理能力核查事实。

1  相关工作

1.1 文档检索

文档检索是指从大量待检索文档中抽取出与待检测声明相关的文档。Thorne等[11]提出利用词频和逆文档频率作为抽取文档依据的TF-IDF算法,仅依靠词频来衡量文章中词语的重要性不够全面;Hanselowski等[15]在TF-IDF算法的基础上利用实体识别提取文档中的关键词;Jiang等[13]同时采用BM25算法和WikiMedia API对文档进行搜索。以上文档检索方法抽取的文档与待检测声明文档的相关度不高,导致文档内的句子不足以核查待检测声明文档。因此,文档检索应着眼于提高抽取的文档内容与待检测声明相关度的研究,以便在证据检索得到与待检测声明紧密相关的句子作为证据。

1.2 证据检索

证据检索是指从检索文档中抽取出与待检测声明相关的句子,并将这些句子作为证据输出到声明验证阶段。Hanselowski等[15]和Soleimani等[16]提出的Point-Wise方法将句子与输入声明的相关性作为标签,没有考虑到句子能够作为声明真实性的依据;Dehaven等[14]在Point-Wise方法的基础上增加了三分类模块,根据声明的真实性添加了真实、虚假和没有足够信息的标签。然而,这些方法将文档拆分为句子的集合,以句子为单位与声明进行比较,忽略了文档中句子间的内在联系和逻辑关系。因此,在证据检索研究中可以将文档视为一个整体与声明进行比较,这样既保留了文档中句子间的内在联系,还可以提高证据检索的质量。

1.3 声明验证

声明验证是利用证据检索得到的句子中包含的客观事实与声明中的内容进行对比,以核查该声明的事实性进行核查。Hanselowski等[15]将检索出的句子集合中的每条句子作为证据和声明进行简单拼接形成一个“证据-声明对”,将其输入到预训练语言模型作为三分类任务进行训练和测试,但该方法忽视了证据间的联系;Jiang等[13]和Stammbach等[17]使用小语言模型将句子集合中的所有句子和声明集中拼接形成“证据组-声明对”进行训练和测试;Krishna等[21]利用序列到序列(Sequence to Sequence)模型生成基于人类逻辑的推理信息作为证据,在对声明进行分类的基础上提供了可解释性。但这些方法或模型缺乏利用检索到的证据对声明进行事实核查过程的可解释性和逻辑推理能力。因此,如果将抽取到的证据作为一个整体输入到大语言模型中,既保留了证据间的逻辑关系,还能利用其逻辑推理能力对待检测声明进行分类、为事实核查任务提供可解释性和进一步提高事实核查的准确率。

1.4 大语言模型

大语言模型的逻辑推理能力是其重要特点[22],目前一些研究者开始探索使用大语言模型进行声明验证。Pan等[23]率先使用大语言模型对声明信息进行核查;Zhang等[24]对大语言模型的上下文学习能力进行了研究,发现大语言模型的声明验证准确率可达到目前有监督模型的水平;Hu等[25]指出仅依靠大语言模型的内在知识进行声明验证是不够的,大模型可以从不同角度对声明进行分析,并与声明结合以训练声明验证模型,得到声明验证结果。但这些方法都是利用大语言模型的内在知识进行事实核查,忽略了外部知识对大语言模型事实核查任务的影响。因此,本文将检索到的证据作为外部知识引入大语言模型,不仅证明了外部知识对大语言模型事实核查任务的积极作用,而且提高了大语言模型事实核查的准确率上限。

2  本文模型

图1为本文模型的流程图,该模型分为文档检索(DRCV文档检索算法)、证据检索(基于关键词-注意力机制的证据检索方法)和声明验证(基于大语言模型的声明验证模型)三部分。

2.1 DRCV文档检索算法

文档检索算法通常有稀疏搜索和稠密搜索两种,本文首次将两种方法结合起来,提出了DRCV文档检索算法(如算法1所示),具体步骤如下:

步骤1:构建训练数据集并训练文档检索模型。DRCV算法输入为待检测声明和文档数据库中文档的嵌入表示。为了获得嵌入表示,本文将数据集中与待检测声明对应的文档作为正文档集合,与待检测声明不对应的文档作为负文档集合,将正文档集合和负文档集合赋值正标签1和负标签0,以此为标准构造包含正文档集合和负文档集合的数据集训练文档检索模型。

步骤2:计算待检测声明的嵌入表示和待检索文档的嵌入表示。按照(1)式和(2)式通过文档检索模型计算得到文档数据库中第i个文档的嵌入表示EDi和待检测声明的嵌入表示 C

EDi=ModelDi,DiD
C=ModelG

其中,Model为训练完成的文档检索模型,D为文档数据库,Di为文档数据库中的第i个文档,G为待检测声明。

步骤3:构建“文档-嵌入表示”表。将文档数据库中第i个文档的嵌入表示EDi作为主键,文档数据库中第i个文档Di作为键值构建文档数据库D中全部文档的“文档-嵌入表示”表。

步骤4:计算文档数据库中文档的嵌入表示EDi与待检测声明的嵌入表示 C 的相似度。将 CEDi按照(3)式计算相似度Similarity,对计算得到的相似度降序排列并检索出K个最相似的嵌入表示,并根据“步骤3”的“文档-嵌入表示”表检索出K个最相似的嵌入表示对应的文档。

SimilarityC,EDi=C|EDi|||C||×||EDi||

步骤5:计算待检测声明G与文档数据库中的第i个文档Di的相关度。按照(4)式计算待检测声明G与文档数据库中的第i个文档Di的相关度Relevance,降序排列计算得到的相关度,并检索出K条相关性最高的文档。

RelevanceG,Di=
j=1S[log(S-nqj+0.5nqj+0.5+1)·
fqj,Wi×k1+1f(qj,Wi)+k1×(1-b+b×Wiavgdl]

其中,S是文档数据库D中的文档总数,qj 是待检测声明G中的第j个词,n(qj )是包含词qj 的文档数量,|Wi |是文档Wi 的长度,avgdl是文档数据库D所有文档的平均长度,k1b是超参数。

步骤6:检索得到与声明文档最相关的K个文档。根据比例系数αβ,对“步骤4”和“步骤5”检索出的文档进行筛选,并去除重复文档得到K个文档作为文档检索结果。

2.2 基于关键词-注意力机制的证据检索方法

受Stammbach等[17]的启发,本文将文档内容视为一个整体,构建“文档-声明对”数据集来训练证据检索模型,提出基于关键词-注意力机制的证据检索方法,该方法从文档中检索出与声明最相关的L条句子作为证据。如图1所示,基于关键词-注意力机制的证据检索方法的具体步骤如下:

步骤1:构建“文档-声明对”数据集训练证据检索模型。对于一个待检索文档,对其中的每个句子递增编号,将每个句子的序号与数据集中的待检测声明对应的证据句子的序号进行对比。如果两者序号一致,将待检索文档中当前编号的句子标签置为1;不一致则将句子标签置为0。根据上述规则构建数据集并训练证据检索模型。

步骤2:使用证据检索模型检索证据。将待检测声明与DRCV算法检索得到的待检测文档构造为“声明-文档对”输入到证据检索模型中,证据检索模型经过计算得到待检测文档中每个句子与待检测声明证据的相关度,将相关度降序排列并选取相关度最高的2L条句子。

步骤3:基于关键词-注意力机制对证据进行筛选。基于关键词-注意力机制对“步骤2”选取的2L条句子进行筛选。关键词-注意力机制具体过程如下:首先,对待检测声明句子利用分词算法(https://github.com/fxsjy/jieba)去除虚词和助词,得到待检测声明句子的关键词集合;接下来,根据(5)式计算每个关键词的注意力权值Weight,并构建没有重复项的“关键词-权值”集合;最后,根据(6)式计算各个句子的相关度Score,选取相关度高的前L个句子作为最终证据。

Weighti=cal_timeskeywordi,Set

其中,cal_times为计算第i个关键词keyword i 在关键词集合Set中的出现次数。

Scorej=B+Weightj,findSj,Seti=Weighti0,findSj,Seti=0

其中,B为初始分数;Sj 为文档中第j个句子;Set i 为关键词集合中第i个关键词;find()为计算关键词集合中第i个关键词Set i 在文档中第j个句子Sj 的出现次数。

2.3 基于大语言模型的声明验证模型

声明验证模型主要包括以下4个步骤:

步骤1:构造提示。将检索得到的句子证据和待检测声明证据进行组合(即“构造提示”)作为大语言模型的输入。

步骤2:大语言模型编码。大语言模型在接收到构造提示后,将构造提示输入到编码层,编码层对构造提示进行嵌入表示,嵌入表示中的每个字元(Token)的编码为8 192维的向量。

步骤3:大语言模型推理并输出。解码层接收编码层的嵌入表示,大语言模型推理得到输出值(输出层的嵌入表示)。

步骤4:大语言模型解码得到核查结果。对“步骤3”输出的嵌入表示进行解码,得到大语言模型对输入待检测声明的分类结果。

3  仿真实验与结果分析

3.1 数据集

选用Lin等[12]构建的CFEVER数据集进行仿真实验。该数据集从中文维基百科中抽取句子,并从抽取句子的相关文档中选择能证明其真实或虚假的句子作为证据。数据集中还存在一些没有证据的声明,这些声明被分类为“没有足够信息”(NOT ENOUGH INFO)。由于Lin等[12]没有公开测试集的分类标签和证据,因此本文对验证集进行了分割处理,得到新的验证集和测试集,将分割后的数据集命名为DCFEVER,其结构如表1所示。

3.2 实验环境

在本文的仿真实验中,相关数据集构建运行在INTEL 13490F和NVIDIA RTX 1660TI的Windows 10平台上;文档检索、证据检索、声明验证、FEVER[11]、CFEVER[12]、BEVERS[14]和Stammbach[22]的模型复现运行在Intel Xeon(R Platinum 8352V和NVIDIA RTX 4090的LINUX平台上。

3.3 DRCV文档检索算法仿真与结果分析

将本文提出的DRCV算法与FEVER[11]、CFEVER[12]和BEVERS[14]模型的文档检索部分进行召回率的对比。FEVER首次采用TF-IDF算法对文档进行检索,CFEVER首次采用BM25算法对文档进行检索,这两种模型在文档检索任务的召回率领先于其他模型;BEVERS采用TF-IDF算法附加模糊串进行检索,该模型是已知在事实核查任务上文档检索召回率最高的模型。训练文档检索模型的基座模型为chinese-bert-wwm-ext[26],文档检索训练数据集中正文档集合和负文档集合的比值和CFEVER[12]一致(1∶1.6),数据集格式如表2所示,文档检索训练模型的超参数设置如表3所示,(4)式的超参数k1设置为1.2,b设置为0.75,比例系数αβ均设置为0.5。采用召回率(Recall@10)为评测指标,表示只有数据集中待检测声明对应的文档名完全存在于预测的文档名集合中才视为预测成功,其计算公式如(7)式所示。

Recall@10=i=1N1,OiRi0,OiRiN×100%

其中,N为测试集中声明总数;Oi为测试集中每条声明对应的文档名集合,集合大小小于10;Ri为预测的文档名集合,集合大小等于10。

实验结果如表4所示。由表4可知,本文提出的DRCV算法的召回率超过了FEVER和CFEVER。与BEVERS算法相比,DRCV算法的召回率仅低1.0%。这是因为BEVERS采用了二次抽取的方法,利用文档中的超链接,可以跳转到与当前文档高度相关的其他文档。当检索到与待检测声明相关的一个文档后,BEVERS能够从中串行检索更多相关文档,与其他方法在DCFEVER数据集中并行检索得到的文档相比,BEVERS检索到的文档相关度更高。然而,该方法依赖于文档之间的超链接,使用场景受到限制。在缺乏超链接的情况下,DRCV算法能更有效地提升待检测声明与从大量文档中提取的内容之间的相关度。

3.4 基于关键词-注意力机制的证据检索方法仿真与结果分析

CFEVER[12]、BEVERS[14]和Stammbach[17]等模型在证据检索任务的召回率领先于领域内其他模型,因此将本文提出的DRCV文档检索算法与这3种模型进行对比。由于文档的长度超过了常用预训练语言模型的输入长度限制,本文选取了长序列预训练语言模型chinese-bigbird-wwm-base-4096(https://github.com/LowinLi/chinese-bigbird)训练证据检索模型。训练模型的超参数设置如表3所示,(6)式的初始分数B设置为1。采用的评测指标是召回率(Recall@5),即只有数据集中声明对应的证据完全存在于预测的证据中才视为预测成功,其计算公式如(8)式所示:

Recall@5= i=1N1,PiEi0,PiEi N×100%

其中,Pi为数据集中每条声明对应证据的集合,集合大小小于或等于5;Ei为预测的证据集合,集合大小为5。

实验结果如表5所示,由表5可知,本文提出的证据检索方法在召回率上比CFEVER高5.0%,比Stammbach高2.5%,仅次于采用了二次抽取方法的BEVERS。这一结果的原因在于,BEVERS在文档检索阶段抽取的文档与待检测声明的相关性较强,因此从这些文档中检索出的句子也与待检测声明的内容紧密相关。本文提出的方法仅依赖检索得到的文档内容进行证据检索,在不使用超链接的情况下,其检索得到的证据与待检测声明可以保持较高的相关性。

3.5 基于大语言模型的声明验证模型仿真与结果分析

为了对比不同参数量的大模型进行声明验证的性能差距,本文参考中文大模型能力评测榜单(https://github.com/jeinlee1991/chinese-llm-benchmark),选取了ChatGLM3-6B[18]、QWEN1.5-0.5B、QWEN1.5-1.8B、QEWN1.5-4B、QWEN1.5-7B、QWEN1.5-14-8BIT-GPTQ(https://qwenlm.github.io/zh/blog/qwen1.5/)、ChatGLM3.5-TURBO[19]7款大模型,这7款大模型的参数量从5亿到1 300亿。本文构造了仅包含声明、使用思维链、提供少量例子和提供给大语言模型证据4种任务提示,构造了是否使用少量例子的两种系统提示。4种任务提示和两种系统提示的内容如表6所示。

实验采用准确率(Accuracy)和FEVER Score作为评测指标。准确率的计算公式如(9)式所示,FEVER Score 的计算公式如(10)式所示。

Accuracy=i=1N1,Li=Gi 0,LiGiN×100%
FEVER Score=i=1N1,PiEiLi=Gi0,PiEi LiGiN

其中,Li为大模型对数据集中每条待检测声明的分类结果;Gi为数据集中每条待检测声明的分类标签。

实验结果如表7所示。实验发现在大语言模型参数超过70亿后,使用大语言模型进行声明验证的准确率并没有随参数增多而上升,而是在46.0%左右波动,这与Lin等[12]使用GPT-3.5(https://openai.com/blog/gpt-3-5-turbo-fine-tuning-and-api-updates)和GPT-4(https://openai.com/index/gpt-4/)进行声明验证的结果一致。实验发现使用思维链的提示能进一步提高声明验证的准确率,但提升幅度有限;使用少量例子的提示比使用思维链的提示能更高地提高声明验证的准确率,这表明大模型具有学习能力,能从输入的例子中学习到知识并应用到输出中。特别地,参数量小的大模型(QWEN1.5-0.5B和QWEN1.5-1.8B)使用少量例子的提示准确率低于仅包含声明的提示,这表明参数量小的大模型不具有学习能力,并且输入的例子会对大模型的输出产生负面影响。根据以上实验结果,本文认为直接使用大语言模型进行声明验证的准确率上限为46.0%。

为了对比小语言模型和大语言模型的声明验证能力,本文选取了CFEVER[12]和BEVERS[14]模型的事实核查部分进行对比。BEVERS是目前已知基于事实信息进行事实核查效果最好的模型。这两个模型基于chinese-bert-wwm-ext[26]训练得到。CFEVER将声明验证任务视为识别文本蕴含任务,将抽取到的证据和待检测声明进行拼接输入模型中进行预测。BEVERS[14]将证据-声明对分为单独、拼接和混合三种模式,并分开训练得到多个分类结果,将得到的结果送入分类器得到单个声明的分类结果。

实验结果如表8所示。实验发现,大模型的参数量对声明验证结果存在直接影响,声明验证准确率随大模型参数量上升而提高,从QWEN1.5-1.8B的27.0%提升到了QWEN1.5-14B-8bit-gptq的66.3%。这是因为随着大模型参数量的上升,其逻辑思考和推理能力逐渐提高,这与Kaplan等[20]和Wei等[27]的结论一致。此外实验观察到QWEN1.5-0.5B和QWEN1.5-1.8B的判断结果中信息不足这一类非常少,5亿为74个,18亿为0个,其将三分类任务当成了二分类任务,这表明QWEN1.5-1.8B并没有正确理解指令,导致QWEN1.5-1.8B的准确率低于QWEN1.5-0.5B,并且该现象无论是否提供给大模型证据均会存在。因此,该现象证明了参数量低的大模型对输入提示中的指令理解不够。实验发现,经过文档检索和证据检索后,大语言模型声明验证的准确率能突破其上限,进一步提高大语言模型声明验证的能力。根据大语言模型参数的不同,经过文档检索和证据检索后的大语言模型声明验证的准确率相较于直接使用大模型提高了0.1%~34.0%。实验在使用Chatglm3.5-turbo时,声明验证的准确率超过了现有效果最好的模型BEVERS[14]1.8%,这表明大模型进行事实核查的能力优于小模型。同时其FEVER Score低于该模型,表明大模型可以在证据与声明不足够相关时,将大模型内在的知识作为补充,协助判断待检测声明的类别。

此外,由于CFEVER数据集的声明带有领域标签,本文还对声明验证结果的领域分布进行了研究。CFEVER数据集领域共12类,各领域分布和实验结果如表9所示。

实验发现大模型的声明验证结果存在明显的领域偏移现象。人文与社会科学,工程与科技领域的准确率高于其他领域,这是因为这些领域的证据和声明的关系更加紧密,大模型仅需要对声明和证据进行事实对比就能对待检测声明进行分类;准确率低的领域需要大模型找出其中隐含的逻辑关系,使得大模型出现幻觉现象[28],降低了准确率。

4  结 语

互联网及应用飞速发展给人们带来便利的同时,也导致虚假信息在网络上快速蔓延。针对如何高效、准确地核查互联网上的不实信息问题,本文研究并提出了一种融合大语言模型和证据抽取的事实核查模型。仿真实验结果表明,该模型进一步提高了文档检索出的文档内容与待检测声明的相关度,保留了证据检索中文档中句子的内在联系,并大幅提高了大语言模型识别虚假信息的准确率,且在部分大语言模型上的表现超过了现有表现最佳的基于事实信息的事实核查模型。尽管如此,仍有一些需要深入研究的问题:大语言模型存在理解指令不充分的情况,这在参数量小的大语言模型上表现尤为突出。在接下来的工作中,需要对大语言模型进行指令对齐,以便大模型能够正确理解指令。此外,大语言模型的识别效果存在明显的领域偏差现象,需要在文档检索和证据检索中检索出领域一致的证据,以缓解大模型的领域偏差现象。

参考文献

[1]

SHU KMAHUDESWARAN DWANG S Het al. FakeNewsNet: A data repository with news content, social context, and spatiotemporal information for studying fake news on social media[J]. Big Data20208(3): 171-188. DOI: 10.1089/big.2020.0062 .

[2]

CUI L MLEE D. CoAID: COVID-19 healthcare misinformation dataset[EB/OL]. 2020arXiv: 2006.00885.

[3]

SILVA ALUO LKARUNASEKERA Set al. Embracing domain differences in fake news: Cross-domain fake news detection using multi-modal data[J]. Proceedings of the AAAI Conference on Artificial Intelligence202135(1): 557-565. DOI: 10.1609/aaai.v35i1.16134 .

[4]

LIU Z WZHANG T LYANG K Let al. Emotion detection for misinformation: A review[J]. Information Fusion2024107: 102300. DOI: 10.1016/j.inffus.2024.102300 .

[5]

YUE ZZENG HZHANG Yet al. MetaAdapt: Dmain adaptive few-Shot misinformation detection via meta learning[C]//61st Annual Meeting of the Association for Computational Linguistics, ACL 2023. Association for Computational Linguistics (ACL), 2023: 5223-5239. DOI: https://doi.org/ 10.18653/v1/2023.acl-long.286 .

[6]

杨昱洲, 周杨铭, 应祺超, . 基于事实信息核查的虚假新闻检测综述[J]. 中国传媒大学学报(自然科学版)202330(6): 28-36. DOI: 10.16196/j.cnki.issn.1673-4793.2023.06.007 .

[7]

YANG Y ZZHOU Y MYING Q Cet al. A survey on fake news detection based on fact verification[J]. Journal of Communication University of China (Science and Technology)202330(6): 28-36. DOI: 10.16196/j.cnki.issn.1673-4793.2023.06.007(Ch ).

[8]

LI Y PHE H RBAI Jet al. MCFEND: A multi-source benchmark dataset for Chinese fake news detection[C]//Proceedings of the ACM Web Conference 2024. New York: ACM, 2024: 4018-4027. DOI: 10.1145/3589334.3645385 .

[9]

MU Y DBONTCHEVA KALETRAS N. It’s about time: Rethinking evaluation on rumor detection benchmarks using chronological splits[C]//Findings of the Association for Computational Linguistics: EACL 2023. Stroudsburg: Association for Computational Linguistics, 2023: 736-743. DOI: 10.18653/v1/2023.findings-eacl.55 .

[10]

SU J YZHUO T YMANSUROV Jet al. Fake news detectors are biased against texts generated by large language models[EB/OL]. 2023arXiv: 2309.08674.

[11]

HUANG K HMCKEOWN KNAKOV Pet al. Faking fake news for real fake news detection: Propaganda-loaded training data generation[C]//Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Stroudsburg: Association for Computational Linguistics, 2023: 14571-14589. DOI: 10.18653/v1/2023.acl-long.815 .

[12]

THORNE JVLACHOS ACHRISTODOULOPOULOS Cet al. FEVER: A large-scale dataset for fact extraction and VERification[C]//Proceedings of the 2018 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long Papers). Stroudsburg: Association for Computational Linguistics, 2018: 809-819. DOI: 10.18653/v1/n18-1074 .

[13]

LIN Y JLIN C YYEH C Jet al. CFEVER: A Chinese fact extraction and VERification dataset[J]. Proceedings of the AAAI Conference on Artificial Intelligence202438(17): 18626-18634. DOI: 10.1609/aaai.v38i17.29825 .

[14]

JIANG KPRADEEP RLIN J. Exploring listwise evidence reasoning with T5 for fact verification[C]//Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 2: Short Papers). Online. Stroudsburg: Association for Computational Linguistics, 2021: 402-410. DOI: 10.18653/v1/2021.acl-short.51 .

[15]

DEHAVEN MSCOTT S. BEVERS: A general, simple, and performant framework for automatic fact verification[C]//Proceedings of the Sixth Fact Extraction and VERification Workshop (FEVER). Stroudsburg: Association for Computational Linguistics, 2023: 58-65. DOI: 10.18653/v1/2023.fever-1.6 .

[16]

HANSELOWSKI AZHANG HLI Z Let al. UKP-athene: Multi-sentence textual entailment for claim verification[C]//Proceedings of the First Workshop on Fact Extraction and VERification (FEVER). Stroudsburg: Association for Computational Linguistics, 2018: 103-108. DOI: 10.18653/v1/w18-5516 .

[17]

SOLEIMANI AMONZ CWORRING M. BERT for evidence retrieval and claim verification[C]//Advances in Information Retrieval. Cham: Springer, 2020: 359-366.10.1007/978-3-030-45442-5_45. DOI: 10.1007/978-3-030-45442-5_45 .

[18]

STAMMBACH D. Evidence selection as a token-level prediction task[C]//Proceedings of the Fourth Workshop on Fact Extraction and VERification (FEVER). Dominican Republic. Stroudsburg: Association for Computational Linguistics, 2021: 14-20. DOI: 10.18653/v1/2021.fever-1.2 .

[19]

DU Z XQIAN Y JLIU Xet al. GLM: General language model pretraining with autoregressive blank infilling[C]//Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Stroudsburg: Association for Computational Linguistics, 2022: 320-335. DOI: 10.18653/v1/2022.acl-long.26 .

[20]

ZENG A HLIU XDU Z Xet al. GLM-130B: An open bilingual pre-trained model[EB/OL]. 2022arXiv: 2210.02414.

[21]

KAPLAN JMCCANDLISH SHENIGHAN Tet al. Scaling laws for neural language models[EB/OL]. 2020arXiv: 2001.08361.

[22]

KRISHNA ARIEDEL SVLACHOS A. ProoFVer: Natural logic theorem proving for fact verification[J]. Transactions of the Association for Computational Linguistics202210: 1013-1030. DOI: 10.1162/tacl_a_00503 .

[23]

HUANG JCHANG K C C. Towards reasoning in large language models: A survey[C]//Findings of the Association for Computational Linguistics: ACL 2023. Stroudsburg: Association for Computational Linguistics, 2023: 1049-1065. DOI: 10.18653/v1/2023.findings-acl.67 .

[24]

PAN L MWU X BLU X Yet al. Fact-checking complex claims with program-guided reasoning[C]//Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Stroudsburg: Association for Computational Linguistics, 2023: 6981-7004. DOI: 10.18653/v1/2023.acl-long.386 .

[25]

ZHANG XGAO W. Towards LLM-based fact verification on news claims with a hierarchical step-by-step prompting method[C]//Proceedings of the 13th International Joint Conference on Natural Language Processing and the 3rd Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics (Volume 1: Long Papers). Stroudsburg: Association for Computational Linguistics, 2023: 996-1011. DOI: 10.18653/v1/2023.ijcnlp-main.64 .

[26]

HU B ZSHENG QCAO Jet al. Bad actor, good advisor: Exploring the role of large language models in fake news detection[J]. Proceedings of the AAAI Conference on Artificial Intelligence202438(20): 22105-22113. DOI: 10.1609/aaai.v38i20.30214 .

[27]

CUI Y MCHE W XLIU Tet al. Pre-training with whole word masking for Chinese BERT[J]. IEEE/ACM Transactions on Audio, Speech, and Language Processing202129: 3504-3514. DOI: 10.1109/TASLP.2021.3124365 .

[28]

WEI J, TAY Y, BOMMASANI Ret al. Emergent abilities of large language models[EB/OL]. 2022arXiv: 2206.07682.

[29]

HUANG LYU W JMA W Tet al. A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions[EB/OL]. 2023arXiv: 2311.05232.

AI Summary AI Mindmap
PDF (1197KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/