基于大语言模型的本体提示指导的司法命名实体识别

田萍芳 ,  刘恒永 ,  高峰 ,  顾进广 ,  祝歆

武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (2) : 219 -231.

PDF (2233KB)
武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (2) : 219 -231. DOI: 10.14188/j.1671-8836.2024.0027
人工智能

基于大语言模型的本体提示指导的司法命名实体识别

作者信息 +

Judicial Named Entity Recognition by Ontology Prompt Guidance Based on Large Language Model

Author information +
文章历史 +
PDF (2286K)

摘要

为改善在低资源和少样本条件下对复杂司法命名实体识别的效果,提出了一种基于本体提示指导的司法命名实体识别方法,将大语言模型应用于司法命名实体识别。首先,以涉假司法文书为例,结合文书内容和现有司法文书领域本体采用“自顶向下”的方式构建涉假司法文书知识图谱本体模型。然后,基于本体模型构建指令,指令包括任务描述、本体描述、任务示例和司法文本四部分,对大语言模型进行指令微调以完成司法命名实体识别任务,其中本体描述部分用于在微调过程中加入实体的定义与关系信息。最后,选择本文构建的本体模型包含的12类细粒度实体,自行采集数据集用于实验,并将其与几种典型的传统实体识别方法进行比较,结果显示,在少样本微调的条件下,本文提出的方法表现效果更好。

Abstract

To enhance the efficacy of complex judicial named entity recognition in low-resource and limited-sample scenarios, this study proposes a judicial named entity recognition method based on ontology prompt guidance, utilizing a large language model. First, taking counterfeit judicial documents as an example, a “top-down” approach is used to construct a knowledge graph ontology model of counterfeit judicial documents based on the document content and the existing ontology in the field of judicial documents. Then, the instruction is constructed based on the ontology model. The instruction includes four parts: task description, ontology description, task example and judicial text. A large language model is fine-tuned to complete the judicial named entity recognition task. The ontology description section adds entity definitions and relationship information to the fine-tuning process. Finally, we selected 12 types of fine-grained entities included in the ontology model constructed in this study and collected the datasets for experiments,and compared these results with those obtained using several typical traditional entity recognition methods. The results showed that the method proposed in this study performed better under the condition of small sample fine-tuning.

Graphical abstract

关键词

司法文书 / 命名实体识别 / 大语言模型 / 提示工程 / 本体

Key words

judicial documents / named entity recognition / large language models / prompt engineering / ontology

引用本文

引用格式 ▾
田萍芳,刘恒永,高峰,顾进广,祝歆. 基于大语言模型的本体提示指导的司法命名实体识别[J]. 武汉大学学报(理学版), 2025, 71(2): 219-231 DOI:10.14188/j.1671-8836.2024.0027

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

近年来,我国不断深入推进法院信息化建设,借助人工智能、大数据等信息技术的迅猛发展,为法院工作信息化提供了更多的工具和方法[1]。同时,为了更好地管理和利用司法数据,并加强对案件数字资源的建设,一系列平台相继建成并投入使用,如中国裁判文书网和北大法宝网等。这些平台上有海量的司法文书,其中包含了大量的案件信息和法律知识等,对于海量的司法文书进行信息提取和智能分析已成为智慧司法的重要内容。司法领域的命名实体识别,作为智慧司法人工智能中的基础性关键工作,对于后续的司法知识图谱构建、法律判决预测等任务起到了重要作用,是司法文书信息结构化的关键技术。

司法文书,是指由法院或其他司法机关根据法律规定制作的文件或记录。司法命名实体则是司法文书中提及的具有司法领域特色的名词或短语,如嫌疑人、作案时间、法律条文等,与通用领域的命名实体相比,存在实体跨度长、嵌套实体多和关注与司法业务相关的司法属性等特点。目前通用的命名实体识别方法主要基于深度学习,而深度学习的方法严重依赖大量的标注训练数据。在司法领域,可用的命名实体识别标注语料较为稀缺,在少样本训练数据的情况下,深度学习方法通常表现不佳。

通过分析上述问题,长跨度实体、嵌套实体和司法属性实体其实质问题在于对文本的全局上下文理解,需要通过全局上下文理解推断实体的实际意义和上下文关系,进而捕捉到实体之间的语义关联和嵌套关系,而大语言模型通过大规模通用文本语料库训练,在理解自然语言文本方面有很强的能力,可以捕捉到句子中更大范围的语义和逻辑关联,从而在全局上下文中进行推理和理解。针对缺乏训练数据语料库问题,大语言模型往往有较强的基础能力,在低资源和少样本的训练下也表现较好。

常用的大语言模型调优方法包括提示工程和微调,提示工程通过设计合适的提示,提供一些任务示例,引导大语言模型生成更符合预期的回答;微调则需要通过训练的过程修改大语言模型参数,在通过特定领域的数据训练后,会更好地适应特定领域,具备更高的准确性和专业性。在命名实体识别任务上,目前所构建的提示并没有充分考虑上下文信息,缺乏一定的说明性,而通过在基础提示信息之外引入知识图谱本体概念,使得大语言模型在输出之前能进行充分的上下文学习并具有一定的逻辑性。

基于上述背景,本文以涉假司法文书为研究对象,提出了一种将知识图谱本体作为指令提示内容来指导大语言模型对司法文书文本进行信息提取,以助力司法智能化。

1  相关研究

命名实体识别(Named Entity Recognition,NER)方法主要包括基于规则和词典的方法、基于机器学习的方法、基于深度学习的方法。基于规则和词典的方法通过专家手工制定规则和词典,对领域知识的依赖性很强,且构造大规模规则和词典耗费成本大,在大规模和多领域的应用中的可扩展性和泛化能力较差。基于机器学习的方法将NER任务转化为多分类或序列标注任务,常见的机器学习方法有隐马尔可夫模型(Hidden Markov Models,HMM)[2]、支持向量机(Support Vector Machines,SVM)[3]、条件随机场(Conditional Random Fields,CRF)[4]等。如Bikel等[5]提出了IdentiFinder系统,该系统第一个将HMM应用在命名实体识别任务上,对日期、时间表达式、名称和数值量进行识别。Quaresma等[6]将SVM分类器用于法律文书的分类,随后使用语言信息和机器学习相结合的方法识别实体,该方法在EUR-Lex网站的法律文书数据集上获得了较好的结果。McCallum等[7]在CoNLL03中应用CRF对复杂的数据进行实体识别,取得了显著的效果。通过将SVM和CRF对比,发现SVM忽略了标记之间的依赖关系,没有考虑上下文信息,而CRF能在建模标记序列中标记至今的依赖关系,适用于序列标注任务,因此在后续的研究中CRF被广泛应用于命名实体识别任务中。然而机器学习方法通常需要手工设计特征,泛化能力不强。

随着深度学习的发展,基于深度学习的方法利用大规模、高质量标注过的语料对复杂的网络结构模型进行训练,再利用其完成命名实体识别任务,使实体识别效果得到显著提升。在一些研究工作中,研究人员利用双向长短期记忆网络(Bi-directional Long Short-Term Memory,BiLSTM)、卷积神经网络(Convolutional Neural Networks,CNN)等模型进行命名实体识别,同时发现在深度学习网络之后加上一层CRF,可以捕捉标签之间的依赖关系,从而得到全局最优的标签序列。Huang等[8]首次将BiLSTM-CRF模型应用于NLP基准序列标注数据集上,可以有效地捕获双向的输入特征。Dos Santos等[9]将CNN用来捕获词序列的语义信息,识别命名实体。Chiu等[10]提出了混和双向LSTM和CNN架构自动检测单词和字符级特征,消除了大多数特征工程的需要。Su等[11]提出了一种新颖的基于跨度的NER框架,即全局指针(Global Pointer,GP),可以无差别地识别嵌套实体和非嵌套实体。

随着预训练模型的出现,如ELMo[12]和BERT[13],模型对丰富的句法和语义信息的理解更进一步,为多项NLP任务带来了巨大的提升。首先在语料充足的领域上通过监督学习训练出一个通用的预训练模型,然后将其迁移到像实体识别这样的特定的语言任务上。在司法领域有许多基于BERT模型的相关研究,如陈剑等[14]提出一种将BERT、BiLSTM和CRF相结合进行案件实体提取的方法,在自主创建的包含公诉机关、被告人等15种实体类型的数据集上进行了实验,性能得到大幅提升。李春楠等[15]提出了一种新的法律文本命名实体定义方案,定义了与案件相关的犯罪嫌疑人、受害人、作案工具、被盗物品等12种实体,并构建了一个关于盗窃案的命名实体识别数据集,使用BERT加上有序LSTM(Ordered Neurons LSTM,ONLSTM)和CRF的结构对数据集中实体进行识别。曾兰兰等[16]提出了一种基于联合学习和BERT的BiLSTM-CRF(JLB-BiLSTM-CRF)模型,自行构建了一个包含作案时间、作案地点等实体类型的数据集和分词数据集,将命名实体识别任务和中文分词任务进行联合训练以提升实体的边界识别率。

然而,司法领域基于深度学习的方法也面临着巨大的挑战,包括对大量训练数据的需求、容易发生过拟合以及缺乏可解释性等问题,且司法领域公开可供直接研究的司法命名实体语料库数量较为有限,通用领域以及医疗、金融等热点领域拥有大量开源可用的语料库资源。因此,在司法领域,大多数研究人员主要依赖内部自标注的数据进行研究,这些数据由于涉及隐私问题或其他特殊原因往往无法公开共享。而随着大语言模型的出现,标注训练数据不足的问题得以解决。大语言模型通常是通过大量的数据进行训练,包含数亿训练参数量。当前研究中,一些基于大语言模型的命名实体识别方法已经被提出,其方法主要为通过提示工程构造指令指导大语言模型完成命名实体识别任务。如Polak等[17]提出了ChatExtract方法,它由一组经过设计的提示组成,通过提示提取数据,再通过后续验证问题提高数据的准确性。Wei等[18]提出了一种多轮问答框架的两阶段方法,利用ChatGPT解决零样本信息提取任务。Wang等[19]提出了GPT-NER方法,首先将序列标记任务转换为适合大语言模型的文本生成任务,然后提出了一种结果验证策略,有效地解决大语言模型容易盲目给出错误答案的“幻觉”问题。Hu等[20]通过结合注释指南、错误分析的指令和少样本学习注释样本,提出了一个临床任务特定的提示框架,并且在两个临床命名实体识别数据集上进行实验。结果表明,结合GPT-4模型和所提出的提示方法取得了与最好的BioClinicalBERT模型相近的性能。Dagdelen等[21]提出了一种联合命名实体识别和关系提取的方法,并微调大语言模型(GPT-3、Llama-2)以提取复杂科学知识中的有用记录。Nguyen等[22]提出了一种知识感知响应计划(KARP)框架。该框架通过知识检索器从网络文档或数据库中获取与用户查询相关的信息,并为大语言模型提供稳健的微调策略。通过这种方式,模型可以利用检索到的外部知识生成更准确的最终回答。

当前基于大语言模型的方法所构建的提示并没有充分考虑上下文信息,缺乏一定的说明性,因此本文通过在基础提示信息之外引入本体概念,在指令微调过程中加入实体的定义与关系信息,从而帮助大语言模型更好地捕捉实体之间的语义关系和上下文信息。

2  涉假司法文书知识图谱本体构建

本节介绍涉假司法文书知识图谱本体模型的构建过程、总体结构及各部分的概念和关系,以及使用该本体模型构建的涉假司法文书知识图谱实例。

2.1 涉假司法文书知识图谱本体建模

本体模型的构建主要涉及两种方式:自顶向下和自底向上。自顶向下的构建方式是从高层次的概念和关系出发,逐步细化和扩展,形成更具体的实体和关系。而自底向上的构建方式是指从具体的实体和关系开始,逐步进行归纳和推理,形成高层次的概念和关系。鉴于司法文书具有相对固定的格式和内容组成,因此本文在传统的七步法的基础上,结合实际应用需求、现有案件司法文书领域本体和文书结构内容,并借助司法领域内专家的指导,采用自顶向下的方式构建涉假司法文书的本体模型[23]。本文的涉假司法文书本体模型的构建过程如图1所示。

目前,司法文书图谱主要关注案件基本信息、人员信息、时间、地点和机构等方面。本文构建的涉假司法文书本体模型主要面向刑事案件。该模型结合了涉假案件的犯罪构成要素和司法文书内容,并进一步融合了案件审判部分的相关法条、判决结果、涉案物品和损害结果等信息,从而丰富了案件相关信息的覆盖范围,提高了信息的准确性和完整性。本体各部分主要概念如图2所示,这些部分关系紧密,构成一个有机整体。

为了对涉假司法文书信息进行有效表达,通过分析司法文书文档,总结主要部分内容如下:

1) 案件:案件作为文书本体的基本要素,基于详细的案件元数据,全面记录了案件的基本信息,为案件检索提供了必要的基础。案件元数据详细记录了案件类型、案号、省份、案件性质、审理程序和案由等数据属性。

2) 证据材料:证据材料旨在有效存储司法文书中详细列举的各类证据信息,涵盖的证据类型主要包括人证、书证、物证、证人证言、被害人陈述、被告人供述和辨认笔录等,对所证实内容提供数据支持。

3) 损害结果:损害结果旨在对嫌疑人侵权行为所产生的结果进行统计,为相关法条的认定提供事实基础。根据嫌疑人行为划分为销售金额、货值金额、销售数量、生产数量和违法所得等损害结果统计。

4) 相关法条:高效存储和管理与案件相关的法律规定,以确保适用法条的准确性和完整性,主要包括法条来源、法条编号、法条内容和适用范围等数据属性。

5) 相关机构:主要记录文书中提及的各种机构,例如人民法院、检察院、公安局和公司等,文书中通常是某法院审理了某案件,某检察院对嫌疑人提起指控,公司作为原告诉讼人等。

6) 人员:人员根据文书中常见的人员类型进行划分,包括嫌疑人、辩护人、检察员、审判长和陪审员等。

7) 时间:根据关联的案件内容,主要包括作案时间、立案时间和判决时间。

8) 地点:地点根据其关联的案件内容,主要包括作案地点、抓获地点和藏货地点。

9) 物品:物品为公安机关查获扣押的假冒商品,对涉及的物品商标品牌、型号和价格等信息进行记录。

司法文书的各个部分并非孤立存在,它们之间存在语义关系。涉假司法文书本体的语义关系不仅限于概念之间的通用语义关系,还包括根据文档内容抽取出的自定义语义关系,本文主要的语义关系如表1所示。

图3展示了基于上述本体概念和关系定义的示例,表现了文书内容之间的有机关联。本文将司法文书内容分为11部分,并根据这些不同部分的实例内容进行关联。其中案件作为涉假司法文书的核心关联点,与其他多个实例之间都存在关联。

2.2 涉假司法文书知识图谱实例

以本文采集的一篇司法文书为例,构建了该文书的图谱实例来展示实体之间的关系,如图4所示。图谱实例以杨某销售假冒注册商标的商品案为中心。首先,检察院指控嫌疑人杨某自2008年4月以来在潍坊市奎文区友谊街非法对外销售假冒PRADA、CHANEL、GUCCI等国际品牌的商品。根据公安机关查获的假冒商品,统计了嫌疑人的销售金额及缴获商品的货值金额。基于这些证据,检察院认为该嫌疑人涉嫌犯销售假冒注册商标的商品罪。然后,法院对该案件进行审理,记录了案件的案件类型、审理程序和省份等信息。根据公诉机关提供的杨某甲证言、扣押笔录、被告人供述和账本等证据材料,证明了嫌疑人的犯罪事实,法院认定公诉机关的指控成立,认为嫌疑人的行为触犯了《中华人民共和国刑法》第二百一十四条。最后,根据相关法条内容,对嫌疑人做出最终判决。法院认为,嫌疑人应当以销售假冒注册商标的商品罪追究其刑事责任,判处拘役四个月,并处罚金人民币40 000元。

3  基于本体提示的司法实体识别

考虑到在司法文书领域缺乏充足的训练数据语料,并且传统的命名实体识别方法难以在不同犯罪类型的细粒度实体上进行迁移学习,缺少泛化能力,本文提出了一种基于本体的指令提示方法,以辅助大语言模型从司法文书中提取命名实体。

基于上节构建的涉假司法文书本体模型,我们选择了12个细粒度的司法实体类别来进行识别。这些类别包括案号、相关机构、嫌疑人、作案时间、作案地点、罪名、品牌、销售金额、违法所得、销售数量、判决结果和相关法条。为了指导大型语言模型准确地识别这些实体,我们结合了本体模型、采集的司法文书和实体识别任务示例,构造了指令提示。同时,利用LoRA技术[24]对模型进行微调,以提高识别准确性。最后对识别出的实体进行验证和处理。该实体识别方法并不局限于某一类型司法文书,可根据各种类型司法文书所构建的本体模型动态调整,本文仅以所构建的涉假司法文书本体模型为例进行实体识别,整个基于本体引导的司法实体识别过程如图5所示。本节主要介绍使用本体模型辅助的指令提示生成方法,并基于生成的指令提示指导大语言模型进行实体识别。

3.1 指令提示生成

在指令提示中,我们将任务定义为由本体指导的司法实体识别任务,该指令提示由4个部分组成:

1) 任务描述:在任务描述中,明确告知大语言模型所扮演的领域角色,如司法领域专家,并清晰界定完成任务所需的技能和目标;然后,明确说明输出答案的格式要求,例如返回实体的格式。

2) 本体描述:本体是一种形式化的知识表示模型,用于描述特定领域中的概念、实体、属性和它们之间的关系。在本体描述中,根据上节所构建的涉假司法文书本体模型,提供该本体的具体概念及关系,为待识别的司法命名实体类别提供司法领域内详细的定义。这些定义可以是司法领域专业术语的解释,也可以是特定实体类别的描述。

3) 任务示例:在任务示例中,提供具体的司法命名实体识别示例,包括输入的司法文书和对应的期望输出答案样例。示例可根据不同实体类别选择提供少个或多个文本和各种可能的命名实体情况。

4) 司法文本:司法文本是指与法律和司法系统相关的文本材料,本文司法文本来源于司法文书,司法文本是一个个自然语言句子,包含上述本体中的司法实体。

给定这些输入,大语言模型能够提取出符合期望的实体。首先,该指令提示使用任务描述和本体描述作为关于提取哪些实体的指导,同时,大语言模型应该遵循示例输出格式。其次,大语言模型应该严格根据输入的司法文本提取实体,不能提取出文本中不存在的实体,即不应该产生“幻觉”问题。

考虑到命名实体识别任务是序列标注任务而非文本生成任务,大语言模型在文本生成方面表现出色,但在序列标注任务方面的效果相对较差。这是因为序列标注任务要求模型明确地执行实体提取任务,并处理复杂的输出格式,增加了实体提取的难度。因此,在任务描述中,本文的指令提示专注于直接抽取实体,以引导大语言模型直接生成相应实体类别的提取结果。本文在ChatGPT-3.5和ChatGLM2-6B这两个大语言模型上尝试了以上两种方法,实例如图6所示。ChatGPT-3.5的输出格式符合BIO格式的输出要求,但在与实体提取格式相比的实体提取效果方面稍逊一筹,遗漏了判决结果实体类别。ChatGLM2-6B与ChatGPT-3.5相比,在训练数据和模型参数的规模上有较大差异,因此对BIO格式的提示理解能力较差,并未达到预期的输出格式和结果,而在实体提取格式下的效果良好。

由于司法文本具有严谨性、专业性、简明性和权威性等语言特点,与通用领域文本存在差异。这些特点使得对于大语言模型,在理解和解读司法文书时需要具备一定的法律背景和专业知识。因此,在输入大型语言模型的本体描述中,我们参考了司法领域的命名实体定义标准和业务需求,为上述12类细粒度司法实体提供了定义。同时关于司法文本与任务示例的匹配,一种直接的方法是使用文本相似性模型来计算司法文本与训练样本之间的句子级余弦相似度。然而,命名实体识别是一个标记级的任务,更加注重于局部级的实体,而不是与语义级任务相关的整个句子。因此,通过这种方法检索到的句子可能并不包含相应的实体,需要基于标记级别而不是句子级别来检索任务示例,在司法文本中根据包含的实体类型检索出对应的示例语句。为了检索司法文本中包含的实体类别,在构建数据集的过程中,对上述实体类别常见的实体描述词进行了统计。本文将司法文本与各实体类别、实体描述词以及细粒度实体类别的定义相结合,作为输入传递给大语言模型。这样,大语言模型可以参考实体定义和实体描述词,推断出司法文本中可能包含的实体类别。同时,结合在句子中检索匹配实体描述词的结果,得出确定包含的实体类别。表2列出了各实体类别的实体定义及部分实体描述词。

3.2 实体识别

根据上文中构建的指令提示,本文在自行采集的数据集上使用指令提示模板生成问题,并对ChatGLM2-6B[25]和Baichuan2-7B[26]这两个大型语言模型进行微调。在生成问题数据集的过程中,考虑到大语言模型的令牌大小限制以及为了提高实体识别的准确性,我们选择只将与待提取实体类别相关的本体部分作为输入,而不是将整个本体描述输入。首先,检索待识别司法文本中包含的实体类别。然后,将这些实体类别与本体模型中的本体概念及实体定义进行匹配,并结合本体概念之间的关系定义,共同构建完整的本体描述。通过指令调优和LoRA技术,使得大语言模型能够根据提供的指令提示生成符合输出格式的实体提取结果。生成结果后,为了进一步验证和评估,我们在指令提示中的司法文本中搜索该实体字符,并为每个字符生成BIO标签。以上步骤如图7所示。

4  实验及结果分析

为了验证本文方法的有效性,我们采集了涉假司法文书文档,并根据涉假司法文书本体模型包含的部分实体类别进行标注。在完成标注的数据集上进行实验,比较了基于本体提示的大语言模型和传统实体识别方法的性能。

4.1 数据集与评价指标

鉴于司法文书领域缺乏充足的标注语料数据集,本文所使用的数据集是自主创建完成的,收集了300份来自北大法宝网和中国裁判文书网公开的涉假类案件司法文书。基于上节所定义的实体类别,从这些文书中抽取了相应的实体句子。通过采用BIO标注法,手工标注了案号、嫌疑人、罪名、作案时间、作案地点、相关机构、品牌、销售金额、违法所得、销售数量、判决结果和相关法条这12类细粒度实体,这些实体涵盖了涉假司法文书的主要内容。数据集共包含4 637个句子和11 361个实体,具体统计信息详见表3。根据实体统计信息,得知实体类别分布不平衡,其中“嫌疑人”“罪名”“相关机构”合占总数63.6%,而“作案地点”“作案时间”“销售金额”“违法所得”“销售数量”仅合占11.8%。按照4∶1∶1的比例将数据集划分为训练集、验证集和测试集。数据集每一行由两列组成,第一列为文本字符,第二列为BIO格式的标签序列,句子间用空行分割。

本文使用准确率(P)、召回率(R)和F1作为司法文书命名实体识别的评价指标。准确率、召回率、F1值的计算公式如下:

P=TPTP+FP×100%
R=TPTP+FN×100%
F1=2×P×RP+R×100%

其中,TP表示正确预测为命名实体的样本数,FP表示错误地预测为命名实体的样本数,FN表示错误地预测为非命名实体的样本数。

4.2 实验设置

为了验证本文提出的方法在广泛应用的大型语言模型上的适用性,本文选择参数量较少、性能开销较小的ChatGLM2-6B和Baichuan2-7B大语言模型作为实验对象,同时为了与传统实体识别方法比较,选取BiLSTM-CRF、BERT-CRF、BERT-BiLSTM-CRF和GlobalPointer4种较为主流的方法进行了实验。各模型介绍如表4所示。

实验参数设置如下:司法文本句子最大长度设为256,LSTM单元数设为128,初始学习率设为5E-5,Batch大小设为16,dropout设为0.5。

4.3 实验结果分析

在自主创建的数据集上,复现了4个传统实体识别方法,分别是BiLSTM-CRF、BERT-CRF、BERT-BiLSTM-CRF和GlobalPointer,其中,GlobalPointer在BERT对输入进行向量化的基础上,将BERT替换为RoBERTa也进行了实验,在下面的表中,GlobalPointer简写成GP,括号内的内容表示对输入进行向量化的预训练模型。在ChatGLM2-6B和Baichuan2-7B大语言模型上,基于上述创建数据集,按照指令提示模板生成对应问题数据集。各模型的整体实体识别结果如表5

根据表5中的整体识别效果显示,与传统基线模型相比,基于本体提示指导的大语言模型ChatGLM2-6B和Baichuan2-7B的表现更好。与传统基线模型中表现最好的GP(BERT)相比,大语言模型在准确率方面相对于召回率有更大的提升,这是因为在基于本体提示指导的实体语义补充信息下,大语言模型能更好捕捉到命名实体识别任务中的上下文关系和语义信息,从而提高准确率。此外,Baichuan2-7B相对于ChatGLM2-6B表现略好,这是因为BaiChuan2-7B具有更大的模型规模,因此在识别效果方面稍微更好一些。而在传统基线方法中,基于GlobalPointer的方法相较于基于CRF的方法表现更好,是因为GlobalPointer利用了全局归一化的思想,在识别嵌套实体方面表现更好,而数据集中存在较多嵌套实体,同时也验证了大语言模型在嵌套实体上表现较好。

统计ChatGLM2-6B和各传统模型在细粒度实体识别上的性能指标F1值,结果如表6所示。相较于传统实体识别方法,ChatGLM2-6B在案号、罪名、作案地点、相关机构、销售金额、违法所得和销售数量等7类实体上表现最佳。特别是在作案地点和相关机构这两类嵌套实体众多的实体类别上,ChatGLM2-6B的F1值提升超过了5个百分点。例如,在机构实体“广东省广州市海珠区人民法院”中嵌套地名实体“广东省广州市海珠区”,机构名称嵌套了地名实体,这种实体嵌套问题一直是传统实体识别方法中存在的挑战,而大语言模型在解决嵌套实体问题上表现出了更好的识别效果。ChatGLM2-6B模型在嫌疑人、作案时间、品牌、判决结果和相关法条这5类实体上略逊于GP(BERT)模型;在后4类实体上也略逊于BERT-BiLSTM-CRF模型,主要由于这几类实体的词汇表达或在语句中的位置非常固定。例如,法条通常会用书名号标注,判决结果通常用判处有期徒刑等固定词汇,这种词汇特征在BERT模型上的训练效果提升较为显著,且并不需要考虑全局上下文信息。

综上,在少样本训练的情况下,大语言模型展现出了对司法文书实体的出色识别能力,在细粒度实体识别方面表现出强大的泛化能力。此外,在基于本体提示指令的辅助微调下,与传统实体识别方法相比,大语言模型综合表现更出色。

4.4 消融实验

除了与传统深度学习方法的对比实验外,本文还进行了消融实验,以分析基于本体的指令提示和微调对大语言模型实体识别效果的影响。在ChatGLM2-6B模型上设置了4组对比实验,分别是基础模型ChatGLM2-6B模型(指令包含任务描述、任务示例和司法文本三部分),在ChatGLM2-6B模型的基础上微调的ChatGLM2-6B-Tune模型,在ChatGLM2-6B模型的基础上加入基于本体的提示的ChatGLM2-6B-Prompt模型,基于本体的指令提示和微调的完整ChatGLM2-6B-Tune-Prompt模型,消融实验结果如表7所示。当不加入本体提示和微调时,ChatGLM2-6B模型也有较好的表现效果,F1值达到62.55%,这是源于大语言模型在大规模语料数据训练后的基础能力;当只加入训练数据加以微调后,F1值有了显著提升,提升接近20个百分点,说明微调使得模型的性能与任务的特定要求更加匹配。在不加微调时,大语言模型可能会误解任务要求,导致识别错误。然而,经过微调后,模型不仅能更好地理解任务,还能更准确地识别实体。当只加入本体提示信息时,F1值提升了5个百分点左右,这说明通过本体加入实体信息产生了有益的效果;当所有模块都一并加入模型后,达到了最佳效果,说明了所加模块共同叠加在一起时,促进了最终司法命名实体识别任务的提升,也印证了本文基于本体提示指导的改进在微调的基础上的有效性。

5  结 语

本文提出了一种基于本体提示指导的司法命名实体识别方法,利用大语言模型在少样本微调条件下的优势,将其用于司法文书命名实体识别。本研究在缺乏带标注的训练数据的情况下,根据本文构建的涉假司法文书本体模型,从中选择12个细粒度实体类别并自行构建一个少样本命名实体识别语料集进行实验。实验结果表明,所提出的方法在司法命名实体识别上超过传统实体识别方法的综合表现,ChatGLM2-6B和Baichuan2-7B大语言模型在整体实体识别效果相比表现最好的传统识别方法提升均超过1个百分点。相较于传统的深度学习方法,该方法不依赖于大量标注数据,能够处理细粒度实体和嵌套实体,并且具备较好的泛化能力。然而,本研究还存在一些局限性。首先,由于本体模型的构建是基于特定领域,可能在其他领域的应用上存在一定的适应性问题。其次,在司法实体识别的多样性方面仍然存在挑战。未来的研究可以进一步探索对其他实体的识别,以更好地推动司法文书领域的智能化发展。

参考文献

[1]

陈甦, 田禾,吕艳滨,. 法治蓝皮书:中国法院信息化发展报告No.4(2020)[M]. 北京: 社会科学文献出版社, 2020: 17-21.

[2]

CHEN STIAN H Y Bet al. Blue book of rule of law: Annual report on informatization of Chinese Courts No.4 (2020) [M]. Beijing: Social Sciences Academic Press(China), 2020: 17-21(Ch).

[3]

RABINER LJUANG B. An introduction to hidden Markov models[J]. IEEE ASSP Magazine19863(1): 4-16. DOI: 10.1109/MASSP.1986.1165342 .

[4]

BURGES C J C. A tutorial on support vector machines for pattern recognition[J]. Data Mining and Knowledge Discovery19982(2): 121-167. DOI: 10.1023/A: 1009715923555 .

[5]

LAFFERTY J DMCCALLUM APEREIRA F C N. Conditional random fields: Probabilistic models for segmenting and labeling sequence data[C]//Proceedings of the18th International Conference on Machine Learning. New York:ACM, 2001: 282-289. DOI: 10.5555/645530.655813 .

[6]

BIKEL D MMILLER SSCHWARTZ Ret al. Nymble: A high-performance learning name-finder[C]//Proceedings of the 5th Conference on Applied Natural Language Processing. Stroudsburg: Association for Computational Linguistics, 1997: 194-201. DOI: 10.3115/974557.974586 .

[7]

QUARESMA PGONÇALVES T. Using linguistic information and machine learning techniques to identify entities from juridical documents[M]// Semantic Processing of Legal Texts. Berlin: Springer, 2010: 44-59. DOI: 0.1007/978-3-642-12837-0_3 .

[8]

McCALLUM ALI W. Early results for named entity recognition with conditional random fields, feature induction and web-enhanced lexicons[DB/OL].[2024-01-02]. DOI: 10.3115/1119176.1119206 .

[9]

HUANG Z HXU WYU K. Bidirectional LSTM-CRF models for sequence tagging[EB/OL]. 2015arXiv: 1508.01991.

[10]

DOS SANTOS C NZADROZNY B. Learning character-level representations for part-of-speech tagging[DB/OL].[2024-01-02]. DOI: 10.5555/3044805.3045095 .

[11]

CHIU J P CNICHOLS E. Named entity recognition with bidirectional LSTM-CNNs[J]. Transactions of the Association for Computational Linguistics20164: 357-370. DOI: 10.1162/tacl_a_00104 .

[12]

SU J LMURTADHA APAN S Fet al. Global pointer: Novel efficient span-based approach for named entity recognition[EB/OL]. 2022arXiv: 2208.03054. DOI: 10.26689/jcer.v6i5.3958 .

[13]

PETERS MNEUMANN MIYYER Met al. Deep contextualized word representations[C]//Proceedings of the 2018 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long Papers). Stroudsburg: Association for Computational Linguistics, 2018: 2227-2237. DOI: 10.18653/v1/n18-1202 .

[14]

DEVLIN JCHANG M WLEE Ket al. BERT: Pre-training of deep bidirectional transformers for language understanding[DB/OL].[2024-01-02]. DOI: 10.18653/v1/n18-2 .

[15]

陈剑, 何涛, 闻英友, . 基于BERT模型的司法文书实体识别方法[J]. 东北大学学报(自然科学版)202041(10): 1382-1387. DOI: 10.12068/j.issn.1005-3026.2020.10.003 .

[16]

CHEN JHE TWEN Y Yet al. Entity recognition method for judicial documents based on BERT model[J]. Journal of Northeastern University (Natural Science)202041(10): 1382-1387. DOI: 10.12068/j.issn.1005-3026.2020.10.003 (Ch ).

[17]

李春楠, 王雷, 孙媛媛, . 基于BERT的盗窃罪法律文书命名实体识别方法[J]. 中文信息学报202135(8): 73-81. DOI: 10.3969/j.issn.1003-0077.2021.08.010 .

[18]

LI C NWANG LSUN Y Yet al. BERT based named entity recognition for legal texts on theft cases[J]. Journal of Chinese Information Processing202135(8): 73-81. DOI: 10.3969/j.issn.1003-0077.2021.08.010(Ch ).

[19]

曾兰兰, 王以松, 陈攀峰. 基于BERT和联合学习的裁判文书命名实体识别[J]. 计算机应用202242(10): 3011-3017. DOI: 10.11772/j.issn.1001-9081.2021091565 .

[20]

ZENG L LWANG Y SCHEN P F. Named entity re-cognition based on BERT and joint learning for judgment documents[J]. Journal of Computer Applications202242(10): 3011-3017. DOI: 10.11772/j.issn.1001-9081.2021091565 (Ch ).

[21]

POLAK M PMORGAN D. Extracting accurate materials data from research papers with conversational language models and prompt engineering[J]. Nature Communications202415(1): 1569. DOI: 10.1038/s41467-024-45914-8 .

[22]

WEI XCUI X YCHENG Net al. ChatIE:Zero-shot information extraction via chatting with ChatGPT[EB/OL]. 2023arXiv: 2302.10205.

[23]

WANG S HSUN X FLI X Yet al. GPT-NER: Named entity recognition via large language models[EB/OL]. 2023arXiv: 2304.10428.

[24]

HU YCHEN Q YDU J Cet al. Improving large language models for clinical named entity recognition via prompt engineering[J]. Journal of the American Medical Informatics Association202431(9): 1812-1820. DOI: 10.1093/jamia/ocad259 .

[25]

DAGDELEN JDUNN ALEE Set al. Structured information extraction from scientific text with large language models[J]. Nature Communications202415(1): 1418. DOI: 10.1038/s41467-024-45563-x .

[26]

NGUYEN MKISHAN K CNGUYEN Tet al. Efficient fine-tuning large language models for knowledge-aware response planning[C]//Joint European Conference on Machine Learning and Knowledge Discovery in Databases. Cham: Springer, 2023: 593-611. DOI: 10.1007/978-3-031-43415-0_35 .

[27]

NOY N FMcGUINNESS D L. Ontology development 101: A guide to creating your first ontology[DB/OL]. [2024-01-02].

[28]

HU EWALLIS PALLEN-ZHU Z Yet al. LoRA: Low-Rank adaptation of large language models[DB/OL].[2024-01-02].

[29]

DU Z XQIAN Y JLIU Xet al. GLM: General language model pretraining with autoregressive blank infilling[C]//Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Stroudsburg: Association for Computational Linguistics, 2022: 320-335. DOI: 10.18653/v1/2022.acl-long.26 .

[30]

YANG A YXIAO BWANG B Net al. Baichuan2: Open large-scale language models[EB/OL]. 2023arXiv: 2309.10305.

基金资助

国家重点研发计划重点专项(2022YFC3300804)

武汉市重点研发计划(2022012202015070)

武汉市东湖高新区揭榜挂帅项目(2022KJB12)

富媒体数字出版内容组织与知识服务实验室开发基金(ZD2023-11/01)

AI Summary AI Mindmap
PDF (2233KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/