基于知识微调和信息融合的医学指南知识抽取

高峰 ,  刘晴 ,  靳英辉 ,  顾进广

武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (2) : 232 -242.

PDF (2273KB)
武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (2) : 232 -242. DOI: 10.14188/j.1671-8836.2024.0032
人工智能

基于知识微调和信息融合的医学指南知识抽取

作者信息 +

Medical Guide Knowledge Extraction Based on Knowledge Fine Tuning and Information Fusion

Author information +
文章历史 +
PDF (2326K)

摘要

医学指南的发布速度迅猛,但其在循证过程中的结构化组织和检索面临诸多挑战,影响了知识的迅速获取和应用。为应对这一问题,本文提出了基于循证医学的指南知识抽取模型。该模型旨在实现指南证据的高效抽取并且识别指南证据来源文献的偏倚风险。该模型结合人工标注的少样本数据集构建提示指令对大语言模型进行训练,以提升其在指南知识抽取任务上的性能。构建融合外部知识的随机对照试验偏倚风险评估模型,在BERT模型的基础上引入多元化的外部知识信息增强模型的偏倚风险识别能力。经过提示微调后的大语言模型在抽取指南关键信息任务上的性能得到了显著提升,BLEU-4提升在43个百分点以上。融合外部知识的证据偏倚风险评估模型在识别偏倚风险方面也展现出了优越的性能,最高精确率达到了0.898,F1值达到了0.892。这表明,在有限的数据集规模下,结合提示工程对大语言模型进行微调,可以有效地提取所需的医学指南信息,并且经过融合多元化的外部知识后,偏倚风险识别模型的性能得到了显著增强。因此,医学指南知识抽取模型有助于推动高质量临床医学研究。

Abstract

In recent years, the publication speed of medical guidelines has been rapid, but their structured organization and retrieval in the evidence-based process face many challenges, which affect the rapid acquisition and application of knowledge. This study proposes a guideline knowledge extraction model based on evidence-based medicine to address the issue. This model aims to efficiently extract guideline evidence and identify the risk of bias in the source literature of guideline evidence. The model combines manually annotated small-sample datasets to construct prompt instructions for training large language models to improve their performance in guideline knowledge extraction tasks. A randomized controlled trial bias risk assessment model was constructed that integrated external knowledge, and enhanced the model's bias risk identification ability by utilizing diverse external knowledge information based on the BERT model. After fine-tuning with prompts, the performance of the large language model in extracting key information from guidelines was significantly improved, with BLEU-4 improving by over 43 percentage points. The evidence bias risk assessment model that integrates external knowledge also showed superior performance in identifying bias risks, with a precision of 0.898 and an F1 value of 0.892. With a limited dataset size, fine-tuning a large language model with hint engineering can effectively extract the required medical guideline information. The incorporation of various external knowledge sources substantially improved the effectiveness of the bias risk identification model. This suggests that models designed to extract knowledge from medical guidelines can contribute to enhancing the quality of clinical research.

Graphical abstract

关键词

循证医学 / 大语言模型 / BERT / 偏倚风险评估

Key words

evidence-based medicine / large language model / BERT / bias risk assessment

引用本文

引用格式 ▾
高峰,刘晴,靳英辉,顾进广. 基于知识微调和信息融合的医学指南知识抽取[J]. 武汉大学学报(理学版), 2025, 71(2): 232-242 DOI:10.14188/j.1671-8836.2024.0032

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

循证医学是指遵循科学依据的医学,发展于20世纪90年代初期,其基本定义为“决策应基于当前可得的最佳研究证据,同时结合临床经验及患者偏好与价值观”[1],是基于证据指导医疗卫生实践和科学决策的国际公认方法。

尽管循证医学的理念在医学科研和临床实践中得到了广泛认可,但其核心载体——医学指南,在实际应用中并未实现真正的可计算化。目前,医学指南的利用方式主要还是依赖于传统的案头参考或电子化检索,这在处理复杂的临床案例时,显得尤为不足。因为医生们难以根据实际情况,快速进行多病种指南的细粒度知识查询和推理,更无法与临床信息系统相结合,提供及时有效的支撑或建议。此外,医学指南的制定和更新过程严谨且繁琐,涉及大量证据等级的划分、评定以及风险评估,使得医学指南的更新周期较长,难以迅速应用于临床实践。这些因素共同制约了医学指南的可计算化发展。

因此,采用自动化手段高效地提取本体中涉及的医学指南(以下简称指南)关键信息,将有助于提升指南的实用性和时效性,推动循证医学在临床实践中的广泛应用。此外,在制定指南的过程中,产生和分析证据是关键环节,要求评估证据来源文献的偏倚性。

随机对照试验(Randomized Controlled Trial,RCT)是循证医学的主要证据来源。它的基本做法就是将研究对象随机分配到研究组和对照组,在相同环境下对不同组实施不同的干预措施,以比较两组的差异。RCT作为一种严格的科学研究方法,尽最大可能地减小或者消除治疗组与对照组之间的不平衡因素,提供干预措施最高级别有效性质量证据,因此在系统评价中被广泛采用,成为系统评价的主要证据来源之一[2]。系统评价是对特定问题的相关文献进行全面地搜集、筛选、分析并综合评价,其主要目的是为临床决策提供科学依据。基于RCT 的高质量系统评价被认为是具有最高证据等级的循证医学证据[3]

因此,系统评价需要对纳入的RCT进行质量分析,排除低质量的RCT或对不同偏倚风险的RCT结果进行对比分析。Cochrane系统评价手册[4]中提到,RCT的偏倚风险类别主要从以下7个方面进行评估:随机序列生成(Random Sequence Generation,RSG)、分配隐藏(Allocation Concealment,AC)、对试验受试者及试验人员实施盲法(Blinding Of Participants and personnel,BOP)、对结局评估员实施盲法(Blinding of Outcome Assessment,BOA)、实验结果数据不完整(Incomplete Outcome Data,IOD)、选择性报告(Selective Reporting,SR)和其他偏倚(Other sources of bias,O)。评估的结果用“偏倚风险较低”“风险未知”或“偏见风险较高”表示。另外,有研究表明,大部分RCT的偏倚风险评价需要花费系统评估员10到60分钟的时间才能完成,并且偏倚风险判断结果可能还不太准确。如果遗漏了文献的一些关键信息,不同的系统评估员针对同一篇RCT甚至可能得出不一样的结论[5]

当前,有很多用于偏倚风险评估的工具,比如Cochrane ROB tool、PEDro量表、Delphi清单、Jadad量表等等,但是这些工具极其依赖人工操作,既耗时又耗力。而且随着互联网和科学技术的发展,近些年来生物医学文献的发表数量呈现爆发式增长,对其进行偏倚风险评估变得更加困难。因此,如果采用人工智能的方法实现自动化偏倚风险评估,将是一项十分有意义的研究,不仅能在一定程度上减轻系统评估员的工作量,同时也可以促进快速医疗决策。

自动化的偏倚风险评估近些年才兴起,最早的一项评估是由2014年的Marshall等提出的使用机器学习方法支持向量机构建文本分类模型预测偏倚风险类别,提取偏倚风险句子[6]。后续,更多的机器学习方法、深度学习方法和自然语言处理技术被用在对RCT文献的自动化偏倚风险评估。但是,这些研究在构建偏倚风险评估模型时使用的数据仅仅采集系统评价中的RCT及其对应的偏倚风险数据,缺乏多元化、多维度的信息。因此,本文在构建偏倚风险模型时,利用外部信息进行证据表示增强技术,实现指南证据风险识别,该模型融合了更多元化的偏倚风险判断因素,期望以更高的精确率提取出RCT的偏倚风险句子,提高系统评估员的工作效率。

本文的贡献主要有以下两点:

1) 对指南循证知识进行了深入的解析和建模,并且利用少样本图谱标注数据构建微调指令,实现了基于大语言模型的指南信息抽取;

2) 提出了融入外部知识的RCT偏倚风险评估模型,基于BERT模型将更多元化的偏倚风险判断因素融入模型中,以实现对RCT更高精确率的自动化偏倚风险句子提取,实现指南证据风险识别。

1  相关工作

1.1 大语言模型提示微调

大语言模型(Large Language Model,LLM)是一种集成了巨量数据的语言模型,其数据参数规模高达亿级别[7]。它的主要目的是解析人类的问题并提供精确的回应。通过其强大的数据处理能力,LLM能够预测文本序列中的后续词汇,或生成与给定文本紧密相关的内容。这使得LLM在自然语言处理领域具有广泛的应用价值,包括但不限于文本分类、情感分析、智能问答以及机器翻译等。简而言之,LLM能够理解人类的询问并提供精准的回应,为我们提供便利。

LLM在处理多样化的任务时,通常需要针对特定任务的数据集进行微调。微调过程是使模型接触与特定任务相关的标记数据优化其性能。这些数据包含了任务所需的关键信息和特征。通过在这些数据上进行训练,LLM可以学习如何更有效地处理这些任务,并改进其预测和生成能力。微调通常涉及对模型参数的调整,以使其更加符合特定任务的需求。因此,当LLM面对与这些任务相关的输入时,它能够更加精确地理解并生成适当的输出,从而提高任务处理的准确性。

借助提示词和高效的少样本学习,提示微调可使LLM快速适配至新任务[8]。Loukas等[9]采用提示微调实现金融领域短文本分类,结果显示,经过提示微调的LLM在执行分类任务时快速且准确,其方法被证实为一种实用且高效的少标签类别分类解决方案。李西雨等[10]基于LLM实现科技论文语义评价指标的自动量化打分,结果显示基于提示微调LLM的指标量化方法具有较高的精确度和可靠性,并且详细的提示词对提升量化效果具有积极作用,micro-acc和fuzzy-acc可以达到0.72和0.87。

提示微调的效果受到诸多因素的影响。其中,高质量的提示模板起着至关重要的作用,它能有效激发LLM的巨大潜力。在数据集规模有限的前提下,使用提示微调LLM的方法依然不失为一种高效且实用的解决方案。通过精心设计的提示模板,可以充分利用有限的数据资源,有效引导LLM进行针对性的学习,从而实现更好的性能提升。

1.2 偏倚风险自动识别

偏倚风险句子提取任务的本质就是文本分类。与本文相关的研究工作可以分成:基于传统机器学习的文本分类方法和基于深度学习的文本分类方法。

1.2.1 机器学习方法

基于机器学习的文本分类方法的核心是将文本表示成向量,便于计算机的理解和处理。特征提取是文本分类的一个重要步骤,常用的模型有词袋模型(Bag-Of-Words,BOW)[11]、TF-IDF模型[12]和词嵌入等。BOW忽略文本的语法和语序,将句子中的每一个单词看成独立的,统计单词出现的频率。TF-IDF模型可以计算关键词与文档的相关性,排除无意义词,某些关键词在文档中出现的频率越高,则相关性越高。词嵌入模型是对简单的BOW的改进,是一种提供单词向量表示的方法,可以捕获单词的含义。特征提取后再进行分类,常用的分类器模型有SVM、朴素贝叶斯等。

关于偏倚风险自动评估的研究并不是很多。2014年,Marshall等[6]使用2 200篇RCT及其系统评价中对应的偏倚风险评估数据通过BOW的特征提取方法,基于SVM分类器模型实现偏倚风险句子提取任务。2016年,Millard等[13]使用1 467篇RCT及其系统评价中对应偏倚风险评估数据通过BOW的特征提取方法,基于Logistic回归分类模型实现偏倚风险句子提取任务。2020年,夏渊[14]使用结合n-gram与TF-IDF的特征工程方法,基于SVM分类器实现该任务。

然而,以上研究在对文本进行向量表示时,忽略了文本的上下文信息,可能导致最终的结果不太精确。

1.2.2 深度学习方法

深度学习比机器学习更加的复杂且高级,深度学习方法可以自动地从训练数据中学习到更多潜在的有效特征表示,获得比传统机器方法更好的分类效果。

BERT模型是一种预训练的深度学习模型,最早出现在2018年12月,是由Google的NLP团队在其预印版论文中提出的,直到2019年3月该团队才正式开源其预训练模型[15]。BERT由多层双向Transformer[16]编码器组成。Transformer的结构图如图1所示,BERT模型的结构图如图2所示。

BERT模型在众多自然语言处理任务上都表现得很出色。但是,BERT模型存在一个潜在缺点就是它对输入长度有限制。它只能接受最多512个标记的嵌入作为输入。这在处理长文档或长序列的任务时可能会成为一个限制因素。对于需要处理超长文本的任务,如RCT摘要或全文分析,这种输入长度的限制可能会限制模型的表现。

2021年,夏渊等[17]使用3 802篇RCT及其系统评价中对应的偏倚风险评估数据基于深度学习算法BERT-Base进行特征表示和文本分类,实现了对RCT的偏倚风险句子提取任务。由于大规模预训练BERT模型能够结合上下文语境,考虑文本的语义关系,将所得结果与传统机器学习方法(结合n-gram与TF-IDF的特征工程方法和LinearSVM分类器)结果进行比较时发现该模型在各类偏倚风险上F1值都有所提升,较机器学习方法高18.2%。

但是,以上模型不管是使用机器学习方法还是深度学习方法,在构建偏倚风险数据集时只考虑了系统评价纳入的RCT的原文及其对应偏倚风险评估数据,缺乏多元化的偏倚风险判断信息,导致精确度不是很高。

2  本文方法

给定一篇医学指南文献,可以将其视为包含医学知识的一系列句子S={s1,s2 , }的集合。通过构建基于循证医学的指南知识本体,匹配出指南中与本体概念相对应的句子。这些句子,即指南中的关键信息,称之为核心句。运用微调后的LLM对这些核心句进行知识抽取,同时追溯核心句的来源文献,进行偏倚风险评估。总体流程如图3所示。

2.1 构建指南知识本体

本文的指南文献以高血压、冠心病、糖尿病等慢性病的治疗指南和应用指南为主。构建指南知识本体的核心目的在于从临床实践指南文献提取出与医学实践密切相关的关键信息。这些信息不仅涵盖了疾病的治疗方法、预防措施、诊断手段等医学知识,还包括了这些知识的来源、质量评估等。以证据为依据强化推理和决策过程,从而确保为医生、患者及决策者提供科学、可信赖的医学指导。

通过分析医学指南实际应用、市场需求等特点,指南知识本体参考国际指南RIGHT报告规范和PICO(Population, Interventions, Comparisons, Outcomes)模型对指南内容进行拆分。PICO模型常用于构建临床问题,将每个临床问题分为患者、对照、干预和结果四个部分。PICO模型基于循证医学理论,利用证据来解答临床问题,从而为临床指南提供坚实的循证支持[18]。拆分的指南模块,包括但不限于:指南基本信息(如标题、作者、发表年份、术语与定义等)、指南背景(如针对的目标人群、适用范围等)、指南的制订方法学、临床问题(目标人群、干预方案、对比方案等)、推荐意见(药物治疗方案或者操作治疗方案等)、结论、证据(证据来源等)、结果(结局指标、效应值、置信区间、精确率)和推荐理由等,为细粒度指南知识的提取提供良好的数据支撑。本体的总体概念模块如图4所示。最后,采用七步法完成指南知识本体的构建工作。

2.2 基于微调LLM的指南知识抽取

在医学领域的专家的帮助下,根据指南知识本体模型对句子进行标注。手动标注是一项既繁琐又耗时的任务。

为了提高工作效率,本文采用手动和人工智能相结合的方式。首先,使用LLM实现医学指南循证知识的抽取。通过构建提示模板微调LLM,对文献中的大量信息进行快速分析,提取出关键信息。然后,专家再对模型分析出的内容进行审查和分析,以确保其准确性和可靠性。

通过这种手动和人工智能相结合的方式,医学领域的专家们成功地对医学指南文献的信息进行抽取,为医学指南的循证数据提供了丰富可靠的来源。具体流程如图5所示。

2.2.1 构建预训练语料

在构建预训练语料之前需要对数据进行预处理,主要有两个步骤:第一步,对于原始指南文本进行分句,以句子为基本单位作为模型的基本输入;第二步,对句子按照本体模型中的概念进行标注,标注句子的类型以及该句子中包含的属性和对应的属性值。人工标注句子的类型主要有四种类型,每个类别所涵盖的主要属性详见表1所示。

构建预训练语料的目的是将数据转化为问答对形式,便于LLM的使用。将文本数据标注转化为多轮问答,第一轮问答在句子中标注现有的句子类型,第二轮问答根据第一轮的标注,标注与该类型句子中包含的属性,最终获得输入语句中的句子类型和属性值的参数答案。因此,问答模板主要有两类,类型预测模板和属性预测模板,如表2所示。

2.2.2 微调模型

本文使用提示工程模板微调LLM,提示的作用主要是从指南中准确识别并且提取与循证本体相关的关键信息,如临床问题、推荐意见、证据、结果等等类型的句子,并从中进一步抽取该类型句子所包含的具体属性。模板的构成形式如下式所示:

Prompt=Instruct+Examples+Input

其中,Instruct表示对任务的说明,Example表示示例,Input是输入的文本。

为了根据Instruct指令引导LLM生成Input中的核心句,本文设计了核心句模板Core Sentence Prompt。考虑到句子中可能没有出现核心句,在Input中,允许LLM输出为None,只有输入句子中包含核心句才能进入下一步。为了确定核心句的类别,设计了类型预测模板Type Prediction Prompt,利用规则匹配的方法去除部分错误答案,随后,运用类型判断模板Type Judge Prompt对预测结果进行验证,以确定该句子类型是否属于指南知识本体所涵盖的类型范畴。同时,在该模板的Instruct中添加对类型句子的解释和说明以及判断依据等,将回答为Yes的结果保存下来。为了抽取出该类型句子的属性,还设计了属性预测模板Attribute Prediction Prompt。提示工程模板如图6所示。最后将属性对应的属性值结果保留下来,即为最终抽取的结果。

2.3 融合外部知识的RCT偏倚风险识别

融入外部知识的RCT偏倚风险识别模型的构建主要包含两大关键部分:首先是外部知识的引入,其次是偏倚风险识别模型的构建。

2.3.1 外部知识的引入

RCT偏倚风险评价工具ROB2.0中对系统评价的研究方案计划书对于偏倚风险因素的判断标准进行了详细的阐述。研究方案计划书需要明确列出所评估研究可能存在的各种偏倚风险并且具体描述其产生的原因和导致的结果。对于每一类偏倚风险,研究方案计划书都提供了明确的判断标准。图7展示了研究计划书所包含的重要信息。

本文使用的数据主要来自Cochrane系统评价数据库(Cochrane Database of Systematic Reviews,CDSR)[19]。CDSR几乎涵盖了临床医学的各个专业,截至2023年底,已经包含了9 100余篇系统评价、2 300余篇研究方案计划书和部分社论等。

系统评价包含的结构化偏倚风险评价数据主要分为三个部分:Bais、Authors' judgement和Support for judgement。Bais也就是偏倚风险的类别。Authors' judgement是作者给出的对该类偏倚风险的判断结果,低偏倚风险Low Risk、高偏倚风险High Risk或者偏倚风险未知Unclear Risk。Support for judgement是作者对此判断结果给出的依据。

因此,本文的数据集主要包含三个部分:系统评价的研究方案计划书、其纳入的RCT文献全文和RCT的偏倚风险评价数据。经过一系列的格式处理和数据清洗后,最终构建出句子分类模型所需的数据集,数据集构建流程如图8所示。

引入外部知识的过程主要是利用余弦相似度,将偏倚风险的判断标准句子向量和RCT原文的句子向量进行计算。将相似度得分最高的前k个句子视为相关句,其他句子视作非相关句。句子向量之间的相似度计算如图9所示。

2.3.2 偏倚风险识别模型的构建

本文的BERT模型编码采用的是12层的Transformer,模型结构如图10所示,其中输入编码向量中的[CLS]作为输出结果的分类结果,是分类任务中常用的符号。在BERT的每个Transformer层中引入根据系统评价的偏倚风险评价原因找到的RCT文中的偏倚风险句子向量EmbeddingA1和根据研究方案计划书的偏倚风险判断标准找到的对应RCT文中的偏倚风险句子向量EmbeddingA2,将这两个向量和Transformer层产生的中间输出拼接在一起,作为下一个步骤的输入。

输入文本序列的embedding操作将位置嵌入和分层嵌入进行结合。首先,令牌嵌入阶段层token embedding是将各个词转换成固定维度的向量;然后,进行分层嵌入操作segment embedding,该过程的主要目的是学习单词的全局语义信息,这个过程是动态的,随着训练的迭代进行发生一定的变化;再加入单词的位置信息position embedding,其主要目的是为了让BERT学习到输入的顺序属性;最后将三个嵌入所得的结果作为BERT模型的输入。

3  实 验

3.1 实验目标

本文提出的基于循证医学的指南知识抽取模型主要有两个任务:根据指南知识本体标注数据构建微调指令,实现指南知识抽取;利用外部信息进行证据表示增强,识别指南证据来源文献的偏倚风险。实验3.3.1验证不同来源的LLM在相同数据集上经过提示微调后对指南知识抽取的有效性,实验3.3.2验证融合外部知识后的模型在偏倚风险识别任务上的有效性。

3.2 训练参数设置和评价指标

在ChatGLM、CPM-Bee、Baichuan等大模型上进行指南知识抽取实验,学习率设置为1E-4,模型批次设置为16,通过INT4量化,仅仅需要20 GB显存就可以实现模型的微调。实验的评估指标选择BLEU-4、ROUGE-1、ROUGE-2、ROUGE-L。其中,BLEU-4通过计算四元组n-gram的精确匹配程度评估机器翻译的质量;ROUGE系列用于评估文本生成与参考文本的相似度,ROUGE-1着重单词重复率,ROUGE-2侧重二元词组重复率,ROUGE-L则评估结构和句法相似性,计算最长公共子序列的召回率。

对于偏倚风险识别模型,经过多次实验调参,得出效果较好的模型的主要参数为:训练epoch的数量是10,学习率为1E-5,batch_size设置成64。按照8∶1∶1的比率把数据集拆分成训练集、验证集、测试集。模型训练停止后,在测试集上进行测试,并记录模型的精确率(P)、召回率(Recall)和F1值。

3.3 实验结果及分析

3.3.1 指南知识抽取实验

人工标注数据集上,ChatGLM、CPM-Bee、Baichuan模型得到的实验结果,与经过提示微调后的ChatGLM_P、CPM-Bee_P、Baichuan_P模型在相同数据集上的实验结果之间的对比如表3所示。

表3可得,经过提示微调后的LLM各项指标效果均有所增加,BLEU-4提升在43个百分点以上,说明模型经过微调后对指南知识的抽取结果也更加接近人工标注得到的结果。Baichuan模型比ChatGLM和CPM-Bee模型的效果在该数据集上表现更好,这说明了Baichuan模型在本文指南知识的抽取任务上具有更强大的学习能力。因此,使用少量人工标注的数据结合对提示微调的方法,能够更准确地生成抽取结果,在一定程度上可以实现对指南中循证信息的有效抽取。

3.3.2 指南证据偏倚风险识别实验

本文选取了几个具有代表性的偏倚风险识别模型进行识别实验。将2014年Marshall等对RCT偏倚风险句子提取算法模型记作Marshall2014[6],将2016年Millard等对RCT偏倚风险句子提取算法模型研究记作Millard2016[13],将2021年Wang等[20]对临床文献提出的偏倚风险算法中使用CNN模型和加入注意力的RNN模型分别记为WangC2021和WangR2021,将2021年夏渊等对RCT偏倚风险句子提取算法模型记作Xia2021[17]。此外,将本文模型命名为COROB。

各模型在偏倚风险句子分类任务的结果对比如表4所示(文献如果存在其他偏倚,其产生原因复杂且多样化,难以从文献中找到原文语句,故仅考虑以下6类偏倚风险的情况:随机序列生成RSG、分配隐藏AC、对试验受试者及试验人员实施盲法BOP、对结局评估员实施盲法BOA、试验结果数据不完整IOD、选择性报告SR,消融实验部分同)。

偏倚风险识别任务的目的在于希望模型预测结果中出现尽可能多的句子确实和偏倚风险描述相关,即希望模型表现出尽可能高的精确率。通过表4的实验结果可知,融合多元化外部知识后的模型在6类偏倚风险类别上的表现要优于其他基线模型,精确率在0.850至0.900之间,F1值在0.830至0.900范围内;最高精确率为0.898,最高F1值为0.892,在一定程度上说明了该模型可以实现自动化的偏倚风险识别。

3.3.3 消融实验

为了验证提取RCT的偏倚风险句子时,模型融合多元化外部知识能够获得更佳效果,本文还设计了两个实验,以探究消除研究方案计划书或系统评价的偏倚风险相关信息所带来的影响。这两个实验方法分别被标记为COROB-研究方案计划书和COROB-系统评价。

实验的结果如表5所示。由表5的结果可知,在使用BERT模型进行自动化的偏倚风险句子提取时,模型在使用系统评价相关信息的基础上引入其研究方案计划书中与RCT偏倚风险相关的信息,模型的性能最佳。这说明研究方案计划书在RCT的偏倚风险识别中确实发挥了一定的积极作用。然而,当模型仅依赖研究方案计划书时,其效果表现最差。这主要是因为研究方案计划书中关于偏倚风险评估的决策信息范围过于宽泛,不够精确和具体,这在一定程度上影响了偏倚风险类别句子分类模型测试的结果。因此,在BERT模型的基础上融合多元化外部知识后,模型的分类效果更好,能更有效地支持对知识来源文献进行偏倚风险识别。

4  结 语

本文实现了基于循证医学的指南知识抽取模型,该模型主要有两个目的,抽取指南知识和识别指南证据风险。由实验结果可得,根据指南知识本体模型标注数据,并且在该数据集上对LLM模型进行提示微调后,模型在抽取指南知识任务上的各项性能指标均获得了显著提升,BLEU-4的提升在43个百分点以上。这一结果充分说明了人工标注结合LLM微调在构建知识工程方法中的有效性,为指南循证知识库的构建奠定了坚实的基础。另外,为了识别证据来源文献的偏倚风险,本文结合BERT模型构建了融合外部知识的RCT偏倚风险评估模型,实验结果表明,融合多元化外部知识后,模型效果更好,精确率在0.850至0.900之间,F1值在0.830至0.900,各项指标比起其他基线模型均有一定的提升。未来期望该模型应用到实际临床决策中,为更高质量的临床医学研究奠定基础。

参考文献

[1]

陈耀龙,孙雅佳,罗旭飞,.循证医学的核心方法与主要模型[J].协和医学杂志202314(1):1-8. DOI: 10.12290/xhyxzz.2022-0686 .

[2]

CHEN Y LSUN Y JLUO X Fet al. The core methods and key models in evidence-based medicine[J]. Medical Journal of Peking Union Medical College Hospital202314(1):1-8. DOI: 10.12290/xhyxzz.2022-0686 .

[3]

罗辉, 刘建平. 从系统综述看中国随机对照试验的质量[J]. 中西医结合学报20119(7): 697-701. DOI: 10.3736/jcim20110701 .

[4]

LUO HLIU J P. Quality and validity of randomized controlled trials in China from the perspective of systematic reviews[J]. Journal of Chinese Integrative Medicine20119(7): 697-701 (Ch). DOI: 10.3736/jcim20110701 .

[5]

胡雁. 循证护理学[M]. 北京:人民卫生出版社,2012.

[6]

HU Y. Evidence based nursing[M].Beijing:People’s Medical Publishing House,2012 (Ch).

[7]

SAVOVIĆ JWEEKS LSTERNE J A Cet al. Evaluation of the Cochrane Collaboration’s tool for assessing the risk of bias in randomized trials: Focus groups, online survey, proposed recommendations and their implementation[J]. Systematic Reviews20143: 37. DOI: 10.1186/2046-4053-3-37 .

[8]

LENSEN SFARQUHAR CJORDON V. Risk of bias: Are judgements consistent between reviews[DB/OL].[2024-01-02].

[9]

MARSHALL I JKUIPER JWALLACE B C. Automating risk of bias assessment for clinical trials[C]//Proceedings of the 5th ACM Conference on Bioinformatics, Computational Biology, and Health Informatics. Newport Beach California. New York: ACM, 2014: 88-95. DOI: 10.1145/2649387.2649406 .

[10]

朱雯, 李亚光, 李喆, . 基于文献和知识学习的重症医学大语言模型探索[J]. 中国数字医学202419(3): 36-41. DOI: 10.3969/j.issn.1673-7571.2024.03.007 .

[11]

ZHU WLI Y GLI Zet al. Research on large language model of intensive care medicine based on literature and knowledge learning[J]. China Digital Medicine202419(3): 36-41 (Ch). DOI: 10.3969/j.issn.1673-7571.2024.03.007 .

[12]

LIU XJI K XFU Y Cet al. P-Tuning v2: Prompt tuning can be comparable to fine-tuning across scales and tasks[DB/OL].[2023-01-02]. DOI: 10.18653/v1/2022.acl-short.8 .

[13]

LOUKAS LSTOGIANNIDIS IMALAKASIOTIS Pet al. Breaking the bank with ChatGPT: Few-shot text classification for finance[DB/OL].[2023-01-02]. DOI: 10.1145/3604237.3626891 .

[14]

李西雨, 钱力, 张智雄. 基于提示微调的科技论文语义评价指标量化方法研究[J]. 数据分析与知识发现20248(Z1): 200-212.

[15]

LI X YQIAN LZHANG Z X. A scoring method for semantic evaluation metrics of scientific papers based on prompt tuning of large language models[J]. Data Analysis and Knowledge Discovery20248(Z1): 200-212 (Ch).

[16]

ZHANG YJIN RZHOU Z H. Understanding bag-of- words model:A statistical framework[J].International Journal of Machine Learning and Cybernetics20101(1):43-52. DOI:10.1007/s13042-010-0001-0 .

[17]

JIANG Z YGAO BHE Y Let al. Text classification using novel term weighting scheme-based improved TF-IDF for Internet media reports[J].Mathematical Problems in Engineering2021: Article ID 6619088. DOI: 10.1155/2021/6619088 .

[18]

MILLARD L A CFLACH P AHIGGINS J P T. Machine learning to assist risk-of-bias assessments in systematic reviews[J]. International Journal of Epidemiology201645(1): 266-277. DOI: 10.1093/ije/dyv306 .

[19]

夏渊. 系统评价中自动化偏倚风险评估的相关算法研究[D]. 成都: 电子科技大学, 2020. DOI: 10.27005/d.cnki.gdzku.2020.002719 .

[20]

XIA Y. Research on relevant algorithms for automated risk of bias assessment in systematic reviews[D].Chengdu: University of Electronic Science and Technology of China, 2020 (Ch).

[21]

DEVLIN JCHANG M WLEE Ket al. BERT: Pre-training of deep bidirectional transformers for language understanding[EB/OL]. 2018arXiv: 1810.04805. DOI: 10.48550/arXiv.1810.04805 .

[22]

LIANG D KXU WBAI X. An end-to-end transformer model for crowd localization[EB/OL]. 2022arXiv: 2202.13065. DOI: 10.1007/978-3-031-19769-7_3 .

[23]

夏渊, 刘东峰, 张津馗, . 基于BERT的自动化偏倚风险评价方法的研究[J]. 中国循证医学杂志202121(2): 204-209. DOI: 10.7507/1672-2531.202006177 .

[24]

XIA YLIU D FZHANG J Ket al. BERT-based automated risk of bias assessment[J]. Chinese Journal of Evidence-Based Medicine202121(2): 204-209. DOI: 10.7507/1672-2531.202006177(Ch ).

[25]

孙皓, 时景璞. 循证医学中PICO模型的扩展及其在定性研究中的应用[J]. 中国循证医学杂志201414(5): 505-508. DOI: 10.7507/1672-2531.20140087 .

[26]

SUN HSHI J P. Expansion of PICO model in evidence-based medicine and its application in qualitative research[J]. Chinese Journal of Evidence-Based Medicine201414(5): 505-508. DOI: 10.7507/1672-2531.20140087 (Ch ).

[27]

白永梅, 杜建. 可计算的临床证据综合: 方法与进展[J]. 首都医科大学学报202243(4): 576-583. DOI: 10.3969/j.issn.1006-7795.2022.04.011 .

[28]

BAI Y MDU J. Computable clinical evidence synthesis: A literature review[J]. Journal of Capital Medical University202243(4): 576-583. DOI: 10.3969/j.issn.1006-7795.2022.04.011 (Ch ).

[29]

WANG QLIAO J YLAPATA Met al. Risk of bias assessment in preclinical literature using natural language processing[J]. Res Synth Methods202213(3): 368-380. DOI: 10.1002/jrsm.1533 .

基金资助

武汉市重点研发计划(2022012202015070)

武汉市东湖高新区揭榜挂帅项目(2022KJB12)

富媒体数字出版内容组织与知识服务实验室开发基金(ZD2022-10/05)

国家自然科学基金(U1836118)

AI Summary AI Mindmap
PDF (2273KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/