0 引 言
乳腺癌是女性最常见的恶性肿瘤之一,严重威胁着女性的健康。乳腺超声检查具有无损伤、操作简单、可重复操作、检出率高等优点,在我国已成为使用最广泛的乳腺癌检查手段之一。随着检查和诊断手段的增加以及数据收集技术的发展,医院积累了大量的乳腺癌病历文本和医生手记,这些病历文本承载着丰富的乳腺癌诊断经验,从中提取的信息不仅有助于加强病人的病情管理
[1,2],而且有助于开展乳腺癌的风险预测
[3]。
知识图谱以图数据库作为存储引擎,通过对提取的关键信息进行智能化处理,并采用可视化技术来描述知识资源及其载体
[4]。现有的医学知识图谱,大都是基于互联网上公开的医学文献、网络社区或各种开放数据库
[5~7],这类数据虽然获取比较方便,但是涉及到电子病历(electronic medical record,EMR)的医疗事实知识较少
[8,9]。针对乳腺癌EMR知识图谱研究,龚乐君等
[10]从自然语言角度出发,使用挖掘算法从临床病历文本挖掘病人乳腺癌这一疾病的相关信息,构建了乳腺癌TNM(tumor, node, metastasis)分期知识图谱。崔洁等
[11]提出了从EMR中提取乳腺癌肿瘤医疗事实知识,在此基础上构建乳腺癌诊断知识图谱,但缺乏对知识图谱构建步骤的详细描述以及对构建结果的报告,无法检验所生成知识图谱的效果。Hasan等
[12,13]提出了一套从癌症注册登记数据构建知识图谱的方法,并发展了针对乳腺癌病人管理的知识图谱雏形,但包含乳腺癌诊断的知识非常有限。Yin等
[14]提出了一套构建针对乳腺癌诊断和治疗的知识图谱的方法,但其缺乏对具体的构建技术的描述,也没有报告构建的结果,影响了构建方法的有效评估。Zhou等
[15]以BiLSTM为深度学习模型,开展了针对钼靶变量的提取,但对提取的变量没有进一步分类和构建研究。以乳腺癌超声检查报告为研究样本,就知识抽取、知识图谱构建和应用开展实例研究,有助于获得规范化高质量的检查结果,有效地管理病情;有助于开展乳腺癌风险预测,辅助乳腺癌诊断决策,但系统性、完整性的相关研究还非常有限。因此,目前有必要发展一整套从中文电子病历(EMR)知识抽取到知识图谱构建乃至辅助诊断的工作流程,将实体变量、变量间关系通过可视化的形式进行展示,进而依托构建的知识图谱开展可视化分析、数据查询、辅助诊断等应用。
为此,本文依托项目合作医院(XX市X三级甲等医院)乳腺癌超声检查报告,参考国内外有关乳腺癌诊疗指南等完成了知识图谱本体定义及概念层构架;以条件随机场(conditional random fields,CRF)和双向长短期记忆(bi-directional long short-term memory,BiLSTM)为基础,通过增加注意力机制(attention mechanism)的深度学习模型进行知识抽取,获取知识图谱数据层信息;构建了基于超声检查报告的乳腺癌诊断知识图谱,开展了乳腺癌诊断知识图谱的可视化分析、数据查询、辅助诊断等应用,验证了知识图谱在帮助提高电子病历数据质量、提升临床诊疗效果和改善医学决策上的应用价值。
1 知识图谱构建
本文以项目合作医院提供的乳腺癌超声检查报告作为研究样本,参照美国放射学会乳腺影像报告和数据系统(Breast Imaging Reporting and Data System,BI-RADS)中的字典
[16]和中国抗癌协会乳腺癌专业委员会发布的有关乳腺癌诊疗指南
[17]中使用的变量,结合临床专家经验定义了在中文乳腺癌超声诊断报告中使用的重要变量及其变量间关系,完成知识图谱本体及概念层框架构建。在后文中所述的“实体”为乳腺超声检查变量,“实体属性”为乳腺超声检查属性变量,检查变量和属性变量统称为BI-RADS变量。
1.1 总体流程
第一步,知识图谱本体及概念层设计。以行业规范、标准为参考,构建乳腺癌诊断知识图谱本体库;结合临床经验和专家建议,细化了本体库覆盖的实体类、关系类型以及属性类型,完成乳腺癌超声知识图谱本体及概念层框架设计。
第二步,知识图谱数据层获取。对乳腺癌超声检查报告进行数据采集、BIO数据标注等数据预处理工作;搭建BiLSTM-Attention-CRF网络模型,提取乳腺癌超声BI-RADS变量特征;对提取的BI-RADS变量特征进行同义描述、实体消歧、指代消解、实体对齐等,完成知识融合工作;采用文本匹配和语义相似计算方法进行知识加工,完成知识图谱数据层实体、实体属性以及实体间关系匹配。
第三步,知识图谱图数据库构建。依托所构建的乳腺癌超声知识图谱概念层框架,导入获取的BI-RADS变量特征数据,实现乳腺癌超声知识图谱“实体-属性-关系”三元组的对应,利用Neo4j完成知识图谱图数据库构建。
第四步,知识图谱可视化及应用。依托所构建的知识图谱,开展可视化分析、数据查询、辅助诊断等应用与评估,为实现乳腺癌超声智能导诊、疾病筛查、知识科普等知识图谱的应用打下了基础
[18,19]。
1.2 本体及概念层设计
本体是用来规定知识图谱中包含哪些领域的知识、知识的类别体系。知识图谱在逻辑架构层面可分为概念层(或模式层)和数据层(或实例层),见
图2。概念层在数据层之上,是知识图谱的核心。概念层主要内容为知识的数据结构,包括实体(entity)、关系(relation)、属性(attribute)等知识类的层次结构和层级关系定义,约束数据层的具体知识形式。
为了使所构建的知识图谱模型更具通用性、完整性、规范性,本研究参考了美国放射学院的《乳腺癌影像报告与数据系统图谱(2013版)》
[16]、《中国抗癌协会乳腺癌诊治指南与规范(2021年版)》
[17]等行业规范和标准,初步构建了乳腺癌诊断知识图谱本体库(
表1),定义了“常见征象”等不同类别体系及体系下所包含的实体和属性;而后,借助多家医院超声报告实例、专家医生建议和经验,以及大量国内外文献,完善了知识图谱概念层实体、实体属性及实体间关系的定义。除了常见的BI-RADS变量外,本研究还增加了一个额外的检查特征——“否定”。例如,在“未见异常彩流信号”文本中,提取“未见”“彩流信号”两个检查特征变量,确保文本语义完整,不会因否定词缺失致使语义表达失真。构建了“常见征象”等4个一级实体,“肿块”等11个二级实体,“位置”等39个实体属性类别,见
表1。
表2为概念层不同实体间主谓宾三要素,即实体间、实体与属性间的关系。
图3为乳腺癌超声知识图谱概念层。
1.3 知识图谱数据层获取
1.3.1 数据来源及预处理
本文以项目合作医院的乳腺癌超声检查文本报告为数据来源,采集了从2019年1月到2019年12月间乳腺癌超声检查报告4 100份,通过去除内容重复的报告和含有记录不完整或错误数据的报告,最终选取3 100份报告作为本文知识图谱数据集。
在本研究中,我们参考所定义的知识图谱概念层实体及实体属性,采用基于Web的标注工具BRAT
[20],对3 100份乳腺癌超声检查文本报告进行BI-RADS变量标注,按
表1的实体属性类别对数据进行标注,
图4给出了标注的一个示例。然后,将标注的文本转换成命名实体识别训练常使用的BIO格式(“B”表示实体的开始标记,“I”表示实体内的标记,“O”表示实体外的标记)
[21]。
1.3.2 知识抽取
本研究构建了基于深度学习的命名实体识别模型BiLSTM-Attention-CRF。BiLSTM-CRF是目前最为流行的命名实体识别(named entity recognition,NER)模型。本文在BiLSTM-CRF模型基础上,通过增加注意力机制对编码器所有时间步的隐藏状态做加权平均得到下一层的输入变量,使模型权重分配更加符合思维习惯,提升了模型的可解释性。
BiLSTM-Attention-CRF模型主要构成单元如
图5,包括嵌入层(Embedding layer)、双向长短期记忆网络层(BiLSTM layer)、注意力机制层(Attention layer)、条件随机场层(CRF layer)。
1) 嵌入层:预训练单词嵌入矩阵采用的是Word2Vec词嵌入模型进行预训练,得到100维的字向量信息。除了单词嵌入的信息外,每个单词的标签信息还被训练成20维度的嵌入向量,将句子单词和对应的标签一起转换成120维的低维向量。
2) BiLSTM层:输入为低维向量,通过前后向的长短期记忆网络获取文本的上下文信息,训练出词语的深层含义表达。
3) 注意力层:输入为词的深层含义表达向量,通过注意力层来计算向量之间的注意力权重,通过加权方式计算出词语含义表达。
4) CRF层:计算出最合理的标签序列。
图5所示的BiLSTM-Attention-CRF模型结构示意图中,“卵”“圆”“形”为三个输入的中文汉字例子,B-Shape,I-Shape,I-Shape分别对应于它们的识别结果。
注意力模块使用的基本注意力结构是缩放点积注意力(scaled dot-product attention),使用点积计算 Q (Query)、K (Key)之间的注意力权重,通过缩放调节内积大小,再利用Softmax操作将其结果归一化为概率分布,然后和 V (Value)相乘得到最终输出。其具体表达式为
其中指K的维度,主要起到缩放的作用,使注意力分数不会过大。一般在文本序列中 K 和 V 的值是相等的,即注意力模型反映了查询 Q 和关键值K之间的关系。 Q 、 K 通常是代表原文本和翻译文本。
本文采用命名实体识别中常用的准确率A、精确率、召回率和值指标来评估模型的识别效果。准确率表示模型所有样本中被预测准确的比例,精确率表示模型预测为正例的实体中真正的正例样本的比例,召回率表示所有真正的正例样本中被正确识别样本的比例。值是精准率和召回率的调和平均值,值为1(完美的精准率和召回率)时模型最佳,为0时模型最差。
1.4 知识融合与知识加工
知识融合是指在知识图谱构建过程中当获得新知识之后,需要对其进行整合,以消除矛盾和歧义的过程。知识融合主要包括同义描述、实体消歧、指代消解、实体对齐等工作,通过知识融合可以消除概念的歧义、剔除冗余和错误概念,从而确保知识图谱的质量
[22]。因为超声检查医生的记录习惯、关注重点以及医院的操作指南存在差异,同样的乳腺肿块或钙化在不同的超声报告或由不同的超声检查医生记录的内容可能不完全一致,导致所提取出的实体变量也会存在差异。因此,本文结合乳腺癌超声指南与规范、行业标准等对实体进行知识融合。我们对提取的同类别实体进行文本相似度计算,并对语义错误或同义描述的词进行标准语义替换。在指代消解过程中,我们进行了实体补充及对齐,确保最后数据层实体及实体属性的一致性和准确性。
要形成高质量的知识图谱,还需要经过知识加工的过程,从层次上形成一个大规模的知识体系,统一对知识进行管理。因本研究提取的数据结构相对清晰,数据逻辑相对简单,所以我们采用文本匹配和语义相似计算的方法进行知识加工。依托知识图谱概念层结构,通过对知识融合后的实体、实体属性数据与概念层(详见
表1)中的实体和实体属性一一对应,完成实体与属性的匹配。
在关系构建时,因本实验采取的是自顶向下的方式构建知识图谱,关系类型所连接的头尾实体类别及实体属性类别都是定义好并存在于概念层中(详见
表2)。通过将带标签的数据层实体、实体属性链接到知识图谱概念层已有的实体、实体属性类别上,即可完成实体间以及实体与属性间的关系构建,并最终形成完整的知识图谱。
1.5 实验结果
1.5.1 数据集标注结果
在知识抽取(命名实体识别)过程中,设置训练集、测试集和验证集的样本比例为
,并随机将样本分成这三个数据集,以此来进行BI-RADS变量提取。
表3为BI-RADS变量名称及其在各个样本集中的统计信息。
基于
表3中BI-RADS变量数量统计可以看出,属性“位置”出现的次数较多,是“淋巴结”的10倍,这是因为每份超声检查报告中可检测到的不同实体的“位置”属性(如肿块位置、钙化位置、乳腺内淋巴结位置、异常血流位置等),与实际报告中的数据一致。实体类别中,“肿块”“血流”等实体检测出的频率也较高,说明这些实体是乳腺癌超声检查医生比较关注且常见的特征变量。除了常规的实体及实体属性,我们新增的特征变量“否定”出现的频率也较高,说明将“否定”作为特征变量提取有较大研究和实践意义。
1.5.2 实体特征提取结果
表4展示了BiLSTM-Attention-CRF模型对每种特征变量提取结果,大部分实体的
F1值表现良好。由于训练集中“血流”“肿块”“淋巴结”等实体的出现频率较低,因此,这部分实体的
F1值低于其他实体。
表5为“CRF”“BiLSTM-CRF”以及“BiLSTM-Attention-CRF”三种模型准确率、精确率、召回率及
值。从
表5可以看出BiLSTM-Attention-CRF模型的识别准确率为98.61%、精确率为96.77%、召回率为97.52%,
为97.15%,达到了较高水平,为下一步构建知识图谱奠定了基础。
1.5.3 关系匹配结果
本文采用自顶向下的方式进行知识图谱构建,3 100份报告实体间以及实体与属性间的关系共计116 873条。其中instance_of关系12 400条,part_of关系46 500条,select关系57 973条。
2 知识图谱可视化与应用
2.1 可视化分析
基于设计好的知识图谱概念层框架,将知识图谱概念层和数据层相结合,将脱敏后的患者基本信息、放射学诊断BI-RADS分类结果和通过深度学习从文本报告中提取的数据导入Neo4j图数据库,完成乳腺癌诊断知识图谱的构建。知识图谱包含了患者基本信息(如年龄、姓名、检查时间、所属科室等)、超声检查信息(如常见征象、伴随征象、具体指标结果)以及BI-RADS诊断分类结果(
图6)。
为了让知识图谱更直观,本文将实体属性也用节点进行展示,
图6中节点表示实体或实体属性,节点间连线表示实体间关系或实体与属性对应关系。通过对单个患者基本信息、超声检查信息和BI-RADS分类信息进行展示,实现了将病人多特征信息(基本信息、超声信息、BI-RADS分类信息)结构化展示,方便病人或临床专家快速了解病情;减轻了临床医生从非结构化数据中找出关键特征并进行分析诊断的工作强度和时间成本,有助于临床医生对病人病因或结果进行成因分析、风险预测等应用。
2.2 数据查询
除了对单一病人超声检查信息进行展示(如
图6)外,Neo4j允许用户通过“Search phrase”功能自定义高级查询语句。用户可以预先定义静态搜索模板(不带参数)或带参数模板语句,并指定用于调用该查询的短语和参数,从而实现一键式高级查询。
本研究中,我们结合医院临床专家常见查询需求,自定义了多个高级查询语句。比如,在调研中了解到,医院临床专家为了进行数据分析,往往需要统计某个年龄段的患者情况或者某个年龄段患者类型。我们预先定义了带参数模板语句,在自定义查询语句中输入“年龄在50到55之间且BI-RADS等级为3的患者信息”即可查询到对应节点信息(
图7),以达到个性化高级查询的要求。基于该知识图谱,临床专家无需学习较多的非医学专业知识,可完成图数据库患者信息的简单查询、组合查询、条件查询、路径查询甚至深层次的关系查询;还可以通过模式匹配图数据库中的节点和关系提取信息或者修改数据,这有助于获得规范化、高质量的检查结果,有效地管理病情。
2.3 辅助诊断
根据《中国抗癌协会乳腺癌诊治指南与规范》
[17],乳腺检查评估分类常用的是BI-RADS分类法,乳腺BI-RADS分类乃至肿瘤的良恶性判断最重要的依据来自于对乳腺的各种检查,主要包括乳腺钼靶、超声检查、MRI检查和细胞活检等。主要的特征指标除包括上述构建的乳腺超声检查信息(如肿块、钙化、结节位置、大小、边缘等)外,还需要综合考虑患者的基本信息(如性别、年龄、体征、家族史等)。
通过对知识图谱图数据库进行直观分析,我们发现数据库中肿块边缘特征为“毛刺状”患者,所对应的BI-RADS等级均为“4C”(
图8)。因本项目样本和患者其他信息有限,我们无法准确进行推理评估,只能大致判断肿块“边缘”特征是BI-RADS等级的重要特征指标,且肿块“边缘毛刺状”患者的BI-RADS等级大概率判断为“4C”。后经临床医生评估,证明了此结论的准确性。同理,我们可以判断单个其他特征或多个组合特征与BI-RADS分类的影响。
基于此知识图谱构建方法,我们可以构建并融合乳腺钼靶、乳腺MRI等其他检查知识图谱信息,进而可以构建患者信息特征、超声检查特征、钼靶检查特征、BI-RADS分类特征等不同维度乳腺癌特征网络,通过对特征网络进行训练,最终实现对患者乳腺BI-RADS分类和肿瘤良恶性的辅助诊断甚至是精准分类。在临床上,可以较大程度协助实习医生或临床医生进行辅助诊断。
2.4 质量评估
为了对实验数据质量、模型效果及应用进行评估,我们邀请8名临床专家和自然语言处理领域专家,分别从概念层、数据层、应用层三个层面进行了测试分析与数据质量评价,具体评价如
表6。
3 结 语
本研究结合项目合作医院的乳腺癌超声检查文本报告集,提出了从乳腺超声中文电子病历变量提取到知识图谱应用的工作流程。基于深度学习的方法抽取了乳腺癌超声检查报告中的特征变量,通过Neo4j图形数据库实现了将患者乳腺超声检查特征信息与患者基本信息、BI-RADS分类信息融合构建知识图谱,完成了知识图谱的可视化、高级语义查询甚至辅助诊断。结果验证了知识图谱框架的合理性以及知识图谱的有效性和实用性,为乳腺癌知识图谱的快速构建与应用研究提供借鉴,对于临床数据处理、数据查询,有较高的应用价值,为服务于更高层次医疗应用比如辅助临床决策、医疗问答系统和疾病预测等奠定了基础。下一阶段的工作是进一步优化知识提取模型,从乳腺癌钼靶检查报告及病理检查报告中提取变量,完善不同特征层面的乳腺癌诊断知识图谱,开展知识推理和风险预测研究、辅助临床决策。
国家社会科学基金(20BTQ066)