随着核能系统日益复杂化及核设施信息化、数字化进程的加速,知识管理成为确保核工业安全运行与创新能力提升的关键支撑
[1]。在核燃料后处理这一多学科交叉、高度工程化的领域,知识来源和载体呈现出多源异构化特征,涵盖实验记录、辐射监测数据、化学流程图、设备CAD图纸、法律法规、专家操作经验等多模态形式。这些信息结构多样,语义分散,且通常缺乏统一的标注体系与语义联通机制。同时,核工业数据获取受限于保密规定、辐射环境与高昂成本,具有典型的小样本、高敏感、跨模态特征,对传统知识管理系统构成挑战
[2-3]。此外,国际原子能机构(IAEA)在其报告中指出,随着大量核能老专家退休以及重大项目周期性断代,知识流失问题日益突出,现有核知识管理体系缺乏面向非结构化和跨模态信息的集成能力
[4]。因此,如何构建具备跨模态感知、语义对齐与知识推理能力的智能知识系统便成为核燃料后处理等关键领域亟需解决的前沿课题。
近年来,大语言模型(LLM)
[5-6]和自然语言处理(Nature Language Processing,NLP)
[7]技术取得了显著进展,逐渐改变知识获取、表示和推理的方式。LLM通过预训练和微调后能够理解和生成自然语言文本
[8],而NLP技术则能够处理和分析语言数据。这些技术的结合极大地提高了信息提取的效率和准确性。随着LLM在医学、材料、化学等高复杂知识领域中展现出的强大的多模态理解与生成能力,其在核工业知识库构建中的潜力受到广泛关注
[9]。在面对非结构化文本、流程图、实验图像等多源异构信息时,LLM具备统一语义建模、跨模态对齐与问答驱动知识调用的技术优势,为构建面向后处理工艺的智能知识系统提供了新思路。
截至目前,我们还没有见到LLM在核燃料后处理知识库构建相关领域的适用性的报道。本文综述了LLM在多个关键领域多模态知识库构建中的典型应用,然后结合核燃料后处理领域的知识结构特征与技术挑战探讨将其迁移应用于构建核燃料后处理多模态知识库的可行性,以期为该领域智能化知识库的建构提供理论参考。
1 概述
1.1 AI工具
随着ChatGPT
[10]的发布,AI语言模型迅速进入公众视野并在学术研究领域引起广泛的关注和讨论。LLM凭借其强大的文本生成能力在润色学术写作、编程和数据分析等多方面为科学家提供科研辅助,推动科学技术的发展。据统计,2023年估计至少有60 000篇学术论文在撰写过程中使用了LLM的辅助,约占Dimensions学术出版数据库中所有文章的略多于1%的比例
[11]。仅在2024年上半年,在生物医学领域,研究人员发表的论文中,至少有10%的论文摘要由LLM生成
[12]。在计算机科学领域,这一比例更高,2024年2月已达到17.5%
[13]。2023年和2024年,在顶级人工智能会议所提交的同行评审报告中,估计有6.5%~16.9%的内容由LLM生成
[14]。以上数据表明,科学家已经逐渐接受并熟练使用LLM。
尽管AI工具在多个工程领域实现从辅助决策到复杂系统建模的广泛应用,但在核能工业特别是核燃料后处理领域,AI技术落地仍处于早期阶段。传统AI技术主要依赖结构化数据、专家特征构建与由规则驱动的模型,在设备故障诊断、图像识别、热工水力仿真辅助中已经取得一定成效
[15-16]。但核燃料后处理领域知识涉及大量非结构化文档、图像、流程图与时间序列数据,传统AI处理方法在语义理解、推理支持与跨模态知识融合方面存在局限性。另一方面,LLM的迁移学习和多模态理解能力则能够生成复杂输出,为实现核领域智能知识建构提供方法基础。
1.2 大语言模型
NLP是人工智能和语言学的一个重要交叉领域,致力于使计算机能够理解、解释和生成人类语言的内容,缩小人类语言和计算机理解之间的差距,使计算机能够执行音频识别、自然语言理解、机器翻译、文本挖掘和文本分析、情感分析、问答系统以及聊天机器人等多种任务
[17-18]。LLM是NLP领域的一种重要技术,主要通过使用大量的参数和数据来训练模型,实现更准确、更灵活的语言处理任务。
图1展示了LLM的发展历程。在深度学习兴起之前,语言模型主要依赖规则系统和统计方法。在二十世纪五六十年代,语言模型主要依赖科研人员手动编写规则,进行语言翻译与基础语法分析。例如,1966年最早出现的聊天机器人之一Eliza
[19]就基于模式匹配来模拟与心理治疗师的对话。随着知识语料库增加与计算能力增强,在二十世纪八九十年代,统计方法逐步被应用于语言模型。1988年,循环神经网络(Recurrent Neural Network,RNN)
[20]首次引入序列建模能力。1997年,长短期记忆网络(Long Short-term Memory Network,LSTM)
[21]改进RNN,能够处理长期依赖关系,但仍无法高效处理长文本。这一阶段的语言模型主要受制于计算能力和数据规模,能力有限。
2017年,Google研究团队在论文《Attention is all you need》中提出Transformer架构
[22]并将其作为LLM的基石,从而将语言模型的研究推向了新时代。Transformer架构通过堆叠的编码器-解码器模块处理顺序数据并捕获远程依赖关系,可以通过少量微调适应多种任务。Transformer的训练基于大量文本语料库的无监督或半监督学习,采用基于梯度的优化方法。除了文本处理,Transformer还在医疗保健、推荐系统、图像生成等多个领域得到应用。
2018年后,基于Transformer的预训练模型(PTMs)开始主导NLP领域。PTMs可被分为两大流派。一种是Google发布的BERT模型
[23],采用掩码语言建模(MLM)和下一句预测(NSP)任务,实现双向上下文编码。该模型在GLUE
[24]、SQuAD
[25]等NLP基准测试中刷新纪录,成为 NLP任务的通用骨干模型。另一种是openAI公司发布的GPT系列模型。2018年,首个基于Transformer的自回归语言模型GPT-1
[26]发布,适用于文本生成任务。2019年,包含15亿参数的GPT-2
[27]模型发布,展示了零样本学习能力。2020年发布的GPT-3
[28]模型使用1750亿参数,突破了少样本学习,成为首个通用AI助手。这一阶段的研究主要通过对模型规模的改进提升模型性能。
近年来,多模态大语言模型
[29](MLLM)开始出现。2023年,GPT-4V
[30]模型发布,能够整合文本并对输入图像进行理解,实现视觉问答任务。2024年,GPT-4o
[31]模型发布。该模型在原基础上进一步往多模态领域扩展,能够支持文本、语音、图像的全模态交互。与传统的仅关注文本数据的语言模型不同,MLLM能够跨多种模态的处理和内容生成,使机器不仅能理解和生成文本,还能解释并整合来自不同感官输入的信息。这弥补了人类通信与机器理解之间的差距,成为具有改变不同领域潜力的多功能工具。
1.3 LLM应用的关键技术
每个特定领域都有其独特的知识体系、数据特点和业务需求。要将LLM成功应用于特定领域、解决实际问题,仅依靠LLM的通用性能是不够的。我们需要结合实际问题对LLM进行优化,使其能够更好地适应特定领域的复杂环境。接下来,本文对关键技术需求进行介绍,以揭示如何将LLM从通用的语言模型转变为能够解决特定问题的有力工具。
1.3.1 提示工程
提示学习是一种为了更好使用预训练语言模型而在输入信息中添加额外文本的技术
[32]。提示学习的目标是更好地挖掘预训练语言模型的能力,使其能高效应用于下游任务。按照形式的不同,提示可以分为离散提示
[33]和连续提示等两类
[34]。离散提示主要有两种,一种是通过自动搜索构建最优梯度搜索方法,另一种是通过人为设计的提示方法,包括上下文学习
[28]和思维链提示
[35]。连续提示则是指提示信息是不受词向量约束的连续向量,这些信息包含可训练参数,可以在下游任务中进行训练更新,可以通过对提示插入位置和训练目标进行改进,以提高模型性能
[36]。
1.3.2 微调技术
微调是指利用特定领域的数据集对已预训练的大模型进行进一步训练的过程
[37]。通过在专有数据集上进行训练,可以实现通用LLM到领域专用LLM的转化,弥合通用LLM与特定应用需求之间的差距,提高LLM在特定任务上的性能,使大模型能够更好地适应特定领域的需求和特征。
图2是LLM微调的一般流程。LLM微调是一个有监督学习过程,主要使用标注数据对LLM权重进行更新。主要有以下几种微调方法:指令微调
[38],全微调(FFT)
[39]以及参数高效微调(PEFT)
[40]。其中,对于FFT,训练过程中的参数需要强大的硬件资源进行存储。PEFT只更新小部分参数。与原始模型相比,其参数数量显著减少,从而使内存需求变得可管理。除此之外,相比FFT每进行一次训练就会产生一个新模型,PEFT未对原始模型进行改变,模型之前学到的信息不会被遗忘,从而能解决灾难性遗忘问题。2021年微软提出的LORA
[41]、谷歌提出的 Prompt Tuning
[34],斯坦福大学提出的 Prefix-Tuning
[36],以及2022年清华大学提出的 P-tuning v2
[42]、2023年华盛顿大学提出的QLoRA
[43]和2024年英伟达提出的DoRA
[44]都用到了大模型微调技术。
1.3.3 领域知识嵌入
领域特定知识是指与特定领域或应用相关的专门信息或专业知识。跨多领域的通用知识使模型能够理解广泛的上下文,而领域特定知识对于需要精确、特定理解的专业任务至关重要
[45]。在LLM中嵌入领域知识的方法可分为四类:动态知识注入、静态知识注入、模块化适配器以及提示优化。动态知识注入是指将从外部知识库或知识图谱中检索到的信息与模型输入结合起来,以增加LLM的推理能力。静态知识嵌入是指在模型训练或微调时将领域知识嵌入到模型参数中,使其成为模型固有的一部分。模块化适配器则通过引入小型可训练模块来存储领域特定知识,这些适配器可以插入到基础模型中或与之并行工作,无需改变原始模型参数。提示优化专注于通过精心设计的提示来引导LLM利用其内部已有的知识,无需从外部检索知识或更改模型架构。
表1展示了不同方法的对比,每种方法都有独特的机制,都可以为LLM注入领域专业知识,在灵活性、可扩展性和效率之间取得平衡。
1.4 LLM与知识库
1.4.1 作为知识库的LLM
知识库是一个存储和组织知识的信息系统或数据集合,用于保存、管理和访问结构化或非结构化的信息,如实体、属性和关系
[46]等。在传统的知识库构建中,往往需要繁琐的工程技术和人工标注。语言模型是基于自然语言文本的统计模型,这些模型在大量的文本数据上进行预训练,将文本信息以参数化的形式进行存储。Petron等
[47]对语言模型包含的知识在实体-属性-关系形式上进行验证,结果显示语言模型学习并存储了一些事实知识。可以看到,语言模型虽然不能像知识库那样提供明确的实体、属性和关系等结构化信息,但它可以通过学习文本信息来获取知识,再将这样的知识库应用于下游任务。
目前的大语言模型在语言学知识上的表现已相当成熟,只需要借助少量的语料数据就能生成流畅连贯,语法正确的句子
[48]。但是,对事实知识的学习是一个动态过程,只能通过增加训练语料让模型学习更多知识,模型的知识更新也相当复杂。例如,ChatGPT只能回答截止到训练时的相关知识的问题,超过这一时间点就束手无策,这是目前ChatGPT待解决的问题之一。
1.4.2 LLM专业知识库构建
在实际应用时,LLM主要面临以下两个问题:知识延迟
[49]与幻觉问题
[50]。知识延迟是由于大模型的知识来源于预训练数据,难以做到实时更新,且由于大模型规模庞大,更新一次所消耗的时间一般高达好几个月。另一方面,LLM采用概率模型,基于预训练数据对生成内容进行预测,预训练数据通常为通用公开数据集,致使LLM难以学习到特定领域更深入精准的专业信息,造成其回答内容可能出现一定错误。为了解决上述问题,Facebook AI Research(FAIR)团队于2020年首次提出了检索增强生成模型(RAG)
[51]。该模型结合了信息检索技术与语言生成模型,通过从外部专业知识库中检索相关信息,并将其作为提示输入给LLM,以增强模型处理知识密集型任务的能力,构建专业化的LLM知识库。RAG的工作原理可分为以下三步:
1) 检索。首先从预先建立的专业知识库中检索与问题相关的信息,为后续的生成过程提供有用的上下文信息和知识支撑。
2) 增强。将检索到的信息用作生成模型的上下文输入,以增强模型对特定问题的理解和回答能力。
3) 生成。生成器根据检索到的外部知识信息作为上下文输入,结合LLM生成文本内容,作出最终回答。
基于上述分析,“LLM作为知识库”与“LLM驱动的知识库”这两类范式在功能定位与实现机制上存在本质差异:
1) 在知识表示方式上,前者将知识隐式存储于模型参数中,依赖生成过程进行调用,后者则通过结构化数据库或知识图谱对知识进行显式组织与存储;
2) 在知识更新机制上,前者依赖模型再训练或微调,更新成本较高,后者可通过外部知识库的动态维护实现快速更新;
3) 在系统可控性与可靠性方面,前者容易受到模型幻觉与不确定性的影响,后者则通过检索增强与规则约束提供更高的可解释性与稳定性;
4) 在工程适用性方面,LLM驱动的知识库更适用于有高安全性与高可靠性要求的场景。
在面向复杂工程应用时,应在利用LLM内在知识表征能力的基础上将其作为知识库构建与调用工具,构建面向特定场景的专业化知识库体系,以提升系统的可控性、可解释性与工程适用性。
2 基于LLM构建多模态知识库的典型技术路径
随着多模态数据不断涌现,LLM在多模态知识库构建中的应用逐渐拓展到化学、物理、医学、生命科学等多个领域
[52-56],并展现出极大的应用潜力,为各行业的研究和实践提供了新的思路和方法。接下来,本文以代表性领域应用为样本归纳基于LLM的多模态知识库构建的一般路径和可迁移方法,以便为LLM在核燃料后处理知识库的应用提供方法基础。
2.1 生成-验证式结构化知识发现
在科学和工程领域,从实验数据中提取数学方程是一个核心任务,可被用于帮助我们理解和预测自然现象
[57]。与传统符号回归
[58]依赖于启发式搜索与专家试错的方式相比,基于LLM的方法将LLM作为结构候选筛选器,结合外部数值优化工具完成参数拟合与客观评价,形成一套可控的闭环发现流程。
2.1.1 方法框架
Sharlin和Josephson在2024年提出了一种基于LLM的方程提取方法
[59],实现了科学方程的自动提取,其核心流程如
图3所示。
首先,将预处理后的数据和精心设计的自然语言提示输送给LLM,引导LLM根据需求生成与特定科学问题相关的数学表达式。在提示设计中,研究人员需要提供包含问题描述、已知科学原理和部分方程形式等要求在内的提示语言,以帮助LLM聚焦于相关领域。
接着,LLM根据提示要求和数据特征,结合自身丰富的知识语料库进行分析整理,生成初步表达式。
然后,LLM使用外部优化工具(如SciPy或PyTorch)对方程参数进行调整,评估方程与实验数据的拟合度,然后将评估结果反馈给LLM,同时研究人员也提示LLM根据反馈结果考虑复杂度和损失两方面结果对生成的表达式进行优化。优化后的结果和之前的结果被存储为一个字典,并使用外部优化工具找到表现最好的结果并反馈给LLM、驱动LLM提出改进结果,循环迭代优化。
最后,输出满足复杂度和准确度要求的表达式。
2.1.2 典型技术路径与方法
生成-验证的结构化知识发现方法主要依赖于三项关键机制。
1) 目标导向的提示工程设计。根据具体任务和模型,研究人员会精心设计提示,使其能够理解和整合科学文献中的背景知识,生成符合要求的输出
[32, 60-61]。一般使用双提示设置,初始提示GPT-4在LaTeX中生成无偏表达式,迭代提示接收以前生成的Python脚本示例。这种上下文利用显著提高了模型在复杂任务中的表现。同时,模型无需每次都从零开始生成代码,而是在前一次生成的基础上进行改进,节省时间和计算资源。
2) 推理增强机制(草稿本技术)。推理研究中引入了草稿本技术,以模仿人类在考试中给出最终答案之前通过草草记笔记来解决问题的方式。这要求GPT-4在生成最终答案之前先在草稿本中记录数据分析和观察。这种方法模拟了人类解决问题时记笔记的过程,能够显著提高表达式质量和模型推理能力,生成更高质量的、符合研究人员应用需求的表达式。
3) 外部工具参与的迭代优化流程。使用外部Python工具进行优化和评估并将评估结果反馈到GPT-4,由GPT-4提出改进的表达式,同时针对复杂性和损失进行优化,以便实现方程的逐步优化,提高生成方程的准确性和可靠性。
2.1.3 可迁移性启示
上述研究表明,在专业领域知识建模中可以将LLM用于结构化候选生成,再通过外部工具进行验证。该流程可被用于对于知识库构建具有高安全要求的核燃料后处理领域。核化工知识包含大量可形式化表达的公式、反应式和参数关系。在结构化抽取后,通过LaTeX编译校验、符号一致性检查与专家审查等外部规则对抽取或生成的结构化知识进行验证,形成抽取-校验-入库的工作流程,提高入库知识的安全性。
2.2 输出模式驱动的结构化信息抽取
从科学文献中提取结构化知识一直是机器学习模型面临的挑战之一。这些科学知识分散于数百万篇论文、表格和图表中,研究人员在进行相关研究时难以全面、迅速地了解该领域以往的研究成果。在固态材料领域,用于材料发现和直接性质预测的机器学习模型
[62-64]受到已有数据库中可用训练数据量的限制,限制了其他领域专家对该领域知识的全面了解。Dagdelen等
[65]在2024年提出了一种基于LLM的结构化知识提取方法,方法通过为目标知识定义结构化输出模式使微调后的LLM能够直接将材料文献转写为可入库的结构化记录,用于支撑后续知识库构建与模型训练。
2.2.1 方法框架
该方法的核心在于先定义需要进入知识库的字段结构模式,再让模型通过学习稳定输出该结构(如JSON对象)。如
图4所示,其一般流程如下。
第一步,根据具体任务定义输出格式(JSON对象或句子),随后根据预定义的模式从摘要中准备JSON文档。这一步由人类专家进行注释,以构建初始训练集进行训练。
第二步,使用由第一步训练得到的初步模型对数据进行预标注,同时令人类专家对机器预标注结果进行校正,两者的结合加速训练数据集的构建。值得注意的是,每一次校正之后的数据将被纳入形成新的训练集,对模型进行训练,重复执行这个步骤,以提高模型性能。
第三步,在得到的完整数据集上对模型进行微调、形成最终模型。此时的微调模型能够以要求的格式提取结构化信息,无需进行人工校正。后续可根据具体任务需要进行后处理任务,如形成知识图谱。
2.2.2 典型技术路径与方法机制
以上研究工作可以归纳为三类方法机制。
1) 联合命名实体识别
[66]与关系抽取
[67](NERRE)。研究者提出了一种基于LLM的联合命名实体识别和关系抽取方法。不同于传统的将大多数工作集中于命名实体识别,该方法能够同时提取科学文本中的实体及其关系,并以结构化格式输出,突破了传统两步法(先NER后RE)的限制,能够更高效地处理复杂科学文本。
2) 人机交互注释。在模型训练过程中,研究者在其中加入了人类专家的领域知识,具体表现在以下两个方面:其一,在预训练样本准备阶段,最初的训练集由人类专家注释形成;其二,在中间模型中,使用部分训练的LLM先对文本进行预注释,再让人类专家对机器注释结果进行校正,加速训练样本的获取时间。这样,一方面降低了人工标注成本,实现在少样本条件下抽取模型的快速建立,另一方面加入专家校正过程提升了模型训练的准确性。
3) 结构化输出与规范化校正。通过事先确定输出模式、约束模型的输出格式。同时,结合纠错与归一化措施,提高抽取结果的格式一致性,以便后续知识入库后的检索和统计。
2.2.3 可迁移性启示
研究提出的输出模式驱动的结构化信息抽取方法对核燃料后处理具有直接的迁移价值。后处理知识广泛分散于报告与历史手册等非结构化文档中,其术语密集、关系复杂且可能具有多种描述方法,比如可以借鉴该思路,围绕核后处理核心对象,即物质-相态-工况-设备-安全约束等,设计专有输出模式与术语本体,在少量专家标注基础上通过人机协同方式快速扩展训练数据,并将抽取结果以结构化的方式记录入库。同时,考虑核领域合规与安全要求,可以优先采用本地化部署,对结构化输出实施格式校验与专家抽检,形成抽取-校验-入库的高置信度规范化流程。
2.3 智能体式的决策框架
以医疗健康领域为例。随着医学大语言模型的发展,理解和生成类似人类文本的能力在广泛的医疗应用中展现出惊人的潜力,应用范围涵盖从医学文本分析、临床决策支持到生物医学研究等多个方面
[68-70]。该领域的知识更新快、决策链条长,且对安全风险具有高要求,在进行临床决策时需要在多源证据如病史、检查、指南等之间进行综合权衡。因此,相较于单纯的问答式应用,医疗场景的LLM应用更强调证据支撑、可解释与可审查性
[71]。Vaid等
[72]提出了一个新框架,通过赋予LLM多种临床工具的使用权限让模型能够像真实医生一样自主完成从问诊、检查到诊断治疗的全流程临床决策,实现循证医学
[73]的自动化工作流程。
2.3.1 方法概述
研究者构建了一个基于LLM的自主智能体框架,将真实世界的临床案例结构化为JSON文件提供给智能体,以模拟人类医生可用的资源。智能体由LLM、自然语言提示、与现实世界交互的工具和用于流程控制的程序组成,工作流程如
图5所示。
首先,模型依赖于人工生成病史和体格检查结果,并加载系统提示(身份设定和操作指南),然后结合用户提示(被要求回答的具体问题)解析输入,并生成初步响应。这些响应可能是生成最终诊断或者使用临床工具包进行进一步检查和研究。
在工具调用阶段,模型能够自主选择并调用临床工具以获得进一步证据(如影像结果等)。随后,模型会查询所有可用文献,以确定它正在考虑的最可能的鉴别诊断,且这些资料将与当前决策对齐,以进行决策的迭代更新。
最后,模型完全基于其被要求回答的问题来发布建议:生成最终诊断、针对它所处的临床环境的特定管理或者是转诊到另一个设施。
2.3.2 一般路径与方法机制
1) 观察-思考-行动闭环的工作流程。模型在多轮交互中不断获取新证据、更新判断并决定下一步行动,其每一步决策遵循以下模式:
其中,表示当前观察结果,表示临床推理过程,表示选择的诊疗行动,表示新的观察结果。以上实现机制帮助智能体建立包括思考、行动和观察三个环节的思维链结构进行迭代思考,使智能体能够按照提示自觉修正思考方向,引导智能体生成更符合临床决策的逻辑输出。
2) 分层知识库与RAG对齐。研究中构建了三层知识体系:其一,机构特定指南(最高优先级);其二,专业学会临床指南(次优先级);其三,最新研究文献(补充信息)。通过以下公式确定参考权重:
,
其中,、、分别表示机构指南、专业指南和文献的权重,满足。
与传统LLM仅依赖训练知识生生成响应相比,研究将构建的分层组织体系与RAG技术结合,在决策过程中检索相关证据、提供输出依据。这对需要最新领域知识的场景尤其适用。
3) 智能体构建。研究提出的将LLM与自然语言提示、现实世界交互工具和外部流程控制相结合的方法将LLM从单纯的信息检索工具转变为能够自主执行任务的智能体。对于高风险场景,这种智能体的构建使用能够辅助专业人员提升决策效率。
2.3.3 可迁移性启示
核燃料后处理是典型的规程驱动、流程复杂且安全要求极高的工程场景,模型输出必须具备证据支撑与可追溯性。这与医疗决策具有共同特性。参考以上研究思路,可以考虑将后处理规程、规范与历史处置记录构建为分层知识库,并通过RAG为模型输出提供可引用依据。同时,以工具调用方式外置关键计算与规则核对环节,并引入人机共审和日志审计机制,以满足安全可控部署要求。
2.4 多模态知识库构建的通用流程
图6是基于上述内容总结的基于LLM的核燃料后处理多模态知识库构建的一般流程,主要包含6个模块,图中带“★”标记的模块为本文在核燃料后处理场景中开展工程验证的关键环节。其中,结构化知识抽取模块用于实现核化工文档中公式与反应式的识别与结构化入库,可信性审查模块用于结合规则校验与专家审核机制对抽取结果进行质量控制。这些对应关系体现了一般技术路径框架在核燃料后处理领域的可迁移性与工程落地路径。
1) 数据接入与预处理。对于文本、谱图、表格与传感器数据等多源载体,通过格式转换、去噪与切分,建立元数据,便于后续处理。
2) 结构化知识抽取。在规则约束和输出模式定义下,将多模态内容转化为可入库的知识单元,如实体-关系-属性三元组、参数与工况条件、公式与反应式、表格字段等。
3) 知识表示与索引。对抽取结果进行结构化表示与组织(如JSON记录、知识图谱或向量化表示),以支持后续的精确检索与语义检索。
4) 检索增强生成(RAG)。将知识库作为外部可控知识源,通过检索-生成机制为问答、推理与决策提供证据支撑,并输出引用片段以增强可解释性。
5) 可信性审查。对于高风险场景,引入格式校验、规则约束、置信度筛选与人工复核等机制,对抽取与生成结果进行审查,以降低幻觉与知识失真对应用的影响。
6) 评估与迭代更新。建立面向任务的评估指标体系(正确性、一致性、可解释性、覆盖率等),结合误差分析与增量数据回流实现知识库与模型的持续更新与版本管理。
除上述三个典型领域外,大语言模型在多模态知识库构建中的应用已逐步扩展至多种复杂科学与工程场景。在地球科学领域,基础模型通过融合遥感、气象及地质等多源数据实现对地球系统的综合建模与分析,提升环境监测与灾害预警能力。相关研究指出,AI在处理地球科学大规模多模态数据方面具有显著优势,但其应用仍依赖于模型的可解释性与透明性
[74]。在生命科学领域,基于LLM的智能体系统已能够整合文献与实验数据,辅助科学研究与知识发现,并在药物设计与临床决策等任务中展现出潜力
[75]。此外,LLM也逐渐应用于智慧城市、交通系统及环境管理等领域,通过融合多源异构数据,支持复杂系统的分析与决策。例如,已有研究提出面向城市系统的基础模型框架,用于支撑城市感知与管理任务
[74]。
3 核燃料后处理知识体系构建的特殊约束与工程实现
近年来,人工智能技术在核工业中的应用不断深化,并在安全分析、运行优化及知识管理等方面显示出重要潜力
[76]。在此背景下,面向核燃料后处理这一典型复杂工程场景探索基于LLM的多模态知识库构建方法具有重要意义。结合上一节中归纳的多模态知识库构建的可迁移技术路径,并考虑到公开数据的有限性,本节中我们不对后处理场景知识库构建的全过程进行实现而选择其中的关键环节:核化工文档的结构化抽取,并开展小规模的工程验证,以说明LLM在核燃料后处理领域多模态知识库构建中的可行性。
3.1 后处理场景下大模型应用的特殊约束
尽管LLM在多个科学与工程领域的多模态知识获取与推理任务中表现出强大能力,但将其迁移至核燃料后处理这一高风险、高数据敏感性的核工业场景仍面临一系列挑战。在整个核燃料循环中,核燃料后处理处于关键地位,其核心任务是铀、钚等有用材料的有效分离回收及放射性废物的妥善处理处置
[77]。核燃料后处理工艺系统复杂,涉及放射性核素分离、萃取工艺设计、临界安全控制、辐射防护等复杂耦合问题
[78],具有跨模态、高安全性、强专业性特点,从而对LLM的适应性提出了更高要求。
3.1.1 多模态异构知识表示的复杂性
核燃料后处理过程涉及的数据形式多样,包括萃取动力学实验曲线、流程系统 CAD 图纸、过程控制规程、辐照监测数据、临界分析报告以及历史经验手册等,属于典型的多源异构数据体系。这些数据跨越文本、图像、结构化传感器流、谱图等多个模态
[79],构建统一语义空间的难度明显高于其他工程领域。此外,专业术语中还存在大量隐含语义与上下文依赖(如“萃余液”与“有机相”的工艺位序关系),对模型的理解能力提出挑战。因此,如何将多模态异构知识进行结构化表示并有效入库,是核燃料后处理智能化应用的首要前提。
3.1.2 数据保密与样本稀缺性限制
受制于放射性安全、国家保密规定与高昂获取成本等实际因素,核燃料后处理各环节可以公开的实验数据极为有限。这一现状导致 LLM 在预训练或微调阶段面临严重小样本困境,可能影响其泛化能力。可公开的文献与报告通常也存在结构不规范、格式杂乱等问题,难以直接被用于监督训练或知识抽取。此外,受限于合规要求,部分关键数据只能在本地部署环境中使用,从而限制当前主流大模型的云端能力。因此,构建面向后处理场景的本地化知识处理与抽取入库流程,能够有效缓解数据稀缺问题。
3.1.3 安全可控与可解释部署要求
核燃料后处理属于高风险工程过程,任何由模型辅助提供的知识或建议都必须符合极高的安全性、稳定性与可追溯性要求。这意味着LLM应用场景需具备“可控生成”“可解释推荐”“专家审查”能力,而非简单的Chatbot形式。具体而言,可通过以下方式实现相关能力。
1) 可控生成。通过预定义输出模板、规则约束及拒答机制,对模型生成内容进行格式与语义限制。同时,结合RAG方法,通过引入外部知识库作为约束上下文,减少模型幻觉风险。
2) 可解释推荐。通过在生成过程中提供检索来源、引用片段及证据链信息,实现结果的可追溯与可解释。同时,结合分层知识库结构,对不同来源信息赋予权重,提高推荐结果的可信度。
3) 专家审查。构建人机协同的审核机制,将模型输出结果纳入专家复核流程,并通过日志记录与版本管理实现全过程追踪,以满足核燃料后处理领域对安全性与可追溯性的严格要求。
除此之外,在实际部署中还需考虑如下问题:如何在离线或本地受控环境中运行大模型?如何设置人机共审机制?如何应对潜在幻觉风险?
基于上述核燃料后处理知识体系构建的特殊考量,接下来本文介绍后处理多模态知识库工程实现的关键路线,即面向核化工文档的结构化抽取与公式-反应式入库模块。
3.2 核化工文档知识的结构化抽取
核燃料后处理知识体系不仅包含工艺流程描述文本,还包含化学反应方程式、动力学速率模型、平衡常数表达式及相关参数表格等。这些知识通常以PDF或Word格式报告及扫描文档等非结构化形式存储,呈现公式与正文混排、多模态交织的特点,难以直接被用于领域知识库构建与后续智能推理任务。
构建面向核化工文档的结构化抽取模块,形成可识别、可检索、可复用的知识单元是实现核燃料后处理知识工程化入库的关键入口之一。抽取对象主要包括核化工过程描述性文本、数学公式和动力学速率模型,以及化学反应方程式及其平衡关系。结构化抽取的目标是将上述抽取对象统一转换为结构化的Markdown文本与Latex公式,以便于后续的系统调用和知识管理。模块的工程实现可采用光学字符识别(Optical Character Recognition,OCR)软件SimpleTex,或采用集成识别公式模型的Python库Pix2Text,前者是一种将图片中的文字内容转化为可编辑的文本的技术,广泛应用于将扫描的文档、照片或 PDF 格式文件中的文字提取出来,通过图像处理和机器学习算法分析图像中的字符形状,并将其转换为数字格式或方便识别的Markdown格式。后者可用于识别图片中的版面、表格、图片、文字、数学公式等内容,整合所有内容后以 Markdown 格式输出。同时,Pix2Text还支持把整个PDF格式文件(PDF 的内容可以是扫描图片或者其他任何格式)转换为Markdown格式。
3.3 核化工文档结构化抽取示例
为验证3.2节中的结构化抽取模块在核燃料后处理知识载体中的可行性,本文选取核化工动力学建模文献页面作为测试对象,对其中的速率方程与化学反应式进行抽取实验,并采用专家抽检方式对抽取结果进行评估。此类文档包含正文描述、数学公式与反应方程混合排版,具有典型的多模态异构特征,是核领域知识入库过程的代表性场景。
1) SimpleTex。采用SimpleTex作为公式OCR工具,对原始文档中的动力学速率方程与反应式进行识别。
图7给出了从原始PDF格式文件页面到公式抽取输出的完整流程,包括文本-公式混排区域的截取、OCR识别以及最终结构化结果输出。
从结构完整性与符号准确性角度评估,SimpleTex能够准确提取公式结构,并生成规范的LaTeX表达形式,整体识别结果具有较高一致性,满足核化工公式知识单元入库的基本要求。
2) Pix2Text。为实现对核化工文档整页内容的统一解析,本文采用Pix2Text工具对原始PDF格式文件页面进行结构化抽取测试,同时处理正文描述与公式、反应式混排内容,并输出包含文本与LaTeX公式的Markdown结构化结果,以便直接作为领域知识单元入库。
图8展示了Pix2Text对典型核燃料后处理动力学模型页面的抽取流程及结果。从公式识别准确性与文本一致性角度评估,Pix2Text能够较为完整地保留原文公式结构与化学反应方程式表达,并生成标准化的LaTeX输出形式。Pix2Text在公式识别方面表现良好而在文本与公式混排场景中存在少量字符偏差或排版误差,但对整体语义表达影响有限,这应与原始文档清晰度及OCR模型算法精度相关。
综合上述抽取结果,从结构完整性、符号准确性及文本一致性维度来看,两种方法在核化工文档结构化抽取任务中均具备较好的适用性与稳定性。鉴于核燃料后处理属于高风险工程应用领域,相关知识抽取结果必须满足可追溯与高可靠性要求。因此,在实际部署中需在前述专家抽检评估基础上,进一步结合置信度筛选、LaTeX编译校验等自动化手段,以及专家复核机制,形成“自动抽取-人工审查”的闭环流程,以确保知识入库与模型推理的安全可控性。
4 结论
本文以符号回归、化学材料以及医疗健康等三个领域为例,梳理归纳了LLM在多模态知识库构建中的关键技术路径。LLM在非结构化知识提取、跨模态语义对齐以及检索增强推理等方面展现出良好的通用性,有望为复杂工程领域知识体系构建提供新的技术范式。这些跨领域实践所提炼的通用思路可为核燃料后处理这一多源异构且高约束场景提供借鉴,特别是在结构化抽取与可信度控制等关键环节。对于核燃料后处理领域,尽管当前针对该领域的LLM应用研究仍处于萌芽阶段,但本文结合该领域的多模态异构特征与安全可控性约束,进一步给出了结构化抽取与入库的入口环节验证示例,初步说明多模态知识库技术路径在核后处理场景中的可迁移性与初步可行性。
未来,为了成功构建核燃料后处理领域的多模态知识库,仍需从技术路径与工程部署两个层面加以推进。
在技术路径方面,需要重点突破以下方向:构建具备放射性工艺语义感知能力的专用术语表示与嵌入空间;发展适用于涉后处理化工过程数据的小样本迁移与微调机制;提升对图像、谱图和文本等多模态数据的结构对齐与语义统一建模能力。
在工程部署层面,进一步探索安全可控的应用路径,考虑引入人机协同验证机制,实现模型输出的专家审查与反馈闭环;发展面向核领域的本地化模型部署策略,以满足数据安全与合规要求;结合可溯源机制,构建支持知识持续更新与版本管理的工程化知识库系统。
本文的研究可以为构建面向核工业场景的多模态知识库与智能问答系统、推动该领域的数字化转型与知识可持续管理提供参考。
国防科技工业局稳定支持专项(24862)