0 引言
传统油气地质研究在系统刻画多圈层相互作用下复杂油气富集过程,尤其是深部-浅部耦合关系方面仍存在一定局限,这一问题随着勘探向深层—超深层推进愈加凸显
[1-4]。当前的油气富集理论不仅关注烃源岩、储层、盖层、圈闭、油气运聚以及油气藏的保存及破坏等基本要素的匹配关系,还强调岩石圈、表层(水圈、大气圈)、生物圈间的圈层相互耦合作用对油气成藏的影响。朱日祥等
[4]提出多圈层驱动的油气形成与富集理论,指出未来须立足地球系统科学框架,重点研究跨岩石圈-表层-生物圈的物质-能量交换机制,构建多圈层耦合的油气形成与富集理论体系。已有学者围绕不同圈层对复杂油气富集的影响开展了大量研究
[5-8]。对这些已发表文献进行系统知识整合,有助于深化对含油气盆地的认识,推动多圈层驱动的油气形成与富集理论的发展与方法创新。
近年来,人工智能和大模型技术的快速发展,为多圈层驱动的油气形成与富集理论的研究提供了新的技术路径
[9-10]。然而,基于海量数据的通用语言大模型在执行具体任务时仍可能生成看似真实实则虚构的信息,即产生“幻觉”
[11]。构建专业领域的知识图谱并赋能大语言模型的做法,能够有效弥补大模型在复杂油气领域的认知偏差,并提高其输出结果的准确性和可信度,可为多圈层驱动的油气形成与富集理论中新知识的发现提供新的思路
[12-15]。
知识图谱可通过三元组来描述油气形成与富集理论中的多维关系,形成“实体-关系-实体”的结构化知识
[16-20]。在早期阶段,知识图谱的构建依赖人工与群体智慧,领域专家通过梳理知识体系并定义概念关系来实现
[21];随着技术的发展,构建知识图谱的方法演进为利用机器学习和信息抽取技术的自动化构建
[22];随着人工智能的发展,设计提示词能够引导大语言模型提取专业领域知识,完成知识图谱的自动化构建,并极大提高构建效率
[23-24]。大语言模型自动构建知识图谱的方式已在水利工程、地理空间建模、骨架材料等方面有较多应用
[25-27]。但在油气领域,知识图谱的自动化构建面临更复杂的挑战,需要同时考虑时间、空间和物质交换的逻辑关系
[13]。实现油气领域知识图谱的自动化构建,可以将提示词工程与大语言模型深度融合,以提升知识抽取与表示的精准度
[15]。在这一方法框架下,选取具有多圈层耦合驱动油气生成的典型盆地作为研究对象,有助于对油气领域已发表理论文献开展知识图谱建模,从而为大语言模型进行知识赋能,并为智能化应用提供可靠支撑。
鄂尔多斯盆地是我国第二大沉积盆地,2024年油气产量当量约9 750万吨,持续保持全国最大油气产区
[28-30]。该盆地在大型坳陷湖盆背景下发育河流-三角洲-湖泊沉积体系,形成了多个油气成藏组合,是我国陆相湖盆成藏研究的重要代表
[31-32]。延长组不仅是我国最大的致密油气储层分布区,还呈现出常规与非常规油气共存共生的特征,是典型油气成藏耦合机制的研究对象
[33-35]。延长组的油气富集过程受控于深部过程、气候环境、盆地演化、生物活动等地球多圈层耦合作用,其中印支期秦岭运动引发的沉积格局转变对延长组的油气成藏产生了深远影响
[36-37]。现有研究在跨岩石圈-表层-生物圈耦合及时空作用机制虽已取得重要进展,但整体认识仍有待深化。知识图谱方法能够整合多源异构地学资料,显式表达事件间的因果与时序关系,为刻画油气成藏的复杂逻辑提供新的技术路径。本研究以鄂尔多斯盆地延长组为对象,构建多圈层相互作用下的油气富集知识图谱,既弥补传统研究在跨圈层耦合机制认识上的不足,又为大语言模型的长链推理提供系统化数据支撑,可为建立多圈层耦合视角的油气富集新范式提供重要科学依据。
基于上述认识,本文将知识图谱构建方法引入鄂尔多斯盆地延长组油气富集过程研究中,并探索基础语言大模型在油气领域在科学发现方面的应用模式。本文构建以“基础地学知识、油气形成与富集过程知识及多圈层地质知识”为核心的知识本体,支撑多圈层油气富集理论的结构化表达与图谱化推理,为油气地质智能化转型提供统一的语义基础。本文采用自底向上与自顶向下的技术路线,完成大模型对鄂尔多斯盆地延长组油气富集过程的知识图谱的自动化构建,为油气领域的科学研究提供新的方法与技术支撑。
1 研究区地质背景
鄂尔多斯盆地位于华北板块西部,是古生代克拉通盆地残余收缩并改造形成的中—新生代叠合盆地,也是中国第二大的沉积盆地
[38](
图1a)。鄂尔多斯盆地作为一个大型多旋回克拉通盆地,整体演化受到板块汇聚、构造-沉积响应、盆山耦合演化、早白垩世构造-热事件的控制,尽管经历过多阶段构造隆起和坳陷迁移,但盆地的构造框架相对简单
[39]。鄂尔多斯盆地的矿产资源丰富,石油、天然气、煤炭、铀等矿产资源并存,其中石油和天然气最为丰富。石油主要富集在三叠纪地层和侏罗纪地层,天然气主要富集在奥陶纪地层和石炭纪—二叠纪地层
[40]。
鄂尔多斯盆地延长组有机质富集特征明显
[43](
图1b)。从构造上,延长组与下伏纸坊组、上覆延安组均不整合接触,整体反映了印支早期运动和印支晚期运动两期构造运动
[42]。三叠纪时期受印支运动的影响,华北板块与扬子板块碰撞拼合,鄂尔多斯盆地进入克拉通坳陷阶段,盆地整体缓慢沉降,形成大型内陆湖盆
[44]。从沉积特征上,延长组的沉积相整体以三角洲相、湖泊相、河流相为主,在岩性上表现为向黑色泥页岩的突变(
图1b)。在烃源岩发育方面,三叠系延长组的富有机质页岩主要来源于具有II型干酪根的水生生物,有机质富集特征明显
[43]。在古环境和气候方面,晚三叠世的气候受到卡尼期湿润幕事件,暖湿气候促进了延长组丰富细粒沉积物形成和有机质富集
[43]。综上所述,延长组构造-沉积背景清晰、晚三叠世大型湖盆的背景及黑色泥页岩发育且受到古气候古环境的影响,是开展多圈层驱动的油气形成与富集理论研究的理想案例。
2 知识图谱构建方法和流程
本研究采用自顶向下和自底向上相结合的方法构建鄂尔多斯盆地延长组油气形成与富集知识图谱,包括模式层、数据层和应用层三个部分(
图2)。其中,自顶向下为本体设计与模式层构建,通过专家对领域文献的归纳,定义核心概念、属性与关系的本体及关系模型,为整个模型提供了统一的语义框架;自底向上为知识图谱的数据抽取与知识实例化,该部分由Python程序实现,涵盖文件解析、规则抽取与数据库导入,提供了实例化的知识图谱库。最终,在知识图谱的支撑下,结合专家与大模型完成对科学问题的知识推理与决策支持。
2.1 模式层构建
模式层主要包括本体和关系的设计。本体作为知识库的核心框架,能够精确定义领域内多样化知识概念及其层次结构,相较于直接从语料中构建的知识图谱,具有更高的准确性和更低的冗余性。油气系统是地球系统的子系统,为岩石圈、表层、生物圈等多圈层协同作用的产物
[45]。本研究以鄂尔多斯盆地延长组的油气形成与富集过程为研究对象,构建面向特定领域的本体体系。在本体设计过程中,选取了多部与鄂尔多斯盆地及延长组相关的权威专著作为参考资料,主要包括《鄂尔多斯盆地油气成藏规律与主控因素》
[46]、《鄂尔多斯盆地三叠纪延长组沉积期湖盆边界与底形及事件沉积研究》
[47]、《非常规油气地质学》
[48]以及《非常规油气资源富集与重大地质事件》
[49]。通过对上述资料中延长组油气富集特征的系统梳理,构建了支撑知识抽取的本体框架。
为了提升自顶向下三元组抽取的效率与准确性,构建过程中融合了多个地学子领域的知识,将基础地质学知识、油气形成与富集过程知识以及多圈层地质事件知识进行系统分类与整合,划分为本体中的三大核心模块。在本体设计中,明确了各类实体的层级关系,并对本体概念之间以及不同实体之间的关系类型进行了系统定义,从而形成了一个简明而具有高度领域针对性的本体体系,为后续基于大模型的抽取知识明确了边界与规范。最终构建完成的多圈层油气形成与富集过程本体模型如
图3所示。
2.2 数据层构建
数据层主要包括资料收集、提示词工程设计以及知识抽取三个环节。在本体及关系模型自顶向下确定抽取范围的基础上,结合提示词和海量文献,自底向上开展知识抽取工作。利用大语言模型自动完成地质实体、实体间关系的识别,并将其组织为结构化的三元组知识,构建数据层的核心内容。
本研究以Web of Science(WOS)数据库作为英文文献的主要来源,检索主题为“鄂尔多斯盆地”和“延长组”,不设时间范围,文献类型限定为“Article”,共获取英文文献904篇。同时,在中国知网中检索研究内容与鄂尔多斯盆地延长组油气富集相关的高被引、研究内容聚焦多圈层驱动油气富集的中文文献47篇,最终形成用于构建知识图谱的中英文文献数据集。
在知识抽取环节,采用少样本地质提示词工程的方法,设计用于大语言模型的提示词模板。该模板包括四个部分:“实体/事件抽取”、“实体/事件判断”、“实体/事件三元组样例”以及“三元组关系样例”(
图4)。此外,在传统实体抽取的基础上,增加了对地质事件类实体的抽取。其中,实体类节点包含名称、标签、描述、本体类别、来源原文等属性;而事件类实体节点则在此基础上,增加了事件起始时间等时间属性,全面表征地质事件的时序信息,增强了对地质过程演化的刻画能力。关系信息则记录了关系类型、关系描述及其引用来源等内容。
基于上述提示词模板,研究利用大语言模型对鄂尔多斯盆地延长组相关的中英文文献进行自动解析与抽取,依次完成实体/事件节点识别和三元组关系构建。在三元组构建基础上,进一步开展实体对齐和属性消歧工作,将语义上相同但形式不同的实体进行合并,对存在属性冗余或表述差异的字段进行融合处理,最终形成结构完整、语义清晰的知识图谱的数据层,为后续的图谱可视化与应用提供了坚实的数据基础。
2.3 应用层构建
应用层主要包括知识图谱可视化和知识图谱应用两个方面。
本研究采用Neo4j Community 5.26.0作为图数据库平台,用于实现知识图谱的可视化展示与交互操作。科研人员可借助Cypher图查询语言,结合Neo4j自带的可视化界面,或通过Gephi等图分析工具,可查询不同地质实体与地质事件之间的关联路径,直观揭示不同多圈层实体间的耦合作用机制。
本研究通过专家协同图谱分析和大模型协同图谱推理,推动知识图谱在科研中的实际应用。通过专家协同图谱分析,科研人员可基于已有地质知识对图谱中的逻辑关系进行验证与补充;同时,结合大语言模型的图谱协同推理能力,可实现对地学科学问题的自动化知识推理与科研假设验证,提升知识图谱在油气地质领域“人-图-机”闭环系统中的应用价值。该应用层设计使得知识图谱不仅作为信息存储工具,更转化为面向科研推理与智能决策支持的关键载体。
3 知识图谱构建结果与质量评估
3.1 知识图谱构建结果
本研究面向鄂尔多斯盆地延长组油气富集过程构建了系统的知识图谱,整合了跨文献的油气富集知识。本知识图谱规模为约11.37万个实体节点(其中事件类节点约1.34万个),三元组15.04万条,全面覆盖了地质实体-地质事件的多维关联。
图5a展示了知识图谱的总体结构,节点的颜色对应不同类别的实体或事件(如生物活动、沉积过程、火山活动、气候环境、油气相关实体等),连接不同节点的边表示特定的“关系”,无数的节点和边相连呈现出复杂而有机的网络特征。以“盖层”、“有机质富集”、“油气聚集”和“油气运移”为中心的知识图谱片段,展示了其与盆地演化、气候环境、深部过程、生物活动等多维要素的关系链条。
图5b为知识图谱中高频实体的词云,可以直观反映出孔隙度、渗透率、有机质丰度等与油气富集过程相关的核心要素具有较高的关注度。
图5知识图谱的片段和高频实体词云均反映出该图谱涵盖了延长组油气成藏过程中多圈层因素的相互作用,为后续的图谱质量评估、人机协同的智能推理应用提供了结构化的数据基础与平台支撑。
3.2 知识图谱质量评估
为保证知识图谱构建质量,本研究从知识图谱的准确率和知识图谱的广泛度两个核心维度开展评估。准确率主要衡量知识抽取结果的正确性。通常采用人工标注对比与精确率、召回率等指标来量化
[50-51]。本研究采用随机抽取一定比例的三元组进行对比,并由领域专家精确计算精确率(Precision),以确保评价结果的可靠性。广泛度则反映知识图谱覆盖领域知识的程度,即知识图谱中涉及的实体、关系是否能够较全面地反映目标领域的知识体系
[52],地学领域的广泛度尤其重要,因为地质实体、事件和过程高度复杂,若覆盖不足则难以支撑下游地学分析与推理
[53]。本研究对知识图谱的广泛度从两个方面进行量化:一是统计节点关系数量的分布特征,并绘制长尾分布曲线以揭示图谱的整体覆盖性;二是基于领域知识分类体,统计各类节点的数量及关系连接数,形成类别覆盖率图。通过这两类指标的结合,可以较全面地评估知识图谱在准确性与广泛性上的质量,为后续的机理分析与智能推理提供可靠依据。
3.2.1 知识图谱的精确率评估
为评估模型抽取结果的准确性,本文采用精确率(Precision)指标对实体与三元组进行评价。精确率P的计算公式为:
P=$\frac{{\mathit{T}}_{\mathit{p}}}{{\mathit{T}}_{\mathit{p}}+{\mathit{F}}_{\mathit{P}}}$×100%
其中,TP表示正确抽取的三元组数量,FP表示错误抽取的三元组数量。
为保证评价的科学性和客观性,本研究引入人工专家审核环节。具体方法为:随机抽取100条三元组,由三名地质学专家共同评判,以获得基准准确率;随后再随机抽取900条三元组,分成三组(每组300条),由三位专家分别独立评判。整个验证过程共评估1 000条三元组,占总体样本的约1%。评估结果显示,三名专家共同评判的100条三元组准确率为76.0%,而独立评判的900条三元组平均准确率为80.5%(见
表 1)。
3.2.2 知识图谱的广泛度评估
知识图谱的广泛度体现了对目标领域知识覆盖的全面性与代表性。通常可通过统计不同实体节点及其关系连接数量来衡量图谱在知识层次上的广度与深度。如
图6a所示,节点关系数量分布呈现出典型的长尾特征:少数核心节点(如“鄂尔多斯盆地”、“延长组”、“长7段”)连接关系数极高,而大量中低频节点则维持较少的关系。这种分布模式表明图谱在突显关键实体的同时,也涵盖了数量庞大的边缘节点,实现了知识的全面覆盖。
图6b进一步展示了不同类别节点的覆盖情况,包括盆地演化相关实体、气候环境相关实体、深部过程相关实体、生物活动相关实体、油气系统相关实体及其他实体。结果显示,各类节点均有分布,其中盆地演化、油气系统类节点占比最高,但气候环境、生物活动与深部过程等类别也得到了较好体现。这表明图谱能够在多维度、多类型要素间实现系统整合。
因此,本研究构建的知识图谱不仅在整体结构上体现了长尾分布特征,保证了知识点的全面覆盖;同时在类别维度上兼顾了油气富集过程的关键实体与跨圈层实体,体现出较强的广泛性与代表性,为后续智能推理提供了可靠的数据支撑。
4 知识图谱应用:延长组火山活动与有机质形成富集的作用机制
为探索知识图谱在揭示油气形成与富集机制中的潜力,通过“专家协同图谱分析+大模型协同推理”的应用方法,与未进行知识图谱增强的大模型回答进行对比,验证知识图谱增强推理在揭示复杂地学关系中的科学价值。
4.1 研究边界与约束条件
秦岭造山带在晚三叠世印支期持续隆升,导致构造格局与盆地沉积环境显著调整,为鄂尔多斯盆地提供了火山物质输入
[54]。多期火山灰对湖盆的营养供给与水体分层缺氧形成具有重要意义
[55]。但从多圈层角度,火山活动对有机质富集的复杂关联并不明确。因此,在这里选择“鄂尔多斯盆地延长组火山活动和有机质富集”之间的关系作为科学问题,为保证推理科学性,研究设置以下约束:
1. 时段约束:限定晚三叠世延长组沉积期,将印支期构造-火山事件作为主控背景。
2. 空间/层位约束:推理路径限定在鄂尔多斯盆地延长组盆地范围内,剔除非本区/本层位节点。
3. 地质科学性检查:在大模型与知识图谱生成推理结果后,引入地质学反思与一致性校验机制,从七个方面让大模型进行反思:“推理出来的知识图谱是否科学?时间尺度是否合理?空间关系是否正确?逻辑结构是否严谨?术语使用是否准确?多圈层耦合是否科学?油气地质学专业性是否到位?”通过七个方面的反思,让大模型生成的结果更具备地质科学性。
4.2 知识图谱分析与可视化
基于知识图谱的专家分析能够直观揭示火山活动与盆地演化、气候环境、深部过程、生物活动、油气系统等关键节点之间的耦合关系。以“火山活动”为中心节点的知识图谱子图显示,火山喷发既通过碎屑物质沉积、凝灰岩层形成和重力流触发等过程改变湖盆沉积动力学格局,也通过热液事件和火山灰输入调节水体营养物质供给和酸化作用,同时影响藻类和浮游植物的生长繁盛及其大规模死亡(
图7)。该子图展示了火山活动与深部过程、沉积环境、水体化学过程及生物效应之间的多类联系,这些关系为理解延长组有机质富集提供了可视化线索。
4.3 协同推理后前后的大模型回答对比
在知识图谱的检索增强下,大模型与知识图谱协同推理所得的回答及知识图谱链路见
图8。相比未引入知识图谱时,大模型的推理框架主要依赖常见的地质学认识,强调构造、热液与沉积作用的耦合,认为火山活动与有机质富集之间的关系主要体现在热液营养供给、缺氧环境形成、火山灰盖层保护以及构造热演化四个方面(
图8a),大模型自主的回答结果中存在编造的论文和不确定性的内容(
图8a文中标黄部分)。大模型自主回答结果认为,火山热液流体为湖泊体系提供铁、磷等营养物质,进而提升初级生产力;火山喷发导致的气候波动和水体分层有助于缺氧环境的形成;火山灰作为物理盖层增强有机质保存;构造作用则为沉积盆地演化和有机质热演化提供了动力。
大模型引入知识图谱检索增强后(
图8b),协同推理的回答结果具备系统性及真实性。通过知识图谱提供的路径信息,大模型能够在原有认识的基础上,扩展出“营养供给-缺氧保存-沉积改造-气候耦合”的多层次机制框架。具体回答体现在以下四个方面:① 营养供给-初级生产力跃迁方面,火山灰溶解释放的铁、磷元素被视为驱动水体生产力跃升的关键因子,与黄铁矿丰度和有机碳同位素异常的地球化学证据相呼应(
图8c-1);②缺氧环境形成-有机质保存方面,火山灰沉积与热液作用不仅导致缺氧环境形成,还通过物理隔离和化学耗氧双重作用提高有机质保存效率(
图8c-2);③沉积环境改造-物源调控方面,秦岭物源供给与火山灰输入的协同作用进一步改造了沉积环境,促进了I型有机质的富集(
图8c-3);④气候-物源-生物耦合方面:火山喷发释放的气溶胶与卡尼期湿润幕事件联系起来,揭示了古气候变化在沉积序列形成和物源调控中的关键作用(
图8c-4)。这一推理不仅涵盖了前人总结的主要机制,而且通过知识图谱链路揭示了卡尼期湿幕变化、秦岭造山事件、藻类生物大爆发事件和火山活动存在的内在联系,形成了跨圈层、跨过程的因果链条。
从不同回答结果的对比可知,知识图谱增强后的回答框架更完整、回答更真实、证据整合能力更强以及推理机制更深。未引入知识图谱时,大模型的推理结果较为发散、缺少相应的证据,且真实性存疑。引入知识图谱检索增强后,大模型把海量文献证据整合成一个整体框架,使得火山活动在岩石圈-表层-生物圈不同圈层、深部过程-气候环境-盆地演化-生物活动的跨圈层、跨过程的因果链条得以清晰呈现。这种推理模式能够揭示出单一文献或单纯模型计算难以全面捕捉的机制联系,体现了知识图谱在复杂地质过程研究中的独特优势,也为理解陆相盆地油气成藏机制提供了新的思路。
4.4 讨论
本研究在构建鄂尔多斯盆地延长组油气富集知识图谱的过程中,系统探索了知识图谱应用于AI for Science的可行性。研究在充分整理延长组油气富集过程相关资料的基础上,设计了覆盖基础地学知识、油气富集过程及多圈层地质事件的知识本体,实现了分散语料向结构化知识的统一转化。结合大语言模型与少样本提示词工程,开展三元组的自动化抽取,并进行语义对齐,提升了跨来源异构地质信息的融合效率与准确性。在此基础上,构建了鄂尔多斯延长组油气富集过程的知识图谱,揭示了火山活动与有机质富集之间的多条有价值的潜在作用路径,为探讨多圈层驱动下的油气富集机制提供了新的思路。这一探索不仅验证了知识图谱在复杂地学过程研究中的应用价值,也展示了AI驱动知识发现模式在油气地质领域的可行性。
尽管当前研究仍存在诸如三元组抽取质量不足、知识融合与语义对齐尚不完善等问题,但这些不足并非个例,而是地学知识图谱构建领域普遍面临的共同困境。由于尚无统一的知识图谱质量评价标准,不同研究成果之间的横向比较和跨团队推广都受到一定限制。然而,随着人工智能技术的快速发展和跨学科合作的不断深化,未来知识图谱将展现出更广阔的应用价值。
知识图谱未来在油气勘探与科学研究中具有广阔前景。一方面,知识图谱将成为理论模型化-模型智能化的重要桥梁,知识图谱在油气地质、地球系统科学以及人工智能技术应用中,能将非结构化的领域知识转换为可计算、可验证的因果链条,通过向量化表示实现与大语言模型的深度融合,在地学问答与决策任务中降低幻觉风险,提升推理的专业性与解释力。结合因果推理框架,还可基于显式事件链条开展多条知识图谱推理等过程的定量化模拟与因果分析。另一方面,多模态知识图谱将成为图-文-表结合的数据中心。在文本知识图谱的基础上,进一步整合测井曲线、地震剖面、薄片图像与地球化学数据,可完成跨模态检索、协同推理等复杂任务,为复杂地质过程研究和油气预测提供更全面的先验信息。
综上所述,知识图谱增强推理方法仍有改进空间,但可为多圈层驱动的油气富集机制研究提供了新视角。随着抽取质量提升、语义对齐完善和多模态融合推进,知识图谱将在理论模型化-模型智能化的多圈层驱动的油气成藏理论研究与智能勘探实践中发挥更加重要的支撑作用。
5 结论
本研究以多圈层驱动的油气形成与富集理论为指导,结合油气地质领域的知识图谱构建需求,基于大语言模型和提示词工程的油气地质知识图谱构建方法,开展知识图谱推理应用,取得了如下结论及认识:
(1)构建了鄂尔多斯盆地延长组油气富集知识图谱,实现了跨文献知识的结构化表达与可视化。该图谱包含约11.37万个实体节点、15.04万条三元组的领域知识图谱,经专家评估准确率约80%,覆盖深部过程、气候环境、盆地演化、生物活动和油气系统等关键要素,为多圈层驱动的油气形成与富集研究提供了知识平台。
(2)基于知识图谱完成跨圈层跨过程的科学问题分析,针对鄂尔多斯延长组火山活动对有机质富集的科学问题,揭示火山活动通过营养供给-初级生产力跃迁、缺氧环境形成-有机质保存、沉积环境改造-物源调控、气候-物源-生物耦合四个机制,促进了延长组有机质高效富集。
(3)完成了AI for Science的探索性应用,表明知识图谱增强的大语言模型可有效整合碎片化地学信息,提升大模型推理的条理性、可追溯性与解释力。本研究为油气领域知识图谱构建和科学发现提供了可行路径,为未来油气大模型提供知识基础,同时为多圈层驱动的油气形成与富集理论提供了理论模型化-模型智能化的重要应用示范。
中国科学院重大科技任务专项