多圈层相互作用的油气富集知识图谱构建与应用——以鄂尔多斯盆地延长组为例

宋颖睿 ,  黄浩 ,  徐志尧 ,  单小彩 ,  赵亮 ,  丁家昕 ,  张旺 ,  韩丙耀 ,  张皓翔

地学前缘 ›› 2026, Vol. 33 ›› Issue (6) : 378 -391.

PDF (10120KB)
地学前缘 ›› 2026, Vol. 33 ›› Issue (6) : 378 -391. DOI: 10.13745/j.esf.sf.2026.3.81
东部海域、全球油气勘探及大数据

多圈层相互作用的油气富集知识图谱构建与应用——以鄂尔多斯盆地延长组为例

作者信息 +

Knowledge graph construction and application of multi-circle interaction for oil and gas enrichment: A case study of the Yanchang Formation in the Ordos Basin

Author information +
文章历史 +
PDF (10362K)

摘要

在多圈层驱动的油气形成与富集理论中,需要对具有复杂因果关系的油气富集过程进行分析。本文在综合前人研究和文献知识的基础上,以“鄂尔多斯盆地延长组有机质富集与火山活动的相互作用机制”为切入点,基于人工智能和大语言模型技术,结合少样本提示词工程与本体设计,采用自底向上与自顶向下相结合的知识图谱构建方法,构建了鄂尔多斯盆地延长组油气富集过程知识图谱,完成了AI for Science的探索性应用。经人工校验与语义对齐后的知识图谱共包含约11.37万个实体节点共计15.04万条三元组,涵盖深部过程、气候环境、盆地演化、生物活动与油气系统等多类要素。应用分析表明,延长组火山活动与热液事件、碎屑流沉积、藻类爆发、水体扰动等地质事件密切相关。协同推理结果揭示火山活动通过营养供给-初级生产力跃迁、缺氧环境形成-有机质保存、沉积环境改造-物源调控、气候-物源-生物耦合四个机制,促进了多圈层协同作用下的延长组有机质的高效富集。相比之下,知识图谱检索增强后的大语言模型能够有效整合碎片化的地学信息,构建跨圈层因果关系的结构化表达,提升复杂地质过程分析的条理性、可追溯性和解释力。本文的探索性成果不仅为鄂尔多斯盆地延长组的油气富集过程研究提供了新的科学视角,也为“AI for Science”在油气勘探领域的应用奠定了方法基础。未来,该知识图谱可作为油气大模型的知识支撑平台,成为理论模型化-模型智能化的重要桥梁,推动多圈层驱动的油气成藏理论研究与智能勘探实践。

Abstract

Within the framework of multi-sphere interaction-driven hydrocarbon formation and enrichment, disentangling the complex causal processes governing accumulation is essential. Building on prior research, this study focuses on the interaction between organic matter enrichment and volcanic activity in the Ordos Basin’s Yanchang Formation. By integrating artificial intelligence and large language models with few-shot prompting strategies and ontology-based schema design, we employed a hybrid bottom-up and top-down approach to construct a comprehensive knowledge graph of the hydrocarbon enrichment process, thereby conducting an exploratory application of AI for Science. After manual validation and semantic alignment, the resulting knowledge graph comprises approximately 113,700 entity nodes and 150,400 relational triples, spanning dimensions such as deep Earth processes, paleoclimate, basin evolution, biological activity, and petroleum systems. Application analysis demonstrates that volcanic activity in the Yanchang Formation directly influenced a series of geological events, including thermal fluid circulation, debris flow deposition, algal blooms, and water-column disturbances. Collaborative reasoning further reveals that volcanic activity facilitated efficient organic matter enrichment through four primary mechanisms: (i) enhancing nutrient input and shifting primary productivity, (ii) promoting anoxia and organic matter preservation, (iii) modifying sedimentary environments and regulating source rock development, and (iv) coupling climatic, source rock, and biospheric processes. Compared to baseline large language models, the knowledge graph-enhanced reasoning framework significantly improves the integration of fragmented geological evidence, enables the construction of structured multi-sphere causal representations, and enhances the linearity, traceability, and explanatory power of complex geological analyses. The exploratory results of this study provide a novel scientific perspective for understanding hydrocarbon enrichment in the Yanchang Formation and establish a methodological foundation for advancing AI for Science in hydrocarbon exploration. Looking ahead, the proposed knowledge graph can serve as a knowledge-support platform for geological modeling, bridge theoretical frameworks and intelligent exploration, and promote the development of both multi-sphere hydrocarbon accumulation theory and AI-driven exploration practices.

Graphical abstract

关键词

油气富集知识图谱 / 大语言模型 / 鄂尔多斯盆地 / 延长组 / 提示词工程 / 知识图谱应用

Key words

hydrocarbon enrichment knowledge graph / large language model / Ordos Basin / Yanchang Formation / prompt engineering / knowledge graph application

引用本文

引用格式 ▾
宋颖睿,黄浩,徐志尧,单小彩,赵亮,丁家昕,张旺,韩丙耀,张皓翔. 多圈层相互作用的油气富集知识图谱构建与应用——以鄂尔多斯盆地延长组为例[J]. 地学前缘, 2026, 33(6): 378-391 DOI:10.13745/j.esf.sf.2026.3.81

登录浏览全文

4963

注册一个新账户 忘记密码

0 引言

传统油气地质研究在系统刻画多圈层相互作用下复杂油气富集过程,尤其是深部-浅部耦合关系方面仍存在一定局限,这一问题随着勘探向深层—超深层推进愈加凸显[1-4]。当前的油气富集理论不仅关注烃源岩、储层、盖层、圈闭、油气运聚以及油气藏的保存及破坏等基本要素的匹配关系,还强调岩石圈、表层(水圈、大气圈)、生物圈间的圈层相互耦合作用对油气成藏的影响。朱日祥等[4]提出多圈层驱动的油气形成与富集理论,指出未来须立足地球系统科学框架,重点研究跨岩石圈-表层-生物圈的物质-能量交换机制,构建多圈层耦合的油气形成与富集理论体系。已有学者围绕不同圈层对复杂油气富集的影响开展了大量研究[5-8]。对这些已发表文献进行系统知识整合,有助于深化对含油气盆地的认识,推动多圈层驱动的油气形成与富集理论的发展与方法创新。

近年来,人工智能和大模型技术的快速发展,为多圈层驱动的油气形成与富集理论的研究提供了新的技术路径[9-10]。然而,基于海量数据的通用语言大模型在执行具体任务时仍可能生成看似真实实则虚构的信息,即产生“幻觉”[11]。构建专业领域的知识图谱并赋能大语言模型的做法,能够有效弥补大模型在复杂油气领域的认知偏差,并提高其输出结果的准确性和可信度,可为多圈层驱动的油气形成与富集理论中新知识的发现提供新的思路[12-15]。

知识图谱可通过三元组来描述油气形成与富集理论中的多维关系,形成“实体-关系-实体”的结构化知识[16-20]。在早期阶段,知识图谱的构建依赖人工与群体智慧,领域专家通过梳理知识体系并定义概念关系来实现[21];随着技术的发展,构建知识图谱的方法演进为利用机器学习和信息抽取技术的自动化构建[22];随着人工智能的发展,设计提示词能够引导大语言模型提取专业领域知识,完成知识图谱的自动化构建,并极大提高构建效率[23-24]。大语言模型自动构建知识图谱的方式已在水利工程、地理空间建模、骨架材料等方面有较多应用[25-27]。但在油气领域,知识图谱的自动化构建面临更复杂的挑战,需要同时考虑时间、空间和物质交换的逻辑关系[13]。实现油气领域知识图谱的自动化构建,可以将提示词工程与大语言模型深度融合,以提升知识抽取与表示的精准度[15]。在这一方法框架下,选取具有多圈层耦合驱动油气生成的典型盆地作为研究对象,有助于对油气领域已发表理论文献开展知识图谱建模,从而为大语言模型进行知识赋能,并为智能化应用提供可靠支撑。

鄂尔多斯盆地是我国第二大沉积盆地,2024年油气产量当量约9 750万吨,持续保持全国最大油气产区[28-30]。该盆地在大型坳陷湖盆背景下发育河流-三角洲-湖泊沉积体系,形成了多个油气成藏组合,是我国陆相湖盆成藏研究的重要代表[31-32]。延长组不仅是我国最大的致密油气储层分布区,还呈现出常规与非常规油气共存共生的特征,是典型油气成藏耦合机制的研究对象[33-35]。延长组的油气富集过程受控于深部过程、气候环境、盆地演化、生物活动等地球多圈层耦合作用,其中印支期秦岭运动引发的沉积格局转变对延长组的油气成藏产生了深远影响[36-37]。现有研究在跨岩石圈-表层-生物圈耦合及时空作用机制虽已取得重要进展,但整体认识仍有待深化。知识图谱方法能够整合多源异构地学资料,显式表达事件间的因果与时序关系,为刻画油气成藏的复杂逻辑提供新的技术路径。本研究以鄂尔多斯盆地延长组为对象,构建多圈层相互作用下的油气富集知识图谱,既弥补传统研究在跨圈层耦合机制认识上的不足,又为大语言模型的长链推理提供系统化数据支撑,可为建立多圈层耦合视角的油气富集新范式提供重要科学依据。

基于上述认识,本文将知识图谱构建方法引入鄂尔多斯盆地延长组油气富集过程研究中,并探索基础语言大模型在油气领域在科学发现方面的应用模式。本文构建以“基础地学知识、油气形成与富集过程知识及多圈层地质知识”为核心的知识本体,支撑多圈层油气富集理论的结构化表达与图谱化推理,为油气地质智能化转型提供统一的语义基础。本文采用自底向上与自顶向下的技术路线,完成大模型对鄂尔多斯盆地延长组油气富集过程的知识图谱的自动化构建,为油气领域的科学研究提供新的方法与技术支撑。

1 研究区地质背景

鄂尔多斯盆地位于华北板块西部,是古生代克拉通盆地残余收缩并改造形成的中—新生代叠合盆地,也是中国第二大的沉积盆地[38](图1a)。鄂尔多斯盆地作为一个大型多旋回克拉通盆地,整体演化受到板块汇聚、构造-沉积响应、盆山耦合演化、早白垩世构造-热事件的控制,尽管经历过多阶段构造隆起和坳陷迁移,但盆地的构造框架相对简单[39]。鄂尔多斯盆地的矿产资源丰富,石油、天然气、煤炭、铀等矿产资源并存,其中石油和天然气最为丰富。石油主要富集在三叠纪地层和侏罗纪地层,天然气主要富集在奥陶纪地层和石炭纪—二叠纪地层[40]。

鄂尔多斯盆地延长组有机质富集特征明显[43](图1b)。从构造上,延长组与下伏纸坊组、上覆延安组均不整合接触,整体反映了印支早期运动和印支晚期运动两期构造运动[42]。三叠纪时期受印支运动的影响,华北板块与扬子板块碰撞拼合,鄂尔多斯盆地进入克拉通坳陷阶段,盆地整体缓慢沉降,形成大型内陆湖盆[44]。从沉积特征上,延长组的沉积相整体以三角洲相、湖泊相、河流相为主,在岩性上表现为向黑色泥页岩的突变(图1b)。在烃源岩发育方面,三叠系延长组的富有机质页岩主要来源于具有II型干酪根的水生生物,有机质富集特征明显[43]。在古环境和气候方面,晚三叠世的气候受到卡尼期湿润幕事件,暖湿气候促进了延长组丰富细粒沉积物形成和有机质富集[43]。综上所述,延长组构造-沉积背景清晰、晚三叠世大型湖盆的背景及黑色泥页岩发育且受到古气候古环境的影响,是开展多圈层驱动的油气形成与富集理论研究的理想案例。

2 知识图谱构建方法和流程

本研究采用自顶向下和自底向上相结合的方法构建鄂尔多斯盆地延长组油气形成与富集知识图谱,包括模式层、数据层和应用层三个部分(图2)。其中,自顶向下为本体设计与模式层构建,通过专家对领域文献的归纳,定义核心概念、属性与关系的本体及关系模型,为整个模型提供了统一的语义框架;自底向上为知识图谱的数据抽取与知识实例化,该部分由Python程序实现,涵盖文件解析、规则抽取与数据库导入,提供了实例化的知识图谱库。最终,在知识图谱的支撑下,结合专家与大模型完成对科学问题的知识推理与决策支持。

2.1 模式层构建

模式层主要包括本体和关系的设计。本体作为知识库的核心框架,能够精确定义领域内多样化知识概念及其层次结构,相较于直接从语料中构建的知识图谱,具有更高的准确性和更低的冗余性。油气系统是地球系统的子系统,为岩石圈、表层、生物圈等多圈层协同作用的产物[45]。本研究以鄂尔多斯盆地延长组的油气形成与富集过程为研究对象,构建面向特定领域的本体体系。在本体设计过程中,选取了多部与鄂尔多斯盆地及延长组相关的权威专著作为参考资料,主要包括《鄂尔多斯盆地油气成藏规律与主控因素》[46]、《鄂尔多斯盆地三叠纪延长组沉积期湖盆边界与底形及事件沉积研究》[47]、《非常规油气地质学》[48]以及《非常规油气资源富集与重大地质事件》[49]。通过对上述资料中延长组油气富集特征的系统梳理,构建了支撑知识抽取的本体框架。

为了提升自顶向下三元组抽取的效率与准确性,构建过程中融合了多个地学子领域的知识,将基础地质学知识、油气形成与富集过程知识以及多圈层地质事件知识进行系统分类与整合,划分为本体中的三大核心模块。在本体设计中,明确了各类实体的层级关系,并对本体概念之间以及不同实体之间的关系类型进行了系统定义,从而形成了一个简明而具有高度领域针对性的本体体系,为后续基于大模型的抽取知识明确了边界与规范。最终构建完成的多圈层油气形成与富集过程本体模型如图3所示。

2.2 数据层构建

数据层主要包括资料收集、提示词工程设计以及知识抽取三个环节。在本体及关系模型自顶向下确定抽取范围的基础上,结合提示词和海量文献,自底向上开展知识抽取工作。利用大语言模型自动完成地质实体、实体间关系的识别,并将其组织为结构化的三元组知识,构建数据层的核心内容。

本研究以Web of Science(WOS)数据库作为英文文献的主要来源,检索主题为“鄂尔多斯盆地”和“延长组”,不设时间范围,文献类型限定为“Article”,共获取英文文献904篇。同时,在中国知网中检索研究内容与鄂尔多斯盆地延长组油气富集相关的高被引、研究内容聚焦多圈层驱动油气富集的中文文献47篇,最终形成用于构建知识图谱的中英文文献数据集。

在知识抽取环节,采用少样本地质提示词工程的方法,设计用于大语言模型的提示词模板。该模板包括四个部分:“实体/事件抽取”、“实体/事件判断”、“实体/事件三元组样例”以及“三元组关系样例”(图4)。此外,在传统实体抽取的基础上,增加了对地质事件类实体的抽取。其中,实体类节点包含名称、标签、描述、本体类别、来源原文等属性;而事件类实体节点则在此基础上,增加了事件起始时间等时间属性,全面表征地质事件的时序信息,增强了对地质过程演化的刻画能力。关系信息则记录了关系类型、关系描述及其引用来源等内容。

基于上述提示词模板,研究利用大语言模型对鄂尔多斯盆地延长组相关的中英文文献进行自动解析与抽取,依次完成实体/事件节点识别和三元组关系构建。在三元组构建基础上,进一步开展实体对齐和属性消歧工作,将语义上相同但形式不同的实体进行合并,对存在属性冗余或表述差异的字段进行融合处理,最终形成结构完整、语义清晰的知识图谱的数据层,为后续的图谱可视化与应用提供了坚实的数据基础。

2.3 应用层构建

应用层主要包括知识图谱可视化和知识图谱应用两个方面。

本研究采用Neo4j Community 5.26.0作为图数据库平台,用于实现知识图谱的可视化展示与交互操作。科研人员可借助Cypher图查询语言,结合Neo4j自带的可视化界面,或通过Gephi等图分析工具,可查询不同地质实体与地质事件之间的关联路径,直观揭示不同多圈层实体间的耦合作用机制。

本研究通过专家协同图谱分析和大模型协同图谱推理,推动知识图谱在科研中的实际应用。通过专家协同图谱分析,科研人员可基于已有地质知识对图谱中的逻辑关系进行验证与补充;同时,结合大语言模型的图谱协同推理能力,可实现对地学科学问题的自动化知识推理与科研假设验证,提升知识图谱在油气地质领域“人-图-机”闭环系统中的应用价值。该应用层设计使得知识图谱不仅作为信息存储工具,更转化为面向科研推理与智能决策支持的关键载体。

3 知识图谱构建结果与质量评估

3.1 知识图谱构建结果

本研究面向鄂尔多斯盆地延长组油气富集过程构建了系统的知识图谱,整合了跨文献的油气富集知识。本知识图谱规模为约11.37万个实体节点(其中事件类节点约1.34万个),三元组15.04万条,全面覆盖了地质实体-地质事件的多维关联。

图5a展示了知识图谱的总体结构,节点的颜色对应不同类别的实体或事件(如生物活动、沉积过程、火山活动、气候环境、油气相关实体等),连接不同节点的边表示特定的“关系”,无数的节点和边相连呈现出复杂而有机的网络特征。以“盖层”、“有机质富集”、“油气聚集”和“油气运移”为中心的知识图谱片段,展示了其与盆地演化、气候环境、深部过程、生物活动等多维要素的关系链条。图5b为知识图谱中高频实体的词云,可以直观反映出孔隙度、渗透率、有机质丰度等与油气富集过程相关的核心要素具有较高的关注度。图5知识图谱的片段和高频实体词云均反映出该图谱涵盖了延长组油气成藏过程中多圈层因素的相互作用,为后续的图谱质量评估、人机协同的智能推理应用提供了结构化的数据基础与平台支撑。

3.2 知识图谱质量评估

为保证知识图谱构建质量,本研究从知识图谱的准确率和知识图谱的广泛度两个核心维度开展评估。准确率主要衡量知识抽取结果的正确性。通常采用人工标注对比与精确率、召回率等指标来量化[50-51]。本研究采用随机抽取一定比例的三元组进行对比,并由领域专家精确计算精确率(Precision),以确保评价结果的可靠性。广泛度则反映知识图谱覆盖领域知识的程度,即知识图谱中涉及的实体、关系是否能够较全面地反映目标领域的知识体系[52],地学领域的广泛度尤其重要,因为地质实体、事件和过程高度复杂,若覆盖不足则难以支撑下游地学分析与推理[53]。本研究对知识图谱的广泛度从两个方面进行量化:一是统计节点关系数量的分布特征,并绘制长尾分布曲线以揭示图谱的整体覆盖性;二是基于领域知识分类体,统计各类节点的数量及关系连接数,形成类别覆盖率图。通过这两类指标的结合,可以较全面地评估知识图谱在准确性与广泛性上的质量,为后续的机理分析与智能推理提供可靠依据。

3.2.1 知识图谱的精确率评估

为评估模型抽取结果的准确性,本文采用精确率(Precision)指标对实体与三元组进行评价。精确率P的计算公式为:

P=$\frac{{\mathit{T}}_{\mathit{p}}}{{\mathit{T}}_{\mathit{p}}+{\mathit{F}}_{\mathit{P}}}$×100%

其中,TP表示正确抽取的三元组数量,FP表示错误抽取的三元组数量。

为保证评价的科学性和客观性,本研究引入人工专家审核环节。具体方法为:随机抽取100条三元组,由三名地质学专家共同评判,以获得基准准确率;随后再随机抽取900条三元组,分成三组(每组300条),由三位专家分别独立评判。整个验证过程共评估1 000条三元组,占总体样本的约1%。评估结果显示,三名专家共同评判的100条三元组准确率为76.0%,而独立评判的900条三元组平均准确率为80.5%(见表 1)。

3.2.2 知识图谱的广泛度评估

知识图谱的广泛度体现了对目标领域知识覆盖的全面性与代表性。通常可通过统计不同实体节点及其关系连接数量来衡量图谱在知识层次上的广度与深度。如图6a所示,节点关系数量分布呈现出典型的长尾特征:少数核心节点(如“鄂尔多斯盆地”、“延长组”、“长7段”)连接关系数极高,而大量中低频节点则维持较少的关系。这种分布模式表明图谱在突显关键实体的同时,也涵盖了数量庞大的边缘节点,实现了知识的全面覆盖。

图6b进一步展示了不同类别节点的覆盖情况,包括盆地演化相关实体、气候环境相关实体、深部过程相关实体、生物活动相关实体、油气系统相关实体及其他实体。结果显示,各类节点均有分布,其中盆地演化、油气系统类节点占比最高,但气候环境、生物活动与深部过程等类别也得到了较好体现。这表明图谱能够在多维度、多类型要素间实现系统整合。

因此,本研究构建的知识图谱不仅在整体结构上体现了长尾分布特征,保证了知识点的全面覆盖;同时在类别维度上兼顾了油气富集过程的关键实体与跨圈层实体,体现出较强的广泛性与代表性,为后续智能推理提供了可靠的数据支撑。

4 知识图谱应用:延长组火山活动与有机质形成富集的作用机制

为探索知识图谱在揭示油气形成与富集机制中的潜力,通过“专家协同图谱分析+大模型协同推理”的应用方法,与未进行知识图谱增强的大模型回答进行对比,验证知识图谱增强推理在揭示复杂地学关系中的科学价值。

4.1 研究边界与约束条件

秦岭造山带在晚三叠世印支期持续隆升,导致构造格局与盆地沉积环境显著调整,为鄂尔多斯盆地提供了火山物质输入[54]。多期火山灰对湖盆的营养供给与水体分层缺氧形成具有重要意义[55]。但从多圈层角度,火山活动对有机质富集的复杂关联并不明确。因此,在这里选择“鄂尔多斯盆地延长组火山活动和有机质富集”之间的关系作为科学问题,为保证推理科学性,研究设置以下约束:

1. 时段约束:限定晚三叠世延长组沉积期,将印支期构造-火山事件作为主控背景。

2. 空间/层位约束:推理路径限定在鄂尔多斯盆地延长组盆地范围内,剔除非本区/本层位节点。

3. 地质科学性检查:在大模型与知识图谱生成推理结果后,引入地质学反思与一致性校验机制,从七个方面让大模型进行反思:“推理出来的知识图谱是否科学?时间尺度是否合理?空间关系是否正确?逻辑结构是否严谨?术语使用是否准确?多圈层耦合是否科学?油气地质学专业性是否到位?”通过七个方面的反思,让大模型生成的结果更具备地质科学性。

4.2 知识图谱分析与可视化

基于知识图谱的专家分析能够直观揭示火山活动与盆地演化、气候环境、深部过程、生物活动、油气系统等关键节点之间的耦合关系。以“火山活动”为中心节点的知识图谱子图显示,火山喷发既通过碎屑物质沉积、凝灰岩层形成和重力流触发等过程改变湖盆沉积动力学格局,也通过热液事件和火山灰输入调节水体营养物质供给和酸化作用,同时影响藻类和浮游植物的生长繁盛及其大规模死亡(图7)。该子图展示了火山活动与深部过程、沉积环境、水体化学过程及生物效应之间的多类联系,这些关系为理解延长组有机质富集提供了可视化线索。

4.3 协同推理后前后的大模型回答对比

在知识图谱的检索增强下,大模型与知识图谱协同推理所得的回答及知识图谱链路见图8。相比未引入知识图谱时,大模型的推理框架主要依赖常见的地质学认识,强调构造、热液与沉积作用的耦合,认为火山活动与有机质富集之间的关系主要体现在热液营养供给、缺氧环境形成、火山灰盖层保护以及构造热演化四个方面(图8a),大模型自主的回答结果中存在编造的论文和不确定性的内容(图8a文中标黄部分)。大模型自主回答结果认为,火山热液流体为湖泊体系提供铁、磷等营养物质,进而提升初级生产力;火山喷发导致的气候波动和水体分层有助于缺氧环境的形成;火山灰作为物理盖层增强有机质保存;构造作用则为沉积盆地演化和有机质热演化提供了动力。

大模型引入知识图谱检索增强后(图8b),协同推理的回答结果具备系统性及真实性。通过知识图谱提供的路径信息,大模型能够在原有认识的基础上,扩展出“营养供给-缺氧保存-沉积改造-气候耦合”的多层次机制框架。具体回答体现在以下四个方面:① 营养供给-初级生产力跃迁方面,火山灰溶解释放的铁、磷元素被视为驱动水体生产力跃升的关键因子,与黄铁矿丰度和有机碳同位素异常的地球化学证据相呼应(图8c-1);②缺氧环境形成-有机质保存方面,火山灰沉积与热液作用不仅导致缺氧环境形成,还通过物理隔离和化学耗氧双重作用提高有机质保存效率(图8c-2);③沉积环境改造-物源调控方面,秦岭物源供给与火山灰输入的协同作用进一步改造了沉积环境,促进了I型有机质的富集(图8c-3);④气候-物源-生物耦合方面:火山喷发释放的气溶胶与卡尼期湿润幕事件联系起来,揭示了古气候变化在沉积序列形成和物源调控中的关键作用(图8c-4)。这一推理不仅涵盖了前人总结的主要机制,而且通过知识图谱链路揭示了卡尼期湿幕变化、秦岭造山事件、藻类生物大爆发事件和火山活动存在的内在联系,形成了跨圈层、跨过程的因果链条。

从不同回答结果的对比可知,知识图谱增强后的回答框架更完整、回答更真实、证据整合能力更强以及推理机制更深。未引入知识图谱时,大模型的推理结果较为发散、缺少相应的证据,且真实性存疑。引入知识图谱检索增强后,大模型把海量文献证据整合成一个整体框架,使得火山活动在岩石圈-表层-生物圈不同圈层、深部过程-气候环境-盆地演化-生物活动的跨圈层、跨过程的因果链条得以清晰呈现。这种推理模式能够揭示出单一文献或单纯模型计算难以全面捕捉的机制联系,体现了知识图谱在复杂地质过程研究中的独特优势,也为理解陆相盆地油气成藏机制提供了新的思路。

4.4 讨论

本研究在构建鄂尔多斯盆地延长组油气富集知识图谱的过程中,系统探索了知识图谱应用于AI for Science的可行性。研究在充分整理延长组油气富集过程相关资料的基础上,设计了覆盖基础地学知识、油气富集过程及多圈层地质事件的知识本体,实现了分散语料向结构化知识的统一转化。结合大语言模型与少样本提示词工程,开展三元组的自动化抽取,并进行语义对齐,提升了跨来源异构地质信息的融合效率与准确性。在此基础上,构建了鄂尔多斯延长组油气富集过程的知识图谱,揭示了火山活动与有机质富集之间的多条有价值的潜在作用路径,为探讨多圈层驱动下的油气富集机制提供了新的思路。这一探索不仅验证了知识图谱在复杂地学过程研究中的应用价值,也展示了AI驱动知识发现模式在油气地质领域的可行性。

尽管当前研究仍存在诸如三元组抽取质量不足、知识融合与语义对齐尚不完善等问题,但这些不足并非个例,而是地学知识图谱构建领域普遍面临的共同困境。由于尚无统一的知识图谱质量评价标准,不同研究成果之间的横向比较和跨团队推广都受到一定限制。然而,随着人工智能技术的快速发展和跨学科合作的不断深化,未来知识图谱将展现出更广阔的应用价值。

知识图谱未来在油气勘探与科学研究中具有广阔前景。一方面,知识图谱将成为理论模型化-模型智能化的重要桥梁,知识图谱在油气地质、地球系统科学以及人工智能技术应用中,能将非结构化的领域知识转换为可计算、可验证的因果链条,通过向量化表示实现与大语言模型的深度融合,在地学问答与决策任务中降低幻觉风险,提升推理的专业性与解释力。结合因果推理框架,还可基于显式事件链条开展多条知识图谱推理等过程的定量化模拟与因果分析。另一方面,多模态知识图谱将成为图-文-表结合的数据中心。在文本知识图谱的基础上,进一步整合测井曲线、地震剖面、薄片图像与地球化学数据,可完成跨模态检索、协同推理等复杂任务,为复杂地质过程研究和油气预测提供更全面的先验信息。

综上所述,知识图谱增强推理方法仍有改进空间,但可为多圈层驱动的油气富集机制研究提供了新视角。随着抽取质量提升、语义对齐完善和多模态融合推进,知识图谱将在理论模型化-模型智能化的多圈层驱动的油气成藏理论研究与智能勘探实践中发挥更加重要的支撑作用。

5 结论

本研究以多圈层驱动的油气形成与富集理论为指导,结合油气地质领域的知识图谱构建需求,基于大语言模型和提示词工程的油气地质知识图谱构建方法,开展知识图谱推理应用,取得了如下结论及认识:

(1)构建了鄂尔多斯盆地延长组油气富集知识图谱,实现了跨文献知识的结构化表达与可视化。该图谱包含约11.37万个实体节点、15.04万条三元组的领域知识图谱,经专家评估准确率约80%,覆盖深部过程、气候环境、盆地演化、生物活动和油气系统等关键要素,为多圈层驱动的油气形成与富集研究提供了知识平台。

(2)基于知识图谱完成跨圈层跨过程的科学问题分析,针对鄂尔多斯延长组火山活动对有机质富集的科学问题,揭示火山活动通过营养供给-初级生产力跃迁、缺氧环境形成-有机质保存、沉积环境改造-物源调控、气候-物源-生物耦合四个机制,促进了延长组有机质高效富集。

(3)完成了AI for Science的探索性应用,表明知识图谱增强的大语言模型可有效整合碎片化地学信息,提升大模型推理的条理性、可追溯性与解释力。本研究为油气领域知识图谱构建和科学发现提供了可行路径,为未来油气大模型提供知识基础,同时为多圈层驱动的油气形成与富集理论提供了理论模型化-模型智能化的重要应用示范。

参考文献

[1]

底青云, 李守定, 付长民, 等. 基于云端大数据的智能导向钻井技术方法[J]. 工程地质学报, 2021, 29(1): 16.

[2]

朱日祥, 金之钧, 底青云, 等. 智能导钻技术体系与相关理论研发进展[J]. 地球物理学报, 2023, 66(1): 1-15.

[3]

朱日祥, 张水昌, 王华建, 等. 多圈层作用驱动北海盆地油气形成与富集[J]. 中国科学: 地球科学, 2024, 54(11): 3433-3457.

[4]

朱日祥, 张旺, 王华建, 等. 多圈层驱动的油气形成与富集理论[J/OL]. 中国科学: 地球科学, 1-18[2025-07-25]. http://kns.cnki.net/kcms/detail/11.5842.P.20250710.1032.002.html.

[5]

SHEN H, ZHAO L, GUO Z, et al. Dynamic link between Neo-Tethyan subduction and atmospheric CO2 changes: insights from seismic tomography reconstruction[J]. Science Bulletin, 2023, 68: 637-644.

[6]

王华建, 张水昌, 王晓梅, 等. 寒武纪海洋碳循环新模型[J]. 中国科学: 地球科学, 2024, 54(6): 1786-1805.

[7]

张水昌, 王华建, 苏劲, 等. 地球系统演化对中国海相超深层油气形成与富集的控制作用[J]. 石油勘探与开发, 2024, 51(4): 759-773.

[8]

赵亮, 朱日祥, 沈昊, 等. 中生代加勒比地区俯冲体系深部过程与浅部效应[J]. 中国科学: 地球科学, 2025, 55(7): 2226-2240.

[9]

PAN S, LUO L, WANG Y, et al. Unifying large language models and knowledge graphs: a roadmap[J]. IEEE Transactions on Knowledge and Data Engineering, 2024, 36(7): 3580-3599.

[10]

DEHAL R S, SHARMA M, RAJABI E. Knowledge Graphs and Their Reciprocal Relationship with Large Language Models[J]. Machine Learning and Knowledge Extraction, 2025, 7(2): 38.

[11]

JI Z, LEE N, FRIESKE R, et al. Survey of hallucination in natural language generation[J]. ACM computing surveys, 2023, 55(12): 1-38.

[12]

MA L, SUN P, LIN Z, et al. Composing knowledge graph embeddings via word embeddings[J]. arXiv preprint arXiv: 1909.03794, 2019.

[13]

周成虎, 王华, 王成善, 等. 大数据时代的地学知识图谱研究[J]. 中国科学: 地球科学, 2021, 51(7): 1070-1079.

[14]

CHEN H, SHEN X, LV Q, et al. Sac-kg: exploiting large language models as skilled automatic constructors for domain knowledge graphs[J]. arXiv preprint arXiv: 2410.02811, 2024.

[15]

邱芹军, 田苗, 吴麒瑞, 等. 基于多源异构数据的地质知识图谱构建与应用[J/OL]. 地学前缘, 1-17[2025-07-23]. https://doi.org/10.13745/j.esf.sf.2024.11.69.

[16]

SUCHANEK F M, KASNECI G, WEIKUM G. Yago: a core of semantic knowledge[C]// Proceedings of the 16th international conference on World Wide Web. 2007: 697-706.

[17]

CARLSON A, BETTERIDGE J, KISIEL B, et al. Toward an architecture for never-ending language learning[C]// Proceedings of the AAAI conference on artificial intelligence. 2010, 24(1): 1306-1313.

[18]

VRANDEČIĆ D, KRÖTZSCH M. WIKIDATA: a free collaborative knowledgebase[J]. Communications of the ACM, 2014, 57(10): 78-85.

[19]

EHRLINGER L, WÖB W. Towards a definition of knowledge graphs[J]. SEMANTiCS (Posters, Demos, SuCCESS), 2016, 48(1-4): 2.

[20]

JI S, PAN S, CAMBRIA E, et al. A survey on knowledge graphs: Representation, acquisition, and applications[J]. IEEE transactions on neural networks and learning systems, 2021, 33(2): 494-514.

[21]

HOFFART J, SUCHANEK F M, BERBERICH K, et al. YAGO2: a spatially and temporally enhanced knowledge base from Wikipedia[J]. Artificial intelligence, 2013, 194: 28-61.

[22]

李涓子, 侯磊. 知识图谱研究综述[J]. 山西大学学报 (自然科学版), 2017, 40(3): 454-459.

[23]

CHEN L, TONG P, JIN Z, et al. Plan-on-graph: self-correcting adaptive planning of large language model on knowledge graphs[J]. Advances in Neural Information Processing Systems, 2024, 37: 37665-37691.

[24]

LIANG K, MENG L, LIU M, et al. A survey of knowledge graph reasoning on graph types: Static, dynamic, and multi-modal[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024, 46(12): 9456-9478.

[25]

钱峰, 成建国, 夏润亮, 等. 水利大模型的建设思路、构建框架与应用场景初探[J]. 中国水利, 2024, (9): 9-19.

[26]

ZHANG D, MA G, QU T, et al. A knowledge graph-enhanced large language model for question answering of hydraulic structure safety management[J]. Advanced Engineering Informatics, 2025, 66: 103468.

[27]

BAI X, HE S, LI Y, et al. Construction of a knowledge graph for framework material enabled by large language models and its application[J]. npj Computational Materials, 2025, 11(1): 51.

[28]

杨华, 李士祥, 刘显阳. 鄂尔多斯盆地致密油、页岩油特征及资源潜力[J]. 石油学报, 2013, 34(1): 1-11.

[29]

付金华, 王龙, 陈修, 等. 鄂尔多斯盆地长7页岩油勘探开发新进展及前景展望[J]. 中国石油勘探, 2023, 28(5): 1-14.

[30]

国家能源局. 2024年中国油气勘探开发十大标志性成果[J]. 世界石油工业, 2025, 32(1): 119.

[31]

刘池洋, 王建强, 张东东, 等. 鄂尔多斯盆地油气资源丰富的成因与赋存-成藏特点[J]. 石油与天然气地质, 2021, 42(5): 1011-1029.

[32]

贾承造, 庞雄奇, 郭秋麟, 等. 基于成因法评价油气资源: 全油气系统理论和新一代盆地模拟技术[J]. 石油学报, 2023, 44(9): 1399-1416.

[33]

李相博, 朱如凯, 惠潇, 等. 晚三叠世卡尼期梅雨事件(CPE)在陆相盆地中的沉积学响应--以鄂尔多斯盆地延长组为例[J]. 沉积学报, 2023, 41(2): 511-526.

[34]

宋岩, 贾承造, 姜林, 等. 全油气系统内涵与研究思路[J]. 石油勘探与开发, 2024, 51(6): 1199-1210+1226.

[35]

CUI H, ZHU S, GAO Y, et al. Hydrothermal activity near the Permian-Triassic transition in the south-western Ordos Basin, China: evidence from carbonate cementation in Upper Permian sandstones[J]. Sedimentology, 2025, 72(1): 227-257

[36]

邓秀芹, 楚美娟, 王龙, 等. 中晚三叠世鄂尔多斯盆地两期沉降及其形成机制[J]. 石油勘探与开发, 2024, 51(3): 501-512.

[37]

刘广林, 邓静, 王艳梅, 等. 鄂尔多斯盆地中生界延长组凝灰岩标志层识别、分布及意义[J/OL]. 天然气地球科学, 1-15[2025-07-15]. http://kns.cnki.net/kcms/detail/62.1177.TE.20250623.1510.003.html.

[38]

贾承造, 魏国齐, 李本亮. 中国中西部小型克拉通盆地群的叠合复合性质及其含油气系统[J]. 高校地质学报, 2005, (4): 479-492.

[39]

琚宜文, 王巍, 任战利, 等. 鄂尔多斯盆地的多阶段演化: 盆山耦合系统和能源资源[J]. 中国科学: 地球科学, 2025, 55(8): 2537-2582.

[40]

付金华, 董国栋, 周新平, 等. 鄂尔多斯盆地油气地质研究进展与勘探技术[J]. 中国石油勘探, 2021, 26(3): 19-40.

[41]

LI Q, WU S H, XIA D L, You X L, Zhang H M, Major and trace element geochemistry of the lacustrine organic-rich shales from the Upper Triassic Chang 7 Member in the southwestern Ordos Basin, China: implications for paleoenvironment and organic matter accumulation[J]. Marine and Petroleum Geology, 2020, 111: 852-867.

[42]

BOZETTI G, LI X, YANG Z, et al. New insights into deep-lacustrine architectural elements: examples from the upper Triassic Yanchang Formation, Ordos basin[J]. Journal of Asian Earth Sciences, 2023, 241, 105431.

[43]

宁婷, 柳蓉, 王旭, 等. 鄂尔多斯盆地南缘中-晚三叠世延长组古环境重建与有机质富集机制[J/OL]. 沉积学报, 1-24[2025-09-18]. https://doi.org/10.14027/j.issn.1000-0550.2025.019.

[44]

刘池洋, 赵红格, 桂小军, 等. 鄂尔多斯盆地演化-改造的时空坐标及其成藏(矿)响应[J]. 地质学报, 2006, (5): 617-638.

[45]

朱日祥. 地球深部过程对岩石圈演化的影响-来自地磁学的证据[C]// 中国地球物理学会.中国地球物理第二十一届年会论文集.中国科学院地质与地球物理研究所, 2005: 57-58.

[46]

王毅, 杨伟利, 张刘平. 鄂尔多斯盆地油气成藏规律与主控因素[M]. 北京: 石油工业出版社, 2016.

[47]

杨华, 田景春, 王峰. 鄂尔多斯盆地三叠纪延长组沉积期湖盆边界与底形及事件沉积研究[M]. 北京: 地质出版社, 2009.

[48]

邹才能, 陶士振, 侯连华. 非常规油气地质学[M]. 北京: 地质出版社, 2014.

[49]

邱振, 邹才能. 非常规油气资源富集与重大地质事件[M]. 北京: 科学出版社, 2024.

[50]

ZAVERI A, RULA A, MAURINO A, et al. Quality assessment for Linked Data: a survey[J]. Semantic Web, 2016, 7(1): 63-93.

[51]

PAULHEIM H. Knowledge graph refinement: A survey of approaches and evaluation methods[J]. Semantic Web, 2017, 8(3): 489-508.

[52]

NICKLES M, ROVETTO R. (2020). Approaches to ontology and knowledge graph evaluation. Applied Ontology, 15(3): 255-291.

[53]

王亮, 张玉新, 张楠, 等. 知识图谱构建与质量评估研究进展[J]. 地球科学进展, 2022, 37(7): 742-754.

[54]

陈朝兵, 陈新晶, 黄锦袖, 等. 造山带隆升与非均衡沉降盆地的响应关系[J]. 石油实验地质. 2019, 41(5): 674-690.

[55]

LIU Q, LI P, JIANG L, et al. Distinctive volcanic ash-rich lacustrine shale deposition related to chemical weathering intensity during the Late Triassic: evidence from lithium contents and isotopes[J]. Science Advances. 2024, 10, 6594.

基金资助

中国科学院重大科技任务专项

AI Summary AI Mindmap
PDF (10120KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/

〈 〉