低渗透砂岩储集层作为非常规油气资源开发及其他地下能源应用的重要目标,广泛分布于陆相盆地、深水浊积体系以及深层或超深层地层(Zou
et al.,
2018;Feng
et al.,
2019;吕奇奇等,
2023;王鑫等,
2023)。这类储集层通常具有孔喉类型多样、连通性较差以及非均质性强等特征,普遍发育微米—纳米级孔喉半径(Lai
et al.,
2018a,
2018b;Xu
et al.,
2025)。这种复杂的孔隙结构不仅显著影响油气的储集与渗流能力,也为储集层的精细评价与表征带来了极大挑战(Pittman,
1992;Lai
et al.,
2018b)。
目前,主流的岩石孔隙结构表征方法主要依赖实验分析和测井数据。实验手段包括铸体薄片、扫描电镜(SEM)、高压压汞(HPMI)、恒速压汞(MICP)、核磁共振(NMR)和CT扫描等(Lai
et al.,
2018b,
2022;Xiao
et al.,
2018)。核磁共振测井能够通过测量氢核横向弛豫时间(
T2)分布,直接量化孔隙度、孔喉分布及流体分布等信息(张宪国等,
2019;赖锦等,
2023;Lai
et al.,
2024b)。而常规测井则多借助机器学习技术,主要包括2大类: (1)通过非监督机器学习明确测井数据的离散型电性聚类,后基于实验获取孔隙结构参数为其赋予岩石物理意义(Maldar
et al.,
2022;Iraji
et al.,
2023;Yang
et al.,
2025);(2)利用监督型机器学习方法开展水力流动指数(FZI)、储集层质量指数(RQI)等参数的预测(Zhang
et al.,
2021;Cao
et al.,
2025;Wang and Hou,
2025)。然而,上述方法均极度依赖获取的实验样本数量,当样本较少时难以保障统计及建模过程的可靠性。
近年来,小样本机器学习已在计算机视觉、自然语言处理、医学等学科领域得到了广泛应用(He
et al.,
2022;Ma
et al.,
2024;Li
et al.,
2025a)。与传统依赖大数据驱动的机器学习方法不同,小样本学习关注如何在数据稀缺或获取成本高昂的情况下,依然实现较高的模型性能。其核心思想是利用数据增强或先验知识等策略,从有限的训练样本中挖掘尽可能多的信息(赵凯琳等,
2021)。例如,Moreno-Barea等(
2020)基于深度生成模型显著提升了小样本数据集上的分类精度。Hollmann等(
2025)提出的TabPFN模型,则通过Transformer架构在表格数据上的先验训练,实现了小样本条件下的高效预测。相比之下,小样本学习在油气储集层评价等领域的应用尚处于起步阶段。因此,将小样本学习方法引入低渗透砂岩储集层孔隙结构表征,有望减少对大规模取心实验的依赖,为非常规储集层高效评价提供思路。
综上,研究通过高压压汞、测井数据、主成分分析等方法手段,系统对比TabPFN和其他7种常见机器学习方法在小样本条件下对孔隙结构表征的适用性。并结合特征重要性排列及Mean|SHAP|堆叠图,明确特征变量在不同孔隙结构区间的贡献权重,以期为低渗透砂岩储集层评价提供数据驱动决策。
1 数据与方法
1.1 数据来源与预处理
研究所用数据收集自鄂尔多斯盆地中西部姬塬地区三叠系延长组砂岩储集层。具体包括作为输入变量的地质分层、沉积相和7种测井数据,以及用于孔隙结构分析的112组高压压汞实验数据。所选取的测井数据涵盖了声波测井、中子测井、密度测井、井径测井、伽马测井、自然电位测井和深电阻率测井。上述资料均由中国石油天然气股份有限公司长庆油田分公司第五采油厂提供。此外,沉积相信息参考了朱石磊(
2019)针对研究区沉积体系开展的研究成果,包括河流相、三角洲平原亚相、三角洲前缘亚相以及深湖相。
考虑到深电阻率、渗透率、排驱压力及中值压力等参数通常呈现对数分布的特性,研究对相关参数进行了以10为底的对数(lg)转换,以减少数据偏态对建模及统计分析的影响。在此基础上,对输入特征进行了标准化处理,以消除量纲差异和数值范围对模型训练的影响(唐佰强等,
2025)。模型训练与评估执行了按井分组的五折交叉验证,以避免同井样本造成的信息泄露。同时,为客观检验模型的泛化能力,选取了1口盲井作为独立测试集。
1.2 压汞参数降维
高压压汞实验能够提供丰富的孔隙结构参数信息,但单一参数难以全面、准确地表征储集层孔隙结构的复杂性。为此,研究采用主成分分析(PCA),对多维度的孔隙结构指标进行降维处理。该方法通过线性变换,将原始多维数据投影到相互正交的主成分坐标系中(刘爱疆等,
2013)。以第一主成分(PC1)最大程度地保留原始数据的方差信息,从而有效提取具有代表性的孔隙结构特征。为避免数据泄露,盲井测试集未参与PCA拟合,仅使用相同变换矩阵进行投影。
1.3 模型构建与性能评估
研究共选用了8种机器学习方法,包括TabPFN、深度神经网络(DNN)、K最近邻(KNN)、轻量梯度提升(LightGBM)、多元线性回归(MR)、随机森林(RF)、支持向量机(SVM)和极端梯度提升(XGBoost)(Coker,
1995;Breiman,
2001;Noble,
2006;Lecun
et al.,
2015;Chen and Guestrin,
2016;Ke
et al.,
2017;Taunk
et al.,
2019;Hollmann
et al.,
2025)。其中,TabPFN是一种基于Transformer架构的机器学习模型,专为小样本表格数据预测任务设计。TabPFN通过在大量合成数据上预训练,避免了传统机器学习方法繁琐的参数调优过程,在小样本环境下表现出更优的预测精度与泛化能力。考虑到篇幅限制,有关机器学习方法具体原理和架构可参考上述相关文献。
为了确保性能对比的公平性,所有模型均采用了i7-13700KF的全部核心训练。除TabPFN和MR外,其余模型采用Optuna框架进行了50次实验的超参数优化,以确定最佳的模型参数(Mao
et al.,
2025)。为全面衡量模型的预测精度、稳定性及拟合效果,采用了决定系数(
R2)与均方根误差(RMSE)作为评价指标。
1.4 可解释性分析
机器学习模型通常被视为难以直接解释的“黑箱”,其决策机制和特征贡献程度不易直观揭示(闵超等,
2024)。为深入理解模型内部的决策逻辑,研究采用了基于合作博弈论的SHapley加性解释(SHAP)方法。SHAP通过计算每个特征在所有可能的特征组合中所产生的平均边际贡献,量化回归任务中各输入变量的重要性(Lundberg and Lee,
2017;周锦涛等,
2025)。此外,进一步定义了特征的相对贡献度(|SHAP|
RC),即单个特征的|SHAP|值占所有特征|SHAP|值之和的百分比,以更清晰且量化的方式描述特征对模型预测结果的影响程度(Zhang
et al.,
2025)。其中,绝对贡献反映各特征对预测结果的总体影响强度,相对贡献则揭示各特征在不同孔隙结构区间内的重要性占比变化。
2 岩石物理特征
2.1 孔隙结构
姬塬地区延长组砂岩储集层孔隙度主要分布范围在9.94%~14.16%之间,均值为11.79%。渗透率集中于0.15×10
-3~0.92×10
-3 μm
2之间,均值为0.39×10
-3 μm
2。孔隙度与渗透率间呈显著正相关性(
R2=0.722),表现为中孔、低渗—特低渗储集层特征(
图 1-a)。统计检验结果显示,不同沉积相及不同地质层位下孔隙度(
Por)和渗透率(
Perm)的
P值均远小于0.05,指示具有显著差异。
高压压汞实验结果显示,研究区平均孔喉半径(
DM)介于8.88~15.17 μm之间,均值为11.90 μm。最大汞饱和度(
SHg)介于19.80%~99.19%之间,均值为80.12%。排驱压力(
Pd)主要分布在0.38~1.66 MPa之间,均值为0.88 MPa。毛细管中值压力(
P50)集中在2.81~9.55 MPa,平均为5.23 MPa。另有少量样品由于
SHg未达50%,导致
P50为空值。整体来看,姬塬地区延长组毛细管压力曲线呈现平缓的下凹型特征(
图 1-b),以细—微孔喉为主,具有排驱压力较低、中值孔喉半径较小、孔喉结构复杂且分选性较差等特征。
2.2 测井响应
相关系数聚类热图表明(
图 2),不同测井曲线对储集层孔隙结构的响应敏感程度存在明显差异。其中,声波测井(AC)与中子测井(CNL)在聚类中高度相似,与
Por和
Perm呈显著正相关,同时与
P50、
DM和
Pd表现为中等强度的负相关关系,表明二者能够较好地反映储集层孔隙空间的发育程度。密度测井(DEN)对储集层孔隙结构表现出最高的敏感性,其与
Por和
Perm均呈现显著的负相关性,表明储集层密度降低通常对应孔喉半径较大、连通性较好的储集层结构特征,即更优质的储集层品质。深电阻率测井(RILD)与自然电位测井(SP)整体表现出与DEN类似但稍弱的趋势,能够间接指示储集层孔隙结构的变化情况。伽马测井(GR)整体上对孔隙结构参数的整体响应较弱,仅与
Por和
Perm呈现微弱的相关性,反映出泥质含量对储集层孔隙结构的控制作用。而井径测井(CAL)则仅对
SHg与分选系数(
So)呈微弱响应。总体来看,通过测井数据能较有效地揭示储集层孔隙结构特征,尤其是三孔隙测井(DEN、AC和CNL)对储集层孔隙结构的表征具有显著优势。
2.3 主成分分析
主成分分析结果表明(
图 3),第一主成分(PC1)可解释65.00%的总方差,高度聚合了
P50、
Perm、
Por和
DM等关键孔隙结构参数。同时,储集层质量指数(RQI)沿PC1呈明显的正向递增趋势,指示PC1能够良好的表征储集层孔隙结构。第二主成分(PC2)解释了12.10%的方差,主要反映
SHg与
So所代表的孔喉分布及连通性差异。值得注意的是,
SHg与
So在PC1上的载荷(分别为0.57和0.48)仍高于其在PC2上的载荷(分别为0.22和0.17),说明即使针对饱和度及分选性特征,PC1的解释能力依旧更为全面。因此,PC1更完整地体现了不同压汞参数在孔喉尺寸、孔隙连通性及孔隙形态方面的复合作用,被确定为后续机器学习建模过程的输出变量。
3 多种机器学习模型性能比较
3.1 性能指标
从模型性能指标来看,基于Transformer架构的TabPFN模型表现最为突出(验证集
R2为0.81,RMSE为0.88;盲井测试集
R2为0.87,RMSE为0.86),其预测散点最为紧凑且清晰地沿对角线分布(
图 4-a),体现了该方法出色的预测稳健性和优异的泛化能力。3种决策树集成模型(RF、XGBoost和LightGBM)的预测散点较为紧凑(
图 4-b,4-c,4-d),验证集的
R2为0.77~0.79,RMSE为0.95~0.99。DNN在验证集上的表现虽稍逊于决策树模型,但在盲井测试集中预测效果显著提高,
R2为0.82,RMSE为0.99(
图 4-e)。相比之下,SVM、MR和KNN 3种模型则多表现为欠拟合,预测散点较为离散且偏离对角线(
图 4-f,4-g,4-h)。其中KNN的预测散点甚至呈现明显的模糊发散特征,在验证集的
R2低至0.42。
3.2 泰勒图评价
泰勒图通过将观测数据设为参考基准点,不同模型的预测结果以散点形式显示,可以直观展示模型输出与观测数据之间的标准差、相关系数及均方根误差(Lai
et al.,
2024a)。结果显示(
图 5),TabPFN和XGBoost在验证集和测试集始终落在RMSE=1的粉色内圈中,相关系数维持在0.9~0.95,与观测数据标准差最为接近,表现出最低的误差和最强泛化。RF、LightGBM和DNN投影则始终保持在RMSE=1附近,相关系数略有降低,属于第二梯队。而SVM、MR和KNN则基本偏离RMSE=1,相关系数处于0.7~0.85之间,标准差则远低于观测值,属于第三梯队。
3.3 寻优及训练时长
除预测精度外,模型构建过程中的训练与超参数寻优时间也是评估模型综合性能的重要指标之一。结果表明(
表 1),决策树集成模型(RF、XGBoost和LightGBM)及DNN模型相对复杂,涉及超参数较多,整体寻优耗时较长,其中XGBoost和RF的寻优时间分别达到19.57 s与18.37 s。相比之下,SVM和KNN涉及超参数较少,训练及寻优时间明显更短。而TabPFN模型尽管单次训练时间略长(0.11 s),但凭借其无需调参的特性,整体运行耗时最短。
3.4 预测曲线
图 6中展示了3种表现较优模型(TabPFN、RF、XGBoost)在盲井测试集中的预测曲线。整体来看,3种模型曲线规律及形态相似,能够较好地反映出PC1的波动。其中,TabPFN曲线最为平滑且与实测数据高度吻合,能够准确捕捉PC1的峰值变化。RF与TabPFN的总体相似,但容易低估PC1,高值连续条带被多次切断,表现出相对强的非均质性。而XGBoost预测曲线则表现出密集窄峰特征,表现出决策树模型的“过分割”倾向,易受测井数据噪声干扰。
4 讨论
4.1 主成分对孔隙刻画能力
这项研究中,通过主成分分析(PCA)对多维孔隙结构参数进行降维,将提取的PC1作为储集层孔隙结构的综合表征指标。这简化了输出指标且方便模型学习,但仍有35.00%的信息未被有效表征。为了验证PC1在表征孔隙结构的合理性,研究基于TabPFN模型对姬塬地区P油藏开展了孔隙结构解释,并与钻井试油结果进行对比验证。结果表明(
图 7-a),PC1与钻井初期产能呈良好的正相关性。由于低渗透砂岩储集层存在较强的垂向与平面非均质性,储集层孔隙结构通常直接影响油气的运聚过程(Lai
et al.,
2018b;Zhao
et al.,
2024)。储集层孔隙结构较差或趋于致密时,毛细管压力较高,油气难以有效充注,以束缚水为主(Gao and Li,
2015;Li
et al.,
2025b)。而孔隙结构较优时,更有利于烃类的充注与储集。
进一步,由于砂岩储集层孔隙结构通常受临近泥岩热演化影响。通过孔隙结构与临近岩性之间的联系用以评价PC1的合理性(
图 7-b,7-c)。结果表明,砂岩厚度增加对应储集层孔隙结构的改善,而泥岩较厚时相邻砂体则趋于致密。这一现象与已有研究结果基本一致(Lu
et al.,
2024),泥岩在热演化过程中释放的成岩流体或促进了邻近薄层砂岩的胶结作用; 而厚层砂岩中较好的孔隙连通性可能更有利于酸性溶蚀流体的迁移。
此外,通过PC1和不同孔隙结构参数的散点矩阵分析(
图 8)。结果表明,PC1与孔隙结构之间整体呈现高度的线性相关性,绝大部分样本落在95%置信椭圆内。但对于个别致密储集层样本,PC1的表征能力较差。这部分样本表现为
SHg<50%,
P50为空值的特殊孔隙结构,这将一定程度上降低PC1能够解释的方差占比。综合而言,通过实际生产数据验证、机理分析以及统计分析,研究认为基于主成分分析提取的PC1能够有效地捕捉并反映低渗透砂岩储集层孔隙结构参数的主要变化趋势。
4.2 特征变量对预测结果的影响
研究基于SHAP方法对TabPFN模型开展了可解释性分析,以量化不同特征变量对储集层孔隙结构的贡献机制。特征重要性分析结果表明(
图 9),对模型预测贡献最大的前5个变量依次为DEN、沉积相、AC、地层和RILD。其中,DEN、AC和RILD能够反映岩石的孔隙体积变化和孔喉连通性,具有明确的物理解释基础。而沉积相和地层作为离散型地质变量也展现出显著的模型贡献。具体而言,地质分层通常蕴含埋深、成岩背景等信息,沉积相则反映了沉积环境、岩性组合等差异。
对于研究区而言(
图 1-a),延长组二段埋藏较浅,主要发育河流相—三角洲平原亚相,经历了后期抬升和淋滤增孔作用,孔隙结构整体较好(尹泽等,
2019;邓秀芹等,
2020)。而长4+5段和长6段则发育三角洲前缘亚相—深湖相细粒沉积环境,破坏性成岩作用普遍,储集层趋于致密化(Ren
et al.,
2019;Yang
et al.,
2020)。离散型地质变量能够有效补充常规测井数据不蕴含的地质信息。
进一步,研究通过Mean|SHAP|堆叠图展示了特征变量在不同孔隙结构区间的动态贡献(
图 10)。整体来看,不同孔隙结构对特征变量的依赖呈现出非线性动态变化。当孔隙结构较差时(PC1<-2),模型总体敏感度达到峰值,其中沉积相的影响最为突出。进入中等孔隙结构区间时(-2<PC1<2),总体SHAP值显著衰减,测井数据的贡献权重回升,沉积相则维持背景贡献。而孔隙结构较好时(PC1>2),沉积相贡献权重再次上升。这表明在极端孔隙结构条件下,模型尤其依赖于离散型变量来进行决策。这也提示在小样本环境下基于测井数据进行储集层定量评价时,合理引入地质分层、沉积环境或成岩背景等地质约束,将有助于提高模型性能。
4.3 油气地质意义
低渗透砂岩储集层通常形成于低能沉积环境,具有高泥质含量和原生孔隙有限等特征(Lai
et al.,
2018b)。而在成岩过程中,机械压实作用进一步压缩并破坏原生孔隙,硅质和碳酸盐等胶结物不断沉淀堵塞孔喉(Yang
et al.,
2020;Luo
et al.,
2024)。这些因素使得测井数据与孔隙结构之间表现出复杂的非线性关系(Zhao
et al.,
2024)。SVM、MR和KNN等简单机器学习模型在应对强非线性问题时能力有限,容易出现欠拟合现象。而TabPFN具备更强的非线性建模能力,能更好地适应低渗透砂岩复杂多变的孔隙结构特征。此外,得益于“开箱即用”的特性,TabPFN展现出了显著的计算效率。而随着数据集规模的扩大,这种效率优势将更加突出。例如,决策树集成模型在树数量增加或DNN网络结构复杂化时,其训练和调参耗时会显著提升,而TabPFN则能有效规避这些问题。
相较常见机器学习方法,TabPFN擅于处理样本量≤10000、特征数≤500的中小型表格数据集(Hollmann
et al.,
2025),这对于海上少井或老井资料稀疏等生产场景极为契合。无论是在量化孔隙度、渗透率或孔隙结构等回归任务,还是对岩相、沉积相或储集层级别等离散标签分类,亦或是对产量、含水率等时序数据的动态预测,TabPFN均能够提供高效的数据驱动决策。此外,TabPFN与SHAP可解释性框架的兼容,能够帮助理解模型的决策机制,对于烃源岩评价等需量化地球化学指标的研究具有重要意义。综合而言,TabPFN能够在不依赖大规模取心实验的情况下,较好地兼顾预测精度、泛化能力与计算效率,展现出更加突出的适用优势。
5 结论
1)通过对高压压汞揭示的孔隙结构参数进行主成分分析降维,所提取的第一主成分(PC1)能够解释65.00%的总方差,高度聚合了P50、Perm、Por和DM等关键孔隙结构参数。通过生产数据、机理分析以及统计分析认为,PC1能够作为表征储集层孔隙结构的有效目标变量。
2)在小样本环境下,TabPFN相较其他机器学习方法表现较为突出。验证集和盲井测试集中,R2分别为0.81和0.87,RMSE分别为0.88和0.86。预测曲线平滑且能够准确捕捉PC1的峰值变化。得益于其无需超参数寻优的特性,整体训练耗时仅0.11 s,展现出卓越的泛化能力和计算效率。
3)SHAP可解释分析中,沉积相与地质分层对模型的贡献分别位列第2位和第4位。二者的相对贡献权重随PC1的变化呈现非线性动态波动,在极端孔隙结构条件下,模型尤其依赖于离散型变量来进行决策。表明离散型地质变量可有效补充测井数据中不具备的地质信息,进一步提升模型预测性能。
*中国石油大学(北京)科研启动基金(2462023BJR011)
中国石油长庆油田分公司科研项目(2023DJ0911)