心力衰竭(heart failure, HF)作为多种心脏疾病的终末阶段,具有高病死率、高致残率及高照护负担的特点。《国家心力衰竭指南2023》指出,心衰易损期是心衰综合管理的关键环节,识别该阶段有效的干预靶点对优化病程管理至关重要
[1]。尽管院内治疗可改善心衰易损期患者的短期结局,但其对远期预后的影响有限,院外管理是决定患者长期预后的关键因素
[2]。血压作为院外管理的重要可干预指标,其控制目标在不同指南中存在差异。美国心脏病学会/美国心脏协会(American College of Cardiology/American Heart Association,ACC/AHA)2025年指南建议将血压控制在130/80 mmHg,欧洲心脏病学会(European Society of Cardiology,ESC)2024年指南则建议根据患者风险分层实施个体化血压目标,而我国指南仍主要推荐140/90 mmHg的目标
[3]。不同病程阶段、不同年龄段的患者对血压的获益阈值并不相同,导致心衰易损期患者的血压控制目标及其截断值迄今尚无定论。
基于临床经验的血压截断虽具有一定可解释性,但适用于总人群的截断方法往往无法直接适用特定患者群体。限制性立方样条曲线(restricted cubic splines, RCS)作为一种灵活的回归建模工具,能够有效捕捉连续暴露与结局之间的非线性关系,近年来已在心血管领域广泛应用,如分析老年心衰患者药物依从性与长期结局的关系,以及揭示血压与心衰风险的剂量-反应关系等
[4,5]。然而,上述方法多停留在关联分析层面,在血压截断的因果推断维度仍存在明显的证据缺口。倾向性得分(propensity score, PS)可用于分析不同血压截断下的因果效应,但当存在未测量混杂因素时,因果效应的估计可能产生偏倚
[6]。逆概率加权(inverse probability weighting, IPW)在纵向随访数据分析中能够有效评估随时间变化的暴露因素对结局的因果效应,但其稳定性仍受极端权重的制约
[7]。双稳健交叉拟合超学习器在偏差、方差及置信区间覆盖率方面均显著优于传统估计器
[8]。
基于此,本研究采用双稳健交叉拟合超学习器因果推断模型,识别心衰易损期患者的因果预后靶点,对因果干预靶点进行因果截断,并在此基础上拟合半参数梯度下降的因果预后模型与在线应用系统,以辅助科研成果落地,便于临床使用。
1 资料与方法
1.1 数据来源
本研究采用的数据来源于一项单中心心力衰竭患者电子健康记录与随访结局公共数据库
[9]。该数据库共纳入2 008例于2016年12月至2019年6月期间在四川省某医院住院的心力衰竭患者,收集了患者人口统计学指标、临床特征、超声心动图检查结果、实验室检测指标等,并于出院后28 d、3个月和6个月随访心衰易损期(院外3~6月内)
[2]主要心血管不良事件(major adverse cardiovascular event, MACE)。
1.2 数据预处理与统计描述
删除缺失大于30%的变量及临床检验指标缺失90%的患者。对于部分临床重要的变量,缺失比例略高于30%,因其临床重要性也进行保留(心脏彩超)。最终纳入2 005例患者信息与99个变量。采用缺失森林进行数据填补。
分类资料采用频数和百分比进行描述,计量资料采用中位数和四分位数进行描述。分类资料采用χ²检验或Fisher确切概率法进行组间比较。非正态分布的计量资料采用Wilcoxon秩和检验进行组间比较。P≤0.05为差异有统计学意义。
1.3 因果图构建
本研究采用最大最小爬山算法(maximun-minimum hill-climbing,MMHC)绘制因果图,结合临床经验确定最终的因果结构图,识别混杂因素。
1.4 稀疏线性双稳健估计器(SparseLinearDRLearner,以下简称SDR*)进行靶点截断
首先,定义待截断干预靶点、混杂变量、协变量及结局变量;第二,采用R语言“ggrcs”程序包绘制RCS,并根据干预靶点数据分布情况,设置截断范围及步长;第三,构建SDR*模型,对各截断点进行因果效应估计;第四,通过准确度等评估SDR*模型效果;第五,输出最佳拟合模型因果效应估计值。
1.5 因果效应估计模型
对截断后的变量,采用SDR*、目标最大似然估计(targeted maximum likelihood estimation,TMLE)、X-Learner等模型估计平均因果效应(average causal effects,ACE)。
1.6 敏感性分析
采用添加随机共同原因(random common cause,RCC)、安慰剂处理反驳(placebo treatment refuter,PTR)、添加未观察到的共同原因(unobserved common cause,UCC)、数据子集反驳(data subset refuter,DSR)进行敏感性分析。
1.7 超级学习器梯度下降因果预后模型
在前期因果干预靶点分析的基础上纳入临床重要变量,构建半参数因果预后模型。具体来说,以Logistic模型为基础结构,将前期因果干预靶点分析得到因果效应值作为变量系数(如βACE-SBP等);结合临床专家意见纳入临床重要变量,并通过梯度下降方式逐步拟合临床重要变量参数系数(如变量CCI.score系数βCCI.score),以确定最佳拟合超级学习器梯度下降模型。计算公式如下:
1/
2 结果
2.1 研究对象基本情况
本研究共纳入2 005例心衰患者,其中538例(26.83%)于心衰易损期出现了MACE事件,出现MACE事件的患者年龄更大、NYHA分级更高、Killip分级更高、CCI.score更高、射血分数更低,差异具有统计学意义(均
P0.05,见
表1)。
2.2 因果结构学习
相关性分析结果显示,年龄、SBP、DBP、NYHA、CCI.score、平均动脉压、射血分数、Killip分级、心衰类型与心衰易损期患者预后显著相关;SBP与DBP高度相关(
r=0.65,
P0.01);SBP(
r=0.89,
P0.01)、DBP(
r=0.92,
P0.01)、PP(
r=0.46,
P0.01)与平均动脉压高度相关(见
图1)。结合相关性分析结果,采用MMHC算法绘制有向无环图以进行因果结构学习,结果显示,年龄、NYHA、CCI.score、射血分数、平均动脉压可能为SBP、DBP、PP与心衰易损期结局通路中的重要协变量(见
图2)。
2.3 干预靶点截断
进行双稳健因果效应估计前需要对因果干预靶点进行截断,RCS作为经典的变量截断方法,将SBP按照130 mmHg截断为二分类变量,截断点具有统计学意义(
Poverall0.001;
Pnonlinear=0.031);将DBP以70.79 mmHg截断为二分类变量,截断点具有统计学意义(
Poverall=0.002;
Pnonlinear=0.253);将PP以52.28 mmHg截断为二分类变量,截断点具有统计学意义(
Poverall0.001;
Pnonlinear=0.247,见
图3)。
如
图3所示,患者SBP大多分布在90~190 mmHg,DBP为70~100 mmHg,PP为20~100 mmHg。为避免极端分布导致基于SDR*的双稳健交叉拟合因果截断模型失效,在靶点截断时,我们将截断区间分别限定为SBP(90~190 mmHg)、DBP(70~100 mmHg)、PP(20~100 mmHg)进行截断,结合因果截断曲线与临床可行性,将SBP按照139 mmHg进行截断;DBP未能识别出最佳控制目标(即因果截断点);PP按照50 mmHg进行截断,进行后续因果效应值的估计。
2.4 因果效应估计
SBP因果效应分析结果详见
表2。其中,临床截断(SBP120 mmHg)后各因果效应估计模型结果不统一,其中TMLE模型估计该待干预靶点因果效应ACE为10.582%(95% CI:5.810%~13.530%),有统计学意义;X-Learner模型估计ACE为11.145%(95% CI:7.162%~15.128%),有统计学意义;SDR*模型估计ACE为3.578%(95% CI:-1.347%~8.503%),尚不认为有统计学意义。
RCS进行截断(SBP130 mmHg)因果效应估计模型结果不统一,其中TMLE模型估计该待干预靶点因果效应ACE为10.063%(95% CI:5.780%~14.347%),有统计学意义;X-Learner模型估计ACE为10.772%(95% CI:7.035%~14.509%),有统计学意义;SDR*模型估计ACE为3.874%(95% CI:-0.017%~0.094%),尚不认为有统计学意义。
因果截断(SBP139 mmHg)后,各模型ACE估计值均具有统计学意义,其中TMLE模型估计该待干预靶点因果效应ACE为8.839%(95% CI:4.240%~13.439%),X-Learner模型估计ACE为9.421%(95% CI:5.644%~13.199%),SDR*模型估计的ACE为4.457%(95% CI:1.260%~7.655%)。
DBP因果效应分析结果显示,临床截断、RCS截断、因果截断后的DBP与心衰易损期MACE事件均无因果效应(见
表3)。其中,临床截断(DBP80 mmHg)时,TMLE模型估计ACE为3.881%(95% CI:-0.321%~8.082%),X-Learner模型估计ACE为3.917%(95% CI:-0.045%~7.880%),SDR*模型估计ACE为0.207%(95% CI:-2.532%~2.947%)。RCS截断(DBP70.79 mmHg)时,TMLE模型估计ACE为5.706%(95% CI:1.633%~9.780%);X-Learner模型估计ACE为5.851%(95% CI:1.965%~9.737%),虽有统计学意义但模型敏感性分析结果不稳定;SDR*模型估计ACE为0.252%(95% CI:-2.445%~2.948%)。因果截断未找到最佳分割点,故未进行因果截断下的效应估计。
PP因果效应分析结果显示,PP与心衰易损期MACE事件具有较稳定的因果关系(见
表4)。其中,PP40 mmHg时,TMLE模型估计ACE为10.951%(95% CI:5.525%~16.376%),X-Learner模型估计ACE为10.490%(95% CI:6.148%~14.833%),均具有统计学意义。而SDR*模型估计ACE为1.325%(95% CI:-1.433%~4.084%),尚不认为PP40 mmHg与结局存在因果效应。进一步分析各模型敏感性,结果发现,相较于TMLE、X-Learn模型,SDR*模型的RCC、UCC、DSR更贴近ACE,PTR更趋近于0,说明SDR*模型的效应估计值具有更高的稳定性。
RCS截断(PP52.28 mmHg)时,各模型ACE估计值均具有统计学意义。其中,TMLE模型估计ACE为10.814%(95% CI:6.447%~11.820%),X-Learner模型估计ACE为10.731%(95% CI:6.987%~14.475%),SDR*模型估计ACE为3.052%(95% CI:0.325%~5.779%)。
因果截断(PP50 mmHg)后,各模型ACE估计值均具有统计学意义。其中,TMLE模型估计ACE为11.090%(95% CI:6.740%~15.440%),X-Learner模型估计ACE为11.484%(95% CI:7.716%~15.251%),SDR*模型估计的ACE为3.475%(95% CI:0.749%~6.201%)。
2.5 半参数因果预测模型构建
结合2.4结果,将SBP、PP变量系数分别固定为其对应的ACE值,借鉴logistic模型基本原理,采用梯度下降进行参数拟合,以alpha=0.001,epochs=10 000进行半参数模型拟合,构建半参数因果预后模型,以计算心衰易损期患者MACE事件发生概率,按如下公式计算:P=1/{1+exp[-(-0.04+0.05SBP+0.0.4PP-0.02DBP+0.17NYHA+0.13CCLscore-0.04年龄-0.07性别)]},结果显示,准确度为0.732(95%CI:0.714~0.751),提示有较好的预测准确性。
2.6 在线部署
图4为根据2.5预测模型部署的Web系统,患者信息由左侧信息输入窗口进行输入,右侧信息输出窗口为患者MACE事件预测,下侧为易损期患者用药指导。如年龄段位于39~49岁,男性,NYHA为Ⅲ级,CCI.score为8分,SBP为142 mmHg,DBP为72 mmHg时,患者有51.50%可能性发生MACE事件,应及早就医。
3 讨论
本研究发现SBP、PP与心衰患者易损期MACE事件存在因果效应,DBP与心衰患者易损期MACE事件不存在因果效应,并且在敏感性分析中SDR*模型的结果更加稳定,且超级学习器梯度下降半参数因果预后模型准确度亦较高。
既往研究发现SBP、DBP、PP与心衰患者预后存在相关性
[10],但其与心衰易损期MACE事件的因果关系尚不明确,该病种特异性的血压干预目标值尚无定论。本研究结果显示,SBP及PP与心衰易损期MACE的发生存在明确因果关联。从病理生理机制分析,SBP是心脏在收缩期时左心室动脉血快速进入主动脉腔内,动脉压力快速上升,在收缩中期动脉压力最大时,对动脉血管壁产生的压力,它反映了心脏在收缩期将血液泵入动脉的能力,以及动脉血管壁的弹性和阻力
[11]。DBP反映了心脏在舒张期血管壁的弹性和血液流动的情况
[12]。另外,较高的PP与心脑血管疾病和全因死亡率的风险增加有关
[13],本研究结果与以往研究基本一致,也从致病机制层面进一步证实SBP、PP在心衰易损期MACE事件发生发展中的因果作用。
干预靶点的控制目标因病种及疾病状态而异,全人群参考范围不适用于特殊患者群体,需寻找疾病特异性控制目标以提供更多干预证据
[14-16]。本研究基于因果截断方法,分析心衰易损期MACE事件各干预靶点因果效应。在因果截断建模中的潜在结果模型下,结合区间截断策略拟合因果剂量反应曲线,进而确定最佳干预靶点
[17]。双稳健因果推断方法为模型错误指定尤其是函数形式不正确提供了额外的保护
[18]。此外,在观察性研究中,往往无法知道暴露和混杂因素与结果相关的方式,机器学习可以处理变量之间的高维交互和非线性关系,将机器学习与双稳健因果推断方法相结合时,不仅增加了模型的预测性能,同样为模型错误指定提供了保护,性能明显优于其他估计器
[8]。本研究在此基础上,细化连续分布靶点切割步长,加入双稳健交叉拟合因果算法,并采用超学习器作为模型进行因果截断,在确保双稳健模型稳定性的同时,可以最大可能挖掘因果干预靶点的控制目标。
此外,基于机器学习的预后模型以预测准确性作为任务目标,因果效应模型则侧重靶点与结局间的因果效应分析。将两类算法结合可以构建既有预测价值、又有干预价值的因果预后模型。本文将具有因果效应的干预靶点以其ACE作为变量系数进行固定,通过采用向心内科专家咨询的方式,将临床中重要的预测变量(年龄、CCI.score)同步纳入因果预后模型,根据数据分布类型引入恰当的激活函数与概率计算公式,并借鉴机器学习梯度下降的超参数学习综合构建超级学习器梯度下降因果预后模型,获得具有干预价值的高准确性统计模型。
本研究创新性构建了基于SDR*的因果截断方法,明确了心衰易损期患者血压(SBP、DBP、PP)的最佳干预目标,为临床患者干预提供了因果干预证据;将因果干预靶点与临床重要指标结合构建因果预后模型,保证模型既具有干预价值又具有预测价值。本研究仍存在不足之处,首先,数据来源单一,仅单中心,未来应进一步纳入不同经济文化水平地区及不同等级医疗机构的样本,以提高研究结果的外推性;其次,本研究仅筛选出心衰易损期患者的因果干预靶点,尚未深入探讨这些靶点对患者远期预后的因果效应,仍需进一步系统评估干预靶点对结局事件的近期及远期因果效应,以期为临床工作提供更全面的参考依据。
4 结论
SBP、PP与心衰易损期MACE事件存在因果关系,应早干预、早预防。结合因果效应估计结果的半参数预后预警模型可在保证模型准确性的同时,增加因果效能。
上海健康医学院精神卫生研究院面上项目(YJYM202503)