基于因果图的协变量数据缺失因果效应估计算法

耿智琳 ,  张丽丽 ,  张耀峰 ,  张志刚 ,  刘茂福

武汉大学学报(理学版) ›› 2026, Vol. 72 ›› Issue (3) : 361 -372.

PDF (1172KB)
武汉大学学报(理学版) ›› 2026, Vol. 72 ›› Issue (3) : 361 -372. DOI: 10.14188/j.1671-8836.2025.0050
智能计算与机器学习

基于因果图的协变量数据缺失因果效应估计算法

作者信息 +

Causal Effect Estimation Algorithm Based on Causal Graph with Missing Covariate Data

Author information +
文章历史 +
PDF (1199K)

摘要

针对随机对照实验数据难获取的情况,基于观测数据的因果推断成为替代性研究范式。而观测数据中协变量的缺失往往引入偏差,导致因果效应估计失真。为此,提出一种在协变量缺失场景下三阶段加权因果效应估计算法。首先,基于因果图将协变量划分为混杂变量、暴露预测因子及结果预测因子三类,并针对混杂变量缺失项实施多重插补以保持因果结构完整性;其次,引入缺失模式,通过改进的协变量平衡策略构建倾向得分模型;最后,整合各缺失模式并采用逆概率加权估计因果效应。仿真实验结果表明,相较于梯度提升机,该算法在绝大多数场景下的估计均方根误差更低,能在数据缺失场景下有效估计因果效应。

Abstract

Given the challenges of obtaining randomized controlled trial data, causal inference based on observational data has emerged as an alternative research paradigm. However, missing covariates in observational data often introduce bias, leading to distorted estimates of causal effects. To address this problem, this paper proposes a three-stage weighted causal effect estimation algorithm for handling missing covariates. First, covariates are categorized into confounders, exposure predictors, and outcome predictors based on the causal graph, and a multiple imputation strategy is implemented for missing confounders to preserve the integrity of the causal structure. Second, a missing pattern is introduced, and propensity score models are constructed through an improved covariate balancing strategy. Finally, causal effects are estimated by integrating inverse probability weighting across missing patterns. Simulation results demonstrate that, compared with existing methods such as gradient boosting machines, the proposed method reduces the root mean square error (RMSE) in most scenarios, validating its effectiveness in estimating causal effects under missing data conditions.

Graphical abstract

关键词

因果推断 / 协变量缺失数据 / 处理效应 / 倾向得分

Key words

causal inference / missing data for covariates / treatment effect / propensity score

引用本文

引用格式 ▾
耿智琳,张丽丽,张耀峰,张志刚,刘茂福. 基于因果图的协变量数据缺失因果效应估计算法[J]. 武汉大学学报(理学版), 2026, 72(3): 361-372 DOI:10.14188/j.1671-8836.2025.0050

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

使用随机对照实验数据进行因果效应估计被认为是因果推断的金标准[1]。但是在社会经济领域研究中,由于现实条件的限制,通常不能开展随机对照实验[2],因此学者们开始研究如何使用观测性研究数据(以下简称“观测数据”)代替随机对照实验数据进行因果效应估计。这样做通常存在两个问题:一是在估计处理变量(Treatment)对结果变量(Outcome)的平均处理效应(Average Treatment Effect,ATE)时会受到混杂因素(Confounder)的影响,导致更大的偏差;二是观测数据中往往存在协变量(Covariate)数据缺失的情况。

为了控制因果效应估计中混杂因素带来的偏差,学者们基于混杂变量的可观测性提出了许多解决方法。当所有混杂变量都能被观测到时,常用方法有基于倾向得分的估计方法[3-4]、基于回归的估计方法[5]和将二者结合的双鲁棒方法[6]。前两种方法对函数形式敏感,模型误设会导致偏差;双鲁棒方法要求至少一个模型的设定正确,估计效果对模型的设定仍有一定程度的依赖。为进一步克服估计对模型设定的依赖,学者们又提出了非参数方法[7]和交错双重差分法[8]。非参数方法计算复杂度高且受异常值的影响较大,交错双重差分法要求数据通过平行性检验。当部分混杂变量不能被观测到时,估计困难增大,常用方法有工具变量的估计方法[9]、回归不连续的估计方法[10]、阴性对照变量方法[11]和基于数据融合的方法[12-14]。工具变量法要求严格的外生性假设,现实工具变量往往难以满足;回归不连续设计仅适用于局部效应,外推性差;阴性对照变量方法需未观测混杂满足特定结构,适用性有限;数据融合方法依赖于多源数据集的互补以提升估计精度,而数据集的可获取性已成为制约该方法的瓶颈。综上,现有方法均依赖于不同程度的假设条件,其适用性受限于数据质量和实际问题的复杂性。尤其是模型存在不确定性或数据缺失的情况下,因果推断的稳健性受到影响。

当协变量数据存在缺失时,混杂因素的有效控制面临挑战,常用解决方法主要有三类:完整个体分析法、缺失指标法和插补法。完整个体分析法删除数据中存在缺失值的个体,仅使用协变量数据完整的个体进行估计,当缺失类型为完全随机缺失时,使用完整个体分析法能得到无偏的估计值。由于删除了部分观测个体,当不完整的个体数量较多时,该方法不适用[15]。缺失指标法引入缺失指标,当某个个体的协变量存在缺失值时,其缺失指标记为1;无缺失值时,其缺失指标记为0[16]。缺失指标法会在回归模型中引入偏差,导致因果效应估计偏差增大[17]。插补方法相较于前两种方法应用更加普遍,通常分为单一插补(Single Imputation,SI)和多重插补(Multiple Imputations,MI)。单一插补方法相对简单,易于操作,适合缺失比例低的数据。对于缺失比例高的数据,多重插补方法更加适用,该方法由Rubin[18]提出,给每个缺失值都构造多个替代值,产生多个完整数据集,综合所有数据集的处理结果,最终得到目标变量的估计。多重插补方法相较于单一插补方法稳健性更好,偏差更小[19]。但插补法可能会导致数据分布的失真[20],因此有学者开始考虑无需删除或填补的缺失值处理方法。McCaffrey等[21]采用梯度提升机(Gradient Boosting Machine,GBM)方法在数据缺失的情况下对倾向得分进行估计。相较于逻辑回归等传统方法,GBM方法由于需迭代构建多个弱学习器并优化损失函数,其算法复杂度显著提高,时间复杂度达O(Tnd),逻辑回归的时间复杂度为O(nd),其中T为迭代次数,n为样本量,d为特征维度,在相同硬件条件下,计算耗时明显增加。Wang等[22]在混合离散和非可忽略缺失协变量的情况下,基于贝叶斯方法进行分位数回归,但需要指定缺失协变量的分布。综上,现有处理协变量缺失的方法中,删除个体的方法会造成原始数据信息丢失;对全部协变量进行填补则会造成原始数据分布失真;无需删除和填补的GBM方法时间成本更高;贝叶斯方法则需要依赖于一定的假设条件。

针对协变量数据完全随机缺失机制下的因果效应估计问题,本文提出三阶段加权的因果效应估计方法(Three-Stage Weighted causal inference,TSW)。该方法旨在减少插补数据带来的偏差,提高因果效应估计的准确性。TSW方法首先基于因果图的因果关系把协变量分为3组:混杂(Confounder)变量组、暴露预测(Exposure Predictor)因子组和结果预测(Outcome Predictor)因子组;接着对混杂变量组的缺失值使用多重插补方法进行插补;然后基于协变量分组构建一系列的子模型,通过加权得到倾向得分;最后使用加权倾向得分进行ATE估计。

1  因果效应与TSW方法

1.1 基于潜在结果框架的因果效应定义

Rubin [23]提出的潜在结果框架在因果效应估计领域被广泛使用。本文基于潜在结果框架,将待研究的个体记为i, i=1,2,,n,个体i的协变量记为xi=xi1,xi2,,xiqT,处理变量记为Ti,结果变量记为Yi。本文仅考虑二元处理,即Ti=t,t=0,1t=1表示接受处理,个体i的两个潜在结果记为Yxi|Ti=1Yxi|Ti=0,则个体处理效应(Individual Treatment Effect,ITE)为:

ITE=Yxi|Ti=1-Yxi|Ti=0

由于一个个体通常无法同时观测到两个潜在结果,所以个体处理效应无法通过观测数据直接得到。因此已有研究大多通过对个体处理效应求期望得到总体的ATE:

ATE=EITE=
EYxi|Ti=1-Yxi|Ti=0=
EYxi|Ti=1-EYxi|Ti=0

本文中所提到的因果效应均为ATE。

1.2 基于倾向得分逆概率加权的因果效应估计

对ATE进行估计时,需要满足以下假设[23]

1) 个体稳定假设;

2) 没有未观测到的混杂变量(无混杂假设);

3) 每个个体接受处理的概率非零(正性假设)。本文研究也遵循上述假设。

在估计ATE时,基于倾向得分的方法应用最为广泛。倾向得分记为p,第i个个体的倾向得分pi定义如下:

pi=PTi=1|xi

其含义为在给定协变量xi的条件下,处理Ti为1的概率。

逻辑回归(Logistic Regression,LR)作为估计倾向得分的基准模型,在医学、社会科学、经济学等众多领域应用普遍,其原理清晰、结果易于解释。更复杂的加权策略,如模型平均、机器学习等方法可能会增加计算负担和结果的不确定性。逻辑回归为TSW方法提供了一个相对简洁、计算高效且易于与分组步骤结合的加权框架,便于验证该方法的有效性。在这种方法中,将处理变量T作为因变量,协变量 x 作为自变量,将LR输出结果作为倾向得分估计值。二元处理变量的倾向得分估计模型可以表示为:

logit(p)=α+xTβ

其中,logit为对数函数,x为协变量,α为截距项,β=β1,β2,,βqT为回归系数,q为协变量数。使用回归系数β计算个体i的倾向得分:

pi=eXiTβ1+eXiTβ

利用倾向得分控制混杂因素的影响,获得ATE的无偏估计[15]。其中基于倾向得分的逆概率加权方法根据倾向得分估计值生成权重,平衡观测数据的分布。第i个个体的权重wi计算公式如下:

wi=Tipi+1-Ti1-pi

进而,可以利用下式估计ATE:

ATE^=1niwiYi=1niTiYipi-1ni1-TiYi1-pi

1.3 三阶段加权因果效应估计算法

本研究针对缺失数据集S开展研究,该数据集包含表示个体特征的协变量W、处理变量T和结果变量Y,其中协变量W中存在缺失值。协变量又可以根据是否与处理变量、结果变量存在直接影响关系,分为混杂变量、暴露预测因子和结果预测因子。TSW算法使用子模型加权方法估计ATE,如算法1

第一阶段 填补混杂变量缺失值

在构建因果分析模型时,首先需要明确处理变量与结果变量之间的因果关系网络。因此根据与处理变量、结果变量的因果关系,构建如图1所示的因果图,将q维原始协变量W分为3组:混杂变量组C1=w11,w12,,w1q1,暴露预测因子组C2=w21,w22,,w2q2和结果预测因子组C3=w31,w32,,w3q3。其中,混杂变量既对处理变量T有直接影响,也对结果变量Y有直接影响;暴露预测因子只对处理变量T有直接影响,对结果变量Y有间接影响;结果预测因子只对结果变量Y有直接影响。

对不同类型的协变量采用不同的缺失值处理办法,对混杂变量使用插补方法补全缺失的协变量值,处理方式见图2;暴露预测因子和结果预测因子则使用缺失模式下倾向得分加权的方法进行处理,处理方式见表1。当原始协变量数据个数较多时,直接根据每个协变量缺失情况划分模式会导致缺失模式数量过多,进而出现某些缺失模式下样本量较少的情况,影响建模分析。因此对原始协变量进行分类后再划分缺失模式,这样一方面控制了缺失模式数量和每个缺失模式下个体的数量;另一方面能给三类协变量赋予不同的影响权重。

在估计ATE时,混杂变量是否完整对于因果效应估计十分重要。为了得到完整的混杂变量,在第一阶段先使用MI多重插补方法填补混杂变量组C1的缺失值。具体做法如下:

将原始数据集S0中变量C1,T,Y对应的数据子集记为S1,其中处理变量T和结果变量Y作为辅助变量[24];对S1使用基于链式方程的多重插补方法进行插补,该方法通过迭代预测模型插补数据集中的缺失值,在每次迭代中使用数据集中的其他变量来估算待处理缺失变量,直至满足收敛条件。TSW方法中迭代预测模型采用预测均值匹配和线性回归预测,分别对应基于多重均值插补的三阶段加权因果效应估计算法(TSW-M)和基于多重回归插补的三阶段加权因果效应估计算法(TSW-R)。将混杂变量组C1的缺失值填补完整后,得到新数据集S

第二阶段 计算加权倾向得分

1) 划分缺失子集

为了减少插补方法带来的干扰,对C2C3不再使用插补的方法处理缺失值,而是通过划分缺失子集处理缺失。划分缺失子集是指将变量缺失模式相同的个体划分到同一模式中,构成具有相同缺失特征的缺失子集。

首先根据数据集S的缺失情况将其划分为4种缺失模式,每种缺失模式分别对应缺失子集Sr,r=1,2,3,4,每个缺失子集中包含具有相同缺失模式的个体,见表1。参考朱建平等[25]对缺失模式进行定义,将缺失函数定义为Rxi,Cm,表示个体i的第m组变量的缺失情况,其中i=1,2,,nm=1,2,3。若存在缺失,则Rxi,Cm=1,不存在缺失时,Rxi,Cm=0。对于任意两个个体ij,如果满足:

Ri,Cm=Rj,Cm, ij

则个体ij具有相同缺失模式。

缺失子集Sr中包含的个体isr都具有相同的缺失模式,缺失子集S1中所有个体is1的协变量均无缺失,因此均满足:

is1: Ris1,Cm=0, m=1,2,3

缺失子集S2中个体is2,若C2组某一个或多个协变量存在缺失,C1组和C3组协变量无缺失,则:

is2: Ris2,Cm=0, m=1,3;Ris2,Cm=1, m=2

因此个体is2保留C1,C3协变量参与后续模型的建立。

缺失子集S3中个体is3,若C3组某一个或多个协变量存在缺失,C1组和C2组协变量无缺失,则:

is3: Rxs3,Cm=0, m=1,2;Ris3,Cm=1, m=3

因此个体is3保留C1,C2协变量参与后续模型的建立。

缺失子集S4中个体is4,若C2组和C3组某一个或多个协变量存在缺失,仅有C1组协变量无缺失,则:

is4: Ris4,Cm=0, m=1;Ris4,Cm=1, m=2,3

因此个体is4仅保留无缺失的C1协变量参与后续模型的建立。设nsrSr中个体isr的数量,则有:

n=r=14nsr

根据上述定义,将数据集S中的个体按照缺失模式划分到缺失子集Sr(r=1,2,3,4)中。

2) 构建子模型组

在每种缺失模型下构建子模型组,使用子模型加权法给协变量组赋予不同权重。首先将子模型加权方法分别应用于不同缺失模式,针对缺失子集Sr,根据无缺失协变量构建不同变量组合Urj,进而根据不同的变量组合建立子模型组Mr=mr1,mr2,,mrkr,缺失模式下的子模型组如表1所示。

以缺失模式1为例,因为该模式保留了所有协变量组,所以在C1保持不变的情况下,无缺失的协变量的组合形式共有4种:C1,C2,C3C1,C3C1,C2C1。每个协变量组的组合形式对应一个子模型,因此该模式下缺失子集S1对应子模型组包含4个子模型,记为{m11,m12,m13,m14}

3) 计算加权倾向得分

Sr的子模型组Mr=mr1,mr2,,mrkr,对每个子模型mrj利用LR估计倾向得分Prj=(prj1,prj2,,prjlr)T,则缺失子集Sr的倾向得分矩阵Pr

Pr=[Pr1,Pr2,,Prkr]=pr11pr21prkr1pr12pr22prkr2pr1lrpr2lrprkrlr

以缺失模式1为例,设该模式下缺失子集S1l1=ns1个个体,S1对应子模型组包含子模型m11,m12,m13,m14。子模型m11使用C1,C2,C3变量建立LR模型计算倾向得分,得到P11=(p111,p112,,p11l1)T,子模型m12使用C1,C3变量建立LR模型计算倾向得分,得到P12=(p121,p122,,p12l1)T,以此类推,得到子模型m13m14倾向得分P13P14,最终得到S1的倾向得分矩阵P1

P1=[P11,P12,,P14]=p111p121p141p112p122p142p11l1p12l1p14l1

参考广义线性模型平均方法对子模型组进行加权,设子模型组Mr的权重Wr=wr1,wr2,,wrkr,使用非线性逻辑回归模型对矩阵Pr进行加权:

Pr*=PT|Prj=exp wrjPrj+b1+exp wrjPrj+b

其中,b是截距项。使用逻辑回归模型求解上述方程,用极大似然估计方法进行估计:

lwrj,b=j=1krlnPT|Prj;wrj,b

得到长度为lr的加权倾向得分Pr*。对kr个子模型加权赋予不同缺失模式下的子数据集不同的变量组权重,可使结果更加稳定。

合并全部缺失子集Sr(r=1,2,3,4)的加权倾向得分Pr*(r=1,2,3,4),得到全部样本点总加权倾向得分P*=(P1*,P2*,P3*,P4*)T

第三阶段 计算ATE

基于加权倾向得分P*,使用逆概率加权的方法计算ATE估计。

ATE=1niTiYiP*Ti=1|xi-1ni1-TiYi1-P*Ti=1|xi

使用加权倾向得分估计ATE值的示意图如图3所示。

2  蒙特卡罗模拟实验

本节使用蒙特卡罗模拟数据验证TSW算法的估计效果。TSW算法结合均值插补和回归插补,分别构成基于多重均值插补的三阶段加权因果效应估计算法(TSW-M)和基于多重回归插补的三阶段加权因果效应估计算法(TSW-R)。其中,多重回归插补的插补数据集数量设置为5,迭代次数设置为10次。在模拟数据集上将TSW算法与常用处理协变量缺失的插补方法和GBM方法进行比较。

2.1 评价指标

模拟实验使用以下指标进行评价:偏差BIAS,偏差比RBIAS,标准误差SE,均方根误差RMSE。

偏差BIAS计算公式为:

BIAS=γ^¯-γ

其中,γ^¯为所有ATE估计的均值,γ为真实ATE值,在本实验中设置为-0.4

RBIAS是在BIAS的基础上得到的,计算公式为:

RBIAS=BIASγ×100%

标准误差SE表示预测值与其均值之间的差异。SE越小,样本的可靠性就越高。标准误差SE由标准差s得来,需要先计算s

s=1n-1i=1nγ^i-γ¯2

得到s后再计算SE,计算公式为:

SE=1Hs

其中,H为实验重复次数。

均方根误差RMSE用于衡量预测值与真实值之间的偏差,计算每个估计值与真实值之间差异的均方根,计算公式为:

RMSE=1ni=1nγ^i-γ2

其中,γ^i为ATE估计值,γ为真实ATE值。

2.2 模拟实验

2.2.1 模拟数据生成

1) 数据模型设置

实验使用的模拟数据和模型场景设置参考Setoguchi等[26]的设置,变量间的相关关系如图4所示。

图4w1,w3,w5,w6,w8,w9为二元变量,w2,w4,w7,w10为连续变量。w2w6w3w8之间存在弱相关关系,相关系数ρ2,6=0.2ρ3,8=0.2w1w5w4w9之间存在强相关关系,ρ1,5=0.9ρ4,9=0.9

处理变量T的设置方式如表2所示,在场景A~G下,使用LR构建真实倾向评分模型得到pT|wi。然后从均匀分布中生成一个0,1之间的随机数,如果随机数小于估计的真实倾向评分pT|wiT设为1,否则设为0。

结果变量Y对协变量w1,,w4,w8,,w10和处理变量T使用LR构造结果模型,如(21)式所示:

Pr Y=1|wi,Ti=1+exp --3.85+0.3w1-0.36w2-0.73w3-0.2w4+0.71w8-0.19w9+0.26w10-0.4T-1

其中,T为二元处理变量;Y为连续结果变量;协变量w1,w2,,w10可以分为:混杂变量组C1=w1,w2,w3,w4,暴露预测因子组C2=w5,w6,w7,结果预测因子组C3=w8,w9,w10

再从均匀分布中生成一个0,1之间的随机数,如果随机数小于pY |wi, TiY设为1,否则设为0。

2) 数据缺失机制

得到完整数据后,需要生成具有缺失的数据集。模拟实验使用完全随机缺失机制对完整数据中的w1,w2,,w10进行处理,完全随机缺失指某变量的缺失数据与其他任何观测或未观测变量都不相关。当样本量为n时,10个协变量共有10×n个协变量值,设协变量的缺失率为θ,则缺失的协变量值个数为10×n×θ。在A~G共7个场景下,生成样本量n分别为2 000、5 000,缺失率θ分别为5%、10%、20%的数据集,进行6组模拟实验,每组实验重复H=100次。

2.2.2 实验结果

在协变量数据缺失的情况下,将TSW-M和TSW-R与单一插值、多重插值、广义提升等方法的结果进行对比。其中,单一均值插值方法记为SI-M,多重均值插值和多重回归插值方法分别记为MI-M和MI-R。

首先将协变量数据无缺失情况下的ATE估计结果作为基线值。表3展示了样本量为2 000时,对无缺失数据进行因果效应估计的模拟结果。在使用LR计算倾向得分、使用逆概率加权计算ATE估计值的情况下,不同场景的偏差值存在很大的区别,A场景下RBIAS最小,仅有1.25%;F场景下RBIAS最大,为32.21%。

表4为当样本量为2 000、缺失率为20%时,不同处理缺失数据方法的ATE估计及其各项指标结果。其中,Complete为基线值,表示对无缺失数据使用LR方法估计得到的结果。TSW方法在A、B、C、E、F、G共6个场景下BIAS和RMSE最小,在A、B、C、F、G共5个场景下SE最小。TSW-M和TSW-R方法相比,指标BIAS稍大,但是指标SE和RMSE表现较好。实验结果显示,TSW类方法明显优于其他方法。

GBM方法仅次于TSW类方法,在场景D上表现最优,SI-M的BIAS总体表现差于MI-M方法,但是优于MI-R方法,这是由于MI-R在不同场景下的BIAS波动较大,稳定性差;并且SI-M方法的SE和RMSE均小于MI类方法,表现更好。

表5为当样本量为5 000、缺失率为20%时,不同处理缺失数据方法的ATE估计及各项指标结果。当样本量增大后,TSW方法的优势依旧明显,在A、B、C、E、F、G共6个场景下获得了最小的BIAS,在B、C、E、F、G共5个场景下获得了最小的SE和RMSE。TSW-M和TSW-R方法相比,BIAS和RMSE稍差,SE表现较好。GBM在D场景下获得最小BIAS、SE和RMSE。其余3种方法与样本量为2 000时表现差别不大,MI类的在BIAS上的表现更好,但MI-R稳定性差;SI的SE和BISA的值更小,表现更好。可以看出,当样本量增加到5 000后,BIAS的变化不大,但SE和RMSE的值更小,ATE估计的效果更好。

鉴于篇幅限制,不再展示样本量分别为2 000和5 000、缺失率分别为5%和10%情形下的全部指标运算结果,仅展示RMSE值,结果如图5所示。在4种不同组合的情况下,TSW-M和TSW-R都能获得较低且更稳定的RMSE值。

总体来看,在不同的模拟数据场景下,TSW类方法的表现总体优于插补类和GBM方法,ATE估计效果更好。由于TSW方法结合倾向得分加权与回归调整,其稳健性随模型误设非线性类型和程度而异,并受数据生成模型中可加性与非线性交互作用的影响。在轻度非线性和中度非线性模型中,TSW因倾向得分与结果模型双重误设而表现不稳定,估计效果下降;但在中度非可加性模型下,其稳定性优势凸显,能抑制高维交互产生的影响。值得注意的是,在中度非可加性与非线性模型中,TSW的精度反而优于轻度模型及中度非可加性模型。这可能源于其机制对误设的非线性响应,轻度复杂度下双重误设敏感导致算法脆弱,高复杂度下权重平均化效应和回归调整潜力使算法相对稳定,而中度非可加性与非线性模型中大量交互项使倾向得分分布更均匀,降低了极端权重的风险,使其稳定性增益部分抵消了回归调整的不足。

3  结 语

本文主要研究了基于协变量数据缺失下的因果效应估计方法,提出了三阶段加权因果效应估计算法,提升了估计ATE的效果。三阶段加权因果效应估计算法是一种新的协变量缺失的因果效应估计方法,在使用观测数据进行因果效应估计时,减少了混杂因素和数据缺失带来的影响。该方法在保留原始样本信息的情况下,仅对混杂变量使用插补方法补全缺失,减少插补数据带来的偏差,得到更好的ATE估计值。模拟实验验证了三阶段加权因果效应估计算法,相较于其他插值和GBM处理缺失值的方法,估计效果更好,总体表现也更好。

本文提出的算法扩充了对缺失数据进行因果效应估计的研究,此算法是基于数据完全随机缺失模式对因果效应展开估计的。数据非随机缺失的情况更为复杂,未来的研究会针对非随机缺失情况进一步探索。

参考文献

[1]

范菊逸, 詹铭峰, 蔡宗武, .带有变量选择的协变量平衡倾向得分的估计: 基于GMM-LASSO方法[J].系统工程理论与实践 202141(10):2631-2639. DOI:10.12011/SETP2020-0037 .

[2]

FAN J YZHAN M FCAI Z Wet al. Covariate balancing in propensity score estimation with variable selection: Based on GMM-LASSO approach[J]. Systems Engineering-Theory & Practice202141(10):2631-2639. DOI:10.12011/SETP2020-0037(Ch ).

[3]

BOTTOU LPETERS JQUIÑONERO-CANDELA Jet al. Counterfactual reasoning and learning systems: The example of computational advertising[J] Journal of Machine Learning Research201314(1): 3207-3260. DOI:10.5555/2567709.2567766 .

[4]

ROSENBAUM P RRUBIN D B. The central role of the propensity score in observational studies for causal effects[J]. Biometrika198370(1): 41-55. DOI: 10.1093/biomet/70.1.41 .

[5]

蒋青嬗, 马佳羽, 黄灿, . 因果推断中基于能源距离的协变量分布平衡[J]. 统计研究202340(5): 144-151. DOI:10.19343/j.cnki.11-1302/c.2023.05.011 .

[6]

JIANG Q SMA J YHUANG Cet al. Covariate distribution balance via energy distance for causal inference[J]. Statistical Research202340(5): 144-151. DOI:10.19343/j.cnki.11-1302/c.2023.05.011(Ch ).

[7]

ROBINS J MROTNITZKY AZHAO L P. Estimation of regression coefficients when some regressors are not always observed[J]. Journal of the American Statistical Association199489(427): 846-866. DOI:10.1080/01621459.1994.10476818 .

[8]

DUDÍK MLANGFORD JLI L H. Doubly robust policy evaluation and learning[EB/OL].[2025-06-07]. DOI: 10.1214/14-sts500 .

[9]

RODRIGUEZ DUQUE DSTEPHENS D AMOODIE E E Met al. Semiparametric Bayesian inference for optimal dynamic treatment regimes via dynamic marginal structural models[J]. Biostatistics202324(3): 708-727. DOI:10.1093/biostatistics/kxac007 .

[10]

刘冲, 沙学康, 张妍. 交错双重差分: 处理效应异质性与估计方法选择[J]. 数量经济技术经济研究202239(9): 177-204. DOI:10.13653/j.cnki.jqte.20220805.001 .

[11]

LIU CSHA X KZHANG Y. Staggered difference-in-differences method: Heterogeneous treatment effects and choice of estimation[J]. Journal of Quantitative & Technological Economics202239(9): 177-204. DOI:10.13653/j.cnki.jqte.20220805.001(Ch ).

[12]

ANGRIST J DIMBENS G WRUBIN D B. Identification of causal effects using instrumental variables[J]. Journal of the American Statistical Association199691(434): 444-455. DOI:10.1080/01621459.1996.10476902 .

[13]

ANDERSON MMAGRUDER J. Learning from the crowd: Regression discontinuity estimates of the effects of an online review database[J]. The Economic Journal2012122(563): 957-989. DOI:10.1111/j.1468-0297.2012.02512.x .

[14]

MIAO WTCHETGEN TCHETGEN E. Invited commentary: Bias attenuation and identification of causal effects with multiple negative controls[J]. American Journal of Epidemiology2017185(10): 950-953. DOI:10.1093/aje/kwx012 .

[15]

LI H KMIAO WCAI Zet al. Causal data fusion methods using summary-level statistics for a continuous outcome[J]. Statistics in Medicine202039(8): 1054-1067. DOI:10.1002/sim.8461 .

[16]

JOSEY K PYANG FGHOSH Det al. A calibration approach to transportability and data-fusion with observational data[J]. Statistics in Medicine202241(23): 4511-4531. DOI:10.1002/sim.9523 .

[17]

YANG SDING P. Combining multiple observational data sources to estimate causal effects[J]. Journal of the American Statistical Association2020115(531): 1540-1554. DOI:10.1080/01621459.2019.1609973 .

[18]

WHITE I RCARLIN J B. Bias and efficiency of multiple imputation compared with complete-case analysis for missing covariate values[J]. Statistics in Medicine201029(28): 2920-2931. DOI:10.1002/sim.3944 .

[19]

ROSENBAUM P RRUBIN D B. Reducing bias in observational studies using subclassification on the propensity score[J]. Journal of the American Statistical Association198479(387): 516-524. DOI:10.1080/01621459.1984.10478078 .

[20]

D’AGOSTINO RLANG WWALKUP Met al. Examining the impact of missing data on propensity score estimation in determining the effectiveness of self-monitoring of blood glucose (SMBG)[J]. Health Services and Outcomes Research Methodology20012(3): 291-315. DOI:10.1023/A: 1020375413191 .

[21]

RUBIN D B. Multiple Imputation for Nonresponse in Surveys[M]. Hoboken: Wiley, 1987. DOI:10.1002/9780470316696 .

[22]

邓建新, 单路宝, 贺德强, . 缺失数据的处理方法及其发展趋势[J]. 统计与决策201935(23): 28-34. DOI:10.13546/j.cnki.tjyjc.2019.23.005 .

[23]

DENG J XSHAN L BHE D Qet al. Processing method of missing data and its developing tendency[J]. Statistics & Decision201935(23): 28-34. DOI:10.13546/j.cnki.tjyjc.2019.23.005(Ch ).

[24]

GRAHAM J W. Missing data analysis: Making it work in the real world[J]. Annual Review of Psychology200960: 549-576. DOI:10.1146/annurev.psych.58.110405.085530 .

[25]

MCCAFFREY D FGRIFFIN B AALMIRALL Det al. A tutorial on propensity score estimation for multiple treatments using generalized boosted models[J]. Statistics in Medicine201332(19): 3388-3414. DOI:10.1002/sim.5753 .

[26]

WANG Z QTANG N S. Bayesian quantile regression with mixed discrete and nonignorable missing covariates[J]. Bayesian Analysis202015(2): 579-604. DOI:10.1214/19-ba1165 .

[27]

RUBIN D B. Estimating causal effects of treatments in randomized and nonrandomized studies[J]. Journal of Educational Psychology197466(5): 688-701. DOI:10.1037/h0037350 .

[28]

CROWE B JLIPKOVICH I AWANG O H. Comparison of several imputation methods for missing baseline data in propensity scores analysis of binary outcome[J]. Pharmaceutical Statistics20109(4): 269-279. DOI:10.1002/pst.389 .

[29]

朱建平, 郑陈璐, 方匡南. 缺失数据下的两阶段信用评分模型——基于互联网消费金融数据的研究[J]. 数理统计与管理202140(4): 613-624. DOI:10.13860/j.cnki.sltj.20201219-006 .

[30]

ZHU J PZHENG C LFANG K N. Two-stage credit scoring model with missing data: Based on the analysis of Internet consumer credit data[J]. Journal of Applied Statistics and Management202140(4): 613-624. DOI:10.13860/j.cnki.sltj.20201219-006(Ch ).

[31]

SETOGUCHI SSCHNEEWEISS SBROOKHART M Aet al. Evaluating uses of data mining techniques in propensity score estimation: A simulation study[J]. Pharmacoepidemiology and Drug Safety200817(6): 546-555. DOI:10.1002/pds.1555 .

基金资助

国家社会科学基金(23ATJ005)

湖北省教育厅科学研究计划项目(D20222202)

数字金融创新湖北省重点实验室开放基金(DFIK2024Y06)

AI Summary AI Mindmap
PDF (1172KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/