基于线性残差独立性测试的致病基因检测

张浩 ,  周水庚 ,  关佶红

武汉大学学报(理学版) ›› 2023, Vol. 69 ›› Issue (2) : 127 -136.

PDF (1201KB)
武汉大学学报(理学版) ›› 2023, Vol. 69 ›› Issue (2) : 127 -136. DOI: 10.14188/j.1671-8836.2023.0037

基于线性残差独立性测试的致病基因检测

作者信息 +

Causal Gene Identification Based on Linear Residuals Independence Test

Author information +
文章历史 +
PDF (1228K)

摘要

使用因果推断相关的机器学习方法辅助检测致病基因时,作为因果推断的核心工具,条件独立性(CI)测试算法在高维生物数据场景中往往存在时间复杂度高以及准确性低等问题。为此,提出一种融合偏相关测试与线性残差独立性测试算法,压缩CI测试条件集的搜索空间,同时提高准确率。设计一种因果推断策略,在减少冗余CI测试的同时结合V结构与因果函数模型的优点,在应用于真实癌症数据的致病基因检测场景中可以区分Markov等价类,找到真正的因果关系。实验结果表明,提出的算法有较好的致病基因检测性能。

Abstract

In what way to efficiently and accurately look for the causal genes related to the corresponding diseases becomes a hot spot in searching. When no control experiment can be applied, we usually use causal discovery method to detect causal genes. However, the traditional independence tests in high-dimensional data have high time complexity and low accuracy. To alleviate this problem, we propose a residual independence test algorithm that combines partial correlation test and linear residuals independence test to compress the search space of the conditional set of CI(conditional independence) test, and improve the accuracy. Next, we design a causal discovery algorithm based on residual independence test, which can distinguish Markov equivalence classes by V-structure and causal functional model, we apply it to real cancer datasets in the detection of pathogenic genes. The results show that proposed algorithm is significantly better than existing algorithms in many aspects.

Graphical abstract

关键词

因果网络 / 因果推断 / 条件独立性 / 致病基因 / 条件独立性测试

Key words

causal network / causal inference / conditional independence / causal gene / CI(conditional independence) test

引用本文

引用格式 ▾
张浩,周水庚,关佶红. 基于线性残差独立性测试的致病基因检测[J]. 武汉大学学报(理学版), 2023, 69(2): 127-136 DOI:10.14188/j.1671-8836.2023.0037

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

随着生物技术的发展,人类基因组测序和基因组活动监测成本快速下降[1],微阵列已经成为检测基因活性的常用工具,若将其应用于疾病诊断和基因治疗,很有可能在未来产生巨大的商业价值[2],因而许多生物信息学和生物医学研究人员正着手进行这方面的应用研究。其中,识别与某些病症相关的致病基因是最具有前景的应用之一[3],因为它可估计患者潜在患某些病症的风险,并为他们提供进一步的治疗建议。致病基因检测在生物医学领域非常具有挑战性[4],是因为在许多情况下都难以进行对照实验,并且仅依靠传统的生物医学发现致病基因代价很高。为了解决这个问题,生物信息学研究者通常借助机器学习和数据挖掘的技术来观察基因表达数据[5~7],并设计各种方法以发现与某种特定疾病相关的重要基因。

通常而言,直接发现致病基因是一件十分困难的事情[8,9],研究者们经常使用特征选择方法检测与疾病相关的基因。特征选择主要有三种主流的方法:过滤、包装和嵌入。然而,这三种类型的特征选择方法在致病基因检测上都存在不同程度的问题。理论上,这些基于特征选择的方法返回的候选基因集合一般都是由以病症变量为中心的马尔可夫毯[10](Markov Blanket,MB)构成的,它是一个包含了致病基因的超集。因此,在假设特征选择结果100%准确的情况下,依然存在一个重要问题——特征集冗余[11]

由于特征选择方法存在的缺陷,基于因果推断的致病基因检测方法应运而生[1,12]。因果网络[13]是分析变量间因果关系的一种常用工具。因果网络通常是关于一组变量的概率图模型,节点表示变量,有向边表示变量之间蕴含的因果关系。实际上,关于边的信息往往是未知,需要进行因果推断确定节点间是否存在边,以及边的方向。在基于约束的因果推断方法[14,15]中,通常利用条件独立性(conditional independence,CI)测试[16,17]学习边的信息,即需要检验变量之间的CI。

通常来说,通过CI测试,因果推断算法如PC算法[18]可以返回一个与数据实际蕴含的因果网络互为马尔可夫等价类[12](Markov equivalence class,MEC)的部分有向无环图[19](partial direct acyclic graph,PDAG),缓解了特征集冗余的问题。但通过检测数据中存在的V结构以及通过一致性传播推断因果方向往往无法在一组MEC中找到完整的因果关系。在多种情况下,基于CI测试的方法,包括PC算法和发现MB的一系列算法[10,20]都不能确定所有被检测出的基因是否为真的致病基因。因此,现有的因果推断方法在检测致病基因过程中耗时长[21],查全率低[22],准确率低[23]

近些年来,研究者们又提出了基于残差的CI检测方法,这些方法能在一组MEC中找到正确的因果结构,其底层模型一般为加性噪声模型(additive noise model,ANM)[24~29]。ANM可以表示为:y=fX+n,其中n是一个独立于X的加性噪声,Xy的父亲变量集。Grosse-Wentrup等[27]提出x-fZy,Zxy|Z的一个充分非必要条件。Gao等[15]提出在忠诚性条件和马尔可夫条件下,x-Ex|Zy-Ey|Z可以推断出xy|Z,不过这个结论仅在线性高斯和非高斯场景下成立,且其中独立性计算往往需要进行高复杂度的基于核方法的密度估算,难以用到包含成千上万个特征变量的基因表达数据。因此,想要通过这些方法来推断因果关系仍然困难重重。为了解决此问题,本文假设这些因果关系是线性的,简化了模型,提出一个全新的方法称为CGD(causal gene discovery),通过基于线性残差独立性测试实现高效的致病基因检测。

1  基础知识

定义1(因果网络) 因果网络是表示变量间概率依赖关系的有向无环图(direct acyclic graph,DAG),它可表示为一个三元组G=X,E,P。其中,X=x1,x2,,xn表示DAG中的所有节点的集合;E=exi,xj|xi,xjX表示DAG中每两个节点间的单向边的集合,exi,xj表示xi,xj间存在依赖关系xixjP={P(xi|paxi),paxiX}是条件概率的集合,P(xi|paxi)表示xi的父节点集paxixi的概率性影响。

因果网络本质上是联合概率分布P(x1,x2,,xn)中所有CI的一种图形化表示。

定义 2d-分离) 给定一个DAG GV,E,令Pvivj之间的一条(先不考虑方向)路径,则称关于vivj的一条路径P被节点集Z阻塞了,只要满足下面的任意一个条件:

1) P包含一个顺连结构,如vivkvjvi vkvj,且vkZ

2) P包含一个分连结构,如vivkvj,且vkZ

3) P包含一个V结构,如vivkvj,且vkZ,同时Z也不包含任何vk的后代节点。

vivj之间的所有路径都被Z阻塞,则vivj被节点集Zd-分离,Z也被称为vivjd-分离集。如果某个Z是所有d-分离集中包含节点数最少的那个,则将称其为最小d-分离集[8](minimal d-separator)。

定义3(条件独立性测试) 令XYZ表示三个随机变量的集合,当给定条件Z时,对XY进行CI检验,如果XY关于Z条件独立,则表示为XY| Z

定义3表明,如果XY之间是关于Z独立的,即使知道Z的值也无法通过X(或Y)的值得到任何对应Y(或 X)的额外信息。

定义 4(因果Markov假设) 给定一个因果网络G,令PX,Y,Z为三个变量集XYZ的联合概率分布,若XYZd-分离 ⇒ XY| Z,则称PX,Y,Z满足关于G的因果马尔可夫(Markov)假设。

定义 5(因果忠实性假设) 给定一个因果网络G,令PX,Y,Z为三个变量集XYZ的联合概率分布,如果XY| ZXYZd-分离,则称PX,Y,Z满足关于G的因果忠实性假设或因果忠实性条件成立。

可以看出,因果Markov假设和忠实性假设将观测数据的组合概率分布与相应的因果网络结构联系起来了。特别地,如果因果忠诚假设得到满足,则可以使用CI测试找到一组与真实因果关系Markov等价的PDAG。一般地,因果推断的时候都会先验地假设因果忠实性条件成立,否则难以进行有效的推断。本文工作也是在这一假设条件成立下进行研究的。

2  线性残差独立性测试

如前面所说,若对任意两个变量xy直接进行CI测试,当数据维度较大的时候,运算的时间成本会比较高。在生物信息领域,数据维度通常很高,直接运行CI测试方法很可能在可接受的时间范围内都无法返回结果。本节将详细描述我们设计的高效线性残差独立性测试方法。

2.1 线性加性噪声模型

本文工作是在线性加性噪声模型(linear additive noise model,LANM)基础上进行的。LANM是一个二元组S,PX,S=S1,S2,,Snn个方程的集合:

Si:xi=fipaxi+εi,i=1,2,,n

其中,每个fi都是一个线性函数,paxi对应于DAG Gxi的父亲节点集,噪声变量εi服从独立分布,且满足εipaxi

如果一个LANM可以通过残差与自变量的独立关系区分不对称的因果方向,那么称它是可以识别(identifiable)的[23]。在大部分线性非高斯或非线性高斯场景中,LANM都是可以识别的[19]。本文假设所有的数据在生成过程中都满足LANM。我们的任务是随机挑选两个节点xy,然后测试在给定一组变量Zxy是否条件独立。下面,介绍不同场景下,CI测试的原理。

2.2 线性场景中的残差独立性与CI的关系

在本节,首先给出关于CI的一个经典理论[30],它描述了如何在平方可积函数空间中把相关性与独立性关联起来。

条件独立性特性[30](characterization of conditional independence,CCI):令X,Y,Z为三个随机变量或随机变量集,定义:

E1=gLXZ2,Eg|Z=0
E2=hLYZ2,Eh|Z=0
E3=g'LX2,Eg'=0
E4=h'LY2,Eh'=0

其中,LXZ2LYZ2LX2LY2分别表示X,Z,Y,Z,X,Y的平方可积函数空间,则下面四个等式相互等价:

CCI-1:XY | Z

CCI-2:gE1 hE1,Egh=0

CCI-3:gE1 h'E4,Egh'=0

CCI-4:hE2 g'E3,Ehg'=0

特别地,当Z= 时,可以得到:

XYg'E3h'E4,Eg'h'=0

CCI描述的是一种在平方可积函数空间中,相关性与独立性的等价关系。下面给出文献[19]的关于条件独立性和残差的独立性的理论结果。

引理1[19] 给定m+2个随机变量:x,y以及Z=z1,z2,,zm,它们都是由独立的随机变量sii=1,2,3,,l组成的一个线性组合,如果所有的si符合联合高斯分布,当且仅当x-Εx|Zy-Εy|Z时,xy|Z成立。

引理2[19] 给定m+2个随机变量:x,y以及Z=z1,z2,,zm,它们都是由独立的随机变量sii=1,2,3,,l组成的一个线性组合,如果所有的si符合联合高斯分布,那么以下条件相互等价:

1) x y| Z

2) x-Ex|Zy

3) y-Ey|Zx

4) x-Ex|Zy-Ey|Z

这个结论意味着在线性高斯分布的条件下,可以将测试x,yZ之间的条件独立简化为测量x-Ex|Zy或者y-Ey|Zx。而因为此种高斯场景下,偏相关性[31]与独立性存在等价关系,即

ρxy.Z=0x-Ex|Zy-Ey|Z

因此,通过偏相关系数ρxy.Z的值就可以直接推断CI是否成立。然而,在线性场景中,更加常见的是非高斯情形,我们要作进一步的处理,将根据引理1和引理2,给出线性残差独立性测试方法。

推论1 给定m+2个随机变量:x,y以及Z=z1,z2,,zm,它们都是由独立的随机变量sii=1,2,3,,l组成的一个线性组合,如果所有的si均服从非高斯分布,那么

引理3[19] 给定m+2个随机变量:x,y以及Z=z1,z2,,zm,它们都是由独立的随机变量sii=1,2,3,,l组成的一个线性组合,如果所有的si均服从非高斯分布,那么

x-E(x|Z)y-E(y|Z)xy| Z

推论2 给定m+2个随机变量:x,y以及Z=z1,z2,,zm,它们都是由独立的随机变量sii=1,2,3,,l组成的一个线性组合,如果所有的si均服从非高斯分布,那么

基于引理3与推论2,本文提出的线性残差独立性测试(linear residuals independence test,LRIT)方法,见算法1。由于ρxy.Z的计算复杂度远低于x-Ex|Zy-Ey|Z,而通常推断过程中满足x-Ex|Zy-Ey|Z的情况要比满足x-Ex|Z y - Ey|Z的情况少,因此两者可以很好地融合。具体地,给定任意两个变量xy,以遍历的方式测试条件集Z,先判断是否满足ρxy.Z0,若不满足,则对x-Ex|Zy-Ey|Z是否满足独立性进行测试;若满足,则返回xy|Z。这种测试方法极大地降低了独立性测试的使用次数,提高了CI测试的速度。

要注意的是,在最坏的情况下,该测试方法的算法复杂度等价于x-Ex|Zy-Ey|Z的复杂度,即O(n+IT) = O(IT),其中O(IT)为单次独立性测试的复杂度,其值取决于使用的具体算法。例如,若使用相关性测试,则O(IT) = O(n)。

2.3 致病基因检测算法

基因检测不同于一般的因果推断,因为基因检测只需要确定哪些基因直接影响疾病变量,因此在进行xy|Z的CI测试过程中,可以直接将x看作为病症变量,即单目标因果推断场景。然而,即使在致病基因检测场景下,还需要在上万个基因中遍历搜索其中蕴含的因果关系,计算量依然非常巨大,现有方法在CI测试过程中,不可避免地引入了大量冗余CI测试,若冗余CI测试返回错误的结果,则必然造成真实的致病基因被错误地排除掉,导致查全率低。基于这个观测,我们设计了一种高效的致病基因检测算法CGD(算法2),在每次迭代CI测试中减少了d-分离集的规模,使得该算法能够处理包含数千个特征的基因表达数据。

算法2主要有3个步骤:基于CI测试判断边是否存在,基于V结构原理判断因果方向,以及基于残差独立原理判断因果方向。算法2需要检测两两变量之间的CI,因此复杂度为:O(n22 n-2CI)。

1) 基于CI测试判断边是否存在

在传统的如PC算法中,需要对基因表达数据集V中的每个特征y测试xy|Z。如果CI成立,那么可以由因果忠实性条件判断xy不相邻,即y必然为非致病基因。一般的基于约束的方法中应用CI测试需要遍历测试V\y中的每个子集Z,本文CGD采取先检查V\y,N中的子集Z算法2,第3行),如果CI不成立,再检测V\y算法2,第5行)。随着进行CI测试次数增加,集合N的数量也会增长,因此CGD算法可以避免冗余CI测试,算法效率更高。尤其是在大多数生物相关的稀疏的网络场景,大部分非邻接节点会在测试V\y,N的时候就被检测出来。

然而,因为ZV\y,N,那么CI是否都能被检测到,即会不会引入冗余特征?为了解答这个问题,我们给出下面这个推论。

推论3 给定两个变量xy,若ZyZx的父子变量集中的任意子集,且满足因果忠诚性条件并且x y|Z,则xy相邻,或者yx的后代且两者的最小d-分离集至少包含一个非x父子变量。

推论3易由文献[17]中Theorem 3推导得到。推论3表明,算法CGD在使用CI测试判断边是否存在的过程中(算法2~行),尽管CI测试条件集被缩小为Z V\y,N,却仅在非常特殊的情况下(yx的后代节点且两者的最小d-分离集至少包含一个非x父子变量)检测不到CI。因此,很大程度上提高了CI测试效率,若这种特殊情况发生了,也会在检测V\y算法2,第5行)的时候检测到CI,因此算法是完备的。要注意的是,算法2的第2~10行仅检测出病症变量x的父子变量集,而致病基因仅是父亲集,这是致病基因检测中无法容忍的,因此需要在因果方向学习时,剔除所有子变量。

2) 基于V结构原理判断因果方向

算法2中第11~13行需要对y1-x-y2是否构成V结构进行判断,这是非常成熟的算法,本工作遵循PC算法里面的标准流程进行判断即可。如果不存在V结构,则需要作进一步处理。

3) 基于残差独立原理判断因果方向

算法2中的第16行,通过测试x-Ex|Zy yZ,确定y是否为x的直接因节点。事实上,如果xy相邻,且x-Ex|Zy yZ成立,那么在线性非高斯场景下,yx通常是满足的,这可以由现有的相关理论[19]保证。

引理 4[19] 给定变量x以及一个通过可识别LANM生成的变量集Z,对于任意一个邻接于xyyZ,在满足因果忠诚性条件下有以下结论:x-Ex|Zyyxy

引理4表明,x的父亲节点可以通过检查x-Ex|ZyyZ是否成立来判断。基于V结构与基于残差独立检测的因果方向学习策略均不会引入x的后代节点。因此,尽管算法CGD在使用CI测试判断边是否存在的过程中无法检测到所有的CI,即引入了x的后代节点,但在后续因果方向学习中都将这些后代节点一一排除,可见,算法CGD最终返回的是x的完整的父亲节集,即致病基因集。

3  实 验

3.1 数据集

本文实验在基因检测领域具有代表性的白血病数据集[32]上进行,该数据集包含7 129个基因数据,样本来自72个不同的白血病患者,包含47例急性淋巴细胞白血病(ALL)以及25例急性髓细胞白血病(AML)。我们将CGD与另外四个经典的致病基因检测方法CDHD[12]、SVS[1]、FRCIT[26]和CGI[17]进行比较。CDHD是一种通过PC算法进行骨架学习[33],然后利用信息几何模型IGCI[34]进行因果方向学习的方法;SVS是一种基于V结构的致病基因检测算法;FRCIT是一种基于峰度检测的因果推断算法,它用峰度检测代替了核密度估算,在高维场景中有较好效果;CGI是一种基于非线性回归测试的致病基因识别算法,它采用基于高斯过程回归与核独立性测试的非线性回归测试检测CI。本文实验环境为:11th Gen Intel(R) Core(TM) i7-11700K 3.60 GHz, RAM 32 GB, MATLAB 2020b。

3.2 实验结果及分析

CGD方法从7 129个基因中发现了66个致病基因。我们重点关注在这66个被发现的致病基因中,有多少是被现有研究工作报道过的与急性白血病的发生、诊断以及治疗相关的。表1中列出了通过CGD方法找到的被报道过的相关基因,共有24个。表2为通过 CDHD、SVS、FRCIT和CGI方法得到的基因。

CDHD只对基于返回的Markov等价类中的候选基因进行排序,而不是直接找到确切的致病基因[14]。该方法返回了前10个基因的排序作为致病基因,而其中5/10的基因被报道与人类急性白血病相关联。SVS只返回了4个致病基因,相对来说,它的召回率非常低。主要原因是SVS仅使用V结构探测致病基因,当非V结构中包含了致病基因时,这些基因无法被检测到。此外,在这个白血病数据集中只有7 129个基因,可能有一些未观察到的基因参与了一些V结构的构成,在缺少未观察到的基因的情况下,SVS就无法恢复相应的V结构,因此无法找到这些致病基因。FRCIT完全依赖于噪声的独立性原理检测基因,返回了16个致病基因,其中有9个被报道过。CGI的表现是这4个对比方法里面最好的,共返回了37个基因,其中有15个被报道过。

对比这些方法,从发现的基因中被报道与急性白血病相关的数量来说,CGD方法在查全率和查准率性能方面明显是最高的。CGD找到的候选基因中,有24个基因是被报道出来的,另外42个基因对于白血病的因果作用尚不明确,但这并不意味着,没有被报道出来的基因就是找错了。如果其他研究学者可以对这些基因给予更多的关注,很多重要且有价值的信息可能就会被发现。这需要运用一些其他方法来验证这个观点。

接下来,我们将从另一个方面评估所提出的方法,检查找到的基因是否可以构成分类特征的子集,即CGD发现的66个基因是否有区分ALL和 AML的能力。从特征选择和因果关系的角度来看,致病基因是分类特征集的一个重要子集,是病症变量的马尔可夫毯一个重要组成部分。因此,致病基因在分类上必然具有较好的能力。

图1展示了CGD发现的基因的表达水平值在AML和ALL的分布情况。每个基因的表达水平在样本中都已进行标准化处理,使其均值为0,标准差为1。对于每个基因而言,基因表达水平高于均值时显示为偏红色(越高越红),低于均值时显示为偏蓝色(越低越蓝)。从图1可以看到,本文发现的66 个基因的表达水平值在ALL和AML间具有明显差异性,其中没有任何基因在两类中均匀地表达。这说明,这66个基因对ALL与AML的分类效果较好。

从统计学的角度来看,致病基因还有一个重要的特征,即通常这些基因比与病症变量没有直接关系的其他基因更接近病症变量。图2给出了CGD所找到的致病基因与病症变量之间的距离关系。距离用1-ρxy来度量,其中x为基因变量,y为病症变量,ρxyxy的Pearson相关系数。首先,将病症变量固定在坐标(1,1)上;然后,随机地将某个基因x放置在以(1,1)为圆心,半径为1-ρxy的圆周上。

通过观察致病基因与病症变量之间的接近程度,可以发现所找到的致病基因与疾病变量之间的平均距离远小于其他基因与疾病变量之间的平均距离,如表3所示。这一结果验证了CGD方法的有效性。

4  结 语

本文提出了一种基于线性残差独立性测试的致病基因检测算法。为了克服“维度诅咒”问题,本文的线性残差独立性测试结合了偏相关测试速度快的优点;特别地,所提出的因果方向学习策略融合了V结构识别算法与线性加噪声模型的优点,使得方向学习不受限于Markov等价类与V结构的数量。我们在白血病数据集上,从三个方面对算法进行了测试,实验结果表明提出的方法优于同类其他方法。

由于提出的算法是一种线性方法,一旦数据背后因果关系的非线性程度较高,则算法效果无法得到保障。如何在非线性场景设计高效的致病基因检测算法将是我们后续一个研究重点。

参考文献

[1]

CAI R CZHANG Z JHAO Z F. Causal gene identification using combinatorial V-structure search[J]. Neural Networks201343: 63-71. DOI: 10.1016/j.neunet.2013.01.025 .

[2]

MOLLA MWADDELL MPAGE Det al. Using machine learning to design and interpret gene-expression microarrays[J]. AI Magazine200425(1): 23-44.

[3]

NOBLE D. Genes and causation[J]. Philosophical Transactions of the Royal Society A: Mathematical, Physical and Engineering Sciences2008366(1878): 3001-3015. DOI: 10.1098/rsta.2008.0086 .

[4]

COOKSON WLIANG L MABECASIS Get al. Mapping complex disease traits with global gene expression[J]. Nature Reviews Genetics200910(3): 184-194. DOI: 10.1038/nrg2537 .

[5]

DING CPENG H. Minimum redundancy feature selection from microarray gene expression data[J]. Journal of Bioinformatics & Computational Biology20083(2): 185-205.

[6]

BLEULER SPRELIC AZITZLER E. An EA framework for biclustering of gene expression data[C]//Proceedings of the 2004 Congress on Evolutionary Computation. New York: IEEE Press, 2004: 166-173. DOI: 10.1109/CEC.2004.1330853 .

[7]

CHAI L EMOHAMAD M SDERIS Set al. Inferring gene regulatory networks from gene expression data by a dynamic bayesian network-based model[C]//Distributed Computing and Artificial Intelligence: 9th International Conference. Heidelberg:Springer, 2012: 379-386. DOI: 10.1007/978-3-642-28765-7_45 .

[8]

GUYON IELISSEEFF A. An introduction to variable and feature selection[J]. Journal of Machine Learning Research20033: 1157-1182. DOI:10.1162/153244303322753616 .

[9]

CAI JLUO J WWANG S Let al. Feature selection in machine learning: A new perspective[J]. Neurocomputing2018300: 70-79. DOI: 10.1016/j.neucom.2017.11.077 .

[10]

WANG HLING ZYU Ket al. Towards efficient and effective discovery of Markov blankets for feature selection[J]. Information Sciences2020509: 227-242. DOI: 10.1016/j.ins.2019.09.010 .

[11]

龚俭, 梅海彬, 丁勇, . 多特征关联的入侵事件冗余消除[J]. 东南大学学报(自然科学版)200535(3): 366-371. DOI: 10.3321/j.issn: 1001-0505.2005.03.010 .

[12]

GONG JMEI H BDING Yet al. Multi-feature correlation redundance elimination of intrusion event[J]. Journal of Southeast University (Natural Science Edition)200535(3): 366-371. DOI: 10.3321/j.issn: 1001-0505.2005.03.010(Ch ).

[13]

HAO Z FZHANG HCAI R Cet al. Causal discovery on high dimensional data[J]. Applied Intelligence201542(3): 594-607. DOI: 10.1007/s10489-014-0607-0 .

[14]

PEARL J. Causality[M]. Cambridge:Cambridge University Press, 2009. DOI: 10.1017/cbo9780511803161 .

[15]

EDWARDS D. Introduction to Graphical Modelling[M]. Berlin:Springer Science & Business Media, 2012.

[16]

GAO TJI Q. Local causal discovery of direct causes and effects[J]. Advances in Neural Information Processing Systems20152: 2512–2520. DOI: 10.5555/2969442.2969520 .

[17]

TSAMARDINOS IBROWN L EALIFERIS C F. The max-min hill-climbing Bayesian network structure learning algorithm[J]. Machine Language200665(1): 31-78. DOI: 10.1007/s10994-006-6889-7 .

[18]

ZHANG HYAN C XXIA Y Wet al. Causal gene identification using non-linear regression-based independence tests[J]. IEEE/ACM Transactions on Computational Biology and Bioinformatics202320(1): 185-195. DOI: 10.1109/TCBB.2022.3149864 .

[19]

SPIRTES PGLYMOUR C NCausation SCHEINES R., Prediction, and Search [M]. Cambridge:MIT Press, 2000.

[20]

ZHANG HZHOU S GGUAN J Het al. Measuring conditional independence by independent residuals for causal discovery[J]. ACM Transactions on Intelligent Systems and Technology201910(5): 1-19. DOI: 10.1145/3325708 .

[21]

PELLET J PELISSEEFF A. Using Markov Blankets for causal structure learning[J]. Journal of Machine Learning Research20089(7): 1295–1342. DOI: 10.1145/1390681.1442776 .

[22]

ZHANG HZHOU S GYAN C Xet al. Recursively learning causal structures using regression-based conditional independence test[J]. Proceedings of the AAAI Conference on Artificial Intelligence201933(1): 3108-3115. DOI: 10.1609/aaai.v33i01.33013108 .

[23]

ZHANG HZHOU S GGUAN J H. Measuring conditional independence by independent residuals: Theoretical results and application in causal discovery[J]. Proceedings of the AAAI Conference on Artificial Intelligence201832(1): 2029 -2036. DOI: 10.1609/aaai.v32i1.11555 .

[24]

ZHANG HZHOU S GZHANG Ket al. Causal discovery using regression-based conditional independence tests[J]. Proceedings of the AAAI Conference on Artificial Intelligence201731(1): 1250-125. DOI: 10.1609/aaai.v31i1.10698 .

[25]

ZHANG KHYVÄRINEN A. On the identifiability of the post-nonlinear causal model[C]//Proceedings of the 25th Conference on Uncertainty in Artificial Intelligence. New York: ACM, 2009: 647-655. DOI: 10.5555/1795114.1795190 .

[26]

PETERS JJANZING DSCHÖLKOPF B. Causal inference on discrete data using additive noise models[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence201133(12): 2436-2450. DOI: 10.1109/TPAMI.2011.71 .

[27]

ZHANG HZHANG KZHOU S Get al. Testing independence between linear combinations for causal discovery[J]. Proceedings of the AAAI Conference on Artificial Intelligence202135(7): 6538-6546. DOI: 10.1609/aaai.v35i7.16810 .

[28]

GROSSE-WENTRUP MJANZING DSIEGEL Met al. Identification of causal relations in neuroimaging data with latent confounders: An instrumental variable approach[J]. NeuroImage2016125: 825-833. DOI: 10.1016/j.neuroimage.2015.10.062 .

[29]

RAMSEY J D. A scalable conditional independence test for nonlinear, non-Gaussian data[EB/OL]. 2014arXiv: 1401.5031.

[30]

FLAXMAN S RNEILL D BSMOLA A J. Gaussian processes for independence tests with non-iid data in causal inference[J]. ACM Transactions on Intelligent Systems and Technology20167(2): 1-23. DOI: 10.1145/2806892 .

[31]

PDAUDIN J J. Partial association measures and an application to qualitative regression[J]. Biometrika198067(3): 581-590. DOI: 10.1093/biomet/67.3.581 .

[32]

PENG JWANG PZHOU N Fet al. Partial correlation estimation by joint sparse regression models[J]. Journal of the American Statistical Association2009104(486): 735-746. DOI: 10.1198/jasa.2009.0126 .

[33]

GOLUB T RSLONIM D KTAMAYO Pet al. Molecular classification of cancer: Class discovery and class prediction by gene expression monitoring[J]. Science1999286(5439): 531-537. DOI: 10.1126/science.286.5439.531 .

[34]

CHEN A HTSAU Y WLIN C H. Novel methods to identify biologically relevant genes for leukemia and prostate cancer from gene expression profiles[J]. BMC Genomics201011: 274. DOI: 10.1186/1471-2164-11-274 .

[35]

JANZING DSTEUDEL BSHAJARISALES Net al. Justifying information-geometric causal inference[M]//Measures of Complexity. Cham: Springer International Publishing, 2015: 253-265. DOI: 10.1007/978-3-319-21852-6_18 .

[36]

KAGER LLION TATTARBASCHI Aet al. Incidence and outcome of TCF3-PBX1-positive acute lymphoblastic leukemia in Austrian children[J]. Haematologica200792(11): 1561-1564. DOI: 10.3324/haematol.11239 .

[37]

KEIM DHAILAT NMELHEM Ret al. Proliferation-related expression of p19/nm23 nucleoside diphosphate kinase[J]. The Journal of Clinical Investigation199289(3): 919-924. DOI: 10.1172/JCI115672 .

[38]

YANG PZHOU B BZHANG Zet al. A multi-filter enhanced genetic ensemble system for gene selection and sample classification of microarray data[J]. BMC bioinformatics201011(1): 1-12. DOI: 10.1186/1471-2105-11-S1-S5 .

[39]

GRISOLANO J LWESSELSCHMIDT R LPELICCI P Get al. Altered myeloid development and acute leukemia in transgenic mice expressing PML-RARα under control of cathepsin G regulatory sequences[J]. Blood199789(2): 376-387. DOI: 10.1006/bcmd.1997.0116 .

[40]

BERTOLI SPAUBELLE EBÉRARD Eet al. Ferritin heavy/light chain (FTH1/FTL) expression, serum ferritin levels, and their functional as well as prognostic roles in acute myeloid leukemia[J]. European journal of haematology2019102(2): 131-142. DOI: 10.1111/ejh.13183 .

[41]

STORR JDOLAN GCOUSTAN-SMITH Eet al. Value of monoclonal anti-myeloperoxidase (MPO7) for diagnosing acute leukaemia[J]. Journal of clinical pathology199043(10): 847-849. DOI: 10.1136/jcp.43.10.847 .

[42]

LINENBERGER M L. CD33-directed therapy with gemtuzumab ozogamicin in acute myeloid leukemia: Progress in understanding cytotoxicity and potential mechanisms of drug resistance[J]. Leukemia200519(2): 176-182. DOI: 10.1038/sj.leu.2403598 .

[43]

HATFIELD K JOLSNES A MGJERTSEN B Tet al. Antiangiogenic therapy in acute myelogenous leukemia: Targeting of vascular endothelial growth factor and interleukin 8 as possible antileukemic strategies[J]. Current Cancer Drug Targets20055(4): 229-248. DOI: 10.2174/1568009054064651 .

[44]

ZAGHLOUL AKAMAL HISMAIL M Met al. Soluble carcinoembryonic antigen cell adhesion molecule 1, 6 and 8 in acute myeloid leukemia: Their relation to survival and prognosis[J]. Life Science Journal201815(4):1-11. DOI: 10.7537/marslsj150418.01 .

[45]

SELLIN M EHOLMFELDT PSTENMARK Set al. Op18/Stathmin counteracts the activity of overexpressed tubulin-disrupting proteins in a human leukemia cell line[J]. Experimental Cell Research2008314(6): 1367-1377. DOI: 10.1016/j.yexcr.2007.12.018 .

[46]

JANOWSKA-WIECZOREK ABELCH A RJACOBS Aet al. Increased circulating colony-stimulating factor-1 in patients with preleukemia, leukemia, and lymphoid malignancies[J]. Blood199177(8): 1796-1803. DOI: 10.1182/blood.v77.8.1796.bloodjournal7781796 .

[47]

CHENG C LHOU H ALEE M Cet al. Higher bone marrow LGALS3 expression is an independent unfavorable prognostic factor for overall survival in patients with acute myeloid leukemia[J]. Blood2013121(16): 3172-3180. DOI: 10.1182/blood-2012-07-443762 .

[48]

NAGAI THARIGAE HISHIHARA Het al. Transcription factor GATA-2 is expressed in erythroid, early myeloid, and CD34+ human leukemia-derived cell lines[J]. Blood199484(4):1074-84. DOI: 10.1016/0955-3886(94)90139-2 .

[49]

HOYOS VSAVOLDO BQUINTARELLI Cet al. Engineering CD19-specific T lymphocytes with interleukin-15 and a suicide gene to enhance their anti-lymphoma/leukemia effects and safety[J]. Leukemia201024(6): 1160-1170. DOI: 10.1038/leu.2010.60 .

[50]

RUSINIAK M EYU MROSS D Tet al. Identification of B94 (TNFAIP2) as a potential retinoic acid target gene in acute promyelocytic leukemia[J]. Cancer Research200060(7): 1824-1829. DOI: 10.1097/00002820-200004000-00012 .

[51]

RUTELLA SRUMI CPUGGIONI Pet al. Expression of thrombospondin receptor (CD36) in B-cell chronic lymphocytic leukemia as an indicator of tumor cell dissemination[J]. Haematologica199984(5): 419-424. DOI: 10.1016/S0268-9499(99)90103-0 .

[52]

SEIKI MINOUE JTAKEDA Tet al. Direct evidence that p40x of human T-cell leukemia virus type I is a trans-acting transcriptional activator[J]. The EMBO Journal19865(3): 561-565. DOI: 10.1002/j.1460-2075.1986.tb04247.x .

[53]

TANAKA HITO T, KYO T, et al. Treatment with IFN? in vivo up-regulates serum-soluble TNF-related apoptosis inducing ligand (sTRAIL) levels and TRAIL mRNA expressions in neutrophils in chronic myelogenous leukemia patients[J]. European Journal of Haematology200778(5): 389-398. DOI: 10.1111/j.1600-0609.2007.00834.x .

[54]

HU X LYANG D FZIMMERMAN Met al. IRF8 regulates acid ceramidase expression to mediate apoptosis and suppresses myelogeneous leukemia[J]. Cancer Research201171(8): 2882-2891. DOI: 10.1158/0008-5472.CAN-10-2493 .

[55]

KIDSON C. Two leukocyte enzymes with catalase activity in acute leukemia[J]. Biochemical and Biophysical Research Communications19629(1/2): 138-141. DOI: 10.1016/0006-291X(62)90102-X .

[56]

陈玲. 急性白血病患者骨髓中细胞间粘附分子-3的表达与临床关系的研究[D]. 济南: 山东大学, 2008.

[57]

CHEN L. Study on the Expression of Intercellular Adhesion Molecule⁃3 in Bone Marrow of Patients with Acute Leukemia and its Clinical Relationship [D]. Jinan: Shandong University, 2008 (Ch).

[58]

刘继明,曾慧兰,张毅,. 白细胞介素8及其受体在急性白血病的表达及其意义[J]. 中华血液学杂志199920(1): 24-26. DOI: 10.3760/j:issn:0253-2727.1999.01.007 .

[59]

LIU J MZENG H LZHANG Yet al. Study on the expression of interleukin-8 and its receptors in acute leukemia[J]. Chinese Journal of Hematology199920(1): 24-26 (Ch). DOI: 10.3760/j:issn:0253-2727.1999.01.007 .

[60]

KONOPLEVA MMIKHAIL AESTROV Zet al. Expression and function of leptin receptor isoforms in myeloid leukemia and myelodysplastic syndromes: Proliferative and anti-apoptotic activities[J]. Blood199993(5): 1668-1676. DOI: 10.1182/blood.v93.5.1668.405a15_1668_1676 .

基金资助

国家自然科学基金(U1936205)

国家自然科学基金(61972100)

国家自然科学基金(62006051)

AI Summary AI Mindmap
PDF (1201KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/