0 引 言
在传统的研究中,人们一般首先假设样本数据来自某个特定的分布总体,然后基于这个总体进行后续的统计推断。但随着科技发展,我们所面临的数据越来越复杂。在很多情形下,样本数据在不同局部可能有不同的特性,单一的参数分布族无法确切地描述观测数据,人们想到用混合分布模型对复杂数据进行统计分析。混合分布模型最早可追溯到Newcomb
[1 ] 和Pearson
[2 ] 的相关工作。近三十几年来,混合分布模型发展迅速,应用广泛,尤其是在生物分析、资源评价、金融股票等领域
[3 ] 。比较典型的例子有
[4 ] :l) 渔业研究中,鱼的体长可以度量,但其性别和年龄不易确定,需要研究如何由体长数据确定不同年龄组和不同性别鱼群的比例;2) 沉积岩学中,一个沙样中颗粒大小的分布已知,但不知道其中包含有哪些不同种类的矿石;3) 医学诊断中可对一组病人做临床调查,但他们所患疾病属于哪一种类型是未知的;4) 在RFLP-QTL连锁分析中,可以知道每个个体的标记基因型及性状值,这个性状值是由三种类型的QTL基因型混合而成,并且个体的QTL基因型未知,如何由标记基因型的表型去推断QTL与标记之间的连锁以及QTL效应值。此外,混合分布模型在寿命数据分析
[5 ] 和污染数据分析中也扮演着重要角色。早在1952年,Davis
[6 ] 就注意到在寿命实验中,元件寿命分布函数可能为两个分布函数的混合。
考虑独立同分布的随机变量列X 1 , … , X n ,具有分布函数
F α ( x ) = ( 1 - α ) F 1 ( x ) + α F 2 ( x ) (1)
其中
F 1 ( x ) , F 2 ( x ) 都是分布函数。通常我们更关心
F 1 ( x ) ,认为数据样本应该服从
F 1 ( x ) ,但却受到了来自分布
F 2 ( x ) 的数据的污染,称
F 1 ( x ) 为主分布,
α 为污染系数,它衡量数据受污染的程度。1964年Huber
[7 ] 考虑了
F 1 ( x ) 为标准正态分布而
F 2 ( x ) 是一族关于原点对称的分布的情形。一个特殊的情况就是:
F 1 ( x ) 和
F 2 ( x ) 是具有相同形式但含有不同参数的分布,即
F 1 ( x ) = F ( x ; θ 1 ) , F 2 ( x ) = F ( x ; θ 2 ) [8 ] 。近十年来,删失数据和截尾数据
[9 ] 的发展已经取得了很大的成果,但是关于污染数据
[10 ] 的研究却很少。污染数据的处理越来越受到重视,有广泛应用背景。
污染数据服从混合分布,对于混合分布常用的参数估计方法有矩估计、极大似然估计等方法。但遗憾的是,在小样本场合,这些估计将会有较大的偏差和方差。小样本估计问题在社会经济系统、生物医学系统和航空航海系统等领域中是普遍存在的。在疲劳寿命实验中,随着科学技术的迅速发展,产品的可靠性越来越高。很多时候由于人力、财力等的限制,重复实验的代价昂贵,这时可以获取的实验数据是非常少的。如果依然采用极大似然估计等方法进行统计推断,一般无法达到期望的效果。因此,适用于小样本情况下的疲劳寿命分布特性研究是很有必要的。早在20世纪60年代,国外学者已经开始研究小样本问题,80至90年代国内外普遍开始重视小样本问题的研究。比小样本情况更极端的一种情形为单样本情况,即只根据一个观测样本进行相关的统计推断。单样本情形下的统计推断研究非常少。(1)式中,在
F 1 ( x ) 和
F 2 ( x ) 是具有相同形式但含有不同参数的指数分布的特殊情形下,2017年Nie等
[11 ] 考虑了基于混合指数分布的单个观测值对
F 1 ( x ) 的可靠性函数的无偏估计。他们假设随机变量
T 服从参数为
λ ( λ > 0 ) 的指数分布,记为
T ∼ E ( λ ) ,则
T 的可靠性函数为
R ( t ) = e x p ( - t λ ) , t ≥ 0 。两个指数分布的混合,记为
p E ( λ ) + ( 1 - p ) E ( θ λ ) , p ∈ R , λ > 0 , θ > 0 。值得注意的是,有时
p 在[0,1]之间时无法满足实际情况的需要,因此这里的混合分布可以理解为广义的混合分布。在
p , θ 已知,
λ 未知的情况下,Nie等基于混合指数分布
p E ( λ ) + ( 1 - p ) E ( θ λ ) 的单个观测值首先给出了
R ( t ) 的两个无偏估计,然后讨论了这两个无偏估计的适当性,最后给出了这两个无偏估计的方差的无偏估计。
寿命数据分析方法是进行可靠性工程研究的基础。常见系统中元件可靠性参数以及工程材料的疲劳寿命和强度分布都可以用Gamma分布很好地描述。指数分布、卡方分布、Erlang分布是Gamma分布的特例。自从Gamma分布被提出,各国研究者就对Gamma分布的参数估计问题产生了极大兴趣并为之付出了不懈努力。极大似然估计、矩估计、贝叶斯估计等为最常用的方法。由于Gamma分布在拟合数据方面比较灵活,适应性较强,因此Gamma分布被广泛地应用于众多统计应用中。常用的寿命概率分布描述寿命数据规律的能力都有限,而一个拟合能力更好的寿命概率分布模型可以让我们更精确的进行统计推断。混合Gamma分布的稠密性是指对于任何非负随机变量,我们总可以选择一个适当的混合Gamma分布把它拟合到任意需要的精度。因此,从理论上讲,选择混合Gamma分布拟合寿命数据总是合理的
[12 ] 。
本文假设随机变量T 服从参数为( α , β ) 的Gamma分布,记为T ∼ G a ( α , β ) ,其概率密度函数为
f ( x ; α , β ) = β α Γ ( α ) x α - 1 e - β x , x ≥ 0 0 , x < 0
其中α > 0 是形状参数,β > 0 是尺度参数,Γ ( ⋅ ) 为Gamma函数。Gamma分布与很多分布都有关系:当α = 1 时,它是指数分布;当α 为正整数时,它是Erlang分布;当β = 1 2 时,它是卡方分布。T 的可靠性函数为R ( t ) = ∫ t ∞ f ( x ; α , β ) d x , t ≥ 0 。考虑两个Gamma分布的混合p G a ( α , β ) + ( 1 - p ) G a ( α , θ - 1 β ) ,其中p ∈ R , θ > 0 , α > 0 , β > 0 。p ( 1 - p ) = 0 或θ = 1 时混合Gamma分布会退化成单个Gamma分布,故本文假定p ( 1 - p ) ≠ 0 且θ ≠ 1 。我们认为数据本身服从的分布为G a ( α , β ) ,但受到了来自分布G a ( α , θ - 1 β ) 数据的影响,我们更想得到分布G a ( α , β ) 的可靠性函数R ( t ) 。在p , θ 已知,α , β 未知的情况下,本文基于混合Gamma分布的单个观测值首先给出R ( t ) 的两个无偏估计,然后讨论了这两个无偏估计的适当性。假设p ∈ R , θ > 0 , α > 0 , β > 0 。p G a ( α , β ) + ( 1 - p ) G a ( α , θ - 1 β ) 的“密度”记为
ψ ( x ; p , θ , α , β ) = p β α Γ ( α ) x α - 1 e - β x + ( 1 - p ) ( β ⋅ θ - 1 ) α Γ ( α ) x α - 1 e - β θ x , x ≥ 0 0 , x < 0
概率密度函数应该具有非负性。由于此时p 的范围并不仅限于[ 0,1 ] 之间,所以此时ψ ( x ; p , θ , α , β ) 可能为负;只有当ψ ( x ; p , θ , α , β ) 非负时,它才成为概率密度函数。
1 ψ ( x ; p , θ , α , β ) 的非负性
下面根据p 的取值范围分三种情况讨论ψ ( x ; p , θ , α , β ) 的非负性。
1) p > 1 。ψ ( x ; p , θ , α , β ) 非负,即要求
p β α Γ ( α ) x α - 1 e - β x + ( 1 - p ) ( β ⋅ θ - 1 ) α Γ ( α ) x α - 1 e - β θ x ≥ 0
上式等价于
解上述不等式得:1 - 1 p α ≤ θ < 1 。因此,当p > 1 时,ψ ( x ; p , θ , α , β ) ≥ 0 当且仅当1 - 1 p α ≤ θ < 1 。
2) p < 0 。ψ ( x ; p , θ , α , β ) 非负,即要求
p β α Γ ( α ) x α - 1 e - β x + ( 1 - p ) ( β ⋅ θ - 1 ) α Γ ( α ) x α - 1 e - β θ x ≥ 0
上式等价于
解上述不等式得:1 < θ ≤ 1 - 1 p α 。因此,当p < 0 时,ψ ( x ; p , θ , α , β ) ≥ 0 当且仅当1 < θ ≤ 1 - 1 p α 。
3) 0 < p < 1 。显然ψ ( x ; p , θ , α , β ) ≥ 0 。
综上所述,ψ ( x ; p , θ , α , β ) 成为概率密度函数的充要条件为下面三种情况之一成立:
(d1) p > 1 且1 - 1 p α ≤ θ < 1 ;
(d2) p < 0 且1 < θ ≤ 1 - 1 p α ;
(d3) 0 < p < 1 。
2 可靠性函数的两个无偏估计
假设p ∈ R , θ > 0 已知,α > 0 , β > 0 未知。设T ∼ G a ( α , β ) ,T 的概率密度函数为f ( x ; α , β ) ,可靠性函数为R ( t ) = ∫ t ∞ f ( x ; α , β ) d x , t ≥ 0 。易知R ( 0 ) = 1 。若条件(d1)、(d2)、(d3)之一成立,则ψ ( x ; p , θ , α , β ) 是混合Gamma分布p G a ( α , β ) + ( 1 - p ) G a ( α , θ - 1 β ) 的概率密度函数。假设X 是来自ψ ( x ; p , θ , α , β ) 的单个样本,我们的目的是基于单个观测X 找到R ( t ) ( t > 0 ) 的无偏估计。
假设g ( x ; t ) 是定义在( 0 , ∞ ) × ( 0 , ∞ ) 上的实值函数且关于x 左连续,下面的定理给出g ( X ; t ) 是R ( t ) 的无偏估计的必要条件。
定理1 假设条件(d1)、(d2)、(d3)之一成立,X 是来自ψ ( x ; p , θ , α , β ) 的单个样本。若E ( g ( X ; t ) ) = R ( t ) , ∀ t > 0 ,则g ( x ; t ) 满足
I ( x > t ) = p g ( x ; t ) + ( 1 - p ) g ( θ x ; t ) , ∀ t , x > 0 (2)
证 若E ( g ( X ; t ) ) = R ( t ) , ∀ t > 0 ,则
∫ 0 ∞ I ( x > t ) f ( x ; α , β ) d x = R ( t ) = E ( g ( X ; t ) ) =
∫ 0 ∞ g ( x ; t ) ( p f ( x ; α , β ) + ( 1 - p ) f ( x ; α , θ - 1 β ) ) d x = p ∫ 0 ∞ g ( x ; t ) f ( x ; α , β ) d x + ( 1 - p ) ∫ 0 ∞ g ( x ; t ) f ( x ; α , θ - 1 β ) d x = p ∫ 0 ∞ g ( x ; t ) f ( x ; α , β ) d x + ( 1 - p ) ∫ 0 ∞ g ( θ x ; t ) f ( x ; α , β ) d x = ∫ 0 ∞ ( p g ( x ; t ) + ( 1 - p ) g ( θ x ; t ) ) f ( x ; α , β ) d x
从而∀ t > 0 ,有
∫ 0 ∞ ( I ( x > t ) - ( p g ( x ; t ) + ( 1 - p ) g ( θ x ; t ) ) ) 1 Γ ( α ) x α - 1 e - β x d x = 0 , ∀ β > 0
由拉氏变换的唯一性,∀ t > 0 ,有
I ( x > t ) - ( p g ( x ; t ) + ( 1 - p ) g ( θ x ; t ) ) = 0 , a . e . x > 0
又I ( x > t ) 和g ( x ; t ) 是关于x 左连续的,所以
I ( x > t ) - ( p g ( x ; t ) + ( 1 - p ) g ( θ x ; t ) ) = 0 , ∀ t , x > 0
证毕。
引理1 假设条件(d1)、(d2)、(d3)之一成立,X 是来自ψ ( x ; p , θ , α , β ) 的单个样本。若g ( x ; t ) 满足(2)式,则有
E ( g ( θ X ; t ) ) = R ( θ - 1 t ) , ∀ t > 0 (3)
证 若g ( x ; t ) 满足(2)式,则有
E ( g ( θ X ; t ) ) = ∫ 0 ∞ g ( θ x ; t ) ( p f ( x ; α , β ) + ( 1 - p ) f ( x ; α , θ - 1 β ) ) d x = p ∫ 0 ∞ g ( θ x ; t ) f ( x ; α , β ) d x + ( 1 - p ) ∫ 0 ∞ g ( θ 2 x ; t ) f ( x ; α , β ) d x = ∫ 0 ∞ ( p g ( θ x ; t ) + ( 1 - p ) g ( θ 2 x ; t ) ) f ( x ; α , β ) d x = ∫ 0 ∞ I ( θ x > t ) f ( x ; α , β ) d x = ∫ 0 ∞ I ( x > θ - 1 t ) f ( x ; α , β ) d x = R ( θ - 1 t )
证毕。
形式上定义
g 1 ( x ; t ) ≜ ∑ k = 0 ∞ 1 p 1 - 1 p k I ( x > θ - k t ) , x , t > 0 (4)
g 2 ( x ; t ) ≜ ∑ k = 0 ∞ 1 1 - p 1 - 1 1 - p k I ( x > θ k + 1 t ) , x , t > 0 (5)
下面的引理给出g 1 ( x ; t ) 和g 2 ( x ; t ) 收敛的充要条件。
引理2 p > 1 2 或θ < 1 是g 1 ( x ; t ) 收敛的充要条件;p < 1 2 或θ > 1 是g 2 ( x ; t ) 收敛的充要条件。
证 首先分情况讨论g 1 ( x ; t ) 的收敛性。
1) p > 1 2 。由于1 - 1 p < 1 ,因此| g 1 ( x ; t ) | ≤ ∑ k = 0 ∞ 1 p 1 - 1 p k = 1 p - | p - 1 | ,此时g 1 ( x ; t ) 收敛。
2) θ < 1 。若0 < x ≤ t ,则g 1 ( x ; t ) = 0 ;若0 < t < x ,令N = l o g θ t x - 1 ,则θ - N t < x ≤ θ - ( N + 1 ) t ,故g 1 ( x ; t ) = ∑ k = 0 N 1 p 1 - 1 p k 收敛。
3) p ≤ 1 2 且θ > 1 。若0 < t < x ,则g 1 ( x ; t ) = ∑ k = 0 ∞ 1 p 1 - 1 p k 发散;若0 < x ≤ t ,N = l o g θ t x ,则θ - ( N + 1 ) t < x ≤ θ - N t ,故g 1 ( x ; t ) = ∑ k = N + 1 ∞ 1 p 1 - 1 p k 发散。
综上可知,p > 1 2 或θ < 1 是g 1 ( x ; t ) 收敛的充要条件。接下来分情况讨论g 2 ( x ; t ) 的收敛性。
1) p < 1 2 。由于1 - 1 1 - p < 1 ,因此| g 2 ( x ; t ) | ≤ ∑ k = 0 ∞ 1 1 - p 1 - 1 1 - p k = 1 1 - p - | p | ,此时g 2 ( x ; t ) 收敛。
2) θ > 1 。若0 < x ≤ θ t ,则g 2 ( x ; t ) = 0 ;若0 < θ t < x ,令N = l o g θ x t - 1 ,则θ N t < x ≤ θ N + 1 t ,故g 2 ( x ; t ) = ∑ k = 0 N - 1 1 1 - p 1 - 1 1 - p k 收敛。
3) p ≥ 1 2 且θ < 1 。若0 < θ t < x ,则g 2 ( x ; t ) = ∑ k = 0 ∞ 1 1 - p 1 - 1 1 - p k 发散;若0 < x ≤ θ t ,令N = l o g θ x t ,则θ N + 1 t < x ≤ θ N t ,故g 2 ( x ; t ) = ∑ k = N ∞ 1 1 - p 1 - 1 1 - p k 发散。
综上可知,p < 1 2 或θ > 1 是g 2 ( x ; t ) 收敛的充要条件。证毕。
g 1 ( x ; t ) 和
g 2 ( x ; t ) 的收敛性情况如
表1 。
假设条件(d1)、(d2)、(d3)之一成立。接下来我们在
表1 所示条件下证明
g 1 ( X ; t ) 和
g 2 ( X ; t ) 是
R ( t ) 的两个无偏估计量,其中
X 是来自
ψ ( x ; p , θ , α , β ) 的单个样本。
定理2 若(d1)或1 2 < p < 1 成立,则有E ( g 1 ( X ; t ) ) = R ( t ) , ∀ t > 0 ; 若(d2)或0 < p < 1 2 成立,则有E ( g 2 ( X ; t ) ) = R ( t ) , ∀ t > 0 。
证 假设(d1)、(d2)、0 < p < 1 2 、1 2 < p < 1 之一成立,X 是来自ψ ( x ; p , θ , α , β ) 的单个样本,则
E ( I ( X > t ) ) = ∫ t ∞ p f ( x ; α , β ) + ( 1 - p ) f ( x ; α , θ - 1 β ) d x =
p ∫ t ∞ f ( x ; α , β ) d x + ( 1 - p ) ∫ θ - 1 t ∞ f ( x ; α , β ) d x = p R ( t ) + ( 1 - p ) R ( θ - 1 t ) , ∀ t > 0 (6)
因此,
R ( t ) = E 1 p I ( X > t ) - 1 - p p R ( θ - 1 t ) =
E 1 p I ( X > t ) - 1 - p p E 1 p I ( X > θ - 1 t ) - 1 - p p R ( θ - 2 t ) = E 1 p I ( X > t ) + 1 p p - 1 p I ( X > θ - 1 t ) + p - 1 p 2 R ( θ - 2 t ) = E 1 p I ( X > t ) + 1 p p - 1 p I ( X > θ - 1 t ) + p - 1 p 2 E 1 p I ( X > θ - 2 t ) - 1 - p p R ( θ - 3 t ) = E 1 p I ( X > t ) + 1 p p - 1 p I ( X > θ - 1 t ) + 1 p p - 1 p 2 I ( X > θ - 2 t ) + p - 1 p 3 R ( θ - 3 t ) = ⋯ = E ∑ k = 0 N 1 p 1 - 1 p k I ( X > θ - k t ) + 1 - 1 p N + 1 R ( θ - ( N + 1 ) t ) , N = 0,1 , 2 , ⋯
当(d1)或1 2 < p < 1 成立时,l i m N → ∞ 1 - 1 p N + 1 R ( θ - ( N + 1 ) t ) = 0 ,由于
∑ k = 0 N 1 p 1 - 1 p k I ( x > θ - k t ) ≤ 1 p - | p - 1 |
根据控制收敛定理有
R ( t ) = l i m N → ∞ E ∑ k = 0 N 1 p 1 - 1 p k I ( X > θ - k t ) = E ∑ k = 0 ∞ 1 p 1 - 1 p k I ( X > θ - k t ) = E ( g 1 ( X ; t ) )
所以当(d1)或1 2 < p < 1 成立时,g 1 ( X ; t ) 是R ( t ) 的一个无偏估计。
在(6)式中用θ t 代替t ,得到:E ( I ( X > θ t ) ) = p R ( θ t ) + ( 1 - p ) R ( t ) , ∀ t > 0 ,因此
R ( t ) = E 1 1 - p I ( X > θ t ) - p 1 - p R ( θ t ) = E 1 1 - p I ( X > θ t ) - p 1 - p E 1 1 - p I ( X > θ 2 t ) - p 1 - p R ( θ 2 t ) = E 1 1 - p I ( X > θ t ) - 1 1 - p p 1 - p I ( X > θ 2 t ) + - p 1 - p 2 R ( θ - 2 t ) = E 1 1 - p I ( X > θ t ) - 1 1 - p p 1 - p I ( X > θ 2 t ) + - p 1 - p 2 E 1 1 - p I ( X > θ 3 t ) - p 1 - p R ( θ 3 t ) = E 1 1 - p I ( X > θ t ) - 1 1 - p p 1 - p I ( X > θ 2 t ) + 1 1 - p - p 1 - p 2 I ( X > θ 3 t ) + - p 1 - p 3 R ( θ 3 t ) = ⋯ = E ∑ k = 0 N 1 1 - p - p 1 - p k I ( X > θ k + 1 t ) + - p 1 - p N + 1 R ( θ N + 1 t ) = E ∑ k = 0 N 1 1 - p 1 - 1 1 - p k I ( X > θ k + 1 t ) + 1 - 1 1 - p N + 1 R ( θ N + 1 t ) , N = 0,1 , 2 , ⋯
当(d2)或0 < p < 1 2 成立时,l i m N → ∞ ( 1 - 1 1 - p ) N + 1 R ( θ N + 1 t ) = 0 ,由于
| ∑ k = 0 N 1 1 - p 1 - 1 1 - p k I ( x > θ k + 1 t ) | ≤ 1 1 - p - | p |
根据控制收敛定理,有
R ( t ) = l i m N → ∞ E ( ∑ k = 0 N 1 1 - p 1 - 1 1 - p k I ( X > θ k + 1 t ) ) = E ( ∑ k = 0 ∞ 1 1 - p 1 - 1 1 - p k I ( X > θ k + 1 t ) ) = E ( g 2 ( X ; t ) )
所以当(d2)或0 < p < 1 2 成立时,g 2 ( X ; t ) 是R ( t ) 的一个无偏估计。证毕。
g 1 ( X ; t ) 和
g 2 ( X ; t ) 都是
R ( t ) 的基于单个样本
X 的无偏估计量,与Nie等
[11 ] 得到的两个无偏估计形式上一致。他们工作中的
X 服从混合指数分布,这里的
X 服从混合Gamma分布。
3 无偏估计的适当性
假设条件(d1)、(d2)、(d3)之一成立,X 是来自ψ ( x ; p , θ , α , β ) 的单个样本,在p ≠ 1 2 时g 1 ( X ; t ) 或g 2 ( X ; t ) 是可靠性函数R ( t ) 的无偏估计。由于R ( t ) 取值范围为[0,1],因此要保证g 1 ( X ; t ) , g 2 ( X ; t ) 的取值范围也为[0,1],称此时的估计是适当的。接下来讨论在什么样的条件下g 1 ( X ; t ) , g 2 ( X ; t ) 才是适当的。
定理3 若(d1)成立,则g 1 ( X ; t ) 是R ( t ) 的一个适当的无偏估计;若(d2)成立,则g 2 ( X ; t ) 是R ( t ) 的一个适当的无偏估计。
证 若(d1)成立,根据
表1 ,此时
g 1 ( x ; t ) 收敛。由于
0 < 1 - 1 p < 1 ,因此
g 1 ( x ; t ) 满足:
0 ≤ g 1 ( x ; t ) < ∑ k = 0 ∞ 1 p 1 - 1 p k = 1 。从而
g 1 ( X ; t ) 是
R ( t ) 适当的无偏估计。
若(d2)成立,根据
表1 ,此时
g 2 ( x ; t ) 收敛。由于
0 < 1 - 1 1 - p < 1 ,因此
g 2 ( x ; t ) 满足:
0 ≤ g 2 ( x ; t ) < ∑ k = 0 ∞ 1 1 - p 1 - 1 1 - p k = 1 。从而
g 2 ( X ; t ) 是
R ( t ) 适当的无偏估计。证毕。
注1 由
表1 可知,若(d1)成立,
g 2 ( x ; t ) 不是收敛的。若(d2)成立,
g 1 ( x ; t ) 不是收敛的。
注2 当1 2 < p < 1 时,g 1 ( X ; t ) 是R ( t ) 的无偏估计,但不是适当的;当0 < p < 1 2 时g 2 ( X ; t ) 是R ( t ) 的无偏估计,但不是适当的。下面说明之。
1) 对于g 1 ( x ; t ) ,根据定理2,当1 2 < p < 1 时g 1 ( X ; t ) 是R ( t ) 的一个无偏估计。根据θ 的范围分两种情况讨论g 1 ( X ; t ) 的适当性。
a) 1 2 < p < 1 , θ < 1 。若0 < t < x ,令N = l o g θ t x - 1 ,则θ - N t < x ≤ θ - ( N + 1 ) t ,故
g 1 ( x ; t ) = ∑ k = 0 N 1 p 1 - 1 p k = 1 - 1 - 1 p N + 1
由于1 - 1 p < 0 ,因此当N 为偶数时g 1 ( x ; t ) 大于1。所以g 1 ( X ; t ) 不是适当的。
b) 1 2 < p < 1 , θ > 1 。若0 < x ≤ t ,令N = l o g θ t x ,则θ - ( N + 1 ) t < x ≤ θ - N t ,故
g 1 ( x ; t ) = ∑ k = N + 1 ∞ 1 p 1 - 1 p k = 1 - 1 p N + 1
由于1 - 1 p < 0 ,因此当N 为偶数时g 1 ( x ; t ) 小于0。所以g 1 ( X ; t ) 不是适当的。
2) 对于g 2 ( x ; t ) ,根据定理2,当0 < p < 1 2 时g 2 ( X ; t ) 是R ( t ) 的一个无偏估计。根据θ 的范围分两种情况讨论g 2 ( X ; t ) 的适当性。
a) 0 < p < 1 2 , θ < 1 。若0 < x ≤ θ t ,令N = l o g θ x t ,则θ N + 1 t < x ≤ θ N t ,故
g 2 ( x ; t ) = ∑ k = N ∞ 1 1 - p 1 - 1 1 - p k = 1 - 1 1 - p N
由于1 - 1 1 - p < 0 ,因此当N 为奇数时g 2 ( x ; t ) 小于0。所以g 2 ( X ; t ) 不是适当的。
b) 0 < p < 1 2 , θ > 1 。若0 < θ t < x ,令N = l o g θ x t - 1 ,则θ N t < x ≤ θ N + 1 t ,故
g 2 ( x ; t ) = ∑ k = 0 N - 1 1 1 - p 1 - 1 1 - p k = 1 - 1 - 1 1 - p N
由于1 - 1 1 - p < 0 ,因此当N 为奇数时g 2 ( x ; t ) 大于1。所以g 2 ( X ; t ) 不是适当的。
根据上面的讨论,
g 1 ( X ; t ) 和
g 2 ( X ; t ) 不可能同时是
R ( t ) 的适当的无偏估计。可以发现,只有当混合权重
( p 或
1 - p ) 其中一个为负值的时候,
g 1 ( X ; t ) 或
g 2 ( X ; t ) 才可能是
R ( t ) 的适当的无偏估计。这个结论和Nie等
[11 ] 指数分布情形下的结论一致。
4 数值模拟
假设条件(d1)成立,T ~ G a ( α , β ) ,其概率密度函数为f ( x ; α , β ) ,其可靠性函数为R ( t ) = ∫ t ∞ f ( x ; α , β ) d x 。混合Gamma分布记为p G a ( α , β ) + ( 1 - p ) G a ( α , θ - 1 β ) ,其概率密度函数为ψ ( x ; p , θ , α , β ) ,其分布函数为F ( x ) = ∫ 0 x ψ ( x ; p , θ , α , β ) d x 。用逆采样方法生成混合Gamma分布的随机观测:首先,假设随机变量U 服从区间[0,1]上的均匀分布,利用计算机生成U 的一个随机观测u ,然后求解x 使得F ( x ) = u 。取x 为混合Gamma分布的一个随机观测。根据x 得到R ( t ) ( t > 0 ) 的无偏估计g 1 ( x ; t ) ,并与真实的可靠性函数R ( t ) 进行比较。
取
p = 1.1 , θ = 0.8 , α = 4 , β = 1 ,当用计算机生成单个随机观测
x 后,根据(4)式求出
g 1 ( x ; t ) ,并与真实的可靠性函数
R ( t ) 作比较。当生成不同的单个随机观测时,
g 1 ( x ; t ) 和
R ( t ) 的比较如
图1 和
图2 。
图1 为
x = 3.2 时的模拟结果,
图2 为
x = 5.4 时的模拟结果。可以看出,
图1 和
图2 中
g 1 ( x ; t ) 能够较好地估计
R ( t ) 。
g 1 ( x ; t ) 的估计效果取决于混合Gamma分布的随机观测
x 。若在单个观测的情况下利用经验分布函数去估计
R ( t ) ,只能得到只有一个阶梯的阶梯函数(取值为0或1)。由(4)式知
g 1 ( x ; t ) 是一个阶梯函数,且有好几个阶梯,因此在单个观测的情况下,
g 1 ( x ; t ) 能够比经验分布函数更好地估计
R ( t ) 。所以,本文的工作是有意义的。
接下来验证g 1 ( x ; t ) 的无偏性。每进行一次试验,得到一个观测,进而可得一个无偏估计g 1 ( x ; t ) 。 当进行大量试验时,希望由此得到的大量g 1 ( x ; t ) 的平均值能精确地估计R ( t ) 。取p = 1.1 , θ = 0.8 ,重复进行500次随机试验,一共生成500个观测x i , i = 1,2 , ⋯ , 500 ,其中x i 为第i 次试验得到的观测。计算R ( t ) 的500个无偏估计g 1 ( x i ; t ) , i = 1,2 , ⋯ , 500 ,其平均值记为
g 1 ( t ) = 1 500 ∑ i = 1 500 g 1 ( x i ; t )
当
α , β 取不同的值时,
g 1 ( t ) 和
R ( t ) 的比较如
图3 和
图4 。
图3 为
α = 4 , β = 1 时的模拟结果,
图4 为
α = 3 , β = 2 时的模拟结果。
图3 与
图1 和2均是在
p = 1.1 , θ = 0.8 , α = 4 , β = 1 时的模拟结果,不同的是
图1 和
图2 是根据单个无偏估计的模拟,而
图3 是根据500个无偏估计的模拟。通过
图3 与
图1 和2的比较可以看出:当用到的无偏估计的数量很多时,多个估计的平均值能比较精确的拟合
R ( t ) ,即验证了
g 1 ( x ; t ) 的无偏性。
图4 是
α = 3 , β = 2 时利用500个无偏估计的模拟结果,进一步验证了
g 1 ( x ; t ) 的无偏性。
5 结 语
本文基于混合Gamma分布的单个观测值讨论了Gamma分布可靠性函数的无偏估计及其相关性质。 首先,给出了混合Gamma分布的概率密度函数可定义的充要条件。其次,在p ∈ R , θ > 0 已知,α > 0 , β > 0 未知的情况下,基于混合Gamma分布的单个观测值给出了Gamma分布的可靠性函数R ( t ) 的无偏估计g 1 ( x ; t ) 和g 2 ( x ; t ) 。接下来,我们讨论了g 1 ( x ; t ) 和g 2 ( x ; t ) 的适当性,发现当p > 1 且1 - 1 p α ≤ θ < 1 时g 1 ( x ; t ) 在[0,1]之间,当p < 0 且1 < θ ≤ 1 - 1 p α 时g 2 ( x ; t ) 在[0,1]之间。最后,我们利用计算机生成模拟数据,验证了g 1 ( x ; t ) 和g 2 ( x ; t ) 的无偏性。
Nie等
[11 ] 在混合指数分布的情况给出了指数分布可靠性函数的无偏估计及其相关性质,本文中的相关结论是基于混合Gamma分布得到的,是其工作的推广。
国家自然科学基金(11171263)