在临床环境中,常需对患者的疾病状态进行分类,例如,心理疾病的诊断、影像学肿瘤分型等。然而,分类结果易受评价者的主观判断影响,导致不同评价者对同一组受试者的分类结果存在实质性差异
[1-3]。为评估分类工具的可靠性,研究者常会使多名评价者独立判断,随后通过量化其分类结果的一致程度来估计可靠性
[4]。对于无序分类结局,Kappa系数应用最为广泛,但其存在显著局限性
[5-7],包括著名的kappa悖论
[8]。为此,Gwet于2008年提出了AC
1系数(第一阶一致性系数)
[9, 10]。多项研究表明
[11-14],相比于Kappa系数,AC
1系数能提供更稳定、更可靠的估计值。
数据缺失是研究中一种常见且无法避免的现象
[15],在一致性研究领域亦是如此
[16]。例如,受试者中途失访、评价资源受限、评价者更替等,导致受试者未能获得所有评价者的评价。为描述缺失值模式的复杂性,Little和Rubin提出了3种缺失机制
[17]:完全随机缺失(MCAR)指缺失概率与变量本身及其他变量的取值均无关;随机缺失(MAR)指缺失概率与其他变量的观测值相关;非随机缺失(MNAR)指缺失概率与变量本身的未观测值相关。
数据缺失会直接导致一致性评价信息不完整,进而影响研究结论的可靠性
[18]。面对这一问题,研究者常采用删除法或填补法
[19-24]。在删除法中,最常用的是删除所有非完整评价的受试者,仅保留获得全部评价者评价的受试者进行分析
[16];另一种则是仅删除未被任何评价者评价的受试者,以最大化利用所有可用的配对数据
[22]。在填补法方面,众数填补使用变量的非缺失值的众数来填补,是对分类数据进行缺失值填补的最简单方法之一
[25]。与机器学习等新兴填补方法相比,众数填补法因不依赖复杂的模型,在处理评价者数量少的一致性评价研究这类小样本数据时表现更为稳定,不易发生过拟合现象。
然而,目前尚不清楚在数据缺失的情况下,哪种处理方法能提供最准确和可靠的AC1系数估计值,以及各方法在不同缺失情况下的具体表现和适用场景。因此,本文将通过模拟研究,比较上述缺失值处理方法在应用于AC1系数计算时的统计性能,以帮助研究者在实际应用中选择合适的处理方法。
1 资料和方法
1.1 AC1系数
Gwet提出的AC
1系数可以解决Kappa悖论,并适用于两名或多名评价者及两个或多个类别的场景
[9, 22]。在AC
1框架内,评价者的评价结果被划分为两种类型:偶然评价和确定评价。当评价者不确定将受试者分到哪一类别时,会发生偶然评价,反之发生确定评价。假设评价者将
n个受试者划分到
k个类别。任意一对评价者对受试者的分类结果按照偶然评价和确定评价可整理为
表1。当评价者均做确定评价时,他们必然将受试者正确分类到同一类别,其结果完全一致,因此
表1中部分单元格为0。
Gwet将AC1系数定义为,
其中
表示观察一致率,
表示偶然一致率。不同评价者数量场景下AC
1系数的计算公式见
表2。
1.2 缺失值处理
1.2.1 删除零评价受试者法
仅删除未被任何评价者评价的受试者
[22]。当评价者A和B共同评价
n个受试者时,零评价受试者对应
表3中“Missing-Missing”交叉单元格的受试者。在计算AC
1系数的过程中,将完全排除这
nmm 个受试者,即
nmm =0。
当考虑缺失时,调整后的观察一致率计算仅限于同时被评定者A和B评价的受试者,定义为,
与观察一致率不同,偶然一致率的计算考虑了未被所有评价者评价的受试者。其形式同
表2,
,但不同之处在于对边际总数的定义包括评价缺失的受试者,
在涉及多评价者的场景下,考虑缺失的观察一致率定义为,
其中n’表示被两个或多个评价者评价的受试者数量,rij 表示将受试者i分类到类别j的评价者数量,ri 表示对受试者i进行评价的评价者数量。偶然一致率为,其中。
1.2.2 删除非完整评价受试者法
当受试者未获得所有评价者的完整评价时,直接删除该受试者
[21],使用完整数据计算AC
1系数,也称为列表删除。该方法操作简单,但当缺失比例较高时会丢失大量信息,影响分析结果的准确性。
1.2.3 评价者众数填补法
当受试者
i的分类结果存在缺失时,填补值为该受试者的其他评价者的非缺失分类结果的众数
[20],使用填补后数据计算AC
1系数。但需注意,当仅有1名评价者完成评价时,因无足够数据计算众数,此时填补值将直接取该名评价者的分类结果。在这种情况下,填补结果本质上依赖单一评价者,导致观察一致性的高估。
1.2.4 受试者众数填补法
当评价者
q的分类结果存在缺失时,填补值为该评价者对其他受试者的非缺失分类结果的众数
[20],使用填补后数据计算AC
1系数。这种方法能有效保留评价者的个人诊断偏好。例如,评价者A的灵敏度较高,将60%的患者分类为焦虑症,则其填补值为“焦虑症”;而评价者B的特异度较高,将40%的患者分类为焦虑症,则其填补值为“非焦虑症”。
1.3 模拟设计
使用Monte Carlo模拟比较各缺失值处理方法的统计性能。模拟包含两种评价场景:①简单场景(2评价者2分类),②复杂场景(8评价者4分类)。模拟参数包括样本量
n,疾病流行率
Pr,第
q个评价者的偶然评价率
rq 和缺失比例
M。样本量
n取为25、50、100、200,基本反映了评价者间一致性研究中常见的样本量大小
[13, 21, 26]。疾病流行率
Pr 模拟了均衡和偏态两类场景,以探讨方法在不同数据分布下的表现
[27]。偶然评价率上限设为0.20,这是由于若评价者做出偶然评价的概率太大,说明其诊断能力不足,尚无法有效参与评价试验。因此定义0.05为低偶然评价率、0.20为高偶然评价率
[9, 26]。具体参数设置见
表4。
1.3.1 模拟步骤
首先基于预设的疾病流行率(即每个类别在总体中的占比)进行随机抽样,生成一个样本量为
n且类别数为
k的评价矩阵。然后按照评价者的偶然评价率
rq 对评价矩阵进行伯努利抽样,若抽样结果为“1”,表明是偶然评价,则随机等概率抽取一个类别替代原始类别,否则保留原始类别
[26]。最后引入3种缺失机制
[28]:MCAR:设置每个分类结果被抽取为缺失的概率相等;MAR:额外模拟性别变量,并设置男性的分类结果缺失概率是女性的两倍;MNAR:设置第1种类别的缺失概率是其他类别的3倍。为保证结果的稳定性,每个参数组合重复模拟1000次,并计算每次模拟样本下的AC
1系数。
1.3.2 评价指标
以完整数据集的AC
1系数估计值作为真值,使用偏差:
和均方误差(
MSE):
作为评价指标
[16]。
2 结果
2.1 简单场景(2评价者2分类)下的比较
在2评价者2分类的场景下,随着缺失比例的增加,所有缺失值处理方法的性能均呈现下降趋势,具体表现为偏差逐渐偏离0,MSE持续增大(图
1、
2)。在疾病流行率均衡[
Pr =(0.50,0.50)]的情况下,评价者众数填补法在各场景中表现均为最差,在MNAR且缺失比例达到50%时,其偏差高达0.70,同时MSE达到0.59。大部分场景下,各方法均表现出正偏差,除在高偶然评价率(
r1=0.20,
r2=0.20)下,受试者众数填补法在MCAR和MAR下表现出负偏差。相比之下,删除零评价受试者和删除非完整评价受试者法在各场景中表现较好。在MCAR和MAR下,这两种方法的偏差几乎为0,且在MNAR下偏差控制在±0.30内。而在MSE指标上,这两种方法均不超过0.16,且删除零评价受试者法的MSE在多数场景下更小。在缺失比例超过30%之后,尤其是进入40%~50%的区间时,所有方法在MNAR下的偏差和MSE出现了大幅度的上升,而在MCAR和MAR下,删除零评价受试者和删除非完整评价受试者法的偏差和MSE仍保持在较低水平(
图1)。
在疾病流行率非均衡[
Pr =(0.90,0.10)]的情况下,受试者众数填补法在MNAR下表现最佳,其偏差控制在±0.10的范围内,MSE保持在0.09以下。特别在样本量充足时(
n=100、200),且缺失比例不超过30%时,该方法的MSE几乎为0。在MCAR和MAR下,评价者众数填补法仍表现为最差,删除零评价受试者和删除非完整评价受试者法仍保持偏差接近0,MSE均不超过0.05。但在MNAR下,这两种方法出现负偏差,在缺失比例为50%,偏差达到-0.20,此时删除非完整评价受试者法的MSE表现最差,最高至0.16,而删除零评价受试者法略好,MSE不超过0.12。类似地,当缺失比例超过30%时,所有方法在MNAR下的性能下降幅度增大(
图2)。
2.2 复杂场景(8评价者4分类)下的比较
在8评价者4分类的场景下,所有缺失值处理方法的性能也随着缺失比例的增加而下降(图
3、
4)。在疾病流行率均衡[
Pr =(0.25,0.25,0.25,0.25)]的情况下,评价者众数填补法的综合表现仍为最差,其偏差达到0.48,MSE达到0.21。除受试者众数填补法在高偶然评价率(
rq =0.20,
q=1,…,8)场景下出现负偏差外,各方法普遍表现出正偏差。删除零评价受试者法表现最佳,偏差几乎为0,且MSE同样接近0,受试者众数填补法的偏差控制在±0.02内,MSE表现与之相当,但在高偶然评价率场景下略差,MSE达到0.02。删除非完整评价受试者法在MCAR和MAR下的偏差也接近0,但其MSE表现不稳定,在MNAR下估计值随缺失比例增加而时高时低,且在小样本量(
n=25)高缺失比例(
M=50%)的场景下,MSE表现最差,达到0.33,提示该方法估计变异较大(
图3)。
在疾病流行率非均衡[
Pr =(0.70,0.15,0.10,0.05)]的情况下,删除零评价受试者法在MCAR和MAR下仍保持最佳性能,偏差和MSE均接近0。但在MNAR下,该方法出现负偏差(缺失比例50%时偏差为-0.20),此时综合表现最佳的是受试者众数填补法,偏差控制在±0.15内,MSE保持在0.05以下。尽管删除非完整评价受试者法在MCAR和MAR下且缺失率较低时偏差接近0,但其MSE表现最差。在缺失比例超过30%之后,删除非完整评价受试者的偏差和MSE出现了大幅度上升,而受试者众数填补法在MNAR下增幅较小,表现最为稳定,以及删除零评价受试者在MCAR和MAR下表现优异,偏差和MSE增幅最小(
图4)。
3 讨论
数据缺失是研究中常见的问题,恰当的处理方法能减轻缺失数据的不良影响
[29]。现已有文献探讨了不同缺失值处理方法在Kappa系数估计中的表现
[16, 30, 31]。然而,针对AC
1系数的缺失值处理方法研究尚处于空白状态。因此,本文通过模拟多种缺失场景下的无序评价数据,探讨删除零评价受试者法、删除非完整评价受试者法、评价者众数填补法和受试者众数填补法对AC
1系数估计的影响。
在疾病流行率均衡的场景中,删除零评价受试者法表现最佳,在MCAR和MAR下偏差近乎为0且MSE最低。这可能是因为该方法最大限度地保留了可用信息,即仅剔除完全未接受评价的受试者,而未丢弃部分缺失的观测,从而更准确地估计边际概率
[22]。这种稳健表现与学者De Raadt在Kappa系数研究中的发现相类似
[31]。然而,在疾病流行率非均衡且为MNAR的场景中,该方法出现负偏差(在缺失比例为50%时偏差至-0.20),性能显著下降。此时,受试者众数填补法表现更为稳健,该方法通过利用评价者自身的评分模式进行填补,较好地保留了个体评价偏好,因此在MNAR场景下具有较好的适应能力。尽管删除非完整评价受试者法在既往研究中应用最多
[19, 21, 24],但本研究结果显示其仅适用于简单场景(2评价者2分类)、缺失比例较低且为MCAR/MAR的情况,其余情况下因信息丢失导致MSE波动剧烈、估计不稳定,这一缺点亦被其他研究指出
[18, 29, 32]。评价者众数填补法在各类场景下均表现最差,尤其在MNAR且缺失比例50%的场景下偏差高达0.70,提示该方法的性能已几乎失效。其根本问题在于当仅有1名评价者完成评价时,该方法实质是将单一评价者的评价推广为“共识”,人为放大了观察一致性,导致对AC
1系数的高估。尽管本文主要聚焦于无序分类数据,但也为有序分类数据中的缺失值处理提供了参考。例如,删除零评价受试者法在保留信息方面的优势可能同样适用于有序分类场景。而受试者众数填补法由于其保留个体评价偏好的特性,可能在有序分类中处理MNAR缺失时也展现出同样稳健的性能。但这些推断仍需后续验证。
总之,不存在一种普遍最优的方法,应根据具体场景进行选择。首先,不建议使用评价者众数填补法。其次,删除非完整评价受试者法仅在2评价者2分类、低缺失比例且缺失机制为MCAR / MAR时可作为一种简单选择。然后,在疾病流行率均衡或缺失机制为MCAR/ MAR时,优先推荐删除零评价受试者法,而当涉及非均衡的疾病流行率且怀疑存在MNAR时,受试者众数填补法应作为更优处理方法。需指出的是,缺失比例过高时任何方法效果均有限,应重点在于预防数据缺失,而非事后处理
[29]。此外,建议在应用中汇报多种处理方法下的AC
1系数估计值,以确保结果的可靠性
[33]。
本文存在一定的局限性。尽管模拟参数覆盖了常见的范围,但现实世界的数据结构可能更为复杂,例如评价者或类别数量更多、结局为有序分类等。此外,本文探讨的4种处理方法相对较为简单。未来的研究可以进一步探索更复杂的数据结构
[34]和更先进的缺失值处理方法
[35]对AC
1系数估计的影响。
广东省基础与应用基础研究基金(2022A1515012152)