基于实例硬度加权采样的增强Bagging集成分类方法

杨起年 ,  姚诗梦 ,  张砾匀 ,  罗应婷

四川大学学报(自然科学版) ›› 2026, Vol. 63 ›› Issue (4) : 823 -834.

PDF (1027KB)
四川大学学报(自然科学版) ›› 2026, Vol. 63 ›› Issue (4) : 823 -834. DOI: 10.19907/j.0490-6756.250339
深度学习方法在多物理耦合建模与计算中的应用

基于实例硬度加权采样的增强Bagging集成分类方法

作者信息 +

An enhanced Bagging ensemble classification method based on instance-hardness weighted sampling

Author information +
文章历史 +
PDF (1050K)

摘要

作为一种典型机器学习方法,集成学习旨在组合多个基分类器的输出结果,进行决策。其中,Bagging集成学习方法常被用于分类、回归、噪声环境建模及不均衡数据学习等。在噪声数据集上,传统的Bagging集成方法面临分类性能不稳定、对难分类样本关注不足的挑战。本文提出了一种融合实例硬度(Instance Hardness, IH)与增强自助采样机制(Enhanced Bootstrapping)的新型集成学习方法——eNewBagging,方法在eBagging框架基础上引入了基于实例硬度的加权采样策略,并通过为样本分配自适应权重来抑制噪声样本的影响、强化难分类样本学习,以便在保持分类器多样性的同时提高整体精度与鲁棒性。验证实验在7个UCI与KEEL公开数据集上进行。原始数据在k-近邻(k-Nearest Neighbors)与决策树(Decision Tree)基分类器下进行分类,并在从2%到30%的不同噪声水平下与只用k-近邻的多种基分类器进行性能比较。结果显示,eNewBagging算法在ACC、AUC与F1等3项指标上均取得最优或次优表现,相较BaggingIH算法与GrpMixBag算法在高噪声数据集上的下降幅度更小,表现出更强的噪声鲁棒性,从而所提方法能够在保持偏差与方差平衡的同时实现分类器边界样本的强化学习,显著提升模型在复杂数据环境中的泛化性能。本文的结果为解决噪声干扰与样本复杂性条件下的集成学习性能退化问题提供了一种高效框架。

Abstract

Ensemble learning is a class of machine learning methods that make decisions by constructing and combining the outputs of multiple base classifiers.Among these, the representative Bagging ensemble method is frequently utilized for classification, regression, modeling in noisy environments, and learning from imbalanced data.Addressing the issues of unstable classification performance and insufficient focus on hard-to-classify samples inherent in traditional Bagging methods when applied to noisy datasets, a new ensemble learning method named eNewBagging is proposed, which integrates Instance Hardness (IH) with an enhanced bootstrapping mechanism.Based on the eBagging framework, an IH-based weighted sampling strategy is introduced.By allocating adaptive weights to samples, this method suppresses the influence of noisy samples and intensifies the learning of hard-to-classify samples, thereby improving overall accuracy and robustness while maintaining classifier diversity.Experiments are conducted on seven public datasets from UCI and KEEL.Evaluations on the original data are performed using two base classifiers: k-Nearest Neighbors (kNN) and Decision Trees (DT).Furthermore, performance comparisons are conducted exclusively using the kNN base classifier under varying noise level ratios ranging from 2% to 30%.The results indicate that eNewBagging can achieve optimal or sub-optimal performance across the ACC, AUC, and F1 metrics.In comparison with BaggingIH and GrpMixBag, eNewBagging exhibits a smaller margin of decline on highly noisy datasets, demonstrating stronger noise robustness.While preserving the bias-variance balance, this method achieves enhanced learning of borderline samples, significantly elevating the model's generalization performance in complex data environments.It is expected that the eNewBagging method can provide an efficient framework to overcome the performance degradation of ensemble learning caused by noise interference and sample complexity.

Graphical abstract

关键词

集成学习 / Bagging / eBagging / 实例硬度 / 分类

Key words

ensemble learning / Bagging / eBagging / instance hardness / classification

引用本文

引用格式 ▾
杨起年,姚诗梦,张砾匀,罗应婷. 基于实例硬度加权采样的增强Bagging集成分类方法[J]. 四川大学学报(自然科学版), 2026, 63(4): 823-834 DOI:10.19907/j.0490-6756.250339

登录浏览全文

4963

注册一个新账户 忘记密码

处理多物理场耦合(Multiphysics Coupling)问题是航空航天、能源环境、生物医学及材料科学等领域面临的共同挑战。此类系统通常涉及多个物理场之间的非线性、多尺度耦合,其数据具有高维度、异质性强、噪声复杂及边界模糊等特点。随着系统复杂度不断提升,传统的数值方法和机器学习方法对此类数据进行建模与预测面临严峻挑战。面对多物理耦合数据的高不确定性与复杂模式特征,如何保持模型的稳定性、鲁棒性和泛化能力,成为当前智能建模与智能仿真的关键问题。
近年来,深度学习与数据驱动方法被广泛用于辅助多物理场耦合系统建模。这些方法具有良好非线性表达能力,能够有效弥补传统方法的不足。但是,多物理场耦合系统的数据一般包含不同形式的噪声与难分类区域,可能导致学习算法在训练过程中易受到异常样本的干扰,降低算法的预测性能。构建具有噪声鲁棒性且能够重点关注高复杂度样本的集成学习框架,对于提升数据驱动的多物理耦合系统建模的可靠性与可解释性具有重要价值。
集成学习(Ensemble Learning)方法能够显著提升模型的稳定性与鲁棒性。其核心思想源于“No Free Lunch”定理1,即通过组合多个基模型获得比单一模型更稳健的预测性能。Bagging(Bootstrap Aggregating)是最常用的集成方法之一,目前已被广泛应用于提升分类准确率2-5。该方法旨在通过对多个自助采样(Bootstrap Sampling)所生成的不稳定估计器进行聚合,以降低方差6、增强预测的稳定性。在很多应用场景中,Bagging集成学习方法的性能显著优于单一分类器4。通过在原始训练集上进行有放回的随机采样来训练多个分类器,Bagging方法能够有效降低过拟合风险、提高模型的泛化能力。例如,在昂贵多目标优化问题中,Bagging方法的思想被引入代理模型(Surrogate Model)构建,以提升模型在小样本条件下的泛化性能。Liu等7提出Bagging-based Surrogate-Assisted Evolutionary Algorithm(B-SAEA),通过对训练数据执行自助采样来构建多个基代理模型(如RBF网络),并集成这些模型的预测,以降低模型的方差、提高预测稳定性。B-SAEA方法有效缓解了昂贵优化中数据匮乏导致的单一模型不稳定问题,并与进化算法相结合显著提高了优化的收敛性与鲁棒性。
目前,Bagging方法在处理噪声数据或难分类样本时仍面临挑战8。其随机采样机制无法优先选择难分类样本或处理误分类实例,可能导致复杂实际场景中方法的性能下降。不同于传统采样方法,在不确定性估计场景中,Kim和Choi9提出了一种基于Bagging方法的树模型集成框架,用于在顺序模型优化(SMBO)中构建具有稳健不确定性估计能力的替代模型。该方法通过对训练数据执行过自助采样(Overbootstrap),并在多个随机化决策树上分别训练代理模型,形成一个多样化的、基于代理模型的集成方法(Surrogate Ensemble)。由于不同模型之间预测输出的差异被用于量化不确定性,该方法能够有效提高替代模型在稀疏样本区域的可信度。此外,在多目标油藏优化领域,Wang等10提出了MOO-SESA框架,并采用Bernoulli 采样机制:训练集中每个样本以50%概率独立入袋,生成大小不固定但更具多样性的子数据集。随后,MOO-SESA方法在各子集上分别训练SVR模型,并通过选择性集成策略动态地挑选表现互补的模型参与预测。这种基于Bagging方法的随机子采样方式能够有效增强代理模型的鲁棒性,在多目标油藏优化中取得显著性能提升。
最近,在改进Bagging方法的采样策略方面,研究者提出了两种改进型Bagging方法:BaggingIH11与GrpMixBag12。这两种方法均将实例硬度作为衡量样本复杂度的重要指标,用于指导采样过程,部分改善传统Bagging方法对噪声数据的处理性能。考虑到传统Bagging方法在训练集中易受噪声与离群点影响的问题,BaggingIH方法为样本分配与其实例硬度成反比的采样概率,以降低噪声样本与离群点的采样权重。尽管BaggingIH方法能够在采样阶段有效抑制噪声的影响,但其倾向于过度采样低难度样本,从而可能使基分类器难以充分学习边界样本特征。因此,在无噪声数据集中,其性能提升受限。GrpMixBag方法在重采样过程中采用3种采样策略的混合机制:“Easy”,“Regular”和“Hard”,Easy策略倾向采样低难度样本,Regular策略对应于传统Bagging方法的标准自助采样,而Hard策略则优先采样高难度样本。通过结合这三种策略,GrpMixBag方法旨在生成更具多样性的采样子集,增强基分类器的差异性。然而,由于Hard策略强调高难度样本,其基分类器可能过多学习包含噪声的样本,因而在含噪数据集中可能出现性能下降。
为了进一步改进Bagging集成学习框架,研究者提出了一些增强方法。其中,eBagging(Enhanced Bagging)方法通过引入基于误分类样本的自助采样机制(Error-based Bootstrapping)13,在一定程度上解决了以上问题。与传统Bagging方法不同,eBagging方法在采样过程中强调包含被误分类样本,从而使基分类器能够更好地学习复杂样本特征、提升整体性能。然而,eBagging方法并未直接考虑全数据集中样本的实例硬度差异。
本文提出了一种新的集成学习方法——eNewBagging。该方法基于eBagging框架并融合实例硬度信息,旨在构建更具鲁棒性与准确性的集成学习模型。实例硬度能够反映样本被误分类的概率,可被用于衡量样本在训练过程中的重要性14。另一方面,通过基于难度调整样本权重,eNewBagging方法能够构建更具信息量与多样性的训练集,训练出性能更优的基分类器。通过将基于实例硬度的加权采样策略与eBagging方法的误差优先机制相结合,eNewBagging方法既能够降低噪声样本的影响,又能强化对难分类样本的学习。该方法有望在增强分类器多样性与准确率的同时有效减少过拟合风险,从而在平衡与非平衡数据集上均取得优异性能。
后文的安排如下。第一节介绍实例硬度、数值计算方法及集成学习,并回顾Bagging方法及其改进方法。第二节详细介绍eNewBagging方法的实现步骤。第三节通过基准数据集实验验证所提方法的有效性,并与传统Bagging、eBagging、BaggingIH与 GrpMixBag等4种基线方法进行性能对比。第四节给出结论与未来的研究方向。

1 知识背景及方法

1.1 实例硬度

在机器学习领域,分类算法性能通常依赖于参数选择与训练数据集构成。然而,许多研究者在模型设计中往往过于关注参数调优,忽视训练数据复杂性对分类性能的影响。大多数数据复杂性度量方法仅描述数据集整体的复杂度,未反映单个样本的分类难度,从而无法解释特定样本被误分类的原因。

为刻画样本层面的分类难度,Smith等15提出了实例硬度的概念,旨在衡量某一特定数据集中样本被误分类的概率。一般而言,样本被误分类的概率不仅取决于用于建模的分类算法,还与该样本在训练集中相对于其他样本的分布密切相关。通过汇总多个分类算法的预测结果,可以得到样本被误分类概率的近似估计值。对于给定数据集中的一个样本xi,yi,其实例硬度的定义如下:

IHxi,yi=1-hHpyi|xi,hph|t

其中,t表示不包含样本xi,yi的训练集,hH为某一分类算法,H表示所有分类算法的集合,pyi|xi,h表示算法h将样本xi正确分类为类yi的概率,而ph|t则表示从算法集合H中选择算法h的概率。

在实际应用中,对H中所有算法进行求和计算实例硬度是不现实的。因此,可选取算法集合H的一个具有代表性的子集L来近似计算该指标。由于ph|t的确切值未知,通常假设集合L中的各分类器具有相同的先验概率。因此,公式可近似表示为:

IHLxi,yi=1-1Lj=1Lpyi|xi,hjt

其中hj表示集L中的第j个分类器。

实例硬度值依赖所选分类器集合L的构成,更大、多样性更高的分类器集合通常能提供更精确的估计结果。然而,Smith等15的研究表明,即便采用相对较小但具有代表性与多样性的分类器集合,也能在保证估计精度的同时显著提升计算效率。在选择分类器集合L时,通常优先考虑具有代表性且广泛使用的分类算法。Smith等选取20种常用分类器,基于分类器输出差异(Classifier Output Difference, COD)指标,通过层次聚类方法筛选出具有代表性的分类器子集,实现对实例硬度的高效估计。

1.2 集成学习与采样机制

集成学习是一类通过组合多个基分类器(Base Classifiers)的输出结果来进行决策的机器学习方法16,其性能主要依赖两个关键因素:基分类器的准确性(Accuracy)与多样性(Diversity)。这意味着基分类器不仅应该具有较高的预测能力,同时在决策特征上应该存在差异性17。尽管准确性与多样性在集成学习中同样重要,但二者之间的关系尚无明确理论分析18。多样性通常通过调整采样策略来实现,采样机制在提升集成模型性能方面具有核心作用。在并行集成框架中,训练子集的构建直接决定了基分类器之间的差异性。若采样机制无法提供足够的数据扰动,则多个基分类器会高度一致,导致其组合不会带来新的信息增益,反而会增加模型的计算复杂度,收效甚微。反之,合理的采样策略能够在保持样本代表性的同时提高模型对复杂数据分布的适应能力。因此,设计数据重采样策略是构建高性能集成模型的关键途径之一。

1.3 Bagging及基于采样的改进方法

Bagging方法是典型的并行集成方法,其核心是通过有放回抽样生成多个训练子集,然后在独立子集上训练基分类器,最终通过投票或平均融合结果。作为一种方差降低方法,Bagging在许多不稳定学习器上表现突出。然而,Bagging方法的随机采样机制也存在局限性:难样本可能在采样过程中被忽略,导致模型学习不足;采样过程不区分重要样本与一般样本,仅对噪声样本同样赋予较高权重;数据采样方式单一,可能使基分类器的多样性受限。

研究者主要围绕Bagging方法的采样过程提出改进。例如,BaggingIH方法通过实例硬度调整采样权重以抑制噪声影响;GrpMixBag方法则引入多策略混合采样,以增强基分类器差异性。两种方法均从噪声抑制或多样性增强的角度改进采样机制,往往难以同时满足噪声样本抑制、边界样本强化及采样多样性保证这三项核心需求。

1.4 eBagging的误差优先机制

eBagging方法13通过误分类样本强化策略保证误分类样本在训练阶段获得充分关注,使模型在一定程度上提升对复杂样本区域的识别能力。其核心思想是:使用预训练模型识别误分类样本,然后在每轮采样中将误分类样本全部纳入训练子集,并从正确分类样本中随机抽样补充。虽然eBagging方法能捕捉到部分难分类样本,但它并不区分结构性难样本(如边界样本)和随机噪声样本,且缺乏样本难度的量化指标,因而容易在高噪声数据集上性能出现下降。

2 eNewBagging

基于上述分析可以发现,实例硬度能有效刻画样本的分类难度,并提供区分结构性难样本与噪声样本的量化依据。eBagging方法的误差优先机制能够强化模型对误分类样本的关注,但缺乏难度分级能力。现有基于采样的Bagging改进方法则难以同时兼顾噪声抑制、边界样本学习、采样多样性。本文提出的eNewBagging方法的核心思想是:以实例硬度构建3类分层采样权重,在采样过程中同时实现噪声抑制与边界样本强化;融合eBagging方法的误差优先机制,使误分类样本得到持续关注;通过多策略有放回重采样机制提升基分类器的多样性。eNewBagging方法是eBagging方法的误差优先采样机制与实例硬度(IH)驱动的加权采样策略的结合。该框架设计既克服了传统Bagging方法在噪声场景中性能下降的问题,又避免了BaggingIH与GrpMixBag存在的边界样本学习不足或噪声过拟合问题

在eNewBagging方法中,每个样本根据其实例硬度被分配相应的权重:实例硬度值较高(接近1)的样本通常为噪声样本或类别边界模糊的样本;实例硬度值较低(接近0)的样本属于安全样本;中等实例硬度值(约为0.5)的样本多为决策边界附近的样本。通过为这些样本赋予不同的采样权重,eNewBagging使集成模型在训练过程中能够更关注那些具有挑战性的实例,不仅提升分类器对复杂样本的学习能力,也有效改善整个集成系统的分类性能与泛化表现。

eNewbagging方法的结构如图1所示。综合误差优先策略与IH权重,eNewBagging方法在每一轮弱分类器训练前执行以下步骤:

步骤1,预训练。在该阶段,首先在原始数据集上训练一个先验分类器,以区分被正确分类样本集合C与误分类的样本集合M。设正确分类样本集为

C={x1, y1, x2, y2, , xn, yn}

实例硬度向量为

IH=IH1, IH2, , IHn,  IHi0,1,

其中IHi表示第i个样本的实例硬度值,数值越大表示样本越难被正确分类。

步骤2,IH加权采样。对正确分类的样本集合,按照IH值进行加权采样。在每一轮训练t=1, 2, , T中,样本权重wi满足以下条件:

1) 若t mod 3=1,则使用式(3)

wi=1 -IHi

2)若t mod 3=2,则使用式(4)

wi=12+12cos πIHi

3)若 t mod 3 = 0,则使用式(5)

wi=12+IHi, IHi0.5,1-IHi, IHi>0.5

这里基于实例硬度构建的三类分层采样是方法的核心,旨在构建高质量、多样性的训练集来提升基分类器的性能。3种加权函数具有互补性:第一种权重策略(对应线性函数)采用线性方式降低高实例硬度样本的权重,优先关注安全样本,减少噪声干扰;第二种权重策略(对应余弦函数)通过余弦函数的非线性变化使权重在安全样本与边界样本之间取得平衡,在保持稳定性的同时兼顾边界学习;第三种权重策略(对应分段函数)对中等难度样本(IH0.5)赋予更高权重,强化模型对决策边界区域的学习能力,并在不同样本类型之间实现动态平衡。在样本加权后,进行权重归一化来计算每个样本的采样概率,即

pi=wii=1nwi

步骤3,增强自助采样。利用概率pi进行有放回采样,生成基于IH加权采样的训练子集,并与误分类样本集合M合并,得到训练集St。这种采样策略能够确保模型在训练中始终关注难分类样本,同时保持样本的多样性。这样,高权重样本被选中的概率更大,而低权重样本(例如噪声样本)则被抑制。

最后,在增强自助采样生成的多个训练集上分别训练多个基分类器,最终的预测是通过对T个基分类器的多数投票获得19

Ex=argmaxy𝒴t=1TIEtx=y

其中I·为指示函数。

该机制实现了误分类样本的强化学习,提高正确分类但靠近边界的样本采样概率,降低难度低样本的采样,并生成多样化的训练子集,以有效避免基分类器之间的过渡相关性。算法实现的伪代码参见算法1,其中基于实例硬度的不等概率重采样可被视为一种蒙特卡洛采样过程,该过程在概率归一化约束下从离散分布中独立抽样,其统计收敛性由大数定律保证。随着基分类器数量T的增加,重采样分布对目标加权分布的逼近误差以𝒪T-1/2的速率衰减。在实际应用中,有限规模的集成已能够有效提升模型多样性和噪声鲁棒性,因而无需追求过大的采样规模。

算法1 eNewBagging算法

输入:数据集D={x1, y1, x2, y2, , xN, yN},其中yi𝒴=1,,k;先验模型的学习算法L;集成规模T;实例数量N;类别数量k;待分类的未标记实例x

输出:Ex = argmaxy𝒴t=1TIEtx=y(多数投票决策)。

1) 训练先验模型:hLD;

2) 初始化集合:C  (正确分类实例),M  (错误分类实例);

3) for i = 1, , N do

4)    if hxi=yi then

5)       C. addxi,yi

6)   else

7)      M.addxi,yi,

8)   end if

9) end for

10) 对正确分类的实例计算实例硬度IH= IH1, IH2, , IHC,  IHi0,1

11) for t = 1, , T do

12)   根据式(3)~(5)计算权重wi

13)   每个实例xi的采样概率为pi=wi/Σwi

14)   从C中按采样概率pi有放回采样C个实例,并与M合并得到训练集St

15)   训练基分类器 EtBaseClassifierSt

16) end for。

3 仿真实验

3.1 数据集

选取来自UCI和KEEL数据库的7个真实世界数据集。为验证所提方法在噪声环境下的有效性与鲁棒性,在训练集标签中引入不同水平的噪声,分别对每个数据集加入2%、4%、6%、8%、10%、20% 和 30% 的标签噪声,构建不同噪声强度的实验样本。

3.2 基线算法

在预训练阶段,基学习器采用决策树模型,内部节点的最小裂样本数设为2,且当节点包含的样本数少于2时不再进行进一步划分。随后,选择4种基线算法,即传统Bagging,eBagging,BaggingIH和GrpMixBag,每种采样算法均执行10次迭代训练,并分别采用决策树(DT)和k-近邻分类器(kNN,k=3)分类算法作为基分类器。具体来说,原始数据实验采用决策树与kNN基分类器,噪声鲁棒性实验则以kNN为基分类器,并在高噪条件下验证各算法的稳定性。鉴于eNewBagging算法是一种与基模型选取无关的集成框架,理论上可以扩展至任意可监督学习器,本文选取kNN与决策树作为代表性基分类器,以验证方法的有效性。所有算法均基于scikit-learn机器学习库20的默认参数设置实现,并通过统一的实现框架来确保实验结果具有可比性与公平性。

3.3 评价指标

在分类任务中,最直观的性能度量指标为准确率(Accuracy, ACC)21,即正确预测样本占总样本的比例。然而,准确率在处理类别不平衡问题时存在一定局限22。因此,本研究同时采用以下3个性能指标进行综合评估:ACC用于衡量整体分类正确率,适用于平衡数据集;AUC(Area Under the ROC Curve)23通过计算ROC曲线下的面积评估模型区分正负类的能力,适用于不平衡数据集;F1值(F1-score)24结合查准率(Precision)与查全率(Recall),作为综合性指标能更全面地反映模型的分类性能。eNewBagging在算法层面支持多分类任务,其性能在多分类场景下的验证将作为未来工作的重要研究方向。

在实验评估中,采用5×5交叉验证(5-by-5-fold Cross Validation)方法25,每个数据集进行5折交叉验证,并重复5次,以获得稳定且具有统计显著性的实验结果。该评估方式能够有效减少数据划分的随机性对结果造成的影响,提高实验结论的可靠性。本文挑选L=6个方法进行IH计算,并使用p=5×q=5交叉验证均值作为每个样本的IH估计值。对于具有d维特征的N个样本而言,假设每次训练时算法l的计算复杂度为𝒪(ClN1-1/q,d),则最终IH的总计算复杂度为𝒪(pql=1LClN1-1/q,d}

3.4 原始数据实验结果

1~3分别给出了5种集成算法在原始数据集上的实验结果,实验分别采用kNN 与决策树(DT)作为基分类器。同时,表中还列出了各算法在所有数据集上的平均得分。从结果可以明显看出,eNewBagging算法在所有测试数据集上均表现出最优或接近最优的平均性能。此外,将eNewBagging算法与其余4种基线算法进行成对比较可以看到,eNewBagging算法的分类准确率整体优于传统Bagging算法及其改进。其中,根据表1表2,我们得到以下结论:

1) 总体来看,针对噪声问题设计的两种集成方法BaggingIH算法和eNewBagging算法在多数数据集下获得最高评分,但并未在所有数据集上对比其它算法取得显著优势;

2) eNewBagging算法在平均得分上表现最好,其整体性能在5种集成算法中最优;

3) 5种算法在低噪声数据集上的性能差异相对较小,主要应归因于数据集噪声水平较低使引入实例硬度的优势未能充分体现;

4) 尽管噪声水平较低,eNewBagging算法在多数数据集上仍优于其他基于实例硬度的集成算法,验证了本文提出的改进策略的有效性与普适性。

表3中,GrpMixBag算法在F1值指标上表现最优,原因可能在于该方法能够起到边界优化器的作用。GrpMixBag算法通过提升分类器多样性来有效细化决策边界,特别是在概率分布接近0.5的关键区域。这种边界优化在固定阈值下能直接改善分类结果,显著提升F1指标表现。

在不同基分类器表现方面,决策树在含噪或高方差数据集上更容易出现过拟合。相比之下,kNN作为一种基于实例的惰性学习方法,不对数据分布作强假设,其多数投票或加权平均机制可以有效减轻个别噪声样本的影响。从表3中结果可以看到,在部分数据集(如ring与mammographic mass)上,kNN在Bagging集成方法下的性能更为稳定,特别是当结合改进算法(如eNewBagging或BaggingIH算法)时。另外,在AUC指标结果中,采用kNN作为基分类器的eNewBagging算法取得最高平均 AUC值(0.865 5)。尽管决策树整体平均AUC值更高(0.901 8),但其在不同数据集间的波动较大,如在ring数据集上的AUC值出现显著下降。在噪声环境中,模型的稳定性与一致性往往比峰值性能更为关键。决策树虽然在干净数据上表现较好,但在高噪声条件下性能下降更为明显,而kNN在噪声环境下则表现出更强的稳定性。这一观察结果促使我们在后续加噪实验中仅使用kNN作为基分类器,以便进一步分析各算法在不同噪声水平下的鲁棒性。

3.5 噪声数据实验

在机器学习模型中,噪声鲁棒性是一项重要且理想的性质,因为真实世界的数据通常包含不同程度的标签噪声或特征噪声。本实验研究将系统性分析分类噪声对 Bagging 技术性能的影响。为了研究分类噪声的作用机制,我们在7个数据集上分别随机地注入标签噪声,并在表4~9中报告了5种Bagging算法分别在2%和10%噪声水平下的平均分类性能,而4%、6%和8%噪声水平的数据结果在折线图中体现。我们得到以下结论:

1) 在5个噪声水平数据集上,BaggingIH算法与eNewBagging算法的整体表现明显优于其他算法;

2) eNewBagging算法在大多数噪声数据集上均取得最佳结果,并在各噪声水平下达到最高的平均准确率;

3) GrpMixBag算法在噪声数据集上的表现较差。

为了进一步直观呈现不同算法在噪声水平变化下的性能表现,图2以折线图绘制了5种算法在不同噪声水平下的平均分类准确率。可以看到,随噪声水平的提高,所有算法的性能均呈下降趋势,其中eNewBagging算法的性能下降幅度最小。图3的AUC得分结果显示出类似的趋势。

值得注意的是,BaggingIH算法的性能下降幅度并未明显劣于eNewBagging算法。为进一步分析这一现象,本文在更高噪声水平(20% 与 30%)下进行了附加实验,结果见表10图4图5。可以看到,在更极端的噪声条件下,eNewBagging算法性能始终优于 BaggingIH算法,并保持更小的性能下降率。因此,可以认为eNewBagging算法在噪声环境中的表现更为鲁棒,能取得更优结果。

表8表9的F1值指标中,GrpMixBag算法在低噪声时取得最佳性能。这是因为,在低噪声环境下,IH值主要反映样本对真实边界判别的难度而不是噪声程度。此时,适度关注“Hard”样本可以细化分类边界、有效提高召回率,从而GrpMixBag算法在F1指标(对精确率与召回率均敏感)上表现出一定优势。当噪声水平增加时,过度关注该部分则将引入更多的噪声采样,该算法的边界增强优势转为噪声放大劣势,从而随着噪声水平提升其性能迅速下降。所以,本文将重点放在图6中0~30%噪声水平下的F1曲线。结果显示,在噪声较低时,GrpMixBag算法的F1表现最佳,而eNewBagging算法则相对较弱。随着噪声水平不断增加,eNewBagging算法的相对性能逐渐提升,并在高噪声水平最终超越其他算法。 这一趋势可通过eNewBagging算法的鲁棒性机制进行解释。eNewBagging算法通过自适应样本加权机制来降低噪声样本的权重,减弱噪声的干扰效应并保持预测性能的稳定性,因而其F1指标下降速度较慢,并在高噪声条件下成为最优算法。与eNewBagging算法相比,GrpMixBag算法的多样性优势在噪声环境中可能转化为劣势。其分组与混合策略倾向于将噪声样本扩散到多个训练子集中,可能导致每个基分类器均学习到部分噪声模式,且这些噪声所诱发的错误无法通过集成投票有效抵消,反而会随着多样性的增加放大基分类器之间对噪声实例的分歧,结果使集成模型的决策边界趋于不稳定,精确率与召回率更快速衰减。

4 结论

本文提出了一种改进的Bagging集成方法eNewBagging,方法在传统自助采样框架的基础上引入了3种基于实例硬度的重采样策略,结合eBagging方法的误差优先机制,以更合理的方式构建训练子集。通过同时增强基分类器的多样性与有效性,eNewBagging方法能够在有限样本条件下采样生成质量更高的训练数据,对构建稳定可靠的集成模型具有积极作用,尤其是在工业场景中代理模型的构建与数据稀缺问题处理。

在实验部分,本文分别采用原始数据集与人工噪声污染数据集对所提方法进行了验证,并与包括传统Bagging方法在内的4种基线集成方法进行比较,特别是同样引入实例硬度思想的BaggingIH方法和GrpMixBag方法。结果表明,在无噪声数据集上,eNewBagging方法与原始Bagging方法的表现接近。在噪声数据集上,eNewBagging方法显著优于所有基线方法,展现出更强的鲁棒性与泛化能力。这说明基于实例难度的加权策略能够有效抑制噪声样本影响,提升模型在复杂数据环境中的稳定性。

尽管eNewBagging方法在抗噪声学习方面具有优势,但其局限性仍需关注。实例硬度的计算依赖于多个基分类器的输出,必然增加额外的计算开销。未来的研究将进一步分析算法复杂度,探索更高效的实例难度估计方法,以便在性能与计算成本之间取得平衡。

参考文献

[1]

Wolpert D HMacready W G.No free lunch theorems for optimization [J].IEEE Trans Evol Comput19971(1): 67-82.

[2]

Kilimci ZOmurca S.Enhancement of the heuristic optimization based extended space forests with classifier ensembles [J].Int Arab J Inf Technol202017(2): 188-195.

[3]

Mohamed HNegm AZahran Met al.Assessment of ensemble classifiers using the bagging technique for improved land cover classification of multispectral satellite images [J].Int Arab J Inf Technol201815(2): 270-277.

[4]

Quinlan J R.Bagging, boosting, and C4.5 [C]// Proceedings of the National Conference on Artificial Intelligence.Menlo Park: AAAI Press, 1996: 725-730.

[5]

Breiman L.Bagging predictors [J].Mach Learn199624(2): 123-140.

[6]

Kohavi RWolpert D H.Bias plus variance decomposition for zero-one loss functions [C]// International Conference on Machine Learning.Bari: IMLS, 1996: 275-283.

[7]

Liu YLiu JTan Set al.A bagging-based surrogate-assisted evolutionary algorithm for expensive multi-objective optimization [J].Neural Comput Appl202234(14): 12097-12118.

[8]

Bauer EKohavi R.An empirical comparison of voting classification algorithms: Bagging, boosting, and variants [J].Mach Learn199936(1): 105-139.

[9]

Kim JChoi S.On uncertainty estimation by tree-based surrogate models in sequential model-based optimization [C]// International Conference on Artificial Intelligence and Statistics.Brookline: PMLR, 2022: 4359-4375.

[10]

Wang LDeng RZhang Let al.A novel surrogate-assisted multi-objective well control parameter optimization method based on selective ensembles [J].Processes202412(10): 2140.

[11]

Walmsley F NCavalcanti G D COliveira D V Ret al.An ensemble generation method based on instance hardness [C]// International Joint Conference on Neural Networks.Piscataway: IEEE, 2018: 1-8.

[12]

Kabir ARuiz CAlvarez S A.Mixed bagging: A novel ensemble learning framework for supervised classification based on instance hardness [C]// International Conference on Data Mining.Piscataway: IEEE, 2018: 1073-1078.

[13]

Tüysüzoğlu GBirant D。Enhanced bagging (eBagging): A novel approach for ensemble learning [J].Int Arab J Inf Technol202017(4): 515-528.

[14]

Paiva P Y AMoreno C CSmith-Miles Ket al.Relating instance hardness to classification performance in a dataset: A visual approach [J].Mach Learn2022111(8): 3085-3123.

[15]

Smith M RMartinez TGiraud-Carrier C.An instance level analysis of data complexity [J].Mach Learn201495(2): 225-256.

[16]

Dietterich T G.Ensemble methods in machine learning [C]//International workshop on multiple classifier systems.Berlin/Heidelberg: Springer, 2000: 1-15.

[17]

Dietterich T G.An experimental comparison of three methods for constructing ensembles of decision trees: Bagging, boosting, and randomization [J].Mach Learn200040(2): 139-157.

[18]

Krawczyk BGalar MJeleń Łet al.Evolutionary undersampling boosting for imbalanced classification of breast cancer malignancy [J].Appl Soft Comput201638: 714-726.

[19]

Zhou Z H.Ensemble methods: Foundations and algorithms [M].Boca Raton: CRC Press, 2012.

[20]

Pedregosa FVaroquaux GGramfort Aet al.Scikit-learn: Machine learning in Python [J].J Mach Learn Res201112: 2825-2830.

[21]

Duda R OHart P EStork D G.Pattern classification [M].2nd ed.New York: John Wiley & Sons, 2001.

[22]

Fatourechi MWard R KMason S Get al.Comparison of evaluation metrics in classification applications with imbalanced datasets [C]// International Conference on Machine Learning and Applications.Piscataway: IEEE, 2008: 777-782.

[23]

Powers D M W.Evaluation: From precision, recall and F-measure to ROC, informedness, markedness and correlation [J].J Mach Learn Tech20112(1): 37-63.

[24]

Bekkar MDjemaa H KAlitouche T A.Evaluation measures for models assessment over imbalanced data sets [J].J Inf Eng Appl20133(10): 27-38.

[25]

Kohavi R.A study of cross-validation and bootstrap for accuracy estimation and model selection [C]// International Joint Conference on Artificial Intelligence.Montreal: Morgan Kaufmann, 1995: 1137-1145.

基金资助

四川省自然科学基金(2026NSFSCZY0056)

AI Summary AI Mindmap
PDF (1027KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/