结合局部密度样本合成和类间插值的协同训练

吕佳 ,  王雨 ,  李帅军

武汉大学学报(理学版) ›› 2024, Vol. 70 ›› Issue (6) : 687 -696.

PDF (1914KB)
武汉大学学报(理学版) ›› 2024, Vol. 70 ›› Issue (6) : 687 -696. DOI: 10.14188/j.1671-8836.2023.0030
机器学习

结合局部密度样本合成和类间插值的协同训练

作者信息 +

Co-Training Combining Sample Synthesis with Local Density and Inter-Class Interpolation

Author information +
文章历史 +
PDF (1959K)

摘要

协同训练算法突破了单视角学习的局限,利用多视角特征学习两个分类器,相互补充、增益学习,以获得更好的分类性能。然而,有标记样本不足以及无标记样本无法有效利用的问题制约着协同训练算法性能的进一步提升。为了解决上述问题,提出一种结合局部密度样本合成和类间插值的协同训练算法。该算法先利用局部密度样本合成方法扩充有标记样本集完善数据的空间结构,得到性能较好的两个初始分类器;再利用K-means聚类算法对两个分类器预测类别不一致的无标记样本聚类,从中随机选取不同类别的样本插值生成新样本,将新样本分别加入到两个分类器中,将决策边界推离类边界,以获得大边距决策边界,重复该过程直至得到最终分类器。在12个UCI数据集上的实验结果验证了本文算法的有效性。

Abstract

The co-training algorithm addresses the limitations of single-view learning by utilizing multi-view features to train two classifiers that complement each other and enhance learning performance. However, the lack of labeled samples and the problem of unlabeled samples not being effectively utilized restrict the further improvement of the performance of the co-training algorithm. In order to solve the above problems, a co-training algorithm combining local density sample synthesis and inter-class interpolation was presented. The algorithm first utilizes the local density sample synthesis method to expand the labeled sample set to improve the spatial structure of the data and obtain two initial classifiers with better performance. Then, the K-means clustering algorithm is used to cluster the unlabeled samples with inconsistent categories predicted by the two classifiers, and the samples of different categories are randomly selected to interpolate to generate new samples. These new samples are then added to each classifier, which pushes the decision boundary further from the class boundary to achieve a larger margin. This process is repeated until the final classifiers are obtained. Experimental results on twelve UCI datasets verify the effectiveness of the proposed algorithm.

Graphical abstract

关键词

协同训练 / 局部密度 / 样本合成 / 插值 / 决策边界

Key words

co-training / local density / sample synthesis / interpolate / decision boundary

引用本文

引用格式 ▾
吕佳,王雨,李帅军. 结合局部密度样本合成和类间插值的协同训练[J]. 武汉大学学报(理学版), 2024, 70(6): 687-696 DOI:10.14188/j.1671-8836.2023.0030

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

半监督学习(Semi-Supervised Learning, SSL)[1]可以利用少量有标记样本和大量无标记样本生成预测模型,被广泛应用于图像识别、自然语言处理以及自动驾驶等方面。SSL算法包括自训练算法、生成式模型、基于分歧的方法和基于图的半监督方法。协同训练(Co-Training, CT)[2]算法属于基于分歧的方法,是多视图学习[3]的一种特殊情况,其假设数据可以从不同的角度将其属性划分为两个视图,用不同视图训练出两个不同的分类器,然后用两个分类器分别对无标记样本进行分类,选出置信度高的无标记样本加入训练集中,重复上述过程,直到无标记样本为空,即训练结束,得到最终的两个分类器。由于这两个分类器协作探索无标记样本中隐含的有效信息,可以相互补充,从而提高分类准确率。

传统的CT算法要求数据有两个独立且充分冗余的视图,但这在实际问题中难以达到。Qian等[4]提出一种Tri-Training算法,通过3个分类器之间的协作来对无标记样本进行分类,并且无需冗余视图,但是该算法在初始分类器比较弱时,对无标记样本的错误分类会给第3个分类器的训练引入噪声。为此,Nguyen等[5]提出一种局部协同训练算法,通过顺序向前选择技术选择部分信息量大的属性构造局部视图,利用完整视图和局部视图的差异性提高分类器性能,但是该算法并没有考虑属性之间的相关性。针对此问题,Nan等[6]提出了一种基于子K-means算法的协同训练算法,用聚类子空间的方法来划分视图,消除了单视图数据的数据噪声和冗余。随后,Wang等[7]提出了一种通过相关系数的层次聚类方法构造视图的协同训练算法,以此提高对地震识别的准确率,但是该算法处理大规模数据集时效果不佳。Song等[8]提出一种基于信息熵划分视图策略的协同训练算法,在一定程度上提高了分类器性能,但该算法将特征视为相互独立,忽略了特征之间的相关性。上述许多研究方法已经逐步放宽了协同训练算法中冗余视图这一前提假设。

除了视图分割这一难题外,CT算法中无标记样本的有效使用也是提高分类器性能的关键所在。Wu等[9]利用局部密度发现数据的空间结构,选择有代表性无标记样本辅助生成分类器,从而提高自训练算法性能。龚彦鹭等[10]提出一种利用主动学习选择信息量丰富的无标记样本来迭代更新有标记样本集的协同训练算法,进一步提高了分类器性能,但该算法在样本区分度不高的数据集上表现较差。随后,Vale等[11]提出一种固定阈值的协同训练算法,选择置信度超过阈值的无标记样本加入训练集,以此增强分类器性能,但置信度高的无标记样本不一定总是可靠的。为了解决这一问题,Lu等[12]提出了一种基于熵和多准则的协同训练算法,通过聚类准则和置信度准则选择无标记样本,但该方法并未考虑到样本的内部结构差异。针对此问题,吕佳等[13]提出一种结合密度峰值聚类算法和相互邻近度的协同训练算法,综合考虑数据全局和局部的紧密和稀疏程度,选择更能代表数据原始空间结构的无标记样本,但该算法计算相互邻近度时会增加算法的时间开销。为此,Gong等[14]提出一种无参数单步无标记数据选择策略的自然邻居协同训练算法,该方法基于自然邻居计算无标记样本置信度,能在无参条件下找到高置信度的无标记样本来辅助训练,且在整个训练过程中只需计算一次置信度。

尽管上述改进后的CT算法性能有了一定的提升,但是仍存在以下两个问题:

1) 由于CT算法初期有标记样本不足,造成分类器在初始阶段通常分类准确率较低,易将无标记样本错误分类,而错误标记样本在迭代训练过程中将数据中噪声连续放大,以致破坏原始数据的空间结构;

2) 在模型训练过程中无标记样本利用效率低下,尤其是无法有效利用分类器标记不一致样本来推动决策边界的移动。

面对工业样本中有标记样本量不足的情形,Zhu等[15]提出了一种可生成虚拟样本的协同训练方法以增加有标记样本数,该方法利用稀疏指数识别特征空间的稀疏程度,并在该空间上生成虚拟样本,再利用双K近邻(K-Nearest Neighbor, KNN)模型赋予标签。该方法虽能合成新样本,但在数据集不平衡时,双KNN模型对生成的样本赋予的标签会存在较大误差。考虑到不平衡数据集的样本扩充和数据本身的空间结构信息,本文提出一种结合局部密度的样本合成(Sample Synthesis with Local Density, SSLD)方法,用其合成新样本扩充有标记样本集合,解决上述问题1)。

为了更好地利用半监督学习中的无标记样本,Verma等[16]提出了一种插值一致性训练的半监督学习方法,随机选取无标记样本进行插值来推动决策边界的移动,得到较大间距的决策边界,但该方法仅在样本集类别数较多时效果好。考虑到实际问题中类别数不大的样本集较为普遍,本文提出一种类间插值(Inter-class Interpolation, II)算法,对标记不一致的无标记样本进行K-means聚类,随机选取不同类别的样本进行插值,利用插值样本推动决策边界远离类边界,从而解决上述问题2)。

综上所述,本文提出一种结合局部密度样本合成与类间插值的协同训练(Co-Training based on Sample Synthesis with Local Density and Inter-class Interpolation, CTSSLDII)算法。首先该算法对有标记样本进行扩充后训练两个初始分类器;其次两个分类器对无标记样本进行预测,保留预测不一致样本;最后对预测不一致样本进行K-means聚类,选取不同类别中的样本进行插值,用插值产生的样本推进决策边界的移动。本文主要贡献有:

1) 对少量有标记样本使用SSLD方法生成合成样本,辅助初始分类器生成,提高了初始分类器准确率;

2) 对两个分类器预测不一致的无标记样本采用II算法生成边界样本,推动决策边界远离类边界,得到了较大边距决策边界;

3) 提出结合局部密度样本合成和类间插值的协同训练算法,提高了分类器的分类准确率。

1  理论基础

1.1 协同训练算法

协同训练算法[2]是一种经典的SSL算法,其主要思想是在有标记样本集的两个视图上分别训练得到两个分类器,然后两个分类器分别标记无标记样本,选择置信度高的样本和对应标签加入对方训练集,重复该步骤直至无标记样本为空,得到最终的两个分类器。协同训练算法描述见算法1

1.2 局部密度

密度峰值聚类算法[17]中,对于每一个样本xi,都需要计算局部密度,样本xi的局部密度ρi的计算公式如下:

ρi=jiχdij-dc

其中,dc是截断距离,dij表示样本xi和样本xj之间的欧氏距离,其计算公式如下:

dij=xi-xj2

χ(x)为逻辑判断函数,计算公式如下:

χ(x)=1,x<00,otherwise

该函数旨在寻找样本xidc为半径的圆内样本的个数,数量越多,说明该样本的局部密度越大。

由于(1)式的计算结果为离散值,导致可能出现多个样本密度值相同的情况发生,影响后续样本的选取。为避免该情况,本文采用以下公式[17]计算样本xi的局部密度ρi

ρi=exp-dijdc2

1.3  K-means聚类算法

K-means聚类算法是一种常见的基于划分的聚类算法,它的基本思想是通过迭代寻找k个簇,使得聚类结果对应的损失函数值最小。其中,传统K-means聚类算法的损失函数为样本到其聚类中心点的误差平方和。

2  本文算法

2.1 局部密度样本合成方法

有标记样本并不是所有情况下都是可靠的,不排除其中也会存在噪声等情况。利用少量的带有噪声的有标记样本训练一个好的分类器极具挑战性,因此对有标记样本进行选择性扩充是一个合理的解决办法。本文提出的SSLD方法可解决该问题,其核心思想是利用有标记样本每一类样本局部密度较大的点与其k近邻来合成可靠的新样本。

为了直观地体现SSLD方法的有效性,本文给出了SSLD方法合成新样本的前后对比图,如图1所示。当有标记样本中存在离群点时,如图1(a)所示,对所有标记样本进行扩充,会通过离群点引入更多的噪声,加大分类难度,降低分类器的性能。为了避免这一问题,SSLD方法利用局部密度有选择性地挑选样本进行扩充,合成样本会落在高密度区域,如图1(b)所示。这样一来既可以避免离群点引入噪声,又可以得到可靠的合成样本集,达到有效扩充有标记样本的目的。

SSLD方法的输入为有标记样本集L、无标记样本集U、过采样因子f、近邻个数k、进化次数G,算法步骤如下:

步骤1:对L中的所有样本,通过(4)式计算其局部密度并排序,取每一类前一半局部密度较大的点x,计算x到样本集中所有样本的欧式距离,得到其k个近邻;

步骤2:根据过采样因子f确定合成样本的比例ratio:

ratio=f#(L+U)#L

其中,#(L+U)为数据集的样本个数,#L为有标记样本个数;

步骤3:在每一类局部密度较大的样本xk近邻中随机选择一个样本,记该样本为xn

步骤4:对于随机选出的近邻xn,与原样本x按照(6)式和(7)式合成新样本。

dif=xn-x
Synthetic=x+gapdif

其中,gap为(0,1)之间的随机数。若生成样本的比例小于ratio,则返回到步骤3,直至满足条件为止;

步骤5:利用差分进化算法[18]对合成的新样本进行位置优化,迭代G次后得到的合成样本集合L_S

输出:合成样本集合L_S

过采样因子f是超参数,用于控制样本合成比例,直接决定了样本的扩充数量。

2.2 类间插值算法

在SSL中,每个无标记样本并不是同等重要的,决策边界的无标记样本往往富含关键信息,直接影响着分类器的决策边界,因此如何捕捉到该类样本并加以有效利用至关重要。本文提出的II算法有效地解决了这一问题,其主要思想是在无标记样本中选取不同类别的样本进行插值,确保插值产生的新样本落在低密度区域,利用插值样本推动决策边界移动,使其远离类边界,最终获得较大边距决策边界。

II算法步骤为:首先对输入的无标记样本进行K-means聚类,其中,聚类个数为计算得到的有标记样本类别数,然后随机选取两个不同类别的样本进行插值操作,直到满足终止条件。

II算法根据(8)式生成新样本:

xnew=αxi+(1-α)xp

其中,xnew为插值产生的新样本,xixp分别为训练集中随机的无标记样本,α为[0,1]之间的随机数。

基于SSL中的聚类假设,类与类之间分布是存在差异的,在两个类别的特征空间中进行插值而生成的新样本融合了两个类别的特征,提供了更丰富的特征信息,使得分类器能够更有效地学习,提高分类器在未知样本上的泛化能力。同时,通过II算法增加了类间位于潜在分类决策边界的样本数量,因而能学习到更为有效的分类器。

为了直观展示II算法生成样本的位置分布情况,本文给出了使用II算法前后的对比图,如图2所示。图2(a)为插值前的样本分布图,基于低密度分离假设,分类器的决策边界处于低密度区域,即图2(a)中虚线位置,决策边界可能会偏向某一类样本,不利于分类器性能的提升。在类间随机选择样本进行插值后,生成的边界样本落在类间的低密度区域,如图2(b)所示,用其推动决策边界移动,生成的决策边界将处在插值样本的低密度区域,即图2(b)中虚线位置。这样可得到较大边距决策边界,从而提高分类器性能。

2.3 CTSSLDII算法流程

基于上述工作,本文提出了CTSSLDII算法(图3),其核心思想是利用SSLD方法扩充有标记样本得到性能较好的两个初始分类器;再对两个分类器预测类别不一致的无标记样本进行插值操作,将生成的插值样本分别加入到两个分类器中,使得决策边界能够远离类边界,以获得大边距决策边界,重复上述过程直至无标记样本集为空,得到最终的两个分类器。

2.4 算法时间复杂度分析

本文算法的时间复杂度由协同训练、局部密度计算、KNN算法、差分进化算法、K-means聚类算法和插值6个部分组成,其中协同训练、局部密度计算、KNN算法、差分进化算法的时间复杂度均为O(n2),插值和K-means聚类算法的时间复杂度均为O(n),故本文算法总的时间复杂度为O(n2)。

3  实验结果与分析

3.1 实验设置和数据集描述

为了验证本文提出的算法的有效性,选择以下8个算法作对比:

① 传统的协同训练算法(CT);

② 结合加权KNN的协同训练算法(Co-Training algorithm combined Weighted K-Nearest Neighbor,CTWKNN);

③ 文献[5]提出的局部协同训练(Partial Co-Training,PCT);

④ 文献[10]提出的CTALDPC算法(Co-Training algorithm combined with Active Learning and Density Peak Clustering,CTALDPC);

⑤ 文献[12]提出的基于熵和多准则的协同训练方法(Co-Training method based on Entropy and Multi-Criteria,CTEMC);

⑥ 文献[13]提出的结合改进密度峰值聚类和共享子空间的协同训练算法(Co-Training algorithm combining Improved Density Peak Clustering and Shared Subspace,CTIDPCSS);

⑦ 文献[8]提出的基于预测未标记样本邻居置信度的协同训练算法(Co-Training algorithm by predicting Confidence of Unlabeled Neighbors,CTPCUN);

⑧ 文献[14]提出的一种无参数单步无标记数据选择策略的自然邻居协同训练方法(Co‑Training method based on parameter‑free and single‑step unlabeled data selection strategy with Natural Neighbors,CTNaN)。

以上8个算法以及本文算法均采用朴素贝叶斯分类器。本文算法的实验参数设置为:SSLD方法中过采样因子f =0.05,近邻个数k=5,进化次数G=500,II算法中α=0.2。实验环境配置见表1,数据集为12个UCI数据集,详细信息见表2

3.2 消融实验

为了证明SSLD方法和II算法的独立有效性和组合有效性,通过对结合SSLD的协同训练算法(CTSSLD)、结合II的协同训练算法(CTII)和结合SSLD和II的协同训练算法(CTSSLDII)进行实验分析,并与CT作比较,实验结果证明了SSLD方法和II算法的独立有效性和组合有效性,实验结果见表3

表3可知,在Custom、Vertebral、Liver、Eeg、Sonar、German、Approval数据集上,CTSSLD平均分类准确率相比CT提高了1个百分点以上,但是在Vehicle、Move、Raisin数据集上的提高小于0.5个百分点,这可能是由于以上数据整体分布较为均匀,使得SSLD方法受限。CTII在11个数据集上的平均分类准确率均高于CT算法,尤其是在Approval、Liver、German数据集上,但是在数据集Contraceptive、Raisin、Vertebral、Eeg数据集上提升有限,这是由于以上数据集分布较为集中,边界样本较少,II算法无法发挥最优效果。以上数据表明SSLD方法和II算法的独立有效性。同时表4中给出了CTSSLDII算法在这12个数据集上的平均分类准确率,均优于CT、CTSSLD和CTII,这也说明了SSLD方法和II算法的组合有效性。

3.3 算法分类准确率对比

在样本训练集中随机选取10%的初始有标记样本,取50次实验后的平均准确率±标准差,见表4。从表4的实验结果看,在有标记样本的比例为10%的情况下,本文算法在Contraceptive、Raisin、Liver、Sonar、German、Move、Wisconsin、Custom数据集上的平均分类准确率均高于其他对比算法。这是由于有标记样本比例较低时,通过SSLD方法合成新样本,使数据的空间结构更可靠,初始分类器性能得到提高。同时利用标记不一致样本进行类间插值,插值样本推动决策边界移动,可以获得大间距决策边界,因此得到的分类器更优。在数据集Vertebral、Approval上,本文算法的平均分类准确率达到次优。在数据集Vehicle、Eeg上,本文算法的平均分类准确率低于大部分其他对比算法,这可能由于数据集自身空间分布均匀限制了本文算法的有效性,但是相比于CT算法还是有一定的提升,并且本文算法的性能相比其他算法更加稳定。

3.4 有标记样本比例对分类器准确率的影响

为了说明有标记样本的比例对9个算法的影响,分别在有标记样本比例为10%、20%、30%、40%、50%的情况下进行了实验。图4给出了随有标记样本比例增加9个算法在12个数据集上平均分类准确率的变化趋势。

图4可以看出,在Raisin和Custom数据集上,本文算法在有标记样本比例上升的过程中始终优于其他对比算法。在数据集Sonar和Move上,当有标记样本比例为40%、50%时,本文算法平均分类准确率略低于其他部分对比算法。在Approval数据集上,在有标记样本比例的变化过程中,本文算法的平均分类准确率仅略低于CTNaN算法,这可能是由于Approval数据集存在较多离群点,CTNaN算法通过检测并去除离群点的技术提高了分类准确率。在Liver数据集上,本文算法仅在有标记样本比例为10%时优于所有对比算法,当有标记样本比例从10%提升到30%时,本文算法平均分类准确率有明显的下降趋势。这是由于在有标记样本比例较低时,本文算法对有标记样本进行了针对性扩充,提高了数据空间分布的完整性,但随着有标记样本比例的增加,出现了过拟合现象。

在Contraceptive、German、Vehicle、Wisconsin数据集上,随着有标记样本比例的增加,本文算法平均分类准确率虽然低于对比算法,但是随有标记样本比例变化的波动较小,因此本文算法的分类性能更稳定。在Vertebral和Eeg数据集上,本文算法分类准确率随着有标记样本比例增加始终低于其他对比算法,尤其在数据集Eeg上,当有标记样本比例从10%增加到20%时,本文算法的平均分类准确率下降了约5%,这是因为Eeg数据集本身样本数量多,数据的空间结构较完整,经过SSLD方法进行样本扩充后导致分类器出现过拟合现象。

3.5 算法运行时间对比

在有标记样本比例为10%的情况下,计算9种算法在12个数据集上的平均运行时间,如表5所示。由表5中的数据可知,相较于其他算法,本文算法的总体计算量有所增加。这是由于CTALDPC算法借助主动学习的方法选择模糊度高的样本,减少了部分计算量,CTNaN采用单步无参数样本选择策略,在整个训练过程中只需计算一次置信度,减少了算法的时间开销,而本文算法在CT的基础上增加了SSLD方法中计算样本局部密度和II操作的环节,增加了部分时间开销。但是,在除Eeg以外的11个数据集中,本文算法的平均运行时间均少于CTEMC算法。同时,在Contraceptive、Raisin、Liver、Sonar、German、Move、Wisconsin、Custom数据集上相比其他对比算法,本文算法在提升了分类准确率的同时并没有带来明显的时间开销。

4  结 语

针对协同训练算法中由于有标记样本较少造成的初始分类器效果不佳和无法有效利用标记不一致样本推进决策过程的问题,本文提出了结合局部密度样本合成和类间插值的协同训练算法。该算法借助SSLD方法对有标记样本进行扩充,用扩充后的样本集训练两个分类器后,分别对无标记样本进行预测,对预测不一致样本进行K-means聚类,随机选取不同类别的样本进行插值操作,利用插值样本推动决策边界远离类边界,循环该过程直到得到两个最终分类器。在12个UCI数据集上验证了CTSSLDII算法的有效性,实验结果表明在有标记样本比例较少的情况下,CTSSLDII算法更优。消融实验证明了SSLD方法和II算法在协同训练中的独立有效性和组合有效性。后续的工作将考虑如何避免由SSLD方法扩充后造成的过拟合现象和减少本文算法的时间开销,更有效地提高分类器的分类准确率。

参考文献

[1]

VAN ENGELEN J EHOOS H H. A survey on semi-supervised learning[J]. Machine Learning2020109(2): 373-440. DOI: 10.1007/s10994-019-05855-6 .

[2]

NING XWANG X RXU S Het al. A review of research on co-training[J]. Concurrency and Computation: Practice and Experience2021: e6276. DOI: 10.1002/cpe.6276 .

[3]

TIAN Y JSUN S DTANG J J. Multi-view teacher-student network[J]. Neural Networks2022146: 69-84. DOI: 10.1016/j.neunet.2021.11.002 .

[4]

QIAN T YLIU BCHEN Let al. Tri-Training for authorship attribution with limited training data: A comprehensive study[J]. Neurocomputing2016171(1): 798-806. DOI: 10.1016/j.neucom.2015.07.064 .

[5]

NGUYEN C MLI XBLANTON R Det al. Partial Bayesian co-training for virtual metrology[J]. IEEE Transactions on Industrial Informatics202016(5): 2937-2945. DOI: 10.1109/TII.2019.2903718 .

[6]

NAN F TTANG Y HYANG Pet al. A novel sub-Kmeans based on co-training approach by transforming single-view into multi-view[J]. Future Generation Computer Systems2021125: 831-843. DOI: 10.1016/j.future.2021.07.019 .

[7]

WANG R YWANG Z ZYANG X Tet al. Co-training semi-supervised learning algorithm for classification of seismic facies of carbonate tidal channels[C]//International Field Exploration and Development Conference. Singapore: Springer, 2022: 1417-1434. DOI: 10.1007/978-981-19-2149-0_132 .

[8]

SONG X LLIU H AFENG Y Let al. A co-training algorithm by predicting confidence of unlabeled neighbors[J]. International Journal on Artificial Intelligence Tools202231(6): 2240023. DOI: 10.1142/s0218213022400231 .

[9]

WU DSHANG M SLUO Xet al. Self-training semi-supervised classification based on density peaks of data[J]. Neurocomputing2018275(5): 180-191. DOI: 10.1016/j.neucom.2017.05.072 .

[10]

龚彦鹭, 吕佳. 结合主动学习和密度峰值聚类的协同训练算法[J]. 计算机应用201939(8): 2297-2301. DOI: 10.11772/j.issn.1001-9081.2019010075 .

[11]

GONG Y L J. Co-training algorithm with combination of active learning and density peak clustering[J]. Journal of Computer Applications201939(8): 2297-2301. DOI: 10.11772/j.issn.1001-9081.2019010075(Ch ).

[12]

VALE K M OGORGÔNIO F LARAÚJO Y Net al. A co-training-based algorithm using confidence values to select instances[C]//2020 International Joint Conference on Neural Networks (IJCNN). New York: IEEE Press, 2020: 1-7. DOI: 10.1109/IJCNN48605.2020.9206621 .

[13]

LU JGONG Y L. A co-training method based on entropy and multi-criteria[J]. Applied Intelligence202151(6): 3212-3225. DOI: 10.1007/s10489-020-02014-6 .

[14]

吕佳, 鲜焱. 结合改进密度峰值聚类和共享子空间的协同训练算法[J]. 计算机应用202141(3): 686-693. DOI: 10.11772/j.issn.1001-9081.2020071095 .

[15]

JXIAN Y. Co-training algorithm combining improved density peak clustering and shared subspace[J]. Journal of Computer Applications202141(3): 686-693. DOI: 10.11772/j.issn.1001-9081.2020071095(Ch ).

[16]

GONG Y LWU Q WCHENG D D. A co-training method based on parameter-free and single-step unlabeled data selection strategy with natural neighbors[J]. International Journal of Machine Learning and Cybernetics202314(8): 2887-2902. DOI: 10.1007/s13042-023-01805-w .

[17]

ZHU Q XZHANG H TTIAN Yet al. Co-training based virtual sample generation for solving the small sample size problem in process industry[J]. ISA Transactions2023134(3): 290-301. DOI: 10.1016/j.isatra.2022.08.021 .

[18]

VERMA VKAWAGUCHI KLAMB Aet al. Interpolation consistency training for semi-supervised learning[J]. Neural Networks2022145(1): 90-106. DOI: 10.1016/j.neunet.2021.10.008 .

[19]

ZHANG C YWANG J MLI X Yet al. Clustering centroid selection using a K-means and rapid density peak search fusion algorithm[C]//2020 IEEE 11th International Conference on Software Engineering and Service Science (ICSESS). New York: IEEE Press, 2020: 201-207. DOI: 10.1109/ICSESS49938.2020.9237746 .

[20]

AHMAD M FISA N A MLIM W Het al. Differential evolution: A recent review based on state-of-the-art works[J]. Alexandria Engineering Journal202261(5): 3831-3872. DOI: 10.1016/j.aej.2021.09.013 .

基金资助

国家自然科学基金重大项目(11991024)

重庆市教委“成渝地区双城经济圈建设”科技创新项目(KJCX2020024)

重庆市高校创新研究群体资助(CXQT20015)

AI Summary AI Mindmap
PDF (1914KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/