基于改进SMOTE算法和Ensemble模型的学习结果预测方法

王晓勇 ,  胡胜利

中北大学学报(自然科学版) ›› 2024, Vol. 45 ›› Issue (03) : 257 -264.

PDF (1020KB)
中北大学学报(自然科学版) ›› 2024, Vol. 45 ›› Issue (03) : 257 -264. DOI: 10.3969/j.issn.1673-3193.2024.03.002
自然语言处理与多模态技术应用专栏

基于改进SMOTE算法和Ensemble模型的学习结果预测方法

作者信息 +

Learning Result Prediction Based on Improved SMOTE Algorithm and Ensemble Model

Author information +
文章历史 +
PDF (1043K)

摘要

为解决不同领域的数据分类和预测任务中单个机器学习算法适用性较差的问题, 以及缓解数据集严重不平衡对预测性能的影响, 提出了基于合成少数类过采样(SMOTE)和Ensemble集成模型的数据分类方法。传统SMOTE算法通过对少数类样本进行插值来生成新的合成样本, 合成样本中存在噪声和样本间相似性较高的问题。为此, 提出了改进的SMOTE算法, 通过距离计算移除噪声样本和易混淆样本, 得到高区分度的纯净合成样本。然后, 利用Ensemble方法调整样本和分类器权重, 并组成分类效果更好的强分类器。在公开在线学习数据集Kalboard360上的实验结果表明, 使用极限随机树(ERT)分类器时, 结合改进SMOTE和Ensemble模型后实现了97.9%的预测准确度, 比单个ERT分类器提升了5.5%, 证明所提改进SMOTE算法能够生成高质量的均衡化数据, 且集成学习模型的性能显著优于单个机器学习算法。

Abstract

In order to solve the problem of poor applicability of a single machine learning algorithm in data classification and prediction tasks in different fields, and to alleviate the impact of severe imbalance in datasets on prediction performance, a learning result prediction method based on Synthetic Minority Oversampling (SMOTE) and the ensemble model was proposed. The traditional SMOTE algorithm generated new synthetic samples by interpolating minority class samples, which could result in the presence of noise and high similarity between synthetic samples. To address these issues, an improved SMOTE algorithm was proposed, which removed noisy and easily confused samples by distance calculation, resulting in high discriminative and pure synthetic samples. Subsequently, an ensemble method was utilized to adjust the weights of samples and classifiers, leading to the creation of a stronger classifier with improved classification performance. Experimental results on the public online learning dataset Kalboard360 show that when using the Extreme Randomized Trees (ERT) classifier, in combination with improved SMOTE and Ensemble model, resulted in a prediction accuracy of 97.9%, which is a 5.5% increase compared to using a single ERT classifier. This demonstrates that the proposed SMOTE algorithm can generate high-quality balanced data, and the performance of the Ensemble learning model is significantly better than that of a single machine learning algorithm.

Graphical abstract

关键词

机器学习 / 神经网络 / 数据挖掘 / 集成学习 / 数据均衡化 / 学习结果预测

Key words

machine learning / neural networks / data mining / ensemble learning / data balancing / learning outcome prediction

引用本文

引用格式 ▾
王晓勇,胡胜利. 基于改进SMOTE算法和Ensemble模型的学习结果预测方法[J]. 中北大学学报(自然科学版), 2024, 45(03): 257-264 DOI:10.3969/j.issn.1673-3193.2024.03.002

登录浏览全文

4963

注册一个新账户 忘记密码

0 引 言

当前, 信息和通信技术的快速发展带来了海量的数据, 传统统计分析方法无法满足大数据背景下知识发现的需求。数据挖掘通过使用复杂的统计工具集合或人工智能模型, 从不同角度进行数据分析, 提取数据内部关联, 将累积的非结构化信息转换为直观数值, 从而促进决策制定过程1。随着在线学习平台的兴起, 利用各种机器学习算法对学习数据进行深度挖掘已成为研究热点2

学习数据挖掘(Learning Data Mninng, LDM)通过分析学习过程并预测学习效果来改善知识的传递方式和吸收效果3。陈曦等4结合知识图谱表征和协同过滤算法对稀疏数据场景下的学习效果进行了预测, 通过知识相似度计算和历史数据补足提高了预测性能。Trakunphutthirak等5认为单个数据源不足以识别出学习者的特征, 提出了网页浏览和互联网活动数据集, 对时域和频域中的不同权重进行了比较, 并使用随机森林(Random Forest, RF)分类器实现了最好的预测性能。申航杰等6提出了结合模糊聚类和支持向量机回归的预测方法, 其中考虑到了历史数据和行为习惯等因素。

神经网络已成LDM中较为成熟的分类和预测模型, 与传统网络模型及其学习算法相比, 其适用于处理大规模数据, 且能够同时应用到结构化和非结构化数据中。林梦楠等7提出了基于BP神经网络的预测方法, 并通过自适应差分算法进行权值优化, 取得了较好的预测结果。张阳等8提出了结合图卷积网络(Graph Convolutional Network, GCN)和自编码器模型的预测方法, 利用GCN进行编码并获取了数据内在特征, 最后输入解码器得到预测结果矩阵。

近些年, Ensemble分类器已成为机器学习和模式识别研究中的流行策略。Ensemble是一种结合不同分类器输出的方法, 通过对多个弱分类器进行加权并合并为单个强分类器来提高分类效率, 从而实现比个体分类器更好的处理性能9。李慧芳等10提出了多维特征融合策略, 基于Ensemble学习策略合并类别型、 数值型和原始输入特征, 提高了云工作流任务的预测精度。Kamal等11提出了基于Ensemble的树分类器, 并利用统计工具分析了特征选择对预测性能的影响。

传统SMOTE算法通过对少数类样本进行插值来生成新的合成样本, 其合成样本中存在噪声和样本间相似性较高的问题。为此, 提出改进SMOTE算法, 通过距离计算移除噪声样本和易混淆样本, 得到高区分度的纯净合成样本。同时, 利用Ensemble方法调整样本和分类器权重, 组成分类效果更好的强分类器。本文的主要创新点总结如下:

1)提出了改进的合成少数类过采样(Synthetic Minority Oversampling Technique, SMOTE)算法, 基于原始少数类样本与新生成少数类样本之间的距离进行调整, 移除噪声样本和易混淆样本, 解决了原算法中的噪声和边界样本的问题, 在实现数据集平衡的同时确保了模型性能的稳定。

2)将Ensemble算法用于LDM任务中, 使用不同机器学习模型作为基础分类器, 在每轮训练中逐步增加误分类样本在基础分类器中的权重, 将多个弱分类器合并为单个强分类器, 提升了模型的预测性能。

1 本文提出的方法

图 1 给出了所提基于改进SMOTE算法和Ensemble模型的学习效果预测方法的流程图, 其中包括预处理、 模型开发和性能评估阶段。在预处理阶段, 首先将采集到的数据转换为合适的格式。通过离散处理将学习效果转换为与分类标签相对应的标称值。为解决分类不平衡对机器学习算法的影响, 利用改进的SMOTE算法来改善训练数据的平衡度。然后, 使用监督分类算法训练模型, 学习从输入特征到输出标签的映射函数。

1.1 改进的SMOTE算法

在数据预处理阶段, 使用改进的SMOTE处理训练数据中分类不平衡的问题。大部分分类算法旨在聚集纯净样本并从中学习, 将每个类别的边界尽可能定义得更清晰, 从而提高预测性能。远离分类边界的人工实例更易于分类, 而靠近分类边界的人工实例会提高分类器学习的难度。

为更清晰地区分不同类别的边界线, 在数据集平衡处理中生成更纯净的样本, 提出了改进的SMOTE算法。首先, 使用SMOTE创建人工实例12

N=2*(r-z)+z,

式中: r为多数类样本; z为少数类样本数量; N为新生成人工实例的数量。令x^={x^1x^2x^3,…,x^N}为新的人工实例集合, x^i(j)x^i的第j个属性值, Sm={Sm1,Sm2,,Smz}Sα={Sα1,Sα2,,Sαr}分别为少数类样本和多数类样本。计算x^iSmk 之间的距离

Dmin(x^i,Smk)=j=1M(x^i(j)-S^mk(j))2

然后, 计算x^i与之间Sαl的距离

Dmaj(x^i,Sαl)=j=1M(x^i(j)-S^αl(j))2

由此, 分别计算出数组AminAmaj

Amin=(Dmin(x^i,Sm1),,Dmin(x^i,Smz)),
Amaj=(Dmaj(x^i,Sα1),,Dmaj(x^i,Sαr))

AminAmaj中分别选出最小值min(Amin)和min(Amaj)。若min(Amin)<min(Amaj), 则接受新生成的人工样本, 否则, 拒绝该样本。

S^={S^1,S^2,,S^n}为已接受的人工样本, 执行噪声移除步骤。计算S^与每个原始少数类样本Sm 之间的距离

min(S^i,Sm)=k=1zj=1M(S^i(j)-Smk(j))2

S^与每个原始多数类样本Sα之间的距离计算为

maj(S^i,Sα)=i=1rj=1M(S^i(j)-Sαl(j))2

基于式(6)式(7)计算出的距离指标, 移除与原始多数类样本距离较小的半数易混淆的合成样本, 由此得到高纯度的合成样本, 从而改善训练数据集的平衡度。

1.2 机器学习算法

所提方法应用监督式分类算法, 通过模型训练学习从输入特征到输出标签的映射。本文测试了4种不同的机器学习算法在LDM任务中的预测性能。

1.2.1 支持向量机

支持向量机(Support Vector Machine, SVM)是一种监督式学习算法, 将实例表示为N维空间中的点集, 并通过生成(N-1)维的超平面对数据点分组。SVM旨在发现模式x的超平面, 并将线性决策边界最大化, 即

y(x)=wTx+b=0,

式中: yx )=0定义了特征空间中的决策边界; w 为法向量; b为偏置。

不同类别的数据之间的最优超平面可求解为二次优化问题

minQ(w,b,ξ)=12||w||2+Ci=1nξi,

式中: iyi(wTΦ(xi)+b)1-ξiξi0Φ为特征向量; ξ为测量误分类误差的松弛变量; C 为控制变量。

本文使用了通过卡方统计进行特征选择的SVM算法13。对寻找最优超平面, 利用核函数将训练数据自动转换到高维空间, 从而使数据线性可分。将核函数应用到原始空间中的数据, 定义为

K(xi,xj)=Φ(xi)TΦ(xj)

本文使用了高斯径向基函数作为SVM的核函数

KGaussian(xi,xj)=exp||xi-xj||22σ2,

式中: σ为核参数, 控制高斯函数的宽度。

1.2.2 贝叶斯网络

贝叶斯网络(Bayesian Network, BN)是得到广泛使用的概率图模型, 能够促进不确定条件下的推理和预测。利用有向无环图进行推导, 其中属性表示为节点, 属性相关的假设则表示为弧线。BN分类器可定义为

cBayes=argmaxcCP(c)P(x1,x2,,xn|c),

式中: xi 为属性值; c为类别标签。

最简单的BN分类器为朴素贝叶斯网络, 其假定所有属性是条件独立的。但在实际应用中, 条件独立假设往往不成立, 因为属性之间常会彼此相关。BN网络可引入隐藏变量, 处理数据不完整的问题和变量间复杂的相依性。为此, 本文使用了隐朴素贝叶斯网络(Hidden Native Bayesian Network, HNBN)分类器14

cHNBN=argmaxcCP(c)iP(xi|xhpi,c),
P(xi|xhpi,c)=P(c)j=1,jinwijP(xi|xj,c)

图 2(a) 给出了简单的BN网络, 图 2(b) 给出了键入隐藏节点的HNBN网络示意。HNBN模型创建表示每个属性的隐藏父节点层, 隐藏父节点(hpi )代表所有其他属性的加权影响。由此, 利用两个属性之间的条件交互关系确定权值wij

1.2.3 决策树

决策树(Decision Tree, DT)算法基于规则集合制定决策。DT学习算法以从上到下递归的方式构建树结构, 根节点和中间节点则包含测试条件, 利用不同的属性值对实例进行分类, 从而为叶节点分配类别标签。DT算法首先从根节点开始, 并基于最大信息增益的特征进行数据分割15。在迭代过程中, 在每个子节点反复进行分割过程, 直至每个叶节点的所有实例均属于相同类别。该算法中包含熵(Entropy)和信息增益(IG)的定义。

熵用来衡量系统的不可预测性, 计算公式为

H(X)=-p(X)logp(X),

式中: pX)为给定类别的部分样本。

信息增益IG指数据集在变换前和变换后的熵值降低度量, 计算公式为

GI(Dp,f)=I(Dp)-NlNI(Dl)-NrNI(Dr),

式中: Dp为父节点数据集; fDp上的部分特征; Dl为左侧子节点数据集; Dr为右侧子节点数据集; I为噪声; N为总样本数; Nl为左侧子节点的样本数; Nr为右侧子节点的样本数。

本文使用了极限随机树(Extremely Random Tree, ERT)分类器, 通过加入随机性降低了过学习风险16。其中, 将多个决策树合并, 并使用特征的随机子集, 基于随机分割的理念来划分节点。令L=(x1,y1),,(xn,yn)为训练集, 其中样本 xi =f1,f2,,fnD维向量; fi 为特征。ERT创建M个独立的决策树。对于每个决策树, Sp 表示训练集L在子节点p的子集。然后, 对于每个节点p, ERT算法基于Sp 选择最优分支。算法1为ERT分类算法。

算法1 极限随机树算法

输入: 训练子集Sp ={s1,s2,,sQp}, 样本si ={f1,f2,,fn}D维向量, K为要随机选择的属性数量, nmin为节点分割所需的最少样本数。

If Qp<nmin then

停止分割, 并将节点定义为叶节点

Else

选择随机子分组

End if

for 子分组中的每个特征k do

寻找最大值fkmax和最小值fkmin

for 子集Sp 中的特征k

得到[fkmin, fkmax]内的随机切割点fkc

选择fkc作为候选切割

end for

选择分割f*<f*c, 并使得f*c为最小得分

输出: 子节点p的最优分割[f*<f*c]

1.2.4 人工神经网络

人工神经网络(Artificial Neural Network, ANN)分类器为前向神经网络, 一层中的每个节点均连接点下一层中的每个其他节点, 图 3 给出了简单ANN的结构示例17。其中, y=wixi+by为输出值, wi 为权重系数, xi 为输入值, b为偏置系数。

以三层前向ANN为例, 中间隐藏层的节点数量计算为(α+β)+γα为输入层节点数, β为输出层节点数, γ为1和10之间的一个随机均匀数。通常, 对输入的加权和应用非线性激活函数, 并在训练中通过权值更新将损失最小化。本文在ANN中使用了Sigmoid激活函数。

1.3 Ensemble方法

在数据分类预测中, 使用基于集成学习理念的Ensemble方法, 将不同的弱分类器合并成单个强分类器18。通过在每轮训练中增加误分类样本在基础分类器中的权重, 实现比单个分类器更好的性能。首先, 对所有数据点赋予相同权重。其后, 为错误分类的数据点指定更高的权重。由此, 高权重数据点将在后续处理中得到重点关注。持续训练模型, 直至达到理想的误差值。

令(x1y1),…,(xnyn )为已标注训练集, 其中, 每个xi 在实例空间X中, 每个标签yi 在标签集Y中。令DIt(i)表示训练实例I在第t轮的权重。初始时, 为所有数据点赋予相同权重, 其后在每轮中增加误分类样本在基础分类器中的权重。算法2给出了Ensemble模型的伪代码。本文使用的集成框架属于同质分类器集成, 即所有的基础分类器都是相同的, 通过不断计算每个基础分类器的误差并对样本和标签分布进行更新来保证多样性, 并由此得到集成后的强分类器。

与集成框架中使用不同类型的分类器相比, 同质分类器集成具有训练和预测速度快、 鲁棒性强、 可扩展性强、 不易受到数据噪声或异常值影响的优点。异质分类器集成则更擅长处理复杂数据和异质数据。本文实验中使用的在线学习数据集Kalboard36019的数据具有较强的规律性, 使用同质分类器集成可更好地捕捉模式或规律, 提高预测性能。

算法2 集成学习模型

输入: 训练数据集(x1,…,xn )和标签集(y1,…,yn

输出: 预测结果

为每个样本分配标签(x1y1),…,(xnyn

初始化DIt(i)权重

For It=1,…,T do

使用分布DIt(i)训练弱分类器

得到弱分类器预测hIt:X{-1,+1}

计算弱分类器误差εIt=hit(x)yinDIt(i)

更新分布

DIt:DIt+1(i)=DIt(i)exp(-αItyItTIt(xIt))/CIt

It=It +1

输出最终预测: H(x)=signIt=1TαIthIt(x)

算法2中, CIt为归一化常数, αIt用于解决过拟合和噪声敏感性问题, 即

αIt=12lnP+1-P-1P-1+P-1,

式中: P为分类概率估计。

2 实 验

实验将首先评估每个分类器SVM、 HNBN、 ERT和ANN在单独使用时的预测性能, 然后分析应用Ensemble模型后, 不同分类器组合的性能变化情况。

2.1 数据集和硬件配置

使用公开在线学习数据集Kalboard36019分析所提方法的性能。该数据集中包含480个学习者的不同特征数据, 表 1 给出了用于预测的不同特征的描述。在分类任务中, 按照百分制中的0~69, 69~79和79~100将学习者分为 3 类。使用的操作系统为Windows 10, 编程语言为Python 3.7, 使用sklearn机器学习库。硬件配置为3.2 GHz的Intel i5 4570 CPU, 16 GB RAM, NVIDIA GeForce GTX 750 Ti 显卡。

2.2 评估指标

使用准确度、 精度和F1指标分析不同分类器的预测性能。准确度为正确分类样本数在总样本数中的占比, 计算公式为

A=NTN+NTPNTN+NTP+NFP+NFN,

式中: NTNNTP分别为正确分类的负样本数和正样本数; NFPNFN分别为错误分类的正样本数和负样本数。

精度用于测量正确分类的正样本数在实际正样本数中的占比, 因此能够衡量少数类样本分类的准确度。精度计算公式为

P=NTPNTP+NFP

召回率为所有预测为正的样本数中正确预测的占比, 计算公式为

R=NTPNTP+NFN

F1指标同时考虑到精度和召回率, 因此能够更全面地衡量分类器的性能, 计算公式为

F1=2×P×RP+R

2.3 实验结果及分析

首先, 不使用SMOTE算法和Ensemble框架, 仅应用不同机器学习算法对学习者进行分类预测, 表 2 给出了实验结果。从中可发现, SVM算法性能最差, 预测准确度仅为68.5%, 证明线性分类器不适用于多维数据和不均衡数据集的分类预测。ERT算法取得了92.4%的最高准确度, 比次优的ANN算法提升了2.2%的预测准确度, 这表明在没有足够训练数据的情况下, 神经网络不能有效提取出高质量的分类特征。

图 4 给出了在应用所提改进SMOTE算法和原SMOTE后, 各分类器的准确度性能表现。从表中可发现, 原SMOTE算法能够在一定程度上提高数据集的均衡度和分类器的预测性能。其中, ERT分类器的预测准确度从92.4%提升至93.2%。本文所提SMOTE算法通过生成区分性高的少数类样本, 移除边界区分性较弱的样本和噪声样本, 在实现数据集平衡的同时, 利用高质量的生成样本提高分类器的训练效果, 使各分类器均实现了最好性能。ERT分类器的预测准确度比无SMOTE和原SMOTE算法分别提高了1.9%和1.1%。

表 3 给出了应用Ensemble模型和改进SMOTE算法后, 各分类器的预测性能。从结果中可发现, 各模型的性能均实现了显著提升, 证明集成学习的理念利用多个弱分类器合并为单个强分类器, 并将注意力集中在错分类样本上, 能够有效提高最终模型的预测性能。其中, ERT算法依然取得了最好性能, 与不使用SMOTE和Ensemble模型的单个ERT分类器相比, 预测准确度提高了5.5%。性能提升幅度最大的则是SVM分类器, 预测准确度比原单个分类器提升了16.9%。这是因为SVM分类器在集成之前性能较差, 在处理数据的不确定性和噪声方面的能力较弱, 在应用改进的SMOTE和Ensemble模型后, 有效解决了数据噪声和过拟合问题, 实现了预测性能的显著改善。

此外, 图 5 给出了使用改进SMOTE算法和Ensemble模型后, 各分类器预测结果的均方误差(Mean Absolute Error, MAE)和均方根误差(Root Mean Squared Error, RMSE)比较。MAE为预测值与真实值之间的平均差, 代表预测误差的标准偏差值。RMSE为每个预测值和真实值之间的平方差均值20

图 5 中可发现, ERT算法和ANN算法均能够较好地完成分类和预测任务。其中, ERT的MAE和RMSE值分别为0.14和0.38, 表明利用所提SMOTE算法进行数据集均衡化并通过集成学习理念强化分类器性能后, 实现了精准的数值预测。

3 结 论

本文提 出了基于集成学习理念的机器学习分类预测方法, 利用改进SMOTE算法进行数据均衡化处理, 并解决了噪声和易混淆样本问题。通过Ensemble算法基于权重调整进行分类器合并, 提升了预测性能。在线学习的公开数据集Kalboard360上的实验结果表明, 在稀疏多维数据的分类预测任务中, ERT算法在单独使用时得到92.4%的最高准确度。将所提方法应用到ERT算法后, 改进的SMOTE算法能够在确保数据集平衡的前提下生成高质量的合成样本, 预测准确度比原SMOTE算法提升了1.1%。Ensemble模型通过集成学习的方式有效增强了分类器的性能, 实现了97.9%的预测准确度。

参考文献

[1]

李瑞峰, 杨海峰, 蔡江辉, .一种基于加权深度森林的离群数据挖掘算法[J].小型微型计算机系统202243(7): 1426-1431.

[2]

LI RuifengYANG HaifengCAI Jianghuiet al.Outlier data mining algorithm based on weighted deep forest[J].Journal of Chinese Computer Systems202243(7): 1426-1431.(in Chinese)

[3]

FISCHER CPARDOS Z ABAKER R Set al.Mining big data in education: affordances and challenges[J].Review of Research in Education202044(1): 130-160.

[4]

刘铁园, 陈威, 常亮, .基于深度学习的知识追踪研究进展[J].计算机研究与发展202259(1): 81-104.

[5]

LIU TieyuanCHEN WeiCHANG Lianget al.Research advances in the knowledge tracing based on deep learning[J].Journal of Computer Research and Development202259(1): 81-104.(in Chinese)

[6]

陈曦, 梅广, 张金金, .融合知识图谱和协同过滤的学生成绩预测方法[J].计算机应用202040(2): 595-601.

[7]

CHEN XiMEI GuangZHANG Jinjinet al.Student grade prediction method based on knowledge graph and collaborative filtering[J].Journal of Computer Applications202040(2): 595-601.(in Chinese)

[8]

TRAKUNPHUTTHIRAK RCHEUNG YLEE V C S.A study of educational data mining: Evidence from a thai university[J]. Proceedings of the AAAI Conference on Artificial Intelligence201933(1): 734-741.

[9]

申航杰, 琚生根, 孙界平. 基于模糊聚类和支持向量回归的成绩预测[J]. 华东师范大学学报(自然科学版)2019(5): 66-73.

[10]

SHEN HangjieJU ShenggenSUN Jieping. Performance prediction based on fuzzy clustering and support vector regression[J]. Journal of East China Normal University(Natural Science)2019(5): 66-73.(in Chinese)

[11]

林梦楠, 李金辉.基于自适应差分进化的学生成绩等级预测神经网络模型[J].现代电子技术202245(3): 130-134.

[12]

LIN MengnanLI Jinhui.Student achievement grade prediction model based on neural network optimized by adaptive differential evolution[J].Modern Electronics Technique202245(3): 130-134.(in Chinese)

[13]

张阳, 鲁鸣鸣, 郑一基, .基于图自编码器模型的学生成绩预测[J].计算机工程与应用202157(13): 251-257.

[14]

ZHANG YangLU MingmingZHENG Yijiet al.Student grade prediction based on graph auto-encoder model[J].Computer Engineering and Applications202157(13): 251-257.(in Chinese)

[15]

DONG XYU ZCAO Wet al.A survey on ensemble learning[J].Frontiers of Computer Science202014(1): 241-258.

[16]

李慧芳, 黄姜杭, 徐光浩, .基于多维度特征融合的云工作流任务执行时间预测方法[J].自动化学报202349(1): 67-78.

[17]

LI HuifangHUANG JianghangXU Guanghaoet al.Multi-dimensional feature fusion-based runtime prediction approach for cloud workflow tasks[J].Acta Automatica Sinica202349(1): 67-78.(in Chinese)

[18]

KAMAL PAHUJA S.An ensemble-based model for prediction of academic performance of students in undergrad professional course[J].Journal of Engineering, Design and Technology, 201917(4): 769-781.

[19]

梅大成, 陈江, 郑涛.边界与密度适应的SMOTE算法研究[J].计算机应用研究202239(5): 1478-1482.

[20]

MEI DachengCHEN JiangZHENG Tao.Research on SMOTE algorithm based on boundary and density adaptation[J].Application Research of Computers202239(5): 1478-1482.(in Chinese)

[21]

SALAWU M DAROWOLO M OABDULSALAM S Oet al.A chi-square-SVM based pedagogical rule extraction method for microarray data analysis[J].International Journal of Advances in Applied Sciences20209(2): 93-100.

[22]

CHEN XYUAN YORGUN M A.Using Bayesian networks with hidden variables for identifying trustworthy users in social networks[J].Journal of Information Science202046(5): 600-615.

[23]

YANG F J.An extended idea about decision trees[C]//2019 International Conference on Computational Science and Computational Intelligence (CSCI), 2019: 349-354.

[24]

ACOSTA M R CAHMED SGARCIA C Eet al.Extremely randomized trees-based scheme for stealthy cyber-attack detection in smart grid networks[J].IEEE20208: 19921-19933.

[25]

KURANI ADOSHI PVAKHARIA Aet al.A comprehensive comparative study of artificial neural network (ANN) and support vector machines (SVM) on stock forecasting[J].Annals of Data Science202310(1): 183-208.

[26]

ASHRAF MZAMAN MAHMED M.An intelligent prediction system for educational data mining based on ensemble and filtering approaches[J].Procedia Computer Science2020167(1): 1471-1483.

[27]

AMRIEH E AHAMTINI TALJARAH I.Mining educational data to predict student’s academic performance using ensemble methods[J].International Journal of Database Theory and Application20169(8): 119-136.

[28]

HODSON T O.Root-mean-square error (RMSE) or mean absolute error (MAE): when to use them or not[J].Geoscientific Model Development202215(14): 5481-5487.

基金资助

安徽省重点科研项目(KJ2021A1306)

AI Summary AI Mindmap
PDF (1020KB)

344

访问

0

被引

详细

导航
相关文章

AI思维导图

/