基于注意力机制的云数据中心资源消耗预测

闫永权

武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (2) : 243 -252.

PDF (3961KB)
武汉大学学报(理学版) ›› 2025, Vol. 71 ›› Issue (2) : 243 -252. DOI: 10.14188/j.1671-8836.2024.0031
人工智能

基于注意力机制的云数据中心资源消耗预测

作者信息 +

Resource Consumption Prediction of Cloud Data Center Based on Attention Mechanism

Author information +
文章历史 +
PDF (4055K)

摘要

针对关于云计算资源消耗预测精度不高的问题,设计了一个资源预测的框架。该框架包括数据预处理、基于注意力机制的长短时记忆网络以及基于改进的遗传算法的搜索机制。在数据预处理过程中,本文通过自组织映射网络保留了数据的内在特性,有助于去除噪声并揭示数据的潜在模式。注意力机制与长短时记忆网络的结合,提高了模型对关键时间步的关注,从而增强了预测能力。改进遗传算法用于权重优化,使得模型可以自适应地调整注意力权重分配。基于Google集群跟踪数据对本文设计的框架进行了验证。实验结果表明,与基准算法相比,本文的框架在三类指标上短期和长期预测均具有优势, 该框架具有更高的精度。通过修正的Friedman检验和Nemenyi检验,证明了所述方法的预测性能在均方根误差上好于两类基准算法。

Abstract

The current accuracy of cloud computing resource consumption forecasts can be improved. This study introduces an innovative resource forecasting framework to address the challenges of predicting resource usage within cloud data centers. The framework includes data preprocessing, a long short-term memory network based on an attention mechanism, and a search mechanism based on an improved genetic algorithm. The intrinsic properties of the data are preserved by the self-organizing mapping network, which helps remove noise and reveal the underlying patterns of the data. The combination of the attention mechanism and long short-term memory network enhances the model's attention to key time steps, thus enhancing the prediction ability. An improved genetic algorithm was used for weight optimization so that the model could adaptively adjust the attention weight allocation. In the experiment, the framework proposed in this study was validated based on Google cluster tracking data. Based on a comparison with the benchmark algorithm, the proposed framework has advantages in the three indices for both short-term and long-term predictions, which proves that the framework has higher accuracy. The modified Friedman test and Nemenyi test proved that the proposed method’s prediction performance is better than that of the two benchmark algorithms in terms of the root-mean-square error.

Graphical abstract

关键词

云数据中心 / 资源利用 / 长短时记忆网络 / 注意力机制

Key words

cloud data center / resource utilization / long short⁃term memory network / attention mechanism

引用本文

引用格式 ▾
闫永权. 基于注意力机制的云数据中心资源消耗预测[J]. 武汉大学学报(理学版), 2025, 71(2): 243-252 DOI:10.14188/j.1671-8836.2024.0031

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

云计算提供可定制的平台,允许应用程序在虚拟机上执行所需的应用程序之前,获取需要的资源[1]。云服务提供商通常使用随用随付的定价模式,这可以降低云用户成本并提供灵活的服务。云计算技术的发展驱使云用户和云环境中应用程序的开发显著增加[2]。一些商业和科学应用大量使用云计算服务,促使云资源各种使用模式的不断出现[3-4]。因此,有效地管理资源以处理用户的不同需求成为必须解决的问题。云计算环境中高效的资源管理有助于优化资源使用、降低成本和提高性能。为了实现有效的资源管理,需要对云数据中心的资源利用进行预测。

近年来,资源消耗预测研究[1-2]越来越受到学者们的关注,一些资源预测模型也被提出。资源预测模型的性能受到外部因素的影响,如模型的参数设定、数据集的划分、时间复杂度和空间复杂度等。同时云数据中心的资源消耗预测研究中数据集包含大量的特征,如CPU和内存使用、磁盘I/O、网络吞吐量等,这些特征之间相互耦合,给资源利用率预测的准确性带来了挑战。为了解决这一问题,云资源预测模型需要具备综合多指标分析的能力,确保提供精确预测,进而为数据驱动的决策提供有力的支持。

由于时间序列数据在现实世界中具有很高的噪声和不稳定性[3],因此需要对原始数据进行预处理。未经过预处理的时间序列数据会出现不适定问题,这使得学习算法难以建立适合的模型。不适定的问题可以通过添加一些限制(如平滑度限制)来解决,具有平滑限制的训练模型可以很好地拟合训练数据,并且具有良好的泛化能力。

基于云的计算中,有效的资源管理可以改善资源的使用,提高应用程序的性能,并降低使用成本。自动化资源调度通过调整可用资源满足业务需求,实现灵活的业务。准确的预测对于降低功耗和保证服务质量具有重要作用,特别是对于那些对延迟或响应时间有严格服务质量要求的业务。Ariza等[5]提出了一种新的机制,旨在精确预测分布式服务器的负载并估计合适的资源数量。该算法基于神经网络模型,用于预测计算资源使用情况。主机负载预测对于提高云计算环境下的资源分配和利用率具有重要意义。在文献[6]中,作者采用长短时记忆网络(Long Short-Term Memory,LSTM)模型,使用实际工作负载评估性能。尽管云计算有很多优势,但也面临着一些挑战。动态资源扩展和功耗是云计算所需面对的问题。低效的资源配置会导致低效的云系统和较高的工作负载预测代价。文献[7]提出了一种基于神经网络的工作量预测模型。管理员可以发现资源预留计划中存在的潜在问题,并进行相应的变更。Kumar等[8]提出了一种基于神经网络和自适应差分进化技术的资源利用分配技术。Nguyen等[9]提出了一种解决云数据中心工作负载预测问题的算法,利用LSTM网络建立了工作负荷预测模型。此外,基于工作负载的不同属性开发模型,大多数云只使用用户自定义的资源阈值提供自动缩放功能。Ashawa等[10]实现一个应用LSTM算法的应用程序,该算法提供了一个直观的动态资源分配系统,该系统分析启发式应用程序资源利用率,以确定为该应用程序提供的最佳额外资源。Dogani等[11]针对云数据中心的多变量资源利用的预测问题,将卷积神经网络提取的空间特征输入到经过注意机制优化的门控循环单元网络中,提取空间相关特征,用于提高所述方法的预测精度。

云数据中心的负载数据包含异常值和噪声,现有方法对这些异常值比较敏感,导致预测能力下降。同时上述方法在短期预测上表现较好,但是在长期预测中往往难以捕获时间序列的长期依赖,所以上述方法的预测精度仍有提升空间。为此本文设计了基于注意力机制的LSTM框架对云资源中心的资源使用进行预测。

1  本文方法

本文设计的预测框架见图1。该框架包括以下几个部分:数据预处理、改进LSTM、权重搜索和性能评价。

1.1 数据预处理

在数据预处理阶段,本文提出了一种基于自组织映射网络的数据预处理机制,可以对数据进行有效的平滑操作。数据预处理过程分为数据平滑、差分转换以及归一化处理三个过程。

1) 数据平滑

对于云数据中心的资源观测序列x(t),t=1,2,,T,此序列可重构为x(t),x(t+τ),,x(t+nτ)τ为时间间隔,则:

x(t+nτ)=φ(t)x(t)++φ(t+(n-1)τ)x(t+(n-1)τ)+ε(t)

其中,ε(t)是噪声,φ(t)是时间t的权重参数。

对于一个算法来说,t+nτ的预测值为:

x^(t+nτ)=φ(t)x(t)++φ(t+(n-1)τ)x(t+(n-1)τ)

由于离群值总是存在于时间序列数据中,因此需要对序列结果进行转换以减轻离群值对于预测结果的影响:

x(t+nτ)=sign[x(t+nτ)](1+log (x(t+nτ)))

其中,sign是符号函数。一个序列可改写为:

X(t+nτ)=(x(t+τ),x(t+2τ),,x(t+(n-1)τ))

Kohonen[12]提出了一种自组织映射网的方法。本文采用自组织映射网作为平滑方法,过滤数据集中的噪声等,从而将时间序列转化为平滑序列。自组织映射网络在网络训练过程中能够保持数据的拓扑结构,即相似的数据点在映射后的网络中也彼此接近,这有助于平滑处理时保持数据的局部特性。作为一种无监督学习方法,自组织映射网络不需要预先标记的训练数据,可以自动地从原始数据中学习并进行组织。自组织映射网络的神经元自动调整其权重以适应输入数据的分布,这使得它能够自适应地对数据进行平滑处理。

使用自组织映射网对资源消耗数据进行预处理的过程是一种无监督学习方法。X(t+nτ)作为输入向量,欧几里得距离用于计算自组织映射网中的最佳匹配单位(BMU):

X(t+nτ)-wbX(t+nτ)=miniSiX(t+nτ)-wiX(t+nτ)

其中,St 是一个投影空间集,wb为BMU权重,wi为数据集中第i个样本的权重。

为了搜索BMU,节点需按如下公式进行迭代:

wiX(t+nτ)=wiX(t+(n-1)τ)+γ(X(t+nτ))h(X(t+nτ))(X(t+nτ)-wiX(t+nτ))

其中,γ(X(t+nτ))是具有约束0γ(X(t+nτ))1的函数,函数h(X(t+nτ)是一个近邻函数,其定义为:

h(X(t+nτ))=α(X(t+nτ)exp (-vc(X(t+nτ))-ri(X(t+nτ))2/2σ(X(t+nτ)2))

其中σ是内核宽度。在学习过程中,高斯核的宽度逐渐减小为零。为了确保最终结果能够收敛,需满足以下条件:

limt0tr(X(t+nτ))dt=
limt0t(r(X(t+nτ)))2dt=K,K<

其中,r(X(t+nτ))表示高斯核宽度函数。

2) 差分转换

在对原始序列数据进行平滑处理后,为了降低数据的线性程度,需对平滑后的数据进行差分变换。这是因为神经网络在学习具有线性特征的数据时表现相对较差,而差分操作可以减小线性趋势。该操作可以定义为:

xd(t)=x(t)-x(t-dτ)

其中,d为差分算子。

3) 归一化处理

在对时间序列数据进行差分转换后,进行归一化处理,其目的在于防止数据输入到神经网络中导致网络神经元饱和,影响预测网络的准确性,归一化处理公式为:

Xi¯=Xi-XminXmax-Xmin

其中,Xi¯表示差分数据归一化后的数据,Xi表示差分输入数据,Xmin表示差分数据中的最小值,Xmax表示差分数据中的最大值。

1.2 基于注意力机制的LSTM

LSTM用于时间序列问题,表示输入序列与输出序列之间的计算映射,即X=(X1,X2,,Xn)y=(y1,y2,,yn)之间的映射。注意机制根据其产生方式可分为两类[13]。第一类是自下而上的无意识注意,它是由外部刺激驱动的。第二类是自上而下的有意识注意,称为集中注意。集中注意力是指具有预定目的并依赖于特定任务的注意力。本文所采用的注意力机制为集中注意。注意力机制使模型能够集中于输入数据中最重要的部分,从而提高特定任务的性能。通过关注输入序列中的关键信息,可以提升模型的泛化能力。注意力机制有助于捕捉长距离的依赖关系,这是循环神经网络等难以做到的。本文中注意力机制就是针对输入序列中重要信息给予更多的关注,并忽略一些无关信息。首先,考虑到不同的特征对于预测的贡献不同,将注意力权重定义为:

W=W1,W2,,WL

其中,WL为第L个特征的权重,之后对特征间的相对重要性进行设置:

Xt̃=xt1W1,xt2W2,,xtLWL

然后将设定相对重要性的X̃=X1̃,X2̃,,XT̃作为输入变量放入LSTM中。通过下述公式学习LSTM单元计算过程:

forgetgate=sigmoid(WfgXt̃+Whfght-1+bfg)
inputgate=sigmoid(WigXt̃+Whight-1+big)
outputgate=sigmoid(WogXt̃+Whoght-1+bog)
(C)t=(C)t-1(forgetgate)t+(inputgate)t(tanh(WCXt̃+WhCht-1+bC))
ht=outputgatetanh((C)t-1)

(13)式中,Wfg,Whfg为权重,bfg为偏置;(14)式中,Wig,Whig为权重,big为偏置;(15)式中,Wog,Whog为权重,bog为偏置。这里,ht-1表示先前的隐藏层单元,这些隐藏层单元逐个添加三个门的权重。经过(15)式的处理,(C) t 变为当前的存储单元。(16)式显示了先前隐藏单元输出和先前存储单元单元的乘法,以tanh和sigmoid激活函数的形式在三个门添加非线性特征,其中WCWhC为权重,bC为偏置。(17)式为隐层单元的输出。假定t-1t分别是之前和现在的时间步长,则:

y˜t=ht-1

最终的输出结果可表示为:

yT̃=(y˜1,y˜2,,y˜T)

1.3 改进的遗传算法

本文提出了一种改进的遗传算法用于注意力权重值的搜索。遗传算法[14]是一种人工优化方法,模拟了自然遗传的假设适应性。本文提出的改进遗传算法可对注意力权重进行调优。该改进遗传算法具备自我调节的能力,能够依据搜索过程即时反馈动态优化参数,从而增强对各类问题的适应力。这种参数自适应调整能力使得算法在解空间中可执行更为深入的全局搜索,有效规避了陷入局部最优的风险。此外,算法通过持续的参数更新,不仅保持了种群的多样性,还预防了过早收敛的问题,提升了整体的稳定性。通过调整如变异率等关键参数,本算法进一步确保了种群内部的遗传多样性,防止了种群的同质化趋势。改进的遗传算法具体步骤如下。

1) 种群初始化

初始化的目的是为后续的遗传操作随机生成一个初始种群。二进制编码是遗传算法中最常用的编码方法,本文对注意力权重进行编码,并直接嵌入到染色体中。这是一种将注意力机制与遗传算法相结合的方法。在这种设置中,遗传算法的每个个体不仅包含了问题的解,还包含了用于计算注意力权重的信息。

2) 种群选择操作

选择操作是从当前群体中选择优秀的个体,为交叉和变异做准备。随着候选个体适应度的增加,被选中的概率也随之增加。选择操作一般采用一种基于比例适应度分配的轮盘赌选择方法,也称为蒙特卡罗方法。然而该方法的一个缺点是可能导致一些适应度较高的个体无法被选中。本文对此进行了改进:首先保留适应度最高的个体,确保其能够顺利过渡到下一代,随后通过轮盘赌选择机制挑选剩余的个体。具体操作如下:

Step 1 计算种群f (i=1,2,⋯,M)中每个个体的适应度,M为种群的大小;

Step 2 适应值最大的个体直接进入下一阶段;

Step 3 计算每个剩余个体遗传给下一代的概率:

pxi=fxij=1Nf(xj)

Step 4 计算每个个体的累积概率:

qi=j=1ip(xj)

Step 5 在区间(0,1)内生成一个均匀分布的伪随机数r;若r<q1,则选取个体1;否则,当qk-1<rqk时,选择个体k;

Step 6 重复Step 5到Step 6 M-1次。

3) 改进的交叉操作

交叉操作一般采用部分匹配交叉操作,传统的方法是从相邻的两条染色体中随机选择片段进行交换。然而,通过轮盘赌选择的相邻两条染色体可能是相同的,这样交叉操作后两条染色体保持不变,因此该交叉操作没有效果。本文采用区间交叉,如(22)式所示:

c=ithcrosswithn/2+ith,i=1,2,,n/2

其中,c表示交点后生成的个体。

使用这种交换方法可以避免陷入局部最优,增加下一代的多样性,加快收敛速度。

4) 变异操作

变异操作是改变染色体上的某一点,本文采用两点变异的方式,可以利用变异算子的随机搜索能力。当运算结果接近最优解邻域时,能快速收敛到最优解。

5) 精英留存策略

交叉和变异可能导致最优个体在下一代中丢失,遗传算法无法收敛到全局最优解。为了避免这种情况的发生,本文引入“精英保留”策略。每一次变异操作后,将本代最佳个体BT与进化过程中迄今为止出现的最佳个体BA进行比较。如果BA大于BT, BA取代这一代最差的个体,转到下一代,BT直接转到下一代。如果BT等于或大于BA,BT直接到下一代,同时将BA替换为BT。这个过程如(23)式所示:

N=BT,if BTBABA,if BT<BA

其中,N代表进入下一代的个体。

6) 适应度函数的设置

基于注意力机制的LSTM模型的目标是捕捉时间序列中关键信息的结构,以此提高预测精度。这里,适应度函数选择LSTM的损失函数:

Fit(yT̃)=min L(yT̃,yT)

其中Fit(yT̃)为适应度函数,该公式中最重要的算子是重建过程,重建过程通过控制随机搜索的方向,对系统的性能有很大的影响。

1.4 性能度量

为了验证本文方法的有效性,使用平均绝对误差(MAE)、均方根误差(RMSE)和拟合优度R2衡量预测的质量。

平均绝对误差的公式如下:

MAE=1mi=1myi-yi^

其中yi为观测值,yi^为预测值,m为数据个数。

均方根误差的公式如下:

RMSE=1mi=1m(yi-yi^)2

拟合优度R2计算如下:

R2=1-i=1m(yi-yi^)2i=1m(yi-y^)2

针对不同算法之间的性能比较,本文除了采用上述方法进行性能比较之外,还对多个不同算法在验证集和测试集性能的比较采用修正的Friedman检验和Nemenyi检验进行比较。修正的Friedman检验计算如下:

FI=(N-1)χF2N(K-1)-χF2

χF2表示Friedman检验方法:

χF2=12NK(K+1)(i=1Kri¯2-K(K+1)24)

其中,N是数据集的个数,K是算法的个数。ri¯=1Kj=1Nrij,其中rij是第j个采样数据集中的第i个数据划分的等级。如果经过修正的Friedman检验拒绝了其原假设,则接下来采用Nemenyi检验进行进一步分析。首先计算出一个关键值(通常称为CD值)。当两个模型在数据分割上的平均排名差异超出了这个CD值,就可以拒绝这两个模型在方差变化影响上没有差异的假设。在这种情况下,平均排名较低的模型表示其性能更优。CD值通过以下方式确定:

CD=qαK(K+1)6N

其中,qα表示Tukey分布的临界值。

2  实验与分析

2.1 实验数据

为了验证本文设计框架的有效性,选择从Google计算集群[15]中收集的工作负载和资源跟踪数据作为本文的数据集。Google计算集群数据于2011年发布,已有大量研究将其用于评估预测[16-18]。此工作负载数据在29天内包含25 462 157个任务和672 003个作业。工作负载以作业的形式到达,每个作业都有多个任务,每个任务都可以看作是一个需要在特定计算机上运行的Linux程序。收集的数据将29天的数据总长度分成20 880个不同长度的时间段。每个时间段为2 min,通过分析任务的时间戳信息,统计任务个数和CPU、RAM等资源的使用记录。本次实验选择其中一个数据集作为实验所用数据集,该数据集包含100多万条记录信息,特征20个。

图2图3分别给出了该数据集中的全部页缓存(total page cache)、磁盘I/O时间(disk I/O time)的数据分布情况,其中横坐标为时间间隔(time slot count)。从图2图3可以看出两序列具有高度的非平稳性和非线性特征。

在数据集的划分上,本次实验选择数据集前80%的数据进行训练,中间10%作为验证集,最后10%的数据作为测试集。在实验部分,执行了100次的实验,从中选择出最优结果作为本文的实验结果。

2.2 实验结果

本文以CPU使用率(CPU rate)作为预测变量,其他19个特征作为输入特征,用于验证本文方法的有效性。本文方法在训练集中的拟合情况见图4所示。

图4中可以看到拟合值(fitted CPU usage)能很好地拟合观测值(observed CPU usage)。指标RMSE值为0.011 3,MAE为0.003 38,R2为0.936。其中,R2的值高达0.936,说明本文模型中自变量对因变量的解释程度较好。

为了验证本文方法的有效性和鲁棒性,对本文方法的短期预测结果和长期预测结果分别进行实验,同时与五类基准算法:长短时记忆网络[10]、支持向量回归、循环神经网络、渐进梯度回归树和卷积神经网络+门控循环单元[11]进行比较。

选择720个数据间隔的数据验证本文模型和基准模型结果的性能,该结果见表1

表1可看出,本文方法在RMSE、MAE和R2指标上具有优势。支持向量回归在三类指标上的表现在所有的方法中的表现是最差的。与卷积神经网络+门控循环单元相比,本文的方法在RMSE上降低了11%,在MAE上降低了12%,在R2中提高了2.72%。

图5给出了本文在验证集中所有数据的预测结果与基准模型的预测结果的实验对比结果。

图5可以看到支持向量回归的预测能力是最差的,其他五类方法的预测能力相对较好。表2给出了验证集所有数据的预测结果的定量比较。在表2中,本文方法在RMSE、MAE和R2指标上也具有优势。支持向量回归在三类指标上的表现在所有的方法中的表现是最差的。与渐进梯度回归树相比,本文方法在RMSE上降低了5.19%,在MAE上降低了10.6%,在R2上提高3.72%。

测试集中的短期预测结果,本文方法对比方法在测试集中的短期预测结果见表3

表3可以看出本文方法在RMSE、MAE和R2指标上具有优势。支持向量回归在三类指标上的表现在所有的方法中是最差的。与卷积神经网络+门控循环单元相比,本文的方法在RMSE上降低了6.1%,在MAE上降低了8.36%,在R2中提高了2.37%。

图6给出了本文模型在测试集中的预测结果与其他模型的对比结果。

表4给出了测试集所有数据预测结果比较。从图6表4可以看出支持向量回归的预测能力是最差的。在表4中,本文的方法在RMSE、MAE和R2指标上具有优势。与卷积神经网络+门控循环单元相比,本文方法在RMSE上降低了2.63%,在MAE上降低了11.4%,在R2上提高1.32%。

本文所述方法较基线方法在三个度量指标上都有一定的优势,这是由于自组织映射网络用于数据预处理,可以有效地对原始数据进行特征提取和降维,有助于去除噪声和无关信息,提高预测模型的准确性;通过注意力机制改进LSTM网络,使模型能够更加关注于对预测结果影响较大的数据部分。这种选择性关注可以提高模型对时间序列数据中关键信息的捕捉能力,提升预测精度。遗传算法是一种模拟自然选择过程的搜索算法,通过改进遗传算法确定注意力权重的最优值,可以增强模型的全局搜索能力,避免陷入局部最优解,提高预测性能。

本文采用修正的Friedman检验和Nemenyi检验对本文所述方法与基准方法进行显著性分析,在RMSE上修正的Friedman检验结果见表5

根据(28)式计算得到修正的Friedman检验值为58.5,当显著性水平取值为0.05,修正的Friedman检验临界值为8.026,因此需要拒绝六类算法具有相同预测性能的假设。执行Nemenyi测试,qα为2.85,CD为3.77,本文方法与渐进梯度回归树、长短时记忆网络以及卷积神经网络+门控循环单元存在重叠区域,然而本文方法与支持向量回归以及循环神经网络不存在重叠区域,因此可以判定本文方法在RMSE指标上预测效果好于以上两类方法。

R2上修正的Friedman检验结果见表6

根据(28)式计算得到修正的Friedman检验值为51,当显著性水平取值为0.05,修正的Friedman检验临界值为8.026,因此需要拒绝六类算法具有相同预测性能的假设。执行Nemenyi测试,qα为2.85,CD为3.77,本文方法与渐进梯度回归树、长短时记忆网络以及卷积神经网络+门控循环单元存在重叠区域,然而本文方法与支持向量回归以及循环神经网络不存在重叠区域,因此可以判定本文方法在R2指标上预测效果好于以上两类方法。

2.3 消融实验

通过消融实验评估本文框架的各个组成部分对整体性能的贡献。测试集中的消融实验结果见表7

表7中,去除了平滑操作(即使用注意力机制+LSTM+改进的遗传算法)算法的RMSE、MAE比本文的大,R2比本文的小。去除了注意力机制和改进遗传算法的方法(即使用数据平滑操作+LSTM)的RMSE和MAE比本文的更大。以上的实验说明在本文中注意力机制+改进的遗传算法对于预测精度的提升存在着较强的作用,数据平滑操作对于预测精度的提升存在一定的正向作用。

3  结 语

准确预测复杂多变的工作负载和资源使用序列对于云数据中心的高效运营至关重要。由于云数据中心的复杂特性,精确预测资源消耗是一项重大挑战。本文设计了基于注意力机制的云数据中心资源消耗预测框架,使用Google集群数据进行建模,实验结果表明本文模型在三类指标上显著优于几种广泛使用的学习模型,同时通过修正的Friedman检验和Nemenyi检验表明本文方法在均方根误差和R2上优于两类基线算法。

本文模型存在一些不足之处:训练阶段可能会需要更多的计算资源和时间;改进的遗传算法需要精细的参数调优才能达到最佳性能,这会增加模型训练的难度。

未来的工作将从以下两方面进行:1) 研究和实现更高效的训练算法,减少计算资源的需求和训练时间;2) 在训练过程中使用早停法避免过拟合,并减少不必要的训练迭代,以减小模型训练的难度。

参考文献

[1]

WANG SZHU FYAO Y Pet al. A computing resources prediction approach based on ensemble learning for complex system simulation in cloud environment[J]. Simulation Modelling Practice and Theory2021107: 102202. DOI: 10.1016/j.simpat.2020.102202 .

[2]

VALARMATHI KKANAGA SUBA RAJA S. Resource utilization prediction technique in cloud using knowledge based ensemble random forest with LSTM model[J]. Concurrent Engineering202129(4): 396-404. DOI: 10.1177/1063293x211032622 .

[3]

NGODUY D. Noise-induced instability of a class of stochastic higher order continuum traffic models[J]. Transportation Research Part B: Methodological2021150: 260-278. DOI: 10.1016/j.trb.2021.06.013 .

[4]

XU M XSONG C HWU H Met al. esDNN: Deep neural network based multivariate workload prediction in cloud computing environments[J]. ACM Transactions on Internet Technology202222(3): 75. DOI: 10.1145/3524114 .

[5]

ARIZA JJIMENO MVILLANUEVA-POLANCO Ret al. Provisioning computational resources for cloud-based e-learning platforms using deep learning techniques[J]. IEEE Access20219: 89798-89811. DOI: 10.1109/ACCESS.2021.3090366 .

[6]

KARIM M EMASWOOD M M S, DAS S, et al. BHyPreC: A novel Bi-LSTM based hybrid recurrent neural network model to predict the CPU workload of cloud virtual machine[J]. IEEE Access20219: 131476-131495. DOI: 10.1109/ACCESS.2021.3113714 .

[7]

NAWROCKI PGRZYWACZ MSNIEZYNSKI B. Adaptive resource planning for cloud-based services using machine learning[J]. Journal of Parallel and Distributed Computing2021152: 88-97. DOI: 10.1016/j.jpdc.2021.02.018 .

[8]

KUMAR JSAXENA DSINGH A Ket al. BiPhase adaptive learning-based neural network model for cloud datacenter workload forecasting[J]. Soft Computing202024(19): 14593-14610. DOI: 10.1007/s00500-020-04808-9 .

[9]

NGUYEN T, DO T, LE Ket al. An LSTM-based approach for predicting resource utilization in cloud computing[DB/OL].[2024-01-09]. DOI: 10.1145/3568562.3568647 .

[10]

ASHAWA MDOUGLAS OOSAMOR Jet al. Retraction note: Improving cloud efficiency through optimized resource allocation technique for load balancing using LSTM machine learning algorithm[J]. Journal of Cloud Computing202312(1): 171. DOI: 10.1186/s13677-023-00562-z .

[11]

DOGANI JKHUNJUSH FMAHMOUDI M Ret al. Multivariate workload and resource prediction in cloud computing using CNN and GRU by attention mechanism[J]. The Journal of Supercomputing202379(3): 3437-3470. DOI: 10.1007/s11227-022-04782-z .

[12]

KOHONEN T. The self-organizing map[J]. Proceedings of the IEEE199078(9): 1464-1480. DOI: 10.1109/5.58325 .

[13]

NIU Z YZHONG G QYU H. A review on the attention mechanism of deep learning[J]. Neurocomputing2021452: 48-62. DOI: 10.1016/j.neucom.2021.03.091 .

[14]

DENG WZHANG X XZHOU Y Qet al. An enhanced fast non-dominated solution sorting genetic algorithm for multi-objective problems[J]. Information Sciences: An International Journal2022585(C): 441-453. DOI: 10.1016/j.ins.2021.11.052 .

[15]

REISS CWILKES JHELLERSTEIN J L. Google cluster-usage traces: Format+ schema[DB/OL]. [2024-01-02].

[16]

AMVROSIADIS GPARK J WGANGER G Ret al. On the diversity of cluster workloads and its impact on research results[DB/OL]. [2024-01-02].

[17]

GUPTA SDILEEP A D. Long range dependence in cloud servers: A statistical analysis based on Google workload trace[J]. Computing2020102(4): 1031-1049. DOI: 10.1007/s00607-019-00779-4 .

[18]

BI JLI SYUAN H Tet al. Integrated deep learning method for workload and resource prediction in cloud systems[J]. Neurocomputing2021424: 35-48. DOI: 10.1016/j.neucom.2020.11.011 .

基金资助

国家自然科学基金(61375045)

国家社会科学基金(21BTJ013)

教育部人文社科研究项目(20YJC910008)

山西省统计科学研究项目(2023LZ028)

山西省高等学校教学改革创新项目(J20220548)

AI Summary AI Mindmap
PDF (3961KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/