基于深度确定性策略梯度的工业任务卸载策略

梁子豪 ,  栗娟 ,  刘进

武汉大学学报(理学版) ›› 2024, Vol. 70 ›› Issue (3) : 358 -366.

PDF (1168KB)
武汉大学学报(理学版) ›› 2024, Vol. 70 ›› Issue (3) : 358 -366. DOI: 10.14188/j.1671-8836.2023.0214

基于深度确定性策略梯度的工业任务卸载策略

作者信息 +

Industrial Task Offloading Strategy Based on Deep Deterministic Policy Gradient

Author information +
文章历史 +
PDF (1195K)

摘要

工业互联网背景下的移动边缘计算(Mobile Edge Computing, MEC)通过在靠近终端的位置部署边缘服务器,将计算任务卸载到工业网络边缘,以满足任务实时响应和终端节能的需求。由于工业场景复杂性和环境动态性,卸载决策需要在满足任务时延需求的同时尽可能降低系统成本,为此提出了一个基于深度确定性策略梯度(Deep Deterministic Policy Gradient, DDPG)的工业任务卸载策略。首先构建了一个端边协同的智能工厂MEC系统模型,以降低任务总时延和系统能耗为目标,将卸载问题转化为混合整数非线性规划问题,然后设计采用DDPG算法来得到最优卸载决策,提高服务质量,最大化节约系统成本。仿真结果表明,该策略在降低时延、系统能耗和成本方面比其他方法更优。

Abstract

Mobile edge computing (MEC) in the Industrial Internet domain deploys edge servers near the terminals. It supports offloading the computation task into the industrial network edge to meet the requirements of real-time task response and terminal energy saving. Due to the complexity and dynamic nature of industrial scenarios, offloading decisions must satisfy the latency requirements of industrial applications while minimizing system costs. To tackle this challenge, we introduce an industrial task offloading strategy grounded in the deep deterministic policy gradient (DDPG) approach. This strategy aims to minimize total latency and energy consumption effectively. Firstly, an intelligent factory MEC system model for device-edge collaboration was constructed, and the offloading problem was formulated as a hybrid integer nonlinear programming; then, a DDPG algorithm was designed and proposed to optimize the objective function, further enhance the Quality of Service (QoS), and maximize the system’s cost savings. Simulation results demonstrate that our proposed DDPG-based strategy outperforms other approaches in reducing latency, energy consumption, and system cost.

Graphical abstract

关键词

移动边缘计算 / 深度强化学习 / 任务卸载 / 深度确定性策略梯度

Key words

mobile edge computing (MEC) / deep reinforcement learning / task offloading / deep deterministic policy gradient (DDPG)

引用本文

引用格式 ▾
梁子豪,栗娟,刘进. 基于深度确定性策略梯度的工业任务卸载策略[J]. 武汉大学学报(理学版), 2024, 70(3): 358-366 DOI:10.14188/j.1671-8836.2023.0214

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

随着工业互联网的快速发展,智能工厂中大规模智能终端设备通过工业无线网络实现了数据的互通互联[1]。各种各样的工业终端设备产生了很多异构工业任务,如设备实时监控、环境异常检测、设备终端协同完成实时操作等,由于工业终端设备自身计算能力和资源有限,无法在本地端对数据进行实时处理。

云计算技术的出现和广泛应用解决了终端设备计算存储能力不足、应用服务质量得不到保障等问题[2]。云计算通过提供按需、可扩展和易于管理的资源来改变传统计算范式。它通过将计算和存储等资源从本地环境转移到云端,极大地缓解了本地算力不足的问题。但是在智能工厂中,云计算设备通常会部署在离工业现场较远的位置,然而现今很多工业任务具有较高的时延敏感性,在带宽不足的情况下,传统的云计算模型难以实现终端应用对实时响应的需求[34]。移动边缘计算(Mobile Edge Computing,MEC)[5]作为一种新型的计算范式,通过在移动终端附近部署具有计算和存储能力的边缘服务器,提高边缘端的计算和存储能力。MEC继承了云计算的部分缓存和计算能力,将任务卸载到离用户更近的边缘服务器上执行,既弥补了工业终端设备计算能力有限的不足,又解决了由云计算导致的传输延迟和能耗高的问题,提高服务质量。

在多终端、多边缘服务器的两层异构资源参与的智能工厂MEC系统中,如何根据应用需求、资源特征、终端实时位置和环境状态对任务进行高效卸载,是目前工业界和学术界研究的热点问题。有学者提出用静态的卸载方法,如基于智能算法的卸载方法、基于博弈论的卸载方法和基于数学优化的卸载方法等[6~11],此类方法由于其静态性,不适合终端移动、环境状态实时变化的工业互联网场景。为此,有些学者使用强化学习(Reinforcement Learning,RL)来解决此问题[12],Q-learning算法作为一种经典的强化学习算法,可通过构造Q表来确定下一个动作对应的状态值,但由于Q表的低维度输入和输出在复杂的工业互联网MEC场景中会存在维数灾难问题,因此使用深度强化学习(Deep Reinforcement Learning,DRL)来进行任务卸载成为一种更好的解决方案[13~15]

基于此,本文提出了一种基于深度确定性策略梯度的工业任务卸载策略,该策略针对智能工厂MEC系统中工业任务如何最优卸载的问题进行建模,以最小化应用时延和系统能耗为目标,将其转化为混合整数非线性规划问题。由于该问题属于非确定性多项式困难 (Non-deterministic Polynomial hard, NP-hard)问题,因此,采用基于深度确定性策略梯度(Deep Deterministic Policy Gradient,DDPG)的计算卸载方法得到最优卸载决策。同时在强化学习部分设置新的奖励函数,通过设置不同的权重系数侧重于对一个指标的优化,以适应工业场景的灵活性。

1  相关工作

目前MEC系统中任务卸载问题的优化目标主要包括时延和能耗。针对不同的优化目标,学者们提出了多种优化方法。

考虑到提高MEC系统的性能,Meng等[6]受益于在线优化算法的发展,提出了一种基于粒子群优化的任务卸载算法,使网络中所有MEC服务器的收益最大化。Zhou等[7]将自适应遗传算法与自适应粒子群优化算法相结合,提出了一种改进的分层自适应搜索算法,逐层细化资源分配方案,使能耗最小化。以上研究主要将传统的智能算法应用于计算卸载和资源优化问题,但这类方法往往需要访问环境先验信息,这在MEC系统中有些困难。

有些学者将博弈论与MEC结合,Zhao等[8]提出了一种基于博弈论方法的边缘终端协同计算卸载和资源分配优化方案,使云辅助MEC系统的系统效用最大化。Xiao等[9]设计了一种非合作博弈论策略选择方法,并且推导了相关均衡,可以使卸载方法在显著降低延迟的情况下提高MEC能效。

也有一些学者采用数学优化方法来解决目标优化问题,Wang等[10]解决了由于整合云无线接入网络与MEC技术而导致的移动服务提供商的高能耗问题。在时延约束的条件下,采用迭代算法求解该问题,以达到优化功耗与性能权衡的目标。Hu等[11]考虑了能源效率和服务延迟之间的权衡,对所提优化问题采用凸分解和子模块方法,提出了在线卸载和资源分配算法,实现了能源效率和服务延迟的优化。

以上任务卸载优化方法在一定程度下可提高MEC系统的性能,但是由于工业互联网场景的复杂性和环境动态性,实时提取环境状态进行最优卸载存在很多困难。随着人工智能(Artificial Intelligence, AI)的快速发展,RL在AI领域取得了相当大的突破。近年来,RL方法也被广泛应用于MEC场景,Gao等[16]设计了一个基于Q-learning的计算卸载策略和一个状态损失函数STLF,可以通过卸载决策来最小化系统损失函数,优化系统延迟。Alqerm等[17]提出了一种新的Q-learning算法,可以在任务随机到达的情况下保证资源公平分配的同时优化系统的总效用。但Q-learning算法通常会受到维数灾难问题的约束,Mnih等[18]将卷积神经网络与传统强化学习中的Q-learning算法相结合,提出了Deep Q-Network (DQN)算法,解决了Q-learning中低维输入和低维输出的问题。基于此,Wu等[19]考虑了一个具有时变衰落通道的多用户多服务器MEC网络,提出了一种基于DQN的任务卸载方法降低系统总成本。Cheng等[20]设计了一种DQN卸载算法以解决智能工厂中最小化延迟和能耗加权和的优化问题。Liu等[21]用离散-连续混合动作空间的马尔可夫决策过程(Markov Decision Process, MDP)模型描述了计算资源分配问题,并提出了一种基于参数化深度Q-Network (PDQN)的方法来解决该问题。尽管以上的工作对Q-learning进行了一定的改进,大大提高了算法效率,但是并没有解决在连续动作空间下的优化问题。基于此,在面对动态的工业互联网场景时,亟需采用合适的任务卸载方法以降低任务时延和系统能耗。

2  系统模型

在工业互联网的背景下,本文构建了一个端边协同的智能工厂MEC系统模型,该系统由智能工业终端设备和带有工业基站的边缘服务器组成,如图1所示本地工业终端设备具有一定的计算能力和存储能力,主要包括智能工厂中的监控摄像头、机床、机械臂、仪器等设备。本地工业终端设备可以自行处理任务,也可以选择将任务卸载给边缘服务器处理。边缘服务器比本地工业终端设备拥有更多的计算和存储资源,以及更强的任务处理能力,所以对于一些对于计算要求比较高的任务,可以将其卸载到边缘服务器上执行。

系统的具体工作流程如下:首先,本地工业终端设备应用生成任务,并通过工业基站将相关信息发送到边缘服务器;然后,根据收集到的任务信息和网络状态决定是否卸载;最后,根据卸载决策方案执行任务并返回结果。

2.1 任务模型

本地工业终端设备会产生时延敏感的异构工业任务,每个终端设备都有计算密集型任务需要及时处理,假设计算任务是不可分的,并且在任务处理过程中网络状态是稳定不变的。任务卸载可分为部分卸载和整体卸载两种类型。部分卸载是指将一个独立的任务分解成多个子任务,将部分子任务从终端卸载到边缘服务器上执行,保留部分子任务在本地终端上处理。整体卸载是指将所有任务卸载到边缘服务器进行处理。本文考虑MEC模型中任务的整体卸载,而且任务只能在边缘服务器或本地终端上单独处理。

当本地工业终端设备产生任务时,首先会向工业基站请求任务是否卸载,已经到达基站但是没有卸载的任务会等待基站的调度,用一个先进先出的队列存储。假设一共有m个本地工业终端设备,则会产生m个独立卸载的任务,任务队列为非抢占式,将任务集合定义为V={v1,v2,…,vm },每个任务定义为:

vi=di,Ci,τi,Emax

其中,di 表示任务的数据大小,Ci 表示完成任务所需要的CPU周期数,τi 表示任务的最大容忍时延,Emax为任务的最大限制能耗。

2.2 通信模型

每个本地工业终端设备产生的独立任务,可以在本地执行,也可以通过无线网络将任务卸载到计算能力强的边缘服务器上执行,分配其计算资源,以降低任务处理的时延和能耗。假设本地工业终端设备与工业基站之间的信道增益为g,则:

g=127+25log10 D

其中,D表示本地终端到边缘服务器基站之间的距离。

根据香农公式,各本地终端到边缘服务器的传输速率rl,e为:

rl,e=Blog21+Pin×g2N×B

其中,l表示本地终端,e表示边缘服务器,Pin表示工业终端的传输功率,B表示终端与边缘服务器基站之间无线信道的通信带宽,N表示信道的噪声功率密度。

2.3 计算模型

在本节中,我们将重点关注任务的时延和能耗方面的计算模型,包括本地计算模型和边缘计算模型。为了简化模型,假设每个服务器同时只能处理一个任务。

2.3.1 本地计算模型

工业终端设备具有一定的计算和存储能力,可以处理一些轻量级的任务请求。由于任务是在本地执行的,因此只考虑任务在本地的执行时间为总时间,用(4)式表示:

Tlvi=Cifl

其中,fl为本地终端的计算能力。

在本地终端上执行任务,没有通信开销,因此只考虑本地执行能耗,用(5)式表示:

Elvi=kCifl2

其中,k表示功率转换系数,其大小取决于CPU芯片架构。

2.3.2 边缘计算模型

尽管本地终端具有一定的计算和存储资源,但与边缘服务器相比,其计算能力和存储容量相对有限,只能处理少量的轻量级任务请求。为了有效减少任务总时延和系统能耗,可以将绝大部分任务请求卸载到边缘服务器进行处理。当任务被卸载到边缘服务器上执行时,传输时间为:

Tetravi=dirl,e

在边缘服务器上的执行时间为:

Teexevi=Cife

其中,fe表示边缘服务器分配给该任务的计算能力,并且满足fefmaxfmax表示该服务器的最大计算能力。

任务在经过边缘服务器处理后,返回的计算结果非常小,因此边缘服务器把计算结果返回给本地终端的时延和能耗可以忽略不计。系统总时间为在本地终端上执行的时间、向边缘服务器卸载任务时的传输时间以及在边缘服务器上执行任务时间的总和。任务在传输过程中的能耗为:

Eetravi=Pin×Tetravi

在边缘服务器上的执行能耗为:

Eeexevi=q×di

其中,q表示在边缘服务器上处理1 bit数据的能耗。

系统总能耗为在本地终端上执行的能耗、向边缘服务器卸载任务时的传输能耗以及在边缘服务器上执行任务能耗的总和。当该任务执行完成后,边缘服务器可用的计算资源将会减少:

frem=fmax-fe

其中,frem表示当前边缘服务器所剩余的计算资源。

2.4 优化目标

本文将该系统完成本地工业终端任务所花费的时延和能耗的加权和定义为系统总开销。优化的目的是优化系统总开销。假设完成任务vi的时延成本和能耗成本分别如(11)、(12)式:

Ti=ailTlvi+aieTevi
Ei=ailElvi+aieEevi

其中,ail,aie0,1,当ail为1时,aie为0,此时任务在本地上执行;当aie为1时,ail为0,此时任务被卸载到边缘服务器上执行;由于某一时刻任务也只能在本地、边缘服务器上的一个执行,因此需要满足约束条件ail+aie=1

系统总开销应为时延开销成本和能耗开销成本的加权和,表述如(13)式:

Zi=βiTTi-τi+βiE(Ei-Emax)

其中,0βiT10βiE1,βiT+βiE=1βiTβiE分别是分配给时延和能耗的权重系数。针对不同场景的应用需求,可以灵活地调整时延能耗权重系数。例如,当本地工业终端设备的电池容量有限时,工作人员选择设置更大的能耗权重值βiE进行任务卸载,使系统可以在满足更大容忍时延的条件下减少能量消耗,达到设备节能的需求。反之,对于电池容量充足的设备选择设置更大的时延权重值βiT进行任务卸载,通过侧重于对时延优化,达到在满足最大能耗限制的条件下减少延迟、获得更好的服务质量的目的。

任务总时延和系统能耗的优化问题可以表示为系统开销最小化的问题,将目标函数定义为:

mini=1nZi

s.t. C1:ail,aie0,1

C2:Tiτi
C3:EiEmax
C4:frem0

其中,C1表示任务在本地或者边缘服务器上执行;C2表示完成任务的时间不能超过任务的最大容忍时延;C3表示完成任务的能耗不能超过最大限制能耗;C4表示完成该任务所需的资源不能超过边缘服务器所剩余的资源。

3  基于DDPG的工业任务卸载算法

在MEC环境中,传统算法无法根据不断变化的环境状态灵活制定任务卸载决策,优化问题(14)是一个NP-hard的混合整数非线性规划问题[22]。由于求解优化问题的过程不仅需要满足任务卸载的最优策略,而且需要使每个边缘服务器充分利用其有限的资源,强化学习算法是一种有效地应对无状态转移概率模型的方法,它可以通过从经验中学习来适应各种复杂的MEC场景,并获得最优的任务卸载策略。本节基于深度强化学习的特性,首先将该优化问题转化为一个马尔可夫决策过程(Markov Decision Process, MDP),然后应用基于深度确定性策略梯度的任务卸载策略。

3.1 MDP形式化

用一个四元组{S,A,P,R}表示马尔可夫决策过程,其中,S为状态空间;A为动作空间,确定代理可执行的操作或行为集合;P为转移函数,表示在给定状态和动作后,系统转移到下一个状态的概率分布,这反映了环境的动态变化以及代理决策的影响;R为奖励函数,用于量化系统在不同状态和动作下的性能和目标。

1) 状态空间:状态集合由工业终端设备产生的所有任务构成,假设一共有m个工业终端设备,则S={s1,s2,,sm}si={vi,fl,Pin,frem}。其中,vi=di,Ci,τi,Emaxvi包括任务vi的数据大小di、所需要的CPU周期数Ci、最大容忍时延τi和最大限制能耗Emaxfl表示终端设备的计算能力;Pin表示终端设备任务的上传功率;frem表示边缘服务器剩余的计算资源。

2) 动作空间:定义为任务在本地或者边缘服务器上执行的决策,A=a1,a2,,amai=ail,aie,其中ail,aie分别表示任务在本地或者边缘服务器执行的卸载决策,并且aie=aie1,aie2,,aiej,表示卸载到第j个边缘服务器上。

3) 奖励函数:agent每次执行动作后,会根据状态转移概率得到下一时刻的新状态,然后根据奖励函数从外部环境中获得奖励值。奖励值用于评估代理在执行决策时所选择的行动的利弊。合理的奖励值对算法的性能起着重要的作用。一般来说,奖励函数会根据优化目标来设定,若该任务在约束条件之内完成,则给其奖励;反之就要给其惩罚。奖励函数定义如(15)式:

R=-Zi,C1~C4约束成立-1,otherwise

3.2 算法描述

DDPG结合了深度神经网络和确定性策略梯度方法,能够学习到连续动作空间中的最优策略。DDPG使用确定性策略梯度方法,可以直接输出连续动作空间中的动作,而不需要通过采样和离散化的方式选择动作。这使得DDPG能够更好地处理高维、连续的动作空间,避免了采样带来的噪声和不准确性。DDPG是在DQN双网络的基础上发展而来,并引入了4个神经网络,即Actor动作估计网络、Actor动作目标网络、Critic状态估计网络和Critic状态目标网络,如图2所示。

其中,Actor动作估计网络负责根据当前状态S选择当前动作A,以便与环境进行交互并生成新状态S′和奖励R,同时,它负责迭代更新策略网络的参数θ;Actor动作目标网络的任务是在利用经验回放池中采样得到的下一状态S′的基础上,生成最优的下一动作A′,从而极大程度地减少训练过程中的冗余学习,并且网络参数θ′会定期从θ复制,以帮助训练的稳定性。Critic状态估计网络负责更新参数ω和计算当前的Q值,其中Q值表示在给定状态S和执行动作A的情况下,系统能够获得的累积奖励的期望值;Critic状态目标网络负责计算目标Q值,网络参数ω′会定期由ω复制。

在更新网络参数时,DDPG使用软更新策略,即每次更新将部分地将当前网络参数向目标网络参数进行靠近,而不是直接替换,如(16)、(17)式所示。

θ'=τθ+1-τθ'
ω'=τω+1-τω'

对于Critic状态估计网络的更新采用均方差损失函数:

Jω=1mj=1mγQ'ϕj+1,μ'ϕj+1|θ';ω'+rj-ϕj,aj;ω2

对于Actor动作估计网络的损失函数,与Q值成反比:

J(θ)=-1mj=1mQϕj,aj;ω

DDPG算法的伪代码描述如算法1所示。

4  实验分析

4.1 环境及参数配置

为验证模型和算法的有效性,采用Python语言设计了仿真实验。本实验使用AMD Ryzen 7 6800HSCreator Edition,16.0 GB RAM,3.20 GHz的PC进行开发,实验环境为Python3.9和Pytorch2.0.1。在算法实现过程中,DDPG算法的网络参数设置为:aactor=0.000 4,acritic=0.004,γ=0.99,σ=0.01。采用了包含3个异构边缘服务器和不同数量的工业终端设备的仿真环境,其他实验参数设置如表1所示。

4.2 评价指标

本文选取系统时间开销和能耗开销作为评价指标,系统时间开销为任务卸载的总时延,并且通过设置不同的工业终端设备数量(10,20,30,40,50)和时延能耗权重系数对相关的评价指标进行对比分析。对比算法包括任务全在本地执行(Local)、任务随机卸载执行(Random)、采用贪心算法卸载执行(Greedy)、采用DQN算法卸载执行以及本文提出的DDPG算法卸载执行。

4.3 结果分析

图3显示了当时延和能耗权重系数都为0.5,且工业终端设备数量为30时,在训练1 000轮后的系统累计平均奖励的收敛曲线。从图3中可以看出在迭代次数到达一定值时,由于DDPG算法在与环境的多次交互中进行了充分的探索,并且由于经验池的功能会降低样本之间的关联性,因此基于DDPG的任务卸载算法可以实现相对稳定的收敛。

当时延和能耗权重系数都为0.5时,通过设置不同的工业终端设备个数,并且每种情况取10次实验结果的平均值,系统时间开销和能耗开销如图4图5所示。

图4图5可知,随着工业终端设备数量的增加,各种算法的时间开销和能耗开销都在随之不断增加。其中,由于任务规模的扩大,在本地执行会大大增加工作负载,因此Local算法的时间和能耗开销最高,并且增长速度最快。Random和Greedy算法会将一部分任务卸载到边缘服务器计算,减少了在本地执行的工作负载,在时间和能耗开销上略低于Local算法,但由于无法动态地做出最优卸载决策,因此该算法在时延和能耗开销方面也不能达到很好的效果。DQN算法基于深度强化学习的机制,动态地进行任务卸载,在时延和能耗开销上低于前3种算法,但由于存在训练不稳定问题,导致性能相比DDPG较差。可以注意到,本文所提出的DDPG卸载算法在时延和能耗开销方面比其他4种算法都低,性能最优。

考虑到在不同的工业场景下,需要定义的服务质量(Quality of Service,QoS)不同,为了评价工业终端设备在不同QoS下的适应性性能[2324],通过设置不同的时延权重系数βT和能耗的权重系数βE进行实验。本组实验重在考察时延权重系数和能耗权重系数对DDPG算法性能的影响,算法在不同权重系数下时间开销和能耗开销如图6图7所示。

图6图7可知,当时延权重系数βT大于0.5时,能耗权重系数βE小于0.5,该算法的奖励函数更加侧重于对时延的优化,随着工业终端设备个数的增加,该算法所花费的时间相比较于时延权重系数等于0.5时更少,能耗则相对更高。反之,当时延权重系数βT小于0.5时,能耗权重系数βE大于0.5,时间开销相对更高,能耗开销相对更低。实验表明,在智能工厂系统中,该算法针对于不同QoS的适应性性能良好,针对不同的应用场景,可以通过设置不同时延权重系数和能耗权重系数的大小来实现工业终端设备降低时延以及节能的需求。

5  结 语

在本文中,我们研究了当前工业互联网环境下的任务卸载策略。首先,构建了一个端边协同的智能工厂MEC模型,并以最小化时延和能耗总成本为目标提出了优化目标,然后根据目标函数的特点,提出了一种DDPG算法解决该NP-hard问题。仿真实验结果表明,该算法在降低系统时延和能耗总成本方面优于其他卸载方案。但是该研究在卸载过程中对于数据安全保护方面具有一定的局限性。在未来的工作中,将考虑更复杂的MEC场景,在MEC场景中引入云中心,实现端边云协同,更有效地提升MEC系统性能。此外,将考虑如何更加安全地进行任务卸载,提高卸载过程中的安全性和隐私性。

参考文献

[1]

LIU YCHI CZHANG Y Wet al. Identification and resolution for industrial Internet: Architecture and key technology[J]. IEEE Internet of Things Journal20229(18): 16780-16794. DOI: 10.1109/JIOT.2022.3160737 .

[2]

LEE J. A view of cloud computing[J]. International Journal of Networked and Distributed Computing20131(1): 2. DOI: 10.2991/ijndc.2013.1.1.2 .

[3]

沈华, 王丽琼. 基于移动边缘计算的任务卸载及隐私保护问题综述[J]. 武汉大学学报(理学版)202369(2): 258-269. DOI: 10.14188/j.1671-8836.2022.0187 .

[4]

SHEN HWANG L Q. Task offloading based on mobile edge computing and its privacy-preserving issues: A survey[J]. Journal of Wuhan University (Natural Science Edition)202369(2): 258-269. DOI: 10.14188/j.1671-8836.2022.0187(Ch ).

[5]

牛鑫, 吕现伟, 余辰. 边缘智能: 现状与挑战[J]. 武汉大学学报(理学版)202369(2): 270-282. DOI: 10.14188/j.1671-8836.2023.0026 .

[6]

NIU X X WYU C. Edge intelligence: State-of-the-art and challenges[J]. Journal of Wuhan University (Natural Science Edition)202369(2): 270-282. DOI: 10.14188/j.1671-8836.2023.0026(Ch ).

[7]

ABBAS NZHANG YTAHERKORDI Aet al. Mobile edge computing: A survey[J]. IEEE Internet of Things Journal20185(1): 450-465. DOI: 10.1109/JIOT.2017.2750180 .

[8]

MENG Y FLI J Z. Task offloading and resource allocation mechanism of moving edge computing in mining environment[J]. IEEE Access20219: 155534-155542. DOI: 10.1109/ACCESS.2021.3129464 .

[9]

ZHOU T QYUE Y LQIN Det al. Joint device association, resource allocation, and computation offloading in ultradense multidevice and multitask IoT networks[J]. IEEE Internet of Things Journal20229(19): 18695-18709. DOI: 10.1109/JIOT.2022.3161670 .

[10]

ZHAO J HLI Q PGONG Yet al. Computation offloading and resource allocation for cloud assisted mobile edge computing in vehicular networks[J]. IEEE Transactions on Vehicular Technology201968(8): 7944-7956. DOI: 10.1109/TVT.2019.2917890 .

[11]

XIAO ZDAI X XJIANG H Bet al. Vehicular task offloading via heat-aware MEC cooperation using game-theoretic method[J]. IEEE Internet of Things Journal20207(3): 2038-2052. DOI: 10.1109/JIOT.2019.2960631 .

[12]

WANG X HWANG K ZWU Set al. Dynamic resource scheduling in mobile edge cloud with cloud radio access network[J]. IEEE Transactions on Parallel and Distributed Systems201829(11): 2429-2445. DOI: 10.1109/TPDS.2018.2832124 .

[13]

HU HSONG W WWANG Qet al. Energy efficiency and delay tradeoff in an MEC-enabled mobile IoT network[J]. IEEE Internet of Things Journal20229(17): 15942-15956. DOI: 10.1109/JIOT.2022.3153847 .

[14]

YANG ZLIU Y WCHEN Yet al. Cache-aided NOMA mobile edge computing: A reinforcement learning approach[J]. IEEE Transactions on Wireless Communications202019(10): 6899-6915. DOI: 10.1109/TWC.2020.3006922 .

[15]

ZHAO RWANG X JXIA J Jet al. Deep reinforcement learning based mobile edge computing for intelligent Internet of Things[J]. Physical Communication202043: 101184. DOI: 0.1016/j.phycom.2020.101184 .

[16]

ABDULAZEEZ D HASKAR S K. Offloading mechanisms based on reinforcement learning and deep learning algorithms in the fog computing environment[J]. IEEE Access188111: 12555-12586. DOI: 10.1109/ACCESS.2023.3241881 .

[17]

TAO Y CQIU JLAI S Y. A hybrid cloud and edge control strategy for demand responses using deep reinforcement learning and transfer learning[J]. IEEE Transactions on Cloud Computing202210(1): 56-71. DOI: 10.1109/TCC.2021.3117580 .

[18]

GAO Z HHAO W MHAN Zet al. Q-learning-based task offloading and resources optimization for a collaborative computing system[J]. IEEE Access20208: 149011-149024. DOI: 10.1109/ACCESS.2020.3015993 .

[19]

ALQERM IPAN J L. Enhanced online Q-learning scheme for resource allocation with maximum utility and fairness in edge-IoT networks[J]. IEEE Transactions on Network Science and Engineering20207(4): 3074-3086. DOI: 10.1109/TNSE.2020.3015689 .

[20]

MNIH VKAVUKCUOGLU KSILVER Det al. Playing atari with deep reinforcement learning[EB/OL]. 2013arXiv: 1312.5602.

[21]

WU Y CDINH T QFU Y Ret al. A hybrid DQN and optimization approach for strategy and resource allocation in MEC networks[J]. IEEE Transactions on Wireless Communications202120(7): 4282-4295. DOI: 10.1109/TWC.2021.3057882 .

[22]

CHENG W JLIU X SWANG X Tet al. Task offloading and resource allocation for industrial Internet of Things: A double-dueling deep Q-network approach[J]. IEEE Access202210: 103111-103120. DOI: 10.1109/ACCESS.2022.3210248 .

[23]

LIU TNI S GLI X Qet al. Deep reinforcement learning based approach for online service placement and computation resource allocation in edge computing[J]. IEEE Transactions on Mobile Computing202322(7): 3870-3881. DOI: 10.1109/TMC.2022.3148254 .

[24]

YANG YHU Y LGURSOY M C. Deep reinforcement learning and optimization based green mobile edge computing[C]//2021 IEEE 18th Annual Consumer Communications & Networking Conference (CCNC). New York: IEEE Press, 2021: 1-2. DOI: 10.1109/CCNC49032.2021.9369566 .

[25]

LI JQIN Z WLIU Wet al. Energy-aware and trust-collaboration cross-domain resource allocation algorithm for edge-cloud workflows[J]. IEEE Internet of Things Journal2023, PP(99): 1. DOI: 10.1109/JIOT.2023.3315339 .

[26]

QIN Z WLI JLIU WYU X. Mobility-aware and energy-efficient task offloading strategy for mobile edge workflows[J]. Wuhan Univ J of Nat Sci202227(6):476-488. DOI: https://doi.org/10.1051/wujns/2022276476 .

基金资助

国家自然科学基金(62102292)

武汉市知识创新专项曙光项目(2023010201020440)

智能机器人湖北省重点实验室(武汉工程大学)科研资助项目(HBIRL 202204)

武汉工程大学青年教师基金(K202035)

武汉工程大学研究生教育创新基金(CX2023301)

AI Summary AI Mindmap
PDF (1168KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/