基于深度强化学习的无人机矿井自主巡航研究

沈凡凡, 杨博帆, 梁琦玮, 惠丽洁, 徐超

武汉大学学报(理学版) ›› 2023, Vol. 69 ›› Issue (2) : 205 -214.

PDF (2002KB)
武汉大学学报(理学版) ›› 2023, Vol. 69 ›› Issue (2) : 205 -214. DOI: 10.14188/j.1671-8836.2022.0216

基于深度强化学习的无人机矿井自主巡航研究

    沈凡凡, 杨博帆, 梁琦玮, 惠丽洁, 徐超
作者信息 +

Research on Autonomous Mine Cruise of UAV Based on Deep Reinforcement Learning

    Fanfan SHEN, Bofan YANG, Qiwei LIANG, Lijie HUI, Chao XU
Author information +
文章历史 +
PDF (2049K)

摘要

针对目前矿井传感器所收集数据的传输效率差、实时性低、丢包率高等问题,提出了一种基于深度强化学习的无人机矿井自主巡航解决方法,以有效收集物联网节点数据。该方法以无人机作为传输中介,根据矿井物联网节点数据生成周期性的不同差值,利用强化学习TD3(Twin Delayed Deep Deterministic policy gradient algorithm)算法实现无人机最优路径规划。同时算法考虑并设计了符合矿井实际场景的环境、奖励值、状态信息等。提出了一种预测等待的方法,预测待采集数据产生时间并确定目标节点,无人机在信号覆盖范围内前往目标节点提前等待,以实时获取矿井传感器的生成数据。实验结果表明,无人机能够自主决策实现最优路径规划,并收集节点数据;在训练回合为700时,奖励值达到峰值,算法达到收敛并具备优异的表现。

Abstract

Aiming at the problems of poor transmission efficiency, low real-time performance and high packet loss rate of data collected by mine sensors at present, a mine autonomous cruise method of unmanned aerial vehicle(UAV) based on deep reinforcement learning was proposed to effectively collect data of Internet of Things nodes. Specifically, the method takes UAV as the transmission intermediary, and according to the different values of data generation cycle of mine IOT node, Twin Delayed Deep Deterministic policy gradient algorithm (TD3) is used to realize the optimal path planning of UAV. At the same time, the algorithm also considers and designs the environment, reward value, and state information that conforms to the actual mine scene. In particular, we propose a predictive waiting method, which predicts the generation time of data to be collected and determines the target node. The UAV goes to the target node and waits in advance within the signal coverage range to obtain the data generated by the mine sensor in real time. The experimental results show that the UAV can realize the optimal path planning and collect node data by autonomous decision. When the training round is 700, the reward value reaches the peak, the algorithm reaches convergence and has excellent performance.

Graphical abstract

引用本文

引用格式 ▾
沈凡凡, 杨博帆, 梁琦玮, 惠丽洁, 徐超. 基于深度强化学习的无人机矿井自主巡航研究[J]. 武汉大学学报(理学版), 2023, 69(2): 205-214 DOI:10.14188/j.1671-8836.2022.0216

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

煤炭行业作为我国重要的传统能源行业,是我国国民经济的关键组成部分。为了推进煤炭工业的高质量发展,必须要将煤矿智能化摆在首位(http://www.nea.gov.cn/2020-03/03/c_138838778.htm)。当前,各级政府与煤炭企业积极响应国家号召,尝试并建成一批无人开采的智能化矿井,伴随产生的问题是规范缺失,数据丢包率高及传输效率过低。现代化智能矿井通常基于物联网架构,采用传感器收集敏感性数据,主要包括重要设施的状态参数、数据阈值,通过对数据进行分析决策以缓解事故风险,安全事故发生概率取决于数据信息的可靠性及传输效率[1]。目前,智能化矿井主要运用传感器进行数据采集,细化为煤矿感知数据系统、安全监控系统、井下作业人员管理系统、工业视频监控系统。其中,煤矿感知数据系统主要采取物联感知、视频感知等技术,从煤矿地面、井下作业区等地获取数据。此外,安全监控系统作为保障作业人员安全的重要防线,尤为重要,该系统实时监测甲烷浓度、一氧化碳浓度、二氧化碳浓度、风速、风压、温度等。节点数据的收集具有一定的采集频率,由传感器收集并周期性传输至基站(基站可以是地面接收端,也可以是云服务器[2])。这些密集型数据需要及时上传至指挥中心并提供服务,然而,由于矿井密闭狭长,井下数据传输端与地面接收端距离过长,使得传播延迟较高[3],无法满足实际需求,不利于井上指挥中心有效决策,甚至会引发安全事故。

近年来,无人机以其灵活性高、成本低及体积小引起了极大的关注。因此,无人机广泛应用于目标追踪、信息通信、情报侦测、环境数据监测等复杂领域,如:灾后紧急救援搜救、油气田测绘、关键数据收集等,取得了可喜的成就[4]。与传统的固定设备定点无线通信相比,无人机辅助通信技术可靠性更强,有望在无线通信系统引发技术革命,凭借范围更广、层次更深的覆盖,作为可移动空中基站从传感器节点采集数据,实现绿色通信。对比当前依赖地面基站的物联网系统,无人机作为空中基站具备更显著的优势,如大范围覆盖的视距无线传输(line of sight,LOS),时延敏感性数据在限定时间内的收集或提高光谱和能源效率的动态三维(three-dimensional,3D)重建及部署[5]。尽管当前无人机的自动化程度已高度发达,但仍然依赖于人工控制,自主化能力较低,具有很大的局限性。随着人工智能的发展,无人机的智能化开始表现在自主飞行路径规划及独立任务执行能力方面[6],强化学习被提出用来解决无人机的自主路径规划问题,学习从复杂多变的环境中直接控制智能体,从而产生正确的动作。实践证明,强化学习的应用大幅提高了无人机的自主化程度,拓展丰富了场景的实践。即便如此,无人机在动态环境中的路径规划仍然面临挑战[7]。综上,我们提出了一种基于深度强化学习(deep reinforcement learning,DRL)的无人机矿井自主巡航研究方案。由于矿井多为狭长曲折,传统的2D场景以及LOS解决方案并不适用,本文考虑了矿井3D环境下,基于DRL的双延迟深度确定性策略梯度(Twin Delayed Deep Deterministic policy gradient algorithm,TD3)实现无人机的路径规划,主要表现为无人机能够根据矿井复杂环境自主规划路径,在实际吞吐量和飞行运动约束下[8],依据各传感器数据采集频率,在最小化时间内收集数据并上传至地面指挥中心。

1  相关研究

在无人机相关领域的研究里,路径规划主要实现起始点至目标点的最优路线规划,被认为是制导巡航及目标追踪的一个核心课题。无人机的高灵活性使其可以接近任意的传感器节点,及时获取并上传数据,但这要求完备的低功耗解决方案及优化的航行轨迹。随着人工智能的发展及机器学习、强化学习的深入研究,无人机的路径规划方法也翻开了新的篇章。

无人机的路径规划主要分为两个方面,全局路径规划及局部路径规划[9]。其中,全局路径规划要求事先知晓环境信息,预先规划连接起始点至终点的最优路径。而局部路径规划则需要无人机对环境状态不断检测,实时规划最优路径。Shi等[10]提出将全局的势场蚁群算法与局部的人工势场算法相结合,对未知环境进行实时路径规划,实现了局部最优及目标可达,是组合控制的策略创新,但并未考虑强化学习等智能算法。需要指出的是,全局路径规划在复杂环境下的计算成本会高于预期。机器学习凭借强大的经验学习能力,在智能化研发和无人系统[11],特别是局部路径规划中,得到了深入的研究及应用。强化学习作为机器学习的一个分支,可以在未知环境中不断调整动作来达到最优策略。基于马尔可夫决策过程(Markov decision process,MDP)模型,应用强化学习的一些经典方法,例如,Q-learning,Deep Q-networks或actor-critic(演员-评论家)等,与环境交互来决策动作与奖励。当前基于强化学习的无人机路径规划方案均需要大量的数据集[1213]构建形式化方法及强化学习环境系统模型。

近年来,针对无人机收集传感器数据,构建物联网数据采集系统的研究工作陆续展开,主要采用深度强化学习规划无人机最优路径。例如,Ding等[14]设计了基于DRL、深度确定性策略梯度(deep deterministic policy gradient,DDPG)的无人机在3D环境下的轨迹运动算法,以系统能量效率最大化及通信服务最优分配为目标来解决路径最优规划问题。此外,Li等[15]提出重塑DRL的训练框架,重点研究降低训练成本,有效提高了推理效率与轨迹成功率。Zhao等[16]提出了一种样本高效的改进DRL算法,同时考虑了环境的复杂性,设计了一种分布鲁棒的DRL算法,解决了无人机路径优化及智能反射表面(reconfigurable intelligent surface,RIS)配置等问题。

现有的基于物联网数据采集的无人机路径规划方案中,大多采用LOS通道,即视距传播,虽有助于综合系统测试及通信资源优化,但通信质量及吞吐量受障碍物的影响,不利于复现复杂环境动态模拟。概率LOS模型的提出[17],从概率的角度综合考虑了LOS与非视距(non line of sight,NLOS),但实际环境中,无人机与传感器节点之间并非没有阻碍,与实际需求不符。Zeng等[18]提出了考虑实际环境的城市LOS模型,但只考虑了单独的传感器,不适用于多传感器分布的情况。

2  模型设计

我们提出一种基于矿井环境的无人机自主巡航研究方案,为局部路径规划,无人机不断对模拟矿井环境进行探索并规划最优路径。首先,井下各传感器(温湿度传感器、气体检测传感器等)之间采用无线Mesh组网的形式,组成一个分布式网络。其次,各传感器之间彼此知晓数据的采集频率周期及截止时间。最后,无人机从起始点出发,在距离最近的传感器节点中获取其余节点数据,应用强化学习做出决策并飞往下一个传感器节点,在能量耗尽前,尽可能多地收集数据。

基于矿井的无人机自主巡航如图1所示。假设无人机和物联网地面节点均采用单一全向天线,在200 m×200 m的规划区域内,k个物联网节点随机分布。第k个物联网节点和时隙为n时的无人机位置分别表示为Wk=[x¯k,y¯k,0]R31kKu(n)=[xn,yn,H]R30nT。为了便于研究,这里我们采用将三维空间投影到二维空间的形式,其中(x¯k,y¯k)表示第k个物联网节点的坐标位置,(xn,yn)表示无人机的投影位置。任务执行时长为T,无人机的高度为H。考虑到现实矿井场景,将k个物联网节点的位置设置为固定,用ik表示第k个物联网节点数据采集周期距离数据产生的时间,使用数组T[k]来记录第k个物联网节点的数据是否生成。

此外,当无人机飞行速度过慢时,可能会导致部分传感器节点产生的数据无法被及时收集,造成数据丢失。为解决这个问题,我们采用预测等待的方法,将各传感器节点的数据生成频率作为强化学习算法的输入,无人机基于不同时隙,对各传感器数据产生时间进行探索并得到奖励值,最终实现对传感器节点数据产生时间的预测。具体表现为:无人机基于当前位置,时刻监测周围传感器节点的数据采集周期,进一步预测节点数据的产生时间,并确定下一个目标节点。无人机在信号范围覆盖下,会提前抵达目标节点附近,等待数据生成并及时采集,进行下一个周期工作,具体过程如图2所示。

3  基于TD3的无人机路径规划

在本部分,我们主要描述无人机的路径规划问题,并将其表述为MDP结构,这是强化学习常见的表示形式。此外,由于问题在连续动作空间,所以我们考虑采用TD3算法来解决问题,该算法为DDPG算法的优化,解决DDPG算法奖励值估计较高的问题。

3.1 问题描述

为了处理无人机路径规划问题,我们将整个规划区域划分为X×Y的网格。将连续时间离散化为N个时隙,其中n为一个时隙,n{1,2,,N}。每个时隙的无人机状态作为神经网络的输入,神经网络将在对应时隙输出一个动作,执行相应的数据采集任务。无人机在第n个时隙的位置可以定义为:

unxn,yn ,0xnX,0ynY

其中,xnyn分别表示无人机在第n个时隙位置的水平坐标与垂直坐标。

我们定义无人机的运动方向为0~360°,与神经网络输出范围(-1,1)相对应并将其设为a。无人机移动方向w的运算公式为:

w=a*π

无人机的位置状态信息更新可以表示为:

xn+1 = xn+ sinw*speed
yn+1 = yn+cosw*speed

其中,speed为无人机的移动速度。为了便于讨论,假设无人机保持其飞行速度恒定。

无人机在相邻时隙内的移动定义为:

Δunun-un-1=Δxn,Δyn

其中,ΔxnΔyn分别表示无人机在第n时隙位置un时,水平坐标及垂直坐标的变化。

每个训练回合的总花费时间Tn由两部分组成,即无人机移动的时间mn以及无人机数据采集的时间cn,计算式如下:

Tn=mn+cn

如果无人机并没有进行数据采集而是不断移动,此时数据采集时间cn为0,可以忽略不计。

假设每个物联网节点最多被收集一次。用g[k]记录物联网节点距离数据生成的时间;d[k]记录无人机与物联网节点的距离;p[k]记录每个物联网节点的采集频率;i[k]表示物联网节点数据是否可被收集。当且仅当无人机与物联网节点的距离小于信号范围r,并且在物联网节点产生数据时,数据才可被收集,因此i[k]的表达式为:

i[k]=1,if pk<gk<pk+Tmax dkr0,otherwise

其中,Tmax为无人机最大等待时间。

设每个回合产生的节点为o[e],每个回合收集的节点个数为q[e],它们的差值为v[e],即:

v[e]=o[e]-q[e]

本文将基于v[e]和奖励值作为结果评估的标准。

无人机的飞行轨迹F以网格坐标作为序列,不同时隙内的无人机位置构成了飞行轨迹。近似表示为:F=un,n=1,2,,N。我们将加权信息最大化,确保无人机处于不同时隙的位置un时,均尽可能收集更多的数据,依据无人机位置设计最优路径F这里描述为:

maxun=maxunk=1Kik
s.t.0xnX, 0ynY,n
Δxn1,Δyn1,n
0w2π

上述优化问题是一个混合整数非凸问题,已知为NP困难。传统的优化方法难以解决上述问题,相比之下,DRL被证明能够很好的解决此类问题,这里我们采用DRL来解决。

3.2 算法原理

强化学习是智能体与环境进行交互的过程,通过不断试错去调整策略,目的是获得尽可能大的奖励值。强化学习可以用来解决马尔可夫决策过程(MDP)问题,MDP问题包括4个属性[S,A,R,P],其中S为状态空间,A为动作空间,R为奖励值,P为状态转移概率。在每个离散的时间段中,智能体处在sS的状态下,通过策略选取动作aA到达一个新的状态,并且获得该动作的奖励值。强化学习是一种考虑未来收益的方法,所以每个动作的奖励值可以表示为:

Rn=i=nNγi-nr(si,ai)

其中,γ表示奖励的折扣因子,γ0,1γ的值较大表示智能体具备更长远的目光,γ的值较小表示智能体更注重眼前的利益。

深度强化学习加强了神经网络的层级,所以将其应用于状态空间连续的情况,可以解决无人机的连续控制问题。使用深度神经网络作为Q(s,a)的近似值,Q(s,a)是在状态s中执行动作a,以取得奖励的预期收益。在DDPG以及TD3算法中,通过最小化损失函数更新神经网络的参数θ获得更准确的Q值,提升智能体的性能。损失函数:

L(θ)=E(y-Qθ(s,a))2

y为目标奖励值,表示为:

y=r+γQθ'(s',a'),a'πφ'(s')

其中,s'代表下一状态,a'代表下一状态依据策略πφ'选择的动作。φ通过确定性策略梯度算法进行更新:

φJ(φ)=EaQθ(s,a)|a=πφ(s)φπφ(s)

DDPG在多种场景拥有较好的性能,但存在高估的问题,即会产生误差累积。TD3使用三种技术对这个问题进行了优化。

首先,TD3采用两套评论家网络及目标网络,对于每次更新,选取较小的Q值,目标网络随即更新Q,即:

y=r+γmini=1,2Qθi'(s',a˜)

其中,r是设定的奖励值,a˜是目标策略的输出。

其次是采用延迟更新策略,当模型的价值函数产生较大变化时,才会更新其策略;否则,不更新。这样可降低价值估计的差异,产生更好的策略,在更新时获得更稳定的性能。

最后采用目标策略正则化减少方差增加,因为在更新评论家网络时,确定性策略的学习目标容易受到函数近似值误差的影响,导致目标的方差增加。此外,TD3的动作输出会受到噪声影响,通过平均训练批次中的噪声可平滑估计值。我们所添加的噪声服从正态分布,并且对采样的噪声进行适当裁剪,使动作更接近原始动作,动作添加噪声影响的公式如下:

a˜=πφ'(s')+ϵ,ϵclip𝒩(0,ω˜),-c,c

使用最小化损失函数来更新评论家网络:

θiargminθiB-1y-Qθi(s,a)2

使用梯度下降来更新演员网络:

φJ(φ)=B-1aQθ1(s,a)|a=πφ(s)φπφ(s)

3.3 马尔可夫决策模型

结合强化学习,我们将问题定义为MDP结构,应用DRL算法。如图3所示,将无人机视为智能体。在训练过程中,将每次智能体和环境交互的信息传入经验回放缓冲区作为神经网络的训练集,TD3网络则根据历史的状态和奖励选择更好的动作来控制无人机的路径,即飞行方向。需要注意的是,这里的TD3网络包含两套演员-评论家网络。演员网络主要是策略函数,学习一个策略尽可能得到更高的回报,评论家网络则是值函数,对当前策略进行评价。接下来我们将定义状态、动作、奖励。

状态:在某一个离散的时间段无人机的状态包括两部分:其一是无人机距离传感器节点的距离,即:

D[k]=(xt-xk)2+(yt-yk)2

其二是各个传感器节点距离数据产生的时间,设定为g[k],最终在某一个离散的时间段内状态数据为:d1,d2,d3,,g1,g2,g3,。我们将环境状态进行归一化处理并作为神经网络的输入。使用获取到的动作对无人机状态信息进行更新,进而获得新的状态。同时,将上一状态的信息、采取的动作、执行当前动作获取的奖励以及下一状态信息存储到经验缓存池,用于神经网络参数的训练,最终训练出一个可以高效收集井下物联网节点数据的模型。

动作:将动作范围设定在-1,1,对应方向0,2pi,无人机移动方向w的计算如(2)式。动作变量取连续值,所以无人机的路径规划是一个连续控制问题。

奖励:首先,为了提升无人机的收集效率,规划更高效的最优路径,设定每回合的步数之外伴随一个较小的惩罚,即为负奖励,以期让无人机找到最合适节能的飞行路径。其次,在训练过程中,无人机会存在触碰边界的情况,将此动作调整为安全动作,并且赋予一个较大的负奖励,使无人机在一定程度下减小触碰边界的动作输出,如图4所示。接下来,根据已收集的物联网节点数据赋予一个相应的正奖励,对于所有物联网节点也有同样的奖励。随着时间累积,已产生数据的物联网节点的数据实时性会下降,对应奖励值也会有所下降,为了使无人机能够收集这些奖励值较低的物联网节点,根据超时时间赋予这些节点一定的负奖励。最后,考虑到实时要求,若节点数据被及时收集,则赋予无人机一个固定奖励。若限定时间内物联网节点数据未被收集,解决方案是使节点转入下一个周期,为下次数据生成做准备,同时赋予无人机一个固定的负奖励,在下次采集时重点关注。

3.4 算法设计

考虑到无人机的路径规划是一个连续的控制任务,因此采用基于TD3的演员-评论家算法解决此问题,如算法1所示。

首先,我们在算法中随机初始化评论家网络Qθ1Qθ2和演员网络πφ的参数,以得到更优的策略获取最佳动作。目标网络θ1'θ2'φ'和行动网络θ1θ2φ也具有相同的初始化方式和结构,包括回访缓冲区R(1~3行)。

接下来主要设定环境探索,自初始回合开始,初始化环境。算法开始时会获得初始状态sn、UAV初始位置sloc1、传感器节点位置sloc1、数据生成时间stime、被采集节点数count及终止标志d,并将被采集节点数count,终止标志d均置为0,因为此刻UAV还未开始探索(4~5行)。环境设定完毕后,UAV要开始不断试错,此过程中,算法会默认输入当前状态并导出一个动作an,动作会被添加一个随机噪声ϵ。通过噪声匹配和设置噪声衰减因子σ,无人机将能够有效探索未知区域并进行数据收集。根据当前状态所执行的动作an获得相应的奖励和惩罚,更新到该动作的下一状态sn+1,将状态信息一同放入回放缓冲区。此外,对于无人机触碰边界的动作,也要即时转换为安全动作并给定惩罚。对于该回合的所有正负奖励,都要及时更新(6~14行)。

最后,在回放缓冲区R中存储转移变量 (sn,an,rn,sn+1,d)并对神经网络进行更新。我们对R进行随机采样,使用目标演员网络输出下一状态s'要执行的动作a˜,并为这个动作添加合适的噪声ϵ,以得到上一状态所期望的奖励。设置目标值函数y(15~19行)。这里的演员网络及目标评论家网络主要采用延迟更新策略,因此,算法执行一定回合后才会对其策略进行更新。通过最小化损失函数更新评论家网络θi,计算梯度来更新演员网络φ。更新目标网络θi'φ'直到已收集的节点count满足预期要求(20~30行)。

4  实验部分

4.1 实验数据来源

本文采用的数据集来自国家煤矿安全监察局颁布的煤矿感知数据接入规范(https://www.chinamine-safety.gov.cn/zfxxgk/fdzdgknr/tzgg/202101/t20210120_377475.shtml)。这里我们主要考虑煤矿的有效实用感知数据,即通过物联感知手段获取的矿井安全生产数据。具体包括环境甲烷浓度、氧气浓度、二氧化碳浓度、二氧化硫浓度(可选采集约束为10~20 s);抽采管路湿度、抽采泵水量、抽采泵水压(可选采集约束为25~30 s);矿压监测值、矿压监测采集时刻(可选采集约束为35~60 s);地表水水位、地表水流速(可选采集约束为1~5 min)。详见表1,后文的研究中我们将以此为基准,设计符合矿井实际场景的参数及状态信息。

4.2 仿真环境

本文的实验是在64位操作系统Windows 11上完成,处理器为Intel(R)Core(TM)i7-10400 CPU @2.90 GHz,RAM 16.00 GB,程序运行环境为Python3.9。我们在一个300 m×200 m的环境中进行仿真,其中随机产生30个物联网节点。每个物联网节点依据仿真数据设置采集频率,分布在144~360个离散时间段之间。设定无人机的飞行速度为8 m/s,无人机的初始位置基本处于运行环境边缘。在算法中,演员网络和批评家网络均由包含32个神经元的两层全连接层组成。其中演员网络采用tanh作为激活函数,而评论家网络则由relu作为激活函数。算法参数的总结及设定如表2所示。

4.3 结果与分析

4.3.1 最优路径规划

我们对路径规划的结果进行了比对验证,如图5所示。某一时刻有3个即将生成的节点j1,j2,j3,无人机将会决策优先前往哪个节点收集数据,这里有两种方案:方案一,无人机会选择动作A,首先收集距离较近的节点j1,接着依次收集节点j3j2。从距离上看,这样的结果是最优的,但未考虑长远利益,即奖励值收益并不高,难以达到预期效果。方案二,无人机会更加考虑未来的收益,具体的奖励值设定前文3.3节已叙述。选择动作B,优先收集奖励值较高的j2,再考虑奖励值较低的j3j1,即无人机的每一步动作总会考虑能够得到的最大奖励,而不考虑眼前的收益,从而作出决策,规划最优路径。

如4.2节仿真环境,我们在模拟数据下进行了测试。路径规划的结果如图6所示,面对随机生成的30个传感器节点,无人机基于TD3算法进行最优路径规划,在不同时隙内应用强化学习尽可能地获取最大奖励值,及时收集传感器生成的数据。考虑无人机与传感器节点的距离、传感器类型不同等因素,无人机收集各节点数据所得到的奖励值也不同。从模拟结果中可以看到,无人机能够尽可能选择奖励值更高的节点,且能够基于自身的通信范围,选择覆盖更多的节点,收集更多的数据,实现最优路径规划。

4.3.2 不同折扣因子对比

选用不同折扣因子进行了比对验证,如图7所示。奖励折扣因子对算法性能有较大影响,不能将折扣因子设置过小,例如:对于部分奖励值较低,却需要大片时间段收集的传感器节点数据,无人机很难达到预期收集效果。我们的环境是一个连续空间,需要足够的探索才能够使算法具备良好的性能。从图7中可以看到,训练初期,折扣因子0.90获取奖励的速度更快,奖励值更高,但总体奖励值偏低。而折扣因子0.99虽然在开始时收集速度相对较慢,但由于更注重长远利益,最终获取的奖励值更高,稳定在7附近。

4.3.3 节点数据收集

最优解情况下奖励值大小是可以预测的,设定收集每个物联网节点的奖励值最低为0.5,累计60个节点后的奖励值即为30。而物联网节点的生成需要耗费一定的时间,所以无人机至少需要等待生成60个节点的时间段,为了提高收集效率,每个时间段均会给定一个值为0.005的惩罚,这段时间无人机将会得到平均值为20左右的惩罚。在训练后期,考虑无人机触碰边界及丢失物联网节点的情况大幅减小,所以我们所期望的奖励值应处于5~10之间。

图8结果来看,episode达到700步左右时,算法基本收敛,对应奖励值也同样达到预期,稳定在5附近。每回合未被采集的物联网节点数量开始下降,并且无人机能够在物联网节点产生数据之前,抵达目标位置附近,等待节点数据的生成。此外,episode达到270步左右时,会出现奖励值突然下降的动作,导致奖励值较低。原因是探索具有一定的随机性,无人机当前处于初步探索阶段。episode在700步达到峰值后,奖励值开始大幅下降,我们推断可能是因为训练后期出现了过拟合问题,为了解决过拟合问题,后续可以考虑在回放缓冲区中减少采样的个数,降低神经网络更新参数的速度。

5  结 语

本文提出一种基于深度强化学习的无人机矿井自主巡航方案,该方案通过无线Mesh组网形式,将传感器节点进行互联,彼此知晓数据采集周期及频率,实现了无人机在固定区域内,进行最优自主路径规划,最小化时间周期内对传感器节点进行数据采集并及时上传至地面指挥中心。实验表明,算法在训练回合达到700时基本实现收敛,无人机能够自主决策规划最优路径,实时收集传感器节点生成的数据。

本文方案可有效应用于矿井,对智能化矿井开发具有一定的研究意义。但本文工作也存在一定局限性,首先是由于无人机的速度问题,不能够保证部分物联网节点数据刚生成就被收集,导致数据的实时性相对变差。其次,因为环境为连续状态空间,所以无人机对环境的探索程度有时无法得到保障,存在某些物联网节点不能每次都被探索到的情况。未来将考虑基于此问题开展进一步的探索和研究。

参考文献

[1]

KIM M LPEVZNER L DTEMKIN I O. Development of automatic system for Unmanned Aerial Vehicle (UAV) motion control for mine conditions[J]. Mining Science and Technology (Russia)20216(3): 203-210. DOI: 10.17073/2500-0632-2021-3-203-210 .

[2]

HEßELING CKELLER J. Pareto-optimal covert channels in sensor data transmission[C]//Proceedings of the 2022 European Interdisciplinary Cybersecurity Conference. New York: ACM, 2022: 79-84. DOI: 10.1145/3528580.3532844 .

[3]

LIU TNI S GLI X Qet al. Deep reinforcement learning based approach for online service placement and computation resource allocation in edge computing[J]. IEEE Transactions on Mobile Computing2022,PP(99):1.DOI: 10.1109/TMC.2022.3148254 .

[4]

张铎,吴佩利,郑学召,.矿井侦测无人机研究现状与发展趋势[J].工矿自动化202046(7): 76-81. DOI: 10.13272/j.issn.1671-251x.17538 .

[5]

ZHANG DWU P LZHENG X Zet al. Research status and development trend of mine detection unmanned aerial vehicle[J].Industry and Mine Automation202046(7): 76-81.DOI: 10.13272/j.issn.1671-251x.17538 (Ch ).

[6]

ZENG YZHANG RLIM T J. Wireless communications with unmanned aerial vehicles: Opportunities and challenges[J]. IEEE Communications Magazine201654(5):36-42. DOI: 10.1109/MCOM.2016.7470933 .

[7]

WU C XJU B BWU Yet al. UAV autonomous target search based on deep reinforcement learning in complex disaster scene[J]. IEEE Access20197: 117227-117245. DOI: 10.1109/ACCESS.2019.2933002 .

[8]

YAN CXIANG X JWANG C. Towards real-time path planning through deep reinforcement learning for a UAV in dynamic environments[J]. Journal of Intelligent & Robotic Systems202098(2): 297-309. DOI: 10.1007/s10846-019-01073-3 .

[9]

WANG YGAO ZZHANG Jet al. Trajectory design for UAV-based Internet of Things data collection: A deep reinforcement learning approach[J]. IEEE Internet of Things Journal20229(5): 3899-3912. DOI: 10.1109/JIOT.2021.3102185 .

[10]

LI S DXU XZUO L. Dynamic path planning of a mobile robot with improved Q-learning algorithm[C]//2015 IEEE International Conference on Information and Automation. New York: IEEE Press, 2015: 409-414. DOI: 10.1109/ICInfA.2015.7279322 .

[11]

SHI K JWU PLIU M S. Research on path planning method of forging handling robot based on combined strategy[C]//2021 IEEE International Conference on Power Electronics,Computer Applications (ICPECA). New York: IEEE Press, 2021: 292-295. DOI: 10.1109/ICPECA51329.2021.9362595 .

[12]

KHAN A IAL-MULLA Y. Unmanned aerial vehicle in the machine learning environment[J]. Procedia Computer Science2019160(C): 46-53. DOI: 10.1016/j.procs.2019.09.442 .

[13]

SINGLA APADAKANDLA SBHATNAGAR S. Memory-based deep reinforcement learning for obstacle avoidance in UAV with limited environment knowledge[J]. IEEE Transactions on Intelligent Transportation Systems202122(1): 107-118. DOI: 10.1109/TITS.2019.2954952 .

[14]

WANG D WFAN T XHAN Tet al. A two-stage reinforcement learning approach for multi-UAV collision avoidance under imperfect sensing[J]. IEEE Robotics and Automation Letters20205(2): 3098-3105. DOI: 10.1109/LRA.2020.2974648 .

[15]

DING R JGAO F FSHEN X S. 3D UAV trajectory design and frequency band allocation for energy-efficient and fair communication: A deep reinforcement learning approach[J]. IEEE Transactions on Wireless Communications202019(12): 7796-7809. DOI: 10.1109/TWC.2020.3016024 .

[16]

LI Y LFANG H WLI M Yet al. Neural network pruning and fast training for DRL-based UAV trajectory planning[C]//2022 27th Asia and South Pacific Design Automation Conference (ASP-DAC).New York: IEEE Press, 2022: 574-579. DOI: 10.1109/ASP-DAC52403.2022.9712561 .

[17]

ZHAO J JYU LCAI K Qet al. RIS-aided ground-aerial NOMA communications: A distributionally robust DRL approach[J]. IEEE Journal on Selected Areas in Communications202240(4): 1287-1301. DOI: 10.1109/JSAC.2022.3143230 .

[18]

YANG PCAO X BXI Xet al. Three-dimensional continuous movement control of drone cells for energy-efficient communication coverage[J]. IEEE Transactions on Vehicular Technology201968(7): 6535-6546. DOI: 10.1109/TVT.2019.2913988 .

[19]

ZENG YXU X L. Path design for cellular-connected UAV with reinforcement learning[C]//2019 IEEE Global Communications Conference (GLOBECOM). New York: IEEE Press, 2020: 1-6. DOI: 10.1109/GLOBECOM38437.2019.9014041 .

AI Summary AI Mindmap
PDF (2002KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/