结合注意力机制与深度强化学习的无人机智能追踪方法

江未来 ,  王文路 ,  王耀南

湖南大学学报(自然科学版) ›› 2026, Vol. 53 ›› Issue (4) : 1 -9.

PDF (2219KB)
湖南大学学报(自然科学版) ›› 2026, Vol. 53 ›› Issue (4) : 1 -9. DOI: 10.16339/j.cnki.hdxbzkb.2026261
计算机科学

结合注意力机制与深度强化学习的无人机智能追踪方法

作者信息 +

Intelligent tracking method for UAV combining attention mechanism and deep reinforcement learning

Author information +
文章历史 +
PDF (2271K)

摘要

针对深度强化学习算法在求解复杂环境下动态目标的无人机智能追踪问题时存在的收敛速度慢、成功率低、模型泛用性差等问题, 将注意力机制与深度确定性策略梯度(deep deterministic policy gradient, DDPG)结合, 提出了attention-DDPG模型, 并在此基础上结合多经验池方法, 搭建了一种新的深度强化学习算法——多经验池注意力深度确定性策略梯度(multi pool attention deep deterministic policy gradient, MPADDPG)算法. 算法将注意力机制加入 DDPG 的 Actor 网络, 赋予状态中各个分量不同的权重来突出重要且关键的信息, 并引入多经验池机制分离失败经验, 强化成功经验, 提升了算法的收敛性;更进一步, 通过赋予无人机环境感知能力, 提升了算法的泛化能力. 最后, 在建立的无人机的连续状态空间与动作空间中验证了MPADDPG算法的有效性.仿真结果表明,MPADDPG算法的智能追踪成功率超过90%, 较DDPG算法具有更高的追踪成功率与更强的泛化能力.

Abstract

To address the challenges of slow convergence rates, low success rates, and poor model generalization in deep reinforcement learning algorithms for UAV intelligent tracking decision-making under a complex environment, this study combines the attention mechanism with the deep deterministic policy gradient (DDPG) approach and introduces an attention-DDPG model. Meanwhile, incorporating a multi-experience pool method, a proposed algorithm, named multi pool attention deep deterministic policy gradient (MPADDPG) is built up, and the attention mechanism is integrated into DDPG’s Actor network. This allows for different weights to be assigned to various state components, so as to highlight the crucial information, while a multi-experience pool strategy is employed to distinguish unsuccessful experiences from successful ones in order to improve convergence. Additionally, enhancing the UAV’s environmental perception capabilities further boosts the algorithm’s generalization ability. The effectiveness of MPADDPG is validated within a continuous state and action space framework established in this research. Simulation results demonstrate that MPADDPG achieves an intelligent tracking success rate exceeding 90%, outperforming DDPG in both tracking success and generalization capability.

Graphical abstract

关键词

无人机 / 智能追踪 / 注意力机制 / 深度强化学习 / 多经验池

Key words

unmanned aerial vehicle(UAV) / intelligent tracking / attention mechanism / deep reinforcement learning / multi-experience pool

引用本文

引用格式 ▾
江未来,王文路,王耀南. 结合注意力机制与深度强化学习的无人机智能追踪方法[J]. 湖南大学学报(自然科学版), 2026, 53(4): 1-9 DOI:10.16339/j.cnki.hdxbzkb.2026261

登录浏览全文

4963

注册一个新账户 忘记密码

无人机智能追踪是一类典型的复杂环境下动态目标追踪的决策问题. 这类问题要求无人机能够在动态、不确定或受限的复杂环境中自主做出决策,以实现对特定目标的持续、准确追踪.然而,传统的无人机追踪算法1面对复杂的环境存在适应性差、计算速度慢等问题,不利于无人机完成及时、准确的追踪任务.
为解决此类问题, 学术界开展了卓有成效的研究. 在文献[2-5]中,利用强化学习方法,通过将环境离散化并采用Q-learning算法成功实现了无人机对静态目标的追踪,但Q-learning算法的适用范围仅限于离散且低维的状态空间以及动作空间,在面对连续状态空间或动作空间的复杂情形,Q-learning算法效果不佳. 文献[6-9]利用深度强化学习方法,实现了静态环境下基于DQN算法的无人机路径自动规划, 文献[10]提出利用人工势场法与DQN结合的方法解决局部最优问题, 提升了无人机在复杂环境下的自主避障与目标搜索能力. 然而, 上述算法主要适用于连续状态空间、离散动作空间类问题, 对于连续状态空间和动作空间类问题仍存在局限. 为了对连续状态空间和动作空间类问题进行有效求解, 文献[11-12]采用Actor-Critic框架下的深度确定性策略梯度(DDPG)算法,通过输入周围环境的初始状态, 求解每个状态下的确定性动作,实现了无人机在复杂室内环境下的搜索与救援.然而,上述文献主要讨论了无人机在静态环境下的追踪决策问题与动态环境下的避障问题,对于复杂环境下无人机针对动态目标的智能追踪决策问题,却未进一步探索.
本文针对复杂环境下无人机动态目标的智能追踪决策问题作出了三个方面的贡献. 首先, 不同于文献[13-14]将状态空间或动作空间离散化, 本文考虑无人机的状态及动作均为连续变化. 其次, 将注意力机制15引入DDPG的Actor网络中,对无人机状态中各个分量赋予不同的权重,来突出重要且关键的信息, 并结合多经验池方法将无人机与环境交互产生的经验数据划分为成功经验数据和失败经验数据, 提升算法的收敛性. 最后, 赋予无人机环境感知能力, 联合环境感知信息和目标的状态信息, 提升算法的泛化能力.

1 问题描述

为了便于对复杂环境下无人机动态目标智能追踪决策问题进行分析与求解,本文提出两个设定:

1)设定无人机为质点,其飞行状态为低空且高度恒定, 将无人机运动从三维空间简化到二维空间.

2)设定无人机在确定的长方形区域内运动,环境中存在不同半径的圆形障碍物. 智能追踪决策示意图如图1所示.

图1所示,蓝色无人机为追踪者, 蓝色圆环为追踪者感知半径,红色无人机为逃避者, 绿色圆形表示障碍物.追踪者可通过自身搭载的传感器感知周围环境信息、逃避者信息,具有在环境中自主避障与追踪目标的能力.逃避者可在环境中随机运动并自由避障.障碍物的大小、位置随机分布.

本文的研究目标是实现追踪者在复杂环境下对逃避者的智能追踪.

2 问题建模

本文针对复杂环境下的无人机动态目标智能追踪问题, 基于深度强化学习方法设计新的观测空间、动作空间以及奖励函数.

2.1 观测空间

观测空间涵盖了追踪者与逃避者的状态信息, 包括坐标、速度大小和运动方向,以及环境障碍物信息, 包括坐标、半径等. 追踪者与逃避者的状态信息如图2所示.

图2中, 假设追踪者的状态信息为sp=[(xpt,ypt),vpt,θpt],其中(xpt,ypt)vptθpt 分别为当前时刻t的位置坐标、速度大小、运动方向角. 逃避者的状态信息为se=[(xet,yet),vet,θet], 其中(xet,yet)vetθet 分别为位置坐标、速度大小、运动方向角. 同时设定追踪者最大飞行速度为vpmax, 逃避者最大飞行速度为vemax.

追踪者可感知一定范围内的环境障碍物信息, 如图3所示.

do=[d1,d2,,d8]表示追踪者与障碍物的距离. α表示追踪者运动方向与逃避者之间的夹角. 假设无人机运动区域的长和宽分别为hwdt表示追踪者与逃避者之间的相对距离, 如式(1)所示.

dt=
xet-xpt2+yet-ypt2,dt0,w2+h2

因此, 观测空间可以具体表示为:

O=sp,se,do,dt,α

2.2 动作空间

追踪者的运动控制方式为速度大小控制与方向控制, 本文设定在环境中追踪者各时刻的输出动作为, 包括速度大小和角度的变化量. 如式(3)所示, 追踪者下一时刻的空间位置、速度大小和运动方向可更新为:

θpt+1=θpt+at[0]×Δθmaxvpt+1=vpt+at[1]×Δvmaxxpt+1=xpt+vpt+1×cosθpt+1ypt+1=ypt+vpt+1×sinθpt+1

式中:at[-1,1]2为算法输出的归一化动作;Δvmax为速度的最大变化量;Δθmax为角度的最大变化量;θpt+1vpt+1xpt+1,ypt+1分别表示追踪者在下一个时刻的运动方向角、速度大小和位置坐标.

2.3 奖励函数

不同于文献[14]采用的稀疏奖励机制, 本文设计了一种连续奖励函数, 细化追踪者每一步的奖励效果, 有助于提高追踪者的学习效率, 降低陷入局部最优的风险.

本文设计的奖励函数包括四个部分:终止奖惩、距离奖惩、角度奖惩、避障奖惩.

终止奖惩函数的数学表达式为:

rT=-kT

式中:rT表示终止奖惩;kT为正实数, 即追踪者任务失败时施加惩罚.

距离奖惩函数的数学表达式为:

rd=k1×dt+1-dtdt+1+9, dt+150k2×dt+1-dtdt+1+6,30dt+1<50k3×dt+1-dtdt+1+3,10dt+1<30k4×dt+1-dtdt+1+1 ,其他

式中:rd表示距离奖惩;dtdt+1分别表示上一个时刻和当前时刻追踪者与逃避者之间的欧式距离;k1k2k3k4均为距离奖惩的权重.

角度奖惩函数的数学表达式为:

rθ=k5π×π2-α, dt+150k6π×π2-α,30dt+1<50k7π×π2-α,10dt+1<30k8π×π2-α,其他

式中:rθ表示角度奖惩;k5k6k7k8为角度奖惩权重.

避障奖惩函数的数学表达式为:

r=-kobs×i=191di-1rcap,robs=r,-rclip<r<0-rclip,r-rclip

式中:robs表示避障奖惩;rclip表示避障奖惩截断的最小值;kobs为正整数;di表示追踪者与障碍物的距离; rcap为距离上界阈值,当di>rcap时该障碍物对惩罚项贡献为零.

综合以上四种奖励函数, 最终的奖励函数ro为:

ro=rT+rd+rθ+robs

3 MPADDPG算法

针对DDPG算法单经验池模式下学习效率低, 容易陷入局部最优解的问题, 本文提出了MPADDPG算法, 将单个经验池替换为多个经验池, 并且利用注意力机制增强有效经验特征, 提高算法的收敛速度.

3.1 DDPG算法

DDPG算法是Actor-Critic框架下的经典算法, 算法通过这两个网络的协同工作, 在连续状态空间、动作空间问题上实现高效的策略学习和优化.

在Critic网络训练阶段, 首先计算出目标动作值和网络预测值, 然后得到Critic损失值, 最后利用梯度下降算法对Critic网络进行优化. 目标动作值为

yi=rsi,ai+γQω˜si+1,π˜(si+1,θ˜)+N(0,σ)

式中:yi表示目标动作值;rsi,ai表示即时奖励;γ表示折扣系数; π˜si+1,θ˜表示下一个状态下输出的目标动作; θ˜表示目标Actor网络中的参数; N0,σ表示满足正态分布的平滑噪声; σ表示平滑噪声的方差; Qω˜si+1,π˜si+1,θ˜+N0,σ表示目标Critic网络中, 下一个状态动作对的动作值. 损失值的计算方式为:

Lc=1NQwsi,ai-yi

式中:Lc表示Critic损失值;N表示每次更新时采样的数据总量;Qwsi,ai表示当前Critic网络中, 当前状态动作对的动作值.

在Actor网络训练阶段,首先计算出当前状态下的预测动作,然后得到Actor网络损失值,最后利用梯度上升算法更新Actor网络参数.Actor网络损失值的计算方式为:

La=-EQws,πsi,θ

式中:La表示Actor网络损失值;πsi,θ表示当前状态下的预测动作;θ表示Actor网络的参数;Qws,πsi,θ表示新的当前状态动作对的动作值;E[·]为期望运算符, 表示对随机变量的加权平均.

完成Critic网络和Actor网络的更新后, 利用软更新方式更新所有的目标网络, 如式(12)所示.

θ=τθ+1-τθ˜w=τw+1-τw˜

式中: τ表示软更新的学习率;w表示Critic网络中的参数;ω˜表示目标Critic网络中的参数.

3.2 注意力机制

注意力(Attention)机制具有增强神经网络信息处理的能力,其核心思想在于通过学习输入特征的权重分布,对原始特征进行加权处理,从而使模型能够聚焦于关键特征,提升学习的效率与准确性.

Attention机制的计算公式为:

E'= Softmax WE·E

式中:E'表示新特征矩阵;E表示为原特征矩阵;W为表示为权重矩阵;Softmax(·)为激活函数.

本文设计了如图4所示的Attention网络结构, 包含一个全连接层和一个Softmax激活函数.输入向量首先通过全连接层进行线性变换,以提取更深层次的特征信息.然后,经过Softmax激活函数处理, 得到输入向量中各分量的权重Wi .这些权重反映了各分量在任务中的重要性.最后,将权重Wi 与原始输入向量相乘,得到新的加权向量,从而强化了神经网络对有效特征的学习.

3.3 多经验池

MPADDPG算法中包括三个经验池:失败经验池、成功经验池和临时经验池. 失败经验池存储追踪者任务失败时产生的经验数据, 设其容量大小为Mf. 成功经验池存储追踪者任务成功时产生的经验数据,设其容量大小为Ms. 而临时经验池则存储当前追踪者产生的临时经验数据, 设其容量大小为Mt. 当临时经验池溢出时, 如果追踪者仍然没有到达终止状态, 则认为过去的决策具有积极影响,将溢出数据存入成功经验池, 然后根据最终任务的成败决定剩余所有数据的存储位置.

MPADDPG算法更新时需要的数据分别从失败经验池与成功经验池中按照一定的比例采样. 这样即使追踪者陷入局部最优, 仍然可以从成功经验池中获取任务成功的经验数据来学习, 从而帮助追踪者快速脱离局部最优解. 假设追踪者每次从成功经验池中采样数据的比例为β, 随机采样的总数据量为B, 则从成功经验池与失败经验池中采样的数据量分别为:

b1=Ds,DsβBβB,其他b2=B-b1

式中:b1表示从成功经验池中采样的数据量;b2表示从失败经验池中采样的数据量;Ds表示当前成功经验池中的总数据量.

3.4 基于Attention机制的深度强化学习网络结构

MPADDPG算法的网络架构沿袭了DDPG算法的设计范式, 核心组件包括一个Actor网络及其对应的目标网络, 以及一个Critic网络与其对应的目标网络. 在Critic网络的架构设计中, 其输入整合了追踪器捕获的观测信息(维度为20)与所执行的动作(维度为2), 通过拼接操作形成一个22维的输入向量. 这一向量随后被送入两个连续的全连接层进行特征抽取.

第一个全连接层配置了400个神经元, 旨在初步提炼输入数据的特征表示, 其激活函数选用了ReLU(rectified linear unit), 以增强网络的非线性映射能力并促进梯度传播.

第二个全连接层拥有300个神经元, 进一步对前一层的输出进行深度特征提取, 同样采用ReLU作为激活函数, 以维持网络的非线性特性.

最终, 经过这两层特征提取的向量被输入到一个输出层, 该层为全连接结构, 负责计算并输出对应的状态-动作值(Q值), 其输出维度设定为1, 以适应值函数预测的需求. 值得注意的是, 此输出层并未采用任何激活函数, 以保持Q值的线性输出特性, 便于后续的决策与优化过程. 具体的网络结构如图5所示.

在MPADDPG的Actor网络结构中,本文引入了一层Attention网络来强化输入向量的重要特征.将Attention网络结构添加到图6中虚线框的位置,Actor输入向量为追踪者观测到的状态信息State,经过Attention网络对状态中的各个分量施以不同的权重以捕捉其中重要的信息.然后依次经过两个全连接网络进行特征提取,第一个全连接网络的神经元数量为400个,第二个为300个,激活函数均采用ReLU.最后将提取到的特征信息送入最后一个全连接网络.由于每个动作的输出在[-1,1]之间,因此最后一个全连接网络的激活函数采用Tanh,如图6所示.

本文采用MPADDPG算法实现追踪者对逃避者的实时追踪,并躲避环境中的障碍物.追踪者在环境中运动时不仅可以获取自身与逃避者的状态信息以及相对位置信息,还可以利用自身搭载的传感器感知周围部分环境信息,然后将这些信息堆叠在一起,构成观测信息.将观测信息送入追踪者的Actor网络中,输出动作,指导追踪者运动.同时环境反馈追踪者回报以及下一个状态, 并判断该状态是否为终止状态. 将一组交互的经验数据送入临时经验池中, 根据临时经验池当前数据量以及追踪者当前状态信息判断是否要将经验数据转移到成功经验池或失败经验池中. 在每一个时间步, 追踪者都会从成功经验池和失败经验池中按照预先设定的比例随机采样一批数据进行训练. 当追踪者进入终止状态时, 结束本回合, 并重新进入下一个回合的学习. 具体的算法流程如图7所示.

4 实验结果

本文在Python环境下,依托PyTorch 1.10与CUDA 10.2计算框架,设计并实现了MPADDPG算法的网络架构.在参数优化方面,Critic网络与Actor网络均采用了Adam优化器,学习率设定为0.001,以确保网络训练的高效与稳定.

4.1 MPADDPG算法验证

仿真环境为一块方形区域,为了验证追踪者在复杂环境下的追踪决策能力,环境中存在若干障碍物.逃避者具备在环境中做随机运动并且可以自主规避环境中的障碍物的能力.追踪者的目标在于实时追踪逃避者,同时自主躲避环境中的障碍物.当追踪者出现以下情况时,当前回合结束:与障碍物发生碰撞;跨越边界;达到最大时间步.每次环境初始化时,追踪者与逃避者的位置也会随机初始化,以增强任务的随机性.本节采用DDPG、MPADDPG算法进行测试,测试结果如图8~图10表1所示.

图8(a)、(b)分别为DDPG算法和MPADDPG算法在训练时的累积奖励曲线与追踪成功率曲线. 实验结果表明,两种算法的奖励曲线均可以收敛,追踪成功率均随训练时间增加.然而,MPADDPG算法因为引入了多经验池机制与注意力机制,在训练过程中能够更加高效地提取训练经验中的有效特征, 具有更快的收敛速度与更高的追踪成功率.为进一步验证算法的实际性能,本文将训练好的两种算法分别在相同环境中测试1 000轮.图9表1是测试时的追踪成功率.测试结果表明,两种算法的追踪成功率均在90%以上,但MPADDPG算法的追踪成功率显著高于DDPG算法.图10是两个算法在简单环境下的追踪路径,其中红色圆圈表示逃避者,蓝色圆圈表示追踪者,绿色圆圈表示障碍物,蓝色圆圈周围的青色区域表示感知范围.从追踪路径可以看出,MPADDPG算法能够有效规划平滑且高效的路径,在避让感知范围内障碍物的同时,迅速向逃避者方向靠近.因此,简单环境下的仿真结果说明,MPADDPG算法具有更快的收敛速度以及更高的追踪成功率.

4.2 MPADDPG算法泛化能力验证

为了进一步验证训练出来的追踪者具备一定的环境泛化能力,本文将训练好的追踪者迁移至新的复杂环境中进行测试.该环境具有更高的障碍物密度,避障与追踪难度显著增加,且追踪者未在该环境下进行过训练.测试结果如图11图12表2所示.

图11表2展示了两个算法在复杂环境中分别测试1 000轮后的追踪成功率. 实验结果表明, MPADDPG算法由于具备环境感知能力,在训练过程中侧重学习的是避障策略而非环境信息,因此在陌生的复杂环境下的追踪成功率仍然在90%以上, 显著高于DDPG算法86%的追踪成功率.图12进一步对比了两种算法在复杂环境中的追踪路径,结果显示,尽管两种算法均能完成任务,但MPADDPG算法的路径规划在避障效率和路径平滑度方面均优于DDPG算法,展现了更强的环境适应能力.在复杂环境下的仿真结果表明,MPADDPG算法较DDPG算法具备更好的环境泛化能力.因此,训练MPADDPG算法时只需要让追踪者在简单的环境中交互即可, 缩短了训练时间.

5 结 论

针对复杂环境下无人机动态目标智能追踪决策问题, 本文提出了一种改进的深度强化学习算法MPADDPG, 实现无人机自主避障以及对动态目标的实时追踪. 该算法在传统DDPG算法的基础上, 结合了Attention机制, 并加入了多经验池机制, 以提升无人机在复杂环境下的自主避障与动态目标实时追踪能力. 为增强仿真环境的真实性与实用性, 本文设定无人机的状态和动作均为连续变化, 并赋予无人机局部环境感知能力, 使其能够实时获取周围环境信息.

仿真结果表明, MPADDPG与DDPG两种算法均具备稳定的动态目标智能追踪决策的能力, 但是MPADDPG具有更快的收敛速度和更高的追踪成功率.此外,MPADDPG算法训练后的追踪者可以适应更加复杂的环境, 表现出更加优秀的环境泛化能力.

参考文献

[1]

江未来, 吴俊, 王耀南 .基于元强化学习的无人机自主避障与目标追踪[J].湖南大学学报(自然科学版)202249(6):101-109.

[2]

JIANG W LWU JWANG Y N .Autonomous obstacle avoidance and target tracking of UAV based on meta-reinforcement learning[J].Journal of Hunan University (Natural Sciences)202249(6):101-109.(in Chinese)

[3]

吴勇, 彭辉, 熊峰钥 .结合类脑导航的强化学习无人机自主导航[J].计算机测量与控制202432(7):225-231.

[4]

WU YPENG HXIONG F Y .Reinforcement learning algorithms combined with brain-inspired navigation[J].Computer Measurement & Control202432(7):225-231.(in Chinese)

[5]

范芮滔,刘昊,程明,.博弈环境下的多无人机系统协同路径规划[J/OL].北京航空航天大学学报1-10[2024-11-28].

[6]

FAN R TLIU HCHENG Met al. Game environment of multiple unmanned aerial vehicle system coordinated path planning [J/OL]. Journal of Beijing University of Aeronautics and Astronautics1-10[2024-11-28].in Chinese)

[7]

蒋坤, 操菁瑜, 柳文章, .移动机器人导航与对抗控制的强化学习方法研究[J].控制理论与应用202542(9):1757-1765.

[8]

JIANG KCAO J YLIU W Zet al .Research on reinforcement learning methods for navigation and adversarial control in mobile robots[J].Control Theory & Applications202542(9):1757-1765.(in Chinese)

[9]

娄智波, 彭越, 辛凯 .基于改进型Q-Learning算法的路径规划系统研究[J].计算机与数字工程202452(8):2312-2316.

[10]

LOU Z BPENG YXIN K .Research on path planning system based on improved Q-Learning algorithm[J]. Computer and Digital Engineering202452(8): 2312-2316.(in Chinese)

[11]

王杰, 王高攀, 孙天杨 .基于DQN算法的无人机校园安全监控路径自动规划模型[J].自动化与仪器仪表2024(4):193-196.

[12]

WANG JWANG G PSUN T Y. Automatic planning model of UAV campus security monitoring path based on DQN algorithm[J]. Automation & Instrumentation2024(4):193-196.(in Chinese)

[13]

沈骁, 赵彤洲 .基于DDQN的无人机区域覆盖路径规划策略[J].电子测量技术202346(14):30-36.

[14]

SHEN XZHAO T Z .UAV regional coverage path planning strategy based on DDQN[J]. Electronic Measurement Technology202346(14):30-36.(in Chinese)

[15]

赵启, 甄子洋, 龚华军, .基于D3QN的无人机编队控制技术[J].北京航空航天大学学报202349(8):2137-2146.

[16]

ZHAO QZHEN Z YGONG H Jet al .UAV formation control based on dueling double DQN[J].Journal of Beijing University of Aeronautics and Astronautics202349(8):2137-2146.(in Chinese)

[17]

毕文豪,段晓波 .基于深度强化学习的无人机航路规划算法研究[J].航空科学技术202334(12):118-124.

[18]

BI W HDUAN X B. Research on UAV path planning method based on deep reinforcement learning[J]. Aeronautical Science & Technology202334(12): 118-124.(in Chinese)

[19]

王子怡, 刘喆, 李玉婉, .物联网背景下基于人工势场法和双目视觉的城市无人机配送补货研究[J].信息记录材料202425(3):240-242.

[20]

WANG Z YLIU ZLI Y Wet al .Research on replenishment of urban UAV distribution based on artificial potential field method and binocular vision under the background of Internet of Things[J].Information Recording Materials202425(3):240-242.(in Chinese)

[21]

展望晨, 郭乐江, 许世佳, .基于贪婪DDPG的无人机智能避障算法[J].空天预警研究学报202438(5):342-346.

[22]

ZHAN W CGUO L JXU S Jet al .UAV Intelligent obstacle avoidance algorithm based on greedy DDPG[J].Journal of Air & Space Early Warning Research202438(5):342-346.(in Chinese)

[23]

荣垂霆, 朱恒伟, 张宾, .基于深度强化学习的移动机器人路径规划研究[J].现代信息科技20248(16):60-63.

[24]

RONG C TZHU H WZHANG Bet al .Research on path planning of mobile robots based on deep reinforcement learning[J].Modern Informationn Technology20248(16):60-63.(in Chinese)

[25]

赵学健, 叶昊, 李豪, .基于改进DDPG的多AGV路径规划算法[J].计算机科学202552(6):306-315.

[26]

ZHAO X JYE HLI Het al .Multi-AGV path planning algorithm based on improved DDPG[J].Computer Science202552(6):306-315.(in Chinese)

[27]

牟文心, 时宏伟 .基于改进TD3算法的无人机轨迹规划[J].计算机系统应用202433(12):197-209.

[28]

MOU W XSHI H W. UAV trajectory planning based on improved TD3 algorithm[J]. Computer Systems & Applications202433(12): 197-209.(in Chinese)

[29]

陈卓, 姜伟豪, 杜军威 .基于策略记忆的深度强化学习序列推荐算法研究[J].湖南大学学报(自然科学版)202249(8):208-216.

[30]

CHEN ZJIANG W HDU J W .Research on deep reinforcement learning sequential recommendation algorithm based on policy memory[J].Journal of Hunan University (Natural Sciences)202249(8):208-216.(in Chinese)

基金资助

国家自然科学基金资助项目(62473138)

National Natural Science

AI Summary AI Mindmap
PDF (2219KB)

301

访问

0

被引

详细

导航
相关文章

AI思维导图

/