基于LSTM–PPO算法的多机空战智能决策及目标分配

丁云龙, 匡敏驰, 朱纪洪, 祝靖宇, 乔直

工程科学学报 ›› 2024, Vol. 46 ›› Issue (7) : 1179 -1186.

工程科学学报 ›› 2024, Vol. 46 ›› Issue (7) : 1179 -1186. DOI: 10.13374/j.issn2095-9389.2023.10.13.003

基于LSTM–PPO算法的多机空战智能决策及目标分配

    丁云龙, 匡敏驰, 朱纪洪, 祝靖宇, 乔直
作者信息 +

Author information +
文章历史 +

摘要

针对传统多机空战中智能决效率低、难以满足复杂空战环境的需求以及目标分配不合理等问题.本文提出一种基于强化学习的多机空战的智能决策及目标分配方法.使用长短期记忆网络(Long short-term memory,LSTM)对状态进行特征提取和态势感知,将归一化和特征融合后的状态信息训练残差网络和价值网络,智能体通过近端优化策略(Proximal policy optimization,PPO)针对当前态势选择最优动作.以威胁评估指标作为分配依据,计算综合威胁度,优先将威胁值最大的战机作为攻击目标.为了验证算法的有效性,在课题组搭建的数字孪生仿真环境中进行4v4多机空战实验.并在相同的实验环境下与其他强化学习主流算法进行比较.实验结果表明,使用LSTM–PPO算法在多机空战中的胜率明显优于其他主流强化学习算法,验证了算法的有效性.

关键词

多机空战 / 智能决策 / 近端优化策略 / 威胁评估 / 目标分配

Key words

引用本文

引用格式 ▾
丁云龙, 匡敏驰, 朱纪洪, 祝靖宇, 乔直. 基于LSTM–PPO算法的多机空战智能决策及目标分配[J]. 工程科学学报, 2024, 46(7): 1179-1186 DOI:10.13374/j.issn2095-9389.2023.10.13.003

登录浏览全文

4963

注册一个新账户 忘记密码

参考文献

AI Summary AI Mindmap

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/