基于改进近端策略优化算法的在线三维装箱方法

徐虹, 曾祥进, 华永斌

武汉工程大学学报 ›› 2025, Vol. 47 ›› Issue (5) : 565 -570.

武汉工程大学学报 ›› 2025, Vol. 47 ›› Issue (5) : 565 -570. DOI: 10.19843/j.cnki.CN42-1779/TQ.202410005

基于改进近端策略优化算法的在线三维装箱方法

    徐虹, 曾祥进, 华永斌
作者信息 +

Author information +
文章历史 +

摘要

为解决现有三维装箱算法优化效率低的问题,本文提出了一种改进近端策略优化(PPO)算法的在线三维装箱方法。首先,基于现实装箱的边界约束、支撑约束、重力约束、碰撞约束等条件,在演员-评论家框架中添加可行性掩码预测网络,限制不可行装箱动作点的选取,以满足现实物流过程中的装箱需求。其次,使用长短期记忆网络替换PPO算法神经网络结构中的全连接层,专注学习高奖励值的样本,以便更快速地优化模型。最后,采用两个不同的数据集进行对比实验,其中数据集1采用随机生成的箱子序列,数据集2采用切割库存的箱子序列,保证实验的全面性。实验结果表明,基于改进的PPO算法缩短了强化学习应用于装箱过程中动作节点的盲目搜索时间。在数据集2中,单个箱子平均码放时间缩短了0.3 s,箱子数量增加了2.7个,空间利用率提升了2.2%。本文提出的优化算法能够有效提高三维装箱问题的空间利用率和降低装载时间,为三维装箱问题的工程化应用提供有效的解决方案和参考。

关键词

三维装箱 / 深度强化学习 / 长短期记忆网络 / 近端策略优化算法

Key words

引用本文

引用格式 ▾
徐虹, 曾祥进, 华永斌. 基于改进近端策略优化算法的在线三维装箱方法[J]. 武汉工程大学学报, 2025, 47(5): 565-570 DOI:10.19843/j.cnki.CN42-1779/TQ.202410005

登录浏览全文

4963

注册一个新账户 忘记密码

参考文献

基金资助

国家自然科学基金(61502355)

AI Summary AI Mindmap

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/