基于异构图与改进近端策略优化的退役机电产品选择性拆卸序列规划

郭洪飞 ,  傅文杰 ,  任亚平

中国机械工程 ›› 2026, Vol. 37 ›› Issue (4) : 977 -986.

PDF (2123KB)
中国机械工程 ›› 2026, Vol. 37 ›› Issue (4) : 977 -986. DOI: 10.3969/j.issn.1004-132X.2026.04.022
再制造与退役产品资源化技术

基于异构图与改进近端策略优化的退役机电产品选择性拆卸序列规划

作者信息 +

Selective Disassembly Sequence Planning for Retired Electromechanical Products Based on Heterogeneous Graph with Improved Proximal Policy Optimization

Author information +
文章历史 +
PDF (2172K)

摘要

针对当前选择性拆卸序列规划问题中存在物理建模复杂、适应性差以及算法泛化能力不足等问题,结合结构化异构图建模方法和自适应近端策略优化算法,提出了一种高效的拆卸序列优化方法。通过结构化异构图建模,统一表示产品中零部件的多约束关系,为后续优化提供更具表达力的状态表示;在优化算法中引入优势函数标准化与熵正则化机制,对不同训练阶段数据因量纲差异所带来的分布不一致进行规范化调整,同时自适应调节训练过程中的探索强度,以提高模型的训练稳定性和泛化能力。实验结果表明,引入优势函数标准化显著提高了算法的收敛速度和训练稳定性,而熵正则化机制则增强了算法的探索能力。与传统深度强化学习算法相比,自适应近端策略优化算法在收敛性和最优策略质量方面均表现更好。

Abstract

To address the issues of complex physical modeling, poor adaptability, and insufficient algorithm generalization in the current selective disassembly sequence planning problem, a structured heterogeneous graph modeling method was proposed, which combined with an adaptive proximal policy optimization algorithm to achieve efficient disassembly sequence optimization. Through the structured heterogeneous graph modeling, the multi-constraint relationships of the product components were unified, providing a more expressive state representation for subsequent optimization. Additionally, in the optimization algorithm, advantage function normalization and entropy regularization mechanism were introduced to standardize the data distribution inconsistency caused by dimensional differences across different training stages, while adaptively adjusting the exploration intensity during the training processes to enhance the model's training stability and generalization ability. Experimental results show that the introduction to advantage function normalization significantly improves the algorithm's convergence speed and training stability, while the entropy regularization mechanism enhances the algorithm's exploration ability. Compared with traditional deep reinforcement learning algorithms, the proposed method performes better in terms of convergence and the quality of the optimal policy.

Graphical abstract

关键词

退役产品 / 拆卸规划 / 深度强化学习 / 异构图

Key words

retired product / disassembly planning / deep reinforcement learning / heterogeneous graph

引用本文

引用格式 ▾
郭洪飞,傅文杰,任亚平. 基于异构图与改进近端策略优化的退役机电产品选择性拆卸序列规划[J]. 中国机械工程, 2026, 37(4): 977-986 DOI:10.3969/j.issn.1004-132X.2026.04.022

登录浏览全文

4963

注册一个新账户 忘记密码

0 引言

随着工业产品迭代加速,全球退役机电设备数量激增。退役工业产品中含有大量具备回收价值的机电、电子部件和可利用材料1-2。如果不能妥善处理这些退役工业产品,不仅会造成一定的经济损失,还会因电子废物对生态环境产生恶劣的影响。近年来,提高资源利用效率已成为全球关注的焦点,退役工业产品的回收、再利用和再制造成为重要研究方向3。拆卸是退役产品回收再利用的首要环节,其合理性与效率直接影响后续资源回收效率和环境影响。拆卸效率的关键在于制定有效的拆卸顺序,即拆卸序列规划(disassembly sequence planning,DSP)4。传统的DSP追求完整拆卸,但实际生产中常需针对高价值或危险部件进行选择性拆卸,以平衡成本和收益,即选择性拆卸序列规划(selective disassembly sequence planning, SDSP)5

求解SDSP问题的前提是构建拆卸信息模型,明确零部件之间的结构和约束关系。当前拆卸信息模型普遍采用优先关系图6、与或图、Petri网等方法建模。这些方法在面对大规模复杂产品时易导致状态空间爆炸等问题,且难以适应动态拆卸场景7。目前求解SDSP问题的方法主要有数学规划算法、启发式算法和强化学习方法。数学规划算法通过全局搜索进行求解,随着当前电子产品复杂程度的增加,解空间和计算复杂度也大幅提高,难以获得最优解。此外,SDSP问题属于NP-hard问题,启发式算法通过局部搜索得到近似解,但依赖先验知识且假设可能与实际情况存在差异8,因此不能很好地解决SDSP问题。在实际环境中,往往缺乏待拆卸产品的零部件信息,而强化学习方法可通过与环境交互,逐步学习环境的特征和规律,并通过试错优化策略,从而在无先验知识的条件下解决SDSP问题9-10。现有研究尝试将基于值的强化学习算法,如Q-Learning和深度Q网络(DQN)应用于拆卸序列规划,并与启发式算法进行对比,发现强化学习在求解性能上具有明显优势11。还有一些研究则探索了启发式与强化学习算法的结合,先利用启发式算法生成可行拆卸序列,再用强化学习优化策略,这类方法在泛化能力和适应性上存在不足12-13。PENG等14采用多智能体深度强化学习来提高拆卸效率,但多智能体设置也带来了算法复杂度显著增加和奖励分配不稳定的问题。REN等15针对随机失效的SDSP问题,考虑将问题建模为马尔可夫决策过程(Markov decision process, MDP),并采用近似动态规划方法进行求解,但该研究实验验证规模有限,尚未与主流深度强化学习方法进行充分对比。

本文引入异构图作为拆卸信息建模工具,避免了传统模型的约束转换,并具备良好的扩展性和表达能力,适用于大规模产品拆卸建模。同时,提出了一种考虑优势标准化和熵正则化的近端策略优化算法(proximal policy optimization,PPO)。该方法以拆卸利润最大化和拆卸时间最小化为目标设计奖励函数,并将SDSP转化为马尔可夫决策过程。

1 问题描述及拆卸信息表达

SDSP问题是指在产品存在复杂约束的条件下,根据具体情况选择性拆卸部分零部件,以实现最大化拆卸利润或最小化拆卸时间,并规划出最优或近似最优的可行拆卸序列。其中,首要任务是对产品复杂结构与约束关系进行有效建模,从而为后续策略优化提供准确的结构信息支持。现有研究多采用与或图或Petri网等方式,将产品结构转化为约束矩阵,以表征零部件之间的物理连接和逻辑依赖关系。然而,与或图仅能表示单一约束关系且节点本身缺乏承载零部件属性的能力,需要借助额外的矩阵存储利润、成本和拆卸时间等信息;Petri网则在零部件数量增加时,其库所与变迁数量会呈现指数级增长,难以适应大规模拆卸建模需求。针对上述问题,本文引入异构图(heterogeneous graph,HG)作为拆卸信息的建模方法,通过不同类型的边刻画零部件之间的多种约束关系,并结合零部件属性信息构建结构化的产品拆卸异构图(disassembly heterogeneous graph,DHG)。图1所示为电池案例的DHG。该图由三元组G={ VExEy }表示,其中,G表示异构图, V 为节点集合, Ex 为物理接触约束边, Ey 为空间依赖约束。

每个节点对应一个待拆卸的零部件,节点特征向量如下:

V=d1p1c1t1d2p2c2t2dnpncntn

其中,d表示零部件的拆卸状态(0为未拆卸,1为已拆卸);p为拆卸利润;c为单位时间拆卸成本(本文单位时间为1 s);t为拆卸时间;n为零部件数量。在电池包案例中,节点就是“电池顶壳”“电池接线盒”等所有零部件。

物理接触约束边 Ex 由有向实边表示,用于建模零部件之间的直接固定关系,只有当目标零部件相关的所有物理约束均被解除时,该零部件才能被拆卸。如图1中,若要拆除零部件13,则必须先拆除零部件11和12,其形式如下:

Ex=vxvxvxvyvyvy

其中,vxvy 分别表示约束节点和被约束节点。图1中,对于节点1和2,节点2被节点1所约束,即节点1为约束节点,节点2为被约束节点。

空间依赖约束 Ey 由有向虚边表示,用于建模空间阻挡关系,当目标零部件存在多个空间约束且无物理约束时,只需接触任意空间约束,即可拆卸目标零部件。如图1中,拆除零部件3则只需要先拆除零部件1或2,具体形式如下:

Ey=vxvxvxvyvyvy

与传统的与或图和Petri网等建模方式相比,DHG不仅能够同时表达多种不同的约束关系,还能直接在节点上集成零部件的多维属性信息。相较于Petri网,DHG的结构更加直观、简洁,避免了状态空间爆炸的问题。

2 基于改进PPO算法的选择性拆卸序列规划方法

拆卸序列规划的核心目标是在满足结构约束的前提下寻求一条利润最优且效率高的拆卸路径16。在拆卸过程中,拆卸状态和可拆卸对象会随着拆卸操作的进行而不断变化,且拆卸动作对后续可行操作产生直接影响,因此该问题可视为动态序列决策问题。本文考虑将SDSP转化为MDP,通过智能体与DHG环境的持续交互,不断优化拆卸策略,从而提高拆卸效率并最大化资源利用。

2.1 决策模型构建

本节基于前文构建的DHG建立相应的MDP模型。DHG中的节点可用于表示MDP的状态,当前可拆卸的零部件集合构成动作空间,边的动态变化反映状态转移过程,而零部件的利润和拆卸时间用于奖励函数的设计依据。DHG为MDP提供了结构化且可动态更新的状态与动作建模支撑,下面介绍具体构建细节。

1)状态空间 S 由DHG中零部件节点集合 V 构成,表示形式为一个1×N的状态向量,即

S(t)=(s1,s2,,sn)

式中:si 取值为0或1,分别表示零部件是否已经被拆卸。

2)动作空间A由DHG中的节点及约束关系定义,每个动作对应于选择一个零部件节点执行拆卸操作。并非所有节点在任意时刻都可被选择,其可行性取决于当前拆卸状态以及所施加的约束关系。具体而言,物理接触约束 Ex 要求其前驱零部件全部拆除后方可执行拆卸;空间依赖约束 Ey 则只需部分前驱零部件拆除即可。基于此,通过判断DHG中节点的约束满足情况,可在每个状态下确定当前有效的动作集合。这种动态机制能够在不同拆卸状态下实时排除实际不可执行的动作,从而在动作空间维度不断变化的条件下保持策略网络的泛化能力。

3)奖励函数R为引导智能体学习更合理且高效的拆卸策略,本文从拆卸经济性、目标达成性和执行效率三个维度出发,设计了层次化的奖励函数,具体包括以下三部分:

(a)基础奖励。每执行一次拆卸操作,智能体都会获得与该零部件对应的经济收益。拆卸第i个零部件所获得的基础奖励定义为

rb=pi-citi

(b)目标导向奖励。为进一步引导智能体优先完成预定义的目标零部件拆卸任务,本文引入目标导向激励机制。若当前动作对应的零部件属于目标集合,则在基础奖励的基础上给予额外奖励Rg,若不属于,则施加惩罚Rp。该奖励定义为

r=rb+Rg               iτ-|rb|-Rp        iτ

式中:τ为目标拆卸零部件索引集合。

(c)任务终止奖励。当所有目标零部件均已成功拆卸时,智能体将获得全局终止奖励。为鼓励策略在较少步数内完成任务,同时避免无效拆卸动作,该奖励设计为

rfin=r+Rt-ηn

其中,Rt为任务完成奖励常数;η为与拆卸步数相关的惩罚;n为已拆卸零部件数量。通过引入拆卸步数惩罚项来抑制冗余的拆卸动作,引导智能体在尽可能少的拆卸步骤内完成目标任务,从而实现高效的拆卸路径规划。

为保证奖励函数参数设置的合理性,奖励函数参数RgRpRtη的设置综合考虑零部件的拆卸利润及拆卸时间,使其能够更真实地反映拆卸过程中的经济性与效率。具体而言,RgRp的设置为在平均利润的前提下与当前拆卸零部件的利润进行相加,Rt为平均利润,η设置为拆卸时间的均值。具体计算公式如下:

Rg=(pi+1nj=1npj)
Rp=-(pi+1nj=1npj)
Rt=1nj=1npj
η=1nj=1ntj

2.2 PPO算法及其改进策略

PPO算法是一种基于Actor-Critic架构的策略梯度方法,新旧策略概率比值及裁剪机制有效限制策略更新幅度,从而在保持策略梯度方法优势的同时提高训练稳定性。Actor网络负责在当前状态下输出各拆卸动作的的概率分布,其更新公式如下:

Lclip(θ)=E[min(rt(θ)A^,clip(rt(θ),1-ε,1+ε)A^)]

式中:E[·]表示期望函数;clip为裁剪函数,用于对新旧策略概率比值进行裁剪,将比值限制在[1-ε,1+ε]区间内;ε为裁剪率;A^为广义优势函数;rt(θ)为新旧策略概率比值;θ为当前策略网络的参数(神经网络里面的权重)。

rt(θ)用于衡量策略更新前后某一动作的选择概率变化程度,反映新旧策略在特定状态下对该动作的倾向性差异。通过该比值,可以有效控制策略更新的幅度,确保更新过程既能有效改进策略,又不会因过大的调整而导致训练不稳定。

PPO在处理SDSP问题时表现出较好的适应性和稳定性,但在训练效率和策略性能方面仍存在进一步提升空间。本文从算法优化的角度出发,提出了一种融合优势函数标准化和熵正则化17的近端策略优化算法(advantage normalization and entropy- regularization proximal policy optimization,ANE-PPO)。

1)优势函数标准化。原始广义优势函数在不同状态下往往存在差异过大、尺度不一致等问题,易导致训练过程中的梯度振荡,进而影响策略收敛的稳定性。为了消除这一问题,本文对优势函数A^进行标准化处理,具体实现如下:

A^tnorm=A^-μA^σA^+εstd

其中,μA^σA^分别为均值和标准差批量估计值;εstd为一个防止除零的小常数。标准化操作可以有效控制优势值的取值范围,使其保持在一个稳定区间内,防止在策略更新过程中出现梯度爆炸或消失问题。此外,该机制还可以减少极端值对策略更新方向的影响,减小策略梯度估计的方差,在实际训练过程中减小优势值的波动、提高梯度的信噪比,加快策略优化的收敛速度。

2)熵正则化。策略在更新过程中高度依赖当前经验的评估结果,若初期智能体在探索过程中未能对环境进行全面探索,则可能陷入局部最优解,从而无法学习到最优策略。为缓解这一问题,本文在策略网络中引入熵正则化,通过增加熵项鼓励策略来保持较高的不确定性,从而在训练中更充分地探索动作空间。具体改进方式如下:

Lactor(θ)=E[min(rt(θ)A^,clip(rt(θ),1-ε,
1+ε)A^)-βH(π(at|st))]

其中,β为控制熵项权重的正则化系数,用于调节策略的探索程度,值越大策略越倾向于增强探索能力,反之则越专注于优化已有策略;H(π(at|st)表示当前策略状态st下对动作at选择的不确定性,值越高说明策略在多个动作间分配概率越均匀,具有更强的探索性,反之则说明策略趋于确定性。

2.3 选择性拆卸序列规划方法框架

基于ANE-PPO算法的动态选择性拆卸序列规划算法框架如图2所示。

算法决策过程如下:首先,根据当前环境状态,利用动作筛选机制生成满足拆卸约束条件的可行动作集合;然后,通过Actor网络进行动作选择,选择方式为基于策略分布的概率性决策;最后,执行该拆卸动作进而获得下一状态、奖励以及是否结束当前Episode的反馈信息。上述交互产生的数据将被存储到经验回放池中,用于后续策略更新与模型训练。

算法更新过程如下:首先,从经验回放池中提取批量数据,分别输入到Actor网络和Critic网络,对于Critic网络,将当前状态和对应的下一状态输入Critic网络以估计状态价值函数Vs),并计算广义优势函数,然后进行标准化处理,同时计算Critic网络损失值,对于Actor网络,将批量数据输入Actor网络以获得当前状态下各动作的概率分布及对应动作,并计算新旧策略比,同时结合熵正则化机制策略熵;然后,利用标准化后的优势函数与策略信息计算Actor网络的损失函数;最后,分别对Actor网络和Critic网络的损失函数进行反向传播,并通过梯度下降法更新网络参数。

3 仿真实验结果分析

为验证本文基于改进PPO算法的选择性拆卸序列规划的可行性和有效性,以动力电池和电冰箱为拆卸对象进行案例研究。所有实验均在Python软件上进行编程,并且在配置为Intel(R) Core(TM) i5-10500 CPU @ 3.10GHz处理器、16GB内存以及NVIDIA GeForce RTX 2060 SUPER的计算机以及Win10系统环境下运行。

3.1 参数设置

本文算法的网络架构如表1所示。其中网络层参数的数值表示神经元的数量,Linear表示线性网络,Leaky_relu和Softmax分别表示两种不同的激活函数,运行环境为Python3.7和Pytorch1.12.0。ANE-PPO算法训练中裁剪参数为0.2、网络更新轮次为10、折扣系数为0.95、优势估计值为0.99、Actor网络学习率为3×10-4、Critic网络学习率为0.001。

为了验证所提出ANE-PPO算法的有效性,将其与PPO、DQN及柔性演员-评论家(soft actor-critic,SAC)算法的学习性能进行对比。在具体的实现中,PPO算法未采用2.2节提出的两种改进机制,其余参数设置与AEN-PPO相同。SAC算法的网络层数和神经元数量以及学习率都与ANE-PPO算法相同,而DQN算法网络参数设置则与ANE-PPO算法中Actor网络的参数设计相同。

3.2 动力电池案例

本节以废旧奥迪A3动力电池作为拆解对象,案例数据来源于文献[18]。图3为该动力电池零部件分解图,共16个。图1为奥迪A3的DHG,其中实线连接边为物理接触约束,虚线连接边为空间依赖约束,如节点2受节点1的物理接触约束,节点3受节点2和节点1的空间依赖约束。表2为该动力电池相关零部件的拆卸信息。

为了全面评估各算法的性能,本文对每种算法进行了30次独立的实验,并记录其奖励值变化。图4展示了动力电池案例4种算法奖励函数曲线。

在训练初期,除DQN算法外,其他算法均出现奖励下降现象,这主要是因为策略尚未稳定、探索比例较高。随着训练的推进,各算法逐渐从探索转向利用,奖励值整体上升并趋于稳定。从收敛性能来看,PPO在约190次迭代后收敛至约316的奖励值;DQN在150次迭代后收敛并稳定在约290;SAC与ANE-PPO均在约75次迭代后完成收敛,但SAC的最终奖励约为300,而ANE-PPO能达到335,且收敛速度与稳定性均优于其他基线算法。由于DQN属于基于值的方法,故其稳定性较强,但受限于探索能力,容易陷入局部最优;SAC作为离线策略算法,数据利用率较高,因而收敛速度更快,但最终性能仍未达到最优。相比之下,原始PPO在收敛速度与稳定性上并无优势,但在引入优势标准化和熵正则化后,其训练过程更加稳定,最终成绩亦显著提高。

在深度强化学习算法中,奖励值是衡量算法性能的重要指标,但仅依赖奖励值难以全面反映算法在拆卸序列规划问题中的应用效果,因此,还需要结合拆卸利润、拆卸时间及算法运行时间等多维度指标对算法进行综合评估,以更全面地反映算法在实际应用中的优劣。

表3给出了4种深度强化学习算法在完成30次实验后的平均拆卸利润p、平均拆卸时间t及算法运行时间T等关键性能指标。由表3可知,PPO算法在拆卸时间和拆卸利润方面表现比较好,其利润均值为912.3元,拆卸时间约为236.8 s,但是算法运行时间最长,表明它在训练与推理阶段的效率仍存在优化空间;DQN算法在运行时间上的表现较为突出,但其拆卸利润和拆卸时间均未达到理想水平,陷入了局部最优解;SAC算法无论是在拆卸利润、拆卸时间还是算法运行时间都处于4种算法中间位置;ANE-PPO算法在拆卸时间和拆卸利润两个指标上均优于其他3种算法并且运行时间也仅仅略小于DQN算法。因此,ANE-PPO算法实现了在最小化拆卸时间的同时获取到最大的拆卸利润,表现出了更优越的综合性能。

ANE-PPO算法在现有小规模拆卸案例中的效果并不明显,需要在更复杂的拆卸场景中验证其的有效性与适应性。

3.3 电冰箱案例分析

上述动力电池案例中零部件数量仅为16个,结构比较简单且复杂度比较低,现以文献[19]中的电冰箱作为拆卸案例进行分析。该电冰箱由66个零部件构成,产品的具体拆卸信息如表4所示。

电冰箱的DHG如图5所示,其中,实线连接边为物理接触约束,虚线连接边为空间依赖约束。利用ANE-PPO算法求解共有66个零部件的电冰箱拆卸实例,算法设置如下:策略网络学习率actor_lr为10-4、价值网络学习率critic_lr为10-3、迭代次数episode为500、隐藏层维度hidden_dim为64、折扣因子gamma为0.95、GAE衰减因子lmbda为0.95、每回合更新轮数epoch为10、裁剪参数eps为0.1,选择拆卸目标件集合为{6,13,33,41,47,52}

图6是DQN、SAC、PPO、ANE-PPO这4种算法在冰箱案例上的算法性能比较,表5所示为4种算法在拆卸序列、平均拆卸利润p、平均拆卸时间t、奖励值R和算法运行时间T上的比较。

表5可以看出,ANE-PPO算法在求解大规模电冰箱案例时的平均奖励值与经济收益方面均优于其他算法,其平均奖励值达到了124.2,较基准PPO提高了约15.3%,相较于传统DQN提高幅度更是超过40%,表明该算法在拆卸路径优化与策略学习方面具有更强的全局搜索能力与策略泛化能力。在经济性方面,ANE-PPO实现了87.6元的平均拆卸利润,优于PPO(76.3元)、SAC(73.4元)与DQN(68.4元),在收益最大化目标下展现出了更高的性能。在任务执行效率方面,ANE-PPO的平均拆卸时间为198.2 s,是算法中唯一低于200 s的方案,体现了其在操作序列优化上的高效性。而PPO的时间为211.7 s,SAC和DQN分别为209.4 s和216.7 s,均高于ANE-PPO。这一结果表明,ANE-PPO 不仅提高了收益,还有效缩短了任务完成时间,具备良好的时效性。从算法平均运行时间来看,ANE-PPO在保持最优性能的同时,平均运行时间为233.4 s,显著优于PPO算法的255.3 s和SAC算法的262.6 s。DQN算法尽管在运行时间上与ANE-PPO基本一致,但在奖励和利润指标上的表现较弱,显示出在复杂任务环境中策略学习能力不足的问题。

与小规模的动力电池案例相比,ANE-PPO算法在处理大规模电冰箱拆卸任务时,无论在效益提高还是执行效率方面均表现出更强的适应性和优化能力。这充分说明了ANE-PPO算法在求解大规模拆卸案例时的优越性。

图6展示了4种算法在训练过程中奖励值的变化趋势,可以看出,ANE-PPO不仅具备最快的收敛速度,其最终奖励值收敛后也明显高于对比算法,显示出更优的策略学习能力与收敛稳定性。相较之下,PPO和SAC均展现出较好的训练效果但略逊一筹;而DQN由于在高维动作空间中表现不佳,训练初期波动大、收敛慢,最终策略表现明显较弱。

3.4 消融实验分析

本节通过消融实验进一步验证ANE-PPO算法在小规模选择性拆卸序列规划中的有效性,包括优势函数标准化和熵正则化改进以及在奖励函数中的参数设置对拆卸结果的影响。消融实验的设计方案和结果如表6表7所示。

本节分别在案例1和案例2上设置6组方案。第1组为原始PPO算法;第2组在PPO基础上加入了熵正则化模块;第3组加入了优势函数标准化模块;第4组将PPO奖励函数参数缩小为原来的1/2;第5组将奖励函数参数扩大为原来的2倍;第6组实验为ANE-PPO算法。由表6表7可以得到以下结果。

1)比较第1、2、3和6组可知:加入熵正则化机制后,算法的探索能力增强,可以得到利润更高且拆卸时间更短的解决方案;加入优势函数标准化机制可显著提高算法收敛效率,但是解的质量有所下降;同时引入两种机制可在保证收敛效率的前提下进一步优化策略性能。

2)比较第1、4、5、6组可以得出:无论是将奖励函数参数放大还是缩小都会降低奖励值,将参数缩小1/2时对奖励值的影响会比较小,但是收敛时间会变长,将参数增大到2倍时对奖励值的影响会比较大,但是收敛时间会缩短。

3)对比表6表7发现:在加入熵正则化和优势函数标准化之后,求解大规模案例效果要好于小规模案例,但是大规模案例对参数也更加敏感,但是依然在合理范围内。

4 结论

1)提出基于DHG的产品拆卸信息建模方法,有效表示了零部件之间的物理连接与空间依赖等多类型约束关系,为后续动态选择性拆卸提供结构化数据支持;同时构建以拆卸时间最小化与拆卸收益最大化为目标的MDP模型,将DHG作为状态表示,并设计了层次化的多目标奖励函数。

2)在PPO算法的基础上引入优势函数标准化和熵正则化机制,增强策略更新的稳定性与鲁棒性,提高训练过程的探索能力,有效防止策略陷入局部最优。

3)通过一个小规模拆卸案例和一个大规模拆卸案例,对ANE-PPO算法与深度强化学习中的基准算法DQN、SAC和PPO算法进行了多维度性能对比分析和消融实验,验证了算法在处理大规模拆卸案例中的可行性和综合性能优势。

在未来的研究中,可进一步从拆卸过程中的不确定性因素出发,深入探讨产品在实际使用中因结构损耗、部件缺失或状态异常等引发的动态变化问题。针对这些不确定性因素,有必要构建更具适应性的建模方法,能够动态感知和处理结构信息的不完备或变化。同时,可结合深度强化学习在动态环境中自适应决策的优势,设计具备在线调整能力的策略模型,实现对不同产品状态下的高效拆卸路径规划。

参考文献

[1]

ZHANG XFU AZHAN Cet al. Selective Disassembly Sequence Planning under Uncertainty Using Trapezoidal Fuzzy Numbers: a Novel Hybrid Metaheuristic Algorithm[J]. Engineering Applications of Artificial Intelligence2024128: 107459.

[2]

朱卓悦, 徐志刚, 沈卫东, . 基于遗传蝙蝠算法的选择性拆卸序列规划[J]. 浙江大学学报(工学版)201852(11): 2120-2127.

[3]

ZHU ZhuoyueXU ZhigangSHEN Weidonget al. Selective-disassembly Sequence Planning Based on Genetic-bat Algorithm[J].Journal of Zhejiang University(Engineering Science)201852(11):2120-2127.

[4]

GUO HZHANG LREN Yet al. Optimizing a Stochastic Disassembly Line Balancing Problem with Task Failure via a Hybrid Variable Neighborhood Descent-artificial Bee Colony Algorithm[J]. International Journal of Production Research202361(7): 2307-2321.

[5]

郭洪飞,傅文杰,李雷孝,.基于最优化的拆卸序列规划研究进展[J].计算机工程与应用202561(11):51-66.

[6]

GUO Hongfei, FU Wenjie LI Leixiao, et al. Research Progress on Optimization-based Disassembly Sequence Planning[J]. Computer Engineering and Applications202561(11):51-66.

[7]

朱建峰, 徐志刚, 苏开远. 基于改进蛙跳算法的多目标选择性拆卸序列规划方法[J]. 计算机集成制造系统202228(3): 676-689.

[8]

ZHU JianfengXU ZhigangSU Kaiyuan. Multi-objective Selective Disassembly Sequence Planning Based on Multi-objective Improved Frog Leaping Algorithm[J]. Computer Integrated Manufacturing Systems202228(3): 676-689.

[9]

任亚平, 郭洪飞, 张超勇, . 考虑产品制造过程内含能的选择性拆解规划能耗优化研究[J]. 机械工程学报202157(6): 200-210.

[10]

REN YapingGUO HongfeiZHANG Chaoyonget al. Energy Consumption Optimization of Selective Disassembly Planning Considering Product Embodied Energy during Manufacturing[J]. Journal of Mechanical Engineering202157(6): 200-210.

[11]

REN YGUO HLI Yet al. A Self-adaptive Learning Approach for Uncertain Disassembly Planning Based on Extended Petri Net[J]. IEEE Transactions on Industrial Informatics202319(12): 11889-11897.

[12]

HU YLIU CZHANG Met al. An Ontology and Rule-based Method for Human-robot Collaborative Disassembly Planning in Smart Remanufacturing[J]. Robotics and Computer-Integrated Manufacturing202489: 102766.

[13]

王蕾, 何宸, 曹建华, . 考虑失效状态的废旧机械产品选择性拆卸序列规划方法[J]. 现代制造工程2022(5): 145-152.

[14]

WANG LeiHE ChenCAO Jianhuaet al. Failure Status Based Planning Method for Selective Disassembly Sequence of Used Machinery Products[J]. Modern Manufacturing Engineering2022(5): 145-152.

[15]

田永廷, 张秀芬, 徐劲芳, . 支持再制造的选择性并行拆卸序列规划方法[J]. 计算机辅助设计与图形学学报201830(3): 531-539.

[16]

TIAN YongtingZHANG XiufenXU Jinfanget al. Selective Parallel Disassembly Sequence Planning Method for Remanufacturing[J]. Journal of Computer-Aided Design & Computer Graphics201830(3): 531-539.

[17]

ZHAO XLI CTANG Yet al. Reinforcement Learning-based Selective Disassembly Sequence Planning for the End-of-life Products with Structure Uncertainty[J]. IEEE Robotics and Automation Letters20216(4): 7807-7814.

[18]

XIAO JZHANG ZTERZI Set al. Dynamic Task Allocations with Q-learning Based Particle Swarm Optimization for Human-robot Collaboration Disassembly of Electric Vehicle Battery Recycling[J]. Computers & Industrial Engineering2025204: 111133.

[19]

LI YZHU WGUO Jet al. Multi-objective Collaborative Optimization of Green Disassembly Planning and Recovery Option Decision Considering the Learning Effect[J]. Journal of Manufacturing Systems202580: 324-343.

[20]

PENG YLI WZHOU Yet al. Dynamic Disassembly Planning of End-of-life Products for Human-robot Collaboration Enabled by Multi-agent Deep Reinforcement Learning[J]. IEEE Transactions on Automation Science and Engineering202522: 13907-13919.

[21]

REN YMENG LTIAN Get al. An Efficient M-step Lookahead Rollout Algorithm for Profit-oriented Selective Disassembly Sequence Planning with Operation Stochastic Failure[J]. Engineering Applications of Artificial Intelligence2025145: 110173.

[22]

CHU XLI LZHAO Fet al. Disassembly Time Estimation for Used Smartphones Based on Maynard Operation Sequence Technology[J]. Computers & Industrial Engineering2024193: 110291.

[23]

刘旖菲, 李小帅, 杨俊安, . 基于SANER-PPO算法的无人机集群干扰资源分配方法[J]. 控制与决策202439(12): 3937-3945.

[24]

LIU YifeiLI XiaoshuaiYANG Jun’anet al. SANER-PPO Algorithm-based Jamming Resource Allocation for UAV Swarm[J]. Control and Decision202439(12): 3937-3945.

[25]

ALFARO-ALGABA MRAMIREZ F J. Techno-economic and Environmental Disassembly Planning of Lithium-ion Electric Vehicle Battery Packs for Remanufacturing[J]. Resources, Conservation and Recycling2020154: 104461.

[26]

WANG KLI XGAO Let al. A Discrete Artificial Bee Colony Algorithm for Multi Objective Disassembly Line Balancing of End-of-life Products[J]. IEEE Transactions on Cybernetics202252(8): 7415-7426.

基金资助

国家自然科学基金(52465061)

国家自然科学基金(52205526)

内蒙古自治区科技创新重大示范工程“揭榜挂帅”项目(2024JBGS0035)

内蒙古自治区自然科学基金重点项目(2024ZD26)

内蒙古自治区重点研发和成果转化计划(2023YFJM0007)

广州市科技计划(202201010284)

中央高校基本科研业务费专项资金(21623219)

AI Summary AI Mindmap
PDF (2123KB)

8

访问

0

被引

详细

导航
相关文章

AI思维导图

/