基于二阶锥鲁棒优化的不确定需求下生鲜农产品路径规划

李军涛 ,  李怡晴

中国农业大学学报 ›› 2026, Vol. 31 ›› Issue (8) : 243 -250.

PDF (906KB)
中国农业大学学报 ›› 2026, Vol. 31 ›› Issue (8) : 243 -250. DOI: 10.11841/j.issn.1007-4333.2026.08.21

基于二阶锥鲁棒优化的不确定需求下生鲜农产品路径规划

作者信息 +

Robust planning for fresh agricultural products with uncertain demand based on second-order cone robust optimization

Author information +
文章历史 +
PDF (927K)

摘要

为解决生鲜农产品在配送过程中,客户需求常受个人偏好、突发事件等外部因素影响而表现出的随机性和不确定性,给配送决策带来的巨大挑战问题,利用强化学习与鲁棒优化的研究方法,构建一个能够在需求不确定的环境下做出有效配送决策的智能系统。首先为了更精确捕捉客户需求之间的依赖关系,为配送决策提供更为真实和动态的数据支持,通过Copula-Gamma模型生成高相关性需求场景,然后结合Dueling-Double DQN最优算法进行路径初始规划,最后引入二阶锥鲁棒优化对第二阶段不确定需求成本进行调控。结果表明:1)本研究所提出的Dueling-Double DQN最优算法在需求不确定条件下,与启发式最近邻贪心算法生成的Baseline、Vanilla DQN和PPO相比,在Solomon数据集R组、C组和RC组全部实例上总成本大幅降低;2)第二阶段不确定需求成本在引入鲁棒优化后大幅下降,R组下降幅度最高,达72.09%,RC组和C组的降幅分别为70.80%和67.02%。综上,本研究方法不仅有效解决了生鲜产品配送中的需求不确定情况下成本优化问题,还增强了配送的稳定性,为配送系统的实际应用提供了一种可推广的智能化优化方案。

Abstract

To address the considerable challenges posed by the randomness and uncertainty of customer demand for fresh produce-demand that fluctuates with personal preferences, emergencies, and other external factors-this study integrates reinforcement learning with robust optimisation to build an intelligent decision-making system capable of operating effectively under demand uncertainty. First, a Copula-Gamma model is employed to generate highly correlated demand scenarios, thereby capturing inter-customer dependence more precisely and supplying realistic, dynamic inputs for route planning. These scenarios are then fed into a Dueling-Double DQN to obtain an initial set of delivery paths, after which second-order cone programming (SOCP)-based robust optimisation is introduced to regulate excess costs, mitigating the cost volatility induced by demand uncertainty. The results showed that: 1) Under demand uncertainty, the proposed Dueling-Double DQN algorithm significantly reduces the average total cost across all instances in the R, C and RC groups of the Solomon dataset, compared to the baseline generated by the heuristic nearest-neighbour greedy algorithm, as well as Vanilla DQN and PPO. 2) With robust optimization, the second-stage random cost drops sharply-by 72.09% in Group R, 70.80% in Group RC, and 67.02% in Group C. In summary, the proposed method not only effectively solves the cost optimisation problem for fresh product delivery under demand uncertainty, but also enhances delivery stability, providing a generalisable and intelligent optimisation solution for practical delivery systems.

Graphical abstract

关键词

生鲜农产品 / 路径优化 / 无人机 / 强化学习 / 不确定需求

Key words

fresh produce / route optimization / unmanned aerial vehicles (UAVs) / reinforcement learning / demand uncertainty

引用本文

引用格式 ▾
李军涛,李怡晴. 基于二阶锥鲁棒优化的不确定需求下生鲜农产品路径规划[J]. 中国农业大学学报, 2026, 31(8): 243-250 DOI:10.11841/j.issn.1007-4333.2026.08.21

登录浏览全文

4963

注册一个新账户 忘记密码

随着城市居民对生鲜农产品需求的持续增长,如何在确保配送效率和质量的基础上实现绿色低碳运输,已成为生鲜农产品配送领域亟待解决的关键问题。无人机凭借其灵活机动、无接触配送等优势,已成为“最后一公里”配送的潜在解决方案。然而,生鲜农产品的配送过程对时效性和温控条件有着严格要求,传统路径规划方法往往难以同时兼顾效率和鲁棒性,尤其在需求具有较高不确定性、环境条件复杂多变的情况下,问题更加突出。在实际配送问题中,客户需求通常由于个体偏好、消费行为或突发事件等因素表现出高度的不确定性。而现有的路径优化方法大多侧重于静态情境,无法有效处理这些不确定因素和突发需求,导致配送效率难以达到理想水平。因此,如何在动态且复杂的环境中,设计出既能保证时效性又能应对需求波动的路径规划方法,成为了亟待解决的难题。
在车辆路径规划的早期研究中,已有研究主要聚焦于电动车的传统启发式算法。马昌喜等1针对时变路网下城市车速变化与生鲜品配送过程中产生的各种成本问题,提出一种时变路网下基于混合调整策略的车辆路径优化方法;李军涛等2针对冷链物流配送系统中总成本较高以及车辆有效利用率低的问题,构建以包含碳排放在内的配送总成本最小化和客户满意度最大化为总目标的多车型路径优化模型;张济风等3针对生鲜冷链配送中新鲜度、货损成本与配送耗时的强耦合关系,考虑路网交通的时变特性,提出了一种冷链配送路径优化方法,有效提升了动态场景下冷链配送的经济性和时效性。上述方法为后续研究奠定了基础,但其求解效率在复杂动态环境中面临挑战,且通常难以有效处理突发性需求。
随着低空经济的发展与无人机应用的普及,使得无人机路径规划逐渐成为智能配送领域的重要研究方向。陈进朝等4聚焦于异构无人机集群在多区域上的覆盖路径规划问题,提出了一种基于时空密度聚类的启发式算法来提高覆盖路径规划问题的求解效率;针对无人机三维路径规划中蚁群算法全局搜索能力不足的问题,Wang等5引入人工势场引导与多重搜索策略,有效提升路径质量与规划效率。这些研究显著提升了无人机路径规划的可行性与效率,但多数仍假设环境与需求信息是确定或静态的,面对现实中的复杂情况,求解效率仍面临诸多问题。
在传统启发式方法求解的基础上,已有研究进一步尝试将深度强化学习(Deep reinforcement learning,DRL)引入路径规划,以提升决策自主性和求解效率。Han等6将A*先验与改进深度Q网络(Deep q-network,DQN)结合,提出优先级协同策略与转弯受限动作集,实现多无人配送车的避碰与高效收敛;相较传统A*,任务成功率由49%提升至94%。该研究引入的启发式先验显著降低了DRL的无效探索,为“深度-启发式混合”算法提供了思路。尽管强化学习在处理随机性方面展现出潜力,但其多聚焦于期望成本最小化,尚缺乏对解方案鲁棒性以及在极端需求情形下系统性能的系统性考量。
在随机请求方面,蔡文广等7针对现有的拼车方案大多服务在线乘客请求,而忽略了离线乘客请求的问题,提出了一种基于挖掘历史出行轨迹数据的概率路由拼车优化算法。李阳等8针对在实际配送环节中客户需求、位置、路况等未知信息对不确定车辆路径问题的影响,提出两阶段的混合变邻域分散搜索算法。Reusken等9在食品银行场景中同时刻画了需求、服务和等待时间的不确定性,并采用分区-分配-路线三级数学启发式算法以满足容量与行驶时限的可靠性约束,验证了分解式求解在中等规模实例上的可行性。Cai等10采用GAT‑AM编码-解码器处理含随机行驶成本的VRP‑STC,结果表明当问题规模增大时,DRL相较传统启发式更具解质量与泛化优势。在更动态的场景中,Zhou等11针对单车动态VRP‑SD提出“历史决策监督学习+在线DRL”混合策略,实验结果表明,该策略在不同客户群体中表现出差异化提升效果:针对高需求密度的客户,服务效率提升了12%;针对低需求密度的客户,服务效率提升了8%。
尽管上述方法在特定场景下取得了一定进展,但在应对需求高度不确定时仍存在以下共同局限:其一,多数传统启发式与早期强化学习方法侧重于期望成本最小化,缺乏对解方案在极端需求情形下鲁棒性的系统性考量;其二,许多概率模型严重依赖历史数据的精确分布,当现实中出现历史未见的突发波动或客户间存在复杂相关性时,其性能可能显著下降;其三,现有研究大多孤立地处理不确定因素,尚未将需求的相关性结构、分布的模糊性以及路径决策的稳健性在一个统一框架内进行协同优化。
因此,如何在强化学习的自主学习能力基础上,引入能够准确刻画分布不确定性,并有效捕捉极端风险、降低额外配送成本的鲁棒优化机制,是提升生鲜无人机配送系统在不确定需求下性能的关键。因此,本研究提出了一种Copula-Gamma场景驱动+Dueling-Double DQN+二阶锥鲁棒优化(Second-order cone distributionally robust optimization,SOC-DRO)的全流程方法,首先利用Copula-Gamma组合模型在整体客户集上生成100个高相关性随机需求场景;随后构建二阶锥鲁棒优化策略,第一阶段由改进的Dueling-Double DQN输出初始路径,第二阶段通过鲁棒优化策略捕捉需求不确定性。该方法旨在有效解决生鲜产品配送中的需求不确定性问题,提高配送的稳健性,以期更精准地评估不确定需求下的配送风险,有效降低由需求不确定性引发的额外成本增加。

1 问题描述与模型构建

1.1 问题描述

生鲜农产品具有高度的时效敏感性​和易腐性,除此之外,在配送过程中,客户的需求会受到个体消费行为随机波动、促销活动或突发天气事件等多重因素干扰,表现出强烈的时变特征。这种多源不确定性使得基于完全信息与静态假设的传统路径规划模型(如VRP)在实践中往往失效。具体而言,预先制定的静态路径方案会因实时需求波动而脱离最优解,甚至不可行,进而导致配送成本的增加,包括无人机路径频繁重构带来的成本增加、车辆装载率低下、运输成本超预算以及客户满意度下降。

为应对上述问题,弥补现有研究在鲁棒性与综合性方面的不足,本研究创新性地提出一种融合Dueling-Double DQN深度强化学习模型与二阶锥鲁棒优化的混合智能决策框架。该框架旨在通过深度强化学习感知并适应环境动态变化,同时利用鲁棒优化抵御不确定性扰动,从而生成在不确定需求成本与方案稳健性之间取得最佳平衡的配送路径,最终为提升生鲜农产品物流系统的整体效率与可靠性提供理论依据与算法支撑。

1.2 数学建模

针对生鲜产品无人机配送场景,构建一个考虑不确定需求与运输损耗的生鲜农产品无人机配送路径优化模型。研究的核心问题可描述为:如何为一组无人机车队规划其访问所有客户点的行驶路径,面对需求不确定时,在满足无人机运力、路径连通性等物理约束的前提下,协同优化无人机固定成本、运输成本和生鲜货损成本,从而实现系统总成本的最小化。该问题本质上是需求不确定的车辆路径问题(Vehicle routing problem with stochastic demands,VRPSD)。

1.2.1 问题定义和模型框架

考虑一个由配送中心(编号为0)与若干客户点(集合N={1,2,,n})构成的配送网络。一个由v架无人机组成的同质车队(集合V={1,2,,v})从配送中心出发,服务完所有客户后返回。模型的关键要素定义如下:

1)优化目标。第一阶段固定成本,主要包括无人机固定使用成本、与行驶距离相关的运输成本,以及因生鲜产品腐坏产生的货损成本。

2)决策变量。核心决策变量为二元路径指示变量xijk(若无人机k从节点i行驶至节点j,则其为1,否则为0)和任务分配变量yik(若客户点i由无人机k服务,则其为1,否则为0)。

1.2.2 主要变量

本研究所用的主要变量说明如表1所示。

1.2.3 目标函数

不确定需求下生鲜农产品路径优化模型的目标函数如下:

z1=Cvk=1vψ(k),z2=Csi=0nj=0nLij,z3=i=1nCrDi(π1T'+π2T'')
min z =z1+z2+z3

式中:z1无人机固定使用成本,元;z2为总运输成本,元;z3生鲜的总折损成本,元;minz为第一阶段固定成本,元;i为第i个客户;j为第j个客户;k为第k架无人机。

1.2.4 约束条件

为了更真实地反映实际配送场景的需求特征,生鲜农产品的约束条件设定如下:

1)确保无人机在顾客节点处出入守恒且每个顾客只能访问一次。

inxijk=inxjik=1,iN,jN,kV

式中:xijk为0-1变量,若第k架无人机从节点i飞向节点j,则取1,否则取0。

2)相同点之间无路径连通。

xijk=0,iN,jN,kV

3)每个节点i上的任务或目标只能分配给一个无人机,即每个顾客必被一架无人机服务。

kVyik=1,iN

式中:yik为0-1变量,若客户点i由第k架无人机服务,则取1,否则取0。

4)保证当无人机被启用时仅有一条服务路径且其始末点均为配送中心。

jNx0jk=jNxj0k1,kV

5)将决策变量xijkyik联系起来,保证客户点被无人机服务时一定有路径与其连接。

jNxijk=yik, iNxijk=yjk,iN,jN,kV

6)消除子回路。

iSjSxijk|S|-1,SN,kV

式中: S 为客户节点的任意非空真子集。

1.2.5 不确定需求建模

在实际配送场景中,客户需求具有一定的随机性,不同客户之间的需求量也可能存在差异。为了有效刻画这种不确定性,并为后续强化学习训练提供更好的动态环境,本研究采用伽马分布对客户需求进行建模。在实际场景中,多个客户的需求往往存在一定相关性,例如气温、节假日和促销等因素可能导致某些区域客户需求同时增加。为此,本研究在建模每个客户边缘需求为伽马分布的基础上,引入Copula函数构造客户间的联合需求分布,捕捉潜在的尾部相关性与非线性相关结构,从而提高场景建模的现实性与鲁棒性。Copula函数允许在保持边缘分布不变的前提下,灵活建模多个随机变量之间的依赖关系12。本研究选取高斯Copula构造场景需求D˜=(D˜1,D˜2,,D˜n),联合分布表示为:

FD˜(D1,D2,...,Dn)=C(FD˜1(D1),FD˜2(D2),...,FD˜n(Dn))

式中:D˜i为每个客户的随机需求量;C()为Copula函数;FD˜i()为第i个客户的边缘伽马分布。构建的联合分布用于生成不确定性的随机需求场景,作为二阶锥鲁棒优化模型的输入数据,以捕捉环境波动对路径规划的影响。

2 算法设计

为有效应对客户需求的随机性、路径规划的复杂性以及飞行避障挑战,本研究提出了一种基于Dueling-Double DQN和二阶锥鲁棒优化的模型。具体步骤如下:

1)Dueling-Double DQN初始路径求解。将生成的场景输入改进的Dueling-Double DQN,利用分位值分布估计(Quantile regression deep q-network, QR-DQN)、双网络去偏机制及优先n-step回放机制,输出在不确定需求条件下具有良好期望性能的初始配送路径。

2)鲁棒优化策略。在路径执行前,引入鲁棒优化策略捕捉不确定需求,以提高配送的稳健性。

2.1 不确定需求场景构建

2.1.1 数据源和变量定义

城市生鲜配送在不同日期面临明显波动的客户集合,每天提出配送请求的用户数量有限且分布不稳定,即便在登记阶段收集了位置与期望需求量,真正的可服务需求仍要在无人机抵达现场后才能确认。本研究将这一特征称为“变量客户集”,并进一步假设客户需求在访问时才能获得,形成需求的双重不确定性。

2.2 路径优化框架

2.2.1 决策网络和状态建模

本研究以Double DQN为核心方法,通过离线生成场景并利用强化学习对路径进行初步优化。为提升对动作价值的辨别能力,决策网络引入Dueling架构,通过分别建模状态值函数与优势函数以实现更稳定的策略学习13。价值函数与优势函数分离建模的表达式为:

Q(s,a)=V(s)+A(s,a)-1|A|a'A(s,a')

式中:Q(s,a)为动作价值;V(s)为状态价值函数;A(s,a)为优势函数;a为当前动作;a'为下一步动作;s为当前状态。

2.2.2 分布式双Q估计

为更准确地刻画Q值分布带来的不确定性,并缓解Q函数估计中的高方差问题,本研究采用基于分布强化学习的Quantile regression DQN(QR-DQN)14作为基础架构,并结合 Double DQN策略15,实现鲁棒的双Q值估计。

1)网络输出形式。策略网络采用QR-DQN结构,启用分布式值函数建模,并设置分位点数量为32,使得网络输出由32个分位值组成的向量。

2)Double DQN目标。Double DQN 的目标值计算采用当前网络选择动作、目标网络评估价值的方式,以减小过估计偏差。

R=r+γQθtarget s',argmaxa'Qθs',a'

式中:R为总回报奖励;r为即时奖励;s'为下一步状态;γ为折扣因子;θ为当前网络;θtarget为目标网络参数。为提升分位值回归的稳定性,损失函数采用Quantile huber损失。目标网络采用软更新方式,逐步融合当前策略参数与历史目标参数,提高策略更新的稳定性。

2.2.3 经验回放和三步时序差分

经验回放采用基于优先级的采样方式,并引入“优先+随机”的混合采样策略,70%来自高时序差分(Temporal difference, TD)误差样本,30%随机采样,以提升样本多样性。同时采用多步TD回报(步数设为3),更充分地利用奖励信号。每次采样后重新计算TD误差以更新样本优先级,保证训练过程的连续性与公平性。

2.2.4 自适应探索策

为了在训练初期充分探索,并在后期逐步收敛至较优解,本研究在ε-greedy策略中引入动态调整机制:训练初期保持完全探索以避免局部最优,之后ε值逐步衰减,向稳定策略过渡。每隔一定回合短暂提升ε值,保证模型继续探索,防止过早收敛。

2.2.5 鲁棒优化策略

为刻画生鲜配送中需求不确定性及尾部相关性,本研究在第一阶段固定路径决策的基础上,进一步引入二阶锥鲁棒优化框架用于建模第二阶段不确定需求成本。该方法基于Wasserstein椭球不确定集16,并在95%置信水平下最小化最坏情况下的预期成本,从而将需求风险加入路径评估中。

记不确定需求向量为:

ξ=ξ1,ξ2,,ξiTR

式中:ξi为第i个客户的总需求量; R 为实数集。

设历史场景集H=ξ1,,ξS,通过高斯Copula与Gamma边缘分布拟合获得经验分布P。基于此,定义2-Wasserstein不确定集合为:

UΛ(P)=GM(RK):W2(G,P)Λ

式中:UΛ(P)为分布邻域;G为概率测度;M(RK)为概率测度空间;W2为2-Wasserstein距离;P为经验分布;Λ为集合半径,通过bootstrap方法在95%的置信水平下估算得到。

在给定任意第一阶段固定成本z的前提下,第二阶段不确定需求成本定义为:

R2(zt)=supGUΛ(P)Eξ~G[C(z,ξ)]

式中:R2(zt)为第二阶段不确定需求成本;C(z,ξ)为在需求实现ξ条件下的最小调整成本(即额外需求、货损成本等);ztt时刻的系统状态。根据凸对偶理论17,可得闭式上界,该项上界即为鲁棒优化模型中最终第二阶段不确定需求成本项为:

R2(zt)=ταuη+tr(Σ)+Λ2

式中:τα为置信水平相关的缩放常数;u为单位需求变化引起的边际成本向量;η为经验均值向量。

考虑到鲁棒优化在第二阶段不确定需求中的关键作用,本研究将鲁棒优化函数加入奖励函数设计,使得策略学习阶段便可感知潜在的成本风险,从而提升对不确定需求的适应能力。本研究构造复合奖励如下:

rt=rpath(zt)-λrR2(zt)

式中:rt 为时刻t的总奖励;rpath为常规路径规划中定义的交叉与货损奖励;λr为鲁棒的加权系数。该复合奖励在强化学习的策略阶段能够兼顾成本最小化与需求不确定性下的稳健性,最终实现路径的鲁棒优化策略。

3 结果与分析

3.1 数据集及实验环境

本研究中,为模拟生鲜农产品配送的实际需求场景,采用了Solomon基准测试集。该测试集包含3种结构化的客户分布,旨在模拟现实场景中不同的需求分布特征,并对算法性能提出差异化的挑战。

R组(Random):客户点在服务区域内服从均匀随机分布,模拟需求点高度分散的应用场景。

C组(Clustered):客户点呈现明显的聚类特征,模拟集中区域的需求分布。

RC组(Mixed):作为R组与C组的混合形式,客户点中既包含随机分布部分,也存在聚类结构,模拟更为复杂和普遍的城市场景。

本研究从上述R、C和RC 3组实例中分别随机抽取40~60个客户点以构成实验所需的客户集合。通过在此3组基准集上的综合测试,可以全面验证路径优化方法在不同空间分布模式下的有效性与稳定性。

3.2 不同算法及参数下成本比较分析

在不引入任何鲁棒优化策略的基准情形下,算法Dueling-Double DQN、Vanilla DQN、PPO、Baseline对第一阶段固定成本、第二阶段不确定需求成本、总成本的影响关系如表2所示。可知:最优算法Dueling-Double DQN在R、C和RC 3组实例上的总成本相较基线Baseline平均降低4.06%,较PPO平均降低1.87%,较Vanilla DQN平均降低4.33%。该结果表明,在未引入鲁棒优化策略的情况下,相比其他3种算法,Dueling-Double DQN仍能小幅降低总成本,验证了其在路径规划问题中具有更强的价值估计能力与策略优化潜力。

为优化第二阶段不确定需求成本,针对是否引入鲁棒优化策略,算法Dueling-Double DQN、Vanilla DQN、PPO、Baseline对第一阶段固定成本、第二阶段不确定需求成本、总成本的影响结果如表3所示。可知:引入鲁棒优化策略较第二阶段不确定需求成本大幅下降,R、C和RC组平均降幅分别达到71.9%、67.0%和70.8%。上述结果表明,鲁棒优化策略的引入能大幅减少第二阶段不确定需求下所导致的高昂成本。

为进一步分析不同参数α对鲁棒优化模型的影响,本研究采用变异系数(Coefficient of variation,CV)方法分析了不同场景情况下α对总成本的影响,结果如图1所示。可知:当α由0.1增加至0.5时,CV增长缓慢,系统鲁棒性逐步增强,且总成本上升幅度较小,表明模型在提高稳定性的同时仍保持较好的成本效率。然而,当α>0.5时,CV和总成本均呈现陡增趋势,说明鲁棒性提升已开始带来明显的效率损失,即模型变得过于保守。故α=0.5附近表现出较好的综合平衡,验证了所提模型在不同客户分布场景下的适应性。

4 结 论

针对生鲜农产品无人机配送中客户需求随机波动引发的路径规划效率下降与成本风险上升问题,本研究构建了一个融合Copula-Gamma随机场景生成、Dueling-Double DQN初始路径优化与第二阶段鲁棒优化的两阶段路径规划框架,并基于Solomon数据集进行了验证。主要结论如下:

1)所构建的路径规划模型能够较好刻画客户需求的相关性与波动特征,提升初始路径方案质量,在不同类型客户分布场景下均表现出较好的适应性。

2)引入鲁棒优化策略后,Dueling-Double DQN算法能更充分地考虑需求不确定性带来的风险,从而有效抑制第二阶段不确定需求成本波动,提升路径方案的稳健性。

3)鲁棒参数敏感性分析表明,模型稳健性提升通常伴随着成本与波动性的权衡;设定合适的参数能兼顾经济性与稳定性。

综上,本研究提出的Dueling-Double DQN最优算法能够解决生鲜农产品无人机配送路径规划因不确定需求导致总成本高昂的问题,对提升配送效率、降低系统成本具有积极意义。

参考文献

[1]

马昌喜, 薛凡松, 麻存瑞, 李海军. 时变路网下基于混合调整策略的生鲜品配送路径优化研究[J]. 交通运输系统工程与信息202323(4): 298-306

[2]

Ma C XXue F SMa C RLi H J. Route optimization of fresh food distribution under time-varying network and hybrid adjustment strategy[J]. Journal of Transportation Systems Engineering and Information Technology202323(4): 298-306 (in Chinese)

[3]

李军涛, 刘明月, 刘朋飞. 生鲜农产品多车型冷链物流车辆路径优化[J]. 中国农业大学学报202126(7): 115-123

[4]

Li J TLiu M YLiu P F. Route optimization of multi-vehicle cold chain logistics for fresh agricultural products[J]. Journal of China Agricultural University202126(7): 115-123 (in Chinese)

[5]

张济风, 杨中华. 时变路网环境下多温冷链配送路径优化研究[J]. 重庆师范大学学报:自然科学版202037(1): 119-126

[6]

Zhang J FYang Z H. Research on distribution path optimization of multi-temperature cold chain in time-varying road network environment [J]. Journal of Chongqing Normal University: Natural Science202037(1): 119-126 (in Chinese)

[7]

陈进朝, 王洋, 张营, 尤涛, 卢岩涛, 杜承烈. 基于时空密度聚类的异构无人机集群覆盖路径规划方法[J]. 电子学报202553(3): 705-715

[8]

Chen J CWang YZhang YYou TLu Y TDu C L. Coverage path planning for heterogeneous UAVs based on temporal-spatial density clustering[J]. Acta Electronica Sinica202553(3): 705-715 (in Chinese)

[9]

Wang X DLiu Z YLi X P. Optimal delivery route planning for a fleet of heterogeneous dronesA rescheduling-based genetic algorithm approach [J]. Computers & Industrial Engineering2023179: 109179

[10]

Han H GZhang Y BHuang Y T. Collision-free motion-constrained path planning for multiple unmanned delivery vehicles based on heuristic deep reinforcement learning [J]. Neurocomputing2025648: 130586

[11]

蔡文广, 刘佳旭, 张小欣. 基于概率路由的出租车共乘调度算法[J]. 计算机应用研究202441(2): 432-437

[12]

Cai W GLiu J XZhang X X. Algorithm for taxi ride-sharing scheduling based on probabilistic routing[J]. Application Research of Computers202441(2): 432-437 (in Chinese)

[13]

李阳, 范厚明, 张晓楠, 杨翔. 随机需求车辆路径问题及混合变邻域分散搜索算法求解[J]. 控制理论与应用201734(12): 1594-1604

[14]

Li YFan H MZhang X NYang X. Two-phase variable neighborhood scatter search for the capacitated vehicle routing problem with stochastic demand[J]. Control Theory & Applications201734(12): 1594-1604 (in Chinese)

[15]

Reusken MLaporte GRohmer S U KCruijssen F. Vehicle routing with stochastic demandservice and waiting timesThe case of food bank collection problems [J]. European Journal of Operational Research2024317(1): 111-127

[16]

Cai HXu PTang XLin G. Solving the vehicle routing problem with stochastic travel cost using deep reinforcement learning[J]. Electronics202413(16): 3242

[17]

Zhou C HMa J XDouge LChew E PLee L H. Reinforcement Learning-based approach for dynamic vehicle routing problem with stochastic demand[J]. Computers & Industrial Engineering2023182: 109443

[18]

Shahryari EShayeghi HMohammadi-ivatloo BMoradzadeh M. A copula-based method to consider uncertainties for multi-objective energy management of microgrid in presence of demand response [J]. Energy2019175: 879-890

[19]

Wang Z YSchaul THessel MVan Hasselt HLanctot MDe Freitas N. Dueling network architectures for deep reinforcement learning[C]. In: Proceedings of the 33rd International Conference on Machine Learning. London: Google DeepMind, 2016(48): 1995-2003

[20]

Li J WMa Y NGao R ZCao Z GLim ASong WZhang J. Deep reinforcement learning for solving the heterogeneous capacitated vehicle routing problem[J]. IEEE Transactions on Cybernetics202252(12): 13572-13585

[21]

Van Hasselt HGuez ASilver D. Deep reinforcement learning with double Q-Learning[C]. In: Proceedings of the Thirtieth AAAI Conference on Artificial Intelligence. London: Google DeepMind, 2016: 2094-2100

[22]

Rui GAnton K. Distributionally robust stochastic optimization with wasserstein distance[J]. Mathematics of Operations Research202248(2): 603-655

[23]

Esfahani M PKuhn D. Data-driven distributionally robust optimization using the Wasserstein metricperformance guarantees and tractable reformulations [J]. Mathematical Programming2018171(1/2): 115-166

基金资助

国家自然科学基金项目(71501125)

AI Summary AI Mindmap
PDF (906KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/