残缺条件下基于生成式轨迹建模的鲁棒模仿学习方法研究

戴领 ,  陈文韬 ,  谭晓阳

南京大学学报(自然科学) ›› 2026, Vol. 62 ›› Issue (04) : 551 -561.

PDF (1121KB)
南京大学学报(自然科学) ›› 2026, Vol. 62 ›› Issue (04) : 551 -561. DOI: 10.13232/j.cnki.jnju.2026.04.004

残缺条件下基于生成式轨迹建模的鲁棒模仿学习方法研究

作者信息 +

Robust imitation learning via generative trajectory modeling from incomplete demonstrations

Author information +
文章历史 +
PDF (1147K)

摘要

高效利用残缺专家演示数据是当前模仿学习领域的重点之一,残缺的演示意味着局部细节的丢失,会导致误差累积.针对演示残缺的场景,提出一种基于生成式轨迹建模的鲁棒模仿学习方法.通过利用决策变换器在残缺演示条件下生成连续状态⁃动作序列补全轨迹,并通过设定目标分数控制生成轨迹的质量,将补全后的轨迹输入扩散模型进行轨迹生成.同时,引入新的评分机制,用于评价扩散模型生成的轨迹是否符合专家示范中的环境动力学约束.该模型能在良好地补全残缺轨迹的条件下,生成高奖励并符合动力学约束的轨迹,有效减少了误差累积并提高规划精度.实验表明,该方法优于现有的离线强化学习方法,能解决高维连续空间中的规划⁃现实不匹配问题,并拥有更好的鲁棒性和泛化能力.

Abstract

Efficiently leveraging imperfect expert demonstration data is one of the key challenges in the field of imitation learning. Imperfect demonstrations,which entail the loss of fine⁃grained local details,can lead to error accumulation. To address scenarios with incomplete demonstrations,we propose a robust imitation learning method based on generative trajectory modeling. Our approach utilizes a Decision Transformer to generate continuous state⁃action sequences conditioned on incomplete demonstrations,thereby completing the trajectories. The quality of these generated trajectories is controlled by setting a target return. The completed trajectories are then fed into a diffusion model for further trajectory generation. Additionally,we introduce a novel scoring mechanism to evaluate whether the trajectories generated by the diffusion model conform to the environmental dynamics constraints present in the expert demonstrations. This model can generate high⁃reward trajectories that adhere to the dynamics constraints while effectively completing imperfect trajectories,thereby significantly reducing error accumulation and improving planning accuracy. Experiments show that our method outperforms existing offline reinforcement learning approaches. It successfully addresses the planning⁃to⁃reality mismatch problem in high⁃dimensional continuous spaces and demonstrates superior robustness and generalization capabilities.

Graphical abstract

关键词

离线强化学习 / 模仿学习 / 扩散模型 / 轨迹补全

Key words

offline reinforcement learning / imitation learning / diffusion models / trajectory completion

引用本文

引用格式 ▾
戴领,陈文韬,谭晓阳. 残缺条件下基于生成式轨迹建模的鲁棒模仿学习方法研究[J]. 南京大学学报(自然科学), 2026, 62(04): 551-561 DOI:10.13232/j.cnki.jnju.2026.04.004

登录浏览全文

4963

注册一个新账户 忘记密码

模仿学习(Imitation Learning,IL)通过从专家示范中直接学习策略,在复杂决策任务中取得了显著进展.然而,大多数现有方法依赖完备且高质量的轨迹数据,但这一假设在真实场景中往往难以满足.由于感知误差、人为操作偏差或数据采集限制,专家轨迹常出现片段缺失或局部退化,破坏了轨迹分布的可建模性并导致策略性能显著下降1,因此,在残缺条件下恢复轨迹结构并进行有效决策成为提升模仿学习实用性的关键问题.
本文提出一种基于生成式轨迹建模的鲁棒模仿学习框架.首先利用决策变换器2(Decision Transformer,DT)在“前缀⁃目标”条件下对缺失片段进行生成式补全,从而恢复轨迹的时序一致性.在此基础上,引入扩散模型(Denoising Diffusion Probabilistic Models,DDPM)3-5进行轨迹级生成,并通过融合价值函数与专家评分网络的梯度引导,实现对生成过程的联合约束.
本文的主要贡献如下.
(1)针对现有模仿学习的方法普遍依赖完整专家轨迹的限制,将残缺示范条件下的学习问题统一建模为“部分观测条件下的轨迹后验推断问题”.在该框架下,轨迹补全、策略生成与规划优化被统一表述为条件生成过程,避免传统方法中对“补全阶段与规划阶段割裂建模”的问题.
(2)将决策变换器重构为目标条件的轨迹生成模型,通过引入“前缀⁃目标状态”约束将缺失轨迹片段建模为条件序列生成问题,实现对不完整示范的结构化补全.该过程仅依赖局部观测信息与目标状态,不依赖额外人工标注或完整专家轨迹,因而提升了在不完整数据场景下的可用性.
(3)在补全轨迹的基础上,基于扩散模型对轨迹分布进行建模,并在反向去噪过程中引入由奖励函数与专家一致性函数共同构成的引导信号,将轨迹生成过程解释为对“数据先验⁃任务最优性⁃专家行为先验”的后验采样.该设计实现了在生成过程中对轨迹质量的联合约束,从而支持“生成即规划”的决策范式.
(4)为了缓解固定权重引导在分布偏移场景下带来的不稳定问题,进一步建模专家一致性的概率分布及其不确定性,通过显式估计专家评分的置信度,对扩散过程中的专家引导强度进行自适应调整,在补全误差存在的情况下提升生成轨迹的鲁棒性与稳定性.

1 相关工作

现有的模仿学习及相关序列建模方法大多隐含依赖一个关键假设,即专家演示数据是完备且高质量的,这一假设在现实应用中往往难以成立6.专家轨迹普遍存在片段缺失、动作噪声以及质量不均等问题,会导致学习目标分布不明确,并进一步削弱模型的稳定性与泛化能力7.下面是为了解决上述问题从多方面做出的不同贡献.

Wang et al8的扩散净化模仿学习(Diffusion Purified Imitation Learning,DP⁃IL),使用扩散模型对次优演示进行“前向加噪⁃反向去噪”的两阶段净化,使数据分布回到接近最优的情况,有效缓解演示噪声问题,在多个控制任务中取得显著性能提升,但需依赖少量最优示范进行建模且计算开销较高.Wu et al9的2IWIL (Two⁃step Importance Weighting Imitation Learning)与IC⁃GAIL (Generative Adversarial Imitation Learning with Imperfect Demonstration and Confidence)两种方法,通过部分置信度标注进行模仿学习,即分别使用重要性加权和对抗学习机制从不完美数据中恢复最优策略,理论上提供了泛化误差界,但需要额外的置信度标注,限制了其实用性.Xu et al10的判别器加权行为克隆(Discriminator⁃Weighted Behavioral Cloning,DWBC),引入判别器来区分专家与非专家数据,并以最坏情况误差最小化为目标来提升策略鲁棒性,避免了复杂的对抗训练,具有较高效率,但仍依赖数据分布覆盖,难以应对严重分布偏移.

一方面,现有工作主要关注噪声抑制、样本加权或部分信息利用,较少从生成建模角度显式恢复缺失轨迹结构.另一方面,当前离线强化学习方法受限于其策略优化的短视性以及感知不确定性、动作执行不确定性、分布偏移等因素,智能体的控制过程极脆弱,难以在长时间内保持有效11.本文提出一种统一的生成式模仿学习框架,通过决策变换器在“前缀⁃目标”条件下补全缺失片段,并结合扩散模型进行轨迹生成与规划,同时引入价值函数与专家评分的联合引导及不确定性建模,实现对轨迹合理性与最优性的统一约束,在残缺示范条件下显著提升了策略性能与鲁棒性.图1展示了扩散模型进行轨迹去噪的过程.

2 预备知识

2.1 问题设定

一个马尔可夫决策过程(Markov Decision Process,MDP)问题,记为S,A,P,

r,γ,ρ0,其中,S表示状态空间,A表示动作空间,P表示状态转移概率矩阵,r表示奖励函数,γ为折扣因子,ρ0为初始状态分布.策略π:SA用于在与环境交互过程中进行决策,并生成轨迹τ=s0,a0,s1,a1,,sT,aT,该轨迹由专家策略πE生成,并诱导出分布pEτ.在标准的模仿学习中,假设可以访问一个专家示范数据集𝒟E=τii=1N,目标是学习一个策略πθas,使其匹配pEτ.

本研究放宽“完整示范”的常见假设,每条轨迹可能包含缺失片段τ=τpre,τmiss,τsuf,其中,τpre=s0,a0,,st表示观测到的前缀,τmiss=at,st+1,表示缺失的片段,τsuf从一个已知的目标状态st+1开始.将不完整数据集表示为𝒟˜=τpre,sgoal,学习目标变为轨迹补全τ^miss

pθτmissτpre,sgoal,这将模仿学习重新表述为一个在部分观测条件下的条件轨迹生成问题.

2.2 决策变换器

决策变换器2是一种将强化学习问题重构为序列建模问题的框架,其核心思想是利用自回归模型直接建模轨迹分布,避免传统强化学习中价值函数估计与策略优化的复杂过程12.在该框架下,一条轨迹被表示为状态、动作与回报的交替序列τ=R1,s1,a1,R2,s2,a2,,

RT,sT,aT,表示从时刻t开始的回报.

该表示方式将强化学习问题转化为标准的序列建模任务,使模型能够通过学习联合分布来隐式建模策略:

pθτ=t=1TpθatRt,st,a<t

式(1)表明,动作的生成依赖于历史状态、历史动作以及目标回报,从而实现对未来行为的条件控制.这种建模方式避免了传统方法中对价值函数或策略函数的显式学习,使决策问题可以直接通过监督学习目标进行优化.

在模型结构上,决策变换器采用带因果掩码的Transformer架构,对序列进行自回归建模.对于每个时间步,状态、动作和回报分别通过独立的嵌入函数映射到统一的特征空间13,并叠加时间步编码:

xt=EmbedRt+Embedst+Embedat+Embedt

该嵌入表示被送入Transformer14网络,通过自注意力机制捕捉长时序依赖关系.特别地,因果掩码保证模型在预测当前动作时仅依赖过去信息,从而满足决策过程的时序约束.

2.3 扩散概率模型

扩散概率模型15是一类基于逐步去噪过程的高容量生成模型,其核心思想是通过学习一个反向马尔可夫过程来恢复被逐步加噪破坏的数据分布.扩散模型定义了一个前向扩散过程qτiτi-1,通过在每一步向数据中注入高斯噪声,使原始数据分布逐渐退化为简单的先验分布.同时,学习一个反向去噪过程pθτi-1τi,从噪声中逐步恢复数据结构.在该框架下,数据的边缘分布可表示为:

pθτ0=pτNi=1Npθτi-1τidτ1:N

其中,τ0表示无噪声的真实轨迹,τN𝒩0,I为标准高斯先验.

式(2)表明,扩散模型通过对完整反向链式分布进行建模,将复杂的数据生成问题转化为一系列简单的条件分布建模问题.由于每一步的转移仅涉及局部去噪,模型能够稳定地学习高维数据分布.在实际建模中,反向过程通常被参数化为高斯分布:

pθτi-1τi=𝒩τi-1;μθτi,i,Σi

其中,μθ由神经网络预测,Σi为预定义或学习得到的协方差矩阵.

该参数化形式使模型的学习目标转化为对去噪均值或噪声项的回归问题,从而可以通过简单的均方误差损失进行优化.同时,由于高斯分布的可解析性,该过程在采样和推理阶段具有较高的计算效率.相对应地,前向扩散过程为高斯加噪过程15

qτiτi-1=𝒩τi;1-βiτi-1,βiI

其中βii=1N为预设的噪声调度参数.

2.4 基于推断视角的扩散轨迹优化

在离线强化学习背景下,本研究的目标是从静态数据集𝒟中学习最优轨迹分布.设数据集诱导的经验分布为P𝒟τ,则最优轨迹分布可通过如下优化问题刻画:

p^*τ=argmaxp^𝔼τp^τlgP𝒟τ+𝒥τ

其中,𝒥τ=t=0Trst,at表示轨迹的累积回报.

上述优化目标同时约束轨迹的数据一致性和奖励最优性,在保证轨迹可行性的同时实现策略优化.为了从概率推断角度解释该优化目标,采用控制即推断的标准建模方式,引入最优性变量Ot,将奖励最大化问题重写为条件后验推断问题16.这一形式可以进一步从概率推断的角度进行重写.引入一个二值隐变量Ot表示时间步t的“最优性”,并定义:

pOt=1st,at=exprst,at

在此基础上,整条轨迹满足最优性的概率可表示为:

pO0:T=1τ=t=0Texprst,at=exp𝒥τ

因此,最优轨迹分布可以表示为条件分布:

p^*τ=pτO0:T=1pτpO0:T=1τ

式(8)表明,最优轨迹分布可被解释为先验轨迹分布pτ与最优性似然pO0:T=1τ的乘积.这一形式将强化学习问题转化为一个条件生成问题,即在“轨迹最优”的条件下对轨迹进行采样.

该条件采样问题通过扩散模型实现5.扩散模型先学习无条件轨迹分布pθτ,作为先验分布pτ的近似.在反向扩散过程中,通过引入最优性约束对生成过程进行引导.当pO0:T=1τ在轨迹空间中足够平滑时,其对数梯度可以用于修正反向扩散的均值更新,得到如下近似转移15

pτi-1τi,O0:T𝒩τi-1;μ+Στ𝒥μ,Σ

其中,μ,Σ为原始反向扩散过程pθτi-1τi的参数.该更新形式表明,扩散模型在每一步去噪过程中恢复数据分布结构,同时通过奖励梯度τ𝒥将轨迹引导至高回报区域,实现“生成即规划”.

3 基于生成式轨迹建模的鲁棒模仿学习

3.1 系统模型

本文提出的基于生成式轨迹建模的鲁棒模仿学习方法不同于传统模仿学习依赖完备示范数据的设定,是在轨迹存在缺失片段的条件下,统一实现轨迹补全、分布建模与决策优化.为此,从概率生成与推断的角度出发,将问题建模为一个分阶段但统一的条件轨迹生成过程.

对于给定的不完整轨迹τpre,sgoal,目标是恢复缺失片段τmiss并进一步生成满足环境动力学约束且具有高回报的完整轨迹τ.这一过程可形式化为如下的两阶段建模问题:

τmisspθ1τmissτpre,sgoal,τpθ2ττ^

其中τ^=τpre,τmiss,τsuf表示补全后的轨迹.前一阶段关注在条件约束下恢复轨迹的时序一致性,后一阶段在此基础上对轨迹分布进行建模.

该方法的工作过程如下:(1)利用决策变换器在条件序列建模框架下对缺失轨迹片段进行生成式补全,恢复轨迹的时序结构;(2)基于扩散模型对完整轨迹分布进行建模,并在反向去噪过程中引入引导项,实现对生成轨迹的优化;(3)设计专家模仿函数,对轨迹的专家一致性进行建模,并以不确定性感知的方式参与扩散引导,从而在数据一致性与策略最优性之间实现平衡.上述过程可被解释为对最优轨迹后验分布的近似采样:

p*τpθτexpJτpϕy=1τ

其中,pθτ表示由扩散模型学习的轨迹先验分布,Jτ为累积奖励函数,pϕy=1τ刻画轨迹与专家行为的一致性.该表达式表明,我们的方法本质上是在生成过程中联合融合“数据先验⁃奖励最优性⁃专家先验”三类信息,从而实现对轨迹空间的结构化搜索.模型框架如图2所示.

图2 基于生成式轨迹建模的鲁棒模仿学习框架

Fig.2 Robust imitation learning framework via generative trajectory modeling

3.2 将决策变换器用于轨迹补全任务

在残缺示范条件下,轨迹中间片段的缺失破坏了原有的时序结构,使传统的基于完整轨迹分布建模的方法难以直接应用.为此,首先将轨迹补全问题转化为一个条件序列生成问题,并基于决策变换器实现对缺失片段的生成式恢复.

为了适应轨迹补全任务,将决策变换器重构为一个目标条件的序列生成器.对于每个训练样本,从完整轨迹中随机截取一段作为缺失区间,并构造如下输入:

τpre=st-K+1,at-K+1,,st,sgoal=st',R^

其中,τpre为前缀上下文,sgoal为目标状态,R^为可选的目标回报.相应地,模型学习如下条件分布:

pθat:t'st-K+1:t,sgoal,R^

与原始决策变换器相比,该方式有两个差异:(1)将未来的目标状态显式引入作为条件变量;(2)仅对缺失区间进行生成,而非整条轨迹.

模型采用标准自回归监督学习目标,对缺失区间的动作进行预测:action=𝔼at-a^t2.并可选引入状态预测损失以增强动力学一致性:state=𝔼st+1-s^t+12.最终损失为加权组合:=αaction+βstate.

在推理阶段,模型以“前缀+目标”为条件,自回归生成缺失动作序列,并通过环境或动力学模型获得对应状态:atpθatcontext,sgoal.该过程逐步扩展轨迹,直至到达目标状态或填满缺失区间.算法1展示了使用决策变换器补全缺失轨迹的过程.

算法1

基于目标条件的轨迹补全方法

输入:模型M,目标状态sgoal,前缀轨迹Spre,Apre,最大生成长度L

1.根据前缀初始化上下文𝒞s,𝒞a,τ^

2.for l=1,,L do

3.alMsgoal,𝒞s,𝒞a

4.sl+1Envsl,al

5.τ^τ^al,sl+1

6.更新 𝒞s,𝒞a

7.若sl+1-sgoal<ϵ,则终止循环

8.end for

9.返回τ^

3.3 引入专家模仿函数的扩散规划机制

2.4已将轨迹生成与规划问题统一为基于扩散模型的条件采样过程,即通过对轨迹先验分布pθτ进行引导.本节进一步关注一个关键问题,在轨迹存在补全误差及数据分布偏移的情况下,即在扩散生成过程中引入额外约束,使生成轨迹既满足任务目标,又保持与专家行为的一致性.

扩散规划可被视为从p˜τpθτhτ这一分布中进行采样,其中,pθτ为扩散模型学习得到的轨迹先验;hτ为未归一化任务势函数(unnormalized potential),用于编码任务相关信息.在经典设置中,hτ通常与累计奖励相关,如hτ=expJτ,从而得到目标分布:

pτoptimalpθτ expJτ

然而,该建模隐含一个重要假设,即奖励函数能够充分刻画优质行为.但在实际问题中,这一假设往往难以成立,特别是在轨迹补全场景下,补全过程可能引入分布偏移,使得仅依赖奖励引导会产生偏离专家分布的轨迹.

为了弥补上述不足,引入专家模仿函数Eτ,用于刻画轨迹属于专家分布的程度.与奖励函数不同,Eτ直接作用于行为分布层面,可以理解为对如下概率的对数近似:Eτlgpexpertτ.这样,在不考虑已知轨迹片段约束时,加入专家模仿函数后的目标轨迹分布如式(15)所示:

ptarτpθτexpJτexpλEτ

其中,λ用于调节专家约束的强度.进一步地,上述形式可以重写为:

ptarτpθτptaskτpexpertτλ

这表明提出的方法实质上是在融合三种信息源:轨迹先验(数据分布)、任务目标(奖励)以及专家先验(行为分布).

在扩散模型中,对目标分布的采样通过修改反向过程实现.根据前文的推导,引导扩散可通过对反向均值进行梯度修正来实现.引入专家模仿函数后,扰动项变为:

lghτ=Jτ+λEτ

因此,其梯度为:

τlghτ=τJτ+λτEτ

将其代入反向扩散来更新公式,可得:

τi-1𝒩μθτi+ΣiτJτ+λτEτ,Σi

该更新规则表明,在每一步去噪过程中,轨迹不仅沿着数据分布的梯度方向恢复结构,还同时受到奖励梯度与专家梯度的共同引导.

在本文的问题设定中,轨迹并非完全自由生成,而是需要满足由决策变换器补全阶段提供的结构约束.也即,在已知轨迹片段τknown在生成过程中保持不变的情况下,得到条件分布:

pττknownpθττknownexpJτ+λEτ

3.4 专家函数设计

本文不直接拟合pexpertτ,而是通过条件高斯模型预测专家相似度标签y的均值与方差,并以μϕτ近似专家评分,以σϕ2τ表征其不确定性.将专家模仿函数建模为一个条件概率模型,用于刻画在给定轨迹τ的条件下,其专家一致性的概率分布,如式(21)所示:

pϕyτ=𝒩y;μϕτ,σϕ2τ

其中,y表示轨迹的专家相似度标签,μϕτ为相似度的预测均值,σϕ2τ刻画模型对该预测的不确定性.该建模方式具有两方面优势:(1)通过均值项刻画“是否像专家”;(2)通过方差项刻画“模型对该判断的置信程度”.

对于给定的训练数据集τk,ykk=1M,采用高斯负对数似然作为优化目标:

ϕ=1Mk=1Myk-μϕτk22σϕ2τk+12lgσϕ2τk

该损失函数会约束预测均值逼近真实标签,同时通过对lgσ2的惩罚抑制方差的无界增长,避免模型通过人为放大不确定性来降低误差项.

其中,专家相似度标签y的构造对模型性能具有关键影响,此处考虑两种设置.

(1)二元标签:专家轨迹记为y=1,非专家轨迹记为y=0.

(2)连续标签:根据轨迹与专家轨迹之间的距离或任务完成度定义y0,1的相似度分数.

在反向采样过程中,利用专家模仿函数提供的梯度对轨迹进行引导.比如,在第i步去噪过程中,给定当前轨迹估计μθτi,i,计算:

gE=τμϕτ|τ=μθτi,i

并以不确定性构造精度权重:

Λϕτ=1σϕ2τ+ϵ

最终,反向扩散的均值更新为:

μguided=μθτi,i+ΣiαVgV+αEΛϕgE

其中,gV=τJτ为奖励梯度,αV,αE为权重系数.表明奖励函数驱动轨迹向高回报区域演化,专家模仿函数驱动轨迹向专家分布靠近,不确定性项σϕ2会自适应调节专家引导强度.提出的方法等价于从如下后验分布进行采样:

ptarττknownpθττknownexpJτpϕy=1τ

其中,pθτ为数据驱动的轨迹先验,expJτ为任务最优性约束,pϕyτ为专家行为先验.

算法2描述了引入专家评分引导后的扩散规划过程.其中,对τi-1的约束操作指在每一步反向扩散过程中,对轨迹中已观测或已知的状态⁃动作片段进行强制替换,即保持这些位置与输入条件一致.

算法2

基于专家评分引导的扩散规划方法

输入:扩散模型μθ,专家评分函数Eϕ,方差估计σϕ2,引导系数αV,αE,协方差序列Σii=1N,扩散步数N,价值函数Jψ

1.观测当前状态s

2.初始化轨迹τN𝒩0,I,并对其施加状态s的条件约束

3.for i=N,,1 do

4.μμθτi

5.gEτEϕτ|τ=μ

6.gVτJψτ|τ=μ

7.Λ1σϕ2μ+ϵ

8.gαVgV+αEΛgE

9.τi-1𝒩μ+Σig,Σi

10.对τi-1 施加约束条件

11.end for

12.执行动作 aFirstActionτ0

4 实验评估

4.1 实验环境和数据集

为了评估方法的长时域规划和机器人控制能力,使用MuJoCo基准测试集在D4RL17平台上进行实验.如图3所示,实验覆盖HalfCheetah,Hopper与Walker2d三个MuJoCo环境,每个环境上分别选取Medium,Medium⁃Replay与Medium⁃Expert三种数据配置.其中,Medium数据集由处于在线训练过程中又没有完全收敛的Soft Actor⁃Critic (SAC)策略生成的一百万个样本组成,Medium⁃Replay数据集汇集了SAC在线训练过程中策略达到中等水平之前的回放缓冲区中的所有样本,Medium⁃Expert数据集是将专家策略和中等水平策略按相同比例混合收集得到.对于轨迹补全实验,主要采用动作与状态的均方误差作为评估指标;对于离线规划实验,采用D4RL标准化分数作为最终性能指标.每个实验均使用超过100个随机种子.

4.2 轨迹补全结果及分析

为了验证提出的目标条件轨迹补全机制的有效性,首先在hopper⁃medium⁃v2数据集上开展轨迹补全实验.从完整专家轨迹中随机截取一段连续片段作为缺失区间,保留缺失片段之前的局部前缀以及缺失片段结束后的目标状态作为条件输入.模型根据前缀状态序列与目标状态,自回归预测缺失区间内的动作与后继状态,从而恢复完整轨迹.

训练阶段采用随机掩码采样策略,即训练目标仍为=αaction+βstate,其中,α=1.0β=0.5.网络结构采用四层四头的Transformer,隐藏维度为128;优化器为AdamW,学习率为1×10-4,权重衰减系数为1×10-4.测试阶段从数据集中抽取1000个不同缺失长度的样本进行离线补全评估,分别计算补全动作序列与真实动作序列之间的动作均方误差以及补全状态序列与真实状态序列之间的状态均方误差,按不同残缺长度统计其变化趋势.

图4展示了模型动作与状态均方误差随残缺长度的变化,图中横坐标为残缺长度,纵坐标表示均方误差.由图可见,随着缺失区间长度的增大,整体保持在较小范围内波动,并呈轻微上升趋势.对全部样本统计可得,动作均方误差的整体平均值为0.1364,状态均方误差的整体平均值为0.1577.可见,动作误差与状态误差对残缺增大的敏感性并不完全一致.

4.3 扩散模型在 D4RL上的表现分析

使用D4RL17基准中的MuJoCo数据集来评估提出的方法.对于每个环境,使用D4RL提供的三种数据集(Medium⁃Expert,Medium和Medium⁃Replay),每个数据集包含一百万个样本.

在三种数据集上对提出的方法进行了全面评估,并将其与多种现有算法进行比较,包括无模型方法(CQL18,IQL19,DT2)、基于模型的方法(MOPO20)以及Diffuser5.性能指标采用归一化分数(Normalized Scores),其中得分超过100表示性能优于专家演示.实验结果如表1所示,表中黑体字表示性能最优.

在Medium⁃Expert组任务上,三项任务的平均得分达到104.88.说明在高质量示范较充分的条件下,提出的方法能够更有效地利用专家行为先验,将补全阶段恢复出的结构信息与扩散规划阶段的最优性引导结合.在Medium⁃Replay组任务上,本文方法的平均得分为75.06.这一结果表明,引入的专家引导与不确定性感知机制能够在一定程度上缓解由Replay数据分布混杂带来的规划偏差,使模型在复杂数据分布下仍然保持较强的策略筛选能力.

相比之下,本文方法在Medium组任务上的表现相对保守.三项任务的平均得分为48.16,明显低于其在Medium⁃Expert与Medium⁃Replay上的表现.说明当训练数据主要由中等质量行为构成又缺乏足够明确的高质量示范约束时,本文方法中的专家一致性引导难以充分发挥优势,甚至可能在一定程度上放大由补全误差或数据分布偏差带来的保守性.从方法机理上看,这与本文设计的核心目标是一致的,即该框架更强调在残缺示范与分布偏移条件下保持轨迹合理性与专家一致性,因此其优势主要体现在高质量示范存在或数据噪声较大时,而不是纯粹追求所有数据集上的统一最优.

4.4 消融实验

设计两个互补的消融实验.

(1)固定扩散模型、价值函数模型及其余规划超参数不变,仅在hopper⁃medium⁃expert⁃v2任务上改变专家引导系数αE,考察不同专家先验强度对规划性能的影响.

(2)在medium⁃expert⁃v2组的三类环境上,比较原始数据集和补全数据集下的最终性能差异.

图5展示了专家引导强度对规划结果的影响,图中横坐标表示αE,纵坐标为D4RL标准化分数.由图可见,专家引导强度对规划性能具有显著影响,但这种影响没有呈现简单的单调变化规律,而是表现出较强的非线性与敏感性.当αE=

0.1,0.2,0.3时,得分分别为103.51,109.02和107.23,说明在较弱至中等强度的专家引导下,模型能较稳定地获得较高回报.随着αE继续增大到0.8,性能达到最佳的115.74.主实验默认采用αE=1.0时,得分为111.95,略低于αE=0.8的最优结果.说明适度增强专家一致性约束确实能改善扩散采样方向,使生成轨迹更接近高质量专家行为,从而提升最终的决策表现.

实验结果表明,专家引导过强或与价值引导发生不良耦合时,也可能导致性能显著退化.当αE=0.40.5时,得分仅为54.24与82.23,和默认设置相比分别下降57.71和29.72,明显低于邻近取值.说明在本文方法中,专家梯度并非越强越好,其效果受到价值梯度方向、专家评分模型置信度以及采样过程中多步去噪动态的共同影响.

表2所示,在medium⁃expert⁃v2组的任务上,若使用完好的原始轨迹训练,本文方法在改用补全后的轨迹训练后,对应得分分别为105.49,85.14与103.52.由此可见,补全轨迹训练相较于完好轨迹训练,在HalfCheetah和Walker2d上性能下降,而在Hopper上反而提升,整体说明补全轨迹会带来一定性能波动.证明尽管DT补全阶段能较好地恢复缺失片段的时序结构,但其生成轨迹与真实专家轨迹之间仍有一定偏差,最终反映为规划性能的整体下降.

值得注意的是,这种性能下降虽然稳定存在,但没有达到灾难性退化的程度.以Hopper为例,使用补全轨迹训练后仍能取得105.49分,高于原始Diffuser在同一任务上的103.3分.说明决策变换器补全模型尽管不能完全恢复真实专家轨迹的全部动力学细节,却能保留足够多的决策相关结构信息,使其生成轨迹仍然可以作为扩散模型训练的有效替代数据.

5 结论

本文针对专家示范存在片段缺失时模仿学习性能易退化的问题,提出一种基于生成式轨迹建模的鲁棒模仿学习框架.从“补全⁃生成⁃规划”统一建模的视角出发,将残缺示范条件下的策略学习重构为一个条件轨迹生成与后验引导问题.首先,利用决策变换器在“前缀⁃目标”条件下对缺失轨迹片段进行生成式补全,以恢复轨迹的时序一致性;随后,基于扩散模型对完整轨迹分布进行建模,并在反向采样过程中联合引入奖励引导与专家模仿引导,从而同时提升轨迹的任务最优性与行为合理性.进一步地,通过显式建模专家评分的不确定性,实现对引导强度的自适应调节,增强方法在残缺示范与分布偏移场景下的稳定性与泛化能力.说明提出的方法能有效缓解由示范残缺引起的局部动力学信息缺失与长时域误差累积问题,生成兼具高回报、动力学一致性与专家相似性的轨迹,从而提高整体决策质量.

参考文献

[1]

张超,白文松,杜歆,. 模仿学习综述:传统与新进展. 中国图象图形学报,2023,28(6):1585-1607.

[2]

Chen L L, Lu K, Rajeswaran A,et al. Decision transformer:Reinforcement learning via sequence modeling∥Proceedings of the 35th International Conference on Neural Information Processing Systems. Red Hook,NY,USA:Curran Associates Inc,2021:15084-15097.

[3]

Ho J, Jain A, Abbeel P. Denoising diffusion probabilistic models. Advances in Neural Information Processing Systems,2020,33:6840-6851.

[4]

Croitoru F A, Hondru V, Ionescu R T,et al. Diffusion models in vision: A survey. IEEE Transactions on Pattern Analysis and Machine Intelligence,2023,45(9):10850-10869.

[5]

Janner M, Du Y L, Tenenbaum J B,et al. Planning with diffusion for flexible behavior synthesis∥Proceedings of the 39th International Conference on Machine Learning. New York,NY,USA:PMLR,2022:9902-9915.

[6]

Huang K, Scalise R, Winston C,et al. Using non⁃expert data to robustify imitation learning via offline reinforcement learning. https://arxiv.org/abs/2510.19495,2025-10-25.

[7]

Yu X R, Han B, Tsang I W. USN:A robust imitation learning method against diverse action noise. Journal of Artificial Intelligence Research,2024,79:1237-1280.

[8]

Wang Y K, Dong M J, Zhao Y K,et al. Imitation learning from purified demonstration. https://arxiv.org/abs/2310.07143,2024-08-06.

[9]

Wu Y H, Charoenphakdee N, Bao H,et al. Imitation learning from imperfect demonstration. https://arxiv.org/abs/1901.09387,2019-01-30.

[10]

Xu H R, Zhan X Y, Yin H L,et al. Discriminator⁃weighted offline imitation learning from suboptimal demonstrations. https://arxiv.org/abs/2207.10050,2022-07-20.

[11]

Jiang K, Yao J Y, Tan X Y,et al. Recovering from out⁃of⁃sample states via inverse dynamics in offline reinforcement learning. Advances in Neural Information Processing Systems,2023,36:38815-38826.

[12]

Levine S, Kumar A, Tucker G,et al. Offline reinforcement learning:Tutorial,review,and perspectives on open problems. https://arxiv.org/abs/2005.01643,2020-11-01.

[13]

Ba J L, Kiros J R, Hinton G E,et al. Layer normalization. https://arxiv.org/abs/1607.06450,2016-07-21.

[14]

Vaswani A, Shazeer N, Parmar N,et al. Attention is all you need∥Proceedings of the 31st International Conference on Neural Information Processing Systems.Red Hook,NY,USA:Curran Associates Inc.,2017:6000-6010.

[15]

Sohl⁃Dickstein J, Weiss E A, Maheswaranathan N,et al. Deep unsupervised learning using nonequilibrium thermodynamics. https://arxiv.org/abs/1503.03585,2015-11-18.

[16]

Levine S. Reinforcement learning and control as probabilistic inference:Tutorial and review. https://arxiv.org/abs/1805.00909,2018-05-20.

[17]

Fu J, Kumar A, Nachum O,et al. D4RL:Datasets for deep data⁃driven reinforcement learning. https://arxiv.org/abs/2004.07219,2021-02-06.

[18]

Kumar A, Zhou A, Tucker G,et al. Conservative Q⁃learning for offline reinforcement learning. https://arxiv.org/abs/2006.04779,2020-08-19.

[19]

Kostrikov I, Nair A, Levine S. Offline reinforcement learning with implicit Q⁃learning. https://arxiv.org/abs/2110.06169,2021-10-12.

[20]

Yu T H, Thomas G, Yu L T,et al. MOPO:Model⁃based offline policy optimization. https://arxiv.org/abs/2005.13239,2020-11-22.

基金资助

国家自然科学基金(62476128)

AI Summary AI Mindmap
PDF (1121KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/