端到端自动驾驶:从技术演进到未来挑战

计洁 ,  牛润新 ,  余彪 ,  张丁伟 ,  李碧春 ,  侯广宇 ,  张辉

吉林大学学报(工学版) ›› 2026, Vol. 56 ›› Issue (4) : 888 -912.

PDF (1866KB)
吉林大学学报(工学版) ›› 2026, Vol. 56 ›› Issue (4) : 888 -912. DOI: 10.13229/j.cnki.jdxbgxb.20250644
综述

端到端自动驾驶:从技术演进到未来挑战

作者信息 +

End-to-end autonomous driving: from technology evolution to future challenges

Author information +
文章历史 +
PDF (1910K)

摘要

系统性回顾了端到端自动驾驶的发展历程,全面探讨了从传统模块化架构向端到端架构演进过程中的典型模型与关键技术,并揭示了其技术演进中的因果关系。同时,详细阐述了大模型在端到端自动驾驶中的应用,介绍了相关训练数据集与评估准则,讨论了端到端自动驾驶面临的挑战,为研究人员提供了该技术发展的全面视角及未来研究方向。

Abstract

The evolution of end-to-end autonomous driving is systematically reviewed, tracing the progression from modular pipelines to fully end-to-end architectures. Representative models and core technologies at each developmental stage are analyzed, and the causal relationships underlying paradigm shifts are uncovered. In particular, the integration of large-scale models with autonomous driving systems is highlighted. In addition, a comprehensive overview of industrial applications and future prospects of autonomous driving is provided, along with a detailed classification and evaluation of relevant datasets and an exploration of future challenges in end-to-end autonomous driving. A holistic perspective on the current state of end-to-end autonomous driving and directions for future research is thereby offered to the research community.

Graphical abstract

关键词

计算机应用技术 / 自动驾驶 / 端到端 / 大模型 / 性能评估 / 现状与挑战

Key words

computer application technology / autonomous driving / end-to-end / large models / performance evaluation / state-of-the-art and challenges

引用本文

引用格式 ▾
计洁,牛润新,余彪,张丁伟,李碧春,侯广宇,张辉. 端到端自动驾驶:从技术演进到未来挑战[J]. 吉林大学学报(工学版), 2026, 56(4): 888-912 DOI:10.13229/j.cnki.jdxbgxb.20250644

登录浏览全文

4963

注册一个新账户 忘记密码

0 引 言

端到端自动驾驶(End-to-end autonomous driving, E2E AD),作为深度神经网络驱动的一体化解决方案,通过联合优化感知、预测、决策、规划与控制等核心任务,克服了传统模块化架构中由于模块独立优化而导致的信息损失及系统协同难题,这种方法近年来受到学术界与工业界的广泛关注。其核心优势在于减少模块间的依赖,实现全局性能的显著提升。但现阶段端到端方法仍然面临以下挑战:对大规模数据依赖、缺乏可解释性以及复杂动态场景下的适应性不足。

目前已有多篇英文综述系统总结了端到端自动驾驶的发展趋势、挑战与方法,例如,Chen等1从模仿学习和强化学习的视角系统梳理了端到端模型的发展脉络;Singh2研究了完全可微的端到端强化学习技术。Yang等3研究了大语言模型(Large language model, LLM)在AD中的使用情况,深入分析了各类别代表性方法及其相关数据集。Liu等4从多个角度对265个自动驾驶数据集进行综合评估。然而,当前综述往往偏向特定算法或局部技术视角,且中文领域的端到端自动驾驶综述相对匮乏,且现有研究多集中于单一模块讨论(如感知5或决策6),未能从整体架构演进的角度系统揭示端到端方法的技术驱动力与发展逻辑7。褚端峰等8对生成式人工智能在端到端方法中的应用进行了初步探讨,但工作往往缺乏对大型多模态模型在自动驾驶中的作用、不同范式之间的互补关系以及新型生成式模型的系统梳理。针对以上不足,本文从整体技术演化的视角出发,全面回顾端到端自动驾驶技术的发展历程,深入分析其各阶段的核心技术驱动力,并且在此基础上提出补充性视角,并以中文形式组织,亦有利于加快中文研究群体的信息获取。本文重点探讨了大模型在端到端方法中的应用潜力与发展方向,并系统总结其在感知、决策等关键任务中面临的技术挑战。本文贡献如下:

(1)提出演进式分类框架,系统回顾从传统模块化到显式端到端、隐式端到端再到大模型驱动的端到端技术演进,梳理各阶段的代表性方法、训练范式和工程实践,归纳出统一的分类与对比框架。

(2)首次全面梳理大模型在端到端自动驾驶中的应用:围绕XLM、VLA和世界模型三大技术路线,深入分析其架构设计、能力边界与典型实例,尤其关注新近涌现的视觉链式思维和动作世界模型等方法。

(3)整理并评估适用于端到端自动驾驶的主流数据集与相关评估准则,并且针对当前端到端自动驾驶的关键技术瓶颈,提出未来研究方向与挑战。

1 研究基础与趋势

图1所示,首先分析模块化向端到端过渡的阶段性演变,揭示大模型等关键技术及其对性能提升的影响;其次,回顾当前流行的数据集及其在大模型下的改进;接着,梳理工业界的最新进展,分析端到端技术在主要自动驾驶公司的应用实践,展示该技术从研究到实际落地的全貌;最后,针对端到端大模型的最新发展,进行深入讨论,并提出可能的研究方向和挑战,包括大模型与多模态数据融合、动态场景生成、终身学习等。通过整合领域内的最新研究成果和工业案例,本文提供了端到端自动驾驶技术的清晰技术全景,并指明了未来发展方向。

表1总结近些年相关综述文章的主要内容并与其他综述进行了比较。

2 从模块化到端到端技术演进

端到端方法是一种通过深度学习实现从输入到输出直接映射的策略,省略了传统方法中的中间步骤或人工设计的规则。随着深度学习技术的进步,衍生出多种介于模块化与完全端到端之间的中间形态。为了更清晰表述,本文将采用以下术语划分。

局部端到端:指仅在感知、规划或决策某一模块内实现端到端学习。

模块化端到端:指系统整体仍分模块设计,但使用统一的损失函数协同训练各模块,以提升全局一致性。

完全端到端:指使用单一深度模型从感知数据直接生成控制信号,不依赖中间模块接口。

2.1 模块化方法:优势与局限

模块化方法是传统自动驾驶系统的核心架构,其通过将驾驶任务分解为感知、预测、规划与控制等独立模块,并针对每个模块进行单独优化。这种方法因其层次化设计显著提升了系统的可开发性、可调试性和可维护性。

然而,模块化方法在处理复杂动态场景时存在显著局限:模块间信息传递的不一致性常导致全局性能的下降;同时,由于每个模块的优化目标各异,全局协同与优化变得尤为困难。相比之下,端到端方法通过深度学习技术实现从感知输入到决策输出的直接映射,避免了传统方法中多个模块间的割裂与不确定性累积问题,展现了更强的适应性和泛化性。

2.2 模块化端到端:模块化与端到端的结合

端到端方法是一种通过深度学习实现从输入到输出直接映射的策略,省略了传统方法中的中间步骤或人工设计的规则。随着深度学习技术的进步,模块化端到端方法逐渐兴起,成为模块化方法向端到端方法演进的中间阶段。

局部端到端方法通过在特定模块(如感知或决策)内实现端到端映射,从而在内部优化目标上实现一致性。例如,基于卷积神经网络(Convolutional neural network,CNN)的感知模块直接将原始传感器数据映射为目标检测结果,大大简化了手工特征提取的复杂性。

模块化端到端方法是局部端到端的进一步发展,其显著特点是通过统一的损失函数优化多个模块任务。然而,模块化端到端方法仅在模块内部实现了端到端优化,模块间仍然通过人工定义的接口进行通信,未能彻底解决模块化架构中因信息传递损耗而带来的性能瓶颈。例如,感知模块的误差可能会传递到后续的规划模块,导致整体系统性能受限。

2.3 完全端到端:大模型突破传统架构

模块化阶段的自动驾驶对于深度模型的开发和使用绝大多数体现于提取视觉特征的感知网络,将编码后的视觉特征作为决策模块的输入。

完全端到端方法采用深度学习技术,直接将传感器数据映射为驾驶控制信号,取消了传统架构中的中间表示和模块接口。在完全端到端的发展趋势中,伴随着大模型等新型建模范式的引入,端到端系统的语义理解能力显著提升。基于大模型的方法,能够统一感知、规划与控制任务,通过单一的优化目标实现性能最大化。但需要提醒的是,尽管现有代表性系统多采用大型模型结构,但其核心特征仍体现在从感知到控制的信息直通路径上,而非特定模型形式。本文着重介绍大模型对完全端到端架构发展的支持。

这一阶段从基于仅处理语言信息的LLM,逐步发展到基于可处理视觉语言等多模态的大模型(Multimodal large language model, MLLM),来生成粗指令辅助自动驾驶决策。随着多模态数据与动作编码的引入,可直接生成自动驾驶动作序列的视觉语言动作模型(Vision language action, VLA)成为新的范式,实现从感知到控制的真正端到端模型,如图2所示,输入内容从局部端到端的图片视频扩展到包含文本信息的大模型完全端到端,而基于VLA则在此基础上加入历史动作序列、实时动作反馈、物理交互数据等,构建更完整的物理世界表征。输出也从使用基于规则的控制器到预测离散轨迹序列的回归模型再到使用从纯噪声中逐步恢复轨迹的条件扩散模型。

相比模块化端到端方法,完全端到端方法进一步降低了人工设计接口的复杂性,但也引发了新的问题,如缺乏透明性和可诊断性,后文4.3节介绍目前可解释性的相关研究。

2.4 演进动力

模块化方法向端到端方法的转变受到多方面因素的推动:

(1)计算能力的提升:随着硬件(如GPU、TPU)的快速发展7,训练大规模深度学习模型的时间成本显著降低,为端到端方法提供了可行性。

(2)数据资源的积累:大量开放数据集的出现7,为端到端模型的训练提供了丰富多样的驾驶场景。

(3)通用大模型的突破:通过预训练后的多模态大语言模型给予端到端方法更多可能性,让更多源的数据类型能够更充分地融合发挥其价值。

2.5 发展趋势

模块化方法向端到端方法的演化呈现出由局部优化到全局协同的阶段性发展趋势。在早期阶段,局部端到端方法通过对专用模型的精细调节实现了感知、决策或规划等模块的独立端到端优化,提升了模块性能。然而,这种方法由于缺乏统一的全局优化目标,模块间的信息传递效率较低,难以实现整体性能的最大化。

模块化端到端方法可视为局部端到端方法的进一步发展,它通过引入统一的损失函数和跨模块的梯度传递机制,实现了系统性能的优化。

随着数据量和计算能力的进一步增强,单一模型的端到端方法逐渐成为可能。在这种架构下,感知、预测与决策任务将完全由单一模型处理,从而避免了传统端到端方法中信息传递的损失。这类方法通常也被称为隐式端到端方法,相较于上述的显式端到端方法,它们能够更精确地围绕最终任务目标进行训练,自动驾驶发展分类如表2所示。

3 专用精调模型赋能显式端到端自动驾驶技术

深度学习技术是端到端自动驾驶的核心驱动力,通过精调专用模型的显式端到端方法,连接感知、决策和控制模块,显著提升了系统的整体性能。相比传统模块化架构,这些模型通过减少模块间的信息孤立问题,实现了性能的大幅提升。在感知模块,特征提取方式已从依赖人工定义的特征15转变为基于CNN或注意力机制的自动特征学习;而在决策模块,规则驱动算法逐步被监督学习或强化学习所取代。在这一过程中,研究者们不仅推动了局部端到端方法的发展,还逐步实现了各模块间的有效协同,最终形成模块化端到端体系。本章将重点介绍从传统模块化架构到显式端到端方法的演进历程,聚焦于局部端到端方法的引入,以及进一步发展的模块化端到端体系。

3.1 局部端到端

3.1.1 感知端到端

自动驾驶车辆需要捕捉行人、汽车、障碍物等多种目标,并生成可供决策模块使用的高精度特征表示。近年来,环境感知在端到端自动驾驶系统中经历了从基于二维图像的CNN方法16,逐步向基于鸟瞰图(Bird's eyes view, BEV)空间的Transformer17结构1819演进,进而扩展到三维占用网格2021建模。早期方法多采用CNN结构从RGB图像中提取特征,实现目标检测或语义分割;随后,BEV感知方法兴起,通过稀疏或密集的查询机制将多视角图像信息融合为统一的空间表示,并引入时间线索与跨视角注意力机制,显著增强了模型对复杂动态场景的理解能力;近年来,3D占用网格成为研究热点,通过融合RGB图像和3D LiDAR数据建模周围环境的体素语义信息,提升了对遮挡和远距离区域的建模鲁棒性。

3.1.2 决策规划端到端

模块化规划方法通过层次化地实时匹配交通规则与环境信息,并推导出合理的驾驶行为22,在工业界得到广泛应用。然而,传统的基于规则的方法因规则的静态性和数量有限,难以应对复杂的交通场景。其“感知⁃决策”框架在规则制定过程中表现出系统片面性与功能局限性23。且设计成本高、需依赖大量计算资源和启发式函数,限制了自动驾驶系统的进一步发展。为克服这些限制,基于深度学习的决策规划方法应运而生,其中强化学习(Reinforcement learning, RL)和模仿学习(Imitation learning, IL)作为两大主流技术,正逐步取代传统的规则驱动方法,展现出更强的适应性和灵活性。

(1)基于深度学习的决策

决策作为规划层的上一层,主要技术包括DQN24、策略梯度法,以及层级强化学习等。许多研究建立在DQN及其变体的基础上25。Wolf等26提出了一种基于紧凑语义状态表示的深度强化学习方法,用于自动驾驶中的行为生成。Wang等27提出使用增强对抗逆向强化学习在高速公路上学习类似人类的决策,其中行动空间由横向和纵向决策的所有可能组合组成。

(2)基于深度学习的规划

规划层任务集中在预测未来的轨迹或路径。近年来,深度神经网络被广泛用于直接从感知数据和高层决策信息中生成驾驶轨迹。Sun等28通过Sampled-DAgger训练网络,以模仿传统的模型预测控制(Model predictive control, MPC)规划方法。Wulfmeier等29提出将LiDAR点云投影到网格地图并输入神经网络,实现更精准的轨迹预测。

(3)决策规划一体化

深度学习模型通过统一的优化目标,从环境感知到控制信号直接生成驾驶动作30,减少了模块化方法中的信息传递损耗,使得决策和规划之间的界限逐渐模糊。一些研究还采用分层网络设计31,如引入特权代理32这种结合IL与RL的方法。它通过教师网络传授高层次知识,提高学生网络在动态场景中的性能33,这种方案灵感来源于策略蒸馏34或特征层面进行知识提炼。例如,FM-Net35和SAM36通过特征蒸馏优化模型性能,增强模型在跨场景中的泛化能力;Roach37通过RL训练了一个更强的特权专家,消除了行为克隆方法的上界;DriveAdapter38则学习了一个感知学生和适配器网络,通过特征对齐目标进行优化。

基于深度学习的决策规划方法汇总见表3

3.2 模块化端到端

上述发展阶段仅在感知或决策模块中实现了局部端到端,且模型模块之间的接口仍然基于人类的理解进行定义(例如,障碍物位置、道路边界等);各模块之间并不一定采用联合训练策略。

模块化端到端方法结合了模块化系统的可解释性与端到端优化的高效性,通过统一的损失函数和跨模块的梯度传递机制,实现感知、决策与规划模块的协同优化。这种方法有效缓解了传统模块化架构中因模块接口不匹配而导致的信息损耗问题,同时避免了完全端到端方法的“黑箱”特性。

下面详细介绍这一范式的具体内容,首先介绍了模块化端到端方法中应用的主要技术,然后概述了当前流行的模块化端到端经典研究论文。

3.2.1 模块化端到端关键技术

(1)注意力查询机制

在当前主流的端到端自动驾驶研究中,Transformer结构凭借其灵活的注意力机制,在多模态融合任务中展现出强大的建模能力。相比早期使用RNN、CNN结构的尝试,其在性能与表示能力上的提升推动了模型设计的进一步演化。随着Transformer结构的注意力机制的广泛应用,查询向量(Query Vector)VQ 常被用于建立各个模块之间的联系,以“查询”的形式输入到注意力模块,与键向量(Key Vector)VK 和值向量(Value Vector)VV 进行计算。通过计算VQVK 之间的相似度,注意力机制生成权重,进而决定每个VV 的影响力。该机制使得模型能够根据查询内容,对输入特征进行加权组合,输出结果即为满足查询需求的响应信息。

在自动驾驶系统中,运动预测模块通过这种机制利用代理查询向量与环境特征及其他代理信息的匹配,最终生成针对特定车辆的轨迹预测。结合查询机制和注意力机制,不仅增强了模型的响应精度,且提升系统在复杂场景下的适应性和处理效率。基于目标车辆(Target agent)的历史状态Ht、环境特征M及其他代理信息Hi,预测未来轨迹的条件概率分布为:

pYt|Ht,M,Hi=fencHt,M,Hi多源特征编码fdecz轨迹生成dz

式中:fenc为编码网络,通过注意力机制融合目标代理的查询向量Qt与环境、其他代理的特征;fdec为解码网络,生成未来轨迹YtRTf×2,包含Tf个时间步的位置坐标;z为隐变量,用于建模轨迹的不确定性。

(2)统一损失函数与跨模块梯度传递

模块化端到端方法的核心是通过统一的优化目标,使得各模块能够在统一的训练框架下协同工作。每个模块的梯度不仅取决于自身的损失函数,还受到后续模块梯度的影响,通常引入任务权重自适应调整或动态损失加权等策略,根据任务难度或训练过程中的动态变化调整权重,从而进一步提升系统性能。

(3)多任务学习

模块化端到端自动驾驶的发展起源于早期对视觉输入的直接处理,随后逐渐演变为结合多任务学习(Multi-task learning, MTL)、强化学习和概率建模的复杂系统。

使用相同的共享表示去完成不同的相关任务的MTL是模块化端到端发展中的重要前提。方法的优势在于降低计算成本、共享相关领域知识,并利用任务间的关系来提升模型的泛化能力。因此,MTL在端到端自动驾驶中得到了广泛应用。例如,在BEV感知中,BEV分割等任务被整合进聚集BEV空间特征的模型中45

3.2.2 模块化端到端经典模型

P346是模块化端到端自动驾驶系统发展的早期关键模型之一,通过生成语义占用图,将感知、预测与规划模块有机结合,显著减少了传统模块化方法中的误差传递问题;MP347进一步扩展了P3模型的功能,通过动态占用图预测,增强了复杂环境中的规划能力,并减少了对高精度地图的依赖;ST-P348首个基于纯视觉输入的P3系列模型,提出了时空特征学习方案,进一步提升了感知和预测模块的表现。

尽管P3系列在任务之间的交互上已有一定进展,但并未涉及目标检测和跟踪或轨迹预测任务,模块之间的联系仍较为有限。UniAD49在P3系列的基础上引入了更强大的多任务集成能力,通过Transformer架构实现感知、跟踪、占用图预测和运动预测的统一优化,它通过任务间的特征共享大幅提高了预测精度和系统鲁棒性。VAD50是一种基于概率规划的端到端自动驾驶模型。与UniAD使用栅格化表示不同,VAD采用神经网络等架构直接处理对象间的几何关系和拓扑结构。VADv251在VAD基础上引入了概率规划策略,以应对规划中的不确定性。SparseDrive52通过结构化稀疏感知模块与并行规划机制的结合,实现在任务分工明确的前提下对检测、跟踪、地图与轨迹预测的协同建模。

4 大模型赋能端到端自动驾驶

面对复杂多样的交通场景,传统模块化方法在泛化能力和多模态信息处理方面存在显著局限。尽管局部端到端方法和模块化端到端方法在一定程度上缓解了这些问题,但它们仍依赖于高质量的标注数据,特别是在稀有驾驶场景(Corner cases)中,模型的表现依然不足。

LLM的迅速发展,为自动驾驶技术提供了新的突破方向。相比传统技术,一方面,大模型通过增加模型的参数量,提升智能车的“脑容量”,能够大幅度提高智能车对复杂环境与跨任务的建模、理 解与推理能力;另一方面,通过“预训练+微调”的人工智能新范式,使得智能车具备强大的开放式推理能力和泛化能力,能够应用于小样本/零样本场景,帮助其快速适应未知环境。基于大模型的端到端自动驾驶技术能够有效利用海量的无标注数据,并通过生成式人工智能的能力,增强端到端系统的多模态感知和跨场景迁移能力,被认为是通向高等级自动驾驶(L4与L5)的关键技术。

本节将系统阐述大模型技术演进:先回顾其发展脉络与架构分类,再分析大模型对自动驾驶系统的赋能机制,进而展开端到端自动驾驶在新范式下的技术路线与横向比较,揭示面向闭环控制与安全落地的创新机遇。

4.1 大模型背景知识与主流架构

4.1.1 形 成

大型语言模型(Large language models, LLMs)作为参数量超过十亿级的深度神经网络,其核心特征体现在显著的规模效应(Scaling law)与涌现能力(Emergent ability)上。最新研究表明53,大模型的性能主要依赖于3个关键因素:参数规模、数据集大小以及训练计算量。研究还提出了缩放定律,即随着模型规模的扩展,其在下游任务中的表现呈指数级提升。

LLMs的发展历程中涌现出若干重要里程碑:GPT-454,是LLM发展的重要里程碑。一些开源LLM(如LLaMA55、Phi56)也在学术界和工业界引起广泛关注。多模态大模型,例如CLIP57和ALIGN58通过视觉感知和文本感知推理结合,对视觉感知具备强大能力,实现了跨模态信息处理和决策的整合。Qwen59、DeepSeek60等国产大模型对推动大模型自主可控与安全应用具有重要意义。

基于模态处理能力维度,当前主流大模型架构可划分为两类典型范式(见图3):①单模态语言模型:仅支持文本模态输入的编码器架构;②多模态大模型(MLLMs):通过创新的跨模态交互机制实现异构数据(如视觉、语音、文本等)的语义级融合。具体而言,MLLMs采用两种核心融合策略:token级别的跨模态投影(基于线性变换或非线性映射)或隐空间特征级融合(通过LLM内部的注意力机制实现)(对应图3中适配器模块的3种实现方式)。这种先进的架构设计使MLLMs展现出卓越的跨模态理解、推理与生成能力,特别适用于自动驾驶这类需要从多模态感知到端到端决策的复杂场景,展现出显著的技术优势。

4.1.2 关键技术

(1)预训练范式

根据预训练的目标函数的不同,预训练可以分为自编码和自回归两种形式。

自编码通过双向上下文重建学习数据表示,以Transformer编码器为核心,典型代表如BERT系列。目标函数如式(2)

px1,x2,,xT=t=1Tpxt|x1,x2,,xt-1

自回归通过序列条件概率最大化实现生成任务,以Transformer解码器为核心,采用掩码自注意力机制遮蔽未来信息,典型代表如GPT系列。目标函数如式(3)

LAE=X-Decoder Encoder X2

(2)训练优化技术

分布式并行训练可将训练数据划分为多个子集,分配到不同的计算节点(如GPU),或将模型拆分为多个子模块(如神经网络层或张量分块),分配到不同计算节点,通过流水线或张量并行协作完成计算。

模型压缩可通过知识蒸馏和量化进行。蒸馏即通过训练一个轻量化的学生模型模仿复杂教师模型的输出分布和知识,从而在保持性能的同时降低模型复杂度。其核心在于利用教师模型的“软标签”(概率分布)传递类别间相似性信息,而非仅依赖真实标签的“硬标签”。

量化通过降低模型参数的数值精度来压缩模型大小并加速推理,适用于资源受限的部署场景。

(3)主流架构

近年来,大模型的发展呈现出多样化与多模态融合的显著趋势,同时展现出明显的时间迸发特征。2018~2020年,语言模型框架(以GPT系列为代表)通过扩展参数规模和任务适应性,推动了生成式人工智能的快速普及。自2021年起,视觉语言模型(如CLIP和ALIGN)逐渐引领了跨模态研究,结合了文本与图像的信息处理能力。2022年,多模态模型进入突破期,Flamingo61和BLOOM62等框架实现了语言、视觉及多语言任务的整合。2023年,GPT-4等模型进一步将文本和图像输入结合,展现出通用人工智能的潜力。2025年,通过数据蒸馏技术降低大模型训练成本的DeepSeek-R1模型通过强化学习替代传统监督微调,实现推理能力的泛化。如何将这些大型模型应用于自动驾驶领域,尤其是在决策过程中发挥关键作用,已成为新的研究课题,图4总结了近几年主流大模型的名称和时间。

4.2 大模型在端到端自动驾驶领域的应用演进

早期研究表明,参数规模较小的语言模型(如BERT63和GPT)已经被证明可以用于从驾驶场景中收集大量数据有助于解决端到端自动驾驶的一些问题,如可解释性64,或通过文本描述强化模型对驾驶场景的理解。

随着数据驱动范式的快速发展,跨模态语言模型(XLM)为自动驾驶系统提供了前所未有的多模态环境理解与整合能力。在从以任务语义驱动为主的XLM过渡到以行为生成为核心的策略模型过程中,模型能力逐步从对语言指令的理解延展到对多模态条件下轨迹分布的生成建模。在这一过程中,生成动作的VLA模型尤其在可控轨迹建模、状态预测等任务中展现出强大潜力。相较于生成自然语言提示的XLM,VLA通过建模真实世界的数据分布,为复杂场景下的未来状态预测与控制策略生成提供了新的能力范式。这类模型不仅可以在轨迹生成任务中取得显著性能,也广泛用于建模潜在状态转移过程、完成观测补全与生成式推理等任务。

除轨迹生成和状态拟合外,当前端到端自动驾驶的大模型研究方向还深入于构建仿真环境、评估未来风险等需要抽象推理的任务,即“世界模型”(World models)概念。本节将沿着3条主要技术路线探讨这一演进:基于跨模态语言模型(XLM)的端到端自动驾驶、基于视觉⁃语言⁃动作(VLA)模型的端到端控制以及以环境预测为核心的世界模型,并在最后对这些方法进行比较,揭示未来研究的融合趋势。

图5展示了相关大模型在端到端自动驾驶领域的技术架构示意图。

4.2.1 基于XLM的端到端自动驾驶

LLM在自动驾驶中的应用原理是通过语言理解和推理能力模拟人类决策逻辑,将多模态感知数据转化为文本描述并生成控制指令。具体实现流程为:传感器数据(图像、点云、车辆状态等)通过规则引擎或轻量级视觉模块转化为结构化文本描述(如“左前方30 m有行人,右侧车道线为虚线”等),再与激光雷达坐标信息拼接为文本序列输入LLM,最终输出驾驶决策链并由人类反馈或传统规控模块执行。代表性工作包括: LanguageMPC64是一个基于LLM提示工程的框架,它使用LLM来推理和理解带有模型预测控制的高级信息,从而执行特定的驾驶动作。LC-LLM65专为车道变化预测设计。DriveCoT66开发了一个使用CARLA模拟器的端到端驾驶数据集。该数据集包含复杂的驾驶场景(如变道和高速驾驶),并结合了一个推理标签方案,为驾驶决策提供推理过程。LMDrive67采用闭环架构,融合多视角相机与LiDAR数据,通过冻结LLM实现语言引导的端到端控制,在CARLA仿真中验证可行性。

MLLM通过多模态联合建模实现场景语义理解和层级规划,结合图像、雷达、音频等特征提取与语言逻辑推理,增强系统对动态环境的解释能力。相较于LLM,MLLM能减少图像信息在文本序列化过程中的损失;相较于模块化感知规划,MLLM额外具备蕴含世界知识的决策思考模块。典型框架有CLIP、BLIP68等视觉语言两模态模型,其通过对比学习(Contrastive learning)实现跨模态语义对齐,其核心是最大化匹配图文对的相似度,最小化不匹配对的相似度,能够依赖有限的标注数据快速学习复杂特征。原理公式如下:

Limgtext=-1Ni=1NlogexpSiij=1NexpSij
Sij=viTujexpτ

式中:Sij为图像⁃文本对的余弦相似度矩阵;τ为温度系数;viTujRN×N,为图像和文本的L2归一化嵌入向量。

通过海量预训练知识,使用MLLM的特征编码器提取输入的图像特征,并与语言模型对齐,识别道路环境中的交通标志、行人、车辆等实体及其语义关系,辅助自动驾驶决策。PromptTrack69通过语言提示结合3D检测和跟踪任务,显著提升了感知性能。

另外,MLLM不仅具备对图像与文本的联合建模能力,也能够生成连续控制信号或未来轨迹,实现从感知到规划的全流程集成,已成为实现端到端自动驾驶的重要手段。例如,HiLM⁃D70将高分辨率信息整合到多模态大语言模型中,用于风险对象定位和意图预测任AIDE71,为自动数据引擎提供了新范例。DriveMLM72是一种在现实模拟器中执行闭环AD的基于MLLM的框架。

4.2.2 基于VLA的自动驾驶

(1)视觉语言动作模型

当前,XLM与人类智能之间的差距之一均在于XLM的输出是基于概率的,而人类则能通过观察和无监督交互学习物理世界的常识,判断合理与不可能,并通过少量的试验学习新技能,预测自身行为的后果。

VLA模型在2024~2025年间受到广泛关注,标志着从“感知-预测-控制”模块化体系向“看-想-做”一体化体系的转变。同时,接受视觉输入和语言指令,并直接输出连续控制信号,使其更接近人类驾驶员的思维过程,动作生成人工智能大模型的可以使机器具备类似于人类的举一反三能力,从数据驱动转为知识驱动,直接驱使机器动作73。相较于基于XLM直接生成控制指令的方法74,基于VLA的动作生成方法在输入层整合了时序动作序列信息,并在输出前引入基于物理知识的动作优化模块。这种设计使生成的控制指令既符合动力学约束,又保持物理合理性,从而有效缓解大模型在自动驾驶场景中常见的“幻觉”问题。

在结构上,VLA模型通常包括三部分75:视觉编码器用于提取场景图像的语义特征,语言模块解析任务描述或提示指令,随后通过融合机制将多模态信息送入策略网络生成控制动作。这种架构赋予系统更强的语义解释力与任务泛化能力。策略网络生成控制动作以图文条件为指导,通过去噪过程采样未来轨迹。这类方法在生成能力与多样性方面展现了较大的潜力。

然而,现有VLA系统大多使用离散文本作为链式推理的中介,容易产生跨模态语义错位或遗漏时空细节。为了克服这一问题,研究者开始探索动作生成和视觉链式推理相结合的模型。扩散模型通过前向扩散和反向去噪过程生成轨迹样本,已在轨迹规划、状态补全等任务中取得优异成绩。

(2)扩散模型

扩散模型76(Diffusion models, DM)借助条件输入(如文本描述或动作指令),可以生成符合特定需求的内容。扩散模型近年来在自动驾驶中的应用拓展了决策模型的表达方式77,除轨迹生成外,也被用于建模状态转移概率、补全缺失观测等复杂场景。

DM也是一种基于概率生成的方法,但与预测下一文本序列的大模型概率预测不同,其通过模拟物理扩散过程实现数据生成与重构。核心思想分为两个阶段:前向扩散与反向去噪。

前向扩散过程通过逐步添加高斯噪声,将原始数据(如图像、轨迹)逐渐破坏为随机噪声。

qτt|τt-1=Nτt;1-βtτt-1,βtI

式中:βt0,1为噪声强度,其中t1,2,,N表示扩散步骤;I为单位矩阵。

反向过程通过训练神经网络学习逐步去除噪声。

pθτt|τt-1=Nτt-1;μθτt,t,t
μθ=1tτt-βt1-t¯εθτt,t

式中:t=1-βtt为协方差矩阵。

在自动驾驶领域,扩散模型突破了传统规则方法对预定义逻辑的依赖。例如,Diffusion Planner78在NuPlan67数据集上通过联合建模自车与周车轨迹,生成平滑且符合驾驶偏好的路径。Diffusion Drive79截断扩散策略:通过K-means聚类生成锚点轨迹,仅对锚点添加少量噪声,大幅减少去噪步骤。

4.2.3 基于世界模型的端到端自动驾驶

世界模型80是一种基于生成式人工智能大模型的方法,是生成式大模型的一个重要应用方向,通过生成未来场景并与真实数据对比构建损失函数,实现无标注数据的监督学习。这种方法不仅能模拟复杂环境中的动态变化,还能用于评估潜在风险并改进规划策略。

世界模型的目标是通过预测未来的能力来理解环境,其应用包括视频生成、自动驾驶和自主智能体的发展等。生成式大模型在世界模型中发挥了重要作用,通过生成符合物理规律的动态数据,支持复杂环境的理解和预测。世界模型不仅在感知与环境建模方面起到了重要作用,还促进了规划与决策的进一步发展,以及多模态集成与安全规划的技术进步。其原理如下所示:

ht=Encxtst+1=Predht,st,zt,at

式中:xt为当前时刻的观测(如图像、传感器数据);st为隐状态,编码历史环境信息;at为智能体的动作提议(如机器人控制指令);zt为潜在变量,用于参数化可能的未来状态分布。

世界模型从感知与环境建模到规划与决策,再到多模态集成与安全规划的全面演化均可提供强大的技术支撑。

在环境感知与建模方面,早期的ChauffeurNet17通过数据增强技术生成Corner Cases,提升感知模型的鲁棒性;DriveGAN81利用GAN生成可控的驾驶场景,为感知模块提供了灵活的测试环境;GAIA-182进一步将场景生成从静态扩展到动态视频,结合Transformer和DM生成高保真驾驶视频,能够根据几秒钟的视频输入预测并生成后续的驾驶场景。需要注意的是,生成的未来驾驶场景与提示视频并无紧密联系,而是基于GAIA-1对世界规则的理解进行生成。World Models83首次提出通过潜在空间动态建模预测未来状态,为强化学习任务中的决策优化奠定了理论基础;Dreamer84引入RSSM模型,减少了对实际环境交互的需求,显著提升了复杂驾驶任务中的长期规划能力;基于此,Iso-Dream85通过潜在空间中状态分离建模,提升了对复杂场景的解释性和规划能力;ADriver-I86结合视频帧和历史视觉-动作对作为输入,利用MLLM和视频潜在扩散模型(VDM),实现了通过自回归方式输出控制信号,增强了预测与决策的可解释性。除场景生成之外,世界模型还有助于在驾驶环境中学习,评估潜在的未来,以及改进规划和控制策略。

4.2.4 不同技术路线的比较

为了更好地理解这3类技术路线的适用边界和互补性,以下从输入模态、输出形式、模型能力、优势与挑战等方面进行分析,以便理解它们的适用场景与协同潜力。

(1)输入模态与建模目标。XLM通过将视觉、点云等感知信息转换为文本序列,使得模型能够借助语言推理进行场景理解和高层决策;VLA则将接受图像、文本及任务指令直接输出连续控制动作,实现从感知到控制的一体化;世界模型以当前观察、历史状态及动作提议为输入,重点在于模拟环境的动态变化,为规划提供未来预测信息。

(2)输出形式与任务适用性。XLM主要输出跨模态语义标签或文本指令,适合用于语义解释和决策辅助;VLA能够生成符合动力学约束的控制信号或未来轨迹,适合用于闭环控制和任务引导;世界模型输出未来场景分布或潜在状态估计,主要用于环境建模、风险评估和仿真数据生成。

(3)优势与挑战。XLM在利用海量语料方面具备强大的知识推理能力,但其生成控制动作的能力有限;VLA实现了视觉、语言和动作的一体化,提供更强的可解释性和端到端能力,不过其对运动学约束的显式建模不足;世界模型能够预测环境演化并生成高保真场景,但难以直接生成动作,需要依赖额外策略模型完成决策。

(4)数据需求与计算复杂度。XLM依赖大规模图文对齐数据与语言标注,文本化过程可能损失部分视觉信息;VLA需要大量具有动作标签的多模态数据,训练成本高;世界模型需要对长时序场景进行建模,对算力和数据质量要求最高。近年来的研究通过多阶段预训练、稀疏提示工程以及知识蒸馏等方法缓解了训练成本,也证明了跨模型融合有助于降低数据需求。

(5)内在联系:在自动驾驶研究领域,XLM主要致力于解决多模态语义对齐问题,特别是在多语言交通标志识别等场景理解任务中表现出色,但其在动作决策生成方面存在明显局限性;VLA(Vision-Language-Action)模型基于多模态对齐框架,利用大规模语言模型的语义理解能力,实现了视觉感知与任务语义的统一表征,从而生成具有高度可解释性的驾驶行为;世界模型则专注于环境动态演化的建模,通过潜在状态空间的动力学预测未来场景演变,为策略学习提供前瞻性环境表征。

表4所示,这3种方法存在显著的互补性:在实际应用中,XLM可为VLA提供细粒度的语义理解基础,显著提升VLA在复杂城市场景中的表现;VLA既可以作为世界模型预测环境下的策略执行模块,也可以将世界模型整合为其内部的环境建模组件。值得注意的是,近期研究87提出了一种创新性的VLA-世界模型融合架构,展现了这两种范式结合的潜力。

4.3 自动驾驶决策可解释性

尽管端到端架构能够有效减少信息损耗与中间误差传播,但其高度整合的结构也带来了推理过程的不可解释性问题。该问题在近年来的大模型系统中尤为突出,尤其在处理语义场景理解与自然语言交互任务时,对行为可控性的要求更加苛刻被称作“黑箱”问题,即决策过程缺乏透明度,使模型的解释和验证变得困难。

为了解决这一问题,研究主要集中在基于注意力的权重方法、可解释中间表示任务、成本函数方法46以及自然语言解释方法64。其中,第2.3节中提到的模块化端到端方法,通过输出辅助任务或中间任务的指标,为最终决策提供依据,是可解释中间表示任务的一种。

近年来,随着大语言模型的发展,基于自然语言的交互成为研究热点。例如,Kim等88和Xu等89开发将驾驶视频或图像与描述和解释配对的数据集,并提出具有控制和解释输出的端到端模型。BEEF90将预测轨迹与感知特征结合,以评估决策的合理性,并通过可视化解释支持复杂驾驶场景中的判断。

5 端到端自动驾驶数据集与评估准则

5.1 端到端自动驾驶数据集

自动驾驶技术的快速发展依赖于高质量数据集,这些数据集为算法的训练、验证和评估提供了基础。随着多样化传感器的普及和任务复杂度的增加,数据集的质量、规模和覆盖场景成为关键问题。

目前数据集大多还是集中在某一模块的单一任务,端到端自动驾驶数据集存在一定缺失。引入专注于端到端任务的数据集对于推动自动驾驶发展至关重要。近年来,大模型在生成数据方面的能力可有效弥补数据不足问题,例如,生成式模型可以通过文本视频生成技术扩展自动驾驶数据集的多样性91,并进一步结合语言标签(如语言问答)以增强数据的表达能力和多模态信息支持。这些进展为未来端到端自动驾驶系统提供了新的研究方向。表5总结了端到端自动驾驶数据集。

5.2 性能评估

端到端自动驾驶系统的性能通常通过开环评估和闭环评估进行验证,前者专注于单一模块的离线表现,而后者则关注系统在动态交互环境中的综合能力。相关评估指标的总结见表6

5.2.1 开环评估

开环评估指在预录制的驾驶数据集上验证自动驾驶系统的表现,通常通过比对系统预测与人类驾驶员行为之间的差异来评估系统的准确性。该方法使用包含时序信息的录制数据集,这些数据记录了人类驾驶员在不同场景中的决策过程及对应的环境状态信息。然而,开环评估由于无需系统与环境实时交互,无法评估系统在动态环境中的闭环决策能力和长期规划稳定性,通常仅作为算法开发的初步验证工具。

常见的评估指标包括:均绝对误差(Mean absolute eror,MAE)、均方根误差(Root mean square error,RMSE)、平均位移误差(Average displacement error,ADE)、终点位移误差(Final displacement error, FDE)、和碰撞率(Collision rate,CR)等。

(1)平均精度(AP)

AP=maxPr'dr

式中:AP为目标检测的评价指标;Pr'为精确率⁃召回率曲线。

(2)平均交并比(mIoU)

mIoU=1Ni=1NIoUi,IoU=SS

式中:mIoU为语义分割的评价指标;IoU为交并比;S为交集面积为预测框和真实框的重叠部分;S为并集面积表示预测框和真实框的总面积。

(3)多目标跟踪准确率(mOTA)

mOTA=1-tFNt+FPt+IDSWttGTt

式中:mOTA为目标跟踪的评价指标;FNt为漏检数;FPt为误检数;IDSWt为身份切换数;GTt为真实目标数。

(4)均方根误差(RMSE)

RMSE=1ni=1ny^i-yi2

式中:RMSE是轨迹预测的评价指标,其中n为样本数;y^iyi分别为第i个样本的预测和真实值。

(5)平均位移误差(ADE)

ADE=1Tt=1T(xtpred-xtgt)2+(ytpred-ytgt)2

式中:xtpredytpredt时刻预测轨迹点的坐标;xtgtytgtt时刻真值轨迹点的坐标。

(6)终点位移误差(FDE)

FDE=PTpred-PTgt

式中:PTpred为最终时刻预测终点的坐标;PTgt为最终时刻真值终点的坐标。

(7)平均绝对误差(MAE)

MAE=12Tt=1T(xtpred-xtgt+ytpred-ytgt)

4.2.2 闭环评估

闭环评估要求系统在实时交互的动态环境中运行,通过模拟平台或实际测试环境验证其综合能力。与开环评估不同,闭环评估关注的是系统与环境之间的交互过程,能够评估系统在路径规划和运动控制等复杂任务中的实时决策能力。以CARLA为例介绍闭环评估的指标。

(1)路径完成率(Route completion, RC)

RC=DSDT

(2)违规得分(Infraction score, IS)

IS=违规行为×处罚系数

(3)驾驶得分(Driving score, DS

DS=RiPi

式中:DS为成功行驶的里程;DT为总行驶的里程;Ri为第条路的完成百分比;Pi为第i条路的违规得分。

6 工业界端到端自动驾驶进展

本节系统梳理了全球领先企业在端到端自动驾驶技术领域的最新研究进展与产业化实践,揭示了该技术在商业化落地过程中的关键突破与发展趋势,总结如表7所示。通过对代表性企业技术路线的深人分析,可以清晰地把握当前端到端自动驾驶技术的演进方向与产业布局。

近年来,端到端自动驾驶技术在工业界取得了显著进展,各企业基于不同技术路线展开了系统性探索。根据技术架构的差异,当前主流工业实践可归纳为3大类:①完全端到端架构;②模块化与端到端协同融合架构;③局部端到端策略(聚焦感知或决策单元)。本章将基于此分类框架,详细剖析各代表性企业的技术实现方案及其核心创新点。

6.1 完全端到端架构

6.1.1 特斯拉(Tesla)

特斯拉自动驾驶系统经历了从模块化架构到完全端到端闭环系统的技术演进。FSD v12采用纯视觉输入方案,创新性地融合占用网络(Occupancy networks)与大规模神经网络模型,实现了感知⁃决策⁃控制的全流程一体化建模。该系统依托百万量级车队构建的数据闭环体系与自动化标注能力,显著提升了模型迭代效率。2023年后,版本重点优化了动态障碍物预测性能,并于2025年推出针对中国道路场景的定制化模型,实现了不依赖高精地图的导航功能。

6.1.2 Waymo

Waymo自2009年启动自动驾驶项目以来,技术路线逐步从L2/L3过渡至L4级系统。其第五代自动驾驶平台整合了自研激光雷达系统与高性能计算单元,为城市复杂环境下的Robotaxi服务提供了可靠支持。该系统创新性地实现了端到端轨迹生成能力,通过多模态传感器数据融合与场景建模技术构建了完整的感知-控制闭环,并在实际运营中验证了系统的稳定性与可靠性。

6.1.3 Momenta

Momenta早期采用模块化技术架构,其中感知与规划分别基于深度学习与规则驱动实现,同时始终坚持数据驱动的技术路线,通过海量真实道路数据加速算法迭代。

2024年,Momenta推出基于UniAD大模型的端到端解决方案,该模型108通过统一的Transformer架构处理激光雷达点云、视觉图像及地图信息,直接输出控制指令。该系统具备多平台适配能力,依托大规模量产车辆采集的真实道路数据实现高效迭代,最终构建了完整的端到端实时闭环控制系统。

6.2 模块化与端到端融合架构

6.2.1 小鹏汽车

小鹏XPILOT系统采用模块化与端到端融合的创新架构:XNet负责感知任务(包括BEV特征提取、语义分割及占用建图),XPlanner基于Transformer实现轨迹规划,XBrain则作为语言推理模块处理指令理解与交通语义解析。这3个核心模块共同构成了感知-规控-体化框架,目前已成功应用于高速和城市NOA场景。系统还创新性地引入了联邦学习机制,提升了数据闭环能力。

6.2.2 华为

华为基于MDC计算平台构建了完整的自动驾驶系统,整合了多模态传感器(包括激光雷达、毫米波雷达及BEV网络等)实现环境感知。其决策模块采用概率驾驶策略(PDP)模型模拟人类驾驶行为,在复杂交互场景下表现出优异的决策能力。最新系统版本搭载192TOPS算力芯片109,并已在量产车型上实现规模化部署。

6.2.3 理想汽车

2024年,理想汽车发布的Li-AD Pro 2.0系统开创性地融合了端到端架构与视觉定位模型110,通过Transformer与自监督学习机制的结合,显著提升了城市场景下的驾驶决策精度。该系统采用双流感知路径设计实现冗余验证,增强了系统鲁棒性,并在无地图场景下展现出卓越的泛化能力。

6.2.4 百度

百度自2013年组建国内首个自动驾驶研发团队以来,持续引领技术创新。2018年推出国内首个L4级自动驾驶量产方案Apollo Pilot,近期又提出“双路协同”架构,将大模型能力引入端到端控制路径,同时保留模块化结构的稳定性优势。Apollo ADFM通过海量驾驶数据预训练构建基础模型111,支持多种传感器配置,具备从L2量产部署到L4 Robotaxi运营的全场景支持能力,成为端到端与传统系统融合的典范。

6.3 局部端到端方案

6.3.1 比亚迪

2025年,比亚迪在“天神之眼”系统中创新性地采用BEV+Transformer架构处理感知任务,并整合语义SLAM技术实现路径规划。该系统实现了端到端的感知-建图功能,同时保留了模块化的规划与控制处理方式。依托数百万辆数据回流车辆,其模型训练迭代效率显著提升,成功实现了端到端技术的成本优化与规模化应用。

6.3.2 英伟达

英伟达通过DRIVE平台提供完整的端到端开发工具链与高性能计算芯片支持,从Xavier到Thor平台,算力提升至2000 TOPS,为Transformer类模型的实时部署提供了算力保障。同时,基于Omniverse的高精度仿真平台为端到端模型训练提供了可靠支持,其技术方案已广泛应用于奔驰、沃尔沃、比亚迪等企业的自动驾驶系统。

7 未来挑战

7.1 高质量海量训练数据的稀缺性问题

受尺度定律(Scaling law)的约束,自动驾驶性能与训练数据规模呈幂率增长规律。高质量、多样化的海量场景数据,一方面可以通过海量的数据集有效支撑端到端自动驾驶模型训练;另一方面,更能通过涵盖极端工况的多样化场景,系统性降低“长尾”风险,提高模型的泛化性。当前自动驾驶车辆训练数据主要源于实车采集与仿真合成两种途径。实车采集数据存在场景覆盖性有限(边缘工况稀缺)、海量场景数据精准标注成本极高,难以满足高安全、高可靠自动驾驶智能测试的需求;仿真合成数据存在人工构建的高精度环境模型代价高昂、虚拟传感器数据与真实数据差距大、难以逼真模拟复杂多样化的动态交通流等问题。

研究路径:结合MLLM、3D高斯溅射112113以及世界模型等,通过对真实数据分布的学习,生成高保真、可控的虚拟场景,补充稀缺且危险的驾驶数据。扩散模型和生成对抗网络可以构建与真实分布一致的多模态场景并在仿真平台中复用,提高数据多样性和真实性。发展基于生成式AI的高可控、高保真自动驾驶场景生成方法,解决自动驾驶端到端模型学习所依赖的数据稀疏性问题。例如,DriveGAN114通过观看未标注的视频序列及其对应动作学习生成高质量、可控的驾驶场景,并允许重新模拟不同动作路径DrivingGaussian115利用复合3D高斯分布逐步重建静态背景和动态物体,实现对复杂场景的详细建模和全景一致的拟真视图合成。这些研究表明,通过生成式AI与世界模型结合,可有效扩充训练数据、模拟长尾场景,为端到端模型提供丰富、多样的训练样本。

7.2 大模型的安全性问题

端到端自动驾驶系统中,大模型在复杂场景下的决策可靠性面临严峻挑战。研究表明,当前模型在道路标线识别(如虚线、停止线)和障碍物定位等关键任务上仍存在显著误差,可能导致危险驾驶行为。更值得关注的是,端到端系统的"黑箱"特性使得其内部决策机制和决策逻辑难以被外部直观理解116。如何避免生成危险操作和对大模型进行可诊断性与可解释性是研究的重点。大模型的幻觉根源是模型训练数据覆盖不足,对复杂场景(如恶劣天气、无标识路口)的泛化能力弱,且缺乏实时环境反馈机制。而对于系统错误可能来源于输入感知噪声、内部特征表达不一致,或是输出阶段的错误分布映射,但这些问题在端到端框架中难以直接分离和修正。

研究路径:Mahawatta等117提出利用Self-CheckGPT对生成结果进行自我核查,该方法在驾驶数据集上检测并过滤3种主流多模态模型的幻觉,结果显示在白天场景下检测准确率更高。Fan等118提出HCOE-Net,通过交叉检索机制过滤实体并增强对关键对象的描述,显著提升视觉语言模型的F1评分并有效减少幻觉,通过数据清洗、去噪和多样性增强减少训练数据中的偏差与错误;此外,Wang等119提出的Hybrid‑Driving决策框架将大型语言模型与知识图谱及驾驶规则结合,通过构建场景演化知识图和规则过滤机制有效约束大模型的幻觉输出,决策成功率相比单独使用LLM提高37.5%。检索增强生成(Retrieval augmented generation, RAG)技术通过插入解释性模块以生成中间任务结果120121,或通过逆向传播追踪输入数据与输出之间的因果路径121,从而提升系统透明度,提高大模型的可解释性。

7.3 因果混淆

在模仿学习范式下,端到端自动驾驶系统通常采用专家演示数据进行监督训练。然而,现有研究表明可能导致模型学到仅限于训练数据分布的表面关联,而非对驾驶环境的本质因果理解。例如,模型可能错误地将道路标线宽度与减速行为关联,而忽略驾驶环境的真正上下文。因果混淆现象在训练数据与测试数据存在分布偏移(Distribution shift)时表现尤为显著。这种领域差异会严重影响模型在开放场景中的泛化能力,导致其无法做出符合安全要求的驾驶决策。

研究路径:为应对这一挑战,当前研究主要聚焦于构建因果感知的端到端学习框架,Li 等提出利用控制变量和反事实干预来验证规划决策所依赖的关键信息,量化分析各输入因素对模型决策的影响,并构建闭环仿真工具支持因果调试。另一方面,Ruan122提出顺序因果模仿学习,在存在未观测混杂因素的情况下,通过构建包含历史和潜在变量的因果图来屏蔽伪相关路径,并用对抗式模仿学习实现对真实策略的拟合。此外,Wang等123提出的框架利用因果推理提升轨迹预测的鲁棒性,通过分解空间与时间因素、构建因果图并使用反事实分析,有效识别并消除训练数据中的虚假关联,或采用因果图模型定义输入特征与输出行为之间的真实关联124

7.4 模型的鲁棒性与泛化性

鲁棒性和泛化性是评估端到端自动驾驶模型能否实现大规模商业化落地的关键指标。现有研究表明,当前模型在极端工况(如极端天气条件、高动态障碍物交互或多传感器失效场景)下的性能表现存在显著退化现象125。感知模块在传感器数据异常或缺失情况下可能产生偏差累积的环境表征,这种误差会通过级联传播影响后续决策模块的可靠性。此外,由于模型训练通常基于有限且静态分布的数据集,而真实驾驶环境具有显著的长尾分布特性,导致模型在开放场景下的泛化能力受限。

研究路径:Gao等126指出,基础模型正在通过学习广泛数据提高感知泛化能力,并强调模型应具备广义知识、空间理解、多传感器稳健性和时序推理等核心能力。未来研究可在贝叶斯神经网络框架下量化预测置信度,引入自监督和对抗训练提高对分布外数据的适应性,并通过多传感器融合与域随机化提升在极端条件下的鲁棒性127

7.5 模型的持续学习机制

自动驾驶系统需要具备在动态变化的交通环境和用户需求下持续进化的能力。然而,传统深度神经网络固有的灾难性遗忘问题严重制约了模型的终身学习性能。模型在新任务训练过程中的信息123,导致性能下降,模型逐渐丧失了学习新知识的能力,而只能保持现有的知识水平。

研究路径:研究记忆增强神经网络(Memory-augmented neural networks),通过构建外部记忆模块保存长期知识128;结合渐进式学习框架,使模型在训练新数据时保留关键旧知识,从而实现动态环境的适应。研究深度神经网路的学习算法,Dohare等129提出了一种持续反向传播(Continual backpropagation)的新算法:在训练过程中随机重新初始化小部分使用较少的神经元单元,从而为网络持续注入多样性来解决这一问题。

7.6 基础智驾模型的构建和车联网与协同驾驶

近年来,大规模预训练模型在自然语言处理和计算机视觉领域取得了突破性进展,这为自动驾驶领域的基础模型研究提供了重要启示。与此同时,单车智能的视野受限,难以感知遮挡区域;车联网(V2X)技术通过实现多智能体间的协同感知与决策,能够从根本上提升自动驾驶系统的安全性和运行效率130。然而,构建适用于复杂交通场景的基础模型仍面临诸多挑战。协同驾驶目前缺乏统一的消息格式和协议,也缺少同时涵盖感知与规划的合作数据集,未来需要研发带宽自适应的分布式感知与规划算法,建立标准化协同框架并与端到端学习深度融合。

研究路径:一方面,研究者致力于开发统一的多模态表征学习框架131,设计统一的表征空间整合图像、点云和其他传感器数据;并通过自监督学习减少对标注数据的依赖,从而降低数据成本。另一方面开发基于注意力机制的协同感知与预测模型,利用联邦学习(Federated Learning)框架实现分布式数据的高效利用132,探索去中心化的系统架构设计,通过降低对中心节点的依赖来提升系统的容错能力和鲁棒性。

8 结论与展望

本文全面探讨了快速发展的端到端自动驾驶领域。从传统的模块化方法到端到端学习的范式转换,展示了从人工定义的特征提取和复杂的模块化到数据驱动,再到因果驱动的端到端学习解决方案转变,讨论涵盖了各个范式方法的发展进程和代表模型,同时涉及它们的数据类型和学习策略以及评估准则数据集。通过分析当前的研究现状与技术实践,确定一些开放性挑战,如高质量海量训练数据的稀缺性问题、极端场景下的安全性和鲁棒性、迁移学习、可解释性、因果混淆、模型的轻量化、持续学习以及车辆的协同等,为相关领域研究人员和实践者提出了当前急需解决的关键问题。尽管如此,端到端自动驾驶距离大规模可靠部署仍存在若干关键瓶颈。首先,高质量、多样化且覆盖长尾场景的训练数据依然不足,尤其是在极端天气、罕见交通事件和跨域迁移场景下,数据稀缺问题直接制约模型性能上限。其次,端到端模型的可解释性与可诊断性仍然有限,黑箱特性使其在安全验证、责任界定和故障追踪方面面临明显挑战。再次,因果混淆、分布偏移和鲁棒性不足等问题尚未得到根本解决,模型往往容易学习到训练数据中的表面相关性,而非稳定的驾驶因果规律。除此之外,大模型引入后虽然增强了推理和泛化能力,但也带来了计算开销大、部署成本高、持续学习困难以及灾难性遗忘等新问题。上述问题已成为当前端到端自动驾驶研究中最核心的开放议题。

未来,端到端自动驾驶的研究可重点从以下几个方向持续推进:一是构建融合视觉、语言、动作与物理约束的统一模型,进一步提升系统对复杂交通语义和交互行为的建模能力;二是发展以世界模型和生成式建模为代表的无监督或弱监督学习范式,降低对人工标注的依赖,并增强系统对未来场景演化的预测能力;三是加强因果学习、不确定性估计与安全约束优化,使模型在开放环境中具备更强的可信决策能力;四是推进模型压缩、知识蒸馏与端侧部署优化,以满足车载平台对实时性、能耗与成本的要求;五是面向车路协同、群体智能与持续学习构建可扩展的智能驾驶系统,使端到端方法从“单车智能”逐步走向“系统智能”。总体而言,端到端自动驾驶正在由单一任务优化工具演变为面向复杂开放环境的统一智能体框架,其未来发展不仅依赖模型规模的扩展,更依赖数据、知识、因果、安全与工程部署之间的协同突破。

总体而言,端到端自动驾驶的发展正在经历由模块替代到系统重构、由监督学习到生成建模、由数据驱动到数据与知识协同驱动的深刻转变。随着多模态大模型、VLA、世界模型和生成式学习方法的持续发展,端到端自动驾驶有望形成兼具统一建模能力、环境理解能力和闭环控制能力的新型技术范式。如何在性能、安全、解释性与工程可部署性之间取得平衡,将是未来该领域实现持续突破的关键。

参考文献

[1]

Chen L, Wu P, Chitta K, et al. End‑to‑end autonomous driving: Challenges and frontiers[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024, 46(12): 10164-10183.

[2]

Singh A. End-to-end autonomous driving using deep learning: a systematic review[J/OL]. [2023-11-30].

[3]

Yang Z, Jia X, Li H, et al. LLM4Drive: a survey of large language models for autonomous driving[J/OL]. [2025-09-15].

[4]

Liu M, Yurtsever E, Fossaert J, et al. A survey on autonomous driving datasets: statistics, annotation quality, and a future outlook[J]. IEEE Transactions on Intelligent Vehicles, 2024, 9(3): 1024-1045.

[5]

黄德启, 黄海峰, 黄德意, . BEV感知学习在自动驾驶中的应用综述[J]. 计算机工程与应用, 2025, 61(2): 1-23.

[6]

Huang De-qi, Huang Hai-feng, Huang De-yi, et al. Survey on the application of BEV perception learning in autonomous driving[J]. Computer Engineering and Applications, 2025, 61(2): 1-23.

[7]

刘旖菲, 胡学敏, 陈国文, . 视觉感知的端到端自动驾驶运动规划综述[J]. 中国图象图形学报, 2021, 26(01): 49-66.

[8]

Liu Yi-fei, Hu Xue-min, Chen Guo-wen, et al. A survey on end-to-end autonomous driving motion planning based on visual perception[J]. Journal of Image and Graphics, 2021, 26(1): 49-66.

[9]

陈妍妍, 田大新, 林椿眄, . 端到端自动驾驶系统研究综述[J]. 中国图象图形学报, 2024, 29(11): 3216-3237.

[10]

Chen Yan-yan, Tian Da-xin, Lin Chun-mian, et al. Survey of end-to-end autonomous driving systems[J]. Journal of Image and Graphics, 2024, 29(11): 3216-3237.

[11]

褚端峰, 王如康, 王竞一, . 端到端自动驾驶的研究进展及挑战[J]. 中国公路学报, 2024, 37(10): 209-232.

[12]

Chu Duan-feng, Wang Ru-kang, Wang Jing-yi, et al. Research progress and challenges in end-to-end autonomous driving[J]. China Journal of Highway and Transport, 2024, 37(10): 209-232.

[13]

Gao H, Li Y, Long K, et al. A survey for foundation models in autonomous driving[J/OL]. [2024-02-02].

[14]

Tampuu A, Matiisen T, Semikin M, et al. A survey of end-to-end driving: architectures and training methods[J]. IEEE Transactions on Neural Networks and Learning Systems, 2020, 33(7): 1364-1384.

[15]

Teng S, Hu X, Deng P, et al. Motion planning for autonomous driving: the state of the art and future perspectives[J]. IEEE Transactions on Intelligent Vehicles, 2023, 8(6): 3692-3711.

[16]

Fourati S, Jaafar W, Baccar N, et al. XLM for autonomous driving systems: a comprehensive review[J/OL]. [2024-09-16].

[17]

Shi J, Chen J, Wang Y, et al. Motion forecasting for autonomous vehicles: a survey[C]∥Proceedings of the 2025 IEEE International Conference on Robotics and Automation (ICRA), Seattle, USA, 2025: 1-10.

[18]

Feng T, Wang W, Yang Y. A survey of world models for autonomous driving[J/OL]. [2025-06-19].

[19]

Dalal N, Triggs B. Histograms of oriented gradients for human detection[C]∥Proceedings of the 2005 IEEE Computer Society Conference on Computer Vision and Pattern Recognition(CVPR), San Diego, USA, 2005: 886-893.

[20]

Bansal M, Krizhevsky A, Ogale A S. ChauffeurNet: Learning to drive by imitating the best and synthesizing the worst[J/OL]. [2018-12-07].

[21]

Vaswani A, Shazeer N, Parmar N, et al. Attention is all you need[C]∥Proceedings of the 31st Conference on Neural Information Processing Systems(NeurIPS 2017), Long Beach, USA: NeurIPS Foundation, 2017: 5998-6008.

[22]

Zhou B, Krahenbuhl P. Cross-view transformers for real-time map-view semantic segmentation[C]∥Proceedings of the 2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR), New Orleans, USA: IEEE, 2022: 13750-13759.

[23]

Xu R, Tu Z, Xiang H, et al. CoBEVT: Cooperative bird's eye view semantic segmentation with sparse transformers[J/OL]. [2022-07-05].

[24]

Zhang Y, Zhu Z, Du D. OccFormer: Dual-path transformer for vision-based 3D semantic occupancy prediction[C]∥Proceedings of the 2023 IEEE/CVF International Conference on Computer Vision (ICCV), Paris, France, 2023: 9399-9409.

[25]

Wang X, Zhu Z, Xu W, et al. OpenOccupancy: A large scale benchmark for surrounding semantic occupancy perception[C]∥Proceedings of the 2023 IEEE/CVF International Conference on Computer Vision (ICCV), Paris, France, 2023: 17804-17813.

[26]

Fan H, Zhu F, Liu C, et al. Baidu Apollo EM motion planner[J/OL]. [2018-07-20].

[27]

王晓, 张翔宇, 周锐, . 基于平行测试的认知自动驾驶智能架构研究[J]. 自动化学报, 2024, 50(2): 356-371.

[28]

Wang Xiao, Zhang Xiang-yu, Zhou Rui, et al. Research on cognitive autonomous driving intelligent architecture based on parallel testing[J]. Acta Automatica Sinica, 2024, 50(2): 356-371.

[29]

Mnih V, Kavukcuoglu K, Silver D, et al. Human-level control through deep reinforcement learning[J]. Nature, 2015, 518(7540): 529-533.

[30]

Rezaee K, Yadmellat P, Nosrati M S, et al. Multi-lane cruising using hierarchical planning and reinforcement learning[C]∥Proceedings of the IEEE Intelligent Transportation Systems Conference(ITSC), Auckland, New Zealand, 2019: 1800-1806.

[31]

Wolf P, Kurzer K, Wingert T, et al. Adaptive behavior generation for autonomous driving using deep reinforcement learning with compact semantic states[C]∥Proceedings of the 2018 IEEE Intelligent Vehicles Symposium(IV), Changshu, China, 2018: 993-1000.

[32]

Wang P, Liu D, Chen J, et al. Human-like decision making for autonomous driving via adversarial inverse reinforcement learning[J/OL]. [2019-11-19].

[33]

Sun L, Peng C-T J, Zhan W, et al. A fast integrated planning and control framework for autonomous driving via imitation learning[J/OL]. [2017-07-09].

[34]

Wulfmeier M, Rao D, Wang D Z, et al. Large-scale cost function learning for path planning using deep inverse reinforcement learning[J]. The International Journal of Robotics Research, 2017, 36(10): 1073-1087.

[35]

Hausknecht M J, Stone P. Deep reinforcement learning in parameterized action space[J/OL]. [2015-11-13].

[36]

Chen J, Wang Z, Tomizuka M. Deep hierarchical reinforcement learning for autonomous driving with distinct behaviors[C]∥Proceedings of the 2018 IEEE Intelligent Vehicles Symposium (IV), Changshu, China: IEEE, 2018: 1239-1244.

[37]

Chen D, Zhou B, Koltun V, et al. Learning by cheating[J/OL]. [2019-12-27].

[38]

Chen D, Krähenbühl P. Learning from all vehicles[C]∥Proceedings of the 2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), New Orleans, USA: IEEE, 2022: 17201-17210.

[39]

Rusu A A, Colmenarejo S G, Gülçehre Ç, et al. Policy distillation[J/OL]. [2015-11-19].

[40]

Hou Y, Ma Z, Liu C, et al. Learning to steer by mimicking features from heterogeneous auxiliary networks[C]∥Proceedings of the 32nd AAAI Conference on Artificial Intelligence, New Orleans, USA, 2018: 1-9.

[41]

Zhao A, He T, Liang Y, et al. SAM: Squeeze-and-mimic networks for conditional visual driving policy learning[C]∥Proceedings of the 2019 Conference on Robot Learning, Osaka, Japan: PMLR, 2019: 1-10.

[42]

Zhang Z, Liniger A, Dai D, et al. End-to-end urban driving by imitating a reinforcement learning coach[C]∥Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), Montreal, Canada: IEEE, 2021: 15202-15212.

[43]

Jia X, Gao Y, Chen L, et al. DriveAdapter: Breaking the coupling barrier of perception and planning in end-to-end autonomous driving[C]∥Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), Paris, France, 2023: 7919-7929.

[44]

Sharifzadeh S, Chiotellis I, Triebel R, et al. Learning to drive using inverse reinforcement learning and deep Q-networks[J/OL].

[45]

Alizadeh A, Moghadam M, Bicer Y, et al. Automated lane change decision making using deep reinforcement learning in dynamic and uncertain highway environment[C]∥Proceedings of the IEEE Intelligent Transportation Systems Conference(ITSC), Auckland, New Zealand: IEEE, 2019: 1399-1404.

[46]

Zhang J, Huang Z, Ohn-Bar E. Coaching a teachable student[C]∥Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), Vancouver, Canada, 2023: 7805-7815.

[47]

Chen D, Koltun V, Krähenbühl P. Learning to drive from a world on rails[C]∥Proceedings of the 2021 IEEE/CVF International Conference on Computer Vision(ICCV), Montreal, Canada, 2021: 15570-15579.

[48]

Chen J, Yuan B, Tomizuka M. Deep imitation learning for autonomous driving in generic urban scenarios with enhanced safety[C]∥Proceedings of the 2019 IEEE/RSJ International Conference on Intelligent Robots and Systems(IROS), Macau, China, 2019: 2884-2890.

[49]

Ross S, Gordon G J, Bagnell J A. A reduction of imitation learning and structured prediction to no-regret online learning[C]∥Proceedings of the 13th International Conference on Artificial Intelligence and Statistics, Sardinia, Italy, 2010: 627-635.

[50]

Chitta K, Prakash A, Jaeger B, et al. TransFuser: Imitation with transformer-based sensor fusion for autonomous driving[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2022, 45(11): 12878-12895.

[51]

Sadat A, Casas S, Ren M, et al. Perceive, predict, and plan: Safe motion planning through interpretable semantic representations[J/OL].

[52]

Casas S, Sadat A, Urtasun R. MP3: A unified model to map, perceive, predict and plan[C]∥Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR), Nashville, USA: IEEE, 2021: 14398-14407.

[53]

Hu S, Chen L, Wu P, et al. ST-P3: End-to-end vision-based autonomous driving via spatial-temporal feature learning[C]∥Proceedings of the 2022 European Conference on Computer Vision(ECCV), Tel Aviv, Israel, 2022: 1-17.

[54]

Hu Y, Yang J, Chen L, et al. Planning-oriented autonomous driving[C]∥Proceedings of the 2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR), Vancouver, Canada, 2023: 17853-17862.

[55]

Jiang B, Chen S, Xu Q, et al. VAD: Vectorized scene representation for efficient autonomous driving[C]∥Proceedings of the 2023 IEEE/CVF International Conference on Computer Vision(ICCV), Paris, France, 2023: 8306-8316.

[56]

CHEN S Y, JIANG B, GAO H, et al. VADv2: End-to-end vectorized autonomous driving via probabilistic planning[J/OL].

[57]

SUN W C, LIN X W, SHI Y N, et al. SparseDrive: End-to-end autonomous driving via sparse scene representation[J/OL]. [2024-05-30].

[58]

Johnson-Roberson M, Barto C, Mehta R, et al. Driving in the matrix: Can virtual worlds replace human-generated annotations for real world tasks?[C]∥Proceedings of the IEEE International Conference on Robotics and Automation (ICRA), Singapore, 2017: 746-753.

[59]

Xu Z, Zhang Y, Xie E, et al. DriveGPT4: Interpretable end-to-end autonomous driving via large language model[J]. IEEE Robotics and Automation Letters, 2023, 9(9): 8186-8193.

[60]

Touvron H, Lavril T, Izacard G, et al. LLaMA: Open and efficient foundation language models[J/OL]. [2023-02-27].

[61]

Gunasekar S, Zhang Y, Aneja J, et al. Textbooks are all you need[J/OL]. [2023-06-20].

[62]

Radford A, Kim J W, Hallacy C, et al. Learning transferable visual models from natural language supervision[C]∥Proceedings of the 38th International Conference on Machine Learning(ICML 2021), Virtual Event: PMLR, 2021: 8748-8763.

[63]

Jia C, Yang Y, Xia Y, et al. Scaling up visual and vision-language representation learning with noisy text supervision[C]∥Proceedings of the 38th International Conference on Machine Learning(ICML 2021), Online, 2021: 4904-4916.

[64]

Bai J, Bai S, Chu Y, et al. Qwen Technical Report[J/OL]. [2023-09-28].

[65]

Deepseek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning[R]. Beijing: DeepSeek Inc., 2025.

[66]

Alayrac J-B, Donahue J, Luc P, et al. Flamingo: A visual language model for few-shot learning[J/OL]. [2022-04-29].

[67]

Scao T L, Fan A, Akiki C, et al. BLOOM: A 176B-parameter open-access multilingual language model[J/OL]. [2022-11-09].

[68]

Devlin J, Chang M-W, Lee K, et al. BERT: Pre-training of deep bidirectional transformers for language understanding[C]∥Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies(NAACL-HLT), Minneapolis, USA, 2019: 4171-4186.

[69]

Sha H, Mu Y, Jiang Y, et al. LanguageMPC: Large language models as decision makers for autonomous driving[J/OL]. [2023-10-04].

[70]

Peng M, Guo X, Chen X, et al. LC-LLM: Explainable lane-change intention and trajectory predictions with large language models[J/OL]. [2024-03-27].

[71]

Wang T, Xie E, Chu R, et al. DriveCoT: Integrating chain-of-thought reasoning with end-to-end driving[J/OL].

[72]

Caesar H, Kabzan J, Tan K S, et al. nuPlan: A closed-loop ML-based planning benchmark for autonomous vehicles[J/OL]. [2021-06-22].

[73]

Li J, Li D, Xiong C, et al. BLIP: bootstrapping language-image pre-training for unified vision-language understanding and generation[C]∥Proceedings of the 39th International Conference on Machine Learning (ICML 2022),Baltimore, USA, 2022: 12888-12900.

[74]

Wu D, Han W, Wang T, et al. Language prompt for autonomous driving[J/OL]. [2023-09-08].

[75]

Ding X, Han J, Xu H, et al. HiLM-D: Towards high-resolution understanding in multimodal large language models for autonomous driving[J/OL]. [2023-09-11].

[76]

Liang M, Su J-C, Schulter S, et al. AIDE: An automatic data engine for object detection in autonomous driving[C]∥Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), Seattle, USA, 2024: 14695-14706.

[77]

Wang W, Xie J, Hu C, et al. DriveMLM: Aligning multi-modal large language models with behavioral planning states for autonomous driving[J/OL]. [2023-12-14].

[78]

Kim M J, Pertsch K, Karamcheti S, et al. OpenVLA: an open-source vision-language-action model[R]. San Francisco: Stanford University, 2024.

[79]

Xing S, Qian C Y, Wang Y P, et al. OpenEMMA: open-source multimodal model for end-to-end autonomous driving[J/OL]. [2024-12-19].

[80]

Arai H, Miwa K, Sasaki K, et al. CoVLA: Comprehensive vision-language-action dataset for autonomous driving[J/OL]. [2024-08-19].

[81]

Sohl-Dickstein J N, Weiss E A, Maheswaranathan N, et al. Deep unsupervised learning using nonequilibrium thermodynamics[J/OL].

[82]

Wen J J, Zhu M J, Zhu Y C, et al. Diffusion-VLA: Generalizable and interpretable robot foundation model via self-generated reasoning[J/OL]. [2024-12-04].

[83]

Zheng Y, Liang R, Zheng K, et al. Diffusion-based planning for autonomous driving with flexible guidance[J]. [2025-01-26].

[84]

Liao B, Chen S, Yin H, et al. Diffusiondrive: truncated diffusion model for end-to-end autonomous driving[J]. [2024-11-22].

[85]

Dawid A, LeCun Y. Introduction to latent variable energy-based models: a path towards autonomous machine intelligence[J/OL]. [2023-06-05].

[86]

Kim S W, Philion J, Torralba A, et al. DriveGAN: towards a controllable high-quality neural simulation[C]∥Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR), Nashville, USA, 2021: 5816-5825.

[87]

Hu A, Russell L, Yeo H, et al. Gaia-1: a generative world model for autonomous driving[J/OL]. [2023-09-29].

[88]

Ha D, Schmidhuber J. Recurrent world models facilitate policy evolution[C]∥Proceedings of the 32nd Conference on Neural Information Processing Systems(NeurIPS 2018), Montreal, Canada, 2018: 1-10.

[89]

Hafner D, Lillicrap T, Ba J, et al. Dream to control: Learning behaviors by latent imagination[J/OL]. [2019-12-04].

[90]

Pan M, Zhu X, Wang Y, et al. Iso-Dream: Isolating and leveraging noncontrollable visual dynamics in world models[C]∥Proceedings of the 36th Conference on Neural Information Processing Systems (NeurIPS 2022), OrleansNew, USA, 2022: 1-12.

[91]

Jia F, Mao W, Liu Y, et al. Adriver-i: a general world model for autonomous driving[J/OL]. [2023-11-22].

[92]

Cen J, Yu C H, Yuan H J, et al. WorldVLA: Towards autoregressive action world model[J/OL]. [2023-11-22].

[93]

Kim J, Rohrbach A, Darrell T, et al. Textual explanations for self-driving vehicles[C]∥Proceedings of the 15th European Conference on Computer Vision (ECCV 2018), Munich, Germany, 2018: 577-593.

[94]

Xu Y, Yang X, Gong L, et al. Explainable object-induced action decision for autonomous vehicles[C]∥Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR), Seattle, USA, 2020: 9520-9529.

[95]

Ben-Younes H, Zablocki É, Pérez P, et al. Driving behavior explanation with multi-level fusion[J/OL]. [2020-12-09].

[96]

Brooks T, Peebles B, Holmes C, et al. Video generation models as world simulators[J/OL]. [2024-02-22].

[97]

Binas J, Neil D, Liu S-C, et al. DDD17: end-to-end DAVIS driving dataset[J/OL]. [2017-11-03].

[98]

Maddern W P, Pascoe G, Linegar C, et al. 1 year, 1000 km: the Oxford RobotCar dataset[J]. The International Journal of Robotics Research, 2017, 36(1): 15-31.

[99]

Dosovitskiy A, Ros G, Codevilla F, et al. CARLA: an open urban driving simulator[C]∥Proceedings of the 1st Conference on Robot Learning(CoRL 2017. ViewMountain, USA, 2017: 1-16.

[100]

Hecker S, Dai D, Gool L V. End-to-end learning of driving models with surround-view cameras and route planners[C]∥Proceedings of the 15th European Conference on Computer Vision(ECCV 2018), Munich, Germany, 2018: 435-453.

[101]

Ramanishka V, Chen Y-T, Misu T, et al. Toward driving scene understanding: a dataset for learning driver behavior and causal reasoning[C]∥Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR),Salt Lake City, USA, 2018: 7699-7707.

[102]

Sun P, Kretzschmar H, Dotiwalla X, et al. Scalability in perception for autonomous driving: Waymo Open dataset[C]∥Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR), Seattle, USA, 2020: 2443-2451.

[103]

Caesar H, Bankiti V, Lang A H, et al. nuScenes: a multimodal dataset for autonomous driving[C]∥Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR), Seattle, USA, 2020: 11618-11628.

[104]

Chen Y, Wang J, Li J, et al. LiDAR-Video driving dataset: Learning driving policies effectively[C]∥Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR), Salt Lake City, USA, 2018: 5870-5878.

[105]

Geyer J, Kassahun Y, Mahmudi M, et al. A2D2: Audi autonomous driving dataset[J/OL]. [2020-04-14].

[106]

Deruyttere T, Vandenhende S, Grujicic D, et al. Talk2Car: Taking control of your self-driving car[J/OL]. [2019-09-24].

[107]

Malla S, Choi C, Dwivedi I, et al. DRAMA: joint risk localization and captioning in driving[C]∥Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision(WACV), Waikoloa, USA, 2023: 1043-1052.

[108]

Sima C, Renz K, Chitta K, et al. DriveLM: Driving with graph visual question answering[J/OL]. [2023-12-21].

[109]

Qian T, Chen J, Zhuo L, et al. nuScenes-QA: a multi-modal visual question answering benchmark for autonomous driving scenario[J/OL]. [2023-05-24].

[110]

Fang J, Li L, Yang K, et al. Cognitive accident prediction in driving scenes: a multimodality benchmark[J/OL]. [2022-12-19].

[111]

Park S, Lee M, Kang J, et al. VLAAD: Vision and language assistant for autonomous driving[C]∥Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision Workshops (WACVW), Seattle, USA, 2024: 980-987.

[112]

Ni Z, Du S, Hou Z, et al. Para-Lane: Multi-lane dataset registering parallel scans for benchmarking novel view synthesis[R]. Beijing: Tsinghua University, 2025.

[113]

Momenta. Momenta announces new autonomous driving solution powered by NVIDIA DRIVE orin, commercializing urban NOA on scale[EB/OL]. [2024-04-26].

[114]

Huawei Technologies Co., Ltd. Striding towards the intelligent world: the journey to all intelligence 2024[EB/OL]. [2025-10-01].

[115]

Amara. Top stories of Li Auto in 2024[EB/OL]. [2025-02-03].

[116]

Gabriella. Baidu Apollo launches Apollo ADFM large model, sixth-gen unmanned Robotaxi at Apollo Day 2024[EB/OL]. [2024-05-15].

[117]

Zhao G, Ni C, Wang X, et al. DriveDreamer 4D: world models are effective data machines for 4D driving scene representation[J/OL]. [2024-03-04].

[118]

Xu T, Chen Z, Wu L, et al. Motion dreamer: boundary conditional motion reasoning for physically coherent video generation[J/OL]. [2023-11-25].

[119]

Kim S W, Philion J, Torralba A, et al. DriveGAN: towards a controllable high-quality neural simulation[C]∥Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, Online,2021: 1231-1240.

[120]

Zhou X, Lin Z, Shan X, et al. Driving Gaussian: composite gaussian splatting for surrounding dynamic autonomous driving scenes[J/OL]. [2024-03-15].

[121]

Zablocki É, Ben-Younes H, Pérez P, et al. Explainability of deep vision-based autonomous driving systems: Review and challenges[J]. International Journal of Computer Vision, 2021, 130(10): 2425-2452.

[122]

Mahawatta M A, Cabrero-Daniel B, Yu Y, et al. LLMs can check their own results to mitigate hallucinations in traffic understanding tasks[J/OL]. [2024-09-19].

[123]

Fan J, Wu J, Chu H,et al. Hallucination elimination and semantic enhancement framework for vision-language models in traffic scenarios[J/OL]. [2024-12-11].

[124]

Wang J, Wu Z, Dong Q, et al. Hybrid-Driving: an autonomous driving decision framework integrating large language models, knowledge graphs and driving rules[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2025, 39(1): 826-833.

[125]

Shao H, Wang L, Chen R, et al. Safety-enhanced autonomous driving using interpretable sensor fusion transformer[C]∥Proceedings of the Conference on Robot Learning(CoRL), Auckland, New Zealand, 2022.

[126]

Chitta K, Prakash A, Geiger A. NEAT: Neural attention fields for end-to-end autonomous driving[C]∥Proceedings of the IEEE/CVF International Conference on Computer Vision(ICCV), Montreal, Canada, 2021: 15773-15783.

[127]

Ruan K, Di X. Learning human driving behaviors with sequential causal imitation learning[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2022, 36(12): 4583-4590.

[128]

Wang B, Liao H, Wang C, et al. Beyond patterns: Harnessing causal logic for autonomous driving trajectory prediction[C]∥Proceedings of the Thirty-Third International Joint Conference on Artificial Intelligence(IJCAI-24), Jeju, South Korea, 2024: 3124–3132.

[129]

Jiang W, Wang L, Zhang T, et al. RobustE2E: exploring the robustness of end-to-end autonomous driving[J]. Electronics, 2024, 13(16): No.3299.

[130]

Sathyam R, Li Y. Foundation models for autonomous driving perception: a survey through core capabilities[J]. IEEE Open Journal of Vehicular Technology, 2025,6: 2554-2582.

[131]

Gao Z, Mu Y, Shen R, et al. Enhance sample efficiency and robustness of end-to-end urban autonomous driving via semantic masked world model[J]. IEEE Transactions on Intelligent Transportation Systems, 2022, 25(12): 13067-13079.

[132]

Toneva M, Sordoni A, Combes R T D, et al. An empirical study of example forgetting during deep neural network learning[J/OL]. [2018-12-12].

[133]

Khosla S, Zhu Z, He Y. Survey on memory-augmented neural networks: cognitive insights to AI applications[J/OL]. [2023-12-11].

[134]

Dohare S, Hernandez-Garcia J F, Lan Q, et al. Loss of plasticity in deep continual learning[J]. Nature, 2024, 632(768): 768-774.

[135]

Kaiwartya O, Abdullah A H, Cao Y, et al. Internet of vehicles: motivation, layered architecture, network model, challenges, and future aspects[J]. IEEE Access, 2016, 4: 5356-5373.

[136]

Feng D, Haase-Schütz C, Rosenbaum L, et al. Deep multi-modal object detection and semantic segmentation for autonomous driving: Datasets, methods, and challenges[J]. IEEE Transactions on Intelligent Transportation Systems, 2019, 22(3): 1341-1360.

[137]

Nguyen A, Do T K L, Tran M-N, et al. Deep federated learning for autonomous driving[C]∥Proceedings of the 2022 IEEE Intelligent Vehicles Symposium(IV), Aachen, Germany, 2022: 1824-1830.

基金资助

江淮前沿技术协同创新中心追梦基金项目(2023-ZM01G002)

中国科学院青年创新促进会优秀会员项目(Y2021115)

AI Summary AI Mindmap
PDF (1866KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/