基于Swin Transformer的无人驾驶路径规划算法

罗翔文 ,  刘毅 ,  向广利

武汉大学学报(理学版) ›› 2024, Vol. 70 ›› Issue (6) : 697 -703.

PDF (2325KB)
武汉大学学报(理学版) ›› 2024, Vol. 70 ›› Issue (6) : 697 -703. DOI: 10.14188/j.1671-8836.2023.0081
人工智能

基于Swin Transformer的无人驾驶路径规划算法

作者信息 +

Swin Transformer-Based Unpiloted Path Planning Algorithm

Author information +
文章历史 +
PDF (2380K)

摘要

无人驾驶车辆的行车路线规划存在着由于障碍物目标误识别问题,而导致行车路线的拟合出现误差。通过设计基于Swin Transformer网络的障碍物目标的实时识别,结合基于RRT*算法和贝塞尔曲线的路径拟合算法,提出了基于Swin Transformer的无人驾驶路径规划算法。以视频帧作为数据源,利用数据增强的方式构建障碍物图像数据集;在障碍物识别之后采用路径平滑优化完成路径规划。实验结果表明,使用本文算法进行路径规划的无人驾驶车辆的各项指标优于对比方法,且鲁棒性较好。

Abstract

Path planning for unpiloted vehicles often encounters route-fitting errors caused by the misidentification of obstacle targets. By designing the real-time recognition of obstacle targets based on the Swin Transformer network, combined with the path fitting algorithm based on the RRT* algorithm and Bessel curves, we design an unpiloted path planning based on the Swin Transformer.Use video frames as the data source and construct an obstacle image dataset by using data enhancement. Experimental results indicate that the proposed algorithm achieves superior performance across multiple metrics compared to baseline methods, demonstrating enhanced robustness in path planning for unpiloted vehicles.

Graphical abstract

关键词

无人驾驶 / 目标检测 / Swin Transformer / RRT* / 路径规划

Key words

unpiloted / object detection / Swin Transformer / RRT* / path planning

引用本文

引用格式 ▾
罗翔文,刘毅,向广利. 基于Swin Transformer的无人驾驶路径规划算法[J]. 武汉大学学报(理学版), 2024, 70(6): 697-703 DOI:10.14188/j.1671-8836.2023.0081

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

随着人工智能技术的发展,无人驾驶车辆逐渐从愿景走向现实。无人驾驶路线预测作为无人驾驶车辆中的关键技术之一,需要通过对车辆周围环境和交通情况进行分析和识别,预测车辆未来的行驶路线,以帮助车辆做出正确的决策。然而,实际道路场景环境复杂,存在着各种障碍物,当无人驾驶路线预测拟合出现误差时,车辆可能会撞到障碍物从而引发事故。

传统目标检测需要借助前景目标的颜色、纹理和边缘等特征进行定位和分类,如尺度不变特征转换(Scale-Invariant Feature Transform, SIFT)[1]。但传统方法存在易受环境影响和实时性较差等缺点。近些年基于深度学习的目标检测算法已被广泛使用,其大致可以分成两类:第一类为两阶段目标检测算法,主要以Faster R-CNN[2]模型为代表;第二类是单阶段目标检测算法,主要以YOLO和SSD为代表[3~5]。两阶段目标检测算法首先通过区域选取网络(Region Proposal Network, RPN)生成一系列候选框,然后使用对应的网络进行特征提取和分类,因此检测精度较高,但检测效率不高;单阶段目标检测算法只需要在完成分类或者回归任务前提取单个特征,所以检测速度快,但其缺乏对图像的全局理解以及图像的深层语义特征。

无人驾驶车辆在行驶过程中需要识别障碍物并进行路线规划,但障碍物可能存在被遮挡、视觉偏差、光照不均等问题,致使出现障碍物误识别问题。Transformer的注意力机制具有较强的视觉表征能力[6],在各种视觉基准测试中,其性能与传统基于卷积神经网络深度学习方法相当甚至更好[7];Swin Transformer[8]方法基于Transformer架构,在目标识别等计算机视觉任务中取得了最先进的结果。因此,将Swin Transformer应用到障碍物识别任务上,可以提升识别的准确率和效率。此外,在现有大部分目标检测方法中,往往会使用卷积神经网络(Convolutional Neural Networks, CNN)作为基准网络,对于时间序列视频,浅层的CNN不足以表现视频中帧的复杂视觉特征,且会丢失过去帧的时间序列特征,直接使用Swin Transformer在时间序列建模上的结果也不是很理想,因此本文设计了双向长短期记忆网络(Bidirectional Long Short-Term Memory Networks, Bi-LSTM)捕获视频中帧的时间序列特征。

在完成障碍物目标检测后,需要为无人驾驶车辆规划从起点到终点的最优路径,同时避免与任何障碍物发生碰撞[9]。目前,国内外学者对路径规划进行了大量的研究,并提出了一系列算法,如基于图的优化方法(Voronoi图)、基于搜索的方法(A*算法)[10]、基于采样的方法(RRT*)[11]和基于遗传算法(GA算法)[12]等。其中,作为一种基于采样的路径规划算法,RRT*[13]并没有像基于搜索的方法那样明确地构建整个规划空间及其边界,而是直接通过采样获取样本,形成一棵搜索树,该方法避免了搜索时间随空间维数呈指数增长的问题,减少了高维空间中路径规划的搜索时间,然而该方法对于规划好的路径存在不平滑的现象,这将影响无人驾驶车辆的行驶安全;此外,还可能会产生次优路线,从而导致路线出错率上升、行驶时间增加。贝塞尔曲线只需要很少的控制点就能够生成较复杂的平滑曲线,该方法保证了输入的控制点与生成的曲线之间的关系非常简洁、明确。因此许多学者对贝塞尔曲线做了大量的研究,如Zhang等[9]结合四阶贝塞尔曲线对路径进行平滑处理,使路径更适合机器人运动。Yang等[14]利用贝塞尔曲线的性质设计了曲率连续且无碰撞的拟合路线,尝试解决了路径规划中曲率不连续的问题。因此,本文提出了一种基于RRT*和贝塞尔曲线的路径规划方法,实现路线最短且平滑运行,最后通过实验验证了所提方法的准确性和有效性。

1  本文算法

针对障碍物目标误识别、视频输入中帧的时间序列特征捕获有限、路线预测时间较长且不平滑等缺点,本文采用Swin Transformer作为骨干网络,以增强特征提取能力,同时使用Bi-LSTM网络对时间序列进行建模以完成障碍物目标检测,最后使用RRT*算法和贝塞尔曲线的融合算法进行无人驾驶路线预测,具体的流程如图1所示。

1.1 基于Swin Transformer的目标检测模型

算法的骨干网络使用Swin Transformer,将后三个阶段的特征图作为输出结果;预测网络使用核为1×1的2D卷积网络直接输出预测结果。骨干网络的窗口设置为13×13,多头注意力头的个数分别设置为4、8、16和32,模型再训练过程中使用加强角度学习的RIoU(Rotated Intersection over Union)损失函数进行计算。其结构示意图如图2所示,主要包含了三个部分,分别是Swin Transformer网络、Bi-LSTM以及基于CNN分类器。首先利用Swin Transformer对无人驾驶车辆摄像头所拍摄的图像进行视觉特征表示,其次使用Bi-LSTM模块对视频帧中的时序特征进行建模,最后使用CNN分类器,完成对应的障碍物目标识别。

1.1.1 Swin Transformer

本文选择的Swin Transformer网络架构如图2所示,Swin Transformer的网络架构中包含了Patch partition层、Patch expanding层、Patch merging层和Swin Transformer层,其中Patch expanding、Patch merging和Swin Transformer层组成第1~4阶段,每一个阶段分别有2、2、6和2个Transformer块。给定一个大小为H×W的图像,在经过Patch partition层的切片操作后,输出为H4×W4,再经过第1~4阶段的特征提取模块,输出4个阶段的特征图,将后3个阶段输出的特征图作为最后的结果,特征图的尺寸分别为H8×W8H16×W16H32×W32

Swin Transformer层是上述框架中的核心部分,主要负责视觉特征的表示学习,它不会改变原始图像的尺寸,详细结构如图3所示;Swin Transformer层由WMSA、SWMSA和MLP组成,其中每个模块还插入了一个LN,使训练更加稳定,并在每一个模块后面使用一个残差连接。每个阶段的具体步骤如公式(1)~(4)所示。

X^i=WMSALNXi-1+Xi-1
Xi=MLPLNX^i+X^i
X^i+1=SWMSALNXi+Xi
Xi+1=MLPLNX^i+1+X^i+1

其中,Xi-1表示第i-1层的多层感知器输出特征,X^i表示第i层的WMSA输出特征,Xi表示第i层的多层感知器输出特征,X^i+1表示第i+1层SWMSA输出特征,Xi+1表示第i+1层的多层感知器输出特征。

1.1.2 Bi⁃LSTM模块

图2所示,本文使用Bi-LSTM捕获时间序列上的特征,两个LSTM在向前和向后的时间方向工作,以获得上下文的视觉特征信息。将Swin Transformer层的特征学习结果x送入正向传播,表示从过去时间运行到未来时间。同样地,将序列嵌入x送入反向传播,它考虑从未来到过去的背景信息。使用该方法可以在任何时间点上保存两个方向的信息,经过Bi-LSTM网络之后的输出特征如公式(5)~(7)所示,其中ht表示当前时刻的隐藏层状态,ht-1ht+1分别表示上一时刻和下一时刻的隐藏层状态,箭头表示不同的方向。

ht=LSTM(xt,ht-1)
ht=LSTM(xt,ht+1)
ht=[htht]

1.2 基于RRT*算法和贝塞尔曲线的路径拟合算法

1.2.1 RRT*算法描述

快速扩展随机树(Rapidly-exploring Random Trees, RRT)算法是一种基于采样的方法,旨在快速的找到一条从起点到终点的拟合路线;RRT*算法是对RRT算法的改进,伪代码如算法1所示。该算法首先选择无人驾驶车辆的初始位置为xinit,将其作为根节点构建一棵搜索树,然后在空间进行采样获得xrand,并利用欧氏距离在随机树上寻找距离xrand最近的节点xnear,以Stepsize扩展得到新节点xnew,该过程是RRT*算法中最为重要的部分,具体如算法第三行所示,该过程得到的结果将作为后续操作的基础,另外如果在这个过程中没有发生碰撞,则重新规划直到找到使得代价值最小的点xmin,并添加到随机树上;将上述过程不断进行迭代运行,进而优化路径。RRT*算法主要解决了RRT算法在求解最优路径上随着搜索空间维数增加而导致的计算复杂度急剧增加的问题。

在完成障碍物目标检测之后,需要对无人驾驶路线进行规划,本文选择使用RRT*算法进行初步的路线规划,但该算法依然存在一些问题,比如路径平滑度较差,可能会产生突变等。

1.2.2 贝塞尔曲线

贝塞尔曲线是一种连续的平滑曲线,其具有如下特点:拟合曲线的起点和终点与被平滑化处理的原始折线的起点和终点是重合的,意味着经过平滑之后并不会改变无人驾驶车辆开始与结束的地方;其次贝塞尔曲线经过平滑处理后,生成的拟合路线与折线相比是更贴近实际的,且曲率连续、控制简单,因此广泛应用于无人驾驶路径规划等领域。

由于高阶贝塞尔曲线的数值稳定性较差,因此本文使用三阶贝塞尔曲线进行预测路线的平滑优化,它可以实现改变车辆位置但不改变车辆在曲线起、终点的速度方向,因此能够很好地用在无人驾驶车辆的路线预测上。三阶贝塞尔曲线表达式如公式(8)所示[8]

P(t)=P0(1-t)3+3P11-t2t+3P2(1-
t)t2+P3t3,t[0,1]

其中,t表示时间变量,P为控制点坐标矩阵。

2  实 验

2.1 数据集

本实验使用由赛曙科技(SASU)提供的包含8类(拖拉机、谷仓、玉米、猪、拱桥、锥桶、减速带和斑马线)障碍物的图像(分辨率为320×240),共计4 770张,并采用矩形检测框标注方法对图像进行标注,详细数据如表1所示,各个类型的障碍物实体如图4所示。

由于数据集照片较少,这将影响模型的训练效果,因此本文进行了一些数据增强操作,将数据集扩充至8 000张,其中数据增强的方式包括但不限于:随机裁剪、调整对比度、调整背景颜色以及替换障碍物的颜色等。使用不同的数据增强方式不仅提高了模型训练质量,同时由于考虑不同条件下的环境影响,也提高了模型的鲁棒性。实验过程中将数据集按照8∶1∶1的比例划分为训练集、验证集和测试集。

2.2 评价指标

本实验中的检测指标包括运行时间和路线出错率(即出赛道的次数占总运行次数的比例)。运行时间可以衡量路线拟合算法的有效性,因为在该实验中无人驾驶车辆的速度是恒定的,当路线拟合算法较优时,所耗费的时间将会减少;路线出错率可以衡量路线拟合算法的正确性,当规划路线出错时,无人驾驶车辆必然会撞上障碍物,或者偏离正确车道线。

2.3 实验平台

计算机视觉使用2M HDR USB2.0 HIGH SPEED 摄像头,并结合配套软件SDK和OpenCV库。深度学习的硬件平台为Intel i9-10900K CPU、64 GB内存、GPU资源为NVIDIA GTX 2080TI,显存容量为12 GB。实验过程中采用python编程语言,并使用Pytorch深度学习框架。

2.4 模型训练

在训练过程中加入余弦退火学习率策略调整模型学习率。实验过程中将8个样本作为一个批次,前100个训练周期初始学习率设置为0.001,在后100个训练周期学习率设置为0.000 1,优化器算法采用随机梯度下降法(stochastic gradient descent, SGD),权重衰减设置为0.000 5。无人驾驶车辆行驶过程中车速保持直线速度1.5 m/s,识别阈值为0.7,测试拟合路线错误率时将无人驾驶车辆在每一种环境下测试30次,并取平均值作为最后的结果。

2.5 基线模型

无人驾驶车辆的行车路线规划存在着由于障碍物目标误识别问题,而导致行车路线的拟合出现误差,目标识别的准确性将很大程度上影响无人驾驶路线规划的效果。因此本文将所提出的框架模型与以下最先进的目标检测方法进行比较。

1) SSD(Single Shot MultiBox Detector)[4]:提取了不同尺度的特征图来完成目标检测任务,大尺度特征图可以用来检测小物体,而小特征图用来检测大物体。

2) Faster R-CNN[2]:使用了RPN网络直接提取出候选框,并将其融入整体网络中,使得综合性能有较大提高。

3) YOLOv4[5]:该模型通过在数据预处理阶段扩充数据集,从而实现在不多消耗任何内存和模型空间的情况下提升模型性能。

2.6 结果与分析

2.6.1 整体评估

本文所提到的无人驾驶路径优化包含两个方面:一是基于Swin Transformer的目标识别,主要为了解决障碍物目标误识别问题;二是利用RRT*和贝塞尔曲线完成路径平滑优化。实验结果如表2所示。

在目标检测任务上,与基线模型相比,本文模型得到了较大的提升。SSD+RRT*+Bessel算法、Faster R-CNN+RRT*+Bessel算法和YOLOv4+RRT*+Bessel算法都忽略了视频输入中图像帧之间的时间序列特征,在无人驾驶过程中,拍摄出的照片时间上是连续的。因此本文使用Bi-LSTM建模所拍摄的连续照片时间序列上的特征,提升了模型识别障碍物的准确率,进而提升了拟合算法对路线预测的准确度。同时,对比了三种目标检测基线方法,结果表明使用Swin Transformer能够提取到更为丰富的视觉特征并应用于障碍物识别上。此外,本文方法骨干网络输出三层特征图的通道数分别为64、128和256,比YOLOv4的256、512和1 024更少。

在障碍物目标检测方法相同的前提下,融合了RRT*和贝塞尔曲线的无人驾驶车辆运行时间较短,路线出错率也较低。这是因为本文使用了三阶贝塞尔曲线进行预测路线的平滑优化,减少了折线路线中多增加的路段,同时也避免了转向角突然变化导致的智能车行驶路线出错以及不安全行驶,证明了对预测路线进行平滑优化的重要性。

2.6.2 消融实验和模型鲁棒性分析

本文对所提出的模型进行了消融实验,实验结果如表3所示。通过构建三种不同层级(ST4、ST6和ST8)的Swin Transformer网络研究了Swin Transformer层以及该层的层数对模型性能提升程度的影响,三者的区别主要在于Swin Transformer网络的第三阶段的层数分别为4、6和8;为了方便实验过程,选择了更轻量的ST4验证Bi-LSTM模块对实验结果的影响。

表3可以看出,层数更多的Swin Transformer表现更好,因为层数越多,视觉特征的表示能力更强。与表2进行联合分析可以得出Bi-LSTM模块对于障碍物检测是有效的;当模型不使用Bi-LSTM建模时间序列特征时,运行时间增加了1 s左右,路线出错率也增加了0.8%,说明了Bi-LSTM模块的有效性。

为了验证本文模型的鲁棒性,在不同灯光条件下进行了实验,同时还验证了不同红色锥桶以及锥桶摆放密集程度对结果的影响,各实验环境示例如图5所示,实验结果如表4所示。

表4可以看出,模型在不同环境下依然表现良好,说明模型有较好的鲁棒性,智能车行驶过程中由于光线昏暗导致的拍摄动态模糊,使得光线昏暗条件下模型效果与其他环境下的模型效果相比略有下降。

3  结 语

以无人驾驶车辆无人驾驶路线预测为研究目标,采用单阶段目标检测架构,使用Swin Transformer为骨干网络,在捕获视觉特征后引入Bi-LSTM模块对时间序列特征进行建模,构建障碍物实时检测网络。完成障碍物识别之后利用RRT*算法快速找到一条从起点到终点的拟合路线,最后,使用贝塞尔曲线进行平滑优化完成路径规划。实验表明本文方法各项指标优于所选择的对比方法,并通过更换赛道环境证明了该方法具有较好的鲁棒性。

在未来工作中,可进一步扩大训练数据集,增强模型识别障碍物的准确率和效率;并进一步分析路线出错可能的原因,从目标检测和路线拟合算法两方面来综合提高无人驾驶车辆无人驾驶路线预测能力。

参考文献

[1]

LOWE D G. Distinctive image features from scale-invariant keypoints[J]. International Journal of Computer Vision200460(2): 91-110. DOI: 10.1023/B: VISI.0000029664.99615.94 .

[2]

REN S QHE K MGIRSHICK Ret al. Faster R-CNN: Towards real-time object detection with region proposal networks[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence201739(6): 1137-1149. DOI: 10.1109/TPAMI.2016.2577031 .

[3]

邵延华, 张铎, 楚红雨, . 基于深度学习的YOLO目标检测综述[J]. 电子与信息学报202244(10): 3697-3708. DOI: 10.11999/JEIT210790 .

[4]

SHAO Y HZHANG DCHU H Yet al. A review of YOLO object detection based on deep learning[J]. Journal of Electronics & Information Technology202244(10): 3697-3708. DOI: 10.11999/JEIT210790(Ch ).

[5]

ZHENG WTANG W LCHEN S Jet al. CIA-SSD: Confident IoU-aware single-stage object detector from point cloud[EB/OL]. [2021-05-18]. DOI: 10.48550/arXiv.2012.03015 .

[6]

WANG C YBOCHKOVSKIY ALIAO H Y M. Scaled-YOLOv4: Scaling cross stage partial network[C]//2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2021: 13024-13033. DOI: 10.1109/CVPR46437.2021.01283 .

[7]

RAO JQIAN TQI S Het al. Student can also be a good teacher: Extracting knowledge from vision-and-language model for cross-modal retrieval[C]//Proceedings of the 30th ACM International Conference on Information & Knowledge Management. New York: ACM, 2021: 3383-3387. DOI: 10.1145/3459637.3482194 .

[8]

HAN KWANG Y HCHEN H Tet al. A survey on vision transformer[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence202345(1): 87-110. DOI: 10.1109/TPAMI.2022.3152247 .

[9]

LIU ZLIN Y TCAO Yet al. Swin transformer: Hierarchical vision transformer using shifted windows[C]//2021 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2022: 9992-10002. DOI: 10.1109/ICCV48922.2021.00986 .

[10]

ZHANG Z BAI C SLI Set al. Path planning and tracking control method based on Bessel curve[C]//2022 5th World Conference on Mechanical Engineering and Intelligent Manufacturing (WCMEIM). New York: IEEE Press, 2023: 511-514. DOI: 10.1109/WCMEIM56910.2022.10021359 .

[11]

CHEN XZHAO M YYIN L Y. Dynamic path planning of the UAV avoiding static and moving obstacles[J]. Journal of Intelligent & Robotic Systems202099(3): 909-931. DOI: 10.1007/s10846-020-01151-x .

[12]

GE Q YLI A JLI S Het al. Improved bidirectional RRT* path planning method for smart vehicle[J]. Mathematical Problems in Engineering2021: 1-14. DOI: 10.1155/2021/6669728 .

[13]

WU YWU S BHU X T. Cooperative path planning of UAVs & UGVs for a persistent surveillance task in urban environments[J]. IEEE Internet of Things Journal20218(6): 4906-4919. DOI: 10.1109/JIOT.2020.3030240 .

[14]

CHI W ZDING Z YWANG J Ket al. A generalized voronoi diagram-based efficient heuristic path planning method for RRTs in mobile robots[J]. IEEE Transactions on Industrial Electronics202269(5): 4926-4937. DOI: 10.1109/TIE.2021.3078390 .

[15]

YANG H XXU X MHONG J C. Automatic parking path planning of tracked vehicle based on improved A* and DWA algorithms[J]. IEEE Transactions on Transportation Electrification20239(1): 283-292. DOI: 10.1109/TTE.2022.3199255 .

基金资助

国家重点研发计划(2020YFA0607902)

AI Summary AI Mindmap
PDF (2325KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/