面向深度模糊的可部署单目3D目标检测方法

邓召学 ,  郝丙森 ,  龚胜 ,  刘万里 ,  王景炎

湖南大学学报(自然科学版) ›› 2025, Vol. 52 ›› Issue (10) : 108 -119.

PDF (4504KB)
湖南大学学报(自然科学版) ›› 2025, Vol. 52 ›› Issue (10) : 108 -119. DOI: 10.16339/j.cnki.hdxbzkb.2025211
机械工程

面向深度模糊的可部署单目3D目标检测方法

作者信息 +

Deployable Monocular 3D Object Detection Method for Overcoming Depth Ambiguity

Author information +
文章历史 +
PDF (4611K)

摘要

单目3D目标检测任务面临深度模糊性问题,现有2D注意力机制难以有效解决,且计算量大,难以部署在车载移动设备上. 针对这些问题,提出一种基于3D注意力机制和多目标边框策略的单目3D目标检测算法. 考虑2D至3D映射的深度模糊性,在网络设计中融入3D注意力机制,包含深度信息增强核心和低计算复杂度的位置增强核心. 通过对深度标签进行扰动,多目标边框策略采用伪标签来缓解原有硬标签的严格限制. 深度估计的精准性有所提升,增强了模型的3D空间感知能力以及泛化性能,适用于3D目标检测任务. 在nuScenes数据集上的实验表明,该算法优于当前的单目3D目标检测算法. 通过TensorRT工具进行模型转换及半精度加速,实现了在车载移动设备上的部署. 在Jetson AGX Xavier与Jetson Orin NX(16 GB)嵌入式平台上,推理时间每帧分别为67 ms和89 ms,可实时精确检测3D目标.

Abstract

Monocular 3D object detection encounters significant challenges due to depth ambiguity. Conventional 2D attention mechanisms have proven insufficient in mitigating this issue, and their high computational overhead further complicates deployment on vehicle-mounted mobile devices. To address these issues, this paper proposes a monocular 3D object detection algorithm based on 3D attention mechanism and multi-object bounding box module. Considering the depth ambiguity in 2D to 3D mapping, the 3D attention mechanism was first incorporated into the network design, which includes a depth information enhancement kernel and a position enhancement kernel with low computational complexity. Then, multi-object bounding box strategies employ pseudo-labels to alleviate the strict constraints of the original hard labels from depth labels perturbations. Hence, the precision of deep estimation is enhanced, improving the model’s 3D spatial perception and generalizability for 3D object detection tasks. Experiments on the nuScenes dataset demonstrate that this algorithm outperforms existing monocular 3D object detection methods. Finally, with the aid of TensorRT tools, the model is successfully deployed on mobile devices in the automotive environment. On the Jetson AGX Xavier and Jetson Orin NX (16 GB) embedded platforms, the inference time per frame is 67 ms and 89 ms, respectively, enabling real-time detection of 3D objects.

Graphical abstract

关键词

注意力机制 / 模型部署 / 深度模糊性 / 目标检测

Key words

attention mechanism / model deployment / deep ambiguity / object detection

引用本文

引用格式 ▾
邓召学,郝丙森,龚胜,刘万里,王景炎. 面向深度模糊的可部署单目3D目标检测方法[J]. 湖南大学学报(自然科学版), 2025, 52(10): 108-119 DOI:10.16339/j.cnki.hdxbzkb.2025211

登录浏览全文

4963

注册一个新账户 忘记密码

三维(3D)目标检测为自动驾驶获取环境中静动态目标的位置、几何及类别信息,以实现自动驾驶车辆对行驶环境的准确认知,进而做出最优的决策规划和运动控制,提升行驶安全性与效率. 然而,大部分3D目标检测技术依赖于成本高昂且数据稀疏的深度传感器,例如激光雷达(LiDAR). 因此,具有低成本和易部署的单目三维目标检测技术具有重要的应用价值1.
深度信息作为单目2D图像与实际3D环境的关键连接,有助于自动驾驶车辆理解周围环境的几何结构和距离2. 但单目图像缺乏空间线索,难以准确估计深度信息,使得不同深度的物体在2D图像中展现出相同的边界框和相似的视觉特征. 因此,单目3D目标检测的核心挑战在于深度模糊性,它阻碍了其他3D属性的预测,从而限制整体检测性能3. 如何有效处理深度信息以解决深度模糊性仍是当前亟待解决的问题.
国内外学者已经对单目3D目标检测技术进行了广泛而深入的研究. 基于中心的3D目标检测方法通过将3D边界框的属性转换为一个中心点估计,简化并提升了检测效率4. Liu等5提出了继承基于中心的框架SMOKE,可以省略二维边界框的估计. Wang等6使用了较少的手工设计模块,从2D图像中直接预测物体的3D边界框和深度信息. Liu等7发现在中心周围添加辅助学习任务可以提高泛化性能. 虽然基于中心的框架有众多优势,但它导致预测3D属性高度依赖局部中心,忽视了全局信息的重要性,从而使预测的3D属性出现耦合. 得益于注意力机制的非局部编码8及其在目标检测领域的发展,基于Transformer的单目3D检测方法通过增强全局感知能力,提高目标检测精度. Huang等9通过深度位置编码和LiDAR辅助监督,实现了注入全局深度信息以指导检测,而Zhang等10依靠前景对象标签预测前景深度图以引导深度. Zhou等11提出自适应token Transformer,优化了token在图像关键区域的分配,提升了推理效率. 这类方法虽然效果良好,但由于计算复杂度高、推理速度缓慢,在移动设备上的部署应用受到较大限制. 除了上述使用神经网络估计目标深度,另一种常用方法通过预测与深度有关的几何线索来扩展深度估计分支12. Lu等13和Shi等14利用数学先验和不确定性建模,通过3D与2D高度比例恢复深度信息. 基于此,Mousavian等15使用2D检测框和几何投影估计物体3D位姿和尺寸,通过最小化预测的3D检测框重投影中心坐标与2D检测框中心坐标的偏差,求解目标中心至相机中心的平移矩阵. Zhang等16通过集成学习和不确定性理论,高效预测物体深度和中心位置. Chen等17通过配对约束和全局优化,建立车辆间距离关系,解决遮挡下的预测问题. Wang等6分析了深度误差,在FCOS3D算法的基础上,引入了更有效但更复杂的几何先验增强其性能. 虽然上述几何相关设计显著提升了性能,但深度模糊问题的限制依然存在.
在3D目标检测领域,深度学习模型的高计算复杂度和庞大参数量,难以实现车载移动设备上的实时检测,成为商业化应用的一大阻碍. Xu等18通过模型重构、剪枝及半精度加速,成功实现YOLOv3-Promote在嵌入式设备上的部署. Dai等19采用TensorRT优化深度学习模型,加快了嵌入式平台的推理速度,提升实时性. Tang等20在边缘计算平台上使用C++、TensorRT、Float16量化和oneTBB实现算法,显著提升了算法性能. 然而,这类方法主要针对2D目标检测,未在3D目标检测中验证,且输入图片分辨率较低. Zhang等21通过模型优化、INT8量化技术及硬件加速,提高嵌入式设备处理点云数据的能力. 然而,鉴于点云数据的稀疏性,虽然这类方法能实现较快的检测速度,但仍未能成功解决将高分辨率图像(1 600×1 200)的3D目标检测实时部署到移动设备上的问题. Liu等22在边缘计算平台中采用C++、TensorRT,实现了激光雷达与摄像头两种传感器的融合算法部署. 然而,点云数据固有的稀疏性质,结合低分辨率(224×224)图像的应用,使得该方法能够实现较高的检测速度. 因此,缺乏一种针对高分辨率图像(1 600×900)的单目3D目标检测框架.
综上,尽管无额外数据的单目3D物体检测已有诸多研究成果,但仍存在以下问题:1)由于存在深度模糊性,单目3D目标检测性能不佳,这给网络在学习单目图像的不同深度时带来了挑战. 2)虽然基于注意力机制的方法显著提高了精度,但在计算跨特征层注意力时计算复杂度大幅上升,限制了在移动计算设备上的部署应用.
针对上述问题,本文提出了一种轻量型实时的单目3D目标检测方案,有效缓解了单目3D目标检测中存在的深度模糊问题,实现了对3D空间信息的准确描绘,并且避免了计算复杂度的剧增.

1 网络设计

1.1 网络整体设计

本文提出的方法结构如图1所示. 为了减少使用TensorRT时未定义算子的风险,本研究选用了广泛应用的ResNet101和FPN构建特征骨干网络和连接颈网络. 针对单目3D目标检测的深度模糊问题,构建一种多目标边框模块,通过优化目标视锥面上的边界框定位并采用合适的伪标签,有效打破了原有硬标签的限制. 此外,引入3D注意力机制来准确描绘3D空间信息,无须显著增加计算复杂度即可满足车载移动设备实时的需求.

3D注意力机制以Transformer为代表的自注意力机制中的注意力矩阵计算具有O(N2)的复杂度23-24,导致计算负担加重,从而限制了其在多个领域的应用. 为降低复杂度,现有方法通过划分空间窗口或池化实现全局表达,但本质上仍存在二次计算复杂性问题,限制了在资源有限的移动设备上的实时部署应用. 刘青等25利用通道注意力机制估计3D边界框,但该方法仅用卷积网络引导深度,未提出适应3D任务的注意力机制. 本文提出了一种新型3D注意力机制,将二次矩阵乘法运算替换为线性元素乘法,大幅降低了计算复杂性,以实现更快速且效果与自注意力机制相当的替换方案,更有效地捕获上下文信息.

首先,设定输入变量:FRC×H×WC表示特征图的通道,H、W分别代表特征图的高度和宽度,将F输入至线性层以生成F1R3C×H×W. 其次,执行多重尺度的卷积操作,构建多尺度特征图的次级表征F2R3C×H×W. 最后,将生成的多个特征图信息进行拼接,生成具有不同信息增益的多尺度特征图XR6C×H×W.3D注意力模块结构如图2所示.

深度信息增强核心. 传统通道注意力的压缩操作会导致细节信息损失,这对于3D目标检测任务中深度信息的捕获至关重要. 为了鼓励注意力模块在通道维度上捕获精确的深度信息,使用卷积操作以增强细节信息的表达. 具体来说,给定多尺度特征图X,执行3×3卷积和BatchNorm层,建模局部空间依赖,从而增强局部细节感知的特征图X1.

X1=BatchNorm(Conv3×3(X))

使用ReLU以及带有BatchNorm的1×1卷积, 将通道数量从6C映射到C,从而生成深度细节增强特征图XD

XD=BatchNorm(Conv1×1(ReLU(X1)))

位置增强核心. 位置信息采用计算复杂度较低的注意力矩阵进行编码. 首先,将多尺度特征图X经过重组操作,以便将其拆分为多个头并行计算. 其次,通过执行转置操作得到特征QKV,以便后续任务的处理. 为了便于计算注意力,将特征QKV分解为查询向量QRNh×HW×d,关键向量KRNh×HW×d和数值向量VRNh×HW×d. 特征QKV获得过程为:

QKVRNh×HW×3d=Transpose(Reshape(X))

式中:N代表多尺度特征图的数量;d表示注意力机制中的头数;h是每个头的维度.

采用传统方法计算注意力时,本研究中的注意力矩阵计算具备二次方复杂度,其计算公式如下:

qkRNh×HW×HW=
MatMul(QRNh×HW×d,KRNh×d×HW)
qkvRNh×HW×d=
MatMul(qkRNh×HW×HW,VRNh×HW×d)

式中:qk是相似度分数,即查询向量与关键向量的乘积;qkv代表完整注意力;MatMul是矩阵乘法.

本研究通过挖掘矩阵乘法的关联特性,实现在不改变其功能的前提下,将计算复杂度和内存占用从二次方降低至线性. 具体而言,通过将关键向量K应用ReLU激活函数处理得到K'RNh×d×HW,与经填充(Pad)操作处理后的数值向量V'RNh×HW×(d+1)一起用于构建注意力矩阵X2RNh×d×(d+1)X2RNh×d×(d+1)与经过ReLU激活函数的Q'RNh×HW×d进行注意力矩阵计算得到X3. 注意力计算过程如下:

X2=MatMul(Transpose(ReLU(K)),Pad(V))
X3RNh×HW×d+1=MatMul(ReLU(Q),X2)

X3执行标准化(Std)、转置以及重组(Reshape)操作,进而产生X4,通过1×1卷积进行维度的变换以生成位置增强特征X4

X4=Conv1×1(Reshape(Transpose(Std(X3))))

为了进一步增强特征的表达能力,位置增强特征X4与输入特征F通过残差块融合得到特征XLXL通过Softmax函数生成权重W

W=Softmax(XL+F)

通过将深度强特征XD与代表位置增强信息的权重W进行逐点乘法操作,获得最终的3D增强特征Fout.

Fout=MatMul(XD,W)

1.2 多目标边框策略

单目图像由于缺乏空间线索,难以准确估计深度信息,导致不同深度的物体在2D图像中展现出相同边界框和相似视觉特征,进而影响深度学习深度信息的稳定性26. 为此,引入的多目标边框模块通过在深度距离输出前添加合理的伪标签,使网络能识别处于3D空间不同位置的对象在2D图像中的相似表现,并从众多伪标签中选取最适合的,以增强深度学习效果. 多目标边框模块结构如图3所示.

假定已校准的相机系统,遵循针孔成像原理,如式(10)所示.

suv13×1=fx0cx00fycy000103×4xyddepth14×1

式中:s为比例因子;uv为物体在图像坐标中的位置;x、y为物体在相机坐标中的位置;ddepth为物体的深度. fxfycxcy为被标定相机的固有参数. 为了表示方便,设置比例因子s=1.

对于图像上的点A(u,v),由于fxfycxcy 是相机的固有参数,(u-cx)/fx(u-cy)/fy是固定的. 投影关系使得图像上的点能映射到多个3D位置,一个2D边界框也能对应到3D空间中的各种对象.

具体来说,对于每个地面真值标签P=(Cclass,X,Y,Z,H,W,L,θyaw),通过一组小的偏移量来干扰深度.其中, Cclass代表目标类别,X、Y、Z是物体在相机坐标中的位置,HW、L分别为3D物体的高、宽、长,θyaw代表目标转角.深度偏移量由深度误差容限及其深度决定:Δddepth·ddepth.深度误差容限是一种扰动参数,用于寻找某些投影矩阵最大化IoU的最佳可能标签P.本研究选择Δddepth=[-4%,-2%,-1%,+1%,+2%,4%].

取出相机参数P2和每个地面真值(Cclass,X,Y,Z,H,W,L,θyaw). 通过提取2D和伪3D边界框坐标,将伪3D边界框投影至2D顶点,计算物体3D边界框在图像中的映射. 通过求取投影顶点坐标的最大值与最小值,获得边界框的2D投影坐标.

为了衡量伪标签的质量,采用IoU标签分数来评价两个边界框的相似度,该分数基于2D边界框和2D投影坐标计算得出. 较高的IoU值意味着更显著的伪标签. 通过xddepth比和yddepth比调整x、y坐标,具体如式(11)式(12)所示. IoU标签分数定义见式(13).

u-cxfx=xddepth
u-cyfy=yddepth
IoU_Label=IoU(Bgt,Bfalse)

式中: Bgt代表原始的2D边界框;Bfalse是伪3D边界框标签的2D投影边界框.

ddis=H2+W-Y22+L2
θyaw'=IoUmaxexp(ddis/80)×θyaw

式中:ddis表示目标框中心点与相机的距离; IoUmax代表标签分数最大的IoU; θyaw'为调整后的转角. 至此,得到一个新的伪标签(Cclass,Xt,Yt,Z+ddepthΔddepth,H,W,L,θyaw')XtYt为调整后3D目标在相机坐标系下X、Y坐标.

多目标边框策略在IoU标签分数上表现良好. 该策略能在多个合理的伪标签中选出最优者,克服了硬标签的制约,增强了网络的泛化能力,缓解了深度模糊性问题.

1.3 模型部署

在自动驾驶感知领域,工程开发首阶段包括数据准备、模型选择、训练和评估,其次是模型优化、嵌入式系统选择与经济分析. 经TensorRT框架转换及半精度加速后,训练模型在Jetson AGX Xavier和Jetson Orin NX(16 GB)嵌入式平台上的推理时间缩短至每帧67 ms和89 ms,达到实时高精度检测的效果.

NVIDIA TensorRT是一个高性能深度学习推理平台,它集成了优化器和运行器,满足了低延迟和高吞吐量的应用需求. 在推理过程中,基于TensorRT的应用程序比仅基于CPU的执行速度快40倍. 鉴于GPU训练平台性能优于嵌入式移动终端,采用TensorRT优化深度学习模型,以便在自动驾驶感知应用中部署.

在模型部署前,先将训练完的PyTorch模型导出为ONNX格式,以便TensorRT识别. 然后,利用TensorRT工具对ONNX模型进行优化,转换成包含优化模型结构、权重及硬件优化执行计划的TensorRT engine格式文件. engine文件可直接部署于目标硬件平台,高效完成深度学习推理任务. 模型转换过程如图4所示.

在模型部署阶段,将ONNX模型导入TensorRT以进行简化和FP16加速.通过合并Conv层、BN层和ReLU层为CBR层来简化网络. 如图5所示,以Inception子网络为例,根据TensorRT的简化原则,将图5(a)中的原Inception结构转换为图5(b)中的网络结构;对于网络的水平组合部分,通过合并输入相同的层来进一步优化,如图5(b)到(c)的转换所示. 从阶段1到阶段2、再到阶段3过渡的具体过程如下: 阶段1至阶段2,TensorRT通过将网络的Conv层、BN层和ReLU层整合成一体的CBR层来简化计算流程. 在阶段2至阶段3,系统直接将拼接的输入送往后续操作,省去了额外的拼接步骤,相当于减少了一个系统的吞吐量,从而提升处理效率. 在TensorRT的支持下,采用FP16加速技术将数据精度从32位降至16位浮点数,有效提高了运算和计算效率.

2 实 验

2.1 实验准备

2.1.1 数据集

选取自动驾驶领域中较大的nuScenes数据集进行研究,包括1 000个场景的多模态数据,涉及6个环视摄像头的RGB图像和5个雷达及1个激光雷达的点云数据. 该数据集为目标检测任务提供了1.4 M个有注释的3D边界框,覆盖10个类别. 依据以往研究,将数据集划分为700个训练场景、150个验证场景和150个测试场景,以确保比较的公正性. 其场景丰富性和类别全面性使得它成为3D目标检测领域的重要基准.

2.1.2 实验平台

本文训练过程依赖装备Nvidia GeForce RTX 4090 GPU的工作站. 所使用的软件主要包括PyTorch、CUDA和CUDNN 等深度学习开发库以及OpenCV图像处理库.模型训练配置如表1所示.

研究采用的嵌入式移动设备为Jetson AGX Xavier和Jetson Orin NX(16 GB). NVIDIA公司的Jetson AGX Xavier配备512个CUDA核心,64个Tensor Core、8个ARM CPU及2个深度学习加速引擎,其8核心的加速计算能力在30 W功耗下可达32 TOPS. Jetson Orin NX(16 GB)配备32个Tensor Core、16 G显存、8个ARM CPU及2个NVIDIA深度学习加速引擎,其8核心加速计算在25 W功耗下可达100 TOPS. 两款嵌入式设备均运行Jetpack5.1.1(ubuntu20.04)操作系统. 图6展示了设备Jetson AGX Xavier与Jetson Orin NX(16 GB),详细部署环境见表2.

2.1.3 评估指标

nuScenes检测任务需要检测10个具有3D边界框、属性的对象类. 对于3D目标检测任务,采用官方预定义的两个关键指标进行评估:平均精度均值(mAP)和nuScenes检测分数(NDS). 其中,nuScenes度量包括5个真正度量指标:平均速度误差 (AVE)、平均尺度误差(ASE)、平均平移误差 (ATE)、平均属性误差 (AAE)和平均方向误差 (AOE),以此来定量评估实验结果.

1)平均精度均值(mAP):

mAP=1|Cc||D|cCdDAPc,d

式中:Cc 表示类别数量;D指地平面的2D中心距离;AP cd 为平均精度;c代表类别的索引;d代表D的索引.

mAP与2D目标检测中用于衡量精度和召回率的平均精度均值相似,但其计算基于地平面上的中心距离而非三维交并比,用于对预测结果和实际情况进行匹配.

2)nuScenes检测分数(NDS):

NDS=1105mAP+mTPTP(1-min(1,mTP))

式中:TP为模型正确预测的正样本数. 各指标前m表示所有检测类别的均值,例如mATE表示所有类别ATE的平均值.

NDS综合考量了多个指标以评估检测能力,其中一半依据检测性能(mAP),另一半根据速度、尺度、平移、属性和方向的检测质量(AVE、ASE、ATE、AAE、AOE)进行评估. 考虑到mAVE 、mATE和mAOE可能超过1,因此将这些度量值限定在0~1.

2.2 性能比较

本节通过定量和定性结果展示本文方法的优势,并对推动其达到先进水平的关键因素进行深入消融实验. 图7展示了训练迭代的训练损失,由图7可知,在设定的训练轮数内损失稳定最小化并收敛,验证了模型结构和损失函数的有效性,表明优化器能找到损失函数的全局最小值.

nuScenes数据集实验结果如表3所示.在权威的3D目标检测基准nuScenes数据集上,本文方法的NDS和mAP评价指标均达到先进水平. 为直观展示本方法有效性,图8呈现了基于nuScenes数据集的定性评估结果. 图8中第1行是评价指标次优的PGD检测结果,第2行是本文提出基于3D注意力机制与多目标边框算法的检测结果. 其中橙色椭圆形部分用以强调检测差异,绿色矩形部分用以展示共同检测误差.

模型权重的灰度图可视化如图9所示.在推理过程中选取了含有64个通道的特征提取网络首层,以展示图8中各个场景的灰度图. 通过对特定通道所学习特征的灰度图可视化,可有效分析模型在不同通道上对抽象特征(如边缘、纹理等)的学习状况. 表4展示nuScenes验证集中各类别的平均精度. 表5为基于nuScenes验证集的消融实验结果,详细分析了本文方法优化的关键因素,包括:(a)基准模型;(b)添加3D注意力模块;(c)添加多目标边框模块;(d)同时添加3D注意力模块和多目标边框模块.

为直观展示嵌入式设备在车辆中的部署效果,图10展示了嵌入式设备在实车部署中的结果可视化,图中红色方框表示3D目标检测结果. 本研究使用nuScenes数据集训练算法模型,并应用标定相机内参及训练得到的权重文件于现实场景. 该模型对近距离目标检测准确,但远距离小目标的预测精度需改进. 尽管如此,由于训练与部署场景不同,该方法在近距离目标的检测中展现出竞争力,强调了其特定场景下的泛化能力. 理论上,Jetson Orin NX(16 GB)和Jetson AGX Xavier的处理性能分别可达100 TOPS与32 TOPS. TOPS指每秒可处理整形运算的次数,在实际使用FP16精度部署到Jetson Orin NX(16 GB)和Jetson AGX Xavier时,Jetson AGX Xavier反而运行更快. Jetson AGX Xavier与Jetson Orin NX(16 GB)推理时间分别为每帧67 ms和89 ms. 鉴于Jetson Orin NX(16 GB)的价格仅为Jetson AGX Xavier的一半,未来研究将更加关注如何在Jetson Orin NX(16 GB)设备上充分发挥其高整形运算能力.

3 讨 论

单目3D目标检测面临的核心问题是深度模糊性,它影响了其他3D属性的预测,从而降低了整体检测效果. 为此,引入3D注意力机制来获取全局深度信息,从而提高深度估计的准确性,缓解深度模糊问题. 同时,通过对深度标签的扰动,使多目标边框模块采用伪标签来打破原有硬标签的限制,以增强模型在深度估计上的泛化性能.

表3列出了部分依赖附加数据的早期单目方法和近期在nuScenes数据集上的仅图像方法. 与采用单帧RGB图像输入的方法相比,本文方法在验证集上展现出了优异的表现. 具体来说,本文方法实现了40.9%的mAP和50.7%的NDS.表3也展示了基于不同数据模式的基准测试结果,其中包括基于RGB图像和雷达数据的CenterFusion、基于实时LiDAR的PointPillars,以及综合所有传感器数据的CenterPoint. 结果显示,在mAP和NDS指标上,本文方法不仅胜过了PointPillars和CenterFusion,也证明了充足数据能有效解决仅用单帧RGB图片引起的深度模糊问题. 然而,本文方法与高性能的CenterPoint存在差距,主要原因在于数据集的限制和模态的单一性. 本文仅利用单一RGB图像,难以与综合使用Camera、LiDAR和Radar的CenterPoint相比. 同时,使用其他多模态数据的方法能通过多帧点云或雷达速度测量预测物体运动速度,从而优化NDS表现和降低mAVE值,而本文方法仅使用单帧RGB图像. 尽管如此,本文方法在仅采用RGB图像作为输入数据的场景中展示出良好的效果,展现了其在特定情况下的有效性.

表4呈现了本文方法与近期在nuScenes数据集上基于图像的方法在各类别的平均精度上的对比情况. 由表4可知,本研究的方法在各类别的平均精度方面超越了大多数近期基于图像的方法. 但值得注意的是,在行人和自行车类别的平均精度上,本文方法却低于PGD算法. 这是由于PGD算法融入了几何约束,从而能够更为有效地检测到较小的目标. 为评估所提方法效果,表5展示了详细的消融实验结果. 实验将3D注意力模块和多目标边框模块逐一加入基准模型,结果表明这些模块的缺失会降低性能,从而证实了它们在提高整体性能中的关键作用. 与移除任一模块相比,这些模块的保留能显著增强性能,进一步证明了本文方法的有效性. 3D注意力模块的消融实验结果见表5中的(b),与基准模型相比,NDS提升7.8%,mAP提升4.4%. 这表明仅添加3D注意力模块在NDS和mAP指标方面优于基准模型,有效地增强了三维结构的细致表达,进而提高了深度预测的精度. 表5中的(c)显示,与基准模型相比,仅引入多目标边框模块的模型性能更佳. 这源于多目标边框模块利用伪标签解除原标签限制,从而提升模型的泛化性能. 这证实了多目标边框模块可以提高模型的深度估计精度,进一步优化单目3D目标检测.

图8可知, 现有评价指标次优的PGD算法难以有效检测远距离的小目标和被遮挡的物体,同时容易受到周围环境的干扰而产生误检. 在这些场景中,本文方法可以较为准确预测远距离的小目标和受遮挡物体,表明本文方法具备获取精细3D结构的能力,且有较强的整体感知能力,进而提升单目3D目标检测的精度. 然而,图8(b)均未能检测出绿色矩形框内的截断车辆,主要由其距离过远且训练样本不足造成的.图8(d)中本文方法未能检测到交通锥,这是由其训练样本远少于nuScenes数据集中的小汽车所致. 有限的训练数据使网络难以准确识别这些类别,导致检测性能不稳定,这也是大多数单目3D目标检测器的共性问题. 因此,关键的研究方向是运用数据增强技术(如扩散模型)增加数据集中样本较少的三维物体检测数据. 此外,相较于简单的2D目标检测任务,3D目标检测INT8量化的校准文件更难取得,下一步工作是创建此类校准文件.

4 结 论

1)针对单目3D目标检测存在深度模糊性的问题,通过在每个原始对象的视锥面上调整边界框,并显式地添加合适的伪标签,有效提高深度估计训练的稳定性.

2)提出一种专为单目3D目标检测设计的注意力机制,提高深度估计的准确性,且在准确描绘3D空间信息的同时兼顾计算效率. 在Jetson AGX Xavier和Jetson Orin NX(16 GB)嵌入式平台上,推理时间分别为每帧67 ms和89 ms,满足自动驾驶实时需求.

3)在大型数据集nuScenes上,与当前流行的单目3D目标检测方法相比,该方法在NDS和mAP指标上分别有所提升.

未来研究将聚焦于扩散模型在稀缺类别样本增强训练数据集及融合时间序列信息的应用,以提升本文方法的性能.

参考文献

[1]

霍威乐,荆涛,任爽 .面向自动驾驶的三维目标检测综述[J].计算机科学202350(7):107-118.

[2]

HUO W LJING TREN S .Review of 3D object detection for autonomous driving[J].Computer Science202350(7):107-118.(in Chinese)

[3]

凌传武, 陈华, 徐大勇, .基于语义辅助和深度时序一致性约束的自监督单目深度估计[J].湖南大学学报(自然科学版)202451(8): 1-12.

[4]

LING C WCHEN HXU D Yet al .Self-supervised monocular depth estimation based on semantic assistance and depth temporal consistency constraints[J].Journal of Hunan University (Natural Sciences)202451(8): 1-12.(in Chinese)

[5]

WANG TXINGE Z H UPANG Jet al. Probabilistic and geometric depth: detecting objects in perspective[C]//Conference on Robot Learning (CoRL). Auckland, New Zealand: PMLR, 2022: 1475-1485.

[6]

WANG G JWU JTIAN Bet al. CenterNet3D: an anchor free object detector for point cloud[J]. IEEE Transactions on Intelligent Transportation Systems202123(8): 12953-12965.

[7]

LIU Z CWU Z ZTOTH R .SMOKE:single-stage monocular 3D object detection via keypoint estimation[C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), June 14-19,2020. Seattle,WA,USA:IEEE,2020:4289-4298.

[8]

WANG TZHU X GPANG J Met al .FCOS3D:fully convolutional one-stage monocular 3D object detection[C]//2021 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), October 11-17, 2021. Montreal,BC,Canada:IEEE,2021:913-922.

[9]

LIU X PXUE NWU T F. Learning auxiliary monocular contexts helps monocular 3D object detection[J]. Proceedings of the AAAI Conference on Artificial Intelligence202236(2): 1810-1818.

[10]

VASWANI ASHAZEER NPARMAR Net al. Attention is all you need[J]. Advances in Neural Information Processing Systems201730: 5998-6008.

[11]

HUANG KWU TSU Het al .MonoDTR:monocular 3D object detection with depth-aware transformer[C]//2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), June 18-24,2022. New Orleans,LA,USA:IEEE,2022:4002-4011.

[12]

ZHANG R RQIU HWANG Tet al. MonoDETR:depth-guided transformer for monocular 3D object detection[C]//2023 IEEE/CVF International Conference on Computer Vision (ICCV),October 1-6,2023. Paris,France:IEEE,2023: 9121-9132.

[13]

ZHOU Y SZHU H ZLIU Qet al. MonoATT:online monocular 3D object detection with adaptive token transformer[C]//2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), June 17-24,2023.Vancouver, BC,Canada:IEEE, 2023: 17493-17503.

[14]

YAN L FYAN PXIONG S Zet al .MonoCD:monocular 3D object detection with complementary depths[C]//2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), June 16-22,2024.Seattle,WA,USA:IEEE,2024:10248-10257.

[15]

LU YMA X ZYANG Let al .Geometry uncertainty projection network for monocular 3D object detection[C]//2021 IEEE/CVF International Conference on Computer Vision (ICCV), October 10-17,2021. Montreal,QC,Canada:IEEE,2021:3091-3101.

[16]

SHI X PYE QCHEN X Zet al .Geometry-based distance decomposition for monocular 3D object detection[C]//2021 IEEE/CVF International Conference on Computer Vision (ICCV),October 10-17,2021. Montreal,QC,Canada:IEEE,2021:15152-15161.

[17]

MOUSAVIAN AANGUELOV DFLYNN Jet al .3D bounding box estimation using deep learning and geometry[C]//2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR),July 21-26,2017. Honolulu,HI,USA:IEEE,2017:5632-5640.

[18]

ZHANG Y PLU J WZHOU J .Objects are different:flexible monocular 3D object detection[C]//2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), June 20-25, 2021. Nashville, TN, USA: IEEE, 2021: 3288-3297.

[19]

CHEN Y JTAI LSUN Ket al .MonoPair:monocular 3D object detection using pairwise spatial relationships[C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), June 13-19,2020. Seattle, WA, USA: IEEE, 2020:12090-12099.

[20]

XU HGUO M TNEDJAH Net al .Vehicle and pedestrian detection algorithm based on lightweight YOLOv3-Promote and semi-precision acceleration[J].IEEE Transactions on Intelligent Transportation Systems202223(10): 19760-19771.

[21]

DAI BLI CLIN Tet al .Field robot environment sensing technology based on TensorRT[M]//Intelligent Robotics and Applications. Cham:Springer International Publishing,2021:370-377.

[22]

TANG Y ZQIAN Y. High-speed railway track components inspection framework based on YOLOv8 with high-performance model deployment[J]. High-speed Railway20242(1): 42-50.

[23]

ZHANG J FSONG Q ZYU J. A transformer based complex-YOLOv4-trans for 3D point cloud object detection on embedded device[J]. Journal of Physics:Conference Series20222404(1): 012026.

[24]

LIU Z JTANG H TAMINI Aet al .BEVFusion:multi-task multi-sensor fusion with unified bird’s-eye view representation[C]//2023 IEEE International Conference on Robotics and Automation (ICRA), May 29 - June 2, 2023. London,United Kingdom: IEEE, 2023: 2774-2781.

[25]

TAY Y, DEHGHANI MBAHRI Det al .Efficient transformers:a survey[J].ACM Computing Surveys202355(6):1-28.

[26]

CAI HLI JHU Met al. Efficientvit: multi-scale linear attention for high-resolution dense prediction [C]//Proceedings of the IEEE/CVF International Conference on Computer Vision. Paris, France: IEEE, 2023: 17302-17313.

[27]

刘青, 李伟, 余少勇, . 结合深度信息引导和多尺度通道注意力机制的单目三维目标检测算法[J]. 山东大学学报(理学版)202560(1): 63-73.

[28]

LIU QLI WYU S Yet al. Monocular 3D object detection algorithm combining depth guidance and multi-scale channel attention mechanism[J]. Journal of Shandong University (Natural Science)202560(1): 63-73.(in Chinese)

[29]

HUANG C XHE TREN H Det al .OBMO:one bounding box multiple objects for monocular 3D object detection[J].IEEE Transactions on Image Processing202332: 6570-6581.

[30]

NABATI RQI H R .CenterFusion:center-based radar and camera fusion for 3D object detection[C]//2021 IEEE Winter Conference on Applications of Computer Vision (WACV),January 3-8,2021.Waikoloa,HI,USA:IEEE,2021:1526-1535.

[31]

YIN T WZHOU X YKRAHENBUHL P .Center-based 3D object detection and tracking[C]//2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), June 20-25,2021. Nashville, TN, USA: IEEE, 2021: 11779-11788.

[32]

LANG A HVORA SCAESAR Het al .PointPillars:fast encoders for object detection from point clouds[C]//2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), June 15-20,2019. Long Beach,CA,USA:IEEE,2019:12689-12697.

[33]

SIMONELLI ABULO S RPORZI Let al .Disentangling monocular 3D object detection[C]//2019 IEEE/CVF International Conference on Computer Vision (ICCV), October 27-November 2, 2019. Seoul, Korea: IEEE, 2019: 1991-1999.

[34]

WANG B LZHENG H WZHANG Let al. BEVRefiner:improving 3D object detection in bird’s-eye-view via dual refinement[J]. IEEE Transactions on Intelligent Transportation Systems202425(10): 15094-15105.

基金资助

国家自然科学基金资助项目(52072054)

National Natural ScienceFoundation of China(52072054)

重庆交通大学研究生科研创新项目(YYK202405)

Research and Innovation Program for Graduate Students in Chongqing Jiaotong University(YYK202405)

AI Summary AI Mindmap
PDF (4504KB)

462

访问

0

被引

详细

导航
相关文章

AI思维导图

/