SVPLP-SLAM:一种基于点-线-面特征融合并带有假定平面约束的RGB-D视觉SLAM

杨磊 ,  陈杰 ,  唐天航 ,  刘怡光

四川大学学报(自然科学版) ›› 2026, Vol. 63 ›› Issue (03) : 250328 -250328.

PDF (1686KB)
四川大学学报(自然科学版) ›› 2026, Vol. 63 ›› Issue (03) : 250328 -250328. DOI: 10.19907/j.0490-6756.250328
计算机科学

SVPLP-SLAM:一种基于点-线-面特征融合并带有假定平面约束的RGB-D视觉SLAM

作者信息 +

SVPLP-SLAM: An RGB-D visual SLAM using point-line-plane feature fusion with supposed plane constraints

Author information +
文章历史 +
PDF (1725K)

摘要

传统的RGB-D视觉SLAM(Visual Simultaneous Localization and Mapping, vSLAM)系统主要依赖于单一特征或简单的组合特征进行定位和建图。然而,此类方法往往无法实现较高的定位准确度,并且在纹理少、噪声大的场景中构建出的地图精度较差。相比之下,多特征融合在降低定位误差方面展示出卓越的性能,同时还能增强系统的鲁棒性。因此,本文提出了一种新颖的基于点-线-面特征融合并带有假定平面约束的RGB-D视觉SLAM系统(SVPLP-SLAM)。该系统集成点特征、线特征和平面特征进行定位和建图,通过使用RGB-D相机从彩色图像中提取点特征和线特征,从深度图像中提取平面特征,采用关联匹配和长度抑制策略,剔除无效的长距离短线特征,使用假定平面作为边缘约束,获得具有正交结构的平面特征。线特征和平面特征的引入可以有效减少跟踪模块所需的特征数量,从而降低光束法平差 (Bundle Adjustment, BA)优化的计算复杂度。最后,采用绝对轨迹误差(Absolute Trajectory Errors, ATEs)的均方根误差(Root Mean Squate Error, RMSE)作为依据,在TUM RGB-D和ICL-NUIM数据集上的实验结果证明,在定位精度上,该方法优于当前主流方法。

Abstract

Traditional RGB-D Visual Simultaneous Localization and Mapping (vSLAM) systems rely predominantly on a single kind of feature or a simplistic combination of features.However, such approaches often fail to achieve optimal accuracy and mapping completeness, particularly in scenarios characterized by low texture and significant noise.In contrast,the fusion of multiple features has shown superior performance in mitigating localization inaccuracies while simultaneously enhancing robustness.Therefore, this paper proposes a novel RGB-D Visual SLAM system Using Point-Line-Plane Feature Fusion with Supposed Plane Constraints (SVPLP-SLAM) that synergistically integrates point features, line features, and plane features for localization and mapping.The system uses an RGB-D camera to extract point features and line features from the RGB images, and plane features from the depth images.By employing correlation matching and length suppression strategies, invalid long-distance short line features can be eliminated.Using supposed planes as edge constraints, the system can obtain plane features with orthogonal structures.The introduction of line features and plane features can effectively decrease the number of features required by the tracking module, thereby reducing the computational complexity of Bundle Adjustment (BA) optimization.Finally, using the root mean square error (RMSE) of absolute trajectory errors (ATEs) as a basis, extensive experiments on the TUM RGB-D and ICL-NUIM datasets verify that the proposed method outperforms current mainstream methods in terms of localization accuracy.

Graphical abstract

关键词

同时定位与建图 / RBG-D视觉 / 多特征融合 / 光束法平差 / 关联匹配 / 假定平面约束

Key words

simultaneous localization and mapping / RGB-D Visual / multi-feature fusion / bundle adjustment / association matching / supposed plane constraints

引用本文

引用格式 ▾
杨磊,陈杰,唐天航,刘怡光. SVPLP-SLAM:一种基于点-线-面特征融合并带有假定平面约束的RGB-D视觉SLAM[J]. 四川大学学报(自然科学版), 2026, 63(03): 250328-250328 DOI:10.19907/j.0490-6756.250328

登录浏览全文

4963

注册一个新账户 忘记密码

视觉SLAM利用图像信息提取特征进行跟踪和建图1。许多依赖于单一特征或简单特征组合的系统,在相机快速运动或环境噪声较大的情况下,往往难以保持稳定的跟踪,从而导致生成的地图精度大幅降低2。线条和平面是常见的结构元素,它们包含关于场景空间布局、几何形状和环境表面的关键结构信息,利用这类包含更为丰富的信息特征,可以提高SLAM系统构建地图的准确度以及追踪过程中的定位精度。
与单目相机和双目相机相比,RGB-D相机利用硬件直接捕获像素级深度信息,即使在动态环境或物体遮挡的情况下也能提供更精确的深度数据。因此,RGB-D相机在视觉SLAM领域的应用日益广泛。目前常见的利用RGB-D相机获取信息的SLAM系统有ElasticFusion3和ESLAM4
线特征是与点特征紧密相关的高级特征。将线特征集成到SLAM系统中,可以显著增强相机跟踪的稳定性。以前的PL-SLAM系统5-6直接使用线段检测器(Line Segment Detector,LSD)7算法来检测线特征,这就导致提取到大量无效的长距离短线特征。这种方法不仅使线特征匹配变得复杂,而且会导致大量计算资源的浪费。基于上述缘由,本文方法中剔除掉无效的线特征,只保留有效的线特征,同时由于端点表示的三维线段在方向上存在模糊性。因此,在本文中,我们采用普吕克坐标系来表示三维线段。
平面是人造环境中最常见的几何结构,其特点是受测量噪声的影响小。平面特征可以从深度图像中分割获得,其特有的稳定性有效地降低了累积误差。在平面SLAM8-10中,迭代最近点(Iterative Closest Point,ICP)和随机样本一致性(Random Sample Consensus,RANSAC)常用于匹配和优化,其用平面作为特征,可以用更少的参数表示更大的场景,同时提高SLAM系统的定位精度。目前,大多数基于平面的SLAM系统都建立在曼哈顿世界假设11的基础上,利用环境中的垂直信息来确定传感器与曼哈顿世界之间的旋转矩阵,从而计算传感器不同位置之间的旋转矩阵。然而,基于曼哈顿世界假设的平面SLAM,在非结构化环境中的性能相对较差。本文方法从深度图像中提取的点云数据重建平面,通过检测平面的边缘生成假定平面,并利用这些假定平面来加强真实平面的约束,同时添加平面的结构(正交或垂直)约束,增强在非结构化环境中的性能。
本文的主要贡献有3个方面:1) 提出了一种基于多特征融合的RGB-D视觉SLAM系统,该系统融合了点特征、线特征和平面特征用于跟踪,并且引入各种信息进行优化; 2) 从平面中提取边缘线条来生成假定平面,增强真实平面的约束,并结合垂直和平行等结构化约束来优化位姿;3) 对线特征进行关联匹配和长度抑制策略筛选,并添加平面特征,从而减少建图所需的特征数量,实现以更少的参数构建出更大的场景。

1 相关工作

1.1 基于单一特征的视觉SLAM

基于单一特征的视觉SLAM系统主要依靠点特征或线特征进行跟踪和建图。这类SLAM系统的优势在于简化了特征提取和筛选的步骤,从而大幅提高实时性能。目前大多数单一特征系统主要基于点特征进行定位跟踪。例如,ORB-SLAM212和ORB-SLAM313,利用ORB点特征进行图像特征提取和匹配。Su等14设计了一种基于混合点特征的视觉SLAM方法,依靠混合词袋(H-BoW)模型来处理混合点特征的匹配。Bird等15则从不同角度提取点特征,通过共享特征信息,实现去中心化的SLAM系统。Lemaire等16提出了基于普吕克坐标系表示三维线段的单一线特征视觉SLAM方法,并使用扩展卡尔曼滤波器 (Extended Kalman Filter,EKF) 更新地标状态。这些单一特征系统在特定场景下表现稳定,但是在单一特征数量有限的环境中,它们的准确性和鲁棒性相对较差。

1.2 基于特征融合的视觉SLAM

基于特征融合的视觉 SLAM 通过有效整合各种几何特征(例如点、线和面)来实现定位和建图。Gomez-Ojeda等17提出了一种点线融合方法,通过融合线特征有效地解决了由于点特征不足而产生的误差。Kaess等18设计出一种点面融合方法,该方法通过融合平面特征以实现更精确的地图构建。Lusk等19构造出将线条和平面表示为仿射格拉斯曼流形元素的结构,并证明了该结构具有高效且鲁棒的图论数据关联能力。Yang等20以统一的方式表示点特征、线特征和平面特征的融合,并设计了一种关联方案来减少匹配误差。此外,近年来,基于神经辐射场的SLAM技术取得突破性进展。Wang等21采用坐标和平面联合编码的方式,通过展平特征空间降低了特征存储的难度,并将物体特征与场景特征融合起来建图。Papatheodorou等22提出一种基于局部子地图的微型飞行器(Micro Aerial Vehicle,MAV)探索框架,将视觉特征同雷达数据与惯性信息融合到一起,从而实现飞行器的自主搜索和定位建图。综上所述,与基于单一特征的视觉SLAM系统相比,基于多特征融合的系统表现出更高的准确性和稳定性。

2 方法

本节将详细介绍我们提出的方法,并重点描述所做出的改进和创新。本文提出的系统是一个基于ORB-SLAM212构建的RGB-D 视觉SLAM系统,利用RGB图像和深度图像作为数据输入。系统框架的工作流程如图1所示。

2.1 基于点-线-面特征融合的RGB-D视觉SLAM

SLAM系统的主要功能是实时定位和地图构建。除了点特征之外,我们还引入了其他高级特征(线特征和平面特征)来提升系统性能。因此,我们需要采用一种合适的方法来对提取到的线特征进行表示,以实现高效的特征匹配。此外,我们综合利用平面的轮廓、边缘与尺寸等信息来生成假定平面,从而对真实平面进行约束。对于平面匹配,我们引入了一种高效的匹配算法23。最后,我们利用重投影误差来优化点、线和平面的位置,从而获得更准确的空间坐标,并构建出准确且一致的环境地图。

1) 线的普吕克坐标表示。典型的空间线段使用两个端点来进行表示,这样做的好处是表示起来简单,但不适用于位姿估计问题。由于障碍物遮挡和视线变化,常会导致无法准确提取到线段的两个端点。因此,本文中我们采用普吕克坐标表示线特征。一条三维直线在普吕克坐标系下可表示为一个6自由度的向量L=mT,dTT,其中mR3,表示的是反投影平面(即相机中心与直线构成的平面)的法向量,dR3,表示直线的方向向量,二者之间满足mTd=0的约束,如图2a所示。参考空间点从世界坐标系到相机坐标系的转换,给定一个变换矩阵Tcw=Rcw,tcw从平面πw转换到平面πc,其中RcwSO(3)tcwR3分别表示旋转和平移,然后将直线投影到图像平面:

Lc=mcdc=TcwLw=Rcwtcw×Rcw0Rcwmwdw

其中,LcLwπc中的普吕克坐标表示。接下来,将Lc变换得到投影线条l=[l1,l2,l3]T=KLmc24。其中,KL是直线投影矩阵,mc为直线的反投影平面法向量可以由式(1)得到。

2) 普吕克坐标的正交表示。由于普吕克坐标是过度参数化的,当满足mTd=0的约束时,表示有5个自由度三维直线25。Zhang等24已经验证普吕克坐标最少可用4个参数的标准正交表示来进行描述,它在收敛方面有不错的表现。在本文中,我们使用正交表示来进行线特征的迭代优化。Lw=mwT,dwTT的正交表示为(U,W)SO(3)×SO(2),通过使用对应QR分解26得到:

mw|dw=Uω100ω200, set:W=ω1ω2-ω2ω1

其中,ω1ω2是两个标量参数,用于对直线方向进行低维参数化。 U 是三维正交旋转矩阵,用于将局部参数化结果映射到世界坐标系下的三维空间。 W 是具有旋转-缩放结构的二维矩阵,其缩放因子为:w12+w22,用于在优化过程中保持方向表示的结构一致性,并避免方向发生退化。设Rθ )= URα)= W,则对应相关的旋转变换计算方式为:

R(θ)=[u1,u2,u3]=           mwmw,dwdw,mw×dwmw×dwR(α)=ω1ω2-ω2ω1=cos α-sin αsin αcos α=           1(mw2+dw2)mw-dwdwmw

其中, θ 是一个三维向量,α是一个标量。因此标准正交表示(U,W)可以恢复为普吕克坐标表示:

Lw=ω1u1T,ω2u2T

其中,ω1ω2u1u2可以通过式(3)获得。在优化步骤结束后,转换为普吕克坐标表示线特征,以便后续进行可视化操作,该过程使用局部光束法平差进行调整。

3) 线条三角化。利用前向投影,从不同相机视角c1c2中,构建出由观测点与图像平面的线段所确定的平面π1(c1,Lw)π2(c2,Lw)。在空间中重建线条Lw时,只需满足两个平面相交即可实现,如图2b所示。线条的普吕克坐标Lw=mwT,dwTTR6可从对偶普吕克矩阵Lw*25中获取:

Lw*=[dw]×mw-mwT0=π1π2T-π2π1T

其中, ×表示三维向量的反对称矩阵。借此求出对应的对偶普吕克矩阵。

4) 线条筛除和匹配。由于普吕克坐标表示的是一条无限直线,所以我们借助LSD算法提取线段并估算出线段的端点。为了拒绝过短的线段,我们采用一种长度抑制策略26,设置线段的最小长度阈值Lmin=η*minW,H,其中minW,H表示输入图像的长度和宽度之间的最小值,η为比值因子,本次工作中该值设置为0.125。引入端点剪枝27,通过拒绝迭代局部BA优化中的端点异常值,来筛除不合理的线条以及对重投影误差进行χ2分布检验;计算优化后的线条的端点对于场景中位深度的变化,来判断线条是否为异常值28。在进行匹配时,利用LBD描述符29对线段进行跨帧匹配。使用汉明距离作为度量方法来计算描述符之间的相似度,选择距离值最小的线段为匹配线段。

5) 平面分割和表示。平面从深度图生成的有组织的点云数据中提取分割出来,如图3a所示。深度图像包含每个像素到相机的相对距离,由此可以获取到 RGB 图像中每个像素对应的深度信息。通过使用针孔相机模型对像素进行反向投影,可以恢复场景的空间结构,同时利用深度图像生成点云的几何结构,可以实现高效的平面分割30。为了简化平面的表示,使用Hessian形式π=nT,dT进行参数化,其中n表示平面的法向量,d为平面到原点的距离。

6) 平面拟合与合并。本文采用随机样本一致(RANSAC)算法,基于多个非共线空间点进行平面拟合,借助三维点与平面之间的相互关系,利用几何关系距离最小化拟合平面,如图3b所示。平面可以简单表示为π=nT,dT,通过3个不同点p1p2p3便可以计算得到。假设平面内两个相交向量p1p2=l,m,n, p1p3=(o,p,q),平面法向量nT可以表示为:

nT=p1p2× p1p3=mq-np,no-lq,lp-om

在平面的标准方程中,利用点到平面的距离公式,计算得到第4个参数d的值。初步拟合平面后,设立距离阈值,将分割的点云数据划分为内点与外点,剔除外点所在的平面后,将所有内点所处的平面计算合并为一个更大的平面。

7) 平面边缘约束与匹配。由于Hessian形式参数化表示的是一个无限平面,但真实场景中的平面是有边界的,因此仅简单使用4个参数不能准确表达真实平面,如图4a所示。此外,单帧无法观察到很多平面,会产生姿态估计约束不足的问题,因此需要从平面边缘获取更多信息来估计真实场景下的相机姿态。为了给平面添加约束,我们可以从提取的平面边缘线条计算生成一个假定的垂直平面。通过生成的假定平面来约束真实平面的边界,进而得到真实平面的尺寸大小,为保证界面显示简洁和减少渲染开销,生成的假定平面不做可视化。我们从平面的轮廓边界提取边缘线条,边缘线条可以表示为:

l=plT,nlTT= px, py, pz, nx, ny, nzT

其中,plT是边缘线条上一点,nlT是边缘线条的方向向量。

利用提取到的边缘线条计算生成假定的垂直平面,借助平面πi=niT,diT和边缘线条lj=(pjT,njT)T来表示假定平面πsup

πsup=nijdij=ni×nj-nijTpj

图4b所示,我们采用相应的平面分割算法提取出箱子的3个平面,对于不同平面采用不同颜色表示,红色点所在线条为平面边缘线条,绿色平面为计算生成的假定平面。

由于假定平面是由边缘线条生成的垂直平面,因此假定平面的法向量与边缘线条正交。通过计算假定平面的法向量是否正交,可以判断真实平面是否正交,并保留具有正交结构的平面用于后续映射。

以前的平面匹配工作1831只通过法向量nT和距离d来找到它们之间的对应关系,但这种方式无法适用于复杂环境。复杂环境中的平面具有噪声,计算出的距离会产生较大幅度的改变,导致无法较好地进行匹配。本工作使用一种新的平面匹配算法,以便更好地实现数据关联。该方法利用平面特征的相交角度来寻找对应的关联关系,本次研究中的角度阈值设置为30°。为了寻找相交平面,我们需要计算观测平面上的点到平面地标的距离。为减少计算量,我们只检查平面分割过程中获取的轮廓中的点p,并借助距离阈值做判断:

s=min nTp+d

如果s小于距离阈值(实验中取0.1 m),则认为平面相交,然后通过检查平面夹角确定对应平面。对于每一个观测平面,我们尝试在全局地图中找到一个满足条件的s最小值当作对应平面。如果一个观测平面找不到符合条件的s,那么视为关联失败,该平面会被当作新的平面地标添加到全局地图中。

2.2 因子图和姿态估计

SLAM中常使用因子图来进行数据关联与地图构建,以此完成对相机位姿的优化。本工作借助因子图来对系统进行优化,以实现高效的位姿估计和精准的地图构建,如图5所示。

图5中黑色小方块代表对应特征的约束因子,粉色圆圈代表关键帧姿态,绿色圆圈代表点特征节点,蓝色圆圈代表线特征节点,黄色代表平面特征节点,S1S2表示平面特征的结构化约束,sp1表示计算生成的假定平面约束。

最简单的基于点的SLAM可以用图5a中的因子图表示。因子m是基于点的SLAM系统中与重投影误差相关的约束因子。由此我们可以得到点的约束条件:

fmPw,Tcw=[upoint-ρpoint(TcwPw)]Σm

其中,Pw是相机坐标系中的三维点,Tcw是从相机坐标系到世界坐标系的变换矩阵,ρpoint是三维点到图像平面的映射函数,upoint是图像中对应的点。同理,基于点线的SLAM也可以用因子图表示。如图5b所示,n是与线段相关的重投影约束因子,线段的投影可以通过计算两个端点的投影来推导出线段重投影误差的约束条件:

fnLw,Tcw=[(uline-ρline(TcwLw)]Σn

其中,Lw是相机坐标系中的三维线段,ρline是三维线段对应的映射函数,uline是图像中对应的线段。

平面也可以作为地标添加到因子图中,如图5c所示,k是平面相关的约束因子。由于平面在三维空间中只有3个自由度,而上述提出的Hessian形式π=nT,dT的平面表示是过度参数化的。为了解决这个问题,我们在优化平面时选择另一种最小参数化的形式τ=qπ=(ϕ,ψ,d),其中ϕψ分别表示法线的方位角和俯仰角。

qπ=ϕ=arctan nynx,ψ=arcsin nz,dT

为避免优化平面时产生奇异性,方位角和俯仰角被限制在(-π,π)内。平面的相关约束条件如下:

fkπw,Tcw=[q(πk)-q(Tcw-Tπw)]Σk

其中,πw是相机坐标系中的三维平面,πk是当前帧中对应的平面观测值。

此外,为了优化姿态估计,我们还引入了与结构化相关的因子S并添加平行与垂直几何约束,如图5d所示。平行约束和垂直约束可以减少累积的漂移误差并利用环境中的结构信息纠正位姿误差带来的地图不一致问题,从而提高建图的质量。平行约束与垂直约束的计算公式如下:

fspπw,Tcw=qnnm-qnRcwnwΣsp,fso(πw,Tcw)=qn(Rnm)-qn(Rcwnw)Σso

其中,qn表示方位角和俯仰角见式(12)R是附加旋转矩阵,用于调整法线的方向。

在局部地图中,点、线和平面用于优化当前位姿Tcw,并通过以下公式得到:

Tcw=argminTcw[ΣmHm(fm)+ΣnHn(v)+ΣkHk(fk)+ΣspHsp(fsp)+ΣsoHso(fso)]

其中,H为Huber鲁棒代价函数,Σ为对应的协方差矩阵。

2.3 环路检测和全局优化

环路检测机制的目的是消除长期运行中由于累计误差导致的轨迹漂移,提升地图的一致性与准确性。

在本文工作中,回环检测依赖于图像中的点特征和线特征信息。文献[17]使用LBD描述符29来重建词袋,以解决与位置识别相关的问题。而我们在此基础上,加入基于ORB点特征32构建的词袋DBoW233来进行回环检测。回环检测需要计算两帧之间的相似度,才能从历史帧中识别出与当前帧存在回环关系的候选帧。对于点特征而言,其相似度计算公式如下式所示。

Spoint=sRt01R4×4

参考点特征的相似变换,我们可以计算线特征的相似变换28

Sline=sR[t]×R0RR6×6

其中,s是两者共享相同的尺度因子,R表示旋转矩阵,t表示平移矩阵,[t]×t的反对称矩阵。

因此,我们可以采用点云定位中使用的回环校正方法来校正线特征的位置误差13。为了校正由姿态漂移引起的累积误差,我们采用一个单独的线程,该线程利用g2o34进行图优化。当回环校正机制被触发时,系统执行图优化,调整相机姿态和各种地标的位置,并最小化关键帧之间的约束误差。最后,我们构建出一个保持全局一致性的地图。

3 实验

我们在TUM RGB-D35和ICL-NUIM36 数据集上进行了实验,评估了SVPLP-SLAM的定位精度。在实验中,我们使用绝对轨迹误差 (Absolute Trajectory Error,ATE) 的均方根误差 (Root Mean Square Error,RMSE) 作为评价指标。在消融实验中,我们分析了不同模块对于定位精度的影响。此外,我们还分析了每一个加入的特征模块对于SVPLP-SLAM追踪时长的影响。实验中使用的基线是 ORB-SLAM212,其中sp表示假定平面约束,表格中的实验数据均为10次实验所得数据的平均值。

3.1 消融实验分析

为了评估不同特征模块对于系统的影响,我们在ICL NUIM数据集和TUM RGB-D数据集上各选取了4个序列进行消融实验。由于基线在某些提取特征数量有限的序列上无法正常运行,因此,我们调整了这类序列的特征阈值。如表1所示,消融实验结果证明了多特征融合可以有效提高定位精度。

同时,表1也证明了假定平面约束能够增强平面特征约束,减少系统的误差。对比表1中第2列与第3列的数据可以发现,多数场景下对于减少定位误差而言,平面特征的加入比线特征更为有效,这是由于平面特征自身的稳定性要高于线特征。将表1中第2列与第3列的数据分别与第4列数据作比较可以发现,线特征和平面特征的融合可以有效提高定位精度,也验证了大多数实验场景下,在点特征的基础上同时加入线特征和平面特征,比分别加入单个特征所带来的精度提升要更加明显。通过比较表中第4列与第5列的数据可以发现,假定平面约束可以增强平面特征的边缘约束,减少系统运行所产生的累积误差,进而提高系统的定位准确度。

图6所示,通过对比点-线SLAM与点-线-面SLAM的APE值,我们发现平面特征的加入有效降低了系统计算位姿时产生的误差,这有助于后续构建出一致性的地图。结合图7中关于APE值随时间的变化趋势可以看出,由于提取和局部优化平面特征更加耗时,因此在系统开始阶段点-线SLAM的表现要优于点-线-面SLAM,但随时间的推移,后者的效果要好于前者。从图8在fr1/desk场景序列下关于点-线SLAM及点-线-面SLAM的轨迹估计值与真值之间的对比中不难看出,平面特征的加入使估计轨迹与真实轨迹更为接近。尽管在多个数据序列中,点-线SLAM系统与点-线-面SLAM系统的定位性能相差不大,但是带有平面特征的SLAM系统表现的还是更为出色。加入平面约束后,由于平面约束的长效性,可以有效减少累计误差,建立其更为长期的位姿约束,为后续解算位姿节约资源消耗。此外,实验结果还进一步表明,在fr3/str_notex_far、fr3/str_tex_far和fr1/desk这类平面特征数量较多的场景中,假定平面约束产生的影响很小。

3.2 ICL-NUIM数据集实验结果

ICL-NUIM数据集主要收集来自两种场景的数据:客厅和办公室。我们从每种场景中选取了3个序列,并将其与7种主流的视觉SLAM方法21232837-40进行了比较。为了直观地比较这些方法之间的差异,我们计算了不同方法在ICL-NUIM数据集6个序列上的绝对轨迹误差的均方根误差。

表2所示,本文方法在3个序列中取得了最佳结果。其中,PL-GM SLAM在office0序列中取得不错结果,该序列中可提取到足够的线特征数量,这保证了在定位跟踪阶段的准确度。从表2的数据可以看出,FI-SLAM在2个序列中取得了比SVPLP SLAM更好的结果。产生这个结果的原因是FI-SLAM采用神经辐射场实现特征融合,在room2和office2场景下物体特征与场景特征的联合编码效率更高,因而定位更加准确。SP-SLAM借助点面特征进行追踪,在纹理较少的场景下,难以提取到足够数量的特征,导致定位不够准确。Manhattn SLAM与Structure PLP-SLAM都是采用点线面3种特征融合的系统,因此可以提取到足够的特征进行定位,但是前者采用平面正交的方式处理平面,在非结构化场景下的效果不佳,后者消除累计误差时,没有使用平面特征导致定位精度降低。SELM‑SLAM3与PLPM‑SLAM在大多数场景下表现优秀,但在快速运动情况下无法有效完成连续帧之间的特征匹配,从而导致准确度较低,并且由于前者采用深度学习网络来优化位姿,因此其实时性不如其他方法。实验结果表明,尽管在部分办公室场景下的定位精度存在不足之处,但在整体性能方面本文方法最优。

实验结果证明,SVPLP-SLAM在办公室场景中的性能并非最佳,原因就在于办公场景中存在大量微小平面,提取这些平面的边缘线条会产生大量假定平面约束。过多的假定平面约束会导致冗余约束,反而导致了本文方法在这类场景下的定位精度下降。此外,大量的平面约束会增加优化时的计算开销,降低系统的性能,使办公室场景建图任务变得更具挑战性。

3.3 TUM RGB-D数据集实验结果

TUM RGB-D数据集包含从RGB-D相机中采集到的图像数据和深度数据。为了对所提出的系统进行更详细的评估,我们从TUM RGB-D 数据集中选择了9个序列,并将本方法与8种主流方法32023283740-42进行了比较。

实验结果如表3所示,RGB-D SLAM使用单一点特征来进行定位追踪,在低纹理情况下无法取得较好效果。PLPM-SLAM利用正交曼哈顿约束优化平面并在非结构化场景下采用消失点引导的联合优化模型来提高几何一致性,但是由于曼哈顿假设的局限性,该方法在倾斜或自由方向上会产生姿态估计错误的问题。与PL-GM SLAM相比,本文方法结合了平面特征。平面特征具有很强的稳定性,且计算简单,仅需少量参数即可描述。因此,在可以提取到平面特征的序列中,如在室内大场景fr3/long_office和存在回环的场景fr2/large_loop中,本文方法被证明更有效。与采用点面特征的SP-SLAM和STING-SLAM相比,在序列fr3/str_tex_far和fr3/str_notex_far中,可用的平面特征有限,SVPLP-SLAM利用线特征弥补特征不足的缺点,增强追踪过程中的稳定性。通过融合线特征,SVPLP-SLAM可以在跟踪过程中增加特征数量,这有助于提高系统的精度和稳定性。ElasticFusion采用直接法借助surfel完成定位建图,由于其基于光度一致性假设,在光照变化和快速运动的序列中误差较大。与UPLP-SLAM相比,对于线特征本文方法采用长度抑制策略筛选掉远距离的短线特征,同时加入假定平面约束和结构化约束来限制平面特征的范围,因而在定位追踪过程中能够保证特征的有效性,减少累计误差。Structure PLP-SLAM利用PlaneRecNet43获取平面特征,但获取的平面特征不参与定位,它本质上仍然使用点特征和线特征进行跟踪,这导致平面特征在定位追踪阶段没有发挥作用。此外,在表3的9个序列中,这3种方法在某些数据序列中无法获得足够特征进行定位跟踪,进而导致建图失败。而本文方法对表中所有序列均可稳定进行定位跟踪,这证明了SVPLP-SLAM的鲁棒性,同时在能够有效进行定位与跟踪的情况下,将我们提出的方法与其他3种方法分别进行比较,结果证明本文方法最优。

3.4 追踪时间分析

为了研究系统不同模块对跟踪阶段时长的影响,我们采取了各模块组装式消融的方法对SVPLP-SLAM进行多次测试,并计算加入每个模块后的平均跟踪时间。如表4所示,线特征的加入使跟踪时间增加约7 ms。我们改进了平面提取的过程,实现了基于有序点云结构的快速平面分割29,耗时约3 ms。此外,生成假定平面约束耗时约4 ms。因此,系统在跟踪模块比基线多耗时约14 ms。考虑到定位精度和建图性能的提升44,这些额外的时间投入是可以接受的。

4 结论

本文提出了一种新颖的RGB-D视觉SLAM系统,该系统集成了点、线和平面三者的特征。为了增强系统中的约束性,我们提取了平面的边缘信息,并利用提取的边缘线条生成假定平面。通过加入平面特征,我们能够以更少的参数有效地拟合更大尺度的场景。为了减少无效的线特征,我们采用了一种长度抑制策略,剔除短线特征,同时为了增加平面的约束,我们还添加了平行约束和垂直约束。本文算法已在公开的基准测试中进行了评估,结果表明,与当前主流的视觉SLAM系统相比,本文系统定位精度更高。由于当前系统是基于RGB-D传感器设计的,未来的工作将探索把该系统扩展到其他类型的传感器。

参考文献

[1]

Taketomi TUchiyama HIkeda S.Visual SLAM algorithms: A survey from 2010 to 2016 [J].IPSJ Trans Comput Vis Appl20179(1): 1-11.

[2]

Wang PZhao LZhang Yet al.MBA-SLAM: Motion blur aware dense visual SLAM with radiance fields representation [J].IEEE Trans Pattern Anal Mach Intell202547(12): 11168-11186.

[3]

Whelan TLeutenegger SSalas Moreno Ret al.ElasticFusion: Dense SLAM without a pose graph [C]//Robotics: Science and Systems Foundation, 2015: 3.

[4]

Johari M MCarta CFleuret F.ESLAM: Effi-cient dense SLAM system based on hybrid representation of signed distance fields [C]//2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2023: 17408-17419.

[5]

Lee JPark S Y.PLF-VINS: Real-time monoc-ular visual-inertial SLAM with point-line fusion and parallel-line fusion [J].IEEE Robot Autom Lett20216(4): 7033-7040.

[6]

Xu LYin HShi Tet al.EPLF-VINS:Real-time monocular visual-inertial SLAM with efficient point-line flow features [J].IEEE Robot Autom Lett20238(2): 752-759.

[7]

von Gioi R GJakubowicz JMorel J Met al.LSD: A fast line segment detector with a false detection control [J].IEEE Trans Pattern Anal Mach Intell201032(4): 722-732.

[8]

Wang XChristie MMarchand E.TT-SLAM: Dense monocular SLAM for planar environ-ments [C]//2021 IEEE International Conference on Robotics and Automation (ICRA), 2021: 11690–11696.

[9]

Chen DWang SXie Wet al.VIP-SLAM: An efficient tightly-coupled RGB-D visual inertial planar SLAM [C]//2022 International Confer-ence on Robotics and Automation (ICRA), 2022: 5615-5621.

[10]

Shu FXie YRambach Jet al.Visual SLAM with graph-cut optimized multi-plane recon-struction [C]//2021 IEEE International Sympo-sium on Mixed and Augmented Reality Adjunct (ISMAR-Adjunct), 2021: 165-170.

[11]

Hoiem DEfros A AHebert M.Geometric context from a single image [C]//Tenth IEEE International Conference on Computer Vision (ICCV'05), 2005: 654-661.

[12]

Mur-Artal RTardos J D.ORB-SLAM2: An open-source SLAM system for monocular, ste-reo, and RGB-D cameras [J].IEEE Trans Robot201733(5): 1255-1262.

[13]

Campos CElvira RRodriguez J J Get al.ORB-SLAM3: An accurate open-source library for visual, visual-inertial, and multimap SLAM [J].IEEE Trans Robot202137(6): 1874-1890.

[14]

Su XEger SMisik Aet al.HPF-SLAM: An efficient visual SLAM system leveraging hybrid point features [C]//2024 IEEE International Conference on Robotics and Automation (ICRA), 2024: 15929-15935.

[15]

Bird JBlumenkamp JProrok A.DVM-SLAM: Decentralized visual monocular simultaneous localization and mapping for multi-agent sys-tems [C]//2025 IEEE International Conference on Robotics and Automation (ICRA), 2025: 1-7.

[16]

Lemaire TLacroix S.Monocular-vision based SLAM using line segments [C]//2007 IEEE In-ternational Conference on Robotics and Auto-mation (ICRA), 2007: 2791-2796.

[17]

Gomez-Ojeda RMoreno F AZuniga-Noel Det al.PL-SLAM: A stereo SLAM system through the combination of points and line segments [J].IEEE Trans Robot201935(3): 734-746.

[18]

Kaess M.Simultaneous localization and map-ping with infinite planes [C]//2015 IEEE Inter-national Conference on Robotics and Automa-tion (ICRA), 2015: 4605-4611.

[19]

Lusk P CParikh DHow J P.GraffMatch: Global matching of 3D lines and planes for wide baseline LiDAR registration [J].IEEE Robot Autom Lett20238(2): 632-639.

[20]

Yang HYuan JGao Yet al.UPLP-SLAM: Unified point-line-plane feature fusion for RGB-D visual SLAM [J].Inf Fusion202396: 51-65.

[21]

Wang XZhang YZhang Zet al.FI-SLAM: Feature fusion and instance reconstruction for neural implicit SLAM [C]//2024 IEEE/RSJ In-ternational Conference on Intelligent Robots and Systems (IROS), 2024: 527-532.

[22]

Papatheodorou SBoche SLaina S Bet al.Efficient submap-based autonomous MAV ex-ploration using visual-inertial SLAM configu-rable for LiDARs or depth cameras [C]//2025 IEEE International Conference on Robotics and Automation (ICRA), 2025: 7284-7290.

[23]

Zhang XWang WQi Xet al.Point-plane SLAM using supposed planes for indoor envi-ronments [J].Sensors201919(17): 3795.

[24]

Zhang GLee J HLim Jet al.Building a 3-D line-based map using stereo SLAM [J].IEEE Trans Robot201531(6): 1364-1377.

[25]

Hartley RZisserman A.Multiple view geom-etry in computer vision [M].2nd ed.Cambridge, USA: Cambridge University Press, 2003.

[26]

Fu QWang JYu Het al.Pl-vins: Real-time monocular visual-inertial slam with point and line [PP/OL].V3.arxiv(2022-04-15)[2025-09-25].

[27]

Lee S JHwang S S.Elaborate monocular point and line SLAM with robust initializa-tion [C]//Proceedings of the 2019 IEEE/CVF International Conference on Computer Vision (ICCV), 2019.

[28]

Shu FWang JPagani Aet al.Structure PLP-SLAM: Efficient sparse mapping and lo-calization using point, line and plane for mo-nocular, RGB-D and stereo cameras [C]//2023 IEEE International Conference on Robotics and Automation (ICRA).London, United Kingdom: IEEE, 2023: 2105-2112.

[29]

Zhang LKoch R.An efficient and robust line segment matching approach based on LBD de-scriptor and pairwise geometric consistency [J].J Vis Commun Image Represent201324(7): 794-805.

[30]

Trevor AGedikli SRusu R Bet al.Efficient organized point cloud segmentation with con-nected components [C]//2013 Semantic Perception Mapping and Exploration (SPME), 2013: 1-6.

[31]

Ma LKerl CStuckler Jet al.CPA-SLAM: Consistent plane-model alignment for direct RGB-D SLAM [C]//2016 IEEE International Conference on Robotics and Automation (ICRA), 2016: 1285-1291.

[32]

Mur-Artal RTardos J D.Fast relocalisation and loop closing in keyframe-based SLAM [C]//2014 IEEE International Conference on Robotics and Automation (ICRA), 2014: 846-853.

[33]

Galvez-López DTardos J D.Bags of binary words for fast place recognition in image se-quences [J].IEEE Trans Robot201228(5): 1188-1197.

[34]

Kummerle RGrisetti GStrasdat Het al.G2o: A general framework for graph optimiza-tion [C]//2011 IEEE International Conference on Robotics and Automation, 2011: 3607-3613.

[35]

Sturm JEngelhard NEndres Fet al.A benchmark for the evaluation of RGB-D SLAM systems [C]//2012 IEEE/RSJ International Con-ference on Intelligent Robots and Systems, 2012: 573-580.

[36]

Handa AWhelan TMcDonald Jet al.A benchmark for RGB-D visual odometry, 3D reconstruction and SLAM [C]//2014 IEEE In-ternational Conference on Robotics and Auto-mation (ICRA), 2014: 1524-1531.

[37]

Zhang C.PL-GM: RGB-D SLAM with a novel 2D and 3D geometric constraint model of point and line features [J].IEEE Access20219: 9958-9971.

[38]

Yunus RLi YTombari F.ManhattanSLAM: Robust planar tracking and mapping leveraging mixture of Manhattan frames [C]//2021 IEEE International Conference on Robotics and Au-tomation (ICRA), 2021: 6687-6693.

[39]

Bamdad MHutter H-PDarvishy A.Deep learning-powered visual SLAM aimed at as-sisting visually impaired naviga-tion [C]//Proceedings of the 20th International Joint Conference on Computer Vision, Imaging and Computer Graphics Theory and Applica-tions, 2025: 758-765.

[40]

Yang GLiu PMa W.Enhanced RGB-D SLAM through orthogonal plane constraints and point-line-plane collaborative optimization [J].PLoS One202520(9): e0330839.

[41]

Endres FHess JSturm Jet al.3-D mapping with an RGB-D camera [J].IEEE Trans Robot201430(1): 177-187.

[42]

Sun QYuan JZhang Xet al.RGB-D SLAM in indoor environments with STING-based plane feature extraction [J].IEEE/ASME Trans Mechatron201823(3): 1071-1082.

[43]

Xie YShu FRambach Jet al.PlaneRecNet: Multi-task learning with cross-task consistency for piece-wise plane detection and reconstruc-tion from a single rgb image [PP/OL].V2.arxiv(2022-01-30)[2025-09-25].

[44]

Xiao XChen Q SWu S Yet al.Research on the application of deep learning methods in identification localization and recognition of engineering drawings[J].Journal of Chongqing University of Posts and Telecommunications(Natural Science Edition)202537(5):696-707.

[45]

肖鑫,陈青松,吴思远,.深度学习方法在工程图纸标识定位与识别中的应用研究[J].重庆邮电大学学报(自然科学版)202537(5): 696-707.

基金资助

国家重点研发计划项目(2023YFF0615800)

四川省科技计划项目(2024ZHCG0191)

AI Summary AI Mindmap
PDF (1686KB)

212

访问

0

被引

详细

导航
相关文章

AI思维导图

/