基于小波变换网络的自监督单目深度与位姿估计

乔善宝 ,  高永彬 ,  黄勃 ,  余文俊

武汉大学学报(理学版) ›› 2023, Vol. 69 ›› Issue (6) : 777 -786.

PDF (3888KB)
武汉大学学报(理学版) ›› 2023, Vol. 69 ›› Issue (6) : 777 -786. DOI: 10.14188/j.1671-8836.2022.0047
算法与应用

基于小波变换网络的自监督单目深度与位姿估计

作者信息 +

Self-Supervised Monocular Depth and Pose Estimation Based on Wavelet Transform Network

Author information +
文章历史 +
PDF (3981K)

摘要

基于小波变换与运动恢复结构的自监督学习范式,将二维离散小波变换嵌入神经网络并实现梯度传播,提出了一种新的单目深度与位姿估计算法。传统的神经网络在降采样过程中会造成信息丢失,且丢失的信息在后续阶段无法复原,对于深度估计任务,结构信息的丢失会降低模型性能。本文使用二维离散小波变换层替代传统的降采样操作,更好地保留图像中的结构细节并避免噪声累积。在上采样解码深度图的阶段,采用小波逆变换层取代传统的插值上采样方法,更有效地恢复图像信息,得到更精确的深度图。提出的算法相比传统的神经网络对噪声更有鲁棒性。在KITTI数据集上进行实验,证明了所提出的算法在自监督单目深度与位姿估计任务中有优异的性能表现。

Abstract

This paper proposes a novel depth and pose estimation framework, leveraging the wavelet transform and the self-supervised structure from the motion paradigm. The approach involves embedding 2D discrete wavelet transform into neural networks and implementing gradient propagation. Traditional convolutional neural networks (CNN) face a challenge during the down-sampling stage, as structural information is lost, and becomes irrecoverable in subsequent phases. This loss of information impacts the performance of depth estimation tasks, where complete structural information is crucial. This paper uses a 2D discrete wavelet transform layer to replace the down-sampling process of traditional neural networks, which can better preserve the structural details and avoid the accumulation of noise. In the up-sampling stage of the decoder, the inverse wavelet transform layer is used to replace the conventional interpolation method, which can effectively restore detailed information and promote the accuracy of the depth map. In addition, the proposed method has noise robustness compared to traditional neural networks. Experiments on the KITTI dataset demonstrate that the proposed algorithm performs excellently in the self-supervised depth and pose estimation tasks.

Graphical abstract

关键词

小波变换 / 自监督学习 / 单目深度估计 / 位姿估计 / 三维感知

Key words

wavelet transform / self-supervised learning / monocular depth estimation / pose estimation / 3D perception

引用本文

引用格式 ▾
乔善宝,高永彬,黄勃,余文俊. 基于小波变换网络的自监督单目深度与位姿估计[J]. 武汉大学学报(理学版), 2023, 69(6): 777-786 DOI:10.14188/j.1671-8836.2022.0047

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

场景深度信息与精确的自身运动信息是众多的智能任务的基础需求,比如自动驾驶,机器人导航等。激光雷达等传感器能够直接获取精确的3D信息,但其造价高昂。深度相机则受限于其工作原理及感知范围,不适用于户外等场景。单目相机由于其性价比高、体积小等优点受到越来越多的关注。传统单目深度与位姿估计算法一般依赖于连续帧间的关键特征匹配,这类方法都需要人工设计关键特征。近年来,基于深度学习的深度与位姿估计算法表现优异,然而监督式学习仍需要激光雷达等传感器提供真实值标签,获取真实深度标签本身就是一项艰巨的任务。

一些自监督学习的算法可以实现深度与位姿的联合估计,基于运动恢复结构原理的算法可以仅通过单目视频数据进行训练。这些方法都采用编码-解码的卷积神经网络框架,编码器对输入数据进行降采样和特征提取,解码器则将特征图解码得到对应的深度图。然而,传统的神经网络在下采样过程中容易积累噪声和丢失结构细节信息。在解码器阶段,由于上采样通常采取插值的方式,编码阶段丢失的结构信息并不能被恢复,使深度图的精度和结构完整性被破坏。针对上述问题,本文探索了二维离散小波(discrete wavelet transform,dwt)变换进行下采样的方式。输入图像经小波分解后,得到对应图像亮度与灰度值变化平缓的低频分量与变化剧烈的高频分量。小波分解作为一种下采样方式,分解后的分量与1×1卷积结合可实现特征提取功能。在解码器阶段,本文采用小波逆变换取代插值上采样,将小波分量携带的信息恢复至特征图中,使最终生成的深度图结构更加完整。综上所述,本文所完成的工作如下:

1) 提出了基于小波变换的自监督深度与位姿估计框架。在编码器端,引入小波分解代替传统的降采样操作,并结合1×1卷积层实现特征提取功能。避免了传统卷积结构在降采样过程中的噪声累积和结构损坏。

2) 在深度解码器端,设计了新的上采样结构。充分利用编码器中小波分解后的高低频分量,在上采样过程中恢复图像的细节结构信息。相比于传统解码器,特征的压缩与过滤具有可逆性,避免了信息丢失且对噪声具有鲁棒性。

3) 在KITTI数据集上进行了实验与验证,并与近年来提出的具有代表性的相关工作进行对比,所提出的算法在自监督深度与位姿估计任务中取得了优异的性能表现。

1  相关工作

1.1 监督式单目深度估计

单目深度估计是一个不适定问题,传统几何方法[1]需要至少两个不同的视图来计算深度。2014年,Eigen等[2]率先提出了基于监督式学习的单目深度估计方法,利用卷积神经网络的强大表达能力从原始图像数据中学习深度预测,与传统方法相比,取得了更具有竞争力的结果。然而在真实世界的场景中获取深度作为监督训练的标签成本极高。目前也有一些工作提出了替代方法,比如人工合成的数据[3],但它们仍然不足以准确模拟现实的物理世界。

1.2 自监督单目深度与位姿估计

获取场景的真实深度图是一项有挑战性的工作,而无监督或自监督的方法不需要标签数据,这类方法极大减少了模型的训练成本。自监督深度与位姿估计的开创性工作是由文献[4,5]提出的,深度和位姿可以仅从单目视频序列中学习,并联合训练。在之后的一些工作中,Yin等[6]将运动分为刚性和非刚性两类,并提出了一种残差流学习的方法处理非刚性运动场景,这种方法明显提高了光流估计的性能,但从文中光流与深度联合估计的数据来看,对深度估计的提高并不明显;Godard等[7]提出了一种逐像素最小重投影损失,这一工作使得单目和双目自监督深度估计之间的性能差距进一步缩小。此外还有一些新颖的深度估计方式,如文献[8]使用了基于域适应的方法,并使用语义感知增强域转移的稳定性;文献[9]则使用生成对抗网络合成目标帧,并引入了自注意力机制增强深度估计的细节。

自监督深度与位姿估计通常采用基于视图合成的监督范式,这种监督范式建立在场景是静态的且物体表面是朗伯式平面的假设下。由于现实世界中的场景往往是动态的,场景中移动的物体和物体间的相互遮挡不满足假设条件,因而造成误差。Zhou等[4]和Bian等[10]分别提出了可解释性掩码和自发现掩码来处理动态场景问题。

1.3 小波变换神经网络

小波变换是信号处理领域常用的时频分析工具。近些年有一部分研究者尝试将小波变换这一传统算法应用在深度学习领域的任务中,Duan等[11]提出了用基于小波变换约束的池化层代替传统的池化层,并将这一架构用在了图像分割任务上,结果表明该方法可以更好地保持图像结构和特征信息。Liu等[12]则将小波变换嵌入到神经网络中降低图像的分辨率,增大神经网络的感受野,并在图像去噪、超分辨率等任务上验证了所提方法的有效性。

在基于学习的深度估计任务中,图像的结构信息同样影响着对应的预测深度图的精度,因此本文探索并设计了适用于深度估计的小波变换神经网络框架。

2  本文的算法

2.1 算法思路

本文提出的算法包含编码器、深度解码器和位姿解码器三种结构,并在同一次训练过程中联合估计深度与位姿。编码器主要负责特征提取,将输入数据逐层下采样并提取多尺度特征图。其中,下采样操作存在于池化层与多步长卷积层中,本文将这两类操作使用二维离散小波变换层代替。小波变换层下采样效果与传统池化层下采样效果的对比如图1所示。

每经过一次小波分解,输入数据在横向与纵向上被分解为四种分量LLLHHLHH,其中L代表低频分量,H代表高频分量。深度解码器将多尺度特征图与小波高低频分量结合,经过一系列上采样与卷积操作生成与原图相同尺寸的深度图。位姿解码器则通过编码器输出的高维特征经若干卷积层估计六自由度的位姿。

本算法的目的是以自监督学习的方式利用单目图像数据IT估计深度图DT,并利用连续的单目图像帧IT,IS估计相机位姿GTSSE(3)。单目相机将空间三维点坐标P=(X,Y,Z)转换为像素坐标p=(u,v)的方式为:

ϕP=fxXZ+cx,fyYZ+cy

其中(fx,fy,cx,cy)为相机内参。在给定深度图D的情况下,像素坐标也可重新投影到空间三维坐标:

ϕ-1p,Dp=Dpx-cxfx,y-cyfy,1T

为了建立相邻图像帧间的投影关系,可定义投影函数φ:R2×R×SE(3)R2,通过下式将当前帧投影到其相邻的目标帧,得到当前帧对目标帧的合成图:

p^=φp,Dp,G=ϕGϕ-1p,Dp

将合成图与目标帧之间的光度误差作为监督信号,单目深度与位姿估计任务实现自监督的流程如下。

输入:单目图像帧(目标帧)IT,与目标帧相邻的源图像帧IS

1) 深度估计网络估计目标帧的深度图DT

2) 位姿估计网络估计目标帧IT到源图像帧 IS间的位姿变换PTS

3) 利用公式ccam=K-1cpixDT,DT从像素坐标系cpix转换至相机坐标系ccam,其中K为相机内参。

4) 利用公式T=KPTS计算从目标帧相机坐标到源图像帧像素坐标的变换矩阵T

5) 利用公式srcpix=Tccam计算目标帧在相机坐标系下的深度图到源图像帧像素坐标系下的投影关系srcpix

6) 使用srcpix将源图像帧投影到目标帧,将投影得到的目标图像生成图记为I^T,即从源图像到目标图像的视图合成。

7) 计算并最小化ITI^T间的光度损失Loss

输出:最小化损失函数min (Loss(IT,I^T))

2.2 网络结构

本文采用基于ResNet-50[13]的特征编码器结构,深度解码器由若干卷积层和上采样层组成,位姿解码器由若干卷积层组成。算法的整体框架如图2所示。

输入相邻两帧图像ItIt+1,特征编码器提取特征图FtFt+1Ft经过深度解码器得到深度图DtFtFt+1经过位姿解码器得到两帧之间的位姿变换,由深度图和位姿生成从It+1It的投影合成图I^t,计算ItI^t之间的重建损失。

下采样操作普遍存在于编码器中。对于步长大于1的卷积操作,将其替换为小波变换层。该层将二维离散小波变换与核尺寸为1×1的卷积层结合,输入数据经其处理后被分解为4个特征分量组件。本文取低频分量LL送入网络下一层,其余三种分量LHHLHH被存储待用。此种结合方式既能实现高质量的下采样,又保持了神经网络层的特征提取能力。对于池化层,直接使用二维离散小波变换操作替代,实现下采样。编码器由第一层的7×7卷积、小波变换层以及后续的四个网络模块(Block)组成,在第一个小波变换层及每个模块后都将输出经过下采样的特征图,每阶段特征图的尺度均为上一阶段的1/2,因此最小的特征图为原图尺度的1/32。编码器最终输出五种尺度的特征图,同时保存了各个尺度下小波分解后的高低频分量。编码器的结构如图3所示。

在深度解码器阶段,各尺度的特征图经过上采样与卷积层最终生成与原始图像相同分辨率的深度图。本文采用二维离散小波逆变换(inverse discrete wavelet transform,idwt)层取代传统的插值式上采样方式,将特征图作为低频分量LL,与在编码器阶段存储的对应尺度的LHHLHH分量组合,经过二维小波逆变换实现融合和上采样。深度解码器的结构如图4所示。

深度解码器同样包含5个阶段,分别对应特征编码器输出的5个尺度的特征图,即深度解码器的输入特征包含5个不同的特征尺度:H32×W32×512H16×W16×256H8×W8×128H4×W4×64H2×W2×64,其中HW分别为输入图像的高度和宽度。特征图经过离散小波逆变换层以编码器阶段存储的小波分量与特征图作为组件实现上采样,并经过维度整合最终生成深度图。深度解码器中的所有卷积层都不会改变特征图的大小而是压缩通道维度,记尺度从H32×W32×512H2×W2×64的5个尺度的特征图为fi,i=(1,2,3,4,5),解码器第一阶段将f1:H32×W32×512上采样为f1':H16×W16×256,即与f2维度相同。之后将f1'f2在通道维度上进行拼接,随后的卷积层把通道维度压缩至128(与f3相同)并将该特征送至下一阶段,依此类推。在解码器的最后一个阶段,特征f5f4'的维度将与原始输入图像相同,其后的卷积层将通道维度压缩为1并通过Sigmoid非线性激活函数映射深度值,从而生成深度图。

位姿解码器以相邻多帧的特征图作为输入,将解码器最后一层输出的特征图进行通道压缩,并将压缩后的特征图在通道维度上拼接生成高维特征,这些高维特征经过若干卷积层处理后最终输出对应组数的六自由度位姿。本文中输入的多帧数量设为n=3,位姿解码器最终输出的维度为(n-1)×6,即三帧之间的两组六自由度位姿。其结构如图5所示。

相邻帧的特征图经过通道压缩和特征卷积最终输出六自由度位姿,每对特征图输出一组位姿。位姿估计流程如算法1所示。

2.3 小波变换与小波逆变换层

本文中小波变换层由二维离散小波变换实现,可实现对图像数据的下采样,与卷积层结合,具有特征提取功能。采用二维离散小波逆变换重构图像信号,可实现特征融合和上采样功能。

2.3.1 前向传播

要将小波变换或小波逆变换嵌入神经网络结构形成小波变换层,需要设计数据的前向传播与反向传播过程。对于二维图像数据,其每行或每列可视为一维信号数据,离散小波变换与逆变换作用在每个一维信号数据上。记正交小波的低通滤波为l=lk,kZ,高通滤波为h=hk,kZ。本文采用的是哈尔(Haar)小波,其低通滤波l=(12,12),高通滤波h=(12,-12)。离散小波变换将输入信号s=si,iZ分解为低通分量sl=slk,kZ和高通分量sh=shk,kZ。其中,

slk=ili-2ksi,shk=ihi-2ksi,kZ

给定低通分量sl与高通分量sh,利用小波逆变换可以重构信号s,其原理为:

si=ili-2kslk+hi-2kshk,kZ

将上述小波变换与逆变换公式写为矩阵的形式:

sl=Ls,sh=Hs
s=LTsl+HTsh

其中LH为低通滤波和高通滤波矩阵。

对于输入的二维图像信号I,小波变换作用在其每行(横向)与每列(纵向)的像素,可生成横向与纵向上的低频分量、横向低频与纵向高频分量、横向高频与纵向低频分量、横向与纵向上的高频分量四种小波分量,如下:

Ill=LILT,Ilh=LIHT,Ihl=HILT,Ihh=HIHT

对应地,通过小波逆变换将上述四种组件重组为原图像信号的过程如下:

I=LTIllL+HTIlhL+LTIhlH+HTIhhH

2.3.2 反向传播

在反向传播过程中,需要求解梯度,对于一维信号的离散小波变换,低频分量与高频分量分别对原信号求导,可得到低通滤波与高通滤波的转置矩阵,即对(6)式求导可得:

sls=LT,shs=HT

拓展到二维离散小波变换,四种小波分量对原信号求导可得到对应的低通滤波和高通滤波转置矩阵的乘积,即对(8)式求导可得:

IllI=LTLT,IlhI=LTHT
IhlI=HTLT,IhhI=HTHT

对于一维信号的小波逆变换,原信号对低频分量和高频分量分别求导,结果即为低通滤波矩阵和高通滤波矩阵,即对(7)式求导可得:

ssl=L, ssh=H

拓展至二维离散小波逆变换,原信号对四种小波分量求导得到对应的低通滤波矩阵与高通滤波矩阵的乘积,即对(9)式求导可得:

IIll=LL, IIlh=LH,IIhl=HL, IIhh=HH

原始的输入图像一般为三通道的RGB图像,在编码器中被处理为更多通道的高维特征,对于此种多通道数据,本文对数据施加逐通道的二维离散小波变换与逆变换。

2.4 损失函数

2.4.1 光度损失

光度损失是自监督深度与位姿估计中最常用的损失函数,用来计算合成图I^T与目标帧IT之间的光度误差。光度损失一般由结构相似性损失(SSIM)[14]和L1损失两部分组成,本文将其中的L1损失改进为具有鲁棒性的L1损失,光度损失Lph定义为如下形式:

Lph=λ1IT-I^T2+ε2+λ21-SSIMIT-I^T2

其中,通常λ1=0.15λ2=0.85ε=0.001

2.4.2 平滑性损失

为了使深度图在局部上保持平滑,需要对其梯度进行惩罚。深度图的不连续性也往往出现在图像梯度上,因此对图像梯度也应进行惩罚。本文采用与文献[6]中相同的平滑性损失函数,减轻梯度变化剧烈处的权重以达到平滑的目的,其公式如下:

Lsmooth=xDTe-xIT+yDTe-yIT

其中,xy分别表示X方向和Y方向上的梯度。

2.4.3 处理动态场景和遮挡

本文采用的自监督范式建立在静态场景的假设下,而现实场景往往是动态的,动态的或跟随相机运动的物体使得模型难以估计其深度。相邻两帧之间若存在新的运动物体移入视图而产生遮挡,则会造成较大的光度误差,不利于网络的收敛。因此,本文采用Bian等[10]提出的方法,在训练过程中为估计的深度值引入权重掩码。网络估计的深度与位姿投影得到的深度值越接近,则该像素的深度估计结果越准确,其权重越高。计算估计单目深度与投影深度间的误差并归一化得到Ddiff,则权重掩码的值可定义为:

M=1-Ddiff

3  实 验

本文在KITTI数据集[15]上进行实验,从多个指标验证了所提出的算法在单目深度与位姿估计任务上的性能,并与近期的有代表性的相关工作进行比较。

3.1 单目深度估计

单目深度估计常用的测试指标如表1所示。其中D代表一张图像所有预测的深度值的集合,d代表深度的预测值,d*代表深度的真实值,·为返回集合中的元素个数。

为保证测试基准与先前工作一致,在KITTI Eigen[2]划分的基准上进行测试。评估结果如表2所示,其中各项误差指标数值越低,精度指标数值越高则表明算法性能越好。从表2可看出,本文提出的算法在各指标中都取得了优异的表现。图6展示了深度图可视化的结果,与先前的算法相比,本文提出的算法生成的深度图具有更清晰的细节结构。

小波分析也是图像去噪的常用方法,本文在编码器阶段对部分高频分量进行了过滤,使其在深度图估计的过程中也具有一定的噪声鲁棒性。为验证其效果,本文随机选取图像数据并对其施加噪声比例为0.02的椒盐噪声,示例如图7所示,其中第一行为原始图像,第二行为添加噪声后的图像。以文献[10]与本文算法作为对比,在除噪声变量外其余实验条件及参数均相同的情况下,对比效果如图8所示,其中差异明显处用椭圆框标出。“SC-SfMLearner”和“SC-SfMLearner-N”分别为文献[10]估计的原图与带噪声图的深度图。可以观察到大面积区域的深度估计失常;“本文”和“本文-N”分别为本文算法估计出的原图和带噪声图的深度图,结果具有噪声鲁棒性。

3.2 位姿估计

对于位姿估计,相关工作大都在Zhan等[22]使用的基准上进行位姿测试,即以KITTI Odometry数据集中的09和10序列为测试集。评估位姿估计性能的指标一般为在整个序列上每100米的平均平移误差terr与旋转误差rerr,以及绝对轨迹的均方根误差ATE。本文在Zhan等[22]的基准上测试了算法的位姿估计性能,以ORB-SLAM2系统[23]为参考,与已有的自监督位姿估计算法进行比较(ORB-SLAM2是一套先进的同时定位与建图系统,包含强大的后端优化系统,在位姿估计与导航方面有极高的精准度),具体数据如表3所示。

根据本文算法预测的位姿,描绘出在序列09与序列10上的预测轨迹,并与相关工作进行比较,其可视化结果如图9所示。

本文对测试序列09和序列10上每百米时的平均平移误差和旋转误差与相关工作进行了对比。与上述整个序列上的每百米平均平移误差terr和旋转误差rerr不同,此处的对比为测试序列上每百米路程处计算的平均误差,可反映平移和旋转误差随序列长度增长时的具体变化,对比结果如图10所示。

4  结 语

本文设计了一种自监督单目深度与位姿估计的新框架,探索了小波变换与深度学习的结合方式,验证了其在自监督深度与位姿估计领域的性能表现。本文所提出的算法改进了编码-解码器结构的功能和效果,使下采样阶段可以更好地保持结构信息,获得高质量的特征图;上采样阶段可以恢复更多图像细节,减少信息丢失。更精确的深度图用于联合训练的位姿估计网络,进而提高了位姿估计的精确度。实验证明,本文所设计的框架在自监督单目深度与位姿估计任务上表现优秀。

深度与位姿估计是视觉里程计中不可缺少的部分,加以适配的后端优化组件,后续可将其拓展应用于视觉同时定位与建图(V-SLAM)系统。

参考文献

[1]

HARTLEY RZISSERMAN A. Multiple View Geometry in Computer Vision[M]. Cambridge: Cambridge University Press, 2000.

[2]

EIGEN DPUHRSCH CFERGUS R. Depth map prediction from a single image using a multi-scale deep network[EB/OL]. 2014arXiv: 1406.2283.

[3]

MAYER N, ILG E, FISCHER Pet al. What makes good synthetic training data for learning disparity and optical flow estimation [J]. International Journal of Computer Vision2018126(9): 942-960. DOI:10.1007/s11263-018-1082-6 .

[4]

ZHOU T HBROWN MSNAVELY Net al. Unsupervised learning of depth and ego-motion from video[C]//2017 IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2017: 6612-6619. DOI:10.1109/CVPR.2017.700 .

[5]

GARG RVIJAY KUMAR B GCARNEIRO Get al. Unsupervised CNN for single view depth estimation: Geometry to the rescue[C]// 2016 European Conference on Computer Vision. Cham: Springer International Publishing, 2016:740-756. DOI:10.1007/978-3-319-46484-8_45 .

[6]

YIN Z CSHI J P. GeoNet: Unsupervised learning of dense depth, optical flow and camera pose[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2018: 1983-1992. DOI:10.1109/CVPR.2018.00212 .

[7]

GODARD CAODHA O MFIRMAN Met al. Digging into self-supervised monocular depth estimation[C]//2019 IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE Press, 2019: 3827-3837. DOI:10.1109/ICCV.2019.00393 .

[8]

詹雁, 张娟, 金昌基. 联合语义感知与域适应方法的单目深度估计[J]. 传感器与微系统202140(5): 60-63. DOI:10.13873/J.1000-9787(2021)05-0060-04 .

[9]

ZHAN YZHANG JKIM C. Monocular depth estimation based on joint semantic perception and domain adaptation method[J]. Transducer and Microsystem Technologies202140(5): 60-63. DOI:10.13873/J.1000-9787(2021)05-0060-04(Ch ).

[10]

叶星余, 何元烈, 汝少楠. 基于生成式对抗网络及自注意力机制的无监督单目深度估计和视觉里程计[J]. 机器人202143(2): 203-213. DOI:10.13973/j.cnki.robot.200084 .

[11]

YE X YHE Y LRU S N. Unsupervised monocular depth estimation and visual odometry based on generative adversarial network and self-attention mechanism[J]. Robot202143(2): 203-213. DOI:10.13973/j.cnki.robot.200084(Ch ).

[12]

BIAN J WLI Z CWANG N Yet al. Unsupervised scale-consistent depth and ego-motion learning from monocular video[EB/OL]. 2019arXiv: 1908.10553.

[13]

DUAN Y PLIU FJIAO L Cet al. SAR image segmentation based on convolutional-wavelet neural network and Markov random field[J]. Pattern Recognition201764: 255-267. DOI:10.1016/j.patcog.2016.11.015 .

[14]

LIU P JZHANG H ZZHANG Ket al. Multi-level wavelet-CNN for image restoration[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW). New York: IEEE Press, 2018: 886-88609. DOI:10.1109/CVPRW.2018.00121 .

[15]

HE K MZHANG X YREN S Qet al. Deep residual learning for image recognition[C]//2016 IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2016: 770-778. DOI:10.1109/CVPR.2016.90 .

[16]

WANG ZBOVIK A CSHEIKH H Ret al. Image quality assessment: From error visibility to structural similarity[J]. IEEE Transactions on Image Processing200413(4): 600-612. DOI:10.1109/TIP.2003.819861 .

[17]

GEIGER ALENZ PSTILLER Cet al. Vision meets robotics: The KITTI dataset[J]. The International Journal of Robotics Research201332(11): 1231-1237. DOI:10.1177/0278364913491297 .

[18]

MAHJOURIAN RWICKE MANGELOVA A. Unsupervised learning of depth and ego-motion from monocular video using 3D geometric constraints[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2018: 5667-5675. DOI:10.1109/CVPR.2018.00594 .

[19]

ZOU Y LLUO Z LHUANG J B. DF-net: Unsupervised joint learning of depth and flow using cross-task consistency[C]//Computer Vision—ECCV 2018(LNCS 11209). Berlin:Springer, 2018: 38-55. DOI:10.1007/978-3-030-01228-1_3 .

[20]

WANG C YBUENAPOSADA J MZHU Ret al. Learning depth from monocular videos using direct methods[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2018: 2022-2030. DOI:10.1109/CVPR.2018.00216 .

[21]

RANJAN AJAMPANI VBALLES Let al. Competitive collaboration: Joint unsupervised learning of depth, camera motion, optical flow and motion segmentation[C]//2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2019: 12232-12241. DOI:10.1109/CVPR.2019.01252 .

[22]

SPENCER JBOWDEN RHADFIELD S. DeFeat-net: General monocular depth via simultaneous unsupervised representation learning[C]//2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE Press, 2020: 14390-14401. DOI:10.1109/CVPR42600.2020.01441 .

[23]

LI H HGORDON AZHAO Het al. Unsupervised monocular depth learning in dynamic scenes[EB/OL]. 2020arXiv: 2010.16404.

[24]

ZHAN H YGARG RWEERASEKERA C Set al. Unsupervised learning of monocular depth estimation and visual odometry with deep feature reconstruction[C]//2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2018: 340-349. DOI:10.1109/CVPR.2018.00043 .

[25]

MUR-ARTAL RTARDÓS J D. ORB-SLAM2: An open-source SLAM system for monocular, stereo, and RGB-D cameras[J]. IEEE Transactions on Robotics201733(5): 1255-1262. DOI:10.1109/TRO.2017.2705103 .

[26]

SHEN T WLUO Z XZHOU Let al. Beyond photometric loss for self-supervised ego-motion estimation[C]//2019 International Conference on Robotics and Automation (ICRA). New York: IEEE Press, 2019: 6359-6365. DOI:10.1109/ICRA.2019.8793479 .

[27]

BIAN J WZHAN H YWANG N Yet al. Unsupervised scale-consistent depth learning from video[J]. International Journal of Computer Vision2021129(9): 2548-2564. DOI:10.1007/s11263-021-01484-6 .

基金资助

国家自然科学基金(61802253)

国家自然科学基金(U2033218)

科技创新2030—“新一代人工智能”重大项目(2020AAA0109302)

科技创新2030—“新一代人工智能”重大项目(2020AAA0109300)

上海晨光人才计划(17CG59)

AI Summary AI Mindmap
PDF (3888KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/