基于跨视角图像转换的地-空图像地理定位

黄佳庆 ,  叶登攀 ,  江顺之

武汉大学学报(理学版) ›› 2023, Vol. 69 ›› Issue (1) : 79 -87.

PDF (2498KB)
武汉大学学报(理学版) ›› 2023, Vol. 69 ›› Issue (1) : 79 -87. DOI: 10.14188/j.1671-8836.2021.0300
信息处理和图像识别

基于跨视角图像转换的地-空图像地理定位

作者信息 +

Ground-to-Aerial Image Geo-Localization with Cross View Image Transformation

Author information +
文章历史 +
PDF (2557K)

摘要

图像地理定位任务的目标是对于给定的现实图像实现其地理位置的预测,在目前主流方法中,这种预测通过将输入图像与数据库中带有地理标签的图像进行匹配实现。由于缺乏全面的带有地理标签的地面图像,已有的数据库都是通过带有经纬度标签的卫星图像来建立的,而卫星图像相对于地面图像的巨大视角变化则给图像的匹配带来了挑战。本文提出了一种新的用于跨视角图像转换的条件生成对抗网络Crossview Attention Seq(CAS),使其生成由卫星图像转换得到的地面辅助信息。CAS由图像的语义分割信息达到了更好的生成效果,同时又通过模块中的空域注意力机制压制了转换的噪声。CAS所生成的转换信息与查询图像一起被输入到图像匹配框架当中,进行参数的优化和特征表示的学习。基于孪生网络模型搭建了新的图像匹配框架,并将新的损失函数结合到训练过程中,与传统三元组损失相比,它大大提升了模型整体优化的效果。实验结果表明,本文提出的方法在两个经典图像定位数据集上对比基线模型达到了更高的定位精度,并且对低信息量的数据具有更强的鲁棒性。

Abstract

The task of image geo-localization refers to the prediction of geographic label for given image. Such prediction was achieved by matching the input with existing geographic labelled image in the database. Due to the lack of ground images with geographic labels, databases were often established by satellite images. However, the huge perspective difference between satellite images and ground images brought great challenges to image matching. In this paper, we proposed a new conditional generative adversarial network (CGAN) called Crossview Attention Seq (CAS) for cross-view image conversion. CAS achieved better effect through semantic segmentation of image, meanwhile we introduced spatial attention mechanism to suppress the noise in transformation. The auxiliary information was input to the framework to optimize the parameters. The image matching framework was built based on Siamese network architecture. In addition, the improved loss function was integrated into the training process. Compared with Triplet loss, it greatly improved the optimization effect. Experimental results prove the effectiveness and superiority of our method on two classical datasets. Compared with the existing methods, our model is more accurate in geo-location and more robust to low quality data.

Graphical abstract

关键词

图像地理定位 / 跨视角图像转换 / 孪生网络

Key words

image geo-localization / cross view image transformation / siamese network

引用本文

引用格式 ▾
黄佳庆,叶登攀,江顺之. 基于跨视角图像转换的地-空图像地理定位[J]. 武汉大学学报(理学版), 2023, 69(1): 79-87 DOI:10.14188/j.1671-8836.2021.0300

登录浏览全文

4963

注册一个新账户 忘记密码

0  引 言

图像地理定位任务指的是对于每一个给定的查询图像输出其在真实世界中的地理位置(如经纬度)。这种技术可用于社交媒体图像的定位、无人驾驶、导航等领域。随着这些应用技术的发展,对于图像定位的准确率与稳定性要求也越来越高。传统的图像地理定位方法通过精确的传感器建模与像素级的图像匹配实现[1],这类方法的主要问题在于对传感器硬件与图像质量的高要求使得其难以推广应用。近年来随着深度学习技术的发展,将卷积神经网络(convolutional neural network,CNN)及其衍生技术应用到图像地理定位中的方法越来越多,并且在标准的地理图像数据集上取得了非常好的效果。

目前基于深度学习实现图像地理定位的主流方向是图像检索,即首先建立一个具有大量地理位置标签的图像数据库,然后对查询图像在数据库中进行匹配检索,将检索到的特征最为匹配图像的位置标签作为查询图像的地理位置进行输出。现有的地面图像数据集集中于著名景点以及人口密集区域,难以均匀覆盖到要进行定位的整体区域,所以这种基于检索的地理定位方式经常在没有匹配图像的区域失效。与之相对的,从卫星上拍摄的卫星图像往往能够对整个地理区域进行全面均匀地覆盖,并且拍摄的图像是带有严格的地理标签的,因此以卫星图像为基准建立图像数据库逐渐发展为地理定位方法的主流。与此同时,卫星图像与地面图像拍摄视角的差异性也给两种图像的匹配带来了挑战,传统基于交叉匹配的浅层特征在这种场景下失效了。因此大量研究将CNN应用到端对端的图像匹配当中,利用CNN进行地面图像特征与卫星图像特征之间的表示学习。文献[2]使用一个额外的网络分支结构定位,利用多个可能方向的卫星图像找到两个视图匹配的最佳角度。文献[3]通过在网络中嵌入NetVLAD层保证CNN在提取描述符时对于视角变化是稳定的。

在本文中,我们在图像检索框架的基础上加入了一个跨视角图像生成的条件生成对抗网络(conditional generative adversarial nets,CGAN)预测模块。首先训练CGAN从卫星图像中预测其对应的地面图像,然后再对其进行特征描述符的提取,与查询图像的特征描述符进行比对,这为地面到卫星图像的匹配提供了辅助信息,进一步强化了定位的准确率;在图像检索框架部分,我们改进了损失函数,优化了常用的三元组损失依赖于阈值选取、收敛效果较差的缺陷,使用T-SARE(stochastic attraction and repulsion embedding)损失函数不断放大正确图像对之间的相似性,缩小错误匹配图像之间的相似性,使模型优化不受限于阈值,提高了模型的匹配效果;通过新的辅助预测模块和损失函数训练了孪生网络框架。实验结果表明,我们的方法在经典卫星与地面图像数据集上好于现有的前沿方法。

1  图像匹配与CGAN概述

近年来通过图像匹配实现图像地理定位的方法已经逐渐成为研究主流。根据特征不同,可以将图像地理定位的研究分为基于手动特征的地理定位和基于深度学习特征的地理定位。除此之外,视角转换模型使用的CGAN以及图像检索选取的损失函数也会对系统的定位效果产生影响。

1.1 图像匹配常用特征

在跨视角的图像匹配中,基于计算机视觉的方法是通过扭曲地面图像以自顶向下的视角来改进特征匹配的,一般的定位匹配框架如图1所示。Bansal等[4]从倾斜的航拍图像构建建筑立面,然后通过匹配建筑立面进行地理定位。Viswanathan等[5]通过改进局部特征描述符将地面图像转换成自上而下的视图。但这些手动设计的特征往往对数据要求高,在实际应用中难以泛化,精确度较低。

现有的许多工作将深度学习与传统图像检索的特征相融合,实现了端对端的图像地理定位框架,使得图像定位系统具有了更强的稳定性与更高的定位精度。Jegou等[6]提出的局部特征聚合描述符(vector of locally aggregated descriptors,VLAD)是一种经典的图像检索特征。基于这项工作,Arandjelovic等[7]提出了基于VLAD的可学习网络结构NetVLAD,并将其嵌入到端到端的深度网络中进行训练,证明了NetVLAD优于多个全连接层和最大池化层的结合。Hu等[3]提出CVM-Net,采用NetVLAD模块聚合CNN特征单元生成图像的特征表示,手动分配了一个带阈值软边际三联体损失以加快训练。文献[8]提出了轻量注意模块(feature context-based attention module,FCAM),并将其集成为一个基本残差网络,形成孪生网络,性能获得明显提升。这些基于深度学习的模型尽管取得了一定的效果,但是在纯街景图与卫星图的匹配方面还有提升空间。

1.2 CGAN模块

在深度学习领域,GAN(generative adversarial nets)[9]是一个可非常成功地生成高锐度、低噪声图像的经典模型。它包含两个神经网络:生成器与鉴别器,通过两者之间相互博弈,共同优化达到生成高质量图像的效果。生成器G被优化为由噪声向量合成接近真实数据分布的图像,鉴别器D被优化为能够准确区分G的合成图像与真实图像,网络的目标函数为

minG maxD LGANG,D=Ex~pdataxlogDx+Ez~pzzlog 1-DGz

其中x表示服从数据分布pdata的真实数据,z表示服从高斯分布pz的噪声向量。

在GAN的基础上,CGAN[10]可以借助如文本和图像信息作为先验知识利用GAN在不同域之间进行图像的转换与重构,其中比较典型的应用为风格迁移、图像翻译以及生成图像信息描述等。CGAN的目标函数为

minG maxD LCGANG,D=Ex,c~pdatax,clog Dx,c+Ex', c~pdatax',clog 1-Dx',c

其中,c表示CGAN用于生成的先验信息,x'=G(c,x)为CGAN生成的图像。

除了LCGAN,CGAN模型还能通过优化真实图像对与生成图像对之间的距离来帮助生成器进一步合成风格相似的图像。为了有效地增加生成任务中的图像清晰度,我们使用L1范数来衡量这种距离,其损失表达式为

minG LL1G=Ex,x'~pdatax,x'x-x'1

CGAN用于图像不同域之间的转换时被证明具有很好的合成效果,联系到前文提到的卫星图像与地面图像之间匹配的跨视角问题,本文考虑将其用于图像的跨视角预测,将预测结果作为图像匹配的辅助信息,其转换过程如图2所示。

1.3 图像匹配损失函数

损失函数的选择在图像检索任务中至关重要,目前使用最广泛的是三元组损失函数,它强调相匹配的正图像对之间的距离严格小于不匹配的负图像对之间的距离,并且两者之间的差异大于一定的阈值。文献[11]指出损失函数中的阈值对实验结果影响很大。由于对不相关对缺少约束,三元组损失在减少类内方差时会导致类间方差较小,四元组损失[12]一定程度上解决了这一问题。CVM-Net[3]在四元组损失基础上进行改进,提出了加权软阈值四元组损失,加快了训练的收敛速度,表达式如下

Lquad,weighted=In1+eαdpos-dneg+In1+eαdpos-dneg*

其中,dposdneg分别表示同一图像对应的匹配正例之间的距离以及不匹配负例之间的距离,dneg*表示不同图像负例之间的距离,α表示对类内方差与类间方差进行优化的权重参数。CVM-Net通过加入软阈值方式避免了严格的距离阈值对网络参数优化结果的严重影响。

在这些基于距离算法的基础上,SARE损失[13]采用概率分布的方式表达匹配的结果,避免了三元组损失中阈值的影响,这种改进被证明是有效且更加鲁棒的。我们将对SARE稍作改进,详细描述见2.3节。

2  跨视角转换模块与图像定位框架

本节首先介绍CGAN对卫星图像进行跨视角转换的过程,然后将其融入到图像匹配的孪生网络框架中,最后提出了T-SARE损失函数对网络进行训练。

2.1 CGAN模块

利用CGAN解决街景图到卫星图的映射工作可以看作视觉域适应的过程,Zhai等[14]提出通过VGG(visual geometry group, VGG)特征变换得到语义图像,然后基于语义图像进行地面图像到卫星图像的迁移。Regmi等[15]提出了X-fork与X-seq两种CGAN结构,借助语义分割图像辅助实现图像跨视角的转换。我们的模型基于X-seq进行改进,其框架结构如图3所示。

CAS框架由两个CGAN共同组成,其中第一个CGAN用于由卫星图像到地面图像的转换,跨视角生成器G1将卫星图像Ia转换生成对应的地面图像Ig'。跨视角鉴别器D1以真实匹配图像对IaIg与生成图像对IaIg'作为输入进行参数优化,然后与G1进行对抗训练,D1的目标是鉴别可靠的卫星-地面图像对。第二个CGAN网络由第一个CGAN生成的地面图像得到语义分割图像,其中生成器G2Ig'作为输入来生成语义分割图像Sg',鉴别器D2以真实语义分割图像SgIg'组成的图像对以及生成图像对Sg'Ig'作为输入进行参数优化,然后与G2进行对抗训练,D2的目标是鉴别从地面图像得到的真实语义分割图像与G2所生成的语义分割图像。整个系统进行了端到端训练,两个CGAN同时训练,这里的语义分割图像主要是用于辅助跨视角的转换。在视角转换任务当中,许多模型难以从简单的俯视角度生成纹理与细节丰富的物体,语义分割图像则可以利用图像的轮廓信息生成更多的细节。

尽管带来了更多的细节生成效果,但X-seq在生成图像时却引入了更多的噪声。不同纹理条件下物体的转换特征不同,如同样作为俯视条件下的平面,屋顶和公路所对应的平视表现完全不同,这需要通过具体的纹理细节来进行判断。因此为了加强网络的分辨能力,本文在X-seq中CGAN模型的基础上,加入了空域的注意力结构,如图4所示。

空域的注意力结构通过给予特征图中不同位置的参数不同权重来帮助CGAN网络更好地从地面图像中捕捉建筑物与树木等相关的细节,实验证明加入注意力模块有效地压制了生成图像中的噪声与混乱信息,并且相对于一般CGAN视角转换模型具有更多的底层视觉特征,G1网络的损失函数与一般的CGAN网络损失函数相同,如(2)式所示。G2网络的损失函数则为

minG2 maxD2 LCGANG2,D2=EIg',Sg~pdataIg',SglogD2Sg,Ig'+ESg',Ig'~pdataSg',Ig'log 1-D2Sg',Ig'

其中Ig'=G1Ia,Sg'=G2(Ig')。除了上述生成器与判别器的损失之外,我们还向模型中加入了L1正则化项,最后模型的整体损失函数为

LX-seq=LCGANG1,D1+λLL1G1+LCGANG2,D2+λLL1G2

在这样的损失函数下,训练过程中G1D1G2G4的参数同时被优化。

2.2 系统框架

基于图像检索中的孪生网络框架,我们所提出的跨视角合成图像匹配网络(cross-view synthesis net,CVS-Net)如图5所示。

系统框架包含有两个相同网络结构的分支,分别输入地面图像和卫星图像。首先通过全卷积网络fL来获取图像的局部特征得到Ui=fLIi,θiL,Ug=fLIg,θgL。式中,Ig表示地面街景图像,Ii表示对应的卫星图像,θ表示对应CNN的网络参数,θLθG分别表示网络的局部特征模块参数和全局描述符模块参数。本文选择VGG16提取图像的局部特征向量并将其输入到NetVLAD层中获取全局描述符。图像的全局描述符可以用vi=fG(Ui,θiG)表示。框架中的两个分支采用完全独立的网络参数。将视角转换的CGAN模块加入到这一框架当中,首先将经CGAN模块变换后的地面图像作为独立数据输入到架构中的地面分支,并将其生成的全局描述符与卫星图像的全局描述符之间的距离加权后添加到损失函数当中对整体网络架构进行优化。

2.3 损失函数

SARE损失[13]将匹配的正例图形对与不匹配的负例图像对之间的距离表述为图像之间匹配的概率

Lθpos,neg=hposlog hposcpos+hnegloghnegcneg

其中,hposhneg分别对应正例与负例的概率分布,它们可以通过匹配正确的概率cpos和匹配错误概率的cneg进行逼近。不断优化cposcneg接近全局概率,SARE损失在收敛后不会达到一定的阈值就停止,因此不容易局限于局部最优的情况。cposcneg分别通过(8)和(9)式进行计算。

cpos=exp-dposexp-dpos+exp -dneg
cneg=1-cpos

其中,dposdneg分别代表正例全局描述符之间的距离和负例全局描述符之间的距离,这种距离在实验中通过欧氏距离计算得到。SARE损失是针对一般的图像检索架构设计的,而由于我们在传统框架的基础上加入了CGAN辅助预测模块,对于一个三元组而言,生成了4对需要匹配图像:地面-卫星图像正例,地面-卫星图像负例,合成-卫星图像正例,合成-卫星图像负例,在这基础上对SARE损失进行调整

cpos=λcpos|a+1-λcpos|g

其中,cpos|a表示航拍图像的匹配正确概率,cpos|g表示合成地面图像的匹配正确概率。总的损失函数cpos通过对cpos|acpos|g进行加权求和得到,在进一步的扩展实验中将其称为T-SARE损失。权重的选择将在实验中进行讨论。

3  实 验

3.1 数据集

选取CVUSA[16]和Vo&Hays[2]这两个经典跨视角数据集来评估我们提出的CVS-Net。CVUSA数据集包含35 532个地面-卫星训练图像对和8 884个测试图像对,其中所有地面图像均为全景图像。Vo&Hays数据集包含超过100万张来自9个不同城市的地面-卫星交叉图像,所有地面图像从全景图像中裁剪到固定大小230×230。我们从Vo&Hays数据集中随机选择8个城市的数据用于训练网络,另外1个用于测试。图6展示了数据集中的一些例子。

为了对CGAN模型进行训练,需要生成地面图像的语义分割图像。CVUSA数据集为地面图像标注了对应的语义分割图像,Vo&Hays数据集没有这一信息,因此我们使用前沿的深度模型RefineNet[17]从原始地面图像中进行提取。

3.2 实现细节

对于CVS-Net架构,使用在ImageNet上预训练的VGG16[18]来提取本地特征,然后通过NetVLAD生成全局描述符,其中NetVLAD层的聚簇数量参数设置为64。CGAN中的网络原始结构与文献[15]中相同并在空域当中嵌入了注意力机制。NetVLAD和全连接层中的所有参数都是随机初始化的。CVS-Net由Tensorflow框架进行实现,训练时使用Adam优化器,学习率为10E-5,完全连接层中dropout=0.9。训练时我们将匹配的卫星和地面图像对应地输入到孪生网络框架的两个分支中。对于一个具有M对图像的batch总共有4M×(M-1)个计算距离的图像描述符。这是因为每一个地面图像都存在一个对应的卫星图像正例以及M-1个负例,并且对每一个地面图像,都有一个相应的视角转换后的卫星生成图像。

3.3 实验结果

参照Vo&Hays[2]的评价指标。我们的网络是通过前1%的召回准确率来评估的,这指的是在实际检索的过程中,查询的地面图像对应的卫星图像出现在整个数据集匹配度排名的前1%中就视作匹配成功。在正式的图像地理定位实验之前,首先进行预实验确定T-SARE损失中参数的选取以及证明NetVLAD特征相对于其他特征的优越性。

3.3.1 参数优化

在T-SARE损失当中,参数表现的是真实地面图像与合成卫星图像在整体损失中各自所占据的空间。由于合成图像主要提供辅助信息帮助图像检索,而视角转换的实际效果始终是有限的,因此这里的权重选取过大会对真实图像的匹配检索造成干扰,但是选择太小则无法起到帮助定位的效果,为了探究当前合成模型对应的最优参数,在预实验中,我们选取数据集中的部分数据,观察其在不同权重对应的T-SARE损失下进行训练的短期收敛效果。由于辅助视角转换CGAN模型和图像数据分布是确定的,因此预实验决定的权重也能够在完整的图像定位实验中取得相应的优化效果。

参数选择实验的结果如图7所示,在这一实验中本文选用了top k指标作为定位效果的评价方式,top k评价指标的含义为正确匹配的图像与查询图像的特征相似度在整个数据库中位于前k个。图7展示了不同参数下模型在CVUSA和Vo&Hays数据集上前50、100、150的匹配准确率。可以看到整体变化都呈现先上升后下降的趋势,大都在λ为0.8左右到达峰值,因此下文的实验选取0.8作为基准超参数。

3.3.2 特征比较

为了证明提取图像全局描述符的有效性以及NetVLAD的优越性,我们选择了几个传统图像检索任务中常用的图像描述符、VLAD、费舍向量和词袋模型与基线神经网络进行比较。本文根据文献[7]中的NetVLAD网络层基于费舍向量和词袋描述符提出了NetFV与NetBOW网络层,将这些层用于图像检索生成全局描述符,并放置在孪生网络框架的顶部,网络框架中的局部特征都通过VGG进行提取。对于特征选择,文献[19]将特征子集视为图中的路径,基于马尔可夫链计算出任意特征间的长度来达到特征选择的过滤选择效果。文献[20]提出了细粒度的球邻域粗糙集方法进行特征缩减,进一步优化了现有方法的时间复杂度。为了对图像检索特征进行比较,本文在两个图像定位的数据集上进行定位结果的实验,结果如表1所示。

表1可知,将全局描述符提取加入到网络中对图像定位具有重要意义,加入全局描述符提取方法可以提高跨视角匹配的效果,其中NetVLAD层效果是最显著的,因此我们在接下来的实验中也选取NetVLAD提取图像的全局描述符。

3.3.3 定位实验

将我们提出的CVS-Net与6个当前的基线图像地理定位方法在两个经典数据集(CVUSA与Vo&Hays)上进行比较,并对加入空间注意力机制前后的CGAN分别进行测试。

表2展示了CVS-Net和基线方法的前1%召回率。可以看出,T-SARE损失训练的CVS-Net在CVUSA数据集上表现优异,并且在Vo&Hays数据集上的效果明显优于另外几种定位方法。本文方法在Vo&Hays数据集上效果显著提升是因为Vo&Hays数据集中的地面图像为非全景图,携带更少的信息量,而CAS模块由于预先进行了图像视角转换,可以帮助定位模型从图像中更多的维度捕获信息,因此相对于携带有大量信息的全景图可以取得更高的定位性能提升。上述结果表明我们所引入的辅助CAS模块是可行且有效的。

为了进一步验证T-SARE损失函数以及在CAS中引入的注意力机制的效果,我们对CAS中的注意力机制和T-SARE损失进行了消融实验,模型在两个数据集上的定位结果如表3所示。

从模型在两个数据集上的不同表现可以看出,加入了空间注意力机制的CAS对于CVS-Net的辅助效果优于没有加入空间注意力机制的视角转换模型,注意力机制通过抑制跨视角转换过程中生成的噪声帮助模型在整体上取得了更加稳定与准确的定位效果。对于Vo&Hays的普通裁剪图像,CVS-Net优异的结果表明CAS模块从裁剪图像中提取的跨视角信息极大地提高了定位任务的准确性。由于CVS-Net相对于一般的图像地理定位框架具有更复杂的输入输出,在使用三元组损失时阈值的选取更为复杂,对模型优化的结果影响也更大,难以找到具有最优效果的固定阈值。因此在CVS-Net中使用T-SARE损失取得了显著的性能提升。

从模型在Vo&Hays数据集上的显著提升可以推断出加入CAS视角转换模块可以更好地帮助信息量较少的地面图像进行定位,由于地面全景图的获取具有更高的难度,因此对低信息量图像的地理定位在实际场景中是更为常见的。为了进一步模拟现实场景,验证CVS-Net的鲁棒性,本文对Vo&Hays数据集中地面图像进行了多种后处理操作,包括常见的JPEG压缩、加噪声和部分区域遮挡,然后基于这些后处理之后的图像重新进行了模型训练与测试,并与部分基线模型进行了比较,评价指标为前1%召回率,最终结果如表4所示。

从实验数据中可以看到,相对于丢失了部分纹理信息的图像JPEG压缩和加噪声,对图像进行遮挡导致的语义信息的丢失会使各个模型都出现更大的定位性能损失。而与现有方法相对比,本文所提出的CVS-Net对于这些信息丢失的后处理场景明显具有更强的鲁棒性。

图8绘制了CVS-Net与其他方法在Vo&Hays数据集上的Top k(k从1到80)召回率。它进一步验证了我们所提出的框架结构优于其他现有的基线图像地理定位模型。

4  结 语

在本文中,我们提出了一种基于地面图像与卫星图像匹配的跨视角图像地理定位框架CVS-Net。首先引入了一个辅助的图像跨视角转换模块CAS,它从卫星图像生成地面图像,并通过空间注意力机制降低了跨视角转换噪声对模型的负面影响。转换模型生成的图像用于在整体框架中协助地理定位。此外,引入SARE损失改进了三元组损失收敛较慢、容易陷入局部最优的缺陷,并基于输入形式对SARE损失进行改进,得到了与CVS-Net匹配的T-SARE损失。在两个基准数据集上测试了CVS-Net,实验结果表明我们的方法相对于当前图像定位基线方法具有有效性和优越性。

由于引入了辅助跨视角匹配的CAS模块,相对于现有的深度图像地理定位模型,CVS-Net具有更多的神经网络参数与更高的计算复杂性。这种缺陷在具有海量数据的实际图像定位任务中可能会被更加放大,因此我们下一步的工作将会是优化网络框架的结构,结合视觉Transformer模型、注意力权重优化策略等降低CVS-Net的整体计算复杂性。另外从实验中可以看到,相对于CVUSA数据集,图像地理定位模型在Vo&Hays上的表现还有较大的优化空间,这也是我们下一步研究的方向。

参考文献

[1]

ZITOVÁ BFLUSSER J. Image registration methods: A survey [J]. Image and Vision Computing200321(11): 977-1000. DOI:10.1016/S0262-8856(03)00137-9 .

[2]

VO N NHAYS J. Localizing and Orienting Street Views Using Overhead Imagery [EB/OL]. [2022-01-02]. DOI: 10.1007/978-3-319-46448-0_30 .

[3]

HU S XFENG M DNGUYEN R M Het al. CVM-net: Cross-view matching network for image-based ground-to-aerial geo-localization [C]// Proceedings of the Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2018: 7258-7267. DOI:10.1109/CVPR.2018.00758 .

[4]

BANSAL MSAWHNEY H SCHENG Het al. Geo-localization of street views with aerial image databases [C]// Proceedings of the 19th ACM International Conference on Multimedia. New York: ACM, 2011: 1125-1128. DOI:10.1145/2072298.2071954 .

[5]

VISWANATHAN APIRES B RHUBER D. Vision based robot localization by ground to satellite matching in GPS-denied situations [C]//2014 IEEE/RSJ International Conference on Intelligent Robots and Systems. New York: IEEE Press, 2014: 192-198. DOI:10.1109/IROS.2014.6942560 .

[6]

JÉGOU HDOUZE MSCHMID Cet al. Aggregating local descriptors into a compact image representation [C]//2010 IEEE Computer Society Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2010: 3304-3311. DOI:10.1109/CVPR.2010.5540039 .

[7]

ARANDJELOVIC RGRONAT PTORII Aet al. NetVLAD: CNN architecture for weakly supervised place recognition [C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2016: 5297-5307. DOI: 10.1109/TPAMI.2017.2711011 .

[8]

CAI SGUO YKHAN Set al. Ground-to-aerial image geo-localization with a hard exemplar reweighting triplet loss [C]//Proceedings of the IEEE/CVF International Conference on Computer Vision. New York: IEEE Press, 2019: 8391-8400. DOI: 10.1109/ICCV.2019.00848 .

[9]

GOODFELLOW IPOUGET-ABADIE JMIRZA Met al. Generative adversarial nets [J]. Advances in Neural Information Processing Systems201427(2): 2672-2680. DOI: 10.5555/2969033.2969125 .

[10]

MIRZA MOSINDERO S. Conditional Generative Adversarial Nets[EB/OL]. [2021-10-23]. DOI: 10.48550/arXiv.1411.1784 .

[11]

HERMANS ABEYER LLEIBE B. In Defense of the Triplet Loss for Person Re-identification[EB/OL]. [2021-10-24]. DOI: 10.48550/arXiv.1703.07737 .

[12]

CHEN W HCHEN X TZHANG J Get al. Beyond triplet loss: A deep quadruplet network for person re-identification [C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2017: 403-412. DOI: 10.1109/CVPR.2017.145 .

[13]

LIU LLI H DDAI Y C. Stochastic attraction-repulsion embedding for large scale image localization [C]// Proceedings of the International Conference on Computer Vision. New York: IEEE Press, 2019: 2570-2579. DOI:10.1109/ICCV.2019.00266 .

[14]

ZHAI M HBESSINGER ZWORKMAN Set al. Predicting ground-level scene layout from aerial imagery[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2017: 867-875. DOI: 10.1109/CVPR.2017.440 .

[15]

REGMI KBORJI A. Cross-view image synthesis using conditional GANs [C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2018: 3501-3510. DOI: 10.1109/CVPR.2018.00369 .

[16]

WORKMAN SSOUVENIR RJACOBS N. Wide-area image geolocalization with aerial reference imagery [C]//Proceedings of the IEEE International Conference on Computer Vision. New York: IEEE Press, 2015: 3961-3969. DOI: 10.1109/ICCV.2015.451 .

[17]

LIN G SMILAN ASHEN C Het al. Refinenet: Multi-path refinement networks for high-resolution semantic segmentation [C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE Press, 2017: 5168-5177. DOI: 10.1109/CVPR.2017.549 .

[18]

SIMONYAN KZISSERMAN A. Very Deep Convolutional Networks for Large-scale Image Recognition [EB/OL]. [2021-10-23]. DOI: 10.48550/arXiv.1409.1556 .

[19]

ROFFO GMELZI SCASTELLANI Uet al. Infinite feature selection: A graph-based feature filtering approach [J]. IEEE Transactions on Pattern Analysis and Machine Intelligence202143(12): 4396-4410. DOI: 10.1109/TPAMI.2020.3002843 .

[20]

XIA S YZHANG HLI W Het al. GBNRS: A novel rough set algorithm for fast adaptive attribute reduction in classification [J]. IEEE Transactions on Knowledge and Data Engineering202234(3):1231-1242. DOI: 10.1109/TKDE.2020.2997039 .

[21]

SUN BCHEN CZHU Y Yet al. Geocapsnet: Aerial to Ground View Image Geo-Localization Using Capsule Network [EB/OL]. [2021-11-02]. DOI: 10.48550/arXiv.1904.06281 .

基金资助

国家自然科学基金(62072343)

国家自然科学基金(U1736211)

国家重点研发计划(2019QY(Y)0206)

AI Summary AI Mindmap
PDF (2498KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/