基于多视图特征融合网络的虚拟视图合成

朴燕 ,  马玉玺

吉林大学学报(工学版) ›› 2026, Vol. 56 ›› Issue (5) : 1352 -1362.

PDF (9065KB)
吉林大学学报(工学版) ›› 2026, Vol. 56 ›› Issue (5) : 1352 -1362. DOI: 10.13229/j.cnki.jdxbgxb.20241090
计算机科学与技术

基于多视图特征融合网络的虚拟视图合成

作者信息 +

Virtual view synthesis based on multi-view feature fusion network

Author information +
文章历史 +
PDF (9281K)

摘要

针对当前的新视角合成方法在恢复高频信息方面存在困难,导致生成图像中出现伪影和模糊现象的问题,提出了一种基于多视图特征融合网络的密集视图新视角合成方法。首先,采用基于快速傅里叶变换的抗锯齿编码算法,捕捉高频细节并提高虚拟视图的质量;其次,引入基于多尺度特征融合网络,利用Transformer作为聚合函数,通过改进多头注意力机制提取不同尺度的特征信息,并引入先验残差模块以缓解梯度消失问题,用于增强局部特征,提高合成质量;最后,引入颜色监督函数来隐式表示场景的颜色分布,解决颜色失真问题。实验证明:该方法可以快速渲染高质量虚拟视图并输出高质量3D图像,且表现优于其他方法。

Abstract

Current new view synthesis methods have difficulty in recovering high frequency information, resulting in artifacts and blurring in the generated images. Therefore, this paper proposes a new view synthesis method for dense views based on multi-view feature fusion network. Firstly, an anti-aliasing coding algorithm based on FFT is used to capture high-frequency details and improve the quality of the virtual view. Secondly, a multi-scale feature fusion network is introduced and Transformer is used as an aggregation function to extract feature information of different scales by improving the multi-head attention mechanism, and a prior residual module is introduced to alleviate the gradient disappearance problem, so as to enhance local features and improve synthesis quality. Finally, the color monitor function is introduced to implicitly represent the color distribution of the scene to solve the color distortion problem. Experiments show that this method can render high quality virtual view and output high quality 3D image quickly, and the performance is better than other methods.

Graphical abstract

关键词

计算机应用 / 多视图特征融合网络 / 神经辐射场 / 新视角合成 / 三维重建

Key words

computer applications / multi-view feature fusion network / neural radiance fields / new view systhesis(NVS) / three-dimensional reconstruction

引用本文

引用格式 ▾
朴燕,马玉玺. 基于多视图特征融合网络的虚拟视图合成[J]. 吉林大学学报(工学版), 2026, 56(5): 1352-1362 DOI:10.13229/j.cnki.jdxbgxb.20241090

登录浏览全文

4963

注册一个新账户 忘记密码

0 引 言

基于图像的视图合成1是计算机图形学和计算机视觉领域的关键研究方向。新视角合成旨在通过一组由相机拍摄的少量的三维场景图像,生成在未拍摄过的视点下的场景图像2,仿佛在该视点下有一个虚拟相机拍摄了场景,并能在未拍摄视角下进行渲染。这项技术广泛应用于远程会议和三维电影等领域,为用户提供了沉浸式的视觉体验。该技术的挑战在于如何利用不同视角的2D图像输入,重建三维场景的外观、几何形状、颜色和纹理等细节,并生成高质量的任意视点合成图像。新视角合成的方法主要分为两类:基于几何的重建(MBR)和基于图像的绘制(IBR)。基于几何的重建方法3从多张输入图像中提取三维信息进行重建,再利用光栅化4-6或光线追踪7-9的方法进行渲染,以生成新的视角图像。而基于图像的绘制方法10则直接利用输入图像,通过图像处理技术合成新的视点下的图像。

MBR方法根据自然场景中物体的结构特征对目标场景进行几何建模渲染,可以生成高质量的光场图像,但其渲染效率11仍需提升。为了提高效率,重建方法各有不同,常见的表示方法包括体素、网格、点云和分层深度等。例如,El-Hakim12依据视角图像获取点/坐标约束、表面约束和拓扑约束,从而重建出逼真的场景模型;Zhang等13通过输入一组稀疏场景图像,提取局部形状和纹理约束,生成满足约束的平滑三维表面;Cohen-Or等14提出了一种离散光线投射的方法,通过光线相干和多分辨率遍历加速生成经过纹理映射的基于体素的三维对象模型。基于几何的方法能产生相对高质量的合成结果,但这些方法的离散表示空间场景通常需要大量的数据和内存,且图像分辨率受限于重建几何模型的精度。

IBR方法通过插值给定的二维视图来渲染光场图像,从而降低了渲染复杂度并提高了渲染效率,同时提供了丰富的图像源。例如,Chen等15提出的视图插值方法和Seitz等16提出的视图变形方法,通过扭曲和混合输入图像中的相关斑块来生成真实的新视图,但这些方法对视点位置有较高的要求;Laveau等17利用图像间的约束关系,使用反向映射或光线跟踪技术合成新视图。然而,由于给定的二维视图缺乏完整的空间信息,这种方法可能会降低光场图像的渲染质量。基于深度图像的渲染(DIBR)方法18结合深度和纹理信息来渲染光场图像,这在一定程度上弥补了空间信息的不足,提高了渲染精度。基于图像的方法能够渲染高分辨率的合成图像,但通常需要大量的密集视角图像或明确的代理几何,并且容易出现渲染空洞和伪影等问题,难以实现高质量的估计。

近年来,随着深度学习技术的快速发展,基于深度学习的新视角图像合成方法逐渐成为研究热点。这些方法通过神经网络和其他启发式技术来预测混合权重和视图相关效果,并常与基于几何和图像的方法结合使用。特别是,自2020年NeRF(Neural radiance fields)方法19首次提出以来,神经渲染技术得到了显著进展。NeRF利用深度学习网络强大的表示能力,通过一个完全连接的神经网络(MLP)隐式地编码体积密度和颜色,从而实现了新视角图像的合成。与传统的显式表达方式如点云和网格不同,NeRF使用5D连续函数来隐式表示三维场景,并通过体渲染方法生成新视角图像。这种方法能从一组拍摄的图像中生成高度逼真的新视角图像,甚至重建出相应的表面细节,提供了前所未有的真实感。然而,尽管NeRF模型内存占用较小,它仍面临一些限制,包括训练和渲染速度较慢、对输入视角图像数量的要求高、无法适应环境光照的变化、仅能描述静态场景,以及模型的泛化能力有限,这些缺点限制了NeRF在实际应用中的价值。目前,该领域的研究主要集中在提升虚拟视点图像的质量和加快渲染速度两个方面。

在提升图像质量方面,基于预训练的MVSNeRF方法20通过将预先提取的输入视图图像特征映射到三维体绘制中,从而显著提升了图像质量。NeRF in the Wild(NeRF-W)方法21通过共享稀疏视图集合中的NeRF参数,提升了虚拟视点的质量。Mip-NeRF模型22采用抗锯齿锥形截锥体(Anti-aliased conical frustums)渲染技术,有效减少了虚拟视点中的锯齿伪影,并显著提高了NeRF在细节表现方面的能力。

在减少原始网络的训练和渲染时间方面,AutoInt23提出了一种近似积分框架,该框架通过查询表示反导数的网络来快速计算沿光线的体积分,从而显著提升了渲染速度。NSVF24采用稀疏体素八叉树结构来表示场景,并为每个体素学习场景的局部属性,以加快渲染过程;FastNeRF25通过缓存每个空间位置的深度辐射度贴图,实现了实时渲染;Instan-NGP26则利用多分辨率哈希编码将数据权重直接映射到对应位置,将NeRF的训练时间从小时级别缩短到秒级别。

尽管上述方法显著提升了虚拟视点的图像质量,但NeRF在渲染过程中需要查询深度多层感知器(MLP)数百万次,这导致了图像处理时间过长,因此在处理不同分辨率的图像时容易出现过度模糊或混叠现象。

针对上述问题,本文提出了一种基于多视图特征融合网络的虚拟视图合成方法。该方法能生成高质量的虚拟视图,适用于真实场景和物理模拟场景。首先,通过多视图校准算法SFM对拍摄的RGB图像进行位姿校准,利用相机的内部和外部参数,在相机截锥体内定期采样获得位置p=(x,y,z)和方向d=(θ,φ)。将得到的位置p和方向d送入抗锯齿编码模块以捕获不同频率的高频信息,之后将多视图图像与位置编码一起送入多视图特征融合网络中进行特征提取。通过多次训练,采用射线积分计算出像素值,最终输出体密度σ和RGB颜色值,该网络通过最小化颜色均方误差进行端到端训练,加速了高质量视图的合成。

1 本文算法

本文针对:①NeRF没有足够有效利用输入视图之间的几何关系,会导致最终结果出现不一致问题;②在处理光滑或透明的场景时,NeRF生成图像存在模糊和混叠现象,提出了一种基于多视图特征融合网络的密集神经辐射场虚拟视图合成方法。具体算法流程如图1所示。首先,输入一组由RGB相机拍摄的真实场景图像,采用局部迭代光束法经过运动恢复结构SFM对输入图像进行稀疏点云重建,并获取相机位姿。其次,计算光线与图像交点的采样点坐标,并将这些采样点通过位置编码获取到图像高频特征向量,与原始图像一起放入多尺度特征融合网络中进行训练拟合。对输出的体密度27和颜色进行体渲染技术得到新视角图像及其对应的深度图。最后,在网络中引入颜色监督函数对真实图像与预测图像进行损失函数计算,对网络进行监督训练,从而进一步提升新视角图像的渲染质量。本文主要从抗锯齿编码、多视图特征融合网络和颜色监督函数三部分对该算法进行描述。抗锯齿编码通过引入快速傅里叶变换FFT处理不同采样点的高频信息,从而捕获更多空间特征信息,提高渲染质量。多视图特征融合网络通过输入场景的几何信息(方向,不透明度、位置等),利用多层注意力机制网络进行特征拟合,得到虚拟视图对应点的颜色和体密度。损失函数利用得到的渲染颜色值,通过颜色监督函数计算渲染颜色值与输入视图真实颜色值之间的损失,从而生成最终的虚拟视点图像。

1.1 三维场景隐式表示抗锯齿编码

位置编码28是一种将结构化对象的坐标转换为有限维度特征向量的技术,这在现代语言模型和视觉任务中尤为关键。这些任务涉及将信号(如二维图像或三维物体)编码为神经网络的权重。具体来说,编码方法通过一组多尺度不同频率的正弦和余弦函数(即傅里叶频率映射)将坐标映射到一个更高维的空间,从而使坐标型MLP能更有效地学习高频信息。位置编码中的每一项对应映射后的一个维度,用于获取采样点之间的位置信息。

标准的多层感知机(MLP)在处理基于坐标的低维视觉和图形任务时存在局限,因为MLP难以有效学习高频函数,这种现象称为“频谱偏差”。尽管使用预定义频率的傅里叶特征编码可以在一定程度上缓解MLP的频谱偏差,但它们在捕捉多维空间中的位置关系时依然存在局限性,且缺乏灵活性,例如L2距离或更复杂的位置关系。因此,NeRF合成的虚拟视点图像在高频细节上仍有不足之处。为解决这一问题,本文提出了一种基于快速傅里叶变换FFT的抗锯齿编码算法。在傅里叶特征位置编码中,需要预定义一个特征纹理网格模型来初始化隐式场景表示,经过高斯分布初始化后,位置编码的内积近似于欧几里得距离,使网络的核函数变为平移不变核,从而实现隐式神经表示对高频成分的快速收敛。不同于NeRF中在射线上进行采样,本算法需要计算相机射线与初始化网格的交点,将交点所在网格的顶点坐标作为下一步位置编码的输入空间坐标,通过傅里叶编码函数对空间位置进行映射,得到编码后的特征嵌入向量。该算法通过一个可学习的特征映射函数,将低维空间位置映射到高维特征空间,并利用多尺度的正弦和余弦函数捕获高频信息,从而使MLP能更有效地学习细节。这种映射显著减少了图像中的锯齿伪影,并能更好地处理细节,减轻高频信息的混叠现象,避免了常见的锯齿伪影。

因此,为了实现这一点,首先将式(1)转换为傅里叶特征,即式(2)(3)所示:

γ(x)=[sin(x),cos(x),,sin(2L-1x),cos(2L-1x)]T
P=1002002L-10001002002L-10001002002L-1T
γ(x)=sin(Px)cos(Px)

式中:B为随机概率矩阵,服从正态分布,它将输入坐标从3维映射到m维的高维空间,即:

Bij~𝒩(0,σ2),Bm×3

通过将随机采样的基函数应用到输入中,可以得到更多高频的特征表示。x=πBx,xm将输入的3D坐标x投影到高维空间,以实现快速傅里叶位置编码。

之后令其均值和协方差为:

μγ=Pμ,Σγ=PΣPT

最后,计算其多元高斯分布的期望,并由位置编码的正弦和余弦调制,其表达式为:

Ex~N(μ,σ2)[sin(x)]=sin(μ)exp(-(12)σ2)
Ex~N(μ,σ2)[cos(x)]=cos(μ)exp(-(12)σ2)
γ(μ,Σ)=Ex~N(μγ,Σγ)[γ(x)]=sin(μγ)exp(-(12)diag(Σγ))cos(μγ)exp(-(12)diag(Σγ))

因为位置编码独立地对每个维度进行编码,所以这种期望的编码只依赖于γ(x)的边缘分布,并且只需要协方差矩阵的对角线。由于Σr相对较大,计算成本较高,因此直接计算Σr的对角线,即式(9)

diag(Σγ)=[diag(Σ),4diag(Σ),,4L-1diag(Σ)]T

与NeRF的位置编码相比,本文FFT位置编码保留了超参数L范围内的所有频率,通过缩放每个正弦和余弦来实现。因此,FFT位置编码可以有效抵抗混叠,平滑地编码空间体积的大小和形状,同时有效地消除了NeRF位置编码中手动调整的超参数L,将其设为可学习的参数,无需进一步调整,可以自动求得最佳频率。

1.2 多视图特征融合网络

本文提出了多视图特征融合网络模型,如图2所示,使用Transformer作为聚合函数,避免了将注意力集中在源视图中的每个像素,从而解决了NeRF在利用输入视图之间的几何关系时出现不一致的问题,并且避免了内存限制和缺乏多视图几何先验。本文将注意力放在相邻视图相应极线上的像素上。具体而言,将每个输入视图编码为特征图,并通过其多尺度架构不仅可以提取阴影信息,还能提取材质、语义、局部或全局复杂的光传输等信息。

该模型分为两个主要阶段。在第一阶段中,首先,对输入的多视图进行相机位姿估计,并通过FFT位置编码获取空间高频特征信息;接着,在特征融合提取网络中引入改进的多头注意力机制MHA,以丰富语义信息。该机制同时实现水平和竖直方向的注意力,保留了样本内目标的位置信息,有效增强了模型对特征的表达能力。最后,采用先验残差网络稳定训练过程,缓解额外网络层数带来的信号和梯度衰减问题,并有效处理复杂的输入特征。

在第二阶段中,采样点的特征与预先定义的特征纹理网格被一起输入到特征融合网络中,该网络进一步提取和存储三维场景中的空间位置信息,捕捉场景中的高频细节和局部微小特征。通过这种方式,特征融合网络能更好表达复杂的几何结构。最后,这些处理后的特征被用于预测虚拟视角下的颜色值。相比原始NeRF使用的两层MLP分别处理粗采样和精采样,本文方法用特征融合网络替代了这两个MLP模块。这一改进能显著减少渲染结果中的伪影和锯齿问题,并提升图像质量。此外,该方法还加速了隐式神经表示的优化过程,从而实现了实时视点图像渲染的应用。

1.3 特征融合注意力网络

本文介绍了特征融合注意力网络,用于处理位置和视角信息。网络结构如图3所示,主要操作包括对多视图进行不同大小采样率的卷积采样,然后将结果送入改进的多头注意力机制。使用多头自注意力(MHA)来增加通道数量,然后通过一个1×1卷积层输出处理后的特征,从而扩大局部信息的感受野,减轻图像中的伪影和模糊现象。多头自注意力是Transformer模型的关键组成部分,它首先将数据分词成序列,然后计算各标记之间的关系得分,以平衡给定输入上下文中的信息。形式上,令XRN×d,表示具有N个标记的d维度的一些序列数据。自注意力层将特征矩阵转换为:

Attn(X)=softmax(A)fν(x)Ai,j=α(Xi,Xj),i,j[N]

式中:ARN×N为注意力矩阵;softmax()操作按行对注意力矩阵进行归一化;α()为成对的关系函数;α(Xi,Xj)=fQ(Xi)TfK(Xj)/γ,其中fQ()fK()fV()称为查询、键、值映射函数。

这种自注意力类似于聚合操作,多头注意力(MHA)设置了一组自注意力块,并采用线性层将它们投影到输出空间上,如式(11)所示:

MHA(X)=Attn1(X)Attn2(X)AttnH(X)W0

在多头注意力机制MHA之后,Transformer的一个标准层还采用前馈网络(FFN)进行逐点特征转换,同时采用残差连接和层归一化来训练。整个Transformer块可以用式(12)表述如下:

X˜=MHA(LayerNorm(X))+XY=FFN(LayerNorm(X˜))+X˜

相较于将特征维度压缩成标量的点积,改进的多头注意力机制矩阵的每个通道计算不同的注意力分数,从而增加特征交互的多样性。同时,通过使用线性层W增强注意力机制矩阵,提高空间相关性,将注意力Δ提升到隐藏层维度。经过改进的注意力机制可表示为:

Image-Attn(X)=diag(softmaxA+                                         ΔTfVX+Δ)Aj=fQX0-fKXj

式中:AjA的第j列;Δ为源视图图像标视图图像之间的差值;fQfKfV为参数化的结果。

1.4 先验残差与前馈网络

先验残差网络是一个多层感知机(MLP)渲染器,其结构如图4所示。在输入前文提取的特征信息并经过归一化层处理后,确保了输入特征在进入前馈网络之前被规范化。线性层和激活函数在前馈网络(见图5)中能捕捉输入特征的复杂非线性关系,而Dropout层则用于防止过拟合,提高模型的泛化能力。最后,通过一个全连接层将处理后的特征映射为3维的RGB颜色值。

1.5 颜色监督函数

由于输入视图中的视差不足限制了多视图特征融合网络向全局一致方向优化,导致在训练视图上容易过拟合,且对新视图的泛化能力差。为了增加正则化效果,在损失函数中引入颜色监督函数和纹理网格损失,以指导网络学习正确的3D场景结构和颜色分布,从而实现高质量的新视角合成。其计算公式定义为:

L(G,C)=λ1C-C^1L1+λ2SSIM(C,C^)Lssim+λ3Corr(G,C^)1Lcorrelation

式中:L1Lssim为预测图像C^和真实图像C之间的颜色损失;Lcorrelation为训练视图和合成视图上的几何正则化,其定义如下:

Corr(G,C^)=Cov(G,C^)Var(G)Var(C^)

通过特征纹理网格G搜索,λ1λ2λ3分别为0.9、0.15和0.05。在1 000次迭代后启用颜色监督函数,以确保网络能合成高质量的渲染图像。

2 实 验

本节为评估所提出的多视图特征融合网络的虚拟视图合成的性能,对实验结果进行了定量和定性分析,并评估了本文方法的视图合成质量和速度性能。在实验中选择了一些传统的和基于学习的方法进行比较,例如LLFF(基于多平面图像的方法)、NeRF(基于神经辐射场的方法)和TensoRF(张量辐射场)。值得注意的是,NeRF通过将捕获的3D场景编码到网络参数来合成虚拟视图,这不能在未经训练的场景中使用。因此,在实验中,NeRF在每个评估场景上进行训练。为评估定量性能,使用结构相似性指数(SSIM)、峰值信噪比(PSNR)和学习感知图像块相似度(LPIPS)衡量生成的结果与真实虚拟视图图像之间的相似性。SSIM从亮度、对比度和结构方面量化图像属性,范围为[0,1],数值越高,表示合成的虚拟视图与原视图的相似度越高。PSNR用于评价图像的失真程度,其数值越高,表明合成的虚拟视图的质量越好。LPIPS使用深度特征衡量图像之间的相似性,数值越小,表明合成的虚拟视图与原视图的相似性越高。与其他视图合成方法相比,本文方法合成视图的质量显著提高,特别是在细节还原方面。

2.1 实施条件

仿真实验在Ubuntu 20.04操作系统下进行,实验计算平台使用CPU为16 vCPU Intel(R) Xeon(R) Platinum 8352V CPU@2.10 GHz,显卡为1个NVIDIA GeForce RTX 4090 24G显存,相关代码采用Python3.8语言,在Pytorch1.13.1+cu118框架下进行编写。本文模型输入为视角图像和相机的位姿信息,本文分别使用了3个不同的数据集,包括多视图前向场景(真实前向),nerf_synthetic和自己拍摄的光场三维数据集。采用COLMAP软件对稀疏图像进行相机标定,得到相机的内外参数。假设数据集中每个场景数据有N张,测试集样本的间隔为8,那么每8张图片中选取一张作为测试集,总共会有N/8张图片作为测试集,用于评估综合视图的质量。剩下的N-(N/8)张图片作为训练集用于训练多视图特征融合网络模型。每个视图在相机视锥内进行光线采样,并为神经网络设置光线采样数,使用批量大小为4 096像素射线的T步优化模型。

2.2 数据集

本部分介绍用于虚拟视图合成的公共和本文稀疏视点数据集。这些数据集包含面向前方和环形射击场景,用于视点合成研究。

第一个数据集是nerf_synthetic,是一种合成数据集。这个数据集包含8种不同物体的800×800像素的多视角图像,且均为颜色值包含4个通道的RGBA图像。这些物体往往几何结构复杂,且为非朗伯材质。除物体外,图像的其余基于特征提取算法的新视角图像合成算法部分透明度均为0,需要在代码中将透明部分转化为不透明且颜色值为白色。

第二个数据集是nerf_llff_data,是一种真实数据集。这个数据集是由原作者拍摄的真实照片集制作的,包含10种不同场景的1 008×756像素的多视角图像,均为颜色值包含3个通道的RGB图像。

本文使用COLMAP做稀疏重建,从而获得相机的参数估计,最终构建出新的数据集。COLMAP常用来实现通用的运动结构(SFM)任务和多视图立体(MVS)任务,它既可以使用命令行界面运行,也提供了图形界面供开发者运行,包含特征提取、特征匹配、稀疏重建、深度图估计、稠密重建等诸多功能来实现有序和无序图像数据集的重建。

2.3 实验分析

选取几个典型场景,从3个数据集中合成虚拟视图进行对比实验,将本文算法与NeRF、TensoRF等主流虚拟视图合成算法进行比较。为验证本文方法的有效性,进行了光线原点到单位球交点的均匀采样,采用射线投射来对内部和外部体积进行处理,进行了新视角视图合成、基线比较和消融实验。

为评估本文算法的有效性,选择将LLFF前向场景和合成数据集nerf_synthetic进行对比实验。在评估过程中,使用多视图图像作为输入数据。对比不同方法合成的新视角图像,如图6图7所示(彩图参见电子版,下同),可以看出本文方法在视觉效果上优于TensoRF方法。生成的新视角图像十分清晰,例如图6中的Room和图7中的lego场景。本文方法能保留物体的轮廓和边缘细节,在重建时形成一致的3D光滑表面。在细节比较中,在Forterss场景中,更好地还原了建筑房屋的外部细节信息,如图6中的红色框所示。在Room场景中还原了桌子上的三维梯形物体边缘的阴影,使其更加逼真。相比之下,与TensoRF相比,本文方法在细节方面表现出色。此外,图7中的lego场景中乐高积木边缘的白色粉末也具有高还原度。综上所述,本文提出的多视图特征融合网络可以有效提高虚拟视图的渲染质量。

为了评估本文提出的改进模型的性能,对其在前向数据集LLFF和合成数据集nerf_synthetic上进行了训练和比较。表1~表4展示了所有生成的虚拟视图的SSIM、PSNR和LPIPS定量结果。结果表明:本文方法在SSIM、PSNR和LPIPS值上优于其他基于2D图像的方法。

根据表1,在LLFF中对于室外弱纹理花场景,可以看到,本文算法的合成视图PSNR远高于其他算法。在1 008×756分辨率下,该算法的PSNR平均达到27.34 dB,比原始NeRF提高了0.84 dB。另外,本文所使用的算法生成的虚拟视图质量明显优于NeRF方法,而NeRF方法生成的虚拟视图则更加模糊。由表4可知,对于乐高模型lego场景,本文算法可以从稀疏视点准确重构内容分布,其PSNR约为34.73 dB,SSIM约为0.976,LPIPS约为0.011。本文方法生成的虚拟视图质量高,且生成速度比NeRF快许多。因此,实验结果表明本文提出的多视图特征融合网络能充分捕获公共数据集中更多源视图的细节特征信息,从而快速生成高质量的虚拟视图。

2.4 消融实验

为了更好地体现多视图特征融合网络有利于合成虚拟视图的质量,对改进的多头注意力机制进行消融实验,将无FFT无MHA,有FFT无MHA,有FFT有MHA的方法在flower场景进行消融实验。

实验结果如图8所示,可以看出,加入改进的MHA对网络进行的补偿作用,有利于提高合成视图质量。从表5中可以看出,相比较之下加入的改进多头注意力机制对合成视图质量贡献更大。

3 结束语

针对生成视图产生的锯齿模糊现象以及输入输出图像结果差异较大等问题,提出了一种基于多视图特征融合网络的快速渲染虚拟视图的算法。在第一阶段,使用快速傅里叶变换位置编码来获取空间高频信息得到不同采样点的特征;在第二阶段,提出了一种基于多视图特征融合网络的渲染方法,采用改进的多头注意力机制训练网络模型,提取不同细节的特征信息,以快速合成高分辨率和高质量的3D图像。实验结果证明:与其他视图合成方法相比,本文方法合成虚拟视图的质量显著提高,合成视图的PSNR约为27.34 dB,SSIM约为0.865,LPIPS约为0.090。

参考文献

[1]

Chan S, Shum H Y, Ng K T. Image-based rendering and synthesis[J]. IEEE Signal Processing Magazine, 2007, 24(6): 22-33.

[2]

Martínez C M, Javidi B. Fundamentals of 3D imaging and displays: a tutorial on integral imaging, light-field, and plenoptic systems[J]. Advances in Optics and Photonics, 2018, 10(3): 512-566.

[3]

Remondino F, El-Hakim S. Image-based 3D modelling: a review[J]. The Photogrammetric Record, 2006, 21: 269-291.

[4]

Molnar S, Cox M, Ellsworth D, et al. A sorting classification of parallel rendering[J]. IEEE Computer Graphics and Applications, 1994, 14(4): 23-32.

[5]

Moreland K D. IceT Users' Guide And Reference[M]. Albuquerque: Sandia National Laboratories, 2011.

[6]

Moreland K, Kendall W, Peterka T, et al. An image compositing solution at scale[C]∥Proceedings of 2011 International Conference for High Performance Computing, Networking, Storage and Analysis, New York, 2011: No.25.

[7]

Dietrich A, Gobbetti E, Yoon S E. Massive-model rendering techniques: a tutorial[J]. IEEE Computer Graphics and Applications, 2007, 27(6): 20-34.

[8]

Wald I, Slusallek P. State of the art in interactive ray tracing[C]∥Proceedings of the 22nd Annual Conference of the European Association for Computer Graphics, Manchester, UK, 2001: 1-21.

[9]

Wald I, Mark W R, Günther J, et al. State of the art in ray tracing animated scenes[J]. Computer Graphics Forum, 2009, 28(6): 1691-1722.

[10]

Anantrasirichai N, Geravand M, Braendler D, et al. Fast depth estimation for view synthesis[C]∥Proceedings of the 28th European Signal Processing Conference, Amsterdam, The Netherlands, 2021: 575-579.

[11]

Halle M. Multiple viewpoint rendering[C]∥SIGGRAPH'98: Proceedings of the 25th Annual Conference on Computer Graphics and Interactive Techniques, Orlando, USA, 1998: 243-254.

[12]

El-Hakim S F. A flexible approach to 3D reconstruction from single images[C]∥ACM SIGGRAPH, Los Angeles, USA, 2001: 12-17.

[13]

Zhang L, Dugas P G, Samson J S, et al. Single-view modelling of free-form scenes[J]. The Journal of Visualization and Computer Animation, 2002, 13(4): 225-235.

[14]

Cohen-Or D, Rich E, Lerner U, et al. A real-time photo-realistic visual flythrough[J]. IEEE Transactions on Visualization and Computer Graphics, 1996, 2(3): 225-265.

[15]

Chen S E, Williams L. View interpolation for image synthesis[C]∥Proceedings of the 20th Annual Conference on Computer Graphics and Interactive Techniques, Anaheim, USA, 1993: 279-288.

[16]

Seitz S M, Dyer C R. View morphing[C]∥Proceedings of the 23rd Annual Conference on Computer Graphics and Interactive Techniques, New Orleans, USA, 1996: 21-30.

[17]

Laveau S, Faugeras O D. 3-D scene representation as a collection of images[C]∥Proceedings of 12th International Conference on Pattern Recognition, Jerusalem, Israel, 1994: 689-691.

[18]

Oliveira Q D, Silveira T L D, Walter M, et al. A hierarchical superpixel-based approach for DIBR view synthesis[J]. IEEE Transactions on Image Processing, 2021, 30: 6408-6419.

[19]

Mildenhall B, Srinivasan P P, Tancik M, et al. NeRF: representing scenes as neural radiance fields for view synthesis[C]∥European Conference on Computer Vision, Glasgow, UK, 2020: 405-421.

[20]

Chen A P, Xu Z X, Zhao F Q, et al. MVSNeRF: fast generalizable radiance field reconstruction from multiview stereo[C]∥Proceedings of 2021 IEEE/CVF International Conference on Computer Vision, Montrea, Canada, 2021: 14104-14113.

[21]

Martin B R, Radwan N, Sajjadi M S M, et al. NeRF in the wild: neural radiance fields for unconstrained photo collections[C]∥Proceedings of 2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition, Nashville, USA, 2021: 7206-7215.

[22]

Barron J T, Mildenhall B, Verbin D, et al. Mip-NeRF 360: unbounded anti-aliased neural radiance fields[C]∥Proceedings of 2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition, New Orleans, USA, 2022: 5460-5469.

[23]

Lindell D B, Martel J N P, Wetzstein G. Autoint: automatic integration for fast neural volume rendering[C]∥Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, Nashville, USA, 2021: 14556-14565.

[24]

Liu L, Gu J, Zaw L K, et al. Neural sparse voxel fields[J]. Advances in Neural Information Processing Systems, 2020, 33: 15651-15663.

[25]

Garbin S J, Kowalski M, Johnson M, et al. Fastnerf: high-fidelity neural rendering at 20 fps[C]∥Proceedings of the IEEE/CVF International Conference on Computer Vision, Nashville, USA, 2021: 14346-14355.

[26]

Müller T, Evans A, Schied C, et al. Instant neural graphics primitives with a multiresolution hash encoding[J]. ACM Transactions on Graphics, 2022, 41(4): 1-15.

[27]

Kajiya J T, Von H B P. Ray tracing volume densities[J]. ACM SIGGRAPH Computer Graphics, 1984, 18(3): 165-174.

[28]

Vaswani A, Shazeer N, Parmar N, et al. Attention is all you need[C]∥Advances in Neural Information Processing Systems, Long Beach, USA, 2017: 6000-6010.

基金资助

吉林省科技支撑项目(20220201062GX)

AI Summary AI Mindmap
PDF (9065KB)

0

访问

0

被引

详细

导航
相关文章

AI思维导图

/