GeoNet:用于联合深度和表面法线估计的几何神经网络(论文2018)
GeoNet: Geometric Neural Network for Joint Depth and Surface Normal Estimation
作者:Xiaojuan Qi、Renjie Liao、Zhengzhe Liu、Raquel Urtasun、Jiaya Jia
摘要:
本文提出了几何神经网络(GeoNet)联合预测单个图像的深度和曲面法向量图,在两条区干CNN的基础上,我们的GeoNet通过新的深度到法线和法线到深度网络,整合了深度和曲面法线之间的几何关系,深度到法线网络利用了曲面法线深度的最小二乘解,并利用残差模块提高了其质量。而法线深度网络则是通过一个核回归模块,根据曲面法线的约束条件,对深度图进行细化,而核回归模块没有参数可学习。这两个网络加强了底层模型对深度和曲面法线的有效预测,以获得较高的一致性和相应的精度。我们在NYU v2数据集上的实验验证了我们的GeoNet能够预测几何一致的深度和法线图。它在曲面法线估计方面取得了很好的性能,和目前的深度估计方向相当。
一、介绍
我们研究了从单个RGB图像中联合估计深度和曲面法线的重要问题。2.5维几何信息有助于实现各种计算机视觉任务,包括运动结构(SfM)、三维重建、姿态估计、目标识别和场景分类。
在单张图像中存在大量的深度估计方法[25,19,7,21,31,24,16,20,34,18]和曲面法线估计[7,33,3,2,18]。其中,基于深度神经网络的方法取得了很希望的效果。
挑战。尽管在这领域取得了很大的进展,但我们注意到,以前的方法大多数是独立于处理深度和法线估计的,这可能会使它们的预测不一致,而不考虑紧密的基础几何关系。例如,如在[32]所示,预测的深度图在平面区域可能发生畸变。因此,如果考虑到曲面法线在平面区域中变化不大这一事实,问这个问题很有趣的。这思想促使我们设计新的模型,这些模型正是基于上述简单事实,但潜在地显示了这一领域的一个重要方向,利用深度和曲面法线之间不可避免的几何关系来进行更精确的估计。
我们用图1这个例子去说明这常识关系。一方面,曲面法线是由三维点的局部曲面切平面决定的,可由深度来估计;另一方面,深度是由曲面法线确定的,而局部曲面切平面来约束的。虽然它看起来很简单,但设计神经网络来正确利用这些几何条件并非易事。

我们注意到,如[25,4]所述,通过手工制作的特征将几何关系融入传统模型已经是可行的。然而,在神经网络中还没有很多的研究来实现它。一种可能的设计是建立卷积神经网络(CNN),直接从数据中学习这种几何关系。然而,我们在第 4.2 节中的实验表明,即使使用常见的成功CNN 架构,如VGG-16,我们也无法从深度获得任何合理的正常结果,甚至接近。研究发现,在给定精心调整的结构和超参数的情况下,训练总是收敛到很差的局部极小值。
这些广泛的实验表明,单前的分类CNN体系结构不具备从数据中学习种几何关系的必要能力。这一发现促使我们设计专门的架构,明确地结构和实施几何条件。
我们的贡献:本文提出用几何神经网络(GeoNet)在一个统一的系统中推断深度和曲面法线。GeoNet的结构包括一个双流CNN,它分别从一副图像中预测深度和曲面法线。这两个网络管理这两个流来建模深度到法线和法线到深度的映射
特别是,基于最小二乘法和残差模型的深度到法线网络有效地捕捉了几何关系。法线到深度网络通过内核回归模块更新深度估计;它不需要任何应该学习的参数。利用这些耦合网络,我们的GeoNet将强制执行深度和曲面法线的最终预测,以遵循基本条件。此外,这两个网络计算效率高,因为它们没有许多参数可供学习。
在NYU v2的数据上的实验显表明,我们的GeoNet在大多数评估指标方面达到了最新的性能,并且比其他备选方案更有效。
二、相关工作
2.5维几何估计是近年来研究的热点。以前的工作大致可以分为两类。
传统的方法没有使用深层神经网络,主要集中于挖掘底层图像线索和几何约束。例如,[30]的方法通过识别图像中显现的结构来估计场景的平均深度,并推断场景的尺度。基于马尔克夫随机场(MRF),Saxena等人。[25]根据单个图像的手工特征预测图像深度图。[12]中使用消失点和消失线来恢复曲面布局。
另外,Liu等人。[19]利用语义分割的预测标签来合并几何约束。文[15]提出了一种基于尺度的分类器来联合学习语义分割和深度估计。Shi等人。[27]表明估计离焦模糊有利于恢复深度图。在文献[4]中,我们形成了一个统一的优化问题,其目的是从阴影中恢复场景的内在属性,如形状、照明和反射。基于特殊设计的特征,上述方法直接结合了几何约束。然而,它们的模型容量和通用性对于处理不同类型的图像可能不尽如人意。
近年来,随着深度学习的深入,人们提出了许多方法来进行单图像深度或/和表面法向预测。Eigen等人。[8]将图像输入CNNs,直接预测深度图。Shelhamer等人。[26]提出了一种基于完全卷积网络(FCN)的方法来学习单个图像的完全内禀分解,其中包括作为第一个中间步骤推断深度图。在文献[7]中,深度/法向预测采用了从粗到细的统一层次网络。
用于预测单图像表面法向,Wang等人。[33]将本地、全局和消失点信息合并到网络架构设计中。文献[20]在CNN的基础上建立了一个连续条件随机场(CRF),用于平滑基于超像素的深度预测。还有一种跳连结构[3]用于融合不同层的隐藏表示以进行表面法向估计。
所有这些方法都将深度和地表法向预测视为独立的任务,忽略了它们之间的基本几何关系。与我们最相关的工作是[32]的工作,考虑到平面区域内预测深度和表面法向的一致性,设计了一个具有4流CNN的CRF。然而,当平面区域在图像中不常见时,它可能会失败。相比之下,我们的GeoNet利用了一般情况下深度和表面法向之间的几何关系,而不做任何平面或曲率假设。它不仅限于特定类型的区域,而且计算效率高。
三、几何神经网络
在这一节中,我们首先介绍了深度到法线网络,它从给定的深度图中提炼出曲面法线。然后我我们解释了从给定的曲面法线图更新深度的法线深度网络。接下来是GeoNet的总体架构,它利用了这些新模块。
3.1 深度到法线网络
如前所述,通过直接应用神经网络从深度学习几何一致的曲面法向是非常困难的。从基于几何的解[9]中得到启发,我们提出了一种新的神经网络结构,它以初始曲面法向图和深度图为输入,预测出较好的曲面法向。我们首先介绍几何模型,它可以看作是一个固定权重的神经网络。然后,我们解释了用于平滑和组合曲面法向预测的残差模块。


残差模块:由于噪声和其他图像问题,这种最小二乘模型偶尔会产生曲面法线的噪声估计。图2显示了一个粗糙的法线图,为了提高精度,我们提出了一个残差模块,它由一个带跳跃连接的三层CNN和一个卷积层组成,如图2所示。器目标是平滑噪声,并结合曲面法线的初始猜测进一步提高质量。特别地,在汇入1x1卷积之前,该CNN的输出与曲面法线的初始估计相连接,后者可以是另一个网络的输出。

图2的最后一行显示了这种深度到标准网络的体系结构。通过显示地利用深度和曲面法线之间的几何关系,我们的网络避免了前面提到的学习几何一致曲面法线的困难。由于最小二乘模型只是一个固定权重层,所以计算效率高。另外重要的好处来自于使用地面真实深度作为输入来预测训练网络。它允许连接和联合微调其他网络,从原始图像预测深度图。


3.3 GeoNet
全结构:通过以上两个网络,我们现在解释图3所示的完整模型。我们首先使用两个流CNN来预测初始深度和表面法线图,分别如图3(a)和(b)所示。我们采用的基本结构是(1)VGG-16和(2)ResNet-50[11]。

基于一个CNN预测的初始深度图,我们将深度应用于第3.1节中解释的法线网络,以细化法线,如图3©所示。类似地,如图3(b)所示,给定曲面法线估计值,我们使用第3.2节中描述的法线深度网络细化深度。我们以地面真实深度为输入,并将深度预测到法线网络。对于法线到深度的网络,我们不需要学习任何权重。

四、实验
我们在NYU v2数据集上评估了我们的方法的有效性[28]。它包含464个室内场景实现系列,进一步分为249个训练系列和215个测试系列。我们从训练实现系列中抽取30,816帧作为训练数据。注意[7]、[34]和[16]的方法使用120K、90K和95K数据进行训练,这些数据都比我们的数据要多得多。
对于训练集,我们使用[17]的修复方法来填充地面真实深度图中的无效或缺失像素。然后按照[9]的步骤生成地面真实法线图。我们的GeoNet是使用TensorFlow实现的。
我们使用在ImageNet上预训练的网络初始化两个流CNN。特别是,我们尝试两种不同的选择。第一种是基于FCN[32]的改进VGG-16网络,具有扩张卷积[6,35]和全局池[22]。第二个是ResNet-50,它遵循了[16]的模型。我们使用Adam[14]优化网络并裁剪梯度的范数,使其不大于5。初始学习速率为le-4 ,并在功率参数 0.9 的多项式衰减策略下进行调整。利用随机水平翻转增强训练数据。在绘制图像时,我们将曲面法线图的相应x方向乘以-1

4.1 与最新技术的比较
在本节中,我们将我们的GeoNet与现有方法在深度或曲面法线预测方面进行比较。
曲面法线预测:表面法向预测结果见表1。对于所有不同的度量标准,我们的GeoNet始终优于以前的方法。请注意,由于我们使用了相同的主干网架构VGG-16,因此改进源于我们对普通网络的深入,这有效地纠正了估计过程中的错误。

深度预测:在深度预测任务中,由于大多数最先进的方法都采用VGG-16和ResNet-50之间的骨干网,因此我们在这两种设置下进行了实验。完整结果如表 2 所示。我们的GeoNet在6个评估指标中的4个指标上再次优于最先进的方法。它在其余两个方面的表现相当。在所有这些方法中,SURGE[32]是唯一一种目标相同的方法,集联合预测深度和曲面法线。它在VGG-16网络上构建CRF。使用相同的骨干网,如表中所示,我们的GeoNet明显优于它。这是因为我们的模型没有对曲面形状和低层几何结构施加特殊的假设。

视觉比较:我们展示了预测深度和曲面法线图的可视化实例,首先,在图5中,我们展示了与最新深度预测方法FCRN[16]的视觉比较。我们的 GeoNet 分别在第二行和第三行中生成有关洗脸盆和小对象更精确的深度图。

文中还给出了相应的地表法向预测,验证了我们的大地水准面网利用地表法向提高深度的有效性。第一行的白板说明了它的有用性。深度预测的三维可视化如图7所示。我们预测的墙面区域比以前最先进的FRCN[16]平滑得多,这表明了合并几何一致性的必要性。

此外,我们还将结果与其他方法进行了比较,包括图6中的Depth3D,多尺度CNN[7]和SkipNet[3]在曲面法线预测。GeoNet实际上可以产生更详细的结果,例如,第一、二、三排的椅子、洗脸盆和墙壁。更多的联合预测结果如图4所示。从这些数字可以清楚地看出,我们的GeoNet在几何估计方面比基线VGG-16网络做的更好,而基线VGG-16网络最初并不是为这项任务二设计的。


运行时间比较:我们使用Intel i7-6950 CPU 和一个 TitanX GPU在PC上测试我们的GeoNet。当以VGG-16为骨干网时,我们的GeoNet对一幅480 x 640的图像使用0.87s来获得表面法向和深度。相比之下,本地网[5]对同一幅图像的深度图进行预测需要24秒左右;而由于在同一个VGG-16网络上要经过10次前向传递,需要CRFs的推断,所以SURGE[32]1也需要很长时间。
4.2 CNNs和几何条件
在这一部分中,我们通过实验验证我们的动机,并评估先前的cnn是否可以直接学习从深度到曲面法向的映射,隐式地遵循几何关系。
为此,我们训练了以地面真实深度图和地面法线图为输入和讲课CNNs。我们尝试了不同的架构,包括VGG-16的前4层,VGG-16的前7层和全VGG-16网络。在将深度图输入网络之前,深度图分别转为3通道图像编码(x,y,z)坐标。
我们在表3中提供了NYU v2数据集的测试性能。所有的选择收敛到非常差的局部极小。为了更公平的比较和更清晰的说明,我们在不结合初始表面法向估计的情况下,给出了由深度调向网络预测的表面法向的测试性能。特别地,由于深度-法向网络包含最小二乘和残差模,因此我们也仅显示由最小二乘模预测的表面法向图,表示为“LS”。该表显示LS模块在所有方面都已经明显优于普通CNN基线。此外,与单独使用最小二乘模型相比,利用残差模型,我们的深度到法线网络取得了更好的效果。

这些实验初步使我们得出以下重要发现。
1、直接通过vanilla CNNs学习从深度到法线的映射几乎不尊重潜在的几何关系。
2、尽管它很简单,但最小二乘模型在将几何条件融入神经网络方面非常有效,从而导致更好的性能。
3、与单最小二乘模型相比,我们的深度-正态网络进一步提高了正态预测的质量。
4.3.几何一致性
在这一节中,我们将验证由我们的GeoNet制作的深度和表面法向图的预测是否一致。为此,我们首先使用地真深度和表面法线图预训练了深度到正常网络,没有最后一个 1 × 1 卷积层,并将其视为精确变换。在给定预测深度图的情况下,利用预先训练好的网络计算转换后的曲面法线图。通过这些准备,我们比较了以下4种配置下的误差和精度。(1)转换法线和预测法线之间的度量(由基准CNN生成的深度和曲面法向)。(2)装换法线和预测法线之间的度量(有我们的GeoNet生成的深度法线和曲面法线)。(3)转换后与地面真实法线(基于CNN生成的深度)之间的度量。(4)转换后与地面真实法线(由我们的GeoNet生成的深度)之间的度量。这里我们也使用VGG-16网络作为CNN的基准。
结果如表4所示。表中的“Pred”列表明,我们的GeoNet可以生成比基线CNNs更一致的深度和曲面法线预测。从表中的“GT”列也可以明显看出,与基线CNN相比,我们的GeoNet得到的预测始终更接近地面真实。

五、结论
本文提出用几何神经网络(GeoNet)联合预测单个图像的深度和曲面法线。我们的GeoNet包括深度到法线和法线到深度网络,它有效地强化了深度和曲面法线计算应遵循的几何条件。它们使得最终的预测在几何山更加一致和准确。我们的大量实验表明,GeoNet达到了最先进的性能。
在未来,我们希望将我们的GeoNet应用于具有内在关照和颜色约束的任务,例如内在图像分解好三维重建。
魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。
更多推荐


所有评论(0)