2023年1月 – chenpaopao

关于模型部署

当我们千辛万苦完成了前面的数据获取、数据清洗、模型训练、模型评估等等步骤之后，终于等到“上线”啦。想到辛苦训练出来的模型要被调用还有点小激动呢，可是真当下手的时候就有点懵了：模型要怎么部署？部署在哪里？有什么限制或要求？

模型训练重点关注的是如何通过训练策略来得到一个性能更好的模型，其过程似乎包含着各种“玄学”，被戏称为“炼丹”。整个流程包含从训练样本的获取（包括数据采集与标注），模型结构的确定，损失函数和评价指标的确定，到模型参数的训练，这部分更多是业务方去承接相关工作。一旦“炼丹”完成（即训练得到了一个指标不错的模型），如何将这颗“丹药”赋能到实际业务中，充分发挥其能力，这就是部署方需要承接的工作。

目前来说，我还没有真正的接触工业界的模型应用，仅仅只是在学术界进行模型训练和探索。部署只是简单的将模型推理代码直接部署在服务器上，因此也没有考虑过模型在工业界的部署，对于工业应用来说，模型的表现和推理速度同等重要，因此，如何提高模型的推理速度成为模型能否落地的关键因素。

部署流程大致分为以下几个步骤：模型转换、模型量化压缩、模型打包封装 SDK。这里我们主要探讨模型转换。

模型转换主要用于模型在不同框架之间的流转，常用于训练和推理场景的连接。目前主流的框架都以 ONNX 或者 caffe 为模型的交换格式，另外，根据需要，还可以在中间插入计算图优化，对计算机进行推理加速（诸如常见的 CONV/BN 的算子融合）。

模型部署

在软件工程中，部署指把开发完毕的软件投入使用的过程，包括环境配置、软件安装等步骤。类似地，对于深度学习模型来说，模型部署指让训练好的模型在特定环境中运行的过程。相比于软件部署，模型部署会面临更多的难题：

1）运行模型所需的环境难以配置。深度学习模型通常是由一些框架编写，比如 PyTorch、TensorFlow。由于框架规模、依赖环境的限制，这些框架不适合在手机、开发板等生产环境中安装。

2）深度学习模型的结构通常比较庞大，需要大量的算力才能满足实时运行的需求。模型的运行效率需要优化。

因为这些难题的存在，模型部署不能靠简单的环境配置与安装完成。经过工业界和学术界数年的探索，模型部署有了一条流行的流水线：

为了让模型最终能够部署到某一环境上，开发者们可以使用任意一种深度学习框架来定义网络结构，并通过训练确定网络中的参数。之后，模型的结构和参数会被转换成一种只描述网络结构的中间表示，一些针对网络结构的优化会在中间表示上进行。最后，用面向硬件的高性能编程框架(如 CUDA，OpenCL）编写，能高效执行深度学习网络中算子的推理引擎会把中间表示转换成特定的文件格式，并在对应硬件平台上高效运行模型。

这一条流水线解决了模型部署中的两大问题：使用对接深度学习框架和推理引擎的中间表示，开发者不必担心如何在新环境中运行各个复杂的框架；通过中间表示的网络结构优化和推理引擎对运算的底层优化，模型的运算效率大幅提升。

MonoViT—基于ViT的自监督单目深度估计

Self-Supervised Monocular Depth Estimation witha Vision Transformer

paper： https://arxiv.org/pdf/2208.03543.pdf

基于深度学习单目深度估计任务简介

深度估计是计算机视觉领域的一个基础性问题，其可以应用在机器人导航、增强现实、三维重建、自动驾驶等领域。而目前大部分深度估计都是基于二维RGB图像到RBG-D图像的转化估计，主要包括从图像明暗、不同视角、光度、纹理信息等获取场景深度形状的Shape from X方法，还有结合SFM(Structure from motion)和SLAM(Simultaneous Localization And Mapping)等方式预测相机位姿的算法。其中虽然有很多设备可以直接获取深度，但是设备造价昂贵。也可以利用双目进行深度估计，但是由于双目图像需要利用立体匹配进行像素点对应和视差计算，所以计算复杂度也较高，尤其是对于低纹理场景的匹配效果不好。而单目深度估计则相对成本更低，更容易普及。

那么对于单目深度估计，顾名思义，就是利用一张或者唯一视角下的RGB图像，估计图像中每个像素相对拍摄源的距离。对于人眼来说，由于存在大量的先验知识，所以可以从一只眼睛所获取的图像信息中提取出大量深度信息。那么单目深度估计不仅需要从二维图像中学会客观的深度信息，而且需要提取一些经验信息，后者则对于数据集中相机和场景会比较敏感。

摘要：

自监督单眼深度估计是一种有吸引力的解决方案，它不需要难以获取的深度标签来进行训练。卷积神经网络 (CNN) 最近在这项任务中取得了巨大成功。然而，它们有限的接受域限制了现有的网络架构只能在局部进行推理，从而削弱了自我监督范式的有效性。鉴于 Vision Transformers (ViTs) 最近取得的成功，我们提出了 MonoViT，这是一个全新的框架，结合了 ViT 模型支持的全局推理和自监督单目深度估计的灵活性。通过将普通卷积与 Transformer 块相结合，我们的模型可以在局部和全局进行推理，以更高的细节和准确性产生深度预测，从而使 MonoViT 在已建立的 KITTI 数据集上实现sota的性能。此外，MonoViT 在 Make3D 和 Driving Stereo 等其他数据集上证明了其卓越的泛化能力。

介绍：

Transformers (ViTs)最近表现出杰出的目标检测和语义分割等任务的结果，这要归功于它们能够建立像素之间的长距离关系，因此是全局感受野。另外，有相关工作将VIT应用于深度估计，但不是采用自监督单目深度估计。本文弥补了这个缺失的步骤，提出了MonoViT architecture。它在其骨干网中结合了卷积层和最先进的 (SoTA) MPViT块【1】进而对图片中的局部信息（objects）和全局信息（前景和背景之间的关系，以及物体之间）进行建模。该策略使我们能够消除由 CNN 编码器的有限感知域引起的瓶颈，产生自然更细粒度的预测。

作者在KITTI dataset进行实验，表现优于其他sota模型，还分析了模型泛化能力跨不同的数据集，将 MonoViT 与它在 Make3D 和 Driving-Stereo datasets进行比较，也突出显示了 MonoViT 的卓越泛化能力

模型架构：

Deep Network：

Joint CNN & Transformer Layer used in depthencoder：

PoseNet：

PoseNet 倾向于简单而有效的实现。具体来说， PoseNet 使用 ResNet18【2】的轻量级结构。接收相邻图像 [I, I†] 作为输入，输出视频序列相邻帧之间的 6 DoF 相对位姿 T。这个网络用于最终辅助计算loss，提供监督信息。

Loss损失函数

View reconstruction loss：

Smoothness loss. As in previous works， the edge-aware smoothness loss is used to improve the inverse depth map d:

【1】MPViT: Multi-Path Vision Transformer for Dense Prediction

【2】Deep residual learning for image recognition

单张图片实现MIP：Single-view view synthesis with multiplane images

CVPR 2020：https://single-view-mpi.github.io/

最近在视图合成方面的一项工作是在已知的视点上通过给定两个或更多的输入图像，利用深度学习来生成多平面图像（以相机为中心的分层三维展示）。我们将这种表示方法应用于单视角的视图合成，这是一个更具挑战性的问题，但可能有更广泛的应用。我们的方法直接从单个图像输入中学习预测多平面图像，并引入了尺度不变量视图合成的监督，使我们能够在在线视频上进行训练。我们展示了这种方法适用于几个不同的数据集，它还能额外生成合理的深度图，并能学习实现对背景层中的前景对象边缘后面的内容进行填充。

备注：SFM（Structure From Motion），主要基于多视觉几何原理，用于从运动中实现3D重建，也就是从无时间序列的2D图像中推算三维信息，是计算机视觉学科的重要分支。

单目图像深度估计 – 自监督方法

近几年有关单目图像深度识别的算法以CNN为主流，更细的说是以无监督的同时对深度、计算机角度、光流等同时计算的端到端深度网络为主流。所谓无监督其实是指在训练过程中不需要输入真实的深度值，这样做有一个好处就是目前能够测量到深度信息的传感器还不够精确，因此由不够精确的label训练出的model得到的预测结果必然不会特别令人满意；
所谓同时计算呢，在我理解是指在训练过程中，用一个能够表征时间序列上有前后关系的帧之间的差别的loss同时训练多个网络，而在得到model后每个网络可以单独使用。
很聪明，不同作用的网络相当于人为的特征提取过程，最后的预测基于这个人为的特征提取结果，但这种方法也有其缺点，我能想到的就是参数的增加，网络结构的复杂化和人为特征对最终预测结果有没有起引导作用只能用实验去证明。

详细说呢，首先，所谓的“自监督”虽然不需要输入真实深度信息，但需要输入双目摄像头获取到的同一时刻不同角度的图像或者前后帧图像。

自监督的单目深度估计包括：基于双目训练的无监督模型和基于视频序列的无监督模型

基于双目训练的无监督模型:

UnSupervised Monocular Depth Estimation with Left-Right Consistency, CVPR, 2017

学习方法在单目深度估计上面有比较好的结果了，但还把深度估计问题作为一个有监督的回归问题。所以需要大量相对应的ground truth用来训练。记录有质量的各种场景的深度信息是一个比较难的事情。作者做了一个新方法，替代了现在直接用深度图数据训练。这个方法是用容易获得的双目立体视觉的角度。

作者提出了全新的训练函数目标函数，可以让卷积神经网络学习到深度估计，虽然没有深度信息的ground truth。利用一些对极几何约束，作者产生了视差损失。还发现只用图像重建结果会产生低质量的深度图。为了克服这个困难，作者构建了一个新颖的训练损失，可以加强左右视差图的一致性，这样能够提升性能和鲁棒性。作者的方法在KITTI数据集的单目深度估计上达到了state-of-the-art，超过用ground-truth深度训练的有监督方法。

基于视频序列的无监督模型:

UnSupervised Learning of Depth and Ego-Motion from Video，CVPR，2017

这篇文章提出了一种非监督的多功能网络，主要思想就像之前提到过的用一个loss同时训练两个网络。网络的结果如图,其中第一个网络可接受一幅图片作为输入，输出其对应的深度图片；第二个网络为姿态网络，接受t，t+1和t-1三个时刻三幅图片作为输入，输出从t到t+1和从t到t-1的相机姿态变化矩阵。

输入为前中后三帧连续的图片，同时训练两个网络，一个得到深度预测结果，一个得到视差矩阵结果

[ICCV 2019] Digging into Self-Supervised Monocular Depth Prediction

目前自监督深度学习取得最好进展的地方，一般说来自监督不需要标注，使用内在几何（通常是多视图几何）关系监督学习，从另一个侧面说明3d视觉才是视觉的本质。

这篇文章中的作者开发了一种方法，该方法使用深度估计和姿态估计网络的组合来预测单帧图像中的深度。它通过在一系列运动的图像（包括单目和双目）序列上训练一个建立在自监督损失函数上的架构来实现,这一架构包括两个网络,一个用来在单目图像上预测深度,另一个在运动图像之间预测姿态。此方法不需要标注训练数据集。相反，它使用图像序列中的连续时间帧和姿态的重投影关系来进行训练。稍后将更详细地描述重建过程。论文的主要贡献是：

1.一种自动mask技术，可消除loss对不重要像素的注意力，减少它们的影响

2.用深度图修正光度重建误差

3.多尺度深度估计

模型架构：本文的方法使用深度网络和姿态网络。深度网络是经典的U-Net [2]编码器-解码器模型结构。编码器是经过预训练的ResNet模型，当然也可以考虑其他模型。深度解码器将输出转换为深度值。作者使用基于ResNet18的姿势网络，该姿态网络经过修改后，可以使用两个彩色图像作为输入来预测单个6自由度相对姿势或旋转和平移参数。姿势网络使用前后两帧而不是典型的立体图像对作为图像对输入。它可以从序列中的前一帧和后一帧通过角度预测目标图像的外观。

训练：下图说明了模型的训练过程。

光度重建误差：目标图像位于第0帧，并且用于姿态估计过程的图像可以是前一帧或后一帧，也就是帧+1或帧-1。该损失是基于目标图像和重建的目标图像之间的相似性。重建过程通过使用姿态网络从源帧（帧+1或帧-1）计算转换矩阵开始。然后使用旋转和平移的信息来计算从源帧到目标帧的映射。最后使用从深度网络预测的目标图像的深度图和从姿势网络转换的矩阵，将其投影到具有固有内参矩阵K的摄像机中，以获取重建的目标图像。此过程需要先将深度图转换为3D点云，通过姿态将点云转换到另一个坐标系后再使用相机内参将3D点转换为2D点。所得的点用作从目标图像进行双线性插值的采样网格。

这种loss的目的是减少目标图像和重建的目标图像之间的差异，在目标图像和重建的目标图像中，姿态和深度估计的过程中都需要使用它。

自动mask：最终的光度重建误差要乘以一个mask，该mask解决与假设相机在静态场景（例如静态场景）中移动的变化有关的问题。尤其是一个物体正在以与相机相似的速度移动，或者在其他物体正在移动时照相机已停止，也就是那些在相机坐标系里静止的物体。这些相对静止的物体理论上应该有无穷大的深度。作者使用一种自动mask方法解决了这一问题，该方法可以过滤不会将外观从一帧更改为下一帧的像素，也就是那些和相机同步运动的像素。 mask是二进制的，如果目标图像和重建的目标图像之间的最小光度误差小于目标图像和源图像的最小光度误差，则为1，否则为0。

当相机是静止的时，这种方法会图像中的所有像素都被掩盖（实际场景中概率很低）。当物体以与照相机相同的速度移动时，会导致图像中静止物体的像素被掩盖。

多尺度估计：作者将各个尺度的损失合并在一起。将较低分辨率的深度图上采样到较高的输入图像分辨率，然后在较高的输入分辨率下重新投影，重新采样并计算光度误差。作者声称，这使得各个比例尺上的深度图以实现相同的目标，即对目标图像进行精确的高分辨率重建。

其他形式的loss：作者加入了平均归一化的逆深度图值和输入/目标图像之间的边缘敏感的平滑度损失。这鼓励模型学习尖锐的边缘并消除噪声。

Depth Prediction Without the Sensors: Leveraging Structure for Unsupervised Learning from Monocular Videos

项目地址：https://sites.google.com/view/struct2depth

目标运动建模：来自Google大脑的作者发表了该文章，该文章进一步扩展了Monodepth2。它们通过预测单个目标而不是整个图像的运动来改善姿态网络估计。因此，现在重建的图像序列不再是单个投影，而是组合在一起的一系列目标的投影。这通过两个模型一个目标运动模型和一个相机运动估计网络（类似于前面几节中描述的姿态网络）来做到。步骤如下：

1.预训练的MASK-RCNN [2]模型用于捕获潜在移动目标的语义分割。

2.使用二进制掩码从静态图像（帧-1，帧0和帧+1）中删除这些可能移动的对象

3.被掩盖的图像被发送到ego-motion（相机自身运动）网络，并输出帧-1和0与帧0和+1之间的转换矩阵。

4.mask过程可提取静态背景，然后提取ego-motion转换矩阵，而无需移动对象。使用来自[3]的方程。

具体操作时需要注意以下几点

1.使用之前步骤3中产生的相机运动转换矩阵，并将其应用于帧-1和帧+1，用这个矩阵来变换帧0。

2.使用从步骤3得到的相机运动变换矩阵，并将其应用于可能移动的对象的分割mask到帧-1和帧+1，以获取每个目标相当于帧0的形变后的分割mask。

3.二进制掩码用于保持与变形分割掩码关联的像素。

4.mask图像与变形图像组合在一起，并传递到目标运动模型，该模型输出预测的对象运动。

结果显示必须知道相机必如何运动才能“解释”对象外观的变化。然后，要根据目标运动建模过程的步骤4中生成的运动模型来移动对象。最后，将形变后的对目标运动与形变后的静态背景结合起来，以获得最终的形变图像：

学习目标尺度：虽然Monodepth2通过其自动mask技术解决了静态物体或以与照相机相同速度移动的物体的问题，但struct2 depth作者还是建议对模型进行约束，以识别物体的比例，从而改善物体运动的建模。

基于对象的类别（例如楼房）定义每个对象的比例loss，旨在基于对象比例的知识来限制深度。 loss是图像中对象的输出深度图与通过使用相机的焦距，基于对象类别的先验高度和图像中分割后的对象的实际高度计算出的近似深度图之间的差，两者均按目标图片的平均深度进行缩放

基于深度学习的单目深度估计综述

Monocular Depth Estimation

Monocular Depth Estimation is the task of estimating the depth value (distance relative to the camera) of each pixel given a single (monocular) RGB image. This challenging task is a key prerequisite for determining scene understanding for applications such as 3D scene reconstruction, autonomous driving, and AR. State-of-the-art methods usually fall into one of two categories: designing a complex network that is powerful enough to directly regress the depth map, or splitting the input into bins or windows to reduce computational complexity. The most popular benchmarks are the KITTI and NYUv2 datasets. Models are typically evaluated using RMSE or absolute relative error. 这项具有挑战性的任务是确定 3D 场景重建、自动驾驶和 AR 等应用场景理解的关键先决条件。

任务介绍

通过阅读文献，可以将基于深度学习的单目深度估计算法大致分为以下几类：

监督算法

顾名思义，直接以2维图像作为输入，以深度图为输出进行训练：：监督方法的监督信号基于深度图的地面真值，因此单目深度估计可以看作是一个回归问题。从单个深度图像设计神经网络来预测深度。利用预测深度图和实际深度图之间的差异来监督网络的训练 L2损失

上面给的例子是KITTI数据集中的一组例子，不过深度图可能看的不是很明显，我重新将深度图涂色之后：

深度网络通过近似真值的方法来学习场景的深度。基于不同结构和损失函数的方法：据我们所知，Eigen等人首先用CNNs解决单目深度估计问题。该体系结构由两个组成部分组成（全局粗尺度网络和局部精细尺度网络），在文献中用于从单个图像进行端到端的深度图预测。

基于条件随机场的方法：Li等人提出了一种基于多层的条件随机场（CRFs）的细化方法，该方法也被广泛应用于语义分割。在深度的估计中，考虑到深度的连续特征，可以广泛地使用CRF的深度信息，因此可以广泛地应用于深度的估计中。

基于对抗性学习的方法：由于提出的对抗性学习在数据生成方面的突出表现，近年来成为一个研究热点。各种算法、理论和应用已得到广泛发展。对抗式学习深度估计的框架如图所示。

无监督算法

首先，所谓的“无监督”虽然不需要输入真实深度信息，但需要输入双目摄像头获取到的同一时刻不同角度的图像或者前后帧图像，只是这样就叫做无监督在我看来略显牵强。

有监督学习方法要求每幅RGB图像都有其对应的深度标签，而深度标签采集通常需要深度相机或激光雷达，前者范围受限后者成本昂贵。再者，采集的原始深度标签通常是一些稀疏的点，不能与原图很好的匹配。因此不用深度标签的无监督估计方法是近年的研究趋势，其基本思路是利用左右视图，结合对极几何与自动编码机的思想求解深度。

由于深度数据的获取难度较高，所以目前有大量算法都是基于无监督模型的。即仅仅使用两个摄像机采集的双目图像数据进行联合训练。其中双目数据可彼此预测对方，从而获得相应的视差数据，再根据视差与深度的关系进行演化。亦或是将双目图像中各个像素点的对应问题看作是立体匹配问题进行训练。左视图-右视图示例：

视差，以我们人眼为例，两只眼睛看到的图像分别位于不同的坐标系。将手指从较远地方慢慢移动到眼前，会发现，手指在左眼的坐标系中越来越靠右，而在右眼坐标系中越来越靠左，这种差异性就是视差。与此同时，可以说明，视差与深度成反比。除此之外，由于摄像机参数也比较容易获取，所以也可以以相机位姿作为标签进行训练。

同时同一水平线上的两个照相机拍摄到的照片是服从以下物理规律的：

在图中， Z 为场景所距离我们的深度, X为三维场景映射到的二维图像平面，也就是最终我们得到的二维图像所在的平面。 f为相机的焦距。 b为两个相机之间的距离，Xl和 Xr 分别为相同物体在左右两个不同相机中成像的坐标。根据以上信息，和简单的三角形相似规律我们可以得到：

这种思路最先应用于使用单张图片生成新视角问题：DeepStereo 和 Deep3d之中, 在传统的视角生成问题之中，首先会利用两张图（或多张）求取图片之间的视差d，其次通过得到的视差（相当于三维场景）来生成新视角。

基于可解释性掩模的方法：基于投影函数的视图重建算法依赖于静态场景假设，即动态目标在相邻帧上的位置不满足投影函数，从而影响测光度误差和训练过程。

基于传统视觉里程计的方法：用传统的直接视觉里程计回归的位姿来辅助深度估计，而不是使用位姿网络估计的位姿。直接视觉里程计利用深度网络生成的深度图和一个三帧图像，通过最小化光度误差来估计帧间的姿态，然后将计算出的姿态发送回训练框架。因此，由于深度网络由更精确的姿态来监督，因此深度估计的精度显着提高。

基于多任务框架的方法：最近的方法在基本框架中引入了额外的多任务网络，如光流、物体运动和相机内参矩阵，作为一个附加的训练框架，加强了整个训练任务之间的关系

基于对抗学习的方法：将对抗学习框架引入到无监督的单目深度估计中。由于在无监督训练中没有真正的深度图。因此，将视图重建算法合成的图像和真实图像作为鉴别器的输入，而不是使用鉴别器来区分真实深度图和预测深度图。

Structure from motion/基于视频的深度估计（无监督学习）

这一部分中既包含了单帧视频的单目深度估计，也包含了多帧间视频帧的像素的立体匹配，从而近似获取多视角图像，对相机位姿进行估计。

评估指标：

在单目深度估计问题中，常用的精度评估指标有相对误差(REL)、均方根误差(RMS)、对数误差(LG)及阈值误差(% correct)

深度估计相关数据集

在深度估计的研究中，由于室内外场景类型与深度范围具有较大的差异，对应不同的场景分别会构造不同的数据集。

真实场景数据集
- NYU depth v2（来自纽约大学）是常用的室内数据集之一，
  - 选取了464个不同的场景，
  - 利用RGB相机和微软的Kinect深度相机同时采集室内场景的RGB信息和深度信息，收集了407 024帧RGBD图像对构建数据集。
  - 由于红外相机和摄像机之间的位置偏差，深度相机采集的原始深度图存在缺失部分或是噪点，
  - 作者从中选取了1 449幅图像，利用着色算法对深度图进行填充得到稠密深度图，同时人工标注语义信息。
- Make3D（斯坦福大学）是常用的室外场景数据集之一，
  - 使用激光扫描仪采集室外场景的深度信息，
  - 选取的场景类型为白天的城市和自然风光，深度范围是5~81 m，大于该范围统一映射为81 m。
  - 数据集共包含534幅RGBD图像对，其中400幅用于训练，134幅用于测试。
- KITTI（德国卡尔斯鲁厄理工学院和美国丰田技术研究院）自动驾驶领域常用的数据集之一，链接：http://www.cvlibs.net/datasets/kit
  - 包含深度数据标签
  - 通过一辆装配有2台高分辨率彩色摄像机、2台灰度摄像机、激光扫描仪和GPS定位系统的汽车采集数据，其中激光扫描仪的最大测量距离为120 m。
  - 图像场景包括卡尔斯鲁厄市、野外地区以及高速公路。
  - 数据集共包含93 000个RGBD训练样本。
- Depth in the Wild（DIW）（密歇根大学）以相对深度作为标签的数据集
  - 从词典中随机选取单词作为搜索关键字，然后从互联网中收集得到原始的RGB图像。
  - 标注工作外包给专门的工作人员，为了更加高效，每一幅图像选取了两个高亮的点，工作人员只需判定两个点的远近关系即可。
  - 对于采样点对之间的位置关系，采用50%随机采样，另外50%对称采样的方法以使构建的数据集尽可能平衡。最终获得的有效标注图像约5×E11张。
- Cityscapes. Cityscapes的数据取自德国的50多个城市的户外场景，其中数据包含有左右视角图像、视差深度图、相机校准、车辆测距、行人标定、目标分割等，同时也包含有类似于vKITTI的虚拟渲染场景图像。其中简单的左视角图像、相机标定、目标分割等数据需要利用学生账号注册获取，其他数据需要联系管理员获取。链接：https://www.cityscapes-dataset.com/
虚拟场景数据集
- SceneNet RGB-D数据集
- SYNTHIA数据集
- 由于是通过虚拟场景生成，数据集中包括更多天气、环境及光照，场景类型多样。各数据集有各自的优缺点，在实际研究中，应根据具体研究问题来选择合适的数据集。

综上，可以看到基于深度学习的单目深度估计是本领域的发展方向。目前，该领域的发展主要集中在数据集和深度学习模型两方面。首先，数据集的质量在很大程度上决定了模型的鲁棒性与泛化能力，深度学习要求训练数据必须有更多的数量、更多的场景类型，如何构建满足深度学习的数据集成为一个重要的研究方向。目前，基于虚拟场景生成深度数据具有不需要昂贵的深度采集设备、场景类型多样、节省人力成本等优势，结合真实场景和虚拟场景的数据共同训练也是未来深度学习方法的趋势。其次，为了提高深度学习估计单幅图像深度的精度，要求更新的更复杂的深度框架。除了神经网络模型本身结构的优化，更新颖的算法设计也能有效地提升预测精度。研究工作大多采用有监督回归模型对连续的绝对深度值进行回归拟合。考虑到场景由远及近的特性，也有用分类模型进行绝对深度估计的方法。由深度信息和其他信息之间的互补性，部分工作结合表面法线等信息提升深度预测的精度。深度学习发展迅速，新的模型层出不穷，如何将这些模型应用于单幅图像深度估计问题中需要更加深入地研究。另外，探索神经网络在单目深度估计问题中学到的是何种特征也是一个重要的研究方向。

对于单目深度估计模型，目前主要分为基于回归/分类的监督模型，基于双目训练/视频序列的无监督模型，以及基于生成学习的图像风格迁移模型。大概从2017年起，即CVPR2018开始，单目深度估计的效果就已经达到了双目深度估计的效果，主要是监督模型。但是由于现有的数据集主要为KITTI、Cityscapes、NYU DepthV2等，其场景和相机都是固定的，从而导致监督学习下的模型无法适用于其他场景，尤其是多目标跟踪这类细节丰富的场景，可以从论文中看到，基本上每个数据集都会有一个单独的预训练模型。

对于GAN，其对于图像风格的迁移本身是一个很好的泛化点，既可以用于将场景变为晴天、雾天等情况，也可以用于图像分割场景。但是深度估计问题中，像素点存在相对大小，因此必定涉及到回归，因此其必定是监督学习模型，所以泛化性能也不好。对于无监督的算法，可能场景适应性会更好，但依旧不适用于对行人深度的估计。

参考文献

[1] Long J, Shelhamer E, Darrell T. Fully convolutional networks for semantic segmentation[C]//Proceedings of the IEEE conference on computer vision and pattern recognition. 2015: 3431-3440.

[2] Ronneberger O, Fischer P, Brox T. U-net: Convolutional networks for biomedical image segmentation[C]//International Conference on Medical image computing and computer-assisted intervention. Springer, Cham, 2015: 234-241.

[3] Laina I, Rupprecht C, Belagiannis V, et al. Deeper depth prediction with fully convolutional residual networks[C]//2016 Fourth international conference on 3D vision (3DV). IEEE, 2016: 239-248.

[4] Fu H, Gong M, Wang C, et al. Deep ordinal regression network for monocular depth estimation[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. 2018: 2002-2011.

[5] Godard C, Mac Aodha O, Brostow G J. Unsupervised monocular depth estimation with left-right consistency[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. 2017: 270-279.

[6] Dosovitskiy A, Fischer P, Ilg E, et al. Flownet: Learning optical flow with convolutional networks[C]//Proceedings of the IEEE international conference on computer vision. 2015: 2758-2766.

[7] Ilg E, Mayer N, Saikia T, et al. Flownet 2.0: Evolution of optical flow estimation with deep networks[C]//Proceedings of the IEEE conference on computer vision and pattern recognition. 2017: 2462-2470.

[8] Mayer N, Ilg E, Hausser P, et al. A large dataset to train convolutional networks for disparity, optical flow, and scene flow estimation[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. 2016: 4040-4048.

[9] Xie J, Girshick R, Farhadi A. Deep3d: Fully automatic 2d-to-3d video conversion with deep convolutional neural networks[C]//European Conference on Computer Vision. Springer, Cham, 2016: 842-857.

[10] Luo Y, Ren J, Lin M, et al. Single View Stereo Matching[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. 2018.

[11] Zhou T, Brown M, Snavely N, et al. Unsupervised learning of depth and ego-motion from video[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. 2017: 1851-1858.

[12] Yin Z, Shi J. Geonet: Unsupervised learning of dense depth, optical flow and camera pose[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. 2018: 1983-1992.

[13] Zhan H, Garg R, Saroj Weerasekera C, et al. Unsupervised learning of monocular depth estimation and visual odometry with deep feature reconstruction[C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. 2018: 340-349.

[14] Goodfellow I, Pouget-Abadie J, Mirza M, et al. Generative adversarial nets[C]//Advances in neural information processing systems. 2014: 2672-2680.

[15] Radford A , Metz L , Chintala S . Unsupervised Representation Learning with Deep Convolutional Generative Adversarial Networks[J]. Computer Science, 2015.

[16] Arjovsky M, Chintala S, Bottou L. Wasserstein gan[J]. arXiv preprint arXiv:1701.07875, 2017.

[17] Gulrajani I, Ahmed F, Arjovsky M, et al. Improved training of wasserstein gans[C]//Advances in Neural Information Processing Systems. 2017: 5767-5777.

[18] Mao X, Li Q, Xie H, et al. Least squares generative adversarial networks[C]//Proceedings of the IEEE International Conference on Computer Vision. 2017: 2794-2802.

[19] Mirza M, Osindero S. Conditional generative adversarial nets[J]. arXiv preprint arXiv:1411.1784, 2014.

[20] Isola P, Zhu J Y, Zhou T, et al. Image-to-image translation with conditional adversarial networks[C]//Proceedings of the IEEE conference on computer vision and pattern recognition. 2017: 1125-1134.

[21] Wang T C, Liu M Y, Zhu J Y, et al. High-resolution image synthesis and semantic manipulation with conditional gans[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. 2018: 8798-8807.

[22] Zhu J Y, Park T, Isola P, et al. Unpaired image-to-image translation using cycle-consistent adversarial networks[C]//Proceedings of the IEEE international conference on computer vision. 2017: 2223-2232.

[23] Wang T C , Liu M Y , Zhu J Y , et al. Video-to-Video Synthesis[J]. arXiv preprint arXiv:1808.06601,2018.

[24] Zheng C, Cham T J, Cai J. T2net: Synthetic-to-realistic translation for solving single-image depth estimation tasks[C]//Proceedings of the European Conference on Computer Vision (ECCV). 2018: 767-783.

[25] Atapour-Abarghouei A, Breckon T P. Real-time monocular depth estimation using synthetic data with domain adaptation via image style transfer[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. 2018: 2800-2810.

[26] Nekrasov V , Dharmasiri T , Spek A , et al. Real-Time Joint Semantic Segmentation and Depth Estimation Using Asymmetric Annotations[J]. arXiv preprint arXiv:1809.04766,2018.

[27] Nekrasov V , Shen C , Reid I . Light-Weight RefineNet for Real-Time Semantic Segmentation[J]. arXiv preprint arXiv:1810.03272, 2018.

[28] Lin G , Milan A , Shen C , et al. RefineNet: Multi-Path Refinement Networks for High-Resolution Semantic Segmentation[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition.,2017:1925-1934

[29] Zou Y , Luo Z , Huang J B . DF-Net: Unsupervised Joint Learning of Depth and Flow using Cross-Task Consistency[C]//Proceedings of the European Conference on Computer Vision (ECCV). 2018:36-53.

[30] Ranjan A, Jampani V, Balles L, et al. Competitive collaboration: Joint unsupervised learning of depth, camera motion, optical flow and motion segmentation[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. 2019: 12240-12249.

MIP 首次用于新视角合成

Stereo magnification:Learning view synthesis using multiplane images

本文主要研究新视角合成任务中 Narrow-baseline Stereo Images Pairs（处于同一水平基线的左右视角图像）输入的情况。本文首次提出了 Multiplane Images (MPI) 的场景表达方式，其优点在于：

只需用网络预测一次 MPI 的场景表达，后续就能重复利用该 MPI 来生成多个不同视角下的图片；
能够有效获取未出现在 Stereo 输入图像中（被遮挡）的场景结构。

另外，为了训练网络，本文还提出了一种使用在线视频来生成训练数据的方法

方法：

1. MPI 场景表达

MPI 包含多个平面，每个平面 d 编码两种信息：RGB 颜色图像 C d，透明度 Alpha 图 α d ，因此整个 MPI 可表示为 RGBA 图像的集合，即 { ( C 1 , α 1 ) , . . . , ( C D , α D ) }，其中 D 表示平面的数量（作者最终采用了 32 个平面）。

2. MPI 网络学习

模型训练过程中，输入为(I1,I2,c1,c2)，ground truth 为(It,ct)，其中 I 表示图像，ci=(pi,ki)，pi 表示相机外参，ki 表示相机内参。目标是学习一个 MPI 表达网络 f θ ( ⋅ ) ，以(I1,I2,c1,c2) 作为输入，推断出 MPI 的场景表达，并重建出 ct 相机参数下的目标图像 It 。

网络输入：下面假设 I1 为 Reference Source，I2 为 Second Source，为了将 I2 的位姿信息嵌入到I1 中，作者先计算了一个 Plane Sweep Volume (PSV)，即将 I2 投影到I1 的不同深度平面上（由于这里采用 Stereo 图像输入，I1 和 I2 位于同一水平基线上，故只需将I2 做不同程度的水平偏移即可得到 PSV。和 Stereo Depth Estimation 任务中的 Cost Volume 类似）。之后将I2 的 PSV 和I1 concat 到一起作为网络的输入，输入的尺度为 H × W × 3 ( D + 1 )。

网络输出：作者认为如果让网络回归出每个平面对应的 RGBA 四个通道，网络输出的通道数太多，对于网络的学习太过困难，因此，作者采用了一种简单有效的做法，即将每个平面的 RGB 看作是参考图 I1 和一张统一背景图 I^b 的加权平均：

直观地来说，对于前景内容占主导的附近的平面，I1 将占有更高的权重，而 I ^ b 用于捕捉在参考视图中被遮挡的表面

那么网络仅需要回归出一张背景图I^b，每个平面的融合概率 wd，以及透明度αd，就能够获得完整的 MPI 表达了。总体而言，原本输出的尺寸为 WH⋅4D，在经过调整之后，变为WH⋅(2D+3) 。

3、使用MPIs进行可微视图合成

给定关于一个参考帧的IMPI 表示，我们能够通过对每个平面的RGBA图像应用平面变换(逆单应性)，并将已转换的图像按前后顺序组合成单个图像的阿尔法组合，最终合成得到一个新奇视图I^t。

平面变换和阿尔法组合都是可微的，因此可以很容易地融入到学习流程的其余部分中。

4. 损失函数

结果展示：

CLIP-NeRF:文本和图像驱动的NeRF编辑框架

论文：(CVPR 2022) CLIP-NeRF: Text-and-Image Driven Manipulation of Neural Radiance Fields

项目主页：https://cassiepython.github.io/clipnerf/

Overview

提出了第一个统一文本和图像驱动的NeRF编辑框架，使得用户可以使用文本提示或示例图像对3D内容进行灵活编辑。
Zs 和Za，分别控制形状和外观。
提出feed forward mapper，能够实现快速推理出用户输入对物体形状和外观的改变量。
提出了一种反演方法，利用EM算法从真实的图像中推断出相机位姿、Zs 和 Za，进而实现编辑现有物体的形状、外观、姿态。

Network architecture

与GRAF不同，该网络并不是将 Zs 直接与positional encoding拼接起来送入神经辐射场，而是先用deformation network（受到Nerfies启发）生成原始位置编码的偏移量并与原始位置编码相加，再送入后续辐射场中。优点：使用tanh函数限制deformation network输出的偏移量的值域，提升了shape操控的鲁棒性与稳定性，同时使得对shape的操纵对于appearance无影响（传统conditional NeRF，如GRAF，实际上改变 Zs会对appearance产生一些影响）。
先预训练好一个解耦条件NeRF，使得NeRF能够充分学习到场景的3D信息以及生成出真实的场景物体。

然后利用CLIP distance训练CLIP分支中的shape mapper and appearance mapper（固定其他模块的参数）。使得mapper能够正确学习到如何将用户输入的modify 信息映射为 Zs, Za 的改变量以使得NeRF正确生成目标结果

Inverse Manipulation

为了获得某物体对应的latent code以便对其实施编辑，作者根据EM算法( Expectation Maximization Algorithm。期望最大算法)设计了一种迭代方法来交替优化、Zs、Za 和相机位姿 v ，本质是优化各项参数，使得在该组参数下得到的生成结果接近于实际结果。

其中Zn是扰动，用于提升优化过程的鲁棒性，入n 从1decay到0，表示越往后参数已经优化得差不多了，那么扰动也就相应地减小。

当获得某物体对应的 Zs,Za,v 后，输入文本便可以输出编辑后的物体。

Experiment results

Text-Driven

Exemplar-Driven Editing Results

Convert real image into corresponding latent code and camera pose, then use prompt to edit real image

实现编辑应该就是先反演出目标图像对应的各个latent codes，然后向CLIP encoder输入参考图像/文字，再通过shape/appearancce mapper得到相应的编辑改变量，将改变量和原始推算出的latent codes相加，再利用NeRF前向渲染出最终编辑后的图像。

Limitations

无法进行细粒度的物体修改，比如修改车轮为红色。根源在于隐空间和预训练CLIP的固有局限性，比如CLIP就没有学到轮胎的语义信息。
局限于使用文本和示例图像对于单个物体进行修改，没有扩展到复杂场景（如object-nerf处理的现实场景）。如何实现多物体场景的text/img guided modify？结合object-nerf和clip-nerf？
先训练好NeRF，再训练mapping network，那就限定了模型只能用参考文字/参考图像编辑固定场景中的物体，而且通过模型结构不难推测出，该模型迁移到多物体数据集上是不可行的。在多物体场景下，由于文本只能影响全局的 Za,Zs ，因此编辑会影响场景中的所有物体。

PixelNeRF–具有泛化性的NeRF

pixelNeRF: Neural Radiance Fields from One or Few Images

代码链接：https://github.com/sxyu/pixel-nerf

论文链接：https://alexyu.net/pixelnerf/

Nerf提出以来，收到了大量关注。但是，它仍存在以下缺点：

Nerf的训练需要很多标准化的照片
训练花费大量时间

因此，本文提出了一种基于全卷积的Nerf：pixelNerf。当经过大量训练后，pixelNerf可以仅通过几张（甚至一张）照片进行良好的视图合成，同时这种方式也不需要精确的3D监督（2D监督即可）。

作者提出了pixelNeRF，一个只需要输入单张或多张图像，就能得到连续场景表示的学习框架。由于现存的构建神经辐射场的方法涉及到独立优化每个场景的表示，这需要许多校准的视图和大量的计算时间，因此作者引入了一种新的网络架构。实验结果表明，在所有情况下，pixelNeRF在新视图合成和单图像三维重建方面都优于当前最先进的工作。

该项目主要研究的问题是如何从一个稀疏的输入视图集中合成这个场景的新视图，在可微神经渲染出现之前，这个长期存在的问题一直没有得到进展。同时，最近的神经渲染场NeRF通过编码体积密度和颜色，在特定场景的新视图合成方面表现出很好的效果。虽然NeRF可以渲染非常逼真的新视图，但它通常是不切实际的，因为它需要大量的位姿图像和冗长的场景优化。

在这篇文章中，作者对上述方法进行了改进，与NeRF网络不使用任何图像特征不同的是，pixelNeRF将与每个像素对齐的空间图像特征作为输入。这种图像调节允许框架在一组多视图图像上进行训练，学习场景先验，然后从一个或几个输入图像中合成视图，如下图所示。

PixelNeRF具有很多特点：首先，Pixel可以在多视图图像的数据集上面进行训练，而不需要任何额外的监督；其次，PixelNeRF预测输入图像的摄像机坐标系中的NeRF表示，而不是标准坐标系，这是泛化看不见的场景和物体类别的必要条件，因为在有多个物体的场景中，不存在明确的规范坐标系；第三，它是完全卷积的，这允许它保持图像和输出3D表示之间的空间对齐；最后，PixelNeRF可以在测试时合并任意数量的输入视图，且不需要任何优化。

NeRF的缺点：

虽然NeRF实现了最新的视图合成，但它是一种基于优化的方法，每个场景必须单独优化，场景之间没有知识共享。这种方法不仅耗时，而且在单个或极稀疏视图的限制下，无法利用任何先验知识来加速重建或完成形状。

基于图像的NeRF：pixelNeRF

为了克服上面提到的关于NeRF的问题，作者提出了一种基于空间图像特征的NeRF结构。该模型由两个部分组成：一个完全卷积的图像编码器E (将输入图像编码为像素对齐的特征网格)和一个NeRF网络f (给定一个空间位置及其对应的编码特征，输出颜色和密度)。

单视图pixelNeRF：首先固定坐标系为输入图像的视图空间，并在这个坐标系中指定位置和摄像机光线。给定场景的输入图像I，首先提取出它的特征量W=E(I)。然后，对于相机光线上的一个点x，通过使用已知的内参，将x投影到图像坐标π(x)上，然后在像素特征之间进行双线性插值来提取相应的图像特征向量W(π(x))。最后把图像特征连同位置和视图方向(都在输入视图坐标系统中)传递到NeRF网络：其中γ()是x上的位置编码。

合并多个视图：多个视图提供了有关场景的附加信息，并解决了单视图固有的三维几何歧义。作者扩展了该模型，不同于现有的在测试时只使用单个输入视图的方法，它允许在测试时有任意数量的视图。

在有多个输入视图的情况下，只假设相对的相机姿态是已知的，为了便于解释，可以为场景任意固定一个世界坐标系。把输入图像记为I，其相关联的摄像机记为P=[R t]。对于新的目标摄影机光线，将视图方向为d的点x转换到每个输入视图i的坐标系，转换如下：

为了获得输出的密度和颜色，作者独立地处理每个视图坐标帧中的坐标和相应的特征，并在NeRF网络中聚合视图。将NeRF网络的初始层表示为f1，它分别处理每个输入视图空间中的输入，并将最终层表示为f2，它处理聚合视图。

和单视图类似，作者将每个输入图像编码成特征体积W(i)=E(I(i))。对于点x(i)，在投影图像坐标π(x(i))处从特征体W(i)中提取相应的图像特征，然后将这些输入传递到f1，以获得中间向量：

最后用平均池化算子ψ将中间向量V(i)聚合并传递到最后一层f2，得到预测的密度和颜色：

个人觉得，这篇文章其实就是对原始Nerf做了一个效果很好的改进：将图片进行特征提取后再输入Nerf，（似乎并没有很多的创新），但是从图中展现的效果来看，这一改进是卓有成效的，或许也为我们提供了一种新的思路。

目前的缺陷：

1) Like NeRF, our rendering time is slow, and in fact, our runtime increases linearly when given more input views. Further, some methods (e.g. [28, 21]) can recover a mesh from the image enabling fast rendering and manipulation afterwards, while NeRF based representations cannot be converted to meshes very reliably. Improving NeRF’s efficiency is an important re-search question that can enable real-time applications.

2) As in the vanilla NeRF, we manually tune ray sampling bounds tn,tf and a scale for the positional encoding. Making NeRF-related methods scale-invariant is a crucial challenge.
3) While we have demonstrated our method on real data from the DTU dataset, we acknowledge that this dataset was captured under controlled settings and has matching camera poses across all scenes with limited viewpoints. Ultimately,our approach is bottlenecked by the availability of largescale wide baseline multi-view datasets, limiting the applicability to datasets such as ShapeNet and DTU. Learning
a general prior for 360◦ scenes in-the-wild is an exciting direction for future work

参考文献：

【1】Ben Mildenhall, Pratul P. Srinivasan, Matthew Tancik,Jonathan T. Barron, Ravi Ramamoorthi, and Ren Ng. Nerf: Representing scenes as neural radiance fields for view synthesis. In Eur. Conf. Comput. Vis., 2020

【2】Daeyun Shin, Charless Fowlkes, and Derek Hoiem. Pixels, voxels, and views: A study of shape representations for single view 3d object shape prediction. In IEEE Conf. Comput.Vis. Pattern Recog., 2018.

位置编码系列（NLP and CV领域）

NLP中的位置编码

转载：让研究人员绞尽脑汁的Transformer位置编码

Bert问世后瞬间引爆了NLP领域，同时也让Transformer火了起来，Transformer中特征提取的方式不是传统的CNN，RNN等，而是用attention的形式，这种模式被用在AI的各个领域中，包括CV和语音等。attention提取特征的效果非常好，可以非常有效的提取到上下文的信息，但是在NLP中会有个问题：attention提取特征的时候，当前这个字对上下文的其他字的关联性可以很好的体现出来，但是其他字的位置在哪里都可以，在这个字的前面、后面都可以，间隔的距离也没有要求。但其实这跟我们平时表达的语言肯定是矛盾的，于是在Transformer中加入了位置编码。

虽然说起来主要就是绝对位置编码和相对位置编码两大类，但每一类其实又能衍生出各种各样的变种，为此研究人员可算是煞费苦心、绞尽脑汁了，此外还有一些不按套路出牌的位置编码。本文就让我们来欣赏一下研究人员为了更好地表达位置信息所构建出来的“八仙过海，各显神通”般的编码方案。

绝对位置编码

形式上来看，绝对位置编码是相对简单的一种方案，但即便如此，也不妨碍各路研究人员的奇思妙想，也有不少的变种。一般来说，绝对位置编码会加到输入中：在输入的第k个向量 \(xk\)中加入位置向量 \(pk\)变为\(xk+pk\)，其中\(pk\)只依赖于位置编号k。

训练式

很显然，绝对位置编码的一个最朴素方案是不特意去设计什么，而是直接将位置编码当作可训练参数，比如最大长度为512，编码维度为768，那么就初始化一个512×768的矩阵作为位置向量，让它随着训练过程更新。现在的BERT、GPT等模型所用的就是这种位置编码，事实上它还可以追溯得更早，比如2017年Facebook的《Convolutional Sequence to Sequence Learning》就已经用到了它。

对于这种训练式的绝对位置编码，一般的认为它的缺点是没有外推性，即如果预训练最大长度为512的话，那么最多就只能处理长度为512的句子，再长就处理不了了。当然，也可以将超过512的位置向量随机初始化，然后继续微调。但笔者最近的研究表明，通过层次分解的方式，可以使得绝对位置编码能外推到足够长的范围，同时保持还不错的效果，因此，其实外推性也不是绝对位置编码的明显缺点。

三角式

三角函数式位置编码，一般也称为Sinusoidal位置编码，是Google的论文《Attention is All You Need》所提出来的一个显式解：

递归式

原则上来说，RNN模型不需要位置编码，它在结构上就自带了学习到位置信息的可能性（因为递归就意味着我们可以训练一个“数数”模型），因此，如果在输入后面先接一层RNN，然后再接Transformer，那么理论上就不需要加位置编码了。同理，我们也可以用RNN模型来学习一种绝对位置编码，比如从一个向量p0出发，通过递归格式pk+1=f(pk)来得到各个位置的编码向量。

ICML 2020的论文《Learning to Encode Position for Transformer with Continuous Dynamical Model》把这个思想推到了极致，它提出了用微分方程（ODE）dpt/dt=h(pt,t)的方式来建模位置编码，该方案称之为FLOATER。显然，FLOATER也属于递归模型，函数h(pt,t)可以通过神经网络来建模，因此这种微分方程也称为神经微分方程，关于它的工作最近也逐渐多了起来。

理论上来说，基于递归模型的位置编码也具有比较好的外推性，同时它也比三角函数式的位置编码有更好的灵活性（比如容易证明三角函数式的位置编码就是FLOATER的某个特解）。但是很明显，递归形式的位置编码牺牲了一定的并行性，可能会带速度瓶颈。

相乘式

刚才我们说到，输入xk与绝对位置编码pk的组合方式一般是xk+pk，那有没有“不一般”的组合方式呢？比如xk⊗pk（逐位相乘）？我们平时在搭建模型的时候，对于融合两个向量有多种方式，相加、相乘甚至拼接都是可以考虑的，怎么大家在做绝对位置编码的时候，都默认只考虑相加了？

很抱歉，笔者也不知道答案。可能大家默认选择相加是因为向量的相加具有比较鲜明的几何意义，但是对于深度学习模型来说，这种几何意义其实没有什么实际的价值。最近笔者看到的一个实验显示，似乎将“加”换成“乘”，也就是xk⊗pk的方式，似乎比xk+pk能取得更好的结果。具体效果笔者也没有完整对比过，只是提供这么一种可能性。关于实验来源，可以参考《中文语言模型研究：(1) 乘性位置编码》。

相对位置编码

相对位置并没有完整建模每个输入的位置信息，而是在算Attention的时候考虑当前位置与被Attention的位置的相对距离，由于自然语言一般更依赖于相对位置，所以相对位置编码通常也有着优秀的表现。对于相对位置编码来说，它的灵活性更大，更加体现出了研究人员的“天马行空”。

经典式

相对位置编码起源于Google的论文《Self-Attention with Relative Position Representations》，华为开源的NEZHA模型也用到了这种位置编码，后面各种相对位置编码变体基本也是依葫芦画瓢的简单修改。

一般认为，相对位置编码是由绝对位置编码启发而来，考虑一般的带绝对位置编码的Attention：

XLNET式

XLNET式位置编码其实源自Transformer-XL的论文《Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context》，只不过因为使用了Transformer-XL架构的XLNET模型并在一定程度上超过了BERT后，Transformer-XL才算广为人知，因此这种位置编码通常也被冠以XLNET之名。

T5式

T5模型出自文章《Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer》，里边用到了一种更简单的相对位置编码。思路依然源自展开式(7)(7)，如果非要分析每一项的含义，那么可以分别理解为“输入-输入”、“输入-位置”、“位置-输入”、“位置-位置”四项注意力的组合。如果我们认为输入信息与位置信息应该是独立（解耦）的，那么它们就不应该有过多的交互，所以“输入-位置”、“位置-输入”两项Attention可以删掉，而piWQW⊤Kp⊤j⊤实际上只是一个只依赖于(i,j)的标量，我们可以直接将它作为参数训练出来，即简化为

说白了，它仅仅是在Attention矩阵的基础上加一个可训练的偏置项而已，而跟XLNET式一样，在vj上的位置偏置则直接被去掉了。包含同样的思想的还有微软在ICLR 2021的论文《Rethinking Positional Encoding in Language Pre-training》中提出的TUPE位置编码。

DeBERTa式

DeBERTa也是微软搞的，去年6月就发出来了，论文为《DeBERTa: Decoding-enhanced BERT with Disentangled Attention》，最近又小小地火了一把，一是因为它正式中了ICLR 2021，二则是它登上SuperGLUE的榜首，成绩稍微超过了T5。

其实DeBERTa的主要改进也是在位置编码上，同样还是从展开式(7)(7)出发，T5是干脆去掉了第2、3项，只保留第4项并替换为相对位置编码，而DeBERTa则刚刚相反，它扔掉了第4项，保留第2、3项并且替换为相对位置编码（果然，科研就是枚举所有的排列组合看哪个最优）：

不过，DeBERTa比较有意思的地方，是提供了使用相对位置和绝对位置编码的一个新视角，它指出NLP的大多数任务可能都只需要相对位置信息，但确实有些场景下绝对位置信息更有帮助，于是它将整个模型分为两部分来理解。以Base版的MLM预训练模型为例，它一共有13层，前11层只是用相对位置编码，这部分称为Encoder，后面2层加入绝对位置信息，这部分它称之为Decoder，还弄了个简称EMD（Enhanced Mask Decoder）；至于下游任务的微调截断，则是使用前11层的Encoder加上1层的Decoder来进行。

SuperGLUE上的成绩肯定了DeBERTa的价值，但是它论文的各种命名真的是让人觉得极度不适，比如它自称的“Encoder”、“Decoder”就很容易让人误解这是一个Seq2Seq模型，比如EMD这个简称也跟Earth Mover’s Distance重名。虽然有时候重名是不可避免的，但它重的名都是ML界大家都比较熟悉的对象，相当容易引起误解，真不知道作者是怎么想的…

其他位置编码

绝对位置编码和相对位置编码虽然花样百出，但仍然算是经典范围内，从上述介绍中我们依然可以体会到满满的套路感。除此之外，还有一些并不按照常规套路出牌，它们同样也表达了位置编码。

CNN式

尽管经典的将CNN用于NLP的工作《Convolutional Sequence to Sequence Learning》往里边加入了位置编码，但我们知道一般的CNN模型尤其是图像中的CNN模型，都是没有另外加位置编码的，那CNN模型究竟是怎么捕捉位置信息的呢？

如果让笔者来回答，那么答案可能是卷积核的各项异性导致了它能分辨出不同方向的相对位置。不过ICLR 2020的论文《How Much Position Information Do Convolutional Neural Networks Encode?》给出了一个可能让人比较意外的答案：CNN模型的位置信息，是Zero Padding泄漏的！

我们知道，为了使得卷积编码过程中的feature保持一定的大小，我们通常会对输入padding一定的0，而这篇论文显示该操作导致模型有能力识别位置信息。也就是说，卷积核的各向异性固然重要，但是最根本的是zero padding的存在，那么可以想象，实际上提取的是当前位置与padding的边界的相对距离。

不过，这个能力依赖于CNN的局部性，像Attention这种全局的无先验结构并不适用，如果只关心Transformer位置编码方案的读者，这就权当是扩展一下视野吧。

复数式

复数式位置编码可谓是最特立独行的一种位置编码方案了，它来自ICLR 2020的论文《Encoding word order in complex embeddings》。论文的主要思想是结合复数的性质以及一些基本原理，推导出了它的位置编码形式（Complex Order）为：

代表词j的三组词向量。你没看错，它确实假设每个词有三组跟位置无关的词向量了（当然可以按照某种形式进行参数共享，使得它退化为两组甚至一组），然后跟位置k相关的词向量就按照上述公式运算。

你以为引入多组词向量就是它最特立独行的地方了？并不是！我们看到式(11)(11)还是复数形式，你猜它接下来怎么着？将它实数化？非也，它是将它直接用于复数模型！也就是说，它走的是一条复数模型路线，不仅仅输入的Embedding层是复数的，里边的每一层Transformer都是复数的，它还实现和对比了复数版的Fasttext、LSTM、CNN等模型！这篇文章的一作是Benyou Wang，可以搜到他的相关工作基本上都是围绕着复数模型展开的，可谓复数模型的铁杆粉了～

融合式

无偶独有，利用复数的形式，笔者其实也构思了一种比较巧的位置编码，它可以将绝对位置编码与相对位置编码融于一体，分享在此，有兴趣的读者欢迎一起交流研究。

简单起见，我们先假设qm,kn是所在位置分别为m,n的二维行向量，既然是二维，那么我们可以将它当作复数来运算。我们知道，Attention关键之处在于向量的内积，用复数表示为

来赋予[x,y]绝对位置信息，那么在Attention运算的时候也等价于相对位置编码。如果是多于二维的向量，可以考虑每两维为一组进行同样的运算，每一组的θ可以不一样。

这样一来，我们得到了一种融绝对位置与相对位置于一体的位置编码方案，从形式上看它有点像乘性的绝对位置编码，通过在q,k中施行该位置编码，那么效果就等价于相对位置编码，而如果还需要显式的绝对位置信息，则可以同时在v上也施行这种位置编码。总的来说，我们通过绝对位置的操作，可以达到绝对位置的效果，也能达到相对位置的效果，初步实验显示它是可以work的，但还没有充分验证，欢迎大家尝试交流。

Elasticsearch

ES既是搜索引擎又是数据库：ElasticSearch究竟是不是数据库?历来存在争议.它是搜索引擎,千真万确,而它是数据库,需要看数据库的界定范围.广义上讲,关系型数据库,对象型数据库,搜索引擎,文件,都可以算作是数据库.数据库是用来存储数据的,为服务应用提供了数据的读写功能,即数据的添加,修改,删除,查询四种基本功能.

1.关系型数据库,诸如:transact-sql,plsql,mysql,firebird,maria等,具备了增删改查四种基本功能.

2.对象型数据库,诸如:redis,mongo等,也具备了增删改查四种基本功能.

3.搜索引擎,就是提到的elasticsearch,也具备了增删改查四种基本功能.

4.文件,比如:sqlite,也具备了增删改查四种基本功能.

ES: 基于Lucene框架的搜索引擎产品。you know for search. 提供了restful风格的操作接口。

ELK，日志检索

Lucene：是一个非常高效的全文检索引擎框架。Java开发的，只提供单机功能。

ES的一些核心概念：

1、索引index：关系型数据库中的table

2、文档document：行

3、字段 field text/keyword/byte：列

4、映射Mapping: Schema

5、查询方式 DSL：SQL ES新版本也支持SQL

6、分片sharding和副本replicas：index都是由sharding组成的。每个sharding都有一个或多个备份。ES集群健康状态。

1）Elasticsearch是搜索引擎

Elasticsearch在搜索引擎数据库领域排名绝对第一，内核基于Lucene构建，支持全文搜索是职责所在，提供了丰富友好的API。个人早期基于Lucene构建搜索应用，需要考虑的因素太多，自接触到Elasticsearch就再无自主开发搜索应用。普通工程师要想掌控Lucene需要一些代价，且很多机制并不完善，需要做大量的周边辅助程序，而Elasticsearch几乎都已经帮你做完了。

2）Elasticsearch不是搜索引擎

说它不是搜索引擎，估计很多从业者不认可，在个人涉及到的项目中，传统意义上用Elasticsearch来做全文检索的项目占比越来越少，多数时候是用来做精确查询加速，查询条件很多，可以任意组合，查询速度很快，替代其它很多数据库复杂条件查询的场景需求；甚至有的数据库产品直接使用Elasticsearch做二级索引，如HBase、Redis等。Elasticsearch由于自身的一些特性，更像一个多模数据库。

图示：Elasticsearch综合数据库排名热度已经到第7

3）Elasticsearch是数据库

Elasticsearch使用Json格式来承载数据模型，已经成为事实上的文档型数据库，虽然底层存储不是Json格式，同类型产品有大名鼎鼎的MongoDB，不过二者在产品定位上有差别，Elasticsearch更加擅长的基于查询搜索的分析型数据库，倾向OLAP；MongoDB定位于事务型应用层面OLTP，虽然也支持数据分析，笔者简单应用过之后再无使用，谁用谁知道。

4）Elasticsearch不是数据库

Elasticsearch不是关系型数据库，内部数据更新采用乐观锁，无严格的ACID事务特性，任何企图将它用在关系型数据库场景的应用都会有很多问题，很多其它领域的从业者喜欢拿这个来作为它的缺陷，重申这不是Elasticsearch的本质缺陷，是产品设计定位如此。

图示：Elastic擅长的应用场景

2、ES做什么

Elasticsearch虽然是基于Lucene构建，但应用领域确实非常宽泛。

1）全文检索

Elasticsearch靠全文检索起步，将Lucene开发包做成一个数据产品，屏蔽了Lucene各种复杂的设置，为开发人员提供了很友好的便利。很多传统的关系型数据库也提供全文检索，有的是基于Lucene内嵌，有的是基于自研，与Elasticsearch比较起来，功能单一，性能也表现不是很好，扩展性几乎没有。

如果，你的应用有全文检索需求，建议你优先迁移到Elasticsearch平台上来，其提供丰富的Full text queries会让你惊讶，一次用爽，一直用爽。

图示：Elasticsearch官方搜索文档

2）应用查询

Elasticsearch最擅长的就是查询，基于倒排索引核心算法，查询性能强于B-Tree类型所有数据产品，尤其是关系型数据库方面。当数据量超过千万或者上亿时，数据检索的效率非常明显。

个人更看中的是Elasticsearch在通用查询应用场景，关系型数据库由于索引的左侧原则限制，索引执行必须有严格的顺序，如果查询字段很少，可以通过创建少量索引提高查询性能，如果查询字段很多且字段无序，那索引就失去了意义；相反Elasticsearch是默认全部字段都会创建索引，且全部字段查询无需保证顺序，所以我们在业务应用系统中，大量用Elasticsearch替代关系型数据库做通用查询，自此之后对于关系型数据库的查询就很排斥，除了最简单的查询，其余的复杂条件查询全部走Elasticsearch。

3）大数据领域

Elasticserach已经成为大数据平台对外提供查询的重要组成部分之一。大数据平台将原始数据经过迭代计算，之后结果输出到一个数据库提供查询，特别是大批量的明细数据。

这里会面临几个问题，一个问题是大批量明细数据的输出，如何能在极短的时间内写到数据库，传统上很多数据平台选择关系型数据库提供查询，比如MySQL，之前在这方面吃过不少亏，瞬间写入性能极差，根本无法满足要求。另一个问题是对外查询，如何能像应用系统一样提供性能极好的查询，不限制查询条件，不限制字段顺序，支持较高的并发，支持海量数据快速检索，也只有Elasticsearch能够做到比较均衡的检索。

从官方的发布版本新特性来看，Elasticseacrch志在大数据分析领域，提供了基于列示存储的数据聚合，支持的聚合功能非常多，性能表现也不错，笔者有幸之前大规模深度使用过，颇有感受。

Elasticsearch为了深入数据分析领域，产品又提供了数据Rollup与数据Transform功能，让检索分析更上一层楼。在数据Rollup领域，Apache Druid的竞争能力很强，笔者之前做过一些对比，单纯的比较确实不如Druid，但自Elasticsearch增加了Transfrom功能，且单独创建了一个Transfrom的节点角色，个人更加看好Elasticseach，跳出了Rollup基于时间序列的限制。

图示：Rollup执行过程数据转换示意图

4）日志检索

著名的ELK三件套，讲的就是Elasticsearch，Logstash，Kibana，专门针对日志采集、存储、查询设计的产品组合。很多第一次接触到Elasticsearch的朋友，都会以为Elasticsearch是专门做日志的，其实这些都是误解，只是说它很擅长这个领域，在此领域大有作为，名气很大。

日志自身特点没有什么通用的规范性，人为的随意性很大，日志内容也是任意的，更加需求全文检索能力，传统技术手段本身做全文检索很是吃力。而Elasticsearch本身起步就是靠全文检索，再加上其分布式架构的特性，非常符合海量日志快速检索的场景。今天如果还发现有IT从业人员用传统的技术手段做日志检索，应该要打屁股了。

如今已经从ELK三件套发展到Elastic Stack了，新增加了很多非常有用的产品，大大增强了日志检索领域。

5）监控领域

指标监控，Elasticsearch进入此领域比较晚，却赶上了好时代，Elasticsearch由于其倒排索引核心算法，也是支持时序数据场景的，性能也是相当不错的，在功能性上完全压住时序数据库。

Elasticsearch搞监控得益于其提供的Elastic Stack产品生态，丰富完善，很多时候监控需要立体化，除了指标之外，还需要有各种日志的采集分析，如果用其它纯指标监控产品，如Promethues，遇到有日志分析的需求，还必须使用Elasticsearch，这对于技术栈来说，又扩增了，相应的掌控能力会下降，个人精力有限，无法同时掌握很多种数据产品，如此选择一个更加通用的产品才符合现实。

图示：Elastic性能对比时序数据库（来自腾讯云分享）

6）机器学习

机器学习最近几年风吹的很大，很多数据产品都集成了，Elasticsearch也必须有，而且做的更好，真正将机器学习落地成为一个产品，简化使用，所见所得；而不像其它数据产品，仅仅集成算法包，使用者还必须开发很多应用支持。

Elasticsearch机器学习提供了两种方式，一种是异常检测类型，属于无监督学习，采用聚类模型，通常应用在安全分析领域，检测异常访问等；一种是数据帧分析，属于分类与回归，属于监督学习，可用于在业务模型领域，如电商行业，价格模型分析。

Elasticsearch本身是数据平台，集成了部分机器学习算法，同时又集成了Kibana可视化操作，使得从数据采集、到模型训练、到模型预测应用都可以一键式完成。

Elasticserach提供的机器学习套件，个人认为最应该应用在数据质量这个领域，帮助大数据平台自动检测数据质量，从而降低人力提供效率。

图示：机器学习应用示意图（截图）

需求等级

Elasticsearch整个的技术栈非常复杂，涉及到的理论与技术点非常多，完全掌握并不现实，作为一个IT从业者，首先是定位好自己的角色，依据角色需求去学习掌握必备的知识点。以下是笔者对于一个技术产品的划分模型：

1、概念

Elasticsearch涉及到的概念很多，核心概念其实就那么几个，对于一个新手来说，掌握概念目的是为了建立起自己的知识思维模型，将之后学习到的知识点做一个很好的归纳划分；对于一个其它数据产品的老手来说，掌握概念的目的是为了与其它数据产品划分比较，深入的了解各自的优劣，在之后工作中若有遇到新的业务场景，可以迅速做出抉择。

IT从业者普遍都有个感受，IT技术发展太快了，各种技术框架产品层出不穷，学习掌握太难了，跟不上节奏。其实个人反倒觉得变化不大，基础理论核心概念并没有什么本质的发展变化，无非是工程技术实操变了很多，但这些是需要深入实践才需要的，对于概念上无需要。

作为一个技术总监，前端工程师工作1～2年的问题都可以问倒他，这是大家对于概念认知需求不一样。

图示：Elasticsearch核心概念

2、开发

开发工程师的职责是将需求变成可以落地运行的代码。Elasticsearch的应用开发工作总结起来就是增删改查，掌握必备的ES REST API，熟练运用足以。笔者之前任职某物流速运公司，负责Elasticsearch相关的工作，公司Elasticsearch的需求很多，尤其是查询方面，ES最厉害的查询是DSL，这个查询语法需要经常练习使用，否则很容易忘记，当每次有人询问时，都安排一个工程师专门负责各种解答，他在编写DSL方面非常熟练，帮助了很多的工程师新手使用Elasticsearch，屏蔽了很多细节，若有一些难搞定的问题，会由我来解决，另外一方面作为负责人的我偶然还要请他帮忙编写DSL。

Elasticsearch后面提供了SQL查询的功能，但比较局限，复杂的查询聚合必须回到DSL。

图示：DSL语法复杂度较高

3、架构

Elasticsearch集群架构总体比较复杂，首先得深入了解Elasticseach背后实现的原理，包括集群原理、索引原理、数据写入过程、数据查询过程等；其次要有很多案例实战的机会，遇到很多挑战问题，逐一排除解决，增加自己的经验。

对于开发工程师来说，满足日常需求开发无需掌握这些，但对于Elasticsearch技术负责人，就非常有必要了，面对各种应用需求，要能从架构思维去平衡，比如日志场景集群需求、大数据分析场景需求、应用系统复杂查询场景需求等，从实际情况设计集群架构以及资源分配等。

4、运维

Elasticsearch本质是一个数据库，也需要有专门的DBA运维，只是更偏重应用层面，所以运维职责相对传统DBA没有那么严苛。对于集群层面必须掌握集群搭建，集群扩容、集群升级、集群安全、集群监控告警等；另外对于数据层面运维，必须掌握数据备份与还原、数据的生命周期管理，还有一些日常问题诊断等。

5、源码

Elasticsearch本身是开源，阅读源码是个很好的学习手段，很多独特的特性官方操作文档并没有写出来，需要从源码中提炼，如集群节点之间的连接数是多少，但对于多数Elasticsearch从业者来说，却非必要。了解到国内主要是头部大厂需要深入源码定制化改造，更多的是集中在应用的便捷性改造，而非结构性的改造，Elastic原厂公司有几百人的团队做产品研发，而国内多数公司就极少的人，所以从产量上来说，根本不是一个等级的。

如果把Elasticsearch比喻为一件军事武器，对于士兵来说，熟练运用才是最重要的，至于改造应该是武器制造商的职责，一个士兵可以使用很多武器装备，用最佳的组合才能打赢一场战争，而不是去深入原理然后造轮子，容易本末倒置。

6、算法

算法应该算是数据产品本质的区别，关系型数据库索引算法主要是基于B-Tree， Elasticserach索引算法主要是倒排索引，算法的本质决定了它们的应用边界，擅长的应用领域。

通常掌握一个新的数据产品时，个人的做法是看它的关键算法。早期做过一个地理位置搜索相关的项目，基于某个坐标搜索周边的坐标信息，开始的时候采用的是三角函数动态计算的方式，数据量大一点，扫描一张数据表要很久；后面接触到Geohash算法，按照算法将坐标编码，存储在数据库中，基于前缀匹配查询，性能高效几个数量级，感叹算法的伟大；再后面发现有专门的数据库产品集成了Geohash算法，使用起来就更简单了。

Elasticsearch集成很多算法，每种算法实现都有它的应用场景。

拥抱ES的方法

1、官方文档

Elasticsearch早期出过一本参考手册《Elastic权威指南》，是一本很好的入门手册，从概念到实战都有涉及，缺点是版本针对的2.0，过于陈旧，除去核心概念，其余的皆不适用，当前最新版本已经是7.7了，跨度太大，Elasticsearch在跨度大的版本之间升级稍微比较麻烦，索引数据几乎是不兼容的，升级之后需要重建数据才可。

Elasticsearch当前最好的参考资料是官方文档，资料最全，同步发布版本，且同时可以参考多个版本。Elasticsearch官方参考文档也是最乱的，什么资料都有，系统的看完之后感觉仍在此山中，有点类似一本字典，看完了字典，依然写不好作文；而且资料还是英文的，至此就阻挡了国内大部分程序进入。

但想要学习Elasticsearch，官方文档至少要看过几遍，便于迅速查询定位。

图示：官方文档截图说明

2、系统学习

Elasticsearch成名很早，国内也有很多视频课程，多数比较碎片，或是纸上谈兵，缺乏实战经验。Elasticsearch有一些专门的书籍，建议购买阅读，国内深度一些的推荐《Elasticsearch源码解析与优化实战》，国外推荐《Elasticsearch实战》，而且看书还有助于培养系统思维。

Elasticsearch技术栈功能特性很多，系统学习要保持好的心态，持之以恒，需要很长时间，也需要参考很多资料。

3、背后原理

Elasticsearch是站在巨人肩膀上产品，背后借鉴了很多设计思想，集成了很多算法，官方的参考文档在技术原理探讨这块并没有深入，仅仅点到为止。想要深入了解，必须得另辟蹊径。

Elastic官方的博客有很多优质的文章，很多人因为英文的缘故会忽视掉，里面有很多关键的实现原理，图文并茂，写得非常不错；另外国内一些云厂商由于提供了Elasticsearch云产品，需要深度定制开发，也会有一些深入原理系列的文章，可以去阅读参考，加深理解。对于已经有比较好的编程思维的人，也可以直接去下载官方源码，设置断点调试阅读。

4、项目实战

项目实战是非常有效的学习途径，考过驾照的朋友都深有体会，教练一上来就直接让你操练车，通过很多次的练习就掌握了。Elasticsearch擅长的领域很多，总结一句话就是“非强事务ACID场景皆可适用”，所以可以做的事情也很多。

日志领域的需求会让你对于数据写入量非常的关心，不断的调整优化策略，提高吞吐量，降低资源消耗；业务系统的需求会让你对数据一致性与时效性特别关心，从其它数据库同步到ES，关注数据同步的速度，关注数据的准确性，不断的调整你的技术方案与策略；大数据领域的需求会让你对于查询与聚合特别关注，海量的数据需要快速的检索，也需要快速的聚合结果。

项目实战的过程，就是一个挖坑填坑的过程，实战场景多了，解决的问题多了，自然就掌握得很好了。