版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1 图像去雨去雾和深度信息估计相关理论知识基础综述目录TOC\o"1-3"\h\u12779图像去雨去雾和深度信息估计相关理论知识基础综述 1115191.1基于深度学习的图像去雨去雾相关理论知识 1270181.1.1雨和雾的成像特性 1117141.1.2卷积神经网络相关理论知识 3107461.1.3图像去雨去雾的评价指标 9305651.2单目图像深度信息估计相关理论知识 11130221.1.1深度估计基本理论 1160031.1.2自监督单目深度估计算法MonoDepth2 12241031.1.3图像深度估计评价指标 14图像去雨和图像去雾作为计算机视觉领域中两个重要的研究方向,具有广泛的应用场景。而图像深度估计作为计算机视觉领域的经典问题之一,一直备受学者们的关注。本章将分别介绍基于深度学习的图像去雨去雾相关理论知识和图像深度估计相关理论知识。1.1基于深度学习的图像去雨去雾相关理论知识1.1.1雨和雾的成像特性1.1.1.1雨的成像特性 随着云中的水汽饱和区中水滴的凝结、吸湿增长,水滴的尺度达一定程度后重力便大于浮力开始下落。雨滴一般呈扁球形或椭球形,其直径一般在0.1-3.5毫米不等。由于雨滴在曝光过程中的快速下落,在所拍摄的图像中往往会留下线型的运动模糊,即雨线。受风力、空气阻力、碰撞等环境因素的影响,自然界雨滴的降落速度和方向总是混沌不定的,给图像去雨工作带来巨大的困难与挑战。而雨的大小和密集程度将直接影响其对所拍摄图像的遮盖情况,破坏场景结构细节影响图片质量。由于雨滴会对光线进行反射与折射,有雨图像中的雨滴和雨线作为高频成分之一常表现为亮眼的白色。在彩色含雨图像中,雨滴对于R,G,B三个通道的所带来的影响程度上基本相同。 在单幅图像去雨研究中,通常将含雨图像视由雨层和背景层的线性叠加而成,其公式表示如下:I=其中,I表示含雨图像,α表示比例系数,B表示无雨的清晰背景图像,R表示雨线。基于雨线在图像中呈稀疏表示,而背景图像具有分片局部连续性的基础上,能够利用雨线周围的像素信息对雨线所遮盖的区域进行还原。1.1.1.2雾的成像特性 由于大气中水雾、灰尘等细小颗粒的存在,雾天拍摄的图像总会产生对比度与饱和度降低且能见度下降的问题,图片质量因此受到影响。图1.1展示了雾天环境下物体的成像过程,由图可以看出雾天物体成像主要受到两方面的影响。一方面,目标反射光受大气中悬浮粒子的影响出现散射和吸收现象,进而使得探测系统所接收到的目标反射光减少,最终导致成像结果亮度降低、对比度下降;另一方面,随着距离的不断增加由雾所散射的大气光所形成背景光也将不断叠加直至背景光强度大于目标反射光,进而导致成像模糊不清。图1.1雾天物体成像过程 根据雾天物体成像的原理,McCartney等人[36]于1976年首先提出大气散射模型。Nayar[37]和Narasimhan[38]等人随后对该模型进行改进与优化,其数学描述为:I其中,x表示被观测图像中的任一像素的位置,Ix表示由设备拍摄所得的有雾图片,Jx表示真实无雾图片,tx表示大气透射率,α表示全局大气光值。故获取大气透射率tx和全局大气光值 大气透射率txt其中,β表示大气散射系数,dx表示所拍摄场景的景深。由此可以看出,大气透射率将随着所拍摄场景与成像设备距离的增加而不断降低,而场景的退化程度将不断上升,最终使得图像呈现模糊状态1.1.2卷积神经网络相关理论知识 近年来,随着GPU算能的迅猛发展,利用深度学习的方法解决图像处理问题成为了主流。在深度学习的网络架构中,卷积神经网络因其强大的特征提取能力而为研究者们所青睐,进而在图像处理领域的高低水平任务中都有充足的发展与建树。自LeCun等人[39]首先提出卷积神经网络模型并在手写数字识别任务中取得巨大成效后,涌现一大批优秀的网络模型,如AlexNet[40]、VGG[41]、GooleNet[42]、ResNet[43]等。虽然这些网络模型搭建方式不同,但其基本结构和搭建单元是相相同。卷积神经网络的网络结构一般包括一个输入层、一个输出层和若干隐藏层,其基础模块一般有卷积层、池化层、激活函数层等。下面将对其各个基础模块进行简要介绍。之后,对本文算法中所采用的残差神经网络(ResNet)和马尔可夫判别器(PatchGAN)进行介绍。1.1.1.1卷积神经网络基础理论知识卷积 常见的卷积操作分为卷积层和反卷积层两种,卷积层和反卷积层实际执行的都是图像的卷积操作但执行方式不同。 卷积操作是利用一组卷积核在图像上滑动的方式,将卷积核中的权值与图像对应位置的像素进行线性加权运算,最后输出一组输入图像的特征图。卷积核的宽高一般相等,其常见的尺寸有1×1、3×3、5×5、7×7等,卷积核尺寸越大则感受野越大而输出特征图越小。在图像卷积操作中,感受野和权值共享是其重要特征。感受野类似人的视野范围,是指输出特征图上的像素点对应于图1.2步长为1的卷积过程 图1.2展示了一幅单通道5×5大小的输入图像与一个3×3大小卷积核的卷积过程,从图中可以看出卷积操作每次滑动的步长为1且没有补零。经过卷积操作后图像的大小发生变化,在实际操作中输出特征图的大小可以通过对步长(Stride)和补零(Zero-padding)的设置进行控制。输出特征图尺寸的计算公式如下:W其中Wout表示输出特征图的尺寸,Win表示输入图像的尺寸,F表示卷积核的大小,P表示补零的个数,I其中Iout为输入特征图,Iin为输入图像,W为卷积核, 反卷积并非卷积的逆向操作,其实际上是一种转置卷积,即将卷积核转置后与输入图像做卷积操作。反卷积通常用于图像的上采样,用于将输入特征图恢复成原始图像大小。图1.3反卷积示例 图1.3展示了一个单通道2×2大小的输入图像在填充两行两列后于一个3×3大小的转置后的卷积核进行步长为1的反卷积过程。反卷积后生成的图像大小同样可以通过对步长与补零的设置进行控制,输出图像大小可以由公式1.6进行计算:W其表现形式上即为公式1.4的逆运算。池化 池化层主要作用在于对输入的特征图的下采样,故也叫下采样层。池化层通过下采样完成对特征图的空间信息的聚合,进而提取更高维度的特征,同时减小特征图的大小和网络模型参数数量。池化操作常见最大值池化和平均值池化两种,其表现为一种逻辑操作,并没有参数。图1.4展示了这两种常见的池化操作:最大值池化平均值池化图1.4最大值池化和平均值池化最大值池化是选取窗口大小的局部区域中的最大像素值作为该区域的输出,平均值池化是选取窗口大小的局部区域中的像素平均值作为该区域的输出。图像池化后会丢失部分信息,但网络模型的规模和复杂度得以降低并且可以防止过拟合。此外模型的泛化能力还可以因池化操作的旋转、平移、尺度不变性的特点而有所提高。激活函数 我们通常会使用激活函数对当前网络的输出进行映射,为网络模型引入非线性因素,给予模型对复杂函数的拟合能力进而更好地对现实复杂情况进行描述。 图1.5展示了4种常见的激活函数图像,下面将分别给出他们的函数表达式及其导数表达式。SigmoidTanHReLULeakyReLU图1.5常见激活函数图像Sigmoid激活函数 Sigmoid激活函数的表达式为:σ 其导数为:∂Tanh激活函数 Tanh激活函数的表达式为:σ 其导数为:∂σReLU激活函数 ReLU激活函数的表达式为:σ 其导数为:∂LeakyReLU激活函数 LeakyReLU激活函数的表达式为:σ其导数为:∂1.1.1.2ResNet和PathGAN(1)残差神经网络(ResNet) 在计算机视觉任务中,学者们发现随着卷积神经网络模型层级的加深网络的表现也将逐步提升,即网络的学习能力随网络层数的加深而提高,如VGG和GoogleNet。然而,在通过对数据的预处理以及BN(BatchNormalization)层的引入基本解决梯度爆炸和梯度消失的情况下,当网络层级达到一定程度时,性能却出现快速下降的情况即退化问题。随着网络层级的加深,模型复杂度更高表达能力也更强,能够对潜在的映射关系进行更好地拟合。但这样同时加大了优化的难度,且优化难度的增长与网络层级的增加并非呈线性关系,故而随着网络层数的不断叠加退化问题的出现是难以避免的。图1.6ResNet基本单元 He等人[43]提出的残差神经网络(ResNet)利用巧妙的残差设计,解决了因网络层级不断加深而出现退化问题,。该网络模型可以不断叠加网络层级,并且该设计下深层网络的性能总是优于或等于浅层网络。ResNet中,将堆叠的几层网络层级作为一个残差块,如图1.6所示。 对于某一单元,其用于拟合的函数为Fx,假设期望的潜在映射为HH基于恒等映射思想:在当前网络达到最优条件下继续加深网络,只需让深层网络保持恒等映射就能保证深层网络不会出现退化问题。让Fx学习为0相较于让Fx学习成恒等映射要容易许多。故而,残差块通过跨层连接的方式,用学习残差H(x)−x代替直接学习潜在映射,在几乎未增加参数量的前提下实现了网络性能的提升。残差学习的方式利用Fx+x来拟合Hx(2)马尔可夫判别器(PatchGAN) 感知生成器所生成图片与真实数据间的差异是生成器的主要作用,其旨在分辨出输入数据的真伪。判别器的输出是经过一系列卷积操作后使用激活函数映射在0∼1的标量值,是整张图像计算加权后的结果。然而对于图像迁移等精度要求相对的任务而言,无法体现局部特征的判别值是不理想的。 PatchGAN的基本思想是,将图像裁剪成多个相互重叠的图像块,分别利用判别器对其进行差异识别,并对各个图像块的判断结果求平均作为最终的判别结果。在图像块差异判别的方式下,得以对输入图形的各局部特征进行提取,进而更好地帮助生成为高分辨率的图像。对于分类特征图进行平均,即对图像整体进行加权求和,能够更好地对图像的整体特征与差异进行描述。PatchGAN机制的核心在于对生成器网络的优化,使得更多的低阶信息得以交换,网络的梯度更加平缓。但对于每一图像块的计算也大大增加了运算消耗,并且对于不同任务感受域的尺寸动态性与差异性的需求,也增加了网络模型的复杂度。 PatchGAN的处理过程如图1.7所示,将一张图片随机裁剪为多各重叠的N×N的图像块,并分别经判别器D判断后得到判别结果Di,最后将所有的判别结果Di加权求和得到判别器图1.7PatchGAN处理过程1.1.3图像去雨去雾的评价指标 获取修复图像后,还需对图像的复原效果进行评价。然而人的主观感觉总是受环境因素影响不够客观和准确,且人眼对于图像细微处差别的分辨能力较弱。故而使用评价成本低、速度快且不受人为因素及环境因素影响的客观参数作为图像质量的评价指标是相对合适的。在本文中,将采取峰值信噪比(PeakSignal-to-NoiseRatio,PSNR)和结构相似性(StructualSimilarityIndexMetric,SSIM)两种参数作为图片复原的评价标准。1.1.3.1峰值信噪比(PSNR) 峰值信噪比(PSNR)是使用最为普遍和广泛的一种客观图像评价指标,用以指示一个信号的最大可能功率与其背景噪声的功率之比,用对数分贝级表示。其计算公式如下:PSNR=10其中MAX表示图像中像素值的最大值,如果用n位数表示一个像素值,则MAX取值为2n−1,若使用8位数表示一个像素值则MAX=255。MSE表示当前图像与参考图像间MSE=MSE越小代表两张图片越相似,即PSNR越大两张图片的相似度就越高。对于整个数据集而言,通常对所有样本取平均值作为测试集的PSNR。因为PSNR是一种基于对应像素点误差的指标,由于其并未考虑到人眼的视觉特性,所以其评价结果与人的主观评价不一致的现象时常发生。1.1.3.2结构相似性(SSIM) 结构相似性(SSIM)是一种常用来衡量两幅图像相似度的指标,是基于人类的视觉感知善于从场景中提取结构信息的假设前提下,由Wang等人[44]所引入的基于结构信息退化的质量评估的替代补充框架的一个实例。其中,结构相似度指数被定义为独立于亮度和对比度的反应场景的结构信息的属性,而整体的失真度由亮度、对比度、结构相似度三种不同因素的组合而成。对于图像样本x和y有其局部亮度相似度lx,y,局部对比度相似度c(x,y),局部结构性相似度s(x,y)lcs其中,μx和μy分别表示x和y的采样区域均值,σx和σy分别表示x和y的采样区域标准差,σxy表示x和y的采样区域的协方差,c 将局部亮度相似度、局部对比度相似度、局部结构性相似度进行组合,即可得到结构相似性(SSIM)的计算公式:SSIM通常情况下,将α、β和γ设为1。SSIM的取值在0到1之间,SSIM越小则表示两幅图像的相似度越低,若SSIM等于0则表示两幅图像毫不相关,SSIM越大则表示两幅图像的相似度越高,若SSIM等于1则表示两幅图像一模一样。对于经处理后的复原图像与原图像而言,SSIM值可以用以体现图像处理的失真情况,且该值相较于PSNR而言更加贴近人的主观感知情况。 1.2单目图像深度信息估计相关理论知识1.1.1深度估计基本理论 图像深度估计是感知景三维信息至关重要的步骤,在后续的三维重建、自动驾驶、增强现实等高层次的计算机视觉任务中有举足轻重的影响。图像深度估计方法可以按探测设备的数目分为单目图像深度估计方法和多目图像深度估计方法。其中,单目图像的获取对设备要求低、场景限制小、操作方便且适应性强,因此单目图像深度估计方法具有很高的研究价值和现实意义。 深度感知是一种对场景三维信息与物体远近的感知能力,在单目图像深度估计方法中主要通过各种各样的视觉线索作为深度感知的来源。常用的单目视觉线索有线性透视(linearperspective),相对大小(relativesize),遮挡(occlusion),纹理与纹理梯度(textureandtexturegradient),光线与阴影(lightandshadow)等,如图1.8所示。线性透视相对大小遮挡纹理与纹理梯度明亮与阴影图1.8常用的单目视觉线索 线性透视是符合人们心理习惯的事实,即相同大小的物体,离我们越近则在视觉感受越大,离我们越远则在视觉感受上越小。诸如火车轨道、马路等平行线会在远处交汇,沿平行线越靠近消失点的物体在视觉感受上越远。相对大小是指图像中任意两个物体,离视点近的物体一般比离视点远的物体在感知上尺寸要大。遮挡是指当一个物体被另一物体所遮挡时,遮挡物体视觉感受上离我们近,而被遮挡雾视觉感受上离我们远。纹理是指图像中物体表现出不同的纹理往往能够指示物体的远近关系,而纹理梯度是指图像中的物体在成像时在视觉传感器上投影的大小和投影密度发生有层次的变化。明亮和阴影有助于我们对于物体的体积、强度、质感和形状等特征进行感知,阴影部分在感知上离我们远,明亮部分在感知上离我们近。 从理论上说,仅有单目图像的情况下由于无法利用相似三角形定量获取视差信息,任一图像之于现实场景中的映射有着无限的可能性,故而对单目图像进行绝对或相对深度值的估计是一个病态问题。但事实上,人类拥有能够基于图像的各种视觉线索对于单目图像的深度进行估计的能力,这证明了利用深度学习方法提取单目图像的深度信息的可行性。1.1.2自监督单目深度估计算法MonoDepth2 对于一张图像而言,其像素之间的联系反应出了诸如线性透视、纹理与纹理梯度、明亮与阴影等图像线索,故而可以通过分析图像的像素排列得到图像的各种视觉线索特征。依赖于各种视觉线索特征可以很好地预测出图像中各物体距离成像设备的远近关系,进而能够分析得到相应的图像深度信息。图像的深度信息通常用深度图表示,深度图中每个像素的位置与原图像对应,每个像素的颜色指示该像素所在真实场景中所对应位置与成像设备的距离。 大量的研究表面卷积神经网络拥有极为强大的特征提取能力,许多学者将卷积神经网络应用于在单目图像深度信息估计领域,并因此涌现出大量优秀的单目图像深度估计算法。其中,利用双目数据进行训练的MonoDepth2算法[45]在图像深度预测上有着十分优秀的精度,其所生成的深度图像在保留图像细节方面也有着良好的表现。 图1.9(a)展示了MonoDepth2中的深度估计模块,该模块的作用是从单目图像中估计图像每一像素点的逆深度,随后将所得逆深度取反即可得到相应像素点对应场景位置之于成像设备的距离。该深度估计模块由特征编码子模块和特征解码子模块组成。其中,特征编码子模块的主要作用是对输入图像进行下采样来提取图像特征,共生成5级特征,特征级数越高则其在特征空间上的分辨率越低。特征解码子模块的主要作用是结合特征编码子模块,联合其中分辨率相同的特征进行深度估计。 图1.9(b)展示了MonoDepth2中的相机位姿估计模块,该模块的作用是
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2025-2026学年三年了说课稿
- 2026年网络攻击防范专项训练题库
- 2025-2026学年《青蛙卖泥塘》说课稿
- 2025-2026学年儿歌表演说课稿模板
- 2025-2026学年1 5分成说课稿
- 2025-2026学年丰收的秋天中班说课稿
- 2025-2026学年《生命的起源》说课稿
- 2026下半年医疗卫生岗笔试全真模拟题库及解析
- 湖北文秘岗笔试历年真题题库及答案
- 2025-2026学年创意画元宝说课稿
- 2026秋统编版语文六年级上册第二单元综合素养测评卷(含答案)
- (2026年版)糖尿病患者合并心血管疾病诊治专家共识
- 工程挂靠协议书
- 无产权车位使用权转让协议书2026年模板
- 关于新生儿科输液泵故障的应急预案演练脚本
- 吉兰-巴雷综合征合并吞咽困难管理专家共识(2026版)
- 探索HIV-1感染者Vpr基因多态性及其临床关联:从分子特征到医学启示
- 网吧卫生管理制度及流程
- 卫浴装修公司合作协议7篇
- 韦氏-儿童智力测验量表
- 《千字文》硬笔楷书字帖
评论
0/150
提交评论