版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
III图像转换的相关技术研究综述目录TOC\o"1-3"\h\u2174图像转换的相关技术研究综述 158271.1深度学习技术 1160921.2深度学习框架 394141.1.1TensorFlow 350171.1.2Torch 4296611.1.3PyTorch 4249701.3生成对抗网络 4284261.3.1深度卷积生成对抗网络 6320321.3.2循环生成对抗网络 6165261.4卷积神经网络 7145641.4.1卷积神经网络的概念 794521.4.2卷积神经网络的构成 91.1深度学习技术事实上,深度学习本身并不是一个簇新的定义。其出现可以溯源到1958年的第一个神经网络——由弗兰克·罗森布拉特创建的感知机[9]。为什么深度学习革命等了足足几十年?一个首要缘由是计算代价。即便是最小的层次架构也有数十层和几百万个变量,在当时的情况下重复计算梯度是非常昂贵的甚至是不可能的。但是反向传播,随机梯度下降[10]和GPU计算这三个主要的方面的进步让研究员窥探到了冲破迷雾的希望,也铸就了深度学习的百花齐放。“深度学习”从此成为机器学习中最具有发展潜力的优质股。如今人们仅仅用几个小时的时间就可以在电脑上训练一个最先进的模型。击败世界顶级围棋棋手李世石的Alphago是深度学习史上的一个桂冠。TensorFlow构架[11]是Google的开放源代码深度学习体系中尽人皆知的学习框架,支持卷积神经网络、递归神经网络[12]和长期短期记忆等机器学习算法,扎根于图像生成、语音识别等方面,是最风靡的深度神经网络模型。近年来,深度学习是机器学习发展历史上的一个重要转折点,极大地推动了人工智能的发展,也引起全球相关学科科研工作者和尖端技术国际公司的高度重视,深度学习算法应用最普遍的两个主要研究方向是语音、图像处理:在语音识别领域研究现状在深度神经网络被用于语言识别领域之前,高斯混合模型[13](GaussianMixedModel,GMM)被广泛用于语音识别系统中以构建复杂对象建模单元的概率模型。GMM是单高斯概率密度函数的拓展,可归属于浅层学习网络模型。就大规模数据集而言,高斯混合模型的训练更加简便,而且有更合适的判别训练算法,所以在语音识别发展史上GMM一骑绝尘,所向披靡。但是GMM模型数据的特征态的空间分布以及特征之间的相关性无法被全面概括。即便某些模型分类判别能经由模拟区分度训练得到,其效果也不尽如人意。因为GMM建模实质上是一种似然概率建模[14]方式。根据这一缺陷,Microsoft将深度神经网络的概念应用于语音识别系统。这一个革命性壮举冲击了语音识别领域现有的技术架构,其特点是用高维特征样本训练模型,通过对比碎片之间的重合度将不连续的语音碎片归并起来构成一个更高维度的语音碎片特征[15]。深度神经网络仿人脑神经网络的结构一层层提取数据特征获取到适合模式识别的理想特征。在图像识别领域研究现状对图片的识别处理一直是机器学习的重点关注对象,深度学习也不例外。Facebook首席AI科学家YannLeCun于1989年就提出了带有卷积层的深度神经网络模型——卷积神经网络(ConvolutionalNeuralNetworks,CNN)。然而,由于在大规模图像识别中一直未能达到预期的效果,长期以来卷积神经网络没有取得质的改进和突破,在计算机视觉领域也没有得到足够多的关注。直到2012年Hinton在万众瞩目的机器视觉以及模式识别问题上采用更深入的CNN结构模型[16],在训练中引入了权值衰减的概念,有效地缩小了权值范围,防止了网络的过拟合。再者,计算机运算能力的提高和GPU加速技术的发展也是关键因素,当对大规模数据集进行深度训练时神经网络的实现效果更佳。深度学习模型一方面提高了图像判别技术的精确度,另一方面也减少了数据特征的提取花费的时间成本。如今,图像识别技术不仅能够识别分类简单的图像,也可以进行有遮挡人脸识别、视频分析剪辑以及图像合成。在2020年新冠肺炎疫情的肆虐之下,识别有无佩戴口罩的人脸识别程序如雨后春笋般涌现。对于精确的人脸识别的实现重难点在于一个人在不同的场景、不同服饰、不同表情、不同姿势下拍照得到的图像对于人脸识别的干扰。当今,人工智能领域普遍存在一种误解,即“深度学习最后很有可能会消灭掉其余机器学习算法”。这种看法的产生主要是因为当下深度学习在语言识别和计算机视觉领域的热度远远超过传统的机器学习方法,并且网络媒体对深度学习报道往往言过其实。眼下的深度学习主要是基于神经网络。由于该算法能自动学习和迭代样本的计算结果,更适合于原始样本与数据特征(如图像、语音、文本等)有较大差异的情况,不能用一般的统计方法来推进特征值,这也是为什么深度学习能够在这些领域取得巨大进步的一个非常重要的原因。而另一方面,当数据的原始样本和数据的特征之间差别不大时,使用深度学习代价和性能将不如传统的机器学习方法。毕竟科学的发展不是孤芳自赏的博弈斗争而是百花齐放的共同合作,任何学科的成长也从来不是闭门造车,而是同行之间互通有无、取长补短、相辅相成、珠联璧合,站在历史巨人的肩膀上不断大踏步前进。机器学习也是同样的道理,任何科学技术和算法发展的目的都不是为了淘汰其他的技术,而是互相学习、互相借鉴的螺旋上升的过程,这也是人工智能的发展之所以能焕发出蓬勃的生命力的原因。任何算法都不可能消除所有的算法,深度学习也不会是例外。1.2深度学习框架在深度学习发展的初期,每个程序都需要编译大量重复的代码,这不仅浪费了时间精力而且容易出错。因此一些研究员将这些代码汇总成了一个框架放到网络上让所有研究者一起使用以便提高工作效率。随着时间的推移,最为易用的几个框架被广泛使用的同时不断改进发展。深度学习框架[17](Deeplearningframework)是一种接口,它使得在不深究底层算法细枝末节的状态下,更轻易、更便捷地构建自己的深度学习模型。深度学习框架使用事先构造和优化的部件集来定义模型,并提供了一种更为简洁的方法去实现具体的模型,而不必编写上百行复杂代码。评价深度学习框架的质量常常通过从以下几个维度判断:性能的改良、编码的复杂度、社区支持度、进程的并行化以及计算梯度。有人做了一个通俗易懂的类比:一种深度学习框架好比是一个工厂批量生产的零件,每种零件就像是特定模型或算法的一部分。我们可以根据自己的需要选择用什么零件拼装出理想工艺品。越来越多初学者深度因学习框架的出现涌入机器学习,人们可以根据需要直接调用现有的深度学习模型,通过训练得到模型的参数,在顶端选择自己需要的分类器。1.1.1TensorFlowTensorflow库是谷歌运用C++语言编写的基于数据流图进行计算的一种开放源代码数学计算软件。Tensorflow体系结构的新巧之点在于它可以配置在CPU、GPU及服务器中,甚至是使用API应用在手机中。数据流图里的结点表示代数运算,而张量之间的交互由线段表示。作为世界上用户数量最多的一个机器学习框架,Tensorflow维护更新频繁并且有着相对完整的教程和比较丰富的学习资源。此外关于深度学习的论文很大一部分都是基于Tensorflow写的,因此它被认为是深度学习界框架的领头羊。1.1.2TorchTorch[18]是继Tensorflow之后的一种机器学习框架,其真正崛起始于脸谱网分享了Torch的深度学习模块源码。Torch虽然使用起来十分灵便,但是其劣势在于选取了小众的Lua。毕竟如今深度学习者主要使用Python,人们可能不愿意花费更多时间成本去学习一门新的编程语言,即使Lua语言实际上很容易入门。1.1.3PyTorchPyTorch[19],一种炙手可热的动态图框架是由Torch7团队开发的改良版Torch,其继承了Torch框架的底层结构,并重新构建了Torch模块中的不合理之处使其更加灵便通用。PyTorch不仅隐藏Torch的内部细节提供一个方便使用的Python接口,而且加入了自动推导系统。与Tensorflow和其他流行的深度学习框架相比,PyTorch的亮点在于强有力的GPU加速和支持动态神经网络。因此,PyTorch也被当作一个具有优良的自动推导功能的深度神经网络。1.3生成对抗网络生成对抗网络[20](GenerativeAdversarialNetworks,GANs)是由蒙特利尔大学(UdeM)伊恩·古德费洛提出。生成对抗网络的灵感来自对策论[21](GameTheory)中的零和游戏,经过判别器D(Discriminator)和生成器G(Generator)这两个神经网络的不断对抗和博弈:生成器根据随机的噪声生成虚假数据,鉴别器将鉴别输入的数据是真实的数据还是生成器产生的虚假数据。生成器的目标是生成以假乱真数据以迷惑判别器,而判别器试图火眼金睛分辨出真实数据与生成的虚假数据。换句话说,生成器和判别器是一对矛盾,两个网络在博弈中进化,在进化后继续对抗,呈现螺旋上升的趋势。由生成器生成的数据越来越接近实际数据,因此可以生成所需的数据(图片、序列、视频等)。图STYLEREF1\s2-SEQ图\*ARABIC\s11生成对抗网络下图形象地展示了生成器和判别器的对抗博弈过程,其中黑色虚线是真实数据所服从的概率分布,绿色实线则代表生成器生成的虚假数据分布,而蓝色表示判别器的判别结果[22];图2-SEQ图\*ARABIC\s12生成器与判别器的博弈过程图(a)是博弈的初期,生成器还没能学会如何模拟真实数据分布,判别器也还在摸索阶段;从图(b)和图(c)可以发现经过不断地学习训练,生成器和判别器不断优化,生成器生成的数据渐渐逼近真实数据;图(d)是理想博弈结果,生成器产生的虚假数据分布于真实数据分布完全一致,判别器再也无法区别数据的真假。IanJ.Goodfellow在论文中对GAN是这样定义:公式(2-1)整个公式由两项期望之和构成。对判别器D而言,对于真实数据x,它希望其判断结果D(x)越接近1越好,因为D(x)是判别器G判断真实图片是否为真的概率。而对输入生成器G的噪声z产生的虚假数据G(z),它希望其判断结果D(G(z))越接近0越好,因为D(G(z))是判别器G判断虚假图片是否为真的概率[23]。而对生成器G则相反,它希望自己产生的虚假数据G(z)“越接近真实越好”这样才能欺骗判别器D。也就是说,生成器G希望D(G(z)尽可能地大。所以GAN的优化任务对于生成器G是求最小min_G,对判别器D是求最大max_D。1.3.1深度卷积生成对抗网络2015年AlecRadford&LukeMetz在改进GAN网络结构的基础上提出了DCGAN[24](DeepConvolutionGenerativeAdversarialNetworks)。与GAN相比,DCGAN在无监督训练过程中引入卷积运算的思想所以状态更加稳定,特征提取更快速,生成的图片质量更高和学习效果更好。DCGAN其实是CNN和GAN的结合体,其生成器和判别器都运用了卷积神经网络CNN的生成对抗网络。具体而言DCGAN的进步之处在于:首先步长卷积代替上采样层能更好地提取图像高维度特征;其次使用batchnorm层对特征层的输出进行归一化处理,加速训练,提高稳定性。而且DCGAN的生成器网络结构如下图:图2-SEQ图\*ARABIC3DCGAN的生成器网络结构1.3.2循环生成对抗网络循环生成对抗网络[25](CycleGAN)是GAN的另外一种进化体。CycleGAN中的“循环Cycle”是指对于每个循环生成对抗网络都有两个镜面对称的GAN构成了一个环型网。循环生成对抗网络一个最突出的特点是对于输入的图片可以是不成对的任意的两张图片。图2-SEQ图\*ARABIC4循环生成对抗网络示意图左:输入x的循环一致性损失的直观表示。右:输入y的循环一致性损失的直观表示。从图中可以看出,循环生成对抗网络是由X→Y和Y→X的两个单向生成对抗网络GAN构成[26]。CycleGAN共用这两个生成器G,加上其本身配套的判别器D。以下是CycleGAN论文中的循环损失函数公式:公式(2-2)CycleGAN不是两个原始Gan的简单叠加,需要特殊的循环一致性损失去保持整个循环的一致性,即定义为两个输入噪声x、y与各自正向预测F(G(x))、G(F(y))的差。差值即代表生成的数据与原始数据之间的差异。针对我们的需求,我们希望经过训练能将损失降到最低。理想情况下,损失应逼近于0即输入与输出完全一致。1.4卷积神经网络1.4.1卷积神经网络的概念卷积神经网络(ConvolutionalNeuralNetwork,简称CNN),是模仿生物神经网络的带有卷积结构的一种监督学习的前馈神经网络[27](feed-forwardneuralnetwork),由若干个神经元按输入层,若干个隐藏层和输出层组成的全连接网络。卷积神经网络是杨立昆在福岛邦彦提出的具有卷积层和池化层的神经网络基础上改进的,宣告了机器学习中的新时代的到来,因此他也被称为CNN之父。局部感受野、权值共享和池化层是CNN的关键。局部感受野[28](receptivefield)其含义可类推生物学上感知细胞的感受野。简单来说,就是由卷积核确定的输出单元相应的输入大小,即数学定义上的映射关系。因此卷积神经网络可以通过每个神经细胞汇总局部特征而认识整体,从而减少深层网络的连接数和内存消耗。权重共享[29]是各个神经细胞共享卷积核参数去卷积输入图像,得到在不同区域相同特征的操作。这表明卷积网络在小范围内对一定程度的位移、放大缩小、旋转或其他形式的变形具有很高的稳定性。局部感受野和权值共享简化了结构,缩减了权值的个数,规避了繁琐的特性提取和数据重建,削减了训练复杂度,有效地减轻了模型的过度拟合问题。图2-5卷积神经网络一个标准的卷积网络由输入层、隐含层(卷积层与池化层合作提炼获取每层的数据特性,是卷积神经网络关键模块)和全连接层构成。对输入图像滤波,提取得到局部特征,确定了其和剩余特征的位置关系。不同层各司其职,相互配合,最终达到特征提取、训练网络的目的。与其他机器学习算法一样,梯度下降、频繁的迭代训练以及权重参数的反馈调整是实现损失函数最小化提高网络的精度的主要手段[30]。隐层处理后的特征图像是第一个完全连通层的输入。输出层是对输入图像使用logistic回归、soft-max回归等算法的分类器。图2-6CNN结构
1.4.2卷积神经网络的构成输入层是整个卷积神经网络的开始。在图像处理中,它一般指图像的二维平面像素和RGB颜色通道。卷积神经网络实际上是从输入层到全连通层的三维矩阵变换。其中前两个坐标是矩阵的长宽代表即图像的大小,而第三个坐标深度表示图片的色彩通道。输出层一般位于全连接层之后,工作原理与结构与输入层相似,但输出层的作用是输出最后的分类结果。卷积神经网络同机器学习中的其他算法一样需要归一化输入特征值以简化下阶段的梯度下降,一般用输入特征值与特征均值之差除以最大区间长度。图片像素一般标准化成0到1之间的实数。卷积层顾名思义,卷积层是一个卷积神经网络中的中央枢纽。卷积层与前馈神经网络的神经细胞类似,由权重系数和误差向量构成的卷积核意欲对神经网络的每个小块进行更深层的卷积,对输入数据提取更高维度的特征。在卷积过程中,每个特征面(FeatureMap)上的每个神经元都通过卷积核与其上一层特征面中相应部分局部连接。如图2-7所示,卷积核是把连接权值与对应的局部输入值加权求和再加上一定偏置值的结果。卷积核于二维图像通常为“3*3”或“5*5”的一个权值矩阵,通过卷积操作(相当于滤波器),提取输入图像的不同特征。在卷积神经网络
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 特种设备事故应急预案
- 2026年银川市兴庆区(中小学、幼儿园)教师招聘笔试备考试题及答案详解
- 2025年招标投标(评标评审专家)试题及参考答案
- 冲突管理:常见短板与提升路径
- 青少年情绪障碍行为治疗指南
- 2026年新疆维吾尔自治区克拉玛依市(中小学、幼儿园)教师招聘笔试模拟试题及答案详解
- 2026年太原市小店区(中小学、幼儿园)教师招聘笔试备考题库及答案详解
- 2026年邢台市桥西区城管协管人员招聘笔试参考试题及答案详解
- 2026年宜昌市西陵区城管协管人员招聘笔试参考题库及答案详解
- 2026年张家界市武陵源区(中小学、幼儿园)教师招聘考试备考试题及答案详解
- 初中数学三角形全等的判定(SAS)说课课件+人教版数学八年级上册
- 力学科普课件
- 2025年期货高管考试题库及答案
- T-CIAPS0026-2023 电池行业能效对标实施指南 第 3 部分 正极材料
- 专利知识培训教学课件
- 污水处理厂主要设备安装与调试研究
- 教学课件-交互设计(第二版)-李世国
- 《生物能源》课件
- 教科版九年级物理教案:3.4电路创新设计展示活动
- 装修工程安全专项施工方案
- 心衰评估量表
评论
0/150
提交评论