【《卷积神经网络和循环神经网络对人工神经网络的改进概述》6200字】_第1页
【《卷积神经网络和循环神经网络对人工神经网络的改进概述》6200字】_第2页
【《卷积神经网络和循环神经网络对人工神经网络的改进概述》6200字】_第3页
【《卷积神经网络和循环神经网络对人工神经网络的改进概述》6200字】_第4页
【《卷积神经网络和循环神经网络对人工神经网络的改进概述》6200字】_第5页
已阅读5页,还剩7页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

卷积神经网络和循环神经网络对人工神经网络的改进概述目录TOC\o"1-3"\h\u30391卷积神经网络和循环神经网络对人工神经网络的改进概述 183911.1早期人工神经网络 145711.2卷积神经网络 328831.1.1卷积神经网络发展 3107021.1.2卷积神经网络基本结构 671251.1.3ResNet网络 7212401.1.4U-net网络 8254311.3循环神经网络 10283311.4小结 12本章主要介绍实现人工智能算法化学分子图识别过程中使用的深度学习网络,包括卷积神经网络、循环神经网络及全卷积神经网络。其中主要介绍了ResNet网络、长短期记忆网络和U-net网络。1.1早期人工神经网络图2-SEQ图\*ARABIC1M-P神经元模型人工神经网络雏形在1943年被提出,由心理学家McCulloch和数学家Pitts共同提出了人工神经元的数学模型ADDINEN.CITE<EndNote><Cite><Author>Mcculloch</Author><Year>1943</Year><RecNum>34</RecNum><DisplayText><styleface="superscript">[5]</style></DisplayText><record><rec-number>34</rec-number><foreign-keys><keyapp="EN"db-id="d900x2p98vraf3eddx4xp008rtxz95r0tdwf">34</key></foreign-keys><ref-typename="JournalArticle">17</ref-type><contributors><authors><author>Mcculloch,WarrenS.</author><author>Pitts,Walter</author></authors></contributors><titles><title>ALogicalCalculusoftheIdeasImmanentinNervousActivity</title><secondary-title>biolmathbiophys</secondary-title></titles><periodical><full-title>biolmathbiophys</full-title></periodical><dates><year>1943</year></dates><urls></urls></record></Cite></EndNote>[\o"Mcculloch,1943#34"5],开始了第一代人工神经网络的研究。图2-1是这一神经网络中单个神经元内部结构。网络模仿生物的神经元,对每个输入加权求和后通过激活函数获得输出。图2-2单层感知机结构简图此后由单层神经元组成的“感知机”被发明,图2-2是单层感知机的结构简图。这一模型和M-P模型的最大区别在于引入了偏置量β,更加接近现代神经网络中神经元的结构。这种结构可以识别一些手写字母,但需要手工调整网络参数且难以完成复杂的任务,不能满足实际需要,仍与现代使用的神经网络工具仍有较大差异。此外单层感知机仅对线性问题具有分类能力,仅依靠单层感知机无法解决非线性问题,如:异或操作。网络存在明显的局限性亟待改进。19世纪90年代,BP(BackPropagation)神经网络被重新提出ADDINEN.CITE<EndNote><Cite><Author>Rumelhart</Author><Year>1986</Year><RecNum>35</RecNum><DisplayText><styleface="superscript">[6]</style></DisplayText><record><rec-number>35</rec-number><foreign-keys><keyapp="EN"db-id="d900x2p98vraf3eddx4xp008rtxz95r0tdwf">35</key></foreign-keys><ref-typename="JournalArticle">17</ref-type><contributors><authors><author>DERumelhart</author><author>Hinton,G.E.</author><author>Williams,R.J.</author></authors></contributors><titles><title>LearningRepresentationsbyBackPropagatingErrors</title><secondary-title>Nature</secondary-title></titles><periodical><full-title>Nature</full-title></periodical><pages>533-536</pages><volume>323</volume><number>6088</number><dates><year>1986</year></dates><urls></urls></record></Cite></EndNote>[\o"Rumelhart,1986#35"6],在这种网络中首次使用的反向传播算法将神经网络研究再次推向高潮。这种反向传播算法将网络误差计算后传播到网络中,并据此调整网络神经元中隐藏层权重。至今,这种设计仍然活跃在各种人工神经网络中,此后的人工神经网络在此基础上不断发展,逐步出现了卷积神经网络和循环神经网络。1.2卷积神经网络卷积神经网络在早期人工神经网络基础上发展,本节将介绍卷积神经网络发展历史中的部分关键节点和本论文中使用的两种网络。1.1.1卷积神经网络发展卷积神经网络起源于20世纪末。为了识别手写数字,LeCun在1998年提出了LeNet这一网络结构ADDINEN.CITE<EndNote><Cite><Author>Lecun</Author><Year>1998</Year><RecNum>36</RecNum><DisplayText><styleface="superscript">[7]</style></DisplayText><record><rec-number>36</rec-number><foreign-keys><keyapp="EN"db-id="d900x2p98vraf3eddx4xp008rtxz95r0tdwf">36</key></foreign-keys><ref-typename="JournalArticle">17</ref-type><contributors><authors><author>Lecun,Y.</author><author>Bottou,L.</author></authors></contributors><titles><title>Gradient-basedlearningappliedtodocumentrecognition</title><secondary-title>ProceedingsoftheIEEE</secondary-title></titles><periodical><full-title>ProceedingsoftheIEEE</full-title></periodical><pages>2278-2324</pages><volume>86</volume><number>11</number><dates><year>1998</year></dates><urls></urls></record></Cite></EndNote>[\o"Lecun,1998#36"7]。LeCun提出这种网络时并没有明确提出卷积这一概念,但这一网络定义了卷积神经网络的基础结构,网络中各部分结构在随后出现的神经网络中也不断被使用,是卷积神经网络的开山之作。图2-3LeNet-5网络模型ADDINEN.CITE<EndNote><Cite><Author>Lecun</Author><Year>1998</Year><RecNum>36</RecNum><DisplayText><styleface="superscript">[7]</style></DisplayText><record><rec-number>36</rec-number><foreign-keys><keyapp="EN"db-id="d900x2p98vraf3eddx4xp008rtxz95r0tdwf">36</key></foreign-keys><ref-typename="JournalArticle">17</ref-type><contributors><authors><author>Lecun,Y.</author><author>Bottou,L.</author></authors></contributors><titles><title>Gradient-basedlearningappliedtodocumentrecognition</title><secondary-title>ProceedingsoftheIEEE</secondary-title></titles><periodical><full-title>ProceedingsoftheIEEE</full-title></periodical><pages>2278-2324</pages><volume>86</volume><number>11</number><dates><year>1998</year></dates><urls></urls></record></Cite></EndNote>[\o"Lecun,1998#36"7]图2-3是LeNet-5网络结构图,在经过后续简化处理后的LeNet-5网络中,除了输入层和输出层有5层结构,包括两个卷积层、两个池化层和一个全连接层,并将激活函数由双曲正切函数Tanh替换成线性整流函数ReLU,使用这种激活函数可以防止网络梯度消失并加快训练速度。LeNet-5网络中的卷积层、池化层和全连接层组成了卷积神经网络的基础架构,在后续的卷积神经网络中广泛使用。在2012年的ImageNetILSVRC竞赛中AlexNet网络以Top-5准确率高于第二名10%的优秀成绩脱颖而出获得了这一年度比赛的冠军ADDINEN.CITE<EndNote><Cite><Author>Krizhevsky</Author><Year>2012</Year><RecNum>37</RecNum><DisplayText><styleface="superscript">[8]</style></DisplayText><record><rec-number>37</rec-number><foreign-keys><keyapp="EN"db-id="d900x2p98vraf3eddx4xp008rtxz95r0tdwf">37</key></foreign-keys><ref-typename="JournalArticle">17</ref-type><contributors><authors><author>Krizhevsky,A.</author><author>Sutskever,I.</author><author>Hinton,G.</author></authors></contributors><titles><title>ImageNetClassificationwithDeepConvolutionalNeuralNetworks</title><secondary-title>Advancesinneuralinformationprocessingsystems</secondary-title></titles><periodical><full-title>Advancesinneuralinformationprocessingsystems</full-title></periodical><volume>25</volume><number>2</number><dates><year>2012</year></dates><urls></urls></record></Cite></EndNote>[\o"Krizhevsky,2012#37"8],这一网络在竞赛中取得的优秀成绩极大的推动了卷积神经网络的发展。图2-4AlexNet网络模型ADDINEN.CITE<EndNote><Cite><Author>Krizhevsky</Author><Year>2012</Year><RecNum>37</RecNum><DisplayText><styleface="superscript">[8]</style></DisplayText><record><rec-number>37</rec-number><foreign-keys><keyapp="EN"db-id="d900x2p98vraf3eddx4xp008rtxz95r0tdwf">37</key></foreign-keys><ref-typename="JournalArticle">17</ref-type><contributors><authors><author>Krizhevsky,A.</author><author>Sutskever,I.</author><author>Hinton,G.</author></authors></contributors><titles><title>ImageNetClassificationwithDeepConvolutionalNeuralNetworks</title><secondary-title>Advancesinneuralinformationprocessingsystems</secondary-title></titles><periodical><full-title>Advancesinneuralinformationprocessingsystems</full-title></periodical><volume>25</volume><number>2</number><dates><year>2012</year></dates><urls></urls></record></Cite></EndNote>[\o"Krizhevsky,2012#37"8]AlexNet网络的结构如图2-4所示,网络内使用了5个卷积层和3个全连接层完成图像分类任务,在AlexNet网络中使用了一些训练技巧提升了网络的稳定性和准确率,如:使用ReLU函数代替Sigmoid函数,大幅度加快了计算速度并避免了梯度消失的问题;使用局部响应归一化模拟生物体内神经元的侧抑制作用,即激活的神经元会对相邻神经元产生抑制作用;使用层叠池化代替非层叠池化,在一定程度上抑制了过拟合现象的发生;对图片进行翻转、平移和颜色变换等操作增大数据量,从而达到抑制过拟合的目的。图2-5DropOut网络模型(a)参照网络(b)使用了DropOut的网络ADDINEN.CITE<EndNote><Cite><Author>Srivastava</Author><Year>2014</Year><RecNum>38</RecNum><DisplayText><styleface="superscript">[9]</style></DisplayText><record><rec-number>38</rec-number><foreign-keys><keyapp="EN"db-id="d900x2p98vraf3eddx4xp008rtxz95r0tdwf">38</key></foreign-keys><ref-typename="JournalArticle">17</ref-type><contributors><authors><author>Srivastava,N.</author><author>Hinton,G.</author><author>Krizhevsky,A.</author><author>Sutskever,I.</author><author>Salakhutdinov,R.</author></authors></contributors><titles><title>Dropout:ASimpleWaytoPreventNeuralNetworksfromOverfitting</title><secondary-title>JournalofMachineLearningResearch</secondary-title></titles><periodical><full-title>JournalofMachineLearningResearch</full-title></periodical><pages>1929-1958</pages><volume>15</volume><number>1</number><dates><year>2014</year></dates><urls></urls></record></Cite></EndNote>[\o"Srivastava,2014#38"9]作者在AlexNet网络中还创造性地提出了Dropout这一方法。如图2-5所示,使输入层和输出层的神经元数量不变,但隐藏层中的神经元有一定概率失效。通过随机使神经元的失活方法不断改变网络结构,以达到抑制过拟合的作用。这种方法在此后的神经网络中也经常被使用。后续出现的网络为了处理不同种类的问题分别在不同方向上进行了改进,增加网络深度和组合使用多种网络是其中的两个方向。图2-6VGG网络模型ADDINEN.CITE<EndNote><Cite><Author>Simonyan</Author><Year>2014</Year><RecNum>7</RecNum><DisplayText><styleface="superscript">[10]</style></DisplayText><record><rec-number>7</rec-number><foreign-keys><keyapp="EN"db-id="d900x2p98vraf3eddx4xp008rtxz95r0tdwf">7</key></foreign-keys><ref-typename="JournalArticle">17</ref-type><contributors><authors><author>Simonyan,Karen</author><author>Zisserman,Andrew</author></authors></contributors><titles><title>VeryDeepConvolutionalNetworksforLarge-ScaleImageRecognition</title><secondary-title>Arxiv</secondary-title></titles><periodical><full-title>Arxiv</full-title></periodical><keywords><keyword>ComputerScience-ComputerVisionandPatternRecognition</keyword></keywords><dates><year>2014</year></dates><urls></urls></record></Cite></EndNote>[\o"Simonyan,2014#7"10]在网络深度上,从LeNet5网络中的5层网络结构发展到AlexNet网络中的8层网络结构,网络的深度没有出现大幅度的增长。但在随后出现的VGG网络中,网络的深度迅速增长到了16层以上。VGG网络的结构如图2-6所示,网络深度的增加使得网络能够更好的提取图片特征。VGG网络证明了增加网络层数可以有效地提高网络的准确率,此外,VGG网络中组合使用的小卷积核、多个卷积层堆叠的结构加强了网络提取图片特征的能力。图2-7VGG网络中代替5*5卷积核的连续卷积层ADDINEN.CITE<EndNote><Cite><Author>Simonyan</Author><Year>2014</Year><RecNum>7</RecNum><DisplayText><styleface="superscript">[10]</style></DisplayText><record><rec-number>7</rec-number><foreign-keys><keyapp="EN"db-id="d900x2p98vraf3eddx4xp008rtxz95r0tdwf">7</key></foreign-keys><ref-typename="JournalArticle">17</ref-type><contributors><authors><author>Simonyan,Karen</author><author>Zisserman,Andrew</author></authors></contributors><titles><title>VeryDeepConvolutionalNetworksforLarge-ScaleImageRecognition</title><secondary-title>Arxiv</secondary-title></titles><periodical><full-title>Arxiv</full-title></periodical><keywords><keyword>ComputerScience-ComputerVisionandPatternRecognition</keyword></keywords><dates><year>2014</year></dates><urls></urls></record></Cite></EndNote>[\o"Simonyan,2014#7"10]如图2-7所示,VGG网络使用3*3大小的卷积核和两到三层连续的卷积层进行卷积操作。在使用3*3大小的卷积核和连续两层卷积层时,卷积层感受野的大小达到了5*5个像素点,此时网络需要存储18个像素对应的参数。但在相同情况下,为达到5*5个像素的感受野采取单层卷积需要使用5*5大小的卷积核,此时需要存储25个像素对应的参数。同理可知,在使用3*3大小卷积核和三层连续卷积层进行卷积操作时,卷积层的感受野的大小达到了7*7个像素点,而此时只需要存储27个像素对应的参数,如果使用单层卷积则需要存储49个像素对应的参数,使用小卷积核和多个连续卷积层的组合有效减少了网络的开销。此外,由于经过更多次的非线性变化,堆叠的连续多个卷积层可以更好的学习网络特征。此后的ResNet网络的网络层数更是增加到了超过100层。伴随网络深度的增加,网络的学习能力也随之增强。在组合使用多个网络这一方向上,通过组合使用卷积神经网络和循环神经网络可以完成图片标注等工作。卷积神经网络能够提取图片特征并保存到张量中,通过循环神经网络则可以将提取到的信息解码并转换为输出信息。对于图片中拥有序列特性的信息,如语言中的逻辑顺序、运动中的时间顺序,通过卷积神经网络提取潜在特征后输入循环神经网络可以挖掘出网络使用者需要的时序信息。1.1.2卷积神经网络基本结构卷积神经网络的基本结构由输入层、输出层、卷积层、池化层和全连接层组成。在卷积神经网络中,卷积层用于提取图片特征,将图片中的信息转化为潜在向量提供给网络使用。池化层用于抽象图片内的特征,减少过拟合现象的发生并减少训练难度。卷积层中,上一层神经元输入的图片特征逐个和卷积核进行点积操作,随后将点积结果输入激活函数得到新的特征图。池化层则根据池化方式的不同采用随机取样、平均取样或取区域内最大值的方法将一定区域内的特征值合并成一个值。在经过多个连续堆叠的卷积层和池化层提取特征图后,输入全连接层中获取结果并输出。1.1.3ResNet网络图2-8ResNet网络中的残差学习单元ADDINEN.CITE<EndNote><Cite><Author>He</Author><Year>2016</Year><RecNum>17</RecNum><DisplayText><styleface="superscript">[11]</style></DisplayText><record><rec-number>17</rec-number><foreign-keys><keyapp="EN"db-id="d900x2p98vraf3eddx4xp008rtxz95r0tdwf">17</key></foreign-keys><ref-typename="ConferenceProceedings">10</ref-type><contributors><authors><author>He,Kaiming</author><author>Zhang,Xiangyu</author><author>Ren,Shaoqing</author><author>Sun,Jian</author></authors></contributors><titles><title>Deepresiduallearningforimagerecognition</title><secondary-title>ProceedingsoftheIEEEconferenceoncomputervisionandpatternrecognition</secondary-title></titles><pages>770-778</pages><dates><year>2016</year></dates><urls></urls></record></Cite></EndNote>[\o"He,2016#17"11]ResNet网络在2015年被提出,这一网络在同年的ILSVRC竞赛中取得了冠军的成绩ADDINEN.CITE<EndNote><Cite><Author>He</Author><Year>2016</Year><RecNum>17</RecNum><DisplayText><styleface="superscript">[11]</style></DisplayText><record><rec-number>17</rec-number><foreign-keys><keyapp="EN"db-id="d900x2p98vraf3eddx4xp008rtxz95r0tdwf">17</key></foreign-keys><ref-typename="ConferenceProceedings">10</ref-type><contributors><authors><author>He,Kaiming</author><author>Zhang,Xiangyu</author><author>Ren,Shaoqing</author><author>Sun,Jian</author></authors></contributors><titles><title>Deepresiduallearningforimagerecognition</title><secondary-title>ProceedingsoftheIEEEconferenceoncomputervisionandpatternrecognition</secondary-title></titles><pages>770-778</pages><dates><year>2016</year></dates><urls></urls></record></Cite></EndNote>[\o"He,2016#17"11]。相较于此前的神经网络,ResNet网络在网络深度和网络结构上都有了很大改进。首先ResNet网络的层数超过了100层,远高于以往的网络。在以往的深层网络中存在的退化问题会导致梯度消失或梯度爆炸的问题,导致深层网络难以被训练。同时随着网络深度的增加,网络参数也随之增加,网络的优化变得困难。因此,简单的增加网络深度不能增加网络的准确率。对于这一问题,ResNet网络中提出了残差单元这一结构,通过引入输入值解决网络退化的问题。如图2-8所示,在此前的网络中,神经元计算的是输入x到输出y的直接映射关系,即寻找y=F(x)中的函数F。在ResNet网络中由于跳接(shortcutconnection)的存在为深层网络提供了输出恒等映射的能力,即可以实现输出F(x)=x的恒等映射。通过这一恒等映射将深层网络转化为等价的浅层网络,避免了因网络层数增加导致的一系列问题,特别是深层网络的退化问题。综上所述,ResNet网络中的组成模块既可以进行卷积和线性变换操作,也可以完成恒等变化,同时拥有浅层网络不易出现梯度消失和深层网络可以准确提取输入信息特征的优点。1.1.4U-net网络图2-9卷积神经网络到全卷积神经网络的转化过程ADDINEN.CITE<EndNote><Cite><Year>2016</Year><RecNum>40</RecNum><DisplayText><styleface="superscript">[12]</style></DisplayText><record><rec-number>40</rec-number><foreign-keys><keyapp="EN"db-id="d900x2p98vraf3eddx4xp008rtxz95r0tdwf">40</key></foreign-keys><ref-typename="ConferenceProceedings">10</ref-type><contributors></contributors><titles><title>DeepResidualLearningforImageRecognition</title><secondary-title>IEEEConferenceonComputerVision&PatternRecognition</secondary-title></titles><dates><year>2016</year></dates><urls></urls></record></Cite></EndNote>[\o",2016#40"12]如图2-9所示,在卷积神经网络结构的基础上,通过将网络中的全连接层更换成卷积层形成了全卷积神经网络ADDINEN.CITE<EndNote><Cite><Year>2016</Year><RecNum>40</RecNum><DisplayText><styleface="superscript">[12]</style></DisplayText><record><rec-number>40</rec-number><foreign-keys><keyapp="EN"db-id="d900x2p98vraf3eddx4xp008rtxz95r0tdwf">40</key></foreign-keys><ref-typename="ConferenceProceedings">10</ref-type><contributors></contributors><titles><title>DeepResidualLearningforImageRecognition</title><secondary-title>IEEEConferenceonComputerVision&PatternRecognition</secondary-title></titles><dates><year>2016</year></dates><urls></urls></record></Cite></EndNote>[\o",2016#40"12]。这种网络完全由卷积层组成,不含有全连接层,因而得名全卷积神经网络。卷积神经网络处理图片后得到的是描述整张图片的特征向量,而全卷积神经网络输出的是输入图片的特征图,特征图上每个像素点代表,这是全卷积神经网络与卷积神经网络的一个重要区别。U-net网络与全卷积神经网络结构相似,仅在内部细节上有少量不同。U-net网络在医疗影像分割中表现出色,在2015年的ISBI细胞追踪类别挑战赛和龋齿检测挑战赛中获得冠军ADDINEN.CITE<EndNote><Cite><Author>Ronneberger</Author><Year>2015</Year><RecNum>24</RecNum><DisplayText><styleface="superscript">[13]</style></DisplayText><record><rec-number>24</rec-number><foreign-keys><keyapp="EN"db-id="d900x2p98vraf3eddx4xp008rtxz95r0tdwf">24</key></foreign-keys><ref-typename="ConferenceProceedings">10</ref-type><contributors><authors><author>Ronneberger,Olaf</author><author>Fischer,Philipp</author><author>Brox,Thomas</author></authors></contributors><titles><title>U-net:Convolutionalnetworksforbiomedicalimagesegmentation</title><secondary-title>InternationalConferenceonMedicalimagecomputingandcomputer-assistedintervention</secondary-title></titles><pages>234-241</pages><dates><year>2015</year></dates><publisher>Springer</publisher><urls></urls></record></Cite></EndNote>[\o"Ronneberger,2015#24"13]。医疗影像具有数据量小和图像语义明确、直接的特点。由于可用于训练的医疗影像图片获取难度较大,在这一类型的比赛中往往只提供不到100例数据,相对于其他类型的图片,医疗影响数据集的数据量较少。此外,由于医疗影像内表示的图像内容和图像结构相对固定,但图片内结构的分界线不清晰,需要兼顾低级图像特征和高级语义信息以精准区分图片中不同结构。综上所述,这类任务中使用的网络需要同时获得感受野较大时的图片的高级语义特征信息和感受野较小时图片的精确位置信息。由于图片的高级语义特征明确且相对固定,且训练使用的数据集较小,要求网络模型的层数较少,否则会出现过拟合的问题。U-net网络可以同时满足以上几个要求。U-net网络的层数通常不会超过4层,相对于深层的神经网络容易训练且特有的U型结构能够同时捕捉高级语义特征和低级图像特征。图2-10U-net网络结构ADDINEN.CITE<EndNote><Cite><Author>Ronneberger</Author><Year>2015</Year><RecNum>24</RecNum><DisplayText><styleface="superscript">[13]</style></DisplayText><record><rec-number>24</rec-number><foreign-keys><keyapp="EN"db-id="d900x2p98vraf3eddx4xp008rtxz95r0tdwf">24</key></foreign-keys><ref-typename="ConferenceProceedings">10</ref-type><contributors><authors><author>Ronneberger,Olaf</author><author>Fischer,Philipp</author><author>Brox,Thomas</author></authors></contributors><titles><title>U-net:Convolutionalnetworksforbiomedicalimagesegmentation</title><secondary-title>InternationalConferenceonMedicalimagecomputingandcomputer-assistedintervention</secondary-title></titles><pages>234-241</pages><dates><year>2015</year></dates><publisher>Springer</publisher><urls></urls></record></Cite></EndNote>[\o"Ronneberger,2015#24"13]U-net网络的结构如图2-10所示,网络中使用了经典的Encoder-Decoder结构ADDINEN.CITE<EndNote><Cite><Author>Ronneberger</Author><Year>2015</Year><RecNum>24</RecNum><DisplayText><styleface="superscript">[13]</style></DisplayText><record><rec-number>24</rec-number><foreign-keys><keyapp="EN"db-id="d900x2p98vraf3eddx4xp008rtxz95r0tdwf">24</key></foreign-keys><ref-typename="ConferenceProceedings">10</ref-type><contributors><authors><author>Ronneberger,Olaf</author><author>Fischer,Philipp</author><author>Brox,Thomas</author></authors></contributors><titles><title>U-net:Convolutionalnetworksforbiomedicalimagesegmentation</title><secondary-title>InternationalConferenceonMedicalimagecomputingandcomputer-assistedintervention</secondary-title></titles><pages>234-241</pages><dates><year>2015</year></dates><publisher>Springer</publisher><urls></urls></record></Cite></EndNote>[\o"Ronneberger,2015#24"13],这一结构在2006年由Hinton提出,用于压缩图片和去噪声。通过将输入的图片进行若干轮次的下采样操作,U-net网络将图像特征提取到编码器输出中,再通过解码器将编码还原为图片。在编码部分中,通过下采样获取图片的高层特征同时减少图片扰动的影响,在这一过程中感受野不断增大,从而获取图片的高级语义信息。在解码部分中,解码器不断进行上采样操作将编码器输出恢复为图片。U-net网络中使用反卷积完成上采样过程,但反卷积过程中存在信息损失,如果仅使用反卷积方法不能将全部需要的图片特征保留。因此,U-net网络中使用跳层链接(SkipConnection)将编码器输出信息直接和解码器中信息进行拼接操作,通过这一链接补充解码器中信息以减少解码器上采样过程中的信息损失,大幅度提高了分割的准确率。综上所述,U-net网络在自然图像处理任务上有很好的表现,特别是语义明确且结构固定的图片。1.3循环神经网络图2-11循环神经网络结构循环神经网络是区别于卷积神经网络的另一类人工神经网络,常使用于自然语言处理、语音识别和图像描述等研究方向上ADDINEN.CITE<EndNote><Cite><Author>Zaremba</Author><Year>2014</Year><RecNum>43</RecNum><DisplayText><styleface="superscript">[14]</style></DisplayText><record><rec-number>43</rec-number><foreign-keys><keyapp="EN"db-id="d900x2p98vraf3eddx4xp008rtxz95r0tdwf">43</key></foreign-keys><ref-typename="JournalArticle">17</ref-type><contributors><authors><author>Zaremba,W.</author><author>Sutskever,I.</author><author>Vinyals,O.</author></authors></contributors><titles><title>RecurrentNeuralNetworkRegularization</title><secondary-title>EprintArxiv</secondary-title></titles><periodical><full-title>EprintArxiv</full-title></periodical><dates><year>2014</year></dates><urls></urls></record></Cite></EndNote>[\o"Zaremba,2014#43"14]。在输入网络的数据中存在某种序列时,卷积神经网络难以有效地利用这一特性,而循环神经网络由于。这一网络的结构如图2-11所示,网络和卷积神经网络最大区别在于每次会将神经网络的输出结果输入到下一时刻的输出中,即循环神经网络中神经元接受的输入信息由当前时刻输入和上一时刻输出共同决定。以使用循环神经网络进行文本翻译为例子,待翻译的句子被逐个分割成单词输入循环神经网络,每个神经元的输出由这一时刻输入的单词以及此前输入的所有单词共同决定。但在普通的循环神经网络中,最后输入的单词影响较大,即普通卷积神经网络存在短期记忆这一问题。在文本翻译这一场景下,长文本的翻译由于网络的短期记忆现象会出现问题。此外,随着时间序列的不断输入,网络中会出现梯度消失的问题。综上所述,循环神经网络在处理含时间序列的信息时有较好的表现,但由于存在梯度消失和短期记忆效应的问题,网络仍需要进一步改进。1.3.1长短期记忆网络长短期记忆网络(LongShort-TermMemorynetworks,LSTM)是在循环神经网络基础上改进后的神经网络ADDINEN.CITE<EndNote><Cite><Author>Sundermeyer</Author><Year>2012</Year><RecNum>42</RecNum><DisplayText><styleface="superscript">[15]</style></DisplayText><record><rec-number>42</rec-number><foreign-keys><keyapp="EN"db-id="d900x2p98vraf3eddx4xp008rtxz95r0tdwf">42</key></foreign-keys><ref-typename="ConferenceProceedings">10</ref-type><contributors><authors><author>Sundermeyer,M.</author><author>RSchlüter</author><author>Ney,H.</author></authors></contributors><titles><title>LSTMNeuralNetworksforLanguageModeling</title><secondary-title>Interspeech</secondary-title></titles><dates><year>2012</year></dates><urls></urls></record></Cite></EndNote>[\o"Sundermeyer,2012#42"15],网络结构如图2-12所示。网络通过特有的门机制选择性地保留网络中的信息,而不是直接根据输入信息的时间决定其对输出的影响程度。在长短期记忆网络中通过细胞状态记录细胞内信息,不同的细胞状态可以选择性的保留或遗忘信息,通过这一机制实现保留长期信息的功能。这种设计保留了循环神经网络能够处理含时间序列信息的优点,又规避了循环神经网络中容易出现的梯度消失和短期记忆效应问题。图2-12长短期记忆网络细胞结构在长短期记忆网络内部存在三种门,分别成为遗忘门、输入门和输出门。这三个门协同合作完成对长短期记忆网络中细胞状态Ct的控制过程。图2-12中,左侧黄色矩形代表网络中的遗忘门。这一门单元拼接上一时刻隐藏层输出和当前时刻网络输入信息输入到遗忘门中,经过Sigmoid函数激活后获得ft,这一变量通过点乘操作控制网络细胞信息的传递过程。计算过程如公式(2-1)所示。f图2-12的中间部分是记忆门。这一门单元同样拼接使用上一时刻隐藏层输出和当前时刻网络输出作为输入,分别通过tanh激活函数和Sigmoid激活函数计算等待更新的细胞状态Ct和记忆门输入it,其中itiC经过选择性的记忆和遗忘后,网络从候选的细胞状态信息Ct中根据it选择更新到细胞状态Ct的部分,并与从旧的细胞状态Ct-1C至此网络已经获取到了经过更新后的细胞状态,为了获取网络输出还需要将新的细胞状态通过输出门。图2-12的右侧部分是输出门,这一门单元通过Sigmoid激活的oi向量控制输出细胞状态不同部分的信息,oi的计算过程如公式(2-5)所示。o得到oi后,将这一向量与经过tanh层处理的细胞状态Ct进行点乘得到网络在这一时刻的输出ht,如公式(2-6)所示。h至此,长短期记忆网络的一次细胞状态更新和预测输出过程完成,通过连续的细胞状态更新和输出隐藏层信息,长短期记忆网络实现了网络的长期记忆效应和预测功能。此外,组合使用注意力机制与长短期记忆网络能够得到更好的效果ADDINEN.CITE<EndNote><Cite><Author>Bengio</Author><Year>2015</Year><RecNum>44</RecNum><DisplayText><styleface="superscript">[16]</style></DisplayText><record><rec-number>44</rec-number><foreign-keys><keyapp="EN"db-id="d900x2p98vraf3eddx4xp008rtxz95r0tdwf">44</key></foreign-keys><ref-typename="JournalArticle">17</ref-type><contributors><authors><author>Bengio,Y.</author><author>Simard,P.</author><author>Frasconi,P.</author></authors></contributors><titles><title>show,attendandtell</title></titles><dates><year>2015</year></dates><urls></urls></record></Cite></EndNote>[\o"Bengio,2015#44"16],这种注意力机制模仿了生物观察行为的内部过程。例如:一个人在观察图片的时候总会将更多注意力信息放在注意力焦点上,在这一过程中焦点区域获得了更多的关注资源,也变相抑制了图片中其他无用信息的接收。注意力机制通过输出权重信息控制网络输出实现这一过程,例如将Encoder-Decoder结构中编码器的输出加权后形成带有权重信息的编码器输出,并输入到解码器中进行预测操作ADDINEN.CITE<EndNote><Cite><Author>Bahdanau</Author><Year>2014</Year><RecNum>45</RecNum><DisplayText><styleface="superscript">[17]</style><

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论