人工智能 第二版 课件 第六章 神经网络与深度学习_第1页
人工智能 第二版 课件 第六章 神经网络与深度学习_第2页
人工智能 第二版 课件 第六章 神经网络与深度学习_第3页
人工智能 第二版 课件 第六章 神经网络与深度学习_第4页
人工智能 第二版 课件 第六章 神经网络与深度学习_第5页
已阅读5页,还剩174页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第六章神经网络与深度学习第六章神经网络与深度学习神经网络发展历史深度学习图象识别2011语音识别什么是神经网络?人工神经元网络(ANN或者NN)6.1从数字识别谈起数字3的图像数字8的图像数字3的模式模式匹配·=

数字3、数字8与模式3的匹配·=143·=115存在的问题笔画多少带来的问题1的笔画少8的笔画多如何评判匹配的程度?使用Sigmoid函数

增加偏置项通过增加偏置项让sigmoid函数平移

netnet+b(b<0)

net

net+b(b<0)

-1414增加偏置项

图示表示

神经元神经网络模式3模式8

神经网络

数字识别神经网络

y4y6……

y5y1y3y2y8y0y9y7神经网络的横向扩展——增加模式y3y8……

神经网络的纵向扩展——局部模式相同不相同让神经网络更深——模式组合……

3的右部3的左部8的右部8的左部多层神经网络输入层输出层隐含层隐含层

……………………如何获得模式?模式通过神经元的连接权重表示通过训练样本,自动学习权重,也就是模式不是人工设计!学习到的模式是一种隐含表达,并不像我们举例的这样清晰6.2神经元与神经网络

∑b…x1x2xnw1w2wnonet

神经元

神经元的向量表示

激活函数

激活函数

激活函数

激活函数

激活函数

输入层输出层隐含层

………………

softmax全连接网络术语:全连接网络,前馈网络,多层感知机,全连接层,稠密层输入层输出层隐含层1隐含层2隐含层3猫狗兔鸟6.3神经网络是如何训练的输入层输出层隐含层1隐含层2隐含层3猫狗兔鸟小朋友如何认识小动物?建立数据集收集各种动物的照片不同姿势不同角度不同大小数据标注每张照片标注上动物的名称训练集与测试集样本这个是猫!这个是狗!如何训练?淋浴器示意图热水冷水水量水温w1w2感知调节++如何评价调节效果?

损失函数——误差平方和

……………………

如何训练?损失函数最小化问题

……………………

梯度下降法

梯度下降法

梯度下降法

梯度下降算法

符号说明o1oM……ok…………

g的后续

反向传播算法(BP:BackPropagation)又称作误差反向传播算法给出了一种计算偏导数的方法

o1oMx1…xj…xn……输入一个样本计算所有神经元的输出2,得到输出层神经元k的输出

ok…………

反向传播算法(BP)?该BP算法的条件具体条件不同,算法会有差异,总体思路一样全连接网络其他形式的网络随机梯度下降算法批量、小批量梯度下降算法激活函数:sigmoid函数其他的激活函数损失函数:误差平方和其他的损失函数交叉熵损失函数

输入层输出层隐含层

………………

softmax交叉熵损失函数

……………………

两种损失函数的作用误差平方和损失函数用于输出是具体数值的问题交叉熵损失函数用于分类问题小结建立数据集损失函数误差平方和、交叉熵梯度下降法批量梯度下降算法随机梯度下降算法小批量梯度下降算法BP算法随机梯度下降算法的一种实现6.4卷积神经网络

……………………

全连接网络的不足连接权重过多影响训练速度影响使用速度提取局部模式边缘信息2102395420234561231004428-101-101-101-501-1-2-58-13输出(匹配结果)权重(模式)输入(-1)*2+0*1+1*0+(-1)*9+0*5+1*4+(-1)*2+0*3+1*4=-52102395420234561231004428-101-101-101-501-1-2-58-13输出(匹配结果)权重(模式)输入2102395420234561231004428-101-101-101-501-1-2-58-13输出(匹配结果)权重(模式)输入2102395420234561231004428-101-101-101-501-1-2-58-13输出(匹配结果)权重(模式)输入卷积核卷积神经网络-局部连接-权值共享

训练获得全连接、卷积神经网络对比WWWW权值不同权值共享全连接局部连接全连接参数:5×5+9=234卷积核参数:3×3+1=10输入输出输入输出举例:边缘提取上边缘下边缘输入输出卷积核举例:边缘提取图象匹配结果加sigmoid卷积核的大小对于二维输入,一般是3×3、5×5、7×7…填充W步长WW步长卷积核每次移动的距离步长是可以设定的以2为例W多卷积核1*0+0*0+(-1)*0+(-1)*0+0*2+1*1+1*0+0*9+(-1)*5=-4输出(通道2)卷积核2(-1)*0+0*0+1*0+(-1)*0+0*2+1*1+(-1)*0+0*9+1*5=6卷积核1输出(通道1)多通道输入时的卷积3×3×36×6×3必须一致输出一个通道多通道卷积举例通道1通道2输出为一个通道3×3×2卷积核1×2+0×1+(-1)×0+(-1)×9+0×5+1×4+1×2+0×3+(-1)×4+(-1)×3+0×1+1×0+(-1)×2+0×4+1×4+(-1)×2+0×3+1×5=-3卷积核的大小小卷积核:细粒度特征大卷积核:大粒度特征多层小卷积实现大卷积两层3×3卷积等效一个5×5的卷积池化一种降维的手段最大池化112451567807321041123432865331102120687344853输入为一个通道最大池化窗口:2×2步长:2取窗口内的最大值窗口大小、步长都

可以设定平均池化神经网络应用举例LeNet神经网络VGG-16神经网络小结卷积神经网络局部连接权值共享卷积核通道池化应用举例LeNetVGG-166.5梯度消失问题神经网络遇到的两大问题梯度消失问题过拟合问题什么是梯度消失问题?

≤0.25解决思路使用ReLU激活函数ReLU的导数=1

Sigmoid的导数两个实例GoogLeNet残差网络(ResNet)GoogLeNet平均池化卷积层全连接层全连接层softmax平均池化卷积层全连接层全连接层softmax平均池化卷积层全连接层softmax输入高楼供水系统GoogLeNet输入Inception模块Inception模块192个通道32个卷积核参数个数:(5×5×192+1)×32=153,632降维的Inception模块

192个通道32个卷积核参数个数:(1×1×192+1)×32+(5×5×32+1)×32=31,80832个卷积核1×1卷积核?Inception模块说明:每个Inception的参数有所不同,这是其中的一个64个1*1卷积28*28*6428*28*19296个1*1卷积28*28*96128个3*3卷积28*28*12832个1*1卷积28*28*3232个5*5卷积28*28*32填充1步长1最大池化28*28*19232个1*1卷积28*28*3228*28*25664+128+32+32=2567×7平均池化步长为1,无填充5×5平均池化步长为3,无填充GoogLeNet为什么称作Inception?“我们需要更加深入!”

“Weneedtogodeeper!”残差网络(ResNet)神经网络的退化现象k层神经网络

k+1层

解决思路k层神经网络

k+1层

k+1层

残差模块F(X)

X

F’(X)=F(X)+X

恒等映射

残差模块3×3卷积步长为1填充为1通道数、通道大小必须一致残差网络(ResNet)输入:224×224×3

输出:1000

64个7×7卷积核,步长为2,填充为3。3×3最大池化,步长为2。3个残差模块64个3×3卷积核,步长为1,填充为1。128个3×3卷积核,步长为1,填充为1。256个3×3卷积核,步长为1,填充为1。512个3×3卷积核,步长为1,填充为1。虚线步长为2,长宽各减一半,通道数增加了一倍。恒等映射需要等维处理。全局平均池化小结梯度消失问题ReLU激活函数GooLeNet三个输出Inception模块同时使用不同大小的卷积核1×1卷积降维残差网络(ResNet)退化问题残差模块恒等映射学习残差6.6过拟合问题神经网络遇到的两大问题梯度消失问题过拟合问题什么是过拟合问题?xf(x)什么是过拟合问题?xf(x)过拟合欠拟合希望结果神经网络的过拟合问题减少过拟合的方法:正则化项法

正则化项的作用:降低模型复杂性

xf(x)

L2(2-范数)正则化项效果:很多参数值很小,但基本不会为0。抗干扰能力强。L1(1-范数)正则化项

减少过拟合的方法:舍弃法(Dropout)随机地临时舍弃一些神经元输出输入减少过拟合的方法:数据增强法数据越多,过拟合的风险就越小xf(x)如何获得更多的数据?数据增强通过各种变换增加数据的数量图象数据缩放、旋转、局部截取、改变颜色等《四库全书》数字化中用到的非线性数据增强方法方法小结过拟合问题解决方法利用测试集(验证集)限制模型的复杂性正则化项法舍弃法增加数据量数据增强6.7词向量神经网络如何处理文本问题?如何表示词如何表示文本独热(one-hot)编码

第i个元素独热编码举例文本:我在清华大学学习,生活在美丽的清华园中词表:{我,在,清华大学,学习,生活,美丽的,清华园,中}独热表示:“清华大学” =[0,0,1,0,0,0,0,0]“清华园” =[0,0,0,0,0,0,1,0]“美丽的” =[0,0,0,0,0,1,0,0]独热编码的特点优点编码简单缺点编码太长无法度量词之间的相似性

词的分布式表示独热编码稀疏向量分布式表示稠密向量[-0.85,2.3,1.5,-0.54,0.77,...]植物动物食物熊猫白菜猪羊词:(<动物>,<植物>,<食物>)猪:(1.0,0.1,1.0)羊:(1.0,0.2,1.0)熊猫:(1.0,0.3,0.0)白菜:(0.0,1.0,1.0)竹子:(0.0,1.0,0.1)竹子词的分布式表示独热编码稀疏向量分布式表示稠密向量[-0.85,2.3,1.5,-0.54,0.77,...]词向量词嵌入把词向量从高维空间嵌入到低维空间中的一个方法语言模型

前n-1个词语言模型p(系|清华大学计算机)大p(学院|清华大学计算机)中p(大学|清华大学计算机)小语言模型语言模型举例2元模型

“清华大学计算机系”p(清华大学计算机系)=p(大学|清华)×p(计算机|大学)×p(系|计算机)神经网络语言模型

神经网络前n-1个词

前n-1个词窗口为n

神经元个数等于词表长度Kn-1个m维向量拼接成的m(n-1)维向量H个神经元每个词对应m个输入,共n-1组全连接全连接

词向量,训练得到如何训练神经网络语言模型?样本设有句子:“清华大学计算机科学与技术系”当窗口为5时,可以得到3个训练样本:清华大学计算机科学与大学计算机科学与技术计算机科学与技术系如何训练神经网络语言模型?

如何训练神经网络语言模型?

如何训练神经网络语言模型?

如何训练神经网络语言模型?

似然函数对数似然函数如何训练神经网络语言模型?

如何训练词向量?遗留问题x1x2x3w1

w3

w2

1w1

w3

w2

x1

x2

x3

如何训练词向量词向量(词嵌入)的性质二者相等C(王后)=C(女人)+C(国王)-C(男人)语义相近词距离近NNLM存在的问题神经元个数等于词表长度K

m(n-1)个输入全连接参数多word2vec模型一种简化的神经网络语言模型两种实现方式连续词袋模型(CBOW)跳词模型(Skip-GramModel)word2vec模型(CBOW)

词向量

霍夫曼树与霍夫曼编码

对比NNLMCBOW

霍夫曼树

sigmoid

一般性描述

获得词向量BP算法求解训练计算量每次只计算与该词有关的参数越是常用词涉及的参数越少word2vec模型(跳词模型)词向量应用举例:TextCNN情感分类正面情感我很喜欢这部电影负面情感这部电影不好看卷积核宽度与词向量长度一致6个不同大小的卷积核输入1-最大池化拼接全连接+softmax输出文本卷积计算举例小结词向量独热编码分布式表示神经网络语言模型通过训练神经网络语言模型得到词向量word2vec模型简化的神经网络语言模型连续词袋模型跳词模型6.8循环神经网络(RNN:RecurrentNeural

Network)数据角度序列数据数据之间有先后联系语音、文本…网络结构角度前馈网络反馈网络表示角度句子向量、序列向量从句子理解说起句子的理解过程

我非常喜欢这部城市题材电影序列的向量表示输入循环模块循环模块全连接

循环神经网络的训练与具体任务结合例:情感分类问题输出层句子向量表示句子的词向量

全连接

循环神经网络的一般结构延迟一拍

全连接全连接举例:中文分词问题分词问题清华大学计算机系标记说明B:词首字E:词尾字M:词中字S:单字词

清华计算机系BEBMES举例:看图说话问题看图说话问题用一句话描述图像内容“草坪上有一只漂亮的小狗”“神经网络图像

训练样本:

图像—句子描述损失函数:

负对数似然函数双向循环神经网络问题的提出序列前面的内容被

后面的内容淹没双向循环神经网络正向处理反向处理拼接在一起序列到序列循环神经网络用途机器翻译文字到文字语音到语音问答系统问句到答案小结循环神经网络处理序列数据双向循环神经网络序列到序列神经网络应用举例情感分类问题分词问题看图说话问题6.9长短期记忆网络(LSTM:LongShort-TermMemory)

简单RNN存在的问题长期依赖问题beijingshiyigemeilide北京是一个美丽的(城市)北京市一个美丽的(姑娘)重点选择问题不同的任务词的重要性不同我非常喜欢看这部电影输入循环模块全连接

×+tanh××x(t)h(t)h(t)s(t)h(t-1)s(t-1)σσtanhσ“门”状态简单RNN结构LSTM结构“门”的概念门

按位乘一层神经网络被选信息选后的信息LSTM模块

状态LSTM模块遗忘门

LSTM模块输入门

LSTM模块输入处理单元

LSTM模块

状态处理LSTM模块输出门

LSTM模块输出处理单元,只是一个tanh激活函数,没有参数

LSTM模块

模块输出举例:机器翻译编码器解码器小结循环神经网络的一种特殊实现单向LSTM双向LSTM序列到序列的LSTM同简单循环神经网络一样,LSTM模块也是共用的只有一个模块,循环使用三个门遗忘门,输入门,输出门结构一样,参数不同LSTM变种GRU6.10深度学习框架网络结构越来越复杂网络层次越来越深如何方便地构建神经网络?BP算法需要每次都推导吗?深度学习框架

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论