《人工智能通识与进阶》 第五章-由神经网络到深度学习_第1页
《人工智能通识与进阶》 第五章-由神经网络到深度学习_第2页
《人工智能通识与进阶》 第五章-由神经网络到深度学习_第3页
《人工智能通识与进阶》 第五章-由神经网络到深度学习_第4页
《人工智能通识与进阶》 第五章-由神经网络到深度学习_第5页
已阅读5页,还剩39页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第五章由神经网络到深度学习(第一讲)1如何识别一只猫?2问题与导读:为什么视觉对智能至关重要深度学习模型能够像图中所示,从原始数据中逐层提取特征,最终完成识别、分类与生成任务。•手机相册:自动识别人脸、场景与主题

•语音助手:实时识别语音并理解指令

•推荐系统:根据行为数据预测用户偏好

•AIGC:生成图像、文本与代码等内容图示流程:原始图像→卷积提取特征→池化压缩信息→全连接层判断→输出分类结果3问题与导读:为什么视觉对智能至关重要本章将围绕三个核心问题展开1.深度学习与传统机器学习到底有什么不同?2.为什么“深度”如此重要,神经网络如何学会识别模式?3.这项技术正在如何改变我们的生活,又会把我们带向哪里?不同在哪里为什么有效走向何处差异:从手工特征到端到端学习原理:多层网络如何逐层抽象表示影响:如何走向大模型与产业应用学习主线从“是什么”到“为什么”,再到“能做什么”。4问题与导读:为什么视觉对智能至关重要5.1深度学习vs机器学习5.2历史与发展脉络5.3神经网络基础5.4深度学习思想5.5卷积神经网络5.6循环神经网络5.7数据增广与实践5.8小结与延伸阅读5本章目录5.1深度学习vs机器学习5.2历史与发展脉络5.3神经网络基础5.4深度学习思想5.5卷积神经网络5.6循环神经网络5.7数据增广与实践5.8小结与延伸阅读6本章目录5.1深度学习与传统机器学习:联系与演进传统机器学习vs深度学习人工提取特征自动学习特征适合小规模数据依赖大规模数据模型结构较简单神经网络层数多、结构复杂计算资源需求较低通常需要GPU加速更容易解释可解释性较弱适合结构化数据擅长图像、语音、文本等复杂数据7深度学习特点应用版图典型应用场景85.1深度学习与传统机器学习:联系与演进深度学习应用5.1深度学习vs机器学习5.2历史与发展脉络5.3神经网络基础5.4深度学习思想5.5卷积神经网络5.6循环神经网络5.7数据增广与实践5.8小结与延伸阅读9本章目录5.2深度学习的历史与发展脉络发展脉络从MP模型到ChatGPT的关键里程碑1943MP模型→1958感知机→1986BP算法→2006深度学习复兴→2012AlexNet→2017Transformer→2023ChatGPT10深度学习发展XOR与寒冬关键转折点•单层感知机只能学习线性可分问题•XOR问题暴露了浅层模型的局限•反向传播与多层网络重新激活神经网络研究•深度学习的复兴,本质上是“可训练深层网络”的出现115.2深度学习的历史与发展脉络XOR问题5.1深度学习vs机器学习5.2历史与发展脉络5.3神经网络基础5.4深度学习思想5.5卷积神经网络5.6循环神经网络5.7数据增广与实践5.8小结与延伸阅读12本章目录5.3神经网络基础人工神经元人脑神经元传递信号方式神经元之间的信息传递神经元通过“接收—处理—传递”的方式完成信息交流。一个神经元接收到刺激后,会产生神经冲动,并沿轴突传递到突触终端;随后释放神经递质,将信号传递给下一个神经元。这一过程为人工神经网络的设计提供了重要启发。13神经网络原理从单层到多层感知机示意人工神经元如何完成分类判断?人工神经元会接收多个输入特征,例如图像中的耳朵、眼睛、鼻子、毛发等特征。每个特征都会乘以对应的权重,表示它对最终判断的重要程度。所有加权结果相加后,再经过激活函数,最终输出分类结果。145.3神经网络基础感知机155.3神经网络基础多层感知机算例

多层感知机计算步骤一:隐藏层线性变换与ReLU激活z¹=W¹x+b¹h=ReLU(z¹)计算逻辑•每个隐藏神经元都接收完整输入x。•先做加权求和,再加偏置。•由于三个z值都大于0,ReLU不改变数值。z₁¹=0.1×0.2+0.2×0.8+0.10.28z₂¹=0.3×0.2+0.4×0.8+0.20.58z₃¹=0.5×0.2+0.6×0.8+0.30.88z¹=[0.28,0.58,0.88]ᵀh=ReLU(z¹)=[0.28,0.58,0.88]ᵀ隐藏层的作用:把原始输入x转换成新的特征表示h,为下一层继续计算提供输入。165.3神经网络基础多层感知机计算步骤二:输出层线性输出把隐藏层输出h作为新输入,继续进行一次加权求和。h₁=0.28h₂=0.58h₃=0.88yW²=[0.7,0.8,0.9]+b²=0.4y=W²h+b²=0.7×0.28+0.8×0.58+0.9×0.88+0.4=1.852最终结果h=[0.28,0.58,0.88]ᵀy=1.852175.3神经网络基础多层感知机计算常见激活函数及其导数激活函数是神经网络中的关键组成部分,它能够为模型引入非线性表达能力,使神经网络可以学习更加复杂的数据特征。图中展示了三种常见激活函数:Sigmoid、Tanh和ReLU,以及它们对应的导数变化情况。185.3神经网络基础激活函数5.1深度学习vs机器学习5.2历史与发展脉络5.3神经网络基础5.4深度学习思想5.5卷积神经网络5.6循环神经网络5.7数据增广与实践5.8小结与延伸阅读19本章目录5.4深度学习的基本思想基本思想人工智能、机器学习、神经网络与深度学习的层级关系深度学习的核心:层级化特征学习20深度学习思想深度学习属于人工智能体系中的重要分支,它以多层神经网络为基础,能够从数据中自动学习特征。以图像识别为例,网络会先学习边缘、颜色等低级特征,再组合成局部结构,最后形成能够用于分类的高级语义特征。人工智能是最广泛的概念,目标是让机器具备智能行为。机器学习是实现人工智能的重要方法,神经网络是机器学习中的一类模型,而深度学习则是以多层神经网络为核心的学习方法。对比维度传统浅层机器学习深度学习模型假设空间相对较小,可控规模巨大、表达能力强,通常为非凸模型空间优化目标以结构风险最小化为主要目标(显式包含正则项)通常直接最小化经验风险(训练损失),并结合显式或隐式正则化提升泛化能力风险控制重点依赖显式正则化和特征工程来平衡偏差-方差依赖优化算法动态和架构先验等隐式正则化来保证泛化理论可解释性凸优化问题,理论完备非凸优化,理论仍处于发展中,更多依赖经验与实验深度学习与传统浅层机器学习在学习准则上的差异215.4深度学习的基本思想深度学习特点优化算法:反向传播与参数更新反向传播的核心是:先从输出层计算误差,再将误差逐层向前传递,利用链式法则求出每一层参数对损失函数的影响,最后沿着梯度下降方向更新权重和偏置。输入信息:损失函数、学习率、网络层数以及前向传播中保存的中间结果输出层误差:从预测结果与真实标签的差距开始计算误差项隐藏层误差:通过后一层误差反向递推,得到各隐藏层的误差信息梯度计算:根据“误差项×输入”计算权重和偏置的梯度参数更新:按照梯度下降规则调整参数,使损失逐步减小225.4深度学习的基本思想反向传播算法给出初始网络如图所示,完成一次样本的前向传播,计算损失,并用反向传播求出各参数的梯度,再按梯度下降法更新参数。误差反向传播算例已知条件输入x=[1,1]ᵀ标签y=[0,0]ᵀ学习率η=0.1激活函数:Sigmoid初始化参数w₁=1,w₂=-1w₃=-1,w₄=1w₅=1,w₆=-1w₇=-1,w₈=1偏置b¹=b²=0235.4深度学习的基本思想反向传播计算步骤一:前向传播,得到隐藏层与输出层结果先计算每层的加权和z,再通过Sigmoid得到激活输出。隐藏层z₁¹=1×1+(−1)×1+0=0h₁=σ(0)=0.5z₂¹=(−1)×1+1×1+0=0h₂=σ(0)=0.5输出层z₁²=1×0.5+(−1)×0.5=0→o₁=0.5z₂²=(−1)×0.5+1×0.5=0→o₂=0.5245.4深度学习的基本思想反向传播计算步骤二:计算损失,衡量预测与标签的差距预测结果为o=[0.5,0.5]ᵀ,真实标签为y=[0,0]ᵀ。预测值o₁=0.5o₂=0.5真实标签y₁=0y₂=0损失函数L=1/2Σ(oₖ−yₖ)²L=1/2[(0.5−0)²+(0.5−0)²]=0.25损失越大,说明模型预测与真实标签差距越大;反向传播接下来要计算“每个参数该承担多少责任”。255.4深度学习的基本思想反向传播计算步骤三:输出层反传,求误差项δ²输出层误差项表示:损失L对输出层加权和z²的敏感程度。输出层误差项δₖ²=(oₖ−yₖ)·σ′(zₖ²)σ′(0)=0.5×(1−0.5)=0.25δ₁²=δ₂²=0.5×0.25=0.125输出层梯度∂L/∂w=δ²×h每条输出层权重梯度=0.125×0.5=0.0625265.4深度学习的基本思想反向传播计算步骤四:隐藏层反传,求误差项δ¹隐藏层误差项由后一层误差加权得到,再乘以当前层激活函数导数。隐藏层误差项δⱼ¹=σ′(zⱼ¹)·Σₖwⱼₖδₖ²σ′(0)=0.25δ₁¹=0.25×(1×0.125+(−1)×0.125)=0δ₂¹=0.25×((−1)×0.125+1×0.125)=0由于两条路径的误差信号互相抵消,输入层到隐藏层的梯度均为0。275.4深度学习的基本思想反向传播计算学习率η=0.1;输出层权重梯度为0.0625,偏置梯度为0.125。更新规则:w←w−η·∂L/∂w,b←b−η·∂L/∂b参数更新前梯度更新后w₅10.06250.96875w₆−10.0625−1.03125w₇−10.0625−1.03125w₈10.06250.96875b₁²,b₂²00.125−0.0125本例特别注意隐藏层误差项为0,因此输入层到隐藏层的权重w₁~w₄与隐藏层偏置在本次迭代中不变。完整迭代链路:前向传播→计算损失→反向传播求梯度→梯度下降更新参数。285.4深度学习的基本思想反向传播计算结构设计典型网络结构对比常见深度学习模型结构深度学习模型根据数据类型和任务需求,形成了多种典型网络结构。

图中展示了三类代表性模型:卷积神经网络、循环神经网络和Transformer,它们分别适用于图像、序列和大规模语言理解等任务。295.4深度学习的基本思想深度模型结构5.1深度学习vs机器学习5.2历史与发展脉络5.3神经网络基础5.4深度学习思想5.5卷积神经网络5.6循环神经网络5.7数据增广与实践5.8小结与延伸阅读30本章目录315.5卷积神经网络翻转卷积经典卷积-翻转卷积[定义5.1]:在计算前,需要将其中一个序列进行时间反转(翻转),然后再进行平移、相乘、求和。32深度学习中“卷积”通常采取相关操作(定义5.2):不需要任何翻转。直接对相关核进行平移、相乘、求和。5.5卷积神经网络相关定义卷积5.5卷积神经网络卷积与互相关注意:深度学习中的卷积操作-通常采取相关运算33

二维相关卷积卷积核提取图像特征卷积神经网络通过不同的卷积核对图像进行处理,从而提取出不同类型的图像特征。原始图像首先经过灰度化处理,将彩色图像转换为灰度图像,便于后续计算。随后,不同的卷积核在图像上滑动并进行卷积运算,得到不同的特征图。卷积核类型主要作用输出效果卷积核1平滑图像、降低噪声图像更加柔和,细节变化减弱卷积核2提取边缘特征突出人物轮廓和图像边界卷积核3强化局部变化突出纹理、边缘和细节信息345.5卷积神经网络卷积操作组件与流程卷积神经网络的主要组件(1)卷积层(ConvolutionalLayer)(2)非线性层(Non-linearLayer)(3)池化层(PoolingLayer)(4)全连接层(FullyConnectedLayer)Dropout示意图平均池化过程示意图355.5卷积神经网络卷积网络组件卷积神经网络用于分类任务的流程示意图工作流程原始图像输入网络后,首先经过卷积层提取局部特征,再通过池化层压缩特征信息。经过多层特征提取后,网络将高维特征转换为一维向量,并送入全连接层进行分类,最终输出不同类别的预测结果。365.5卷积神经网络卷积工作流程5.1深度学习vs机器学习5.2历史与发展脉络5.3神经网络基础5.4深度学习思想5.5卷积神经网络5.6循环神经网络5.7数据增广与实践5.8小结与延伸阅读37本章目录5.6循环神经网络为什么需要记忆循环神经网络结构示意图

38循环神经网络时间展开循环神经网络示例RNN在序列标注任务中的应用循环神经网络(RNN)不仅可以处理单个输入到单个输出的问题,还能够实现输入序列到输出序列的建模,因此非常适合用于词性标注、命名实体识别、语音识别等序列任务。

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论