版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
深度学习模型与算法5自强不息厚德载物TsinghuaUniversityofChinaContents.目录5.1深度学习概述5.1.1深度学习的定义与基本特征5.1.2深度学习的发展历程5.1.3深度学习与传统机器学习的区别5.2神经网络基础5.2.1神经网络概述5.2.2反向传播算法5.1深度学习模型与算法本章学习目标理解深度学习的基本概念、核心特征及其与传统机器学习的区别;掌握神经网络的构成原理;能够根据不同场景选择合适的深度学习模型,具备实现简单神经网络的能力,能够解读和评估深度学习模型的实验结果。随着数据规模的指数级增长和问题复杂度的日益提升,传统的机器学习方法在处理高维、非线性及大规模数据时逐渐暴露出性能瓶颈和泛化能力不足等问题。深度学习作为人工智能领域中最具革命性的技术之一,因其卓越的特征表示能力和端到端建模优势,正在成为解决复杂智能任务的核心方法。5.1深度学习概述深度学习的定义与基本特征定义深度学习(deeplearning)是机器学习的一个分支,其核心是通过构建多层次的神经网络模型,模拟人脑处理信息的机制,从数据中自动学习特征表示并进行预测或决策。作为人工智能领域最具突破性的技术之一,深度学习通过构建具有多个隐藏层的深度神经网络,自动从海量数据中学习多层次的抽象特征表示。基本特征深度架构深度学习模型最显著的特征在于其深度架构,包含少则几层、多则成百上千层的网络结构。每一层都对前一层的输出进行处理,提取更抽象的特征。自动特征学习深度学习能够自动从原始数据中提取特征,这种自动特征学习能力,不仅节省了大量的人力和时间成本,还能够发现一些人类难以察觉的潜在特征,提升模型的性能。数据驱动深度学习模型的强大性能依赖于海量的数据支撑。在训练过程中,模型通过对大量数据的学习,不断调整网络参数,优化特征提取和决策过程。端到端学习深度学习支持端到端的学习模式,即直接从原始输入数据到最终输出结果,无须在中间过程进行过多的人工干预和处理。5.1深度学习概述深度学习的发展历程1.深度学习的萌芽期(20世纪40年代—20世纪80年代)深度学习的思想最早可追溯到20世纪40年代。1943年,沃伦.麦卡洛克(WarrenMcCulloch)和沃尔特.皮茨(WalterPitts)提出了M-P神经元模型,这是首个模拟生物神经元的数学模型,为神经网络的发展奠定了理论基础。2.深度学习的蛰伏期(20世纪90年代—21世纪初)尽管反向传播算法推动了神经网络的发展,但由于当时计算能力有限、数据量不足,以及难以解决梯度消失等问题,神经网络的发展再次陷入瓶颈。3.深度学习的爆发期(2006年至今)2006年,杰弗里·辛顿在《科学》杂志上发表论文,提出了深度学习的概念,并提出了一种新的训练深度神经网络的方法———预训练+微调。该方法通过无监督预训练学习数据的初始特征表示,再使用有监督学习对网络进行微调,有效解决了深层网络训练困难的问题,标志着深度学习时代的正式开启。5.1深度学习概述深度学习与传统机器学习的区别1.数据依赖程度机器学习算法在数据量有限的情况下,也能凭借先验知识和人工设计的特征实现较好的效果。深度学习则高度依赖海量数据,其通过对大规模数据的学习,不断调整神经网络参数,挖掘数据中的潜在模式。2.特征工程方式机器学习的核心环节之一是特征工程。需要领域专家和数据科学家手动设计、提取和选择特征,将原始数据转换为适合模型处理的形式。深度学习则具备自动特征学习能力,无须人工设计复杂的特征提取规则,极大地降低了人力成本和对领域知识的依赖。3.模型结构与复杂度机器学习模型结构相对简单且固定,传统模型通常具有明确的数学表达形式与可控的参数量。深度学习模型则以深度神经网络为基础,包含多个隐藏层,结构复杂且参数众多。5.1深度学习概述深度学习与传统机器学习的区别4.学习方式与训练过程机器学习算法通常采用确定性的学习方式,一旦模型训练完成,其决策过程和输出结果是固定的。深度学习模型的训练则是一个动态优化的过程,通常采用随机梯度下降及其变体算法,在训练过程中不断调整参数以最小化损失函数。由于模型参数众多、数据量大,训练过程往往需要强大的计算资源。5.模型可解释性机器学习模型透明性是其突出优势。决策树可通过可视化规则路径解释分类逻辑;线性回归系数可直接反映特征重要性。深度神经网络的黑箱特性引发广泛争议。尽管部分技术可以可视化卷积神经网络的注意力区域,但模型内部特征交互机制仍不明确。5.2神经网络基础神经网络概述1.生物神经元
生物神经元是构成人类神经系统的基本单元,每个神经元由树突、细胞体和轴突三部分组成。树突是神经元的“输入端”,像树枝一样分叉繁多,如同信息接收器,可接收来自其他神经元的信号。细胞体是神经元的“中央处理器”,整合所有树突接收的信号。如果信号总和超过某个“激活阈值”,细胞体就会产生电脉冲(神经冲动)。轴突是神经元的“输出端”,像一根细长的电线,将细胞体处理后的电信号传递给其他神经元。突触是神经元之间的“连接开关”,轴突末端与其他神经元的树突通过突触相连。神经元之间的信息传递遵循“全或无”原则,即只有当输入信号总和超过阈值时,神经元才会产生输出。此外,神经元的兴奋和抑制状态共同作用,形成了复杂的神经网络动态平衡。5.2神经网络基础神经网络概述2.人工神经元与感知机感知机模型的工作过程可分为三步:将所有输入信号与对应权重相乘并求和;将求和所得结果加上偏置通过激活函数;根据激活函数的输出决定神经元是否
产生输出信号。即将所有输入信号x1,x2,…,xn
与对应权重w1,w2,…,wn相乘并求和,再加上偏置b,得到的结果:z=w1x1+w2x2+…+wnxn+b,接着将z经过激活函数ϕ(·),如果大于0,则输出1,小于0,则输出-1。以预测房价为例,输入数据可能包括房屋面积、房间数量等特征。在计算z时,面积和房间数量乘以各自的权重后相加,再加上偏置,这个总和反映了这些特征综合起来对房价的影响程度。如果没有偏置,模型的输出将始终围绕零波动,难以拟合复杂的实际数据。得到总和z后,需要通过激活函数来决定神经元是否产生输出。5.2神经网络基础2.人工神经元与感知机
激活函数
(activationfunction)是人工神经元中的核心组成部分,其主要作用是决定神经元在接收到输入后是否被激活。具体而言,激活函数通过对输入信号(通常是加权求和后的结果)施加非线性变换,使神经网络具备了拟合复杂函数和表达非线性关系的能力。正是由于激活函数引入了非线性因素,神经网络才能突破传统线性模型的限制,从而处理更加复杂和多样的决策边界,实现对高度复杂映射关系的建模。下面是几种常见的激活函数:
5.2神经网络基础2.人工神经元与感知机
激活函数ReLU是近年来深度学习中非常流行的激活函数。其数学形式非常简单,当输入大于0时,ReLU输出输入本身;当输入小于0时,ReLU输出0。5.2神经网络基础2.人工神经元与感知机三种激活函数图像如图所示,横坐标为x,纵坐标为激活函数值,Sigmoid[常用σ(x)表示]的取值范围为[0,1],Sigmoid图像关于x=0中心对称;ReLU在x>0时为x本身;Tanh与Sigmoid类似,但取值范围为[-1,1],显然Tanh的梯度更加明显。Sigmoid表示适合二分类问题,但存在梯度消失等问题,计算成本较高;ReLU大多用于隐藏层中,计算高效且能够缓解梯度消失问题,但可能导致神经元“死亡”;Tanh梯度比Sigmoid更强,但仍难以缓解梯度消失问题。5.2神经网络基础3.多层感知机为了突破单层感知机的局限,科学家们提出了一个关键构想:在输入层和输出层之间引入隐藏层,让模型具备学习多层次特征的能力。
这一构想便是多层感知机(MLP),MLP的出现极大提升了神经网络的表达能力,隐藏层如同信息的加工厂,每一层都对前一层的数据进行非线性变换,逐步从原始输入中提取更抽象、更高级的特征。图中展示了一种简单的MLP模型,该模型由三个主要部分组成:输入层、隐藏层和输出层,各层之间通过全连接方式相互连接,形成一个前馈神经网络。输入层负责接收原始数据隐藏层负责提取潜藏特征输出层输出分类结果或者回归结果简单的MLP模型5.2神经网络基础反向传播算法——计算图反向传播算法的完整实现依赖于计算图、链式法则和梯度下降三者的有机结合。计算图为反向传播提供了结构化的数学表达;链式法则通过逐层分解复合函数导数,使得损失函数对任意参数的梯度都能通过局部梯度的连乘高效计算;梯度下降算法利用反向传播计算得到的梯度信息,以迭代方式更新网络参数,完成模型优化。计算图计算图是一种用于表示数学表达式和运算过程的有向图结构,它将复杂的函数计算过程拆解为一系列基本操作,帮助我们更加直观和系统地理解变量之间的依赖关系。计算图的原理基于一个关键思想:将复杂函数拆解为一系列简单的局部运算单元。每一个单元既承担前向计算的任务,也在反向传播中接收并传递梯度。5.2神经网络基础反向传播算法——链式法则计算图的优势在于它不仅提供了函数结构的“静态视图”,还允许我们在图中灵活地插入、修改、合并节点,从而实现复杂模型的可组合性和可扩展性。在深度学习中,模型的训练本质上就是不断通过梯度信息来更新参数,以减小损失函数的值。而当模型结构复杂、包含多个函数嵌套时,如何高效而准确地计算每个参数对损失函数的影响呢?这个答案便是链式法则。链式法则是微积分中的一个基本定理,它描述了复合函数的导数如何分解为内部函数导数的乘积。从本质上说,链式法则是信息传播的桥梁,它将“局部变化”变成“全局影响”。每一层只需知道自己对输出的导数以及从上层传来的梯度,就可以完成对自身参数的梯度计算。这种局部计算的方式使得反向传播算法非常高效,并能适应任意深度和复杂度的神经网络。在现代深度学习框架中,链式法则以系统化的方式在计算图上自动应用,使得程序只需定义前向计算过程,框架就能自动生成梯度计算过程。这种机制极大地简化了模型的设计与优化流程。5.2神经网络基础反向传播算法——梯度下降梯度下降主要目标是通过不断地调整模型参数,使得目标函数(通常为损失函数)达到最小值,从而提升模型的预测能力和泛化性能。
直观地讲,梯度描述了函数值增长最快的方向,而梯度的负方向则代表函数值下降最快的路径,因此梯度下降算法通过沿负梯度方向进行搜索,从而实现函数值的最小化。在数学表达上,给定一个可微的目标函数J(θ),其中θ表示模型参数,则梯度下降的标准更新规则为
5.2神经网络基础反向传播
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 芯片安全试题及答案
- 黑龙江大庆中学2025-2026学年高二下学期7月期末考试地理试卷
- 商洽销售部能否延长华东地区代理期限的函4篇
- 感恩之心存,奉献之情扬小学主题班会课件
- 文化的桥梁-外语学习与跨文化交流-小学主题班会课件
- 媒体编辑团队内容产出与质量提升绩效考评表
- 关于项目进度更新及关键节点确认的回复函8篇
- 社区停电期间电力抢修预案
- 银行风险管理部门风险管理师风险控制绩效考核表
- 运动俱乐部教练员团队建设KPI考核表
- GB/T 6974.3-2024起重机术语第3部分:塔式起重机
- 布朗运动公式
- 仁爱版英语七年级单词总表(上下册)
- 采矿工程毕业设计(论文)-灵新煤矿十四煤层年产300万吨地下开采初步设计
- 《特种作业实际操作考评手册》(高压电工作业分册)
- 供热管网项目安全文明施工保证措施
- QBT 2602-2003 影剧院公共座椅
- GB/T 11091-2024电缆用铜带箔材
- (正式版)SHT 3046-2024 石油化工立式圆筒形钢制焊接储罐设计规范
- 水库安全生产责任书 水库安全责任协议书(3篇)
- 外伤性白内障疾病查房
评论
0/150
提交评论