深度学习及应用 课件 第二章 深度学习中的数学基础_第1页
深度学习及应用 课件 第二章 深度学习中的数学基础_第2页
深度学习及应用 课件 第二章 深度学习中的数学基础_第3页
深度学习及应用 课件 第二章 深度学习中的数学基础_第4页
深度学习及应用 课件 第二章 深度学习中的数学基础_第5页
已阅读5页,还剩61页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第二章:深度学习中的数学基础深度学习的核心技术是神经网络,神经网络由多个神经元和它们之间的连接组成。这些神经元和连接可以通过大量的数据和计算来训练和优化,以便在新的数据上进行准确的预测和分类。神经网络运算的数学基础是线性代数、微积分、概率论和信息论等多个领域的结合。这一章将从线性代数到信息论进行全面的介绍,揭示深度学习中的核心概念、算法原理与数学理论之间的联系,为后续章节各种深度学习网络模型提供必备的数学知识储备。需要说明的是,本章主要复习与深度学习最为相关的一些基本公式,具体的数学理论和推导参考专业参考书。引言第二章

深度学习中的数学基础2.1深度学习中的线性代数2.2深度学习中的微积分2.3深度学习中的概率论2.4深度学习中的信息论第二章

深度学习中的数学基础2.1深度学习中的线性代数2.1.1向量与矩阵2.1.2矩阵运算2.1.3仿射变换2.1.4矩阵范数2.1.5线性代数的应用2.1.1向量与矩阵在开展深度学习相关工作时,所面临的都是客观世界中的对象,例如图片、视频、语音、文本等。这些对象包含各式各样的数据:图片对应的是像素值,文本对应的是字符串,语音对应的是声波,视频则包含大量的用户行为数据。如果将深度学习网络看作一个数学函数,那么网络将权重参数存储在矩阵中,输入和输出则是向量或矩阵。线性代数通过矩阵运算来处理这些对象,让网络模型变得快速而简单。矩阵是数的阵列,如下所示:横排称为行,竖排称为列。在上例中,矩阵由3行3列构成,称为3行3列矩阵。特别地,行数和列数相同的矩阵称为方阵。2.1.1向量与矩阵此外,如下所示的矩阵、分别称为列向量、行向量,也可以简单地称为向量。进一步,将矩阵A推广到更一般的情形,如下所示:

2.1深度学习中的线性代数2.1.1向量与矩阵2.1.2矩阵运算2.1.3仿射变换2.1.4矩阵范数2.1.5线性代数的应用2.1.2矩阵运算在深度学习中,矩阵运算主要包括矩阵加减、矩阵乘积、Hadamard乘积和矩阵转置。对于两个矩阵A、B,矩阵的加减定义为相同位置元素的和、差所产生的矩阵。矩阵A、B的乘积如图2.1所示,具体过程为:将A的第i行看作行向量,B的第j列看作列向量,将它们的内积作为第i行第j列元素,由此所产生的矩阵就是矩阵A和B的乘积AB。

图2.1两个矩阵的乘积2.1.2矩阵运算2.1深度学习中的线性代数2.1.1向量与矩阵2.1.2矩阵运算2.1.3仿射变换2.1.4矩阵范数2.1.5线性代数的应用2.1.3仿射变换仿射变换是指通过一个线性变换和一个平移,将一个向量空间变换为另一个向量空间的过程。对应到深度学习网络模型中,就是神经网络通过连接权重对特征进行线性变换,并通过偏置项来进行阈值判断。令A为n×n的实数矩阵,x是n维向量空间中的点,仿射变换可以表示为其中b平移项,当b=0时,仿射变换退化为线性变换。例2.2:在2维平面中,仿射变换可表示为仿射变换除了实现网络模型线性层变换外,还经常用于图像的旋转、平移、缩放和剪切等,目的是增强图像和数据扩增,生成更多样本。2.1深度学习中的线性代数2.1.1向量与矩阵2.1.2矩阵运算2.1.3仿射变换2.1.4矩阵范数2.1.5线性代数的应用2.1.4矩阵范数范数是线性代数中一个基本且重要的概念。范数用于衡量向量或矩阵的“长度”或“大小”,并具有非负性、齐次性和三角不等式等基本性质。非正式地说,向量或矩阵的范数是表示一个向量或矩阵有多大。在深度学习中,范数的作用是多方面的。首先,在深度学习网络正则化方面,范数通过约束参数的大小来控制网络复杂度,防止过拟合,具体细节参见本书第12章。其次,在特征表示领域,范数被用来约束特征向量的尺度,通过将特征向量规范到单位范数空间,可以更好地进行相似度计算和度量学习。再次,网络模型压缩和加速技术也广泛运用范数概念,权重矩阵的谱范数不仅用于评估模型复杂度,还是模型剪枝和量化的重要依据,通过控制各层参数的范数,可以在保持性能的同时显著减小模型规模。2.1.4矩阵范数

2.1.4矩阵范数2.1深度学习中的线性代数2.1.1向量与矩阵2.1.2矩阵运算2.1.3仿射变换2.1.4矩阵范数2.1.5线性代数的应用2.1.5线性代数的应用线性代数作为处理向量、矩阵和线性变换的数学分支,为深度学习提供了处理高维数据和执行复杂算法的核心工具。作为深度学习的数学支柱,其核心思想渗透在深度学习网络模型的每个计算环节,从基础架构到优化过程都发挥着不可替代的作用。比如,在深度学习的基础架构中,所有数据都以向量或矩阵的形式存在和流动。最基本的网络全连接层本质上就是矩阵乘法运算,通过权重矩阵将输入向量线性变换到新的空间。CNN中的卷积操作可以转化为特殊的矩阵乘法,而RNN则通过矩阵的递归乘积实现时间步传播。无论是处理简单的线性回归还是复杂的神经网络架构,这种基于线性代数的表示方法为各类深度学习模型提供了统一的数学框架。2.1.5线性代数的应用在深度学习的模型训练过程中,同样深度依赖线性代数。反向传播算法的核心梯度计算涉及雅可比矩阵的链式求导,各种优化器算法通过矩阵运算更新参数。即便是Transformer架构的核心注意力机制,也不过是查询矩阵、键矩阵和值矩阵的系列乘积与归一化运算,这些计算过程都建立在线性代数基础之上。另外,在深度学习的实际应用中,线性代数同样展现出强大的适应能力。在计算机视觉领域,图像的每个像素可以表示为向量,整幅图像构成矩阵,而图像的旋转、缩放等操作本质上都是线性变换。在NLP领域,词嵌入技术通过线性变换将词汇转化为高维向量,为文本数据建立可计算的数学表示,这些应用都依赖于线性代数提供的高效计算框架。2.1深度学习中的线性代数2.2深度学习中的微积分2.3深度学习中的概率论2.4深度学习中的信息论第二章

深度学习中的数学基础2.2深度学习中的微积分2.2.1导数基础2.2.2偏导数基础2.2.3函数梯度2.2.4链式法则2.2.5微积分的应用2.2.1导数基础

在几何上,导数可以看作是函数曲线上的切线斜率,图2.2给出了一个函数导数的可视化示例。

2.2.1导数基础

对该函数求导,可以得到接下来看下导数的性质,在深度学习中,主要用到导数的线性特性和求最小值。对于线性特性,具体地:

2.2深度学习中的微积分2.2.1导数基础2.2.2偏导数基础2.2.3函数梯度2.2.4链式法则2.2.5微积分的应用2.2.2偏导数基础

2.2.2偏导数基础

2.2深度学习中的微积分2.2.1导数基础2.2.2偏导数基础2.2.3函数梯度2.2.4链式法则2.2.5微积分的应用2.2.3函数梯度

2.2深度学习中的微积分2.2.1导数基础2.2.2偏导数基础2.2.3函数梯度2.2.4链式法则2.2.5微积分的应用2.2.4链式法则

上述公式称为单变量函数的复合函数求导公式,也称为链式法则。2.2.4链式法则

由于第1个式子为Sigmoid函数,根据前面式可得

2.2.4链式法则

2.2深度学习中的微积分2.2.1导数基础2.2.2偏导数基础2.2.3函数梯度2.2.4链式法则2.2.5微积分的应用2.2.5微积分的应用微积分在深度学习中的应用贯穿于网络模型设计、训练和优化的全过程,为深度学习提供了关键的理论基础和实践方法。在网络模型训练的核心机制误差反向传播法中,微积分的链式法则发挥着决定性作用。神经网络本质上是一个巨大的复合函数:输入数据经过第一层变换得到结果,这个结果又作为第二层的输入,依此类推,直到最终输出。因此要计算损失函数关于网络权重参数的导数,就必须使用链式法则,也就是说,链式法则使得多层神经网络能够通过层层递进的梯度计算,将最终的预测误差精准地分配回网络中的每个权重参数。正是这一机制,让包含数百万甚至数十亿参数的深度神经网络得以有效训练。2.2.5微积分的应用网络模型优化同样运用到微积分的概念。比如,梯度下降法直接来源于函数的一阶导数信息,指引权重参数朝着误差减小的方向更新。网络优化器Adam作为一种自适应优化算法,根据历史梯度信息动态调整学习率,这本质上是对导数信息的累积与运用。在深度学习网络架构设计中,也会运用微积分思想。比如,残差网络解决了深层网络梯度消失问题,其设计思想源于对梯度流动的微分分析。注意力机制中的Softmax权重分配也依赖于可导运算。总的来说,微积分不仅为深度学习提供了理论基础,也直接指导了网络模型改进和网络架构创新。从基本的梯度下降到最新的网络结构设计,微积分思想贯穿始终,这些设计细节将在后面各章节中详细阐述。2.1深度学习中的线性代数2.2深度学习中的微积分2.3深度学习中的概率论2.4深度学习中的信息论第二章

深度学习中的数学基础2.3深度学习中的概率论2.3.1概率分布2.3.2多元高斯分布2.3.3贝叶斯定理2.3.4期望和方差2.3.5随机过程2.3.6概率论的应用2.3.1概率分布

2.3.1概率分布2.3.1概率分布

2.3.1概率分布2.3深度学习中的概率论2.3.1概率分布2.3.2多元高斯分布2.3.3贝叶斯定理2.3.4期望和方差2.3.5随机过程2.3.6概率论的应用2.3.2多元高斯分布

2.3.2多元高斯分布2.3深度学习中的概率论2.3.1概率分布2.3.2多元高斯分布2.3.3贝叶斯定理2.3.4期望和方差2.3.5随机过程2.3.6概率论的应用2.3.3贝叶斯定理

2.3深度学习中的概率论2.3.1概率分布2.3.2多元高斯分布2.3.3贝叶斯定理2.3.4期望和方差2.3.5随机过程2.3.6概率论的应用2.3.4期望和方差

2.3.4期望和方差

2.3深度学习中的概率论2.3.1概率分布2.3.2多元高斯分布2.3.3贝叶斯定理2.3.4期望和方差2.3.5随机过程2.3.6概率论的应用2.3.5随机过程

2.3.5随机过程离散时间的马尔可夫过程也称为马尔可夫链,如果一个马尔可夫链的条件概率:

2.3深度学习中的概率论2.3.1概率分布2.3.2多元高斯分布2.3.3贝叶斯定理2.3.4期望和方差2.3.5随机过程2.3.6概率论的应用2.3.6概率论的应用概率论为深度学习提供了处理不确定性和复杂模式的数学框架,其应用渗透在网络模型构建、训练和推理的各个环节。在深度学习中,概率论主要体现在以下方面:在深度学习中,通常需要处理多个随机变量,如图像中的像素值、文本中的单词等。处理多个随机变量的方法包括联合概率、条件概率、贝叶斯定理等。比如,联合概率常用于描述输入特征和目标变量之间的关系,而条件概率常用于网络模型的预测阶段,即根据输入特征预测目标变量的取值,贝叶斯定理则常用于网络模型的参数估计和不确定性量化,从而提高网络模型的泛化能力和鲁棒性。在深度学习生成模型领域,概率论发挥着核心作用。比如,VAE通过编码器学习数据到潜空间的概率分布映射,再通过解码器实现从潜空间到数据空间的概率生成。训练过程中使用的变分推断方法,本质上是在优化一个包含概率分布相似度衡量的下界目标,使模型能够以概率化的方式理解数据的内在结构。2.3.6概率论的应用再比如,GAN则采用了另一种基于概率分布匹配的独特范式。它通过生成器和判别器的对抗训练,实现生成数据分布与真实数据分布的逐步逼近。其中判别器充当了概率分布差异的测量仪,而生成器则不断调整自身输出以欺骗判别器。这种动态博弈过程最终使得生成数据在概率分布上与真实数据达到高度一致。另外,DiffusionModel将数据生成过程建模为一个渐进的概率演化过程。前向阶段通过逐步添加噪声将数据转化为简单分布,逆向阶段则学习逐步去噪的概率转换。这种基于马尔可夫链的概率框架,使得模型能够通过多个微小概率步骤的累积,实现复杂数据的高质量生成。概率论不仅提供了网络模型设计的理论基础,也使深度学习能够被量化,这对医疗诊断、自动驾驶等安全关键领域尤为重要。从参数初始化到不确定性估计,概率思维贯穿深度学习的全流程,使其成为处理复杂现实问题的有力工具。2.1深度学习中的线性代数2.2深度学习中的微积分2.3深度学习中的概率论2.4深度学习中的信息论第二章

深度学习中的数学基础2.4深度学习中的信息论2.4.1信息量和熵2.4.2交叉熵2.4.3信息论的应用2.4.1信息量和熵

在自信息的定义中,对数的底可以使用2或自然常数e,当底为2时,自信息的单位为bit;当底为e时,自信息的单位为nat。自信息只处理单个的输出,如果对整个概率分布中的不确定性总量进行量化,则需要熵的概念,其定义为2.4.1信息量和熵

根据它们的定义,条件熵也可以写为2.4.1信息量和熵

也可以写为

2.4深度学习中的信息论2.4.1信息量和熵2.4.2交叉熵2.4.3信息论的应用2.4.2交叉熵

2.4深度学习中的信息论2.4.1信息量和熵2.4.2交叉熵2.4.3信息论的应用2.4.3信息论的应用信息论为深度学习提供了刻画数据规律和优化模型性能的数学语言,其核心概念同样渗透在深度学习网络模型的各个关键环节。信息论在深度学习中的应用主要体现在以下几个方面:损失函数的设计植根于信息论基础。在深度学习中,常用的损失函数有交叉熵损失函数和均方误差损失函数等,其中交叉熵损失函数是用于计算预测结果与真实结果之间的差异,它可以用来衡量模型的预测准确性,因此交叉熵损失函数已经成为分类任务的标准选择。在深度学习中,信息熵最大化是一种常用的方法,它可以用于优化网络模型的训练。具体来说,可以通过最大化输入数据的熵,来增加深度网络的表示能力。这样可以使网络能够更好地捕捉输入数据的随机性和不确定性,从而提高模型的性能。2.4.3信息论的应用在NLP中,文本摘要是一种常用的方法,它用于将长文本转换为短文本。信息熵可以用于评估文本摘要的质量

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论