版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1第6章深度学习《人工智能》6本章学习目标21,概述神经网络的发展历史2,解释神经元和前馈神经网络的计算过程3,理解损失函数、梯度下降和反向传播4,区分CNN、RNN和Transformer的结构特点5,了解GAN、VAE和扩散模型的基本思想目录CONTENTS简史6.1前馈神经网络6.2卷积神经网络6.3循环神经网络6.4Transformer6.53深度生成式模型6.66.1简史4从1943年“M-P”神经元模型的提出开始算起,神经网络的研究经历了80多年的历程,大致分为五个阶段:萌芽期、冰河期、复兴期、低谷期和崛起期。图6.1
神经网络发展简史6.1简史5五个发展阶段萌芽期(1943—1969)提出M-P神经元模型、感知机等基本模型。冰河期(1969—1983)感知机存在局限,计算能力不足,神经网络研究进入低潮。复兴期(1983—1995)反向传播算法重新受到重视,Hopfield网络、BoltzmannMachine和卷积神经网络相继出现。低谷期(1995—2006)支持向量机、概率图模型、AdaBoost等统计学习方法发展较快,神经网络研究相对减少。崛起期(2006—至今)逐层预训练、AlexNet、ResNet和Transformer推动深度学习发展,并进一步催生ChatGPT、DALL-E、Sora等生成式人工智能应用。目录CONTENTS简史6.1前馈神经网络6.2卷积神经网络6.3循环神经网络6.4Transformer6.56深度生成式模型6.66.2.1神经元7假设神经元有D个输入,表示为
,神经元所获得的输入的加权和叫作净输入(NetInput),表示为式中,
是D维的权重向量,b是偏置。净输入
经过一个非线性激活函数
后得到神经元的激活值(Activation)。图6.2
神经元的基本组成6.2.1神经元8激活函数可以有效增加网络的表示能力,一般要求激活函数是连续的非线性函数、可导且导函数的值在合适的区间且计算简单方便。以下介绍两种激活函数:Sigmoid函数是指一类S型的两端饱和的曲线函数,常用的有Logistic函数和Tanh函数:Logistic函数:将实数域压缩到(0,1),它的输出既能作为概率分布来衔接统计学习模型,也能作为软性门控制其他神经元的信息传递量。Tanh函数:Logistic函数的平移和放大版本,其值域为(-1,1)。6.2.1神经元9ReLU函数
指“RectifiedLinearUnit”,即修正的线性单元义,定义为斜坡(Ramp)函数:函数特点:只需加、乘和比较操作,计算效率较高。相比Sigmoid函数的两端饱和,ReLU在x>0时导数为1,有利于加速梯度下降的收敛。ReLU输出非负,相当于给后续网络引入偏置,可能影响梯度下降效率。若参数更新不当,某些ReLU神经元可能永远无法被激活,使其输出始终为0,即死亡ReLU问题(DyingReLUProblem)。改进函数有LeakyReLU、ParametricReLU和ExponentialLinearUnit等。6.2.2模型10给定一组神经元,可以将神经元作为节点来构建一个网络。不同的神经网络模型有着不同的网络连接的拓扑结构。前馈神经网络(FeedforwardNeuralNetwork,FNN)第0层称为输入层,最后一层为输出层,其他中间层为隐含层。整个网络没有反馈,信号从输入层向输出层单向传播,可以用一个有向无环图表示。图6.3
多层前馈神经网络结构示意图6.2.2模型11前馈神经网络(FeedforwardNeuralNetwork,FNN)令
,神经网络从输入𝑥开始,通过逐层计算得到网络输出。对于第
层,首先根据第
层神经元的激活值计算净活性值
:然后,经过一个激活函数
得到第
层神经元的激活值:通过逐层的信息传递,最终得到网络输出
,整个前馈神经网络可以看作一个复合函数其中
表示网络所有层的连接权重和偏置。图6.4
前馈神经网络的计算示意图6.2.2模型12给定一个训练样本,先利用多层前馈神经网络将
映射为,再将其映射到分类器
:其中,
为线性或非线性的分类器,
为分类器的参数,
为分类器的输出。如果分类器
为Logistic回归分类器或Softmax回归分类器,则
可以看成网络的最后一层,即神经网络直接输出不同类别的条件概率。6.2.2模型13如果采用交叉熵损失函数,则损失函数为:
式中,
为标签对应的one-hot向量表示,这里的C为对应的类别数目。给定训练集
,将每个样本
输入到前馈神经网络,得到网络的输出
,则其在D上的结构风险函数为式中,
为正则化项,目的是防止过拟合。
一般使用Frobenius范数:有了目标函数和训练样本,网络参数可以通过梯度下降法来进行学习。6.2.3训练14前馈神经网络的训练可以采用随机梯度下降法,梯度的计算采用反向传播算法来高效计算。给定一个训练样本
,经过前馈神经网络后得到输出
,相应的损失函数为考虑对第
层的参数
和
计算偏导数,首先考察损失函数关于参数矩阵
中的元素
的偏导数
。根据链式法则(ChainRule)有
6.2.3训练15
式中,
是损失函数关于第
层神经元
的偏导数,称为误差项
,
是第
层神经元的个数。
间接反应了不同神经元对网络的贡献度。由于
,可以计算得到式中,
表示第i个元素的值是
、其余为0的行向量,
为
的单位矩阵。
6.2.3训练16由于
,
,其中
为按位计算的函数,因此有根据链式法则可知,误差项
的计算方式如下:式中,
是向量的点积运算符,表示每个元素相乘。可见,第
层的误差可以通过第
层的误差项计算得到,这就是误差的反向传播。6.2.3训练17综上可知,式中,
相当于向量
和向量
的外积的第i行第j列的元素。因此,在计算出每一层的误差项之后,可以得到每一层参数的梯度。具体的步骤总结如下。(1)前馈计算每一层的净输入
和激活值
,直到最后一层。(2)反向传播计算每一层的误差项
。(3)计算每一层参数的偏导数,并更新参数。目录CONTENTS简史6.1前馈神经网络6.2卷积神经网络6.3循环神经网络6.4Transformer6.518深度生成式模型6.66.3.1模型19卷积神经网络(ConvolutionalNeuralNetwork,CNN)是指包含卷积运算、具有局部连接和权重共享等特性的前馈神经网络,一般由卷积层、汇聚层和全连接层构成。图6.5卷积神经网络的整体结构示意图6.3.1模型201.卷积层给定一个大小为
的矩阵
和一个大小为
的核矩阵(滤波器,Filter)满足
。核矩阵在输入矩阵上从左到右、从上到下按顺序滑动,在滑动的每一个位置上,核矩阵与输入矩阵的一个子矩阵重叠。求核矩阵与每个子矩阵的内积,产生一个
的输出矩阵
,称此运算为卷积或二维卷积,写成
,其中
。式中,
。6.3.1模型21假设输入矩阵
和滤波器
分别为则卷积
的计算结果为注意:这里
作用在
上,且不超出
的范围。6.3.1模型22卷积层的作用是提取局部区域的特征,不同的卷积核相当于不同的特征提取器。为了提高卷积网络的表示能力,可以在每一层使用多个不同的卷积核,从而得到多个特征映射图(FeatureMap)。假设卷积层的结构如下。(1)输入特征映射组:
为三维张量(Tensor),其中每个切片(Slice)矩阵
为一输入特征映射,
。(2)输出特征映射组:
为三维张量,其中每个切片矩阵
为一输出特征映射,
(3)卷积核:
为四维张量,其中每个切片矩阵
为一个二维卷积核,为了计算输出特征映射
,用卷积核
分别对输入特征映射
进行卷积,然后将卷积结果相加,并加上一个标量偏置
得到卷积层的净输入
,再经过非线性激活函数(如ReLU)后得到输出特征映射
。具体的形式化表示如下:
如果希望卷积层输出P个特征映射,则将上述过程重复P次。以上操作需要的参数个数为
个。
232.汇聚层汇聚层(PoolingLayer)又称子采样层(SubsamplingLayer),其作用是进行特征选择,降低特征数量,从而减少参数数量。常用的汇聚函数有:最大汇聚(MaximumPooling):选择区域内所有神经元的最大值作为该区域的表示。平均汇聚(MeanPooling):取区域内所有神经元的活性值的平均值。汇聚层不仅可以有效地减少神经元的数量,还可以使网络对一些小的局部形态改变保持不变性,并且拥有更大的感受野。6.3.1模型6.3.1模型24典型的汇聚层是将每个特征映射划分为
大小的不重叠区域,然后使用最大汇聚的方式进行下采样。汇聚层也可以看作一个特殊的卷积层,卷积核的大小为
,步长为
,卷积核为max函数或mean函数。最大汇聚的计算假设输入矩阵:核的大小为
,步长为2,则X上的最大汇聚得到的输出矩阵Y为6.3.2训练25假设第
层为卷积层,第
层的输入特征映射为
,通过卷积计算得到第
层的特征净输入
。第
层的第
个特征映射净输入:第
层中共有
个卷积核和
个偏置,
和
分别为卷积核及偏置,根据链式法则,损失函数关于参数的偏导数为可见,在卷积神经网络中,每层参数的梯度依赖其所在层的误差项
。在卷积层和汇聚层中,误差项的计算有所不同,以下分别进行介绍。261.汇聚层的误差项汇聚层采用下采样操作。反向传播时,需要将后一层的误差项进行上采样(upsampling),使其与前一层特征映射大小一致,再与相应的激活值偏导数逐元素相乘,得到前一层的误差项。第
层的第
个特征映射的误差项
的具体推导过程如下:式中,
为第
层使用的激活函数导数,up为上采样函数(upsampling),与汇聚层中使用的下采样操作刚好相反。对于不同的汇聚方式:最大汇聚:误差项直接传递到对应区域中的最大值所对应的神经元,其他神经元的误差项设为0。平均汇聚:误差项会平均分配到对应区域中的所有神经元。6.3.2训练272.卷积层的误差项当
+1层为卷积层时,假设特征映射净输入
,其中第
个特征映射净输入为式中,
和
为第
1层的卷积核及偏置。第
1层中共有
个卷积核和
个偏置。第
层的第
个特征映射的误差项
的具体推导过程如下:式中,
为宽卷积。6.3.2训练281.LeNet基于LeNet-5的手写数字识别系统在20世纪90年代被美国很多银行使用,用来识别支票上面的手写数字。这里的“Le”指的是卷积神经网络的提出者YannLeCun(2018年的图灵奖获得者之一)。6.3.3常见的网络结构图6.6LeNet-5网络结构6.3.3常见的网络结构29LeNet-5共7层,输入图像大小为32×32=1024,输出10个类别的得分。每一层结构如下。(1)C1层为卷积层,使用6个5×5的卷积核,得到6组大小为28×28=784的特征映射。因此,C1层的神经元数量为6×784=4704,可训练参数数量为6×25+6=156,连接数为156×784=122304(包括偏置在内,下同)。(2)S2层为汇聚层,采样窗口为2×2,使用平均汇聚,神经元个数为6×14×14=1176,可训练参数数量为6×(1+1)=12,连接数为6×196×(4+1)=5880。(3)C3层为卷积层。LeNet-5中用一个连接表来定义输入和输出特征映射之间的依赖关系,共使用60个5×5的卷积核,得到16组大小为10×10的特征映射。神经元数量为16×100=1600,可训练参数数量为(60×25)+16=1516,连接数为100×1516=151600。6.3.3常见的网络结构30(4)S4层为汇聚层,采样窗口为2×2,得到16个5×5大小的特征映射,可训练参数数量为16×2=32,连接数为16×25×(4+1)=2000。(5)C5层为卷积层,使用120×16=1920个5×5的卷积核,得到120组大小为1×1的特征映射。C5层的神经元数量为120,可训练参数数量为1920×25+120=48120,连接数为120×(16×25+1)=48120。(6)F6层为全连接层,有84个神经元,可训练参数数量为84×(120+1)=10164。连接数和可训练参数个数相同,为10164。(7)输出层:由10个径向基函数(RadialBasisFunction,RBF)组成。这里不再详述。312.AlexNetAlexNet是第一个现代深度卷积神经网络模型,首次使用了很多现代深度CNN的技术方法:使用GPU进行并行训练、采用了ReLU作为非线性激活函数、使用Dropout防止过拟合、使用数据增强来提高模型准确率等。6.3.3常见的网络结构图6.7AlexNet网络结构示意图6.3.3常见的网络结构32AlexNet的输入为224×224×3的图像,输出为1000个类别的条件概率,具体结构如下。(1)第一个卷积层,使用两个大小为11×11×3×48的卷积核,步长S=4,零填充P=3,得到两个大小为55×55×48的特征映射组。(2)第一个汇聚层,使用大小为3×3的最大汇聚操作,步长S=2,得到两个27×27×48的特征映射组。(3)第二个卷积层,使用两个大小为5×5×48×128的卷积核,步长S=1,零填充P=2,得到两个大小为27×27×128的特征映射组。(4)第二个汇聚层,使用大小为3×3的最大汇聚操作,步长S=2,得到两个大小为13×13×128的特征映射组。(5)第三个卷积层为两个路径的融合,使用一个大小为3×3×256×384的卷积核,步长S=1,零填充P=1,得到两个大小为13×13×192的特征映射组。6.3.3常见的网络结构33(6)第四个卷积层,使用两个大小为3×3×192×192的卷积核,步长S=1,零填充P=1,得到两个大小为13×13×192的特征映射组。(7)第五个卷积层,使用两个大小为3×3×192×128的卷积核,步长S=1,零填充P=1,得到两个大小为13×13×128的特征映射组。(8)第三个汇聚层,使用大小为3×3的最大汇聚操作,步长S=2,得到两个大小为6×6×128的特征映射组。(9)三个全连接层,神经元数量分别为4096、4096和1000。此外,AlexNet还在前两个汇聚层之后进行了局部响应归一化(LocalResponseNormalization,LRN),以增强模型的泛化能力。343.ResNet2016年,何凯明提出了残差网络(ResidualNetwork,ResNet)。ResNet通过给非线性的卷积层增加直连边(ShortcutConnection),又称残差连接(ResidualConnection)的方式,提高信息的传播效率。残差网络就是将很多残差单元串联起来构成的一个非常深的网络。假设在一个深度网络中,希望一个非线性单元
去逼近一个目标函数
,将目标函数拆分成两部分:恒等函数
和残差函数
。根据通用近似定理,原来的优化问题可以转换为让非线性单元
去近似残差函数
,并用
去逼近
。下图为一个简单的残差单元结构。残差单元由多个级联的(等宽)卷积层和一个跨层的直连边组成,再经过ReLU激活后得到输出。6.3.3常见的网络结构图6.8一个简单的残差单元结构目录CONTENTS简史6.1前馈神经网络6.2卷积神经网络6.3循环神经网络6.4Transformer6.535深度生成式模型6.66.4.1模型36假设输入的数据为
,
是一个实数向量,在不同的位置上共享同一个神经网络结构。在第
个位置(也可以叫作时刻)上,神经网络的输入层
与中间层(隐含层)
和
的关系为式中,
是权重矩阵,b是偏置。神经网络最终的输出层
和隐含层
之间的关系为式中,
是一个概率向量,满足
,
是权重矩阵,c是偏置。6.4.1模型37循环神经网络可以有两种表示形式:图6.9简单循环神经网络的两种形式:折叠形式和展开形式本质上是一个动态系统(DynamicSystem),也是计算的通用模型,可以模拟图灵机。理论证明:图灵机可计算的任何函数都可以通过有限规模的循环神经网络来计算。38RNN的参数学习采用随时间的反向传播(BPTT)算法。考虑长度为4的输入序列
,其对应的离散型输出变量序列为。设
为损失函数(常见为交叉熵损失),则总体损失函数为:
。为了计算参数,需要计算L关于
的梯度。需要注意的是,在参数的学习过程中,由于反向传播的计算中存在大量的矩阵连乘,有可能得到矩阵的一些元素的值过小或过大,造成梯度消失或梯度爆炸。为了避免该问题,可以使用长短期记忆网络或门控循环单元、深度循环神经网络。6.4.2训练39由于参数共享的特点,梯度计算比较复杂,以下给出其中一项的计算方法:6.4.2训练图6.10BPTT算法示意图,以
为例401.长短期记忆网络(LongShort-TermMemory,LSTM)6.4.3常见的循环神经网络LSTM的基本想法是记录并使用之前所有位置的状态,两个核心机制:记忆元(MemoryCell)和门控(GatedControl)。记忆元用于记录历史状态信息。门控有三个:遗忘门(ForgetGate)、输入门(InputGate)和输出门(OutputGate),用来控制状态信息的使用。门是一个向量,每一维的取值在0和1之间,与其他向量进行逐元素相乘运算,起到“软”逻辑门电路的作用。门依赖所在位置,由所在位置的输入和之前位置的状态决定。维取值是1时,门是开放的维取值是0时,门是关闭的411.长短期记忆网络6.4.3常见的循环神经网络在第t个位置上的单元是以当前位置的输入
、之前位置的记忆元
、之前位置的状态
为输入,以当前位置的状态
和当前位置的记忆元
为输出的函数,具体通过以下方程计算。式中,
是输入门,
是遗忘门,
是输出门,
是中间结果。状态
、记忆元
、输入门、遗忘门、输出门都是向量,维度相同。426.4.3常见的循环神经网络当前位置的记忆元可以展开为如右的形式:式中,
表示计算得到的第t个位置的权重。可以看出记忆元是
之前所有位置的中间结果
的线性组合,而中间结果由所在位置的输入
和之前位置的状态
决定。所以,当前位置的记忆元及状态由之前位置的状态综合决定。图6.11LSTM的网络结构图432.门控循环单元(GatedRecurrentUnit,GRU)6.4.3常见的循环神经网络GRU是对LSTM网络进行简化得到的模型,效果相当,但是计算效率更好。GRU有两个门:更新门(UpdateGate)和重置门(ResetGate),没有使用记忆元。图6.12GRU网络的架构图446.4.3常见的循环神经网络在循环神经网络的每一个位置上都有状态及重置门、更新门,三者构成一个单元。在第t个位置上的单元是以当前位置的输入
、之前位置的状态
为输入,以当前位置的状态
为输出的函数,具体的计算方式为:GRU也能很好地表示和学习长距离依赖关系。当前位置的状态
可以展开为以下形式:式中,
表示计算得到的第t个位置的权重,可见当前位置的状态由之前位置的状态综合决定。453.深度循环神经网络6.4.3常见的循环神经网络将简单RNN扩展为包含多个隐藏层的神经网络,称为深度循环神经网络。图6.13深度循环神经网络的架构图第一个隐含层的深度循环神经网络在第t个位置的定义为第L个隐含层的深度循环神经网络在第t个位置的定义为输出层为目录CONTENTS简史6.1前馈神经网络6.2卷积神经网络6.3循环神经网络6.4Transformer6.546深度生成式模型6.6476.5TransformerTransformer模型是基于多头自注意力(Multi-HeadSelf-Attention)的序列到序列模型,整个网络结构分为两部分:编码器和解码器。编码器只包含多层的多头自注意力模块,每一层都接收前一层的输出作为输入。解码器通过自回归的方式来生成目标序列。图6.14Transformer总体结构图486.5.1自注意力机制对于一个向量序列
,自注意力模型执行如下的操作:式中,
。
是输入矩阵Q和K中列向量的维度,三个投影矩阵为
,
,多头注意力机制指的是在M个投影空间中分别应用自注意力模型。496.5.1自注意力机制如图(a)所示,在编码器的每一层,利用多头自注意力计算每个位置上的单词基于输入序列的表示向量。每个位置上的表示向量与其他位置上的表示向量进行多头自注意力计算。如图(b)所示,在解码器的每一层,利用掩码的多头自注意力计算每个位置上的单词基于已生成输出序列的表示向量。每个位置上的表示向量只与之前位置上的表示向量进行多头自注意力计算。如图(c)所示,在解码器的每一层,利用多头自注意力计算在已生成输出序列每个位置上的单词基于中间表示序列的表示向量。每个位置上的表示向量与编码器的中间表示向量进行多头自注意力计算。图6.15Transformer的三种多头注意力506.5.2输入层由于自注意力忽略了序列的位置信息,因此需要在初始的输入序列中加入位置编码(PositionalEncoding)来进行修正。对于一个输入序列
,令式中,
为词
的嵌入向量表示,
为位置t的向量表示,即位置编码。
可以作为可学习的参数,也可以通过如下的形式进行预定义:式中,
表示第t个位置的编码向量的第
2i维,D表示编码向量的维度。516.5.3编码器图6.16Transformer的编码层结构图编码器单层处理步骤:获取输入序列在各个位置上的输入向量。利用多头自注意力计算每个位置上的单词基于输入序列的表示向量。通过残差连接(加法)和层归一化。利用相同的前馈神经网络对表示向量进行非线性变换。再次通过残差连接(加法)和层归一化。输出单词的表示向量到下一个编码层。每个编码层结构相同,但拥有自己的参数。526.5.4解码器图6.17解码器的结构示意图每个解码层由自注意力层、注意力层和前馈神经网络层三部分组成。输入层与自注意力层:每个位置以词嵌入和位置嵌入作为该位置的输入向量。利用多头自注意力计算基于已生成输出序列的表示向量。通过残差连接(加法)和层归一化。注意力层:利用多头注意力获取中间表示序列的信息,计算基于输入序列和中间表示序列的表示向量。在多头注意力计算中对之后位置的信息进行掩码(Masking)处理。536.5.4解码器图6.17解码器的结构示意图3.
前馈神经网络层与输出:利用相同的前馈神经网络对表示向量进行非线性变换。通过残差连接(加法)和层归一化。输出一个单词的表示向量到第二个解码层。4.
最终输出层:得到当前位置的表示向量。通过线性变换和软最大化得到下一个位置的单词出现的条件概率。目录CONTENTS简史6.1前馈神经网络6.2卷积神经网络6.3循环神经网络6.4Transformer6.554深度生成式模型6.6556.6深度生成式模型人工智能的主要任务有预测、发现、决策和生成。其中,生成主要是指生成模型,尤其是深度生成模型。深度生成式模型(DeepGenerativeModels)是概率生成模型(ProbabilisticGenerativeModels)和深度学习(DeepLearning)的结合。一般情况下属于无监督学习,因此也被称为深度无监督学习(DeepUnsupervisedLearning)。深度生成式模型的应用范围包括:生成数据、概率密度估计、异常检测、结构发现、隐空间插值、强化学习中的环境仿真、表示学习和数据压缩等。566.6深度生成式模型什么是生成式人工智能?其基本过程包括两个步骤:从数据中学习一个分布。即建立一个参数化概率模型,使在该模型下数据集出现的概率最大;从概率分布中采样/生成数据。目前,生成式人工智能已经广泛应用在图片生成、声音生成、音乐生成、文字生成、文本生成、三维生成、脸生成和视频生成等领域。576.6深度生成式模型深度生成式模型主要有两种:一种显式地描述数据生成的概率分布函数;另一种隐式地描述数据生成的概率分布函数。本章介绍几种典型的方法。图6.18常见的几种深度生成式模型示意图586.6.1流模型流模型(Flow)又称归一化流(NormalizingFlow),是一类变换函数可逆的深度生成式模型。一个随机变量
经过函数变换后得到
。当函数
可逆时,记逆函数为
,根据随机变量的变换准则,可以得到的
概率密度函数为式中,
表示函数的雅可比矩阵的行列式。流模型通过构造可逆的函数变换:,将隐变量
变换为复杂的数据变量。通常选择隐变量的分布为高斯分布或均匀分布。流模型需要满足两个基本要求:(1)是可逆函数;(2)易于计算。596.6.1流模型仿射耦合(AffineCoupling)流模型将输入的向量
划分为两部分:
和
,并定义如下的变换:式中,
是一个可逆的函数,其输出维度与
相同,因此可以得到逆变换为常见的函数
具体形式为
求和:
逐元素相乘:
仿射变换:式中,
表示逐元素相乘。1.仿射耦合模型606.6.1流模型图6.19流模型示意图,其中虚线表示逆变换(1)生成过程。设
服从高斯分布,通过叠加多个可逆神经网络模块
,中间变量为
。最终模型输出的分布近似等于输入数据的分布。令
,其概率密度函数为由于每个变换后得到的随机变量分布都是具备良好定义的概率密度函数,这种模型被叫作归一化流。
616.6.1流模型图6.19流模型示意图,其中虚线表示逆变换(2)推断过程。令
是
的逆函数,则复合函数的逆函数为:其中:
,根据复合函数的链式法则,可以得到雅可比矩阵:626.6.1流模型流模型的参数学习可以使用极大似然估计法。对于任意给定的一个数据点
,其对数似然为给定一组训练数据
,可以采用随机梯度下降法进行参数优化,需要用到反向传播算法。2.训练636.6.2自回归生成模型自回归(Auto-Regressive)生成模型是一类具有显式似然函数的生成模型。假设
,根据全概率公式,可以将
因子化为如下的连乘形式:式中,
表示下标小于t的随机变量组成的向量。变量之间的依赖关系构成了一个贝叶斯网络,每个变量都是后面变量的节点,这种结构称为自回归。图6.20自回归示意图:四个变量构成了一个贝叶斯网络646.6.2自回归生成模型以离散型随机变量为例,如果用表格描述条件概率分布
,则需要
个参数。为避免维度灾难,自回归生成模型采用参数化模型定义条件概率。考虑二值随机变量,定义式中,
是定义在
上的函数,
是函数
的参数,可以从数据中学习。该模型的参数个数为
,通常小于表格所需要的参数个数。以下是三个具体的模型示例。1.模型例1:完全可观测Sigmoid置信网络。函数
是输入变量线性组合的Sigmoid函数:
,该模型的参数总量为
。例2:多层感知机。可以使用具有一个隐含层的MLP来定义函数
:式中,
表示MLP的隐含层,矩阵
是隐含层的参数,
。模型的参数总量为
。656.6.2自回归生成模型例3:神经自回归密度估计器(NeuralAuto-regressiveDensityEstimator,NADE)NADE在条件概率间共享参数:式中,权重矩阵
和偏置向量
是共享的。
表示矩阵W的前t-1列。与MLP相比,模型的参数总量降低为
且隐含层的计算可以通过递归的形式实现:式中,
,
表示矩阵W的第t列。666.6.3生成对抗网络生成对抗网络(GenerativeAdversarialNetwork,GAN)属于隐式生成模型(ImplicitDensityModel),通过对抗训练,使生成网络产生的样本逐渐接近真实数据分布。GAN由两个相互对抗的网络组成:生成网络:生成判别网络无法区分其来源的样本;判别网络:判断一个样本是来自真实数据还是由生成网络产生。其基本结构为:图6.21生成对抗网络的总体结构图676.6.3生成对抗网络1.模型(1)判别网络(DiscriminatorNetwork)判别网络
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 某汽车制造厂员工奖惩细则
- 山东菏泽牡丹 2026 乡村振兴岗公务员招录测评试题 招聘 5 人
- 2.3 一元二次方程的根与系数的关系 教学课件 北师大版数学九年级上册
- ASTM D6161-22 中文版 超纯水系统超滤膜性能测试的标准方法
- 2024新沪教版英语九年级上单词表bd
- 在平凡岗位做出不平凡在日常工作中创造非常-工作总结
- 周年庆典话题活动策划方案(3篇)
- 仪表安装施工方案图(3篇)
- 圆形综合管网施工方案(3篇)
- 悠闲旅游音乐活动方案策划(3篇)
- 2026年重庆市中考物理试卷(含答案及解析 )
- 2026年乡村振兴背景下农村饮用水安全保障
- DB43-T 3432-2025 中医特色护理技术规范 罐法类
- 河南省焦作市某中学初一新生入学分班考试真题含答案
- 导游员普通话培训课件
- 消防维保工作规范制度
- GB/T 8731-2025易切削结构钢
- 耳源性眩晕患者康复训练方案
- 2025年军事理论知识竞赛试题库及答案(完整版)
- 2025及未来5年鸡肝项目投资价值分析报告
- 汽轮机高压主气阀课件
评论
0/150
提交评论