版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
机器学习
MachineLearning
第9讲:神经网络和深度学习-IIPart1:激活函数、CNN整流线性激活函数(RectifiedLinearUnit:ReLU新的激活函数目前深度学习中最常用的激活函数~90%常用激活函数比较激活函数收敛速度比较本例:4层网络,ReLU和Tanh激活比较,达到25%训练误差,ReLU激活快6倍[Krizhevsky]卷积网络(ConvolutionalNeuralNetwork:CNN)至少在网络的一层中使用卷积运算替代一般的线性全连接加权组合运算。CNN的特点:稀疏连接参数共享等变表示(输入平移不变性,LTI系统的基本特性)一个完整卷积神经网络的示例可以通过多个卷积核(滤波器)将一幅图像产生多个卷积层卷积网络可以连接全连接网络作为输出层Gradient-basedlearningappliedtodocumentrecognition[LeCun,Bottou,Bengio,Haffner1998]LeNet-5CNN近期重新得到极大关注的例子“AlexNet”ImageNetClassificationwithDeepConvolutional
NeuralNetworks[Krizhevsky,Sutskever,Hinton,2012]连续情况离散情况标准卷积满足可交换性神经网络中卷积核有限长,可写成卷积运算卷积运算(续)二维卷积(图像最常用)神经网络中常使用一种变体的卷积,为即将标准卷积一方的“翻转”运算取消,实际是一种互相关二维卷积运算示意图卷积运行(第一行)示例(有效卷积)说明:一个7x7输入图像,一个3x3滤波器核,进行有效卷积,输出5x5卷积层图像。一般MxM输入,KxK核,卷积输出:(M-K+1)x(M-K+1)稀疏连接示意:从下向上看CNN网络:权系数稀疏性稀疏连接示意:从上向下看随层数增加,一个输出对应的接受域增加尽管单层接受域有限,但多层具有感受域传播能力参数共享基本CNN网络,一层使用一个卷积核共用卷积核参数数目K,也是CNN一层共用的权系数数目通过一层卷积做边缘检测的例子图像产生完整卷积层的示例例:图像是由3通道(例如RGB)组成,32x32有6个5x5滤波核,则产生6个卷积通道,池化(Pooling)卷积网络一个典型层由3级组成:第一级并行地计算多个卷积层通过非线性激活函数,例如ReLU(探测级)使用池化函数池化层帮助实现输入表示的近似不变性最大池化函数(MaxPooling)-输出相邻区域最大值相邻区域均值简单抽取最大池化例子(步进为1)从激活函数输出到池化输出(池化窗为3)注意,上下图的激化输出有移动。最大池化例子(步进为2)从激活函数输出到池化输出(池化窗为3)相当于降采样池化一个池化示例:最大化池化,图像行列步进均为2步进>1卷积相当于1步进卷积加下采样步进卷积填充零保证卷积相同大小上图卷积逐步减小下图保持卷积相同张量卷积(体卷积)的扩展也可以直接进行步幅为s的降采样卷积一个张量卷积例子该例主要说明体卷积,紧跟ReLU激活函数,池化步幅为1,实际中池化步幅大多>1。典型CNN网络结构示意图CNN在图像识别的成果(ImageNetLargeScaleVisualRecognitionChallenge(ILSVRC)winners)AlexNet
CNN网络实例:VGGNetSmallfilters,Deepernetworks
8layers(AlexNet)->16-19layers(VGG16Net)Only3x3CONVstride1,pad1and2x2MAXPOOLstride2VGGNet结构示意图
CNN网络实例:GoogLeNet基本构造块:Inception
(取自电影Inception(盗梦空间))Verydeepnetworksusingresidualconnections
-152-layermodelforImageNet-ILSVRC’15classificationwinner(3.57%top5error)-
CNN网络实例:ResNet残差网络DenseNet一些代表性的CNN结构示例CNN网络小结CovnNET一般有多卷积层(卷积+激活+池化)+全连接层(FC)组成;目前趋势是更小的滤波核和更深的层数,甚至取消池化和全连接层,构成纯卷积网络。一种典型结构:[(CONV-RELU)*N-POOL?]*M-(FC-RELU)*K,SOFTMAX,这儿N可高达~5,M是较大值,0<=K<=2.新的结构不断被构造和尝试。CNN的一些趋势参考论文
LeCun,Y.etal.Handwrittendigitrecognitionwithaback-propagationnetwork.InProc.AdvancesinNeuralInformationProcessingSystems396–404(1990).LeCun,Y.,Bottou,L.,Bengio,Y.&Haffner,P.Gradient-basedlearningappliedtodocumentrecognition.Proc.IEEE86,2278–2324(1998).Krizhevsky,A.,Sutskever,I.&Hinton,G.ImageNetclassificationwithdeepconvolutionalneuralnetworks.InProc.AdvancesinNeuralInformationProcessingSystems251090–1098(2012).K.SimonyanandA.Zisserman“VeryDeepConvolutionalNetworksforLarge-ScaleImageRecognition”,ICLR,2014C.Szegedy,LiuW.,JiaY.etal,GoingDeeperwithConvolutions,IEEECVPR,2015HeK.etal.
DeepResidualLearningforImageRecognition,IEEECVPR,20162012年以后,每年ICML、NIPS等会议都有大量CNN结构的论文有兴趣可参考。这里只给出几个比较经典的工作。机器学习
MachineLearning
第9讲:神经网络与深度学习IIPart-2RNN网络、优化算法和正则化一个RNN网络的基本结构这是Elman结构循环网络,最常用的一种基本RNN结构这是经典的方框图表示1.循环神经网络
RecurrentNeuralNetwork:RNN1.1基本表示和展开图基本的,隐藏层做循环,基本关系为上标(t)表示序列标号,缺省为时间,但可表示任意“序列关系”对于直到(t)的输入序列形成计算序列,有记忆系统
展开计算图上图是RNN基本模块的简化流程图下图是展开计算图一个典型结构(隐藏层反馈)RNN的计算结构左图结构计算流程图,右图为展开计算图1.2RNN网络的基本计算关系(以tanh激活函数、输出多分类为例)RNN的损失函数时间的片段输入向量集标注向量集损失函数为负对数似然函数1.3RNN的BP算法通过时间的反向传播(Back-PropagationThroughTime:BPTT由得假设输出为softmax,则假设进行反向传播前用现有权系数,已通过前向传播计算出各时间点和各层激活值和输出对隐藏层h,从时间开始反向传播,故对于反向传播过程的t,有对于BPTT,先从时间反向,在每个时刻,再按层传播由于RNN网络中,只有状态h进行时间传播,故“误差传播”对h进行对于各参数的梯度分别为1.4其他结构RNN例从输出反馈的RNN,表达能力不及从隐藏层反馈一般比从隐藏层反馈易于训练双向RNN展开计算图表示因果循环通道反因果循环通道深度RNNa.隐藏层级联b.循环中
包含MLPc.多种延迟
循环1.5RNN中长期依赖的挑战
TheChallengeofLong-TermDependence经过多时间段传播后,梯度倾向于消失(多数情况)或爆炸(少数情况)提出了降低学习的长期依赖的多种方法回声状态网络(固定循环权重,只学习输出权重)泄露单元方法和不同时间尺度方法门控RNN,包括LSTM、GRU(门控循环单元)RNN网络训练的主要问题长期依赖问题,导致梯度消失和梯度爆炸一个解决办法:梯度截断1.6长短期记忆模型
LongShort-TermMemory:LSTM一种有效的门控RNN结构门控RNN在每个时间步通过门控路径,使得梯度既不消失也不爆炸;关键扩展:自循环的权重视上下文改变,而不是固定的,门控自循环的权,积累时间可动态改变;遗忘门(控制自循环)、外部输入门(控制输入通路)、输出门(控制输出),均使用Sigmoid函数,输入也通过非线性压缩(可使用Sigmoid或其他)LSTM网络一个单元的结构图LSTM网络的计算关系输入通道对状态更新的贡献表示为三个门控网络LSTM网络的计算关系(续)长记忆状态向量,由下式表示LSTM单元输出LSTM单元的展开计算图结构1.7门控循环单元—GRUGRU可看作是LSTM的一种简化版,性能上与LSTM等价。两个门分别为主前馈通道表示为GRU的状态和输出表示为GRU的计算结构2.深度神经网络训练的基本组成2.1深度学习的优化算法深度神经网络优化存在的许多困难局部极小值高原、鞍点和平坦区域(鞍点数量远远超出局部极小点)悬崖和梯度爆炸、长期依赖(可用梯度截断)非精确梯度局部和全局结构间的弱对应关系典型算法介绍SGD、AdaGrad、RMSProp、Adam等鞍点示意下图:初始点局部梯度没有下降到最优点神经网络优化的一些问题示意图2.2随机梯度下降StochasticGradientDescent:SGD算法描述SGD注意的问题小批量随机梯度(minibatch)
从训练集随机选取小批量m个样本,或大样本集重新随机排序后,顺序取m样本2.学习率选取是个重要因素,一般随迭代变化,但满足一个变化的例子:从起始到学习率变化,然后固定带动量的随机梯度下降SGD-with-MomentumSGD存在学习过程慢的问题,动量方法可加速学习引进速度累积量作为动量,并引入超参数右图:引入动量SGD和标准SGD算法收敛比较SGD-with-Momentum算法Nesterov动量对动量更新为权系数更新仍为带Nesterov动量的小批量SGD算法SGD+动量,SGD+Nesterov动量的更新方向示意图2.3自适应学习率算法-1:AdaGrad对所有模型参数的学习率自适应改变,反比于所有梯度历史平方值之和的平方根按元素运算控制各系数的更新学习率,即自适应学习率算法-2:RMSProp+Nesterov动量比AdaGrad算法增加一个遗忘加权因子,适当控制累加的范围和大小。加了Nesterov动量自适应学习率算法-3:AdamAdam算法分别计算梯度的1阶和2阶矩,其中1阶矩是动量的一种等价形式,2阶矩用于自适应控制学习率,Adam算法对有偏估计的1阶和2阶矩进行校正。自适应学习率算法-3:Adam(续)几种算法的收敛轨迹图示意3.1
网络的初始化初始化影响到大多算法的收敛,甚至影响到泛化性能;初始化方法大多是启发性的;如果具有相同激活函数的两个隐藏单元具有相同输入,则必须具有不同的初始化参数;对网络权系数进行随机初始化(不能选择为恒0),而偏置参数则启发性地选择常数(常见情况下可选择为0)。例如一个典型初始化为:这里表示均匀分布其他如:随机正交化矩阵做为系数矩阵,稀疏初始化等或这里m,n为输入和输出数目3.杂项简介:多种改善深度学习的技术3.2批归一化变换:加速学习过程BatchNormalization与网络权参数一起学习批归一化改善分类精度和学习速度上图(对一类数据集)分类精度随迭代变化下图:验证集分类精度随迭代变化(注意对多种不同参数和初始学习率与没有BN比)实际小批量归一化在权系数相乘后进行3.3DropoutDropout是一种正则化方法;Dropout训练中,从基础网络随机除去一些单元(输出单元总是保留)后形成子网络在每个小批量权更新时,对每一个样本,用一个二进制掩码向量,决定各单元是否去除,掩码向量按预先设定的方式随机取样(例如输入单元被去除的概率0.2,隐藏单元的概率0.5)。每个步骤训练一部分子网络参数,但其他参数继承基本网络的原参数。Dropout作为正则化技术,其减少模型的有效容量,为了抵消这种影响,需增大模型规模。Dropout只在大样本训练时有效。Dropout:一种正则化技术右图:从原始网络丢弃不同子集,形成的所有可能子网络Dropout例子三层神经网络,在每一个前向层,随机设置一些神经元为0设为0的比例是个超参数,本例取50%。3.4对抗训练样本x和对抗样本x’,x和x’非常近似,但神经网络输出非常不同。人类察觉不出区别的原始样本和对抗样本,神经网络可能分类为不同的类。(见下页例)对抗训练:在对抗扰动的训练集上训练网络。对抗训练通过鼓励网络在训练数据附近的局部区域恒定来限制高度敏感的局部线性行为。可以看作是引进了局部恒定的一种正则化。对抗样本的例子对抗训练的原理StandardsupervisedlearningAttackphase(寻找最强破坏性扰动)Defensephase(对抗训练,抵抗扰动)机器学习
MachineLearning
第9讲:神经网络与深度学习Part-3自编码器、注意力机制、Transformer一个自编码器的基本结构示例1.自编码器结构(Autoencoders)
基本自编码器编码器解码器神经网络的第一隐藏层表示编码为输出层(解码器)为
基本自编码器(续)自编码器训练问题从无监督学习转化为一种监督学习问题(可理解为一种自监督学习)经验损失函数表示为采用加正则化的目标函数堆叠自编码器示意图28*28手写数字数据库MNIST,通过两级堆叠自编码器,得到40维编码输出降噪自编码器(denoisingautoencoders)被损坏的变换信号
作为输入训练自编码器
两种常用损坏的变换信号2注意力机制(attentionmechanism)N个输入向量构成输入信息给出咨询向量计算各输入向量与咨询向量的相关度:打分函数注意力机制(attentionmechanism)常用打分函数点积模型:缩放点积模型:双线性模型:加性模型:注意力机制(attentionmechanism)softmax函数定义一种注意力分布注意力机制(attentionmechanism)硬注意力输出软注意力输出软注意力输出是一种带注意力的信息聚合,主要方式注意力机制(attentionmechanism)原理框图注意力机制更常采用健-值对(key-valuepair)格式表示输入,用健向量计算注意力分布,用值分量计算输出。注意力机制(attentionmechanism)健-值对结构健-值对表示为健-值对注意力机制输出为多头注意力机制(multi-headattention)注意力机制(attentionmechanism)多个查询各查询产生的输出进行拼接自注意力机制输入序列矩阵查询矩阵、健矩阵和值矩阵均由系数矩阵产生:查询向量不是由外部给出,而是自己产生。自注意力机制总的输出自注意力机制采用缩放点积函数,自注意力机制的输出可缩写为自注意力机制计算示例健矩阵产生与第一行图同维,略序列模型的条件概率描述:3.序列到序列模型输入序列输出序列训练样本序列到序列模型最大似然原理训练模型参数模型推断一个用于机器翻译的序列到序列模型示例:RNN结构编码器解码器序列到序列模型4.Transformer循环网络的序列模型不支持并行处理并行计算可有效缩短训练和推断的时间模型支持并行计算是现代模型的重要特征Transformer模型依靠注意力机制去刻画输入输出中的全局依赖性,在机器翻译等应用中取得当时最好的效果Transformer是编码器-解码器结构Transformer是支持并行结构的序列-序列模型Transformer的组成结构左侧部分是编码器右侧部分是解码器NX表示框内的宏结构级联N级在编码器端,一个层由两级子层级联:•第一子层由多头注意力机制和“残差连接+层归一化”构成;•第二子层由(逐位置)前馈全连接网络和“残差连接+层归一化”构成4.1模型总体结构在解码器端,一个层由三级子层级联:•掩蔽多头注意力机制、•编码器到解码器多头注意力机制、•逐位置前馈全连接网络“残差连接+层归一化”单元基本运算结构:“残差连接+层归一化”4.2编码器结构多头自注意力机制编码器的第l层层输入使用多头自注意力机制,即产生多个投影矩阵,分别计算多头自注意力机制每头的自注意力机制输出多头自注意力机制的输出是多头自注意力机制的输出映射矩阵例:Vaswani等人的论文中,给出的取值是多头自注意力机制多头自注意力机制计算完成后的“残差连接+层归一化”计算可表示为编码器端,每一层的第二个子层是前馈网络和“残差连接+层归一化”逐位置前馈神经网络前馈神经网络其后的残差连接+层归一化4.3解码器结构处理第t个位置词时,仅使用解码层中的第一个子层称为“掩蔽自注意力机制”第二子层,可称为“编码器-解码器”多头注意力机制解码器结构输入的健和值均来自编码器,查询来自第一层其中编码器最后一层的输出记为嵌入位置向量一种位置信息的定义为:加上位置编码的编码器端输入向量序列输入嵌入和位置编码输入语句通过词嵌入变换得到输入向量序列扩展:VisualTransformer(ViT)GPT:GenerativePre-trainingTransformer仅使用Transformer的解码器部分且仅保留掩蔽自注意力机制层GPT模型的解码运算层单向语言模型的输出概率表示掩利用丰富的语料库,训练一个单向语言模型微调:根据下游任务和标注数据进行微调
机器学习
MachineLearning
第10讲:无监督学习Part-1聚类和混合模型1.K均值聚类算法K-meansClustering将未标注的数据点集分簇(或分组)每一簇具有一定的聚集特性,是无监督学习的一种基本算法D维样本集合:将N个样本聚类成K簇,每一簇有D维特征向量需学习参数:对每一个样本,定义标识变量属于k簇,则K均值聚类算法(续)为了导出有效算法,定义如下目标函数求和使得目标函数J最小算法分成两步:选择初始第一步:固定,确定使J最小第二步:固定,确定使J最小反复迭代,直到算法收敛(#1)K均值聚类算法(续)第一步:由(#1),显然,对于固定和n第二步,对于固定,(#1)对导数为0,有(#2)K均值聚类算法(续)求各簇特征向量为(#3)注:通过反复迭代(#2)和(#3),其中(#2)确定每个样本属于离特征向量最近的簇,(#3)重新计算每个簇的均值向量为特征向量。该算法称为K均值聚类算法。例子:OldFaithful数据集聚类,二类的简单例子例子:OldFaithful数据集聚类的收敛曲线K均值聚类算法1.K均值聚类算法与其他方法有密切联系,例如与图像压缩的矢量量化算法。2.可以定义更一般的相似性度量,由此扩展成更一般的K-中心点算法(K-medoid)。3.K均值方法与混合高斯模型有紧密联系,可以用K均值算法为混合高斯模型的EM算法提供初值。同时,K均值算法也可看作一个EM算法的实例。2.混合高斯模型(GMM):隐变量观点GMM引入一个隐变量(假设存在,但观测不到)K维,表示取自第k个高斯分布故:GMM:隐变量观点(续)先验概率参数满足是,概率表示为给出的一个特殊值,则表示为GMM:隐变量观点(续)的条件分布为联合分布为对联合分布求边际分布,得到存在隐变量时的PDF为GMM:隐变量观点(续)是的先验分布,求的后验分布并表示为由贝叶斯公式得:这个隐变量的后验概率将起很关键作用!GMM:隐变量观点示例左:已知和参数,仿真产生若干数据,并记下,用红绿蓝表示样本点产生那个k分量,故:左图是联合分布中:去掉颜色,即去掉隐变量信息,实际样本是不知隐变量右:已知,用中图的各样本点坐标估计:
实际中,只有中图的样本点集:估计3.GMM参数估计:MLE的EM算法EM:Expectation-Maximization给出数据集:假定K(超参数)估计GMM的所有参数集是维样本矩阵,是第n行是维隐变量矩阵对数似然函数为:GMM参数估计:MLE的EM算法(续)由于对数中的GMM各分量求和,对数并不能直接作用到高斯函数的指数项,无法获得二次函数和的形式,带来计算的困难。利用隐变量的后验概率,通过迭代解该问题对数似然函数对求导为0,得:以上方程是高度非线性的,无解析解。若用迭代解,先假设可用旧参数值(第一次迭代时用初始猜测值)计算出
,然后用表示的解。
GMM参数估计:MLE的EM算法(续)均值向量的解为其中对数似然函数对求导为0,类似地得:GMM参数估计:MLE的EM算法(续)为求,除对数似然函数,还要加上约束项,即上式对求导为0,得:上式分子分母同乘,引入,并用得:GMM参数估计:MLE的EM算法(续)这是EM算法解GMM的思路E步,利用旧参数值,计算隐变量后验概率M步,利用计算新的参数集GMM参数估计的的EM算法描述初始化,,并计算初始对数似然函数E步:计算隐变量的后验概率GMM参数估计的的EM算法描述(续)3.M步:更新计算GMM的各项参数这里4.用新参数计算对数似然函数,若满足条件则停止,否则,转2继续迭代GMM参数估计的EM算法实例数据集4.EM算法由数据集,通过MLE估计参数对数似然函数可能难以处理,例如GMM情况。定义隐变量集,联合分布用联合分布更易于求解,但是是未观测到的量
称为完整数据集,为不完整数据集替代方法(EM):定义隐变量的后验分布求在下的条件期望,作为优化函数EM算法(续)EM算法采用迭代方法,并分为E步和M步,依次迭代。E步:参数固定为,并确定隐变量后验概率为计算的条件期望注:该式放在E步或M步均可M步:更新参数,得到参数更新值(#1)(#2)初始时取=
E步和M步依次迭代直到收敛迭代:以EM标准步骤,重新考察GMM参数估计由隐变量和完整数据集的表示,得联合概率分布联合对数似然函数需要求的条件期望,只需要求对的条件期望用EM重新考察GMM参数估计(续)联合分布的条件期望为(即:)以下求最大,结果同前。为了得到,这里只需要用EM收敛的一种解释利用完整数据集,似然函数写为通过推导,得对数似然函数的一种分解为其中用EM收敛的一种解释(续)KL散度,对数似然函数的下界三个量的关系示意图,EM算法中,其值变化用EM收敛的一种解释(续)一般情况下,故为对数似然函数下界只有当时,=0E步:参数固定为若取:=,KL散度为0下界=为最大。用EM收敛的一种解释(续)E步以后的各量示意图用EM收敛的一种解释(续)M步:(=
)固定不变,则可有求,使最大,即最大,即增加,同时,由于新参数,KL也不再为0故:对数似然函数的增加,可能大于的增加用EM收敛的一种解释(续)M步,各量的变化增大不再为0为两增量和每个E步和M步,保证对数似然函数单调增保证收敛。用EM收敛的一种解释(续)EM算法收敛的变化示意图。说明:按照EM的算法,每一步都在增加直到收敛EM算法的一点说明EM算法是现代统计学中的一种有效计算最大似然的算法,有更一般的形式(完整数据集概念),机器学习的无监督学习中主要利用了隐变量这种形式;EM算法也可有效的计算MAP问题。EM算法在现代统计学、信号处理和机器学习等领域都有应用。机器学习
MachineLearning
第10讲:无监督学习-2Part-2PCA降维ICA(独立分量分析)1.PCA方法降维PrincipalComponentAnalysis:PCA数据样本集(为了用下标表示主分量方便,用(n)表示样本序列(或改为上标亦可),即设任何一个样本是M维向量可以用一个K<M向量进行逼近表示,并对训练集外向量有好的泛化性为处理简单,假设PCA-特征分解在零均值假设下,自相关矩阵代替协方差矩阵,即对于训练集,自相关矩阵计算为做特征分解,得所有特征值集:相应特征向量集:(或扩展到)PCA-特征分解(续)取特征向量是归一化的,并构成特征矩阵并且对于训练集中或同生成概率所产生的向量定义向量为则有:这里是一对正反变换对(称为KL变换)PCA-特征分解(续)利用可得并且和PCA表示如果让特征值按大小排序仅取的前K<M个系数即这里是维矩阵且()或通过,可得的近似表示(注仍是M维向量)通过K维向量近似表示,称为的PCA表示PCA表示(续)PCA表示的能量定义误差向量误差向量评估PCA的解释通过训练样本集合得到K个主分量对于(来自训练集或一个泛化样本),近似表示用K维向量表示,其中是在的投影主分量分析的要点是用低维向量表示高维向量,是一种对高维数据的有效降维方法2.PCA的在线算法给出训练样本通过在线迭代得到主分量1.推导第一个主分量迭代中,迭代时第一个主分量系数迭代时用:优化的目标函数为PCA的在线算法(续)在线算法中,目标函数采用用SGD算法,权向量更新为注:在神经网络的文献中,这类将权系数的更新表示为输入与输出乘积的形式,称为Hebb学习规则,这类算法称为Hebb学习算法PCA的在线算法(续)由于PCA中,固定故迭代中,每一步固定:迭代算法修改为:上式可近似为(留作练习)其中PCA在线算法--广义Hebb算法(GeneralizedHebbianAlgorithm,GHA)推广到有K个主分量初始化:
,取小的随机数,构成随机向量,分别赋予令
循环起始:对计算令,取,返回循环起始,直到结束3.盲源分离和ICAIndependentComponentAnalysis,ICA存在独立源分量经过一个混合系统,产生可测量到的向量混合系统表示为最简单的混合系统混合系统未知,由测量向量估计源向量,欠定问题独立分量分析:ICA假设各源分量是统计独立的,即ICA定义为求解如下优化问题是描述的独立性的度量函数,是的估计给出样本集,,首先学习在线ICA系统框图ICA的常用算法不动点算法-Fast-ICA自然梯度算法最大似然ICA算法信息最大化ICA算法非线性PCA算法稀疏ICA算法等等4.不动点算法-Fast-ICA算法简介讨论抽取一个独立分量且目标函数是输出非高斯性最大化,目标函数为是一个选定的非线性函数利用牛顿迭代算法,得到非线性函数1阶导数
2阶导数
Fast-ICA的几个推荐非线性函数
初始步:观测数据向量首先白化,是白化向量,确定,,第1步,选择范数为1的随机初始权向量第2步,迭代计算第3步,若尚未收敛,返回第2步
第4步,若,返回第1步Fast-ICA算法描述隐变量分析问题混合模型的参数估计应用了离散隐变量方法PCA和ICA等方法实际是一种连续隐变量方法。隐变量问题,是机器学习、现代统计学和信号处理中公共关注的一个问题。本章附录:向量样本的白化由样本估计相关矩阵,并进行特征分解,得定义变换矩阵则是白化的,即在许多机器学习应用中,预白化是有效的预处理机器学习
MachineLearning
第13讲:强化学习-1ReinforcementLearning-1(TabularSolution)强化学习的基本问题强化学习(增强学习)(reinforcementlearning,RL)研究智能体基于对环境的认知做出行动来最大化长期收益,是解决智能控制问题的重要方法。强化学习的主体为智能体(agent)。智能体面对一个环境(environment),与环境的交互,感知环境的状态并获得当前环境的奖励(reward),决策当前要采取的动作(action),以最大化决策策略所能获得的长期收益。1.强化学习的基本结构模型交互中产生:“状态、动作、奖励”的序列
一个简化的猫抓老鼠游戏强化学习的简单示例强化学习解决的实际示例AlphaGo对弈麻将(MSRA)机器人控制2.马尔可夫决策过程RL的大部分问题可建模为马尔可夫决策过程(Markovdecisionprocess,MDP)定义:一个MDP由一个五元组
构成
表示状态集合;
表示动作集合
表示状态转移概率
是奖励函数
表示折扣因子。MDP定义的进一步解释状态转移满足:马尔可夫性
状态转移概率的定义决策过程产生一个样本序列
奖励函数的定义例:猫和老鼠的例子
状态集合动作集合
状态转移概率例子
奖励例子
描述规则!状态和返回值
出发所获得的累积奖励:返回值(return)
3.强化学习的基本元素策略函数确定性策略
随机策略
状态值函数(在给定策略下)
动作-值函数
4.贝尔曼(Bellman)方程决策过程中各状态之间有转移,表示MDP的状态之间值函数关系的一组方程称为贝尔曼(Bellman)方程
第一组形式方程贝尔曼方程证明
第2组形式
第2组方程的导出和关系第2组方程的导出和关系(续)第2组方程的导出和关系(续)第2组方程的导出和关系(续)5.MDP的最优性最优值函数:OptimalValueFunction最优策略:OptimalPolicy求最优策略:FindanOptimalPolicy
贪婪策略6.Bellman最优方程
由
得例:猫和老鼠的例子右侧是上下左右等概率策略的值函数以下,左侧为一个更好的策略右侧为该策略对于的值函数,实际上这是最优策略7.动态规划PlanningbyDynamicProgramming完全知道MDP模型!7.1策略迭代方法第一步:对于一个策略(起始时给出一个初始策略),利用贝尔曼期望方程迭代求策略对应的状态值函数,这一步称为策略评估(policyevaluation);第二步:利用所求的状态值函数,对策略进行改进,得到更好的策略,然后回到第二步,这一步称为策略改进(policyimprovement)。以上过程反复迭代,当改进后的策略不再变化,已得到最优策略7.1.1迭代策略评估IterativePolicyEvaluation迭代表示为
直到满足
7.1.2策略优化(ImproveaPolicy)
改进策略的贪婪算法策略迭代过程示意(
PolicyIteration)例:猫和老鼠初始策略为四方向等概率。(a)初始值函数,(b)值函数第一步迭代,(c)值函数收敛,(d)策略改进7.2广义策略迭代generalizedpolicyiteration,GPI策略评估不必到收敛,只做部分策略评估,则进入策略改进,形成一个链式算法
例:猫和老鼠初始策略为四方向等概率。(a)初始值函数,(b)值函数第一步迭代,(c)一步值函数迭代后更新的策略7.3值函数迭代(ValueIteration)利用贝尔曼最优方程,直接迭代最优值函数最后由最优值函数,得到最优策略
8.MC强化学习Monte-CarloReinforcementLearning通过实际交互学习需要有一个完整EPISODE!智能体通过与环境的交互进行学习,最终得到一种逼近最优的策略由于需要智能体在环境中进行实际交互,将智能体从开启到结束的过程称为一次试验,一种类型是一次试验的步数有限,将这种类型的试验称为一分幕(episode)蒙特卡洛方法只用于分幕环境用MC做策略评估的基本思路MC策略评估算法-1:首次访问计数每次完成一个episode,计算Gt,然后按如下更新VMC策略评估算法-2:每次访问计数每次完成一个episode,计算Gt,然后按如下更新V均值的增量计算,启发MC的增量算法MC的增量算法
动作-值函数更新表示为学习率形式
简记为:MC的策略改进利用一幕的序列计算部分策略评估,进行策略改进9.时间差分学习(TD类算法)Temporal-DifferenceLearning通过实际交互学习!实时!给出一种实时性更高、更灵活的算法。在最基本的情况下,交互过程每进行一步,就可以更新状态值函数MC方法要求一幕结束后,才可以更新值函数算法称为时序差分算法(temporaldifference,TD),基本的TD算法或称为TD(0)算法参考增量MC算法导出TD算法TD算法:值函数的一步更新
重写MC计算值函数的迭代公式
其中可近似为
定义TD误差(TDerror)
更新公式为
更经常使用的是动作-值函数,其更新为
每次值函数更新后,立刻用更新后的值函数,进行策略更新,用
Sarsa算法10.三种方法的Backup关系图比较11.Q-学习Off-PolicyQ-学习Q-学习算法Off-PolicyQ-学习算法描述12.学习算法比较(DP和TD)(续)机器学习
MachineLearning
强化学习-2ReinforcementLearning-2(函数逼近、策略梯度、连续动作)1.值函数逼近ValueFunctionApproximation大规模强化学习问题Large-ScaleReinforcementLearning状态取值空间
动作的取值空间
状态空间和/或动作空间巨大甚至取值连续的情况下,经典的表格方法不再适用,这时可用函数逼近的方法表示值函数。1.1值函数逼近解大规模MDP问题值函数逼近:用一种参数化的函数分别表示值函数和动作-值函数值函数逼近的几种类型注:其中第3种情况是状态空间巨大,但只有很少动作的情况下,可针对每一动作给出“动作值函数”可用监督学习中的参数回归模型表示一种值函数1.2值函数逼近的随机梯度方法特征向量FeatureVector为了有效表示值函数,用特征向量表示状态线性值函数逼近LinearValueFunctionApproximation例:表方法可认为是线性值函数逼近的特例1.3增量类值函数预测算法MC-增量类值函数预测算法TD(0)-增量类值函数预测算法1.4增量类控制算法实际中用“动作-值函数Q”取代值函数V动作-值函数逼近线性动作-值函数逼近线性动作-值函数的增量逼近算法结合贪婪改进策略算法,构造控制算法。函数逼近情况下的策略改进选择当前逼近函数下的最优动作贪婪策略
1.5基本函数逼近方法的收敛性值函数预测的收敛性控制过程的收敛性1.6神经网络Q函数逼近和学习DeepQ-Networks:DQN为保证收敛,引入经验回放(experiencereplay)和目标Q网络示例:针对Atari游戏的DQNDQN的实验结果(Atari)2.策略梯度算法通过学习直接得到一个参数化的策略函数假设动作是离散的,策略是随机的一个策略表示性能评价函数为策略梯度算法表示为迭代过程策略梯度算法PolicyGradient策略学习的三种基本方法常用离散策略函数用Softmax表示一个例子是线性函数逼近这里策略函数举例2.1策略梯度方法的目标函数策略梯度方法的梯度算法2.2策略梯度定理预备知识:记分函数(ScoreFunction)特例说明:梯度定理一步MDPs作为说明策略梯度定理梯度定理基于梯度定理的基本算法:Reinforce以Gt取代梯度定理的Q函数2.3Actor-Critic方法Weuseacritictoestimatetheaction-valuefunctionActor-criticalgorithmsUpdatesaction-valuefunctionparametersUpdatespolicyparametersθ,indirectionsuggestedbycritic
Actor-Critic算法加入一个Critic降低方差
动作-值函数Actor-Critic算法描述3.DRL中连续动作空间的策略梯度算法进展确定策略梯度算法(DPG,2014)确定策略(针对随机策略)、Actor-Critic、线性Q函数逼近,连续动作空间,确定策略函数深度Q网络(DeepQ-Network,2015)用深度CNN网络逼近Q函数和策略函数,解决不收敛问题(replayalgorithm)离散动作空间连续动作策略梯度定理DeepDPG(DDPG,2016)深度CNN网络,连续动作空间RecurrentDPG(RDPG,2016)解决POMDP问题RNN网络+DPG,LSTM更优先采用Fast-RDPG(2017/18)解决POMDP问题On-line实现,收敛效率高,LSTM表示函数逼近(我们近期的一个工作)连续动作空间的策略梯度算法(续)深度生成模型深度生成模型概述生成对抗网络(GAN)变分自编码器深度扩散模型归一化流模型1.生成模型由数据集通过训练得到数据集的概率分布:或由带标注的数据集通过训练得到数据集的联合概率分布:由概率分布可生成新的样本等多种应用有代表性的深度生成模型及结构样本向量对应隐变量生成模型的隐变量方法完整样本向量可表示为更方便模型化联合分布由联合分布得到可由以下两式之一完成或生成模型的隐变量方法在隐变量情况,以下两个条件概率均有重要意义以隐变量为条件生成样本(解码)隐变量的后验概率(编码)在高斯混合模型的例中,这两个概率都有作用在实际生成模型中,这两个概率未知,可用神经网络分别表示
例如VAE隐变量方法的几种实现技术直接训练生成网络:GAN直接生成概率函数,最大似然:归一化流代理似然函数:VAE、深度扩散模型生成模型的隐变量方法似然函数的分解EvidenceLowerBound(ELBO)证据下界:最大化ELBO,替代最大似然2.生成对抗网络
GenerativeAdversarialNets(GAN)有一组训练数据,目的是得到一个生成模型,产生与训练数据相同的概率密度函数。不是直接得到概率密度函数,而是得到一个神经网络G,G产生高维样本,训练完成后,G产生的样本与训练数据样本集有相同概率密度函数。通过两个神经网络:D鉴别网络,输出为一个标量,判断输入样本为真;G生成网络,生成伪样本。D和G构成博弈双方(对抗)。D尽力将真实训练样本判为1,将G生成的样本判为0;而G则尽可能产生样本,使D判为真。达到纳什均衡时D=1/2。生成对抗网络生成网络G:输入是噪声向量,有先验概率生成网络G函数表示为:,,为参数集生成网络输出样本的PDF为鉴别器函数为,区别输入为训练样本还是生成器生成的样本G和D是两个玩家的MinMax博弈,值函数表示为生成对抗网络(续)GAN不是一个优化问题,实际是一个博弈问题,其解是值函数的一个鞍点,值函数为解如下问题生成对抗网络训练示意图GAN算法描述GAN训练例子训练样本分布生成网络分布D输出(蓝色)右下角:理想训练结果G的生成样本分布等于训练样本分布GAN示例GAN的几个结果1.G固定,D的最优值为2.的全局最小解为3.理论上,收敛到注意:以上结论3对与函数空间成立,由于算法是调整神经网络参数而不是函数本身,故没有可直接保证神经网络收敛的定理。GAN示例GAN产生样本示例。数据集分别为MNIST和TFD图中是G产生的样本最右侧是原数据集中与生成样本最接近的数据集样本2014年的结果显示GAN的一些进展针对训练困难、模型坍塌、性能提升、风格迁移等问题的各种改进尝试Wasserstein距离和WassersteinGAN(2017)DeepConvolutionalGAN(DCGANs,2016)CycleGAN(2017)ProgressiveGrowingGAN(2018)StyleGAN(2019)StyleGAN产生的图像示例深度生成模型深度生成模型概述生成对抗网络(GAN)变分自编码器深度扩散模型归一化流模型3.变
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年健康管理师三级理论全真试题解析
- 2026年江苏省建筑施工安管人员C1证模拟复习题及答案
- 2026年掘进作业模拟试卷目及参考答案
- 2026年美甲师(四级理论知识)试题及答案
- 2026年内科学主治医师考试真题及答案详解
- 2026年农村社区管理试题及答案
- 2026年普法学法知识竞赛考试押题卷含答案(典型题)
- 2026年人工智能公需科目测评及答案
- 2026年人工智能训练师竞赛实操试题
- 一年级上册数学国庆假期作业7天10以内加减法练习含答案
- 2026年安徽合肥单招考试题库
- 辽宁石化职业技术学院单招职业技能考试题库及答案
- 2026-2027学年四年级上册数学单元全真模拟培优卷(人教版)第4单元 加法模型和乘法模型
- 2026年全国职业病诊断医师培训职业性化学中毒复习题及答案
- 徐工25吨吊车使用说明书
- 帕金森病深部脑刺激(DBS)手术
- 平面设计师招聘笔试题及解答(某大型国企)2025年
- 2026年温州市房地产行业分析报告及未来发展趋势报告
- 老师给的立式多喷嘴水喷射真空泵设计课程设计模板
- 实施指南(2025)《HGT 4615-2023 增塑剂 柠檬酸三丁酯(TBC)》
- 2025年南航乘务英语题库及答案
评论
0/150
提交评论