人工智能原理及其应用(第5版)课件 第5章 机器学习_第1页
人工智能原理及其应用(第5版)课件 第5章 机器学习_第2页
人工智能原理及其应用(第5版)课件 第5章 机器学习_第3页
人工智能原理及其应用(第5版)课件 第5章 机器学习_第4页
人工智能原理及其应用(第5版)课件 第5章 机器学习_第5页
已阅读5页,还剩90页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

《人工智能》第5章机器学习苏松志目录CONTENTS5.1什么是机器学习5.2线性回归模型5.3线性分类模型5.4支持向量机5.5决策树5.6AdaBoost5.7朴素贝叶斯模型5.8混合高斯模型5.9概率主成分分析5.1什么是机器学习

5.1什么是机器学习损失函数(Loss):衡量预测与真实答案的差距优化算法(Algorithm):寻找更好的参数模型(Model):把输入映射到输出大数据(BigData):训练过程中的经验应用(Application):部署、推理并沉淀新数据5.1.1数据

5.1.2模型

5.1.3损失函数

5.1.4优化算法优化算法的目标是求解如下的最优化问题:梯度下降法分为:填鸭式:使用训练集中的所有样本计算梯度。随机梯度下降法:每次使用一个样本计算梯度,又称在线学习方法。小批量:每次使用部分的样本数计算梯度,如32、64或128。概率模型中,参数的求解方法:极大似然估计、最大后验概率估计和贝叶斯估计若概率模型含隐变量,则可用期望最大化EM、变分推断VI和抽样技术等方法在机器学习中,针对某个数据集,选好模型和损失函数后,利用优化算法不断调整参数,使模型在数据集上的损失不断下降的过程称为训练(Training)5.1.5应用训练完成后把模型部署到生产环境概率模型的使用通常称为推理(Inference,也称推断)新数据可沉淀下来,进入下一轮参数学习机器学习的应用关注的是模型在未知数据中的能力,即泛化能力目录CONTENTS5.1什么是机器学习5.2线性回归模型5.3线性分类模型5.4支持向量机5.5决策树5.6AdaBoost5.7朴素贝叶斯模型5.8混合高斯模型5.9概率主成分分析5.2线性回归模型

5.2.1线性回归及最小二乘法(1)模型线性回归的模型为

,其中(2)损失函数线性回归模型采用平方损失,又称最小二乘法(LS),二乘是平方的意思。模型在数据集D上的损失函数为:注:在机器学习的研究中,把问题建模为矩阵和向量的表达式是必备技能。这里要求读者熟练掌握线性代数的基础知识,若是遗忘建议查阅相应的教材。5.2.1线性回归及最小二乘法

5.2.2概率模型及极大似然估计

5.2.2概率模型及极大似然估计

式中,后一项与参数无关,我们只需要关注第一项。可见,最小化负对数似然与最小二乘法是等价的。5.2.2概率模型及极大似然估计

5.2.2概率模型及极大似然估计

5.2.3最大后验概率与正则化线性回归

5.2.3最大后验概率与正则化线性回归

5.2.3最大后验概率与正则化线性回归

5.2.3最大后验概率与正则化线性回归

目录CONTENTS5.1什么是机器学习5.2线性回归模型5.3线性分类模型5.4支持向量机5.5决策树5.6AdaBoost5.7朴素贝叶斯模型5.8混合高斯模型5.9概率主成分分析5.3线性分类模型

5.3.1模型

5.3.1模型

5.3.2损失函数

5.3.2损失函数

5.3.3优化算法

5.3.3优化算法

5.3.3优化算法

5.3.3优化算法(2)牛顿法由此可得,参数的更新公式为进一步可以推导得到:可以记

,则该参数更新公式为

,本质上是如下的加权最小二乘法的解:式中,目标变量为这种方法也被称为迭代重加权最小二乘法(IRLS)5.3.4应用

目录CONTENTS5.1什么是机器学习5.2线性回归模型5.3线性分类模型5.4支持向量机5.5决策树5.6AdaBoost5.7朴素贝叶斯模型5.8混合高斯模型5.9概率主成分分析5.4支持向量机

5.4.1模型

5.4.1模型

5.4.2损失函数

5.4.2损失函数

5.4.2损失函数

5.4.3优化算法

5.4.3优化算法该原始问题对应的对偶问题为根据优化理论中的弱对偶性(WeakDuality),可以得到:即对偶问题的最优解是原问题最优解的一个下界,且对偶问题是一个凸优化问题。因此原问题可以通过优化对偶问题得到原问题的一个下界。进一步地,在满足凸性和

Slater条件下,弱对偶问题加强为强对偶问题:5.4.3优化算法

5.4.3优化算法

5.4.3优化算法

5.4.4应用

目录CONTENTS5.1什么是机器学习5.2线性回归模型5.3线性分类模型5.4支持向量机5.5决策树5.6AdaBoost5.7朴素贝叶斯模型5.8混合高斯模型5.9概率主成分分析5.5决策树决策树学习过程实际上是一个构造决策树的过程。其学习前提是必须有一组训练实例学习结果是由这些训练实例构造出来的一棵决策树。当学习完成后,就可以利用这棵决策树对测试样本进行分类或回归5.5.1模型

5.5.1模型下图所示为一个简单的鸟类识别决策树。根节点包含了各种鸟类,叶节点是所能识别的各种鸟的名称,中间节点是不同鸟类的一些属性,边是鸟的某一属性的属性值。从根节点到叶节点的每条路径都描述了一种鸟,包括该种鸟的一些属性及相应的属性值。5.5.1模型决策树还可以表示成规则的形式。如图所示的决策树可表示为如下规则集:IF 鸟类会飞 AND 是家养的 THEN 该鸟类可能是和平鸽IF 鸟类会飞 AND 不是家养的 THEN 该鸟类可能是信天翁IF 鸟类不会飞 AND 会游泳 THEN 该鸟类可能是企鹅IF 鸟类不会飞 AND 不会游泳 THEN 该鸟类可能是鸵鸟5.5.2损失函数

5.5.2损失函数

5.5.2损失函数

5.5.3优化算法

5.5.3优化算法ID3算法过程可描述如下:(5)对选定属性的每个属性值,重复执行如下操作,直到所有属性值全部处理完为止。①为每个属性值生成一个分支,并将样本集中与该分支有关的所有样本放到一起,形成该新生分支节点的样本子集。②若样本子集为空,则将此新生分支节点标记为叶节点,其节点类别为原样本集中最多的类别。③否则,若样本子集中的所有样本均属于同一类别,则将该节点标记为叶节点,并标出该叶节点的类别。(6)从属性集中删除所选定的属性,得到新的属性集。(7)转第(3)步。5.5.4应用

目录CONTENTS5.1什么是机器学习5.2线性回归模型5.3线性分类模型5.4支持向量机5.5决策树5.6AdaBoost5.7朴素贝叶斯模型5.8混合高斯模型5.9概率主成分分析5.6AdaBoost强可学习:在概率近似正确(PAC)学习框架中,若一个概念(一个类)存在一个多项式的学习算法能够学习它,并且正确率很高弱可学习:一个概念存在一个多项式的学习算法能够学习它,学习的正确率仅比随机猜测好一点强可学习和弱可学习是等价的:一个概念的强可学习的充分必要条件是这个概念是弱可学习的发现弱可学习算法通常比发现强可学习算法简单,故把弱学习算法组装成强学习算法,其中典型代表:AdaBoost算法5.6.1模型

5.6.2损失函数

5.6.2损失函数在分类问题中,AdaBoost采用的是指数损失函数:从直观上来看,根据指数函数的单调性,预测的置信度越大,指数损失越小。上述的优化问题比较复杂,一般采用前向分步算法求解:从前往后,每一步只学习一个基函数及其系数,逐步逼近优化目标函数式。5.6.2损失函数

5.6.3优化算法

5.6.3优化算法

5.6.3优化算法

5.6.3优化算法

5.6.4应用

目录CONTENTS5.1什么是机器学习5.2线性回归模型5.3线性分类模型5.4支持向量机5.5决策树5.6AdaBoost5.7朴素贝叶斯模型5.8混合高斯模型5.9概率主成分分析5.7朴素贝叶斯模型

5.7朴素贝叶斯模型

5.7.1模型

5.7.2损失函数考察对数似然函数:式中,联合概率分布:类先验分布为类条件分布为代入后整理得

5.7.3优化算法

5.7.3优化算法由此可见,MLE得到的参数估计结果正是训练集中属性出现的频率。但这种看似简单的利用统计频率作为参数的估计方法具有严重的缺陷。在训练样本不足,或者特征维数较高时,可能会有某些类别或特征在训练集中不出现的情况,这称为数据贫乏问题(DataScarcityIssue)或零计数问题(Zero-Counts-Problem)。为克服这种潜在的问题,一种常见的方法是拉普拉斯平滑化(LaplaceSmoothing)或加性平滑化(AdditiveSmoothing),即取一个极小的正数,对结果进行微小的修正,得到如下估计

5.7.4应用

5.7.5算法简例

5.7.5算法简例解:首先计算出下列概率5.7.5算法简例

目录CONTENTS5.1什么是机器学习5.2线性回归模型5.3线性分类模型5.4支持向量机5.5决策树5.6AdaBoost5.7朴素贝叶斯模型5.8混合高斯模型5.9概率主成分分析5.8混合高斯模型

5.8.1模型

5.8.1模型假设隐变量的分布为条件分布为高斯分布通过全概率公式,可得到该模型需要学习的参数5.8.2损失函数

5.8.3优化算法

5.8.3优化算法

5.8.3优化算法

5.8.4应用

目录CONTENTS5.1什么是机器学习5.2线性回归模型5.3线性分类模型5.4支持向量机5.5决策树5.6AdaBoost5.7朴素贝叶斯模型5.8混合高斯模型5.9概率主成分分析5.9概率主成分分析本节讨论的是无监督学习,输入的数据集为主成分分析(PCA)是一种常用的降维方法,一般可以从最大化投影方差和最小化重构误差这两个角度去介绍原理。最大化投影方差指的是在给定数据X的情况下,寻找一个投影使变换后数据的方差最大,即最大程度地保留原始信息;最小化重构误差指的是最小化重建的高维数据与原始数据之间的误差。本质上,PCA是一种编码解码过程:编码对数据进行降维;解码恢复原空间的数据。概率主成分分析(PPCA)对PCA进行扩展,可以更好地描述数据的不确定性。5.9.1模型

5.9.2损失函数

5.9.3优化算法

5.9.4应用

习题5(1–

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论