第五章 机器学习_第1页
第五章 机器学习_第2页
第五章 机器学习_第3页
第五章 机器学习_第4页
第五章 机器学习_第5页
已阅读5页,还剩36页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第五章机器学习

董燕举

2012年9月24日机器学习概述机器学习概念机器学习研究目标机器学习系统基本结构机器学习策略分类机器学习作用一个机器学习例子机器学习概念一个经典定义:利用经验改善系统自身的性能[T.Mitchell,Book97]如果一个系统能够通过执行某种过程而改进它的性能,这就是学习。

[H.Simon给出的定义]从人工智能的角度看,机器学习是一门研究使用计算机获取新的知识和技能,提高现有计算机求解问题能力的科学机器学习的研究目标使机器像人一样具有学习能力更好地理解人和其它生物的学习机理;使机器具有自我完善能力;使机器具有自适应、自学习能力;知识发现。机器学习系统基本结构环境学习环节知识库执行环节反馈外部信息的来源,它将为系统的学习提供有关信息系统的学习机构,它通过对环境的感知取得外部信息,然后经分析、综合、类比、归纳等思维过程获得知识。系统已经具有的知识执行一系列任务,并将运行结果报告学习环节,机器学习系统是一个计算模型把机器学习过程看作是一个数学映射学习的结果得到一个目标函数(计算模型)目标函数将输入数据转换成为某种特定形式有用的输出。光扫描字符识别机器人为抓住某物体需要执行的动作下棋游戏的下一步移动是否允许贷款申请人贷款的建议目标函数F4光扫描字符识别的目标函数F(字符扫描图像)——〉{A,B,……,Z,1,2,……,9}映射病人血常规检查

如果病人的白细胞升高,而且中性粒细胞比例高,说明是细菌感染如果病人的白细胞不高(降低),淋巴细胞升高,说明是病毒感染。f(白细胞,中性粒细胞,淋巴细胞)感染类型?

映射数据(经验)学习系统目标函数XY机器学习建模过程职业骑手数据库骑马越障表演赛骑手职业赛马骑手马术骑手骑手(年龄、身高、体重、参赛年限)职业赛马骑手学习模型骑手(体重)目标函数是否为职业赛马骑手一维函数骑手(年龄、身高、体重、参赛年限)目标函数是否为职业赛马骑手多维函数李强<21、160、102、2>职业骑手数据库骑马越障表演赛骑手职业赛马骑手马术骑手骑手(年龄、身高、体重、参赛年限)训练数据有监督学习:每个例子都对应着一个目标值y训练例子形式:{<x1,y1>,<x2,y2>,…<xm,ym>},Xi:<xi1,xi2,……xin>,Y:yes或no李强<21、160、105、2、yes>张三<20、165、102、4、yes>李甲<21、163、104、4、yes>李乙<21、176、140、2、no>无监督学习:训练例子不具有目标值学习过程外部环境:训练数据学习:训练计算模型(目标函数)参数过程知识库:与训练数据最匹配的参数执行:利用计算模型计算(识别、分类等)学习策略分类按学习过程中系统所采用的推理策略,可分为:机械学习(Rotelearning)演绎学习(Learningbydeduction)归纳学习(Learningbyanalogy)类比学习(Explanation-basedlearning)基于解释的学习(Learningfrominduction)增强学习(reinforcementlearning)统计学习(StatisticalLearning)机械学习学习就是记忆,系统无需任何推理或其它的知识转换,直接吸取环境所提供的信息。不要求复杂的问题求解,以空间换时间存储与计算权衡:存储和检索的代价<计算代价?基于常问问题集的问答系统FAQFAQ问答系统问题:LCD电视与LED电视有啥区别?

答案演绎学习学习所用的推理形式为演绎推理,从公理出发,经过逻辑变换推导出结论;学习结果即是推论,“保真”变换,;例:

A->B,B->C==>A->C;归纳学习归纳学习(InductiveLearning)就是从个别到一般,根据从观察数据(经验)中归纳出知识;是机器学习中最核心、最成熟的分支。泛化(Generalization):扩展某假设的语义信息,使其能够包含更多的正例,应用于更多的情况。例:观察事实:(1)下午四五点钟时,236路公交车很拥挤(2)下午四五点钟时,232路公交车很拥挤

……经验泛化:每天下午四五点钟时,公交车很拥挤泛化能力越强,所获得的知识越有价值天下的乌鸦一般黑辍学归纳(1)盖茨1973年秋季进入哈佛大学学习。仅仅两年之后他就辍学回家,和儿时的玩伴保罗.艾伦(PaulAllen)一同创建了微软公司。(2)乔布斯刚刚踏进里德学院六个月,就因为经济贫困而辍学。(3)……归纳学习分类监督学习与非监督学习监督学习:训练例子(经验数据)有目标值,如分类非监督学习:训练例子(经验数据)没有目标值;如聚类积极学习与消极学习

积极学习(eagerlearning):训练例子,建立学习模型;

消极学习(Lazylearning):直接使用训练数据,进行预测学习;统计机器学习统计机器学习=统计学+计算机科学黑箱原理:从一组观测数据推算问题世界的数学模型,一般没有物理解释,但是在输入输出关系上反映了问题世界的实际。统计学习最大的优点是它具有泛化能力缺点是它得到的永远是统计意义下的最优解模型真实世界中的系统模型1InputOutput模型2Output1Output2如果Output1总是和Ouput接近,Output2总是和Output偏离,我们就认为模型1比模型2好

真实系统模型1模型2InputOutput统计机器学习的简单例子假设我们观测到一个系统的输出是一系列的1和0,要预测它的下一个输出是什么。如果观测数据中1和0各占一半,那么我们只能以0.5的准确率做出预测。如果我们同时观测系统输入是1时输出是0的比例是0.9,输入是0时输出是1的比例也是0.9。这样我们就可以从已给数据中学到“模型”,根据系统的输入预测其输出,并且把预测准确率从0.5提高到0.9。统计学习是“乡下人”的办法一个乡下人进城,到餐馆吃饭,不知如何在餐馆用餐,就模仿旁边的人。别人做什么,他也就学着做什么。邻桌的一位故意戏弄他,将桌上的蜡烛卷在饼里,趁乡下人不注意时把蜡烛扔到地上,然后咬了一口卷着的饼。乡下人也跟着学,大咬了一口自己的饼。机器学习重要性没有学习能力的系统不是真正的智能系统;机器学习是人工智能的核心问题之一;机器学习开始进入了计算机科学的不同领域,甚至其它学科,成为一种支持技术、服务技术生物信息学计算金融学分子生物学行星地质学……工业过程控制机器人……遥感信息处理信息安全机器学习Office产品发展过程中的挑战。一方面,用户希望添加各种新功能;随着版本升级,新功能不断增加另一方面,用户又发现菜单变得越来越复杂,在系统中经常难于找到要找的功能。基于大规模用户行为数据挖掘从Office2003开始,微软公司在争得许可的条件下,记录并收集了部分用户使用Office的行为数据。这些用户使用Offic

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论