版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
集成学习朱辉星2016年11月集成学习朱辉星18.1(1)个体与集成集成学习(ensemblelearning):通过构建并结合多个学习器来完成学习任务。(也被成为:多分类器系统、基于委员会的学习)一般结构:先产生一组“个体学习器”(individuallearner),再用某种策略将他们结合起来。个体学习器通常由一个现有的学习算法从训练数据产生C4.5决策树算法、BP神经网络算法8.1(1)个体与集成集成学习(ensemblelearn28.1(2)同质集成中只包含同种类型的个体学习器个体学习器:基学习器对应算法:基学习算法异质集成中包含不同类型的个体学习器个体学习器:由不同学习算法生成个体学习器:组件学习器(或直接称个体学习器)8.1(2)同质集成中只包含同种类型的个体学习器个体学习器:38.1(3)集成学习优点:通过将多个学习器进行结合,常可获得比单一学习器显著优越的泛化性能。这对“弱学习器”(weaklearner)尤为明显,因此集成学习的很多理论研究都是针对弱学习器进行的,而基学习器有时也被直接成为弱学习器虽然从理论上来说使用弱学习器集成足以获得好的性能,但在实践中出于种种考虑,希望使用较少的个体学习器,人们常常会使用比较强的学习器。8.1(3)集成学习优点:通过将多个学习器进行结合,常可获得4如何能获得比最好的单一学习器更好的性能呢?8.1(4)在二分类任务中:三个分类器在三个测试样本上的表现如下:分类器测试例1测试例2测试例3h1√√×h2×√√h3√×√集成√√√分类器测试例1测试例2测试例3h1√√×h2√√×h3√√×集成√√×分类器测试例1测试例2测试例3h1√××h2×√×h3××√集成×××a.集成提升性能b.集成不起作用c.集成起负作用集成学习的结果通过投票法产生如何能获得比最好的单一学习器更好的性能呢?8.1(4)分类器58.1(5)a.每个分类器都只有66.6%的精度,但集成学习却达到了100%;b.三个分类器没有差别,集成后性能没有提高;c.每个分类器精度只有33.3%,集成学习结果变得更糟;以上例子显示要获得好的集成,个体学习器应“好而不同”,即个体学习器要有一定的“准确性”,即学习器不能太坏,并且要有“多样性”。即学习器间具有差异性。个体学习器至少不差于弱学习器8.1(5)a.每个分类器都只有66.6%的精度,但集成学习68.1(6)考虑二分类问题:和真实函数,假定基分类器的错误率为,即对每个基分类器有假设集成通过简单投票法集合T个基分类器,若超过半数的基分类器正确,则集成分类就正确⑴⑵8.1(6)考虑二分类问题:和真实函78.1(7)假设基分类器的错误率相互独立,则由Hoeffding不等式可知,集成的错误率为⑶上式显示出:随着集成中个体分类器数目T的增大,集成的错误率将指数级下降,最终趋向于零。8.1(7)假设基分类器的错误率相互独立,则由Hoeffdi88.1(8)然而我们必须注意到,上面的分析有一个关键假设:及学习器的误差相互独立。在现实任务中,个体学习器是为解决同一个问题训练出来的,他们显然不可能相互独立。事实上,个体学习器的“准确性”和“多样性”本身就存在冲突。一般的,准确性提高之后,要增加多样性就需牺牲正确性。集成研究核心如何产生“好而不同”的个体学习器8.1(8)然而我们必须注意到,上面的分析有一个关键假设:及98.1(9)根据个体学习器的生成方式,集成学习方法可分为两大类:①个体学习器间存在强依赖关系、必须串行生成的序列化方法②个体学习器间不存在强依赖关系、可同时生成的并行化方法代表:Boosting代表:Bagging和“随机森林”
(Randomforest)8.1(9)根据个体学习器的生成方式,集成学习方法可分为两大108.2(1)Boosting(助推、推进)Boosting是一族可将弱学习器提升为强学习器的算法,这族算法的工作机制:先从初始训练集训练出一个基学习器再根据基学习器的表现对训练样本分布进行调整,使得先前基学习器做错的训练样本在后续受到更多关注然后基于调整后的样本分布来训练下一个基学习器如此重复进行,直至基学习器数目达到事先指定的值T,最终将这T个基学习器进行加权结合。8.2(1)Boosting(助推、推进)Boosting是118.2(2)adaboostBoosting族算法最著名的代表:AdaBoost其中是真实函数基于“加性模型”,即基学习器的线性组合来最小化指数损失函数(exponentiallossfunction)⑷⑸8.2(2)adaboostBoosting族算法最著名的代128.2(3)若H(x)能令指数函数最小化,则考虑(5)式对H(x)的偏导令(6)式为零可解得:⑹⑺8.2(3)若H(x)能令指数函数最小化,则考虑(5)式对H138.2(4)因此,有⑻8.2(4)因此,有⑻148.2(5)这意味着sign(H(x))达到了贝叶斯最优错误率。换言之,若指数损失函数最小化,则分类错误率也将最小化.在Adaboost算法中,第一个基分类器h1是通过直接将基学习算法用于初始数据分布而得;此后迭代地生成和,当基分类器基于分布产生后,该分类器的权重应使得最小化指数损失函数:8.2(5)这意味着sign(H(x))达到了贝叶斯最优错误158.2(6)
其中:⑼8.2(6)其中:⑼168.2(7)考虑指数损失函数的倒数:令(10)为零可解得:这恰是(Ⅰ)中算法分类器权重更新公式。⑽⑾8.2(7)考虑指数损失函数的倒数:⑽⑾178.2(8)AdaBoost算法在获得之后样本分布将进行调整,使下一轮的基学习器能纠正的一些错误。理想的能纠正的全部错误,即最小化⑿8.2(8)AdaBoost算法在获得之后样188.2(9)注意到,式(12)可使用的泰勒展式近似为于是,理想的基学习器⒀8.2(9)注意到198.2(10)注意到是一个常数,令
表示一个分布⒁⒂8.2(10)⒁⒂208.2(11)则根据数学期望的定义,这等价于令由f(x),h(x){-1,+1},有⒃⒄8.2(11)则根据数学期望的定义,这等价于令⒃⒄218.2(12)
这恰是(Ⅰ)中算法第7行的样本分布更新公式由(15)式得⒆8.2(12)由(15)式得⒆228.2(13)
输入:训练集D={(x1,y1),(x2,y2),…,(xm,ym)};基学习算法;训练轮数T过程:于是,由式(11)(19),我们从基于迭代式优化指数损失函数的角度推导出了算法:endfor输出:Ⅰ1:2:3:4:5:6:7:8:8.2(13)输入:训练集D={(x1,y1),(x2,y238.2(14)Boosting算法要求基学习器能对特定的数据分布进行学习,这可通过“重赋权法”(re-weighting)实施:对于无法接受带权样本的基学习算法,则可通过“重采样法”(re-sampling)来处理:在训练过程的每轮中,根据样本分布为每个训练样本重新赋予一个权重在每一轮学习中,根据样本分布对训练集重新进行采样,再用重采样而得的样本集对学习器进行训练一般而言,这两种做法没有显著的优劣差异,需注意的是,Boosting算法在训练的每一轮都要检查当前生成的基学习器是否满足基本条件(第5行),一旦条件不满足,则当前基学习器即被抛弃,且学习过程停止。在此时,初始设置的学习轮数也许远未达到,可能导致最终集成只包含很少的基学习器而性能不佳。8.2(14)Boosting算法要求基学习器能对特定的数据248.2(15)
若采用“重采样法”则可获得“重启动”机会一避免训练过程过早停止,即在抛弃不满足条件的当前基学习器之后,可根据当前分布重新对训练样本进行采样,再基于新的采样结果重新训练出基学习器,从而使得学习过程可以持续预设的T轮完成。3个基学习器5个基学习器11个基学习器+好瓜—坏瓜Y含糖率X密度集成:红色基学习器:黑色Boosting能基于泛化性能相当弱的学习器构建出很强的集成8.2(15)若采用“重采样法”则可获得“重启动”机会一避258.3(1)bagging与随机森林由之前可知,欲得到泛化性能强的集成,集成中的个体学习器应该尽可能相互独立,虽然“独立”在现实中无法做到,但可以设法使基学习器尽可能具有较大的差异。这样。由于训练数据不同,我们获得基学习器可望具有比较大的差异,然而,我们同时还希望个体学习器不能太差。若每个子集完全不同,则每个基学习器只用到一小部分训练数据,甚至不足以进行有效学习,无法保证产生好的学习器,所以,我们考虑使用相互有交叠的采样子集。给定一个训练集,对训练样本进行采样,产生出若干不同的子集,再从每个数据子集中训练出一个基学习器8.3(1)bagging与随机森林由之前可知,欲得到泛化性268.3.1(1)baggingBagging是并行式集成学习方法最著名的代表。基于自助采样法。初始训练集中约有63.2%的样本出现在采样集中。这样,我们可采样T个含m个训练样本的采样集,然后基于每个采样集训练出一个基学习器,再将这些基学习器进行结合。给定包含m个样本的数据集:①先随机取出一个样本放入采样集中;②再把该样本放回初始数据集,使得下次采样时该样本仍有可能被选中;③经过m次随机采样操作,得到含m个样本的采样集,初始训练集中有的样本在采样集里多次出现,有的从未出现;Bagging的基本流程8.3.1(1)baggingBagging是并行式集成学习278.3.1(2)在对预测输出时,Bagging通常对分类任务使用简单投票法,对回归任务使用简单平均法。若预测时出现两个类收到同样的票数,则随机选择一个,也可进一步考察学习器投票的置信度来确定最终输出。输入:训练集D={(x1,y1),(x2,y2),…,(xm,ym)};
基学习算法&
训练轮数T过程:endfor输出:Ⅱ1:2:3:是自助采样产生的样本分布8.3.1(2)在对预测输出时,Bagging通常对分类任务288.3.1(3)对比:Adaboost只适用于二分类任务;Bagging能不经修改地用于多分类、回归任务。自助采样过程给Bagging带来了另一个优点:由于每个基学习器只使用了初始训练集中约63.2%的样本,剩下的约36.8%的样本可用作验证集来对泛化性能进行“包外估计”(out-of-bagestimate).为此需记录每个基学习器所使用的训练样本。令表示实际使用的训练样本集,令表示对样本X的包外预测,8.3.1(3)对比:Adaboost只适用于二分类任务;X298.3.1(4)即仅考虑那些未使用x训练的基学习器在x上的预测,有则Bagging泛化误差的包外估计为:⒇(21)8.3.1(4)即仅考虑那些未使用x训练的基学习器在x上的预308.3.1(5)包外样本还有许多用途:①当基学习器是决策树时,可使用包外样本来辅助剪枝,或用于估计决策树中各结点的后验概率以辅助对零训练样本结点的处理;②当基学习器是神经网络时,可使用包外样本来辅助早期停止以减小过拟合风险;8.3.1(5)包外样本还有许多用途:①当基学习器是决策树时318.3.1(6)从偏差——方差分解角度看:Boosting主要关注降低偏差,因此其能基于泛化性能相当弱的学习器构建出很强的集成。Bagging主要关注于降低方差,因此它在不剪枝决策树,神经网络等易受样本扰动的学习器上效用更为明显。
西瓜数据集3.0上Bagging集成规模为3,5,11时,集成与基学习器分类边界3个基学习器5个基学习器11个基学习器8.3.1(6)从偏差——方差分解角度看:Boosting主328.3.2(1)随机森林(RF)随机森林是Bagging的一个扩展变体。RF在以决策树为基学习器构建Bagging集成的基础上,进一步在决策树的训练过程中引入了随机属性选择。传统决策树在选择划分属性时在当前结点的属性集合(假定有d个属性)中选择一个最优属性;而在RF中,对基决策树的每个结点,先从该结点的属性集合中随机选择一个包含k个属性的子集,然后再从这个子集中选择一个最优属性用于划分。这里的参数k控制了随机性的引入程度:若令k=d,则基决策树的构建与传统决策树相同,若令k=1.则是随机选择一个属性用于划分。一般情况下,推荐值8.3.2(1)随机森林(RF)随机森林是Bagging的一338.3.2(2
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 催化重整装置操作工岗前安全生产规范考核试卷含答案
- 啤酒花栽培工安全应急水平考核试卷含答案
- 2025年医学专题-埃及伊蚊参考文献检索
- 医患关系中的信任构建与心理护理
- 2024-2025学年湖北武汉东湖高新区五年级(下)期末数学试卷及答案
- 肾脏疾病诊疗与护理实践案例分享与总结
- 骨孤立性浆细胞瘤的影像学表现
- 医院病房护士礼仪规范
- 上午便秘的便秘的中西诊治全课件
- 《UI设计-AIGC驱动赋能界面完美设计》课件 5.1 相关知识
- 《医院空气净化管理》课件
- 处方点评知识与技能课件
- 电气气动控制回路介绍电气气动控制回路介绍
- 洁净空调负荷计算表格
- 紫罗兰永恒花园
- 顶棚涂料喷涂施工方案范本
- 职业技能鉴定考评员聘用协议书【模板】
- 育肥羊养殖项目可行性研究报告
- 全民法复习 融资租赁合同 全考点法考详解
- 初中物理实验计划表
- 国家职业技能标准申报表
评论
0/150
提交评论