模式识别随机森林报告_第1页
模式识别随机森林报告_第2页
模式识别随机森林报告_第3页
模式识别随机森林报告_第4页
模式识别随机森林报告_第5页
已阅读5页,还剩3页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、模式识别实验题目:基于自助法随机森林分类器设计班级:信息10-2姓名:朱玥TOC o 1-5 h z学号:39指导教师:钱云目录随机森林介绍3自助法4实验原理5实验目的5实验步骤5实验内容6实验结果7小结与讨论81、随机森林介绍:随机森林分类(RFC)是由很多决策树分类模型h(X,0k),k=1,.组成的组合分类模型,且参数集0k是独立同分布的随机向量,在给定自变量X下,每个决策树分类模型都由一票投票权来选择最优的分类结果。RFC的基本思想:首先,利用bootstrap抽样从原始训练集抽取k个样本,且每个样本的样本容量都与原始训练集一样;其次,对k个样本分别建立k个决策树模型,得到k种分类结果

2、;最后,根据k种分类结果对每个记录进行投票表决决定其最终分类。RF通过构造不同的训练集增加分类模型间的差异,从而提高组合分类模型的外推预测能力。通过k轮训练,得到一个分类模型序列hl(X),h2(X),.,hk(X),再用它们构成一个多分类模型系统,该系统的最终分类结果采用简单多数投票法。最终的分类决策:其中,H(x)表示组合分类模型,hi是单个决策树分类模型,Y表示输出变量(或称目标变量),I()为示性函数。式(1)说明了使用多数投票决策的方式来确定最终的分类。随机森林具有以下特征:在现有的算法中随机森林算法的精度是无可比拟的。随机森林能够有效的处理大数据集。随机森林可以处理没有删减的成千上

3、万的输入变量。随机森林能够在分类的过程中可以生成一个泛化误差的内部无偏估计。随机森林是一种具有有效的估计缺失数据的方法,当数据集中有大比例的数据缺失时仍然可以保持精确度不变。在不平衡的数据集的类别总体中可以平衡误差。随机森林提供了一种检测变量交互作用的实验方式。特别值得注意的是随机森林的运行速度非常快并且不会产生过度拟合,可以根据需要生成任意多的树。基于随机森林的诸多优点,随机森林在当前的机器学习领域里成为了一个新的研究热点。随机森林常用的构建方法:装袋法(Bagging)更新权重构建随机森林的方法基于输入构建随机森林基于输出构建随机森林利用随机选择的特征子空间构建随机森林二、自助法自助法是一

4、种有返还的再抽样统计方法可以用于总体分布未知或者统计量的分布未知时的参数推断。自助法的基本思路:如果不知道总体分布,那么,对总体分布的最好猜测便是由数据提供的分布。自助法的要点是:假定观察值便是总体;由这一假定的总体抽取样本,即再抽样。由原始数据经过再抽样所获得的与原始数据集含量相等的样本称为再抽样样本(resamples)或自助样本(bootstrapsamples)。如果将由原始数据集计算所得的统计量称为观察统计量(observedstatistic)的话,那么由再抽样样本计算所得的统计量称为自助统计量(bootstrapstatistic)。自助法的关键所在是自助统计量与观察统计量间的关

5、系,就如同观察统计量与真值间的关系。三、实验原理:随机森林是一种包含多棵决策树的分类器,其中每棵决策树的构造和分类测试均相互独立.训练过程中,每棵决策树对原始的训练数据集进行采样替换,构造新的训练数据集(bootstrap方法);决策树中每个决策节点上的分裂测试均从一个随机测试集合中产生:根据某种量化评价标准,例如信息熵等,从随机测试集合中选择一个最佳测试作为决策点的分裂测试.随机森林中的每棵决策树均不需要进行剪枝.相对于单棵决策树而言,随机森林可以避免过拟合问题,分类精度高,稳定性好;随机森林保留了多值分类的特性,适合处理多值分类问题;相比boosting和其他集成方法,随机森林方法对于数据

6、噪声更稳定。4、实验目的:利用自助法随机森林对所给数据进行分类5、实验步骤:1.随机森林方法对样本数据进行自举重采样,得到多个样本集。所谓自举重采样,就是每次从原来的N个训练样本中有放回地随机抽取N个样本(包括可能重复的样本)。用每个重采样样本集作为训练样本构造一个决策树。在构造决策树的过程中,每次从所有候选特征中随机地抽取m个特征,作为当前节点下决策的备选特征,从这些特征中选择最好地划分训练样本的特征。得到所需数目的决策树后,随机森林方法对这些树的输出进行投票,以得票最多的类作为随机森林的决策。6实验内容:%RunRFonTrainingsettraindata=textread(satim

7、age_tra.txt);x=traindata(:,1:(end-1);y=traindata(:,end);y(y=7)=6;cat=ones(1,size(x,2);classwt=ones(1,length(unique(y)param=502601.10000.0100123;out=RFClass(param,x,y,cat,classwt)printRF(out);%PlotVariableImportancefigure;bar(out.errimp,0.1);title(VariableImportance);xlabel();ylabel();7、实验结果:Numberof

8、Trees:50No.ofVariablestriedateachsplit:2OOBestimateerrorratefortrainingdata:9.8083%ConfusionMatrixForTrainingSet|1-|-|23456|-|-|err%1|1050215050|2.05222|14681234|2.29653|6192122011|4.16234|7484237380|42.89165|3241439336|16.38306|10296017931|10.308371118、小结与讨论:综上所述,RF是一种有效的预测工具,是一个组合分类器算法,是树型分类器的组合,它集成了bagging和随机选择特征分裂等方法的特点,具有以下特征:(1)RF的精度和AdaBoost相当,甚至更好,但运算速度远远快于AdaBoost,且不容易过拟合。由bagging方法产生的OOB数据,可

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论