版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、随机森林的直观理解导语:对于那些认为随机森林是黑匣子算法的人来说, 这篇帖子会提供一个不同的观点。接下来,我将从4个方面 去理解随机森林模型。1.我们的特征有多重要?在 sklearn 随机森林中使用 model.feature_importance 来研 究其重要特征是很常见的。重要特征是指与因变量密切相关 的特征,并且对因变量的变化影响较大。我们通常将尽可能 多的特征提供给随机森林模型,并让算法反馈对预测最有用 的特征列表。但仔细选择正确的特征可以使我们的目标预测 更加准确。计算feature_importances的想法很简单,但却很有效。把 想法分解成简单的几步:训练随机森林模型(假定
2、有正确的 超参数)找到模型的预测分数(称之为基准分数)多次(p 次,p为特征个数)计算预测分数,每次打乱某个特征的顺 序,可见下图将每次预测分数与基准分数进行比较。如果随 机调整特征顺序后预测分数小于基准分数,这意味着我们的 模型如果没有这个特征会变得很糟糕。删除那些不会降低基 准分数的特征,并用减少后的特征子集重新训练模型。图1 :计算特征重要性注:将F4列打乱重新进行预测来判断特征F4的重要性计算特征重要性的代码:下面的代码将为所有特征提供一个结构为特征,重要性的 字典。图2:随机森中的重要特 role=presentation图 2 :随机森林中的重要特征输出:在上面的输出中,可以看出,
3、YearMade将最大程度 增加RMSE预测。所以它一定是最重要的特征。(上面的结 果所对应的数据是从Kaggle competition获取的,这是链接 HYPERLINK /cZbluebook-for-bulldozers%ef%bc%89 /cZbluebook-for-bulldozers) 2.我们对我们的预测有多大信心?一般来说,当企业想要有 所预测时,他们的最终目的不是降低成本就是提高利润。在 做出重大商业决策之前,企业十分热衷于去评估做出这个决 定的风险的大小。但是,当预测结果并没有被展现在置信区 间时,我们可能会无意中将企业至于更多的风险中,而不是 降低风险。当我们使用线性
4、模型(基于分布假设的一般模型) 时,比较容易找到我们预测的置信水平。但是当谈到随机森 林的置信区间时,找起来并不是那么容易。图 3:偏差与方差的说明图我想,任何上过线性回归课程的人都肯定看过这张图3。为了找到一个最佳线性模型,我们要去寻找偏差一方差最为折衷的模型。这张图片很好地说明了预测中偏差和方差的定义。 (我们理解为这4张图分别是由四个不同的人掷飞镖所得)。 如果我们有高偏差和低方差值时(第三个人),我们投掷的 飞镖会固定的远离红心。相反,如果我们有高的方差和低的 偏差(第二个人),那么他投掷飞镖的结果就很不一样。如 果有人去猜测他下一个飞镖击中的位置,那么它既有可能打 到靶心也有可能远离
5、靶心。现在我们来假设在现实生活中识 别一起信用欺诈等同于上面例子击中靶心。如果信用公司拥 有的的预测模型与上面第二人的掷飞镖行为很相似,那么该 公司在大多数时候都不会抓住这个诈骗犯,尽管模型预测的 是正确的。因此,不仅仅是意味着预测的准确程度,我们还 应该检查我们的预测的置信水平。在随机森林中如何做到这 一点?随机森林是由许多决策树组成。每棵树分别预测新的 数据,随机森林从这些树中提取出平均预测值。预测置信水 平的想法只是为了去看来自不同树木的预测有多少因为新 的观测而产生变化,然后进一步分析。基于方差树预测置信 度的源代码:注:偏差=(up-down)/Yhat以上代码的输出如 下所示:图4
6、:基于方差树的置信树图5的这棵决策树(深度:3层)基于波士顿房价数据集。 根据中间节点的预测值以及导致数值发生变化的特征,它显 示了决策路径的分解。单节点的贡献是该节点的值与前一个 节点值的差值。图6:Tree interpreter (最终再次入院的概率=0.6)图6给出了对于患者A使用Tree interpreter的输出示例。 图片显示年龄为65岁是模型预测再入院概率高于均值的最 高贡献者。图7:将特征贡献通过瀑布图可视化展示图6同样也可以使用瀑布图7来表示。我从“瀑布图包”中选材 做的这个快速简单的瀑布图。上面的瀑布图可视化代码:相 关变量的阐释:值(图片B)是指通过节点预测目标值。(
7、就是在该节点中 落下的观测目标的平均值)。贡献是当前节点的值减去上一节点的值(这是为一个路径 提供的贡献特征)。路径是为了到达叶节点而通过某些观察所获得的所有特征 分割的组合。tree interpreter包直接用来计算每个节点的贡献,链接: treeinterpreter4.目标变量如何与重要特征相关? Partial Dependence Plots找到最重要的特征后,下一步我们可能会 感兴趣的是研究目标变量与兴趣特征之间的直接关系。从线 性回归中得到的与其相类似的是模型系数。对于线性回归, 系数以这种方式被计算,即我们可以通过说:“在Xj中有1 个单位变化,保持所有其他Xi不变,Y会发
8、生什么变化?” 这样的方式来表示。虽然我们有来自随机森林的特征重要性, 但是它们只是给出Y的变量是由Xi的改变之间的相关性。我们不能直接地解释他们就像保持所有其他特征不变,Y该 变量取决于Xj中的单位的变化。幸运的是,我们有看一被看 作线性模型系数图表的局部依赖图,但同样也可被扩展为看 起来像黑箱模型。这个想法是将预测中所做的改变孤立于一 个特定的功能。它不同于X对Y的散点图,因为散点图不能 隔离X对Y的直接关系,并且可能受X和Y所依赖的其他 变量的间接关系所影响。PDP分析步骤如下:训练一个随机森林模型(假设F1F4 是我们的特征,Y是目标变量,假设F1是最重要的特征)。 我们有兴趣探索Y和
9、F1的直接关系。用F1( A)代替F1 列,并为所有的观察找到新的预测值。采取预测的平均值。 (称之为基准值)对F1( B)F1( E)重复步骤3,即针 对特征F1的所有不同值。PDP的X轴具有不同的F1值, 而Y轴是虽该基准值F1值的平均预测而变化。图8:PDP分析逻辑图9是partial dependence plot 的一个例子。数据来自 kaggle bulldozer competition data,它显示了生产年份(YearMade)和(销 售价格)SalesPrice的关系图 9:partial dependence plot( YearMade 与 SalePrice 的变化)而图10是SalePrice与YearMade的线状图。我们 可以看到,散点图/折线图可能无法像PDP那样捕获 YearMade对SalesPrice的直接影响。图10:上述两个图片均来自(来源 HYPERLINK /fastai/fastai/tree/master/courses/ml1 /fastai/fastai/tree/master/courses/ml1) 写在最后:在大多数情况下,随机森林在预测中可以击败线性模型预测。 针对随
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 保险行业风险管理与合规知识综合测试卷
- 保险市场研究与保险客户服务模拟试题
- 园区固定资产盘点员岗位面试题及答案
- 绿篱修剪养护技师试题及答案
- 医疗机构安全生产岗位培训考试题库(2026年)
- 2026年中级经济师农业经济专业全真试题及答案
- 2026年云南省景洪市高二生物上册期末考试检测卷及一套答案
- 2026年医保公共服务便民化培训考试题及答案
- 2026年医疗器械经营监管政策考试题及答案
- 2026年烟道内部检修气体检测操作培训试卷及答案
- 2026年全国煤炭生产经营单位(安全生产管理人员)考试题库含答案
- 2026年《中国脑卒中防治和康复管理指南(2026版)》
- 2026新教材数学 2.1.1 第1课时 有理数加法法则
- 第5课 中国人民站起来了 第3课时 课件(内嵌视频)2026-2027学年道德与法治五年级上册统编版
- 2026年全媒体运营师理论考试题库(重点350题)
- 2026新版检验检测机构管理评审报告
- 机械原理 课件 第2章-常用机构
- 职业卫生技术服务机构质量管理体系手册
- 《机械制图》电子教材
- 兵团连队管理办法
- CJT511-2017 铸铁检查井盖
评论
0/150
提交评论