版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
[40]。 随机森林衡量特征重要性的指标有不纯度的平均下降值和准确率的平均下降值。本文采用的衡量特征重要性的指标是基于袋外数据的准确率的平均下降值,其原理如下:随机森林算法会生成N棵决策树,由于随机有放回抽样原则使得从未被抽中的样本单元组成了一个OOB数据,对该OOB数据计算预测的误差,记作err1t对OOB数据加入噪声影响,然后再次计算OOB数据的预测误差,并记为err2t则特征变量X对应的重要性为V(X)=t=1N由上述方法得到特征的重要性后,需要对特征进行选择,如果只是单纯地基于此来选择,则在数据存在大量的干扰信息的情况下,可能还是无法避免冗余特征对模型效果的影响,因而本文将再结合特征向后消除法,对特征变量重要性排序靠后的变量进行删除,将删除后的特征子集作为新的特征集,再使用随机森林算法以平均袋外误差为指标来计算该特征集的预测效果,重复此步骤,选择袋外误差最低的子集作为最终的最优特征子集。该过程可以总结为如下几步:基于随机森林算法得到特征变量的重要性;删除重要性最低的特征,剩余的作为新特征集;基于第二步得到的特征集,在测试集上使用随机森林算法进行分类,并计算袋外数据的平均误差;重复步骤(1)-(3),选择平均袋外误差最小的特征子集作为最终的最优特征子集。对该数据集采用上述所说的随机森林算法得到特征的重要性如下,由平均准确率下降和平均不纯度下降得到的变量的重要性大致相同,说明数据具有一定的稳定性。由上述方法,本文主要基于平均准确率下降指标来进行特征变量的删选,并结合后向消除法,首先排除掉变量alco,将剩余的变量作为新特征集代入随机森林算法,计算OOB误差率并对特征重要性再次排序,不断迭代上述步骤,最终选择OOB误差率最小时对应的特征子集作为特征选择后的最优特征子集。图4.1随机森林算法变量重要性排序图图4.2随机森林算法特征变量筛选过程图 由上述变量个数与OOB误差率的图形,我们可以看到当筛选掉的变量个数为5时,所对应的OOB误差最小。经过特征选择后的特征变量集包含变量为{age,weight,ap_hi,ap_lo,cholesterol,active,bmi},即{年龄、体重、收缩压、舒张压、胆固醇、是否运动、身体质量指数},后续基于支持向量机的预测模型将根据这7个变量进行。模型的训练及调参 一个好的预测模型不仅仅要选择合适的分类器,更要进行参数的优化选择,一组好参数对于提升一个模型的预测表现非常重要。本文主要对支持向量机、K近邻算法以及XGBoost算法调整参数。支持向量机 在SVM算法中选择什么核函数是建模的第一步,本文将目前使用较为广泛的线性核函数和径向基核函数均代入模型进行对比。结果表明,使用线性核函数的分类准确率为72.66%,AUC值为0.7265,而使用径向基核函数分类准确率为72.81%,AUC值为0.7308。使用径向基核函数的SVM算法性能略优于使用线性核函数的,故本文最终采用径向基核函数作为SVM算法的核函数。 在用径向基核函数的SVM算法中,比较影响模型预测性能的两个关键的参数是gamma和cost。gamma参数是可以控制超平面的形状的核函数的参数。gamma越大,其训练样本能触达的边界越广阔。cost参数则代表犯错的成本,成本越大代表着模型对误差的容忍程度越低。所以,过大的成本参数可能会导致模型过拟合,使得模型预测性能不佳。因而,在SVM算法中,选择合适的参数对最终的模型表现是很重要的。由于SVM算法中需要寻优的参数并不多,故本文利用网格搜索法对这两个参数进行寻优来确定最优的参数组合。网格搜索算法就是将我们提前输入的参数像坐标轴上的一个个点一样划分为网格,每个网格点都代表了一种参数组合,通过将所有网格点一次次代入模型来选择使模型性能最好的参数组合。本文首先对参数设置大范围值确定大范围上最优的参数,再对该最优参数附近设置小范围精确搜索,最终确定gamma为0.02,cost为10时,模型性能最好。K近邻算法 K近邻算法中影响模型预测能力的比较重要的两个参数是k的选取以及kernel(距离的加权方法)。在选择这两个参数时,我们使用交叉验证的方法,选择分类错误率最小时对应的k值和kernel,如下图所示,当k=23时,采用不加权的方式得到的错误率最低,故最终选择k=23,kernel=rectangular作为模型的最优参数。图4.3KNN参数选择XGBoost算法 XGBoost算法中参数很多,基于本文的研究背景为预测疾病的患病与否,本文设置该算法的基模型为决策树,并为二分类。以下将主要对影响最终算法表现的参数进行设置,考虑的方法是首先对其中几个参数人为设置初始值,然后再对其他参数采取网格搜索的方法并结合十折交叉验证法以AUC为评价指标确定对应参数的最优值,在进行网格搜索时同样先是在参数的较大范围上先进行一次粗略的调参找到相对优的参数,然后再在找到的相对优的参数附近进行小范围的精确调参。最终确定的最优参数组合如下表所示:表4.1XGBoost最优booster参数组合参数名称最优值nrounds50max_depth6eta0.05gamma0.5min_child_weight3subsample0.8colsample_bytree0.8模型的结果与对比 为了更好也更为客观地对本文使用的模型进行评估,本文将提出的模型与朴素贝叶斯、K近邻算法和逻辑回归三种较为常用的传统分类算法,以及目前机器学习领域中较为新的XGBoost算法,从上文提到的评价指标出发进行对比。在传统分类算法中选择这三种算法是由于此三种算法在分类预测问题中皆具有十分广泛的使用与应用,在对模型评估时作为对比模型具有较好的典型性与代表性。 如下所示为五种模型的ROC曲线以及不同评价指标表格,ROC曲线的获得是基于将数据集分割为8:2的训练集与测试集,然后在测试集上验证模型并输出ROC曲线,而评价指标的值的获取是基于上文所说的十折交叉验证方法。图4.4模型对应ROC曲线及AUC值 通常我们会用ROC曲线下对应的AUC值,来评价预测模型的平均性能表现。从上图可看出XGBoost算法和本文构建的基于随机森林和支持向量机的机器学习算法表现最好,其次是逻辑回归算法,而朴素贝叶斯的性能表现最差。不过总体来说,四种模型的AUC值都大于0.7,根据第二章评价指标的说明,四种模型的预测性能都较好。表4.2五种模型预测心血管疾病评价指标结果表算法准确性精确率特异性敏感性F1-ScoreAUCRF-SVM73.02%75.79%79.08%66.83%71.02%0.7296KNN72.29%73.62%75.93%68.57%71.00%0.7225LR72.73%75.37%78.66%66.67%70.75%0.7267NaiveBayes70.67%75.22%80.40%60.74%67.20%0.7057XGBoost73.47%76.02%79.06%67.76%71.65%0.7341 从上表可以看出,基于权衡精确率和敏感性的评价指标F1-Score,也同AUC指标结果一样,XGBoost算法和本文构建的模型表现最好,XGBoost算法略优于本文构建的模型,其次是逻辑回归模型。朴素贝叶斯在本文使用的心血管疾病数据集中预测性能最差,是由于该算法有一个很强的前提条件是各特征变量间是相互独立的,由上一章节我们可以知道该条件在此数据集中并不成立,所以使得该算法预测分类能力不强。另外,基于混淆矩阵计算的四个指标,在医学领域中并不都是同等重要的。在疾病诊断中,我们最害怕的是将患有疾病的人诊断为无病,因为这直接影响了该病人及时治疗的最佳时间,可能造成无法挽回的后果,所以我们通常希望敏感性,也即在真的患有疾病的人中也被正确诊断的概率尽可能大一些,在这五种模型中,敏感性最大的是K近邻算法,其次是XGBoost算法和本文构建的模型;XGBoost算法作为一种较为新的机器学习算法在应用于本文的数据集中确实具有更好的预测性能,原因可能在于该算法作为一种集成式的机器学习算法,相比传统单一的模型,他将弱分类器进行组合为一个强分类器,使得预测的性能会更好;另一方面,该算法对损失函数通过泰勒展开至二阶,不仅用到了一阶导数还利用了二阶导数,也会对预测的准确性有所提升。虽然本文构建的基于随机森林和支持向量机的预测模型在这五种模型中并不是表现最好的,略低于XGBoost的表现,但相比于传统的KNN算法以及朴素
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 护理部年度工作总结
- 护理纠纷案例分析及其防范措施-王晓雪
- 护理查房范文
- 护理教育信息化与教学效果评估
- 临床液体管理核心知识与实践
- 吸氧护理规范与临床实践
- GB-T 41330-2022 飞轮储能系统 技术要求与测试方法(中文版完整版)
- 单相抑郁与双相抑郁认知功能的多维剖析与比较研究
- 单宁酸赋能聚四氟乙烯复合纳滤膜:制备工艺与性能优化的深度探究
- 单克隆抗体制备新方法驱动下的NGAL快速酶联免疫试剂盒创新研发与多元应用
- 2027年中考英语【阅读理解】满分答题技巧
- 贵州省粮食储备集团有限公司招聘考试真题
- 部编版新教材道德与法治五年级上册第2课《探索中国革命道路》教学设计
- 四年级上数学学困生转化计划
- 2026国企中层干部竞岗笔试真题题库及标准答案(竞聘专用完整版)
- 苏轼自题金山画像 课件
- 2026小学教资教育科学研究方法课件
- (2026年)纪念红军长征胜利90周年主题班会-爱我中华 长征启新程课件
- 中医基础理论全套课件415P-课件
- 2026年农村房屋买卖合同模板
- 八年级生物下册生物的遗传教学教案苏科版(2025-2026学年)
评论
0/150
提交评论