版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
概率机器学习:
从基础到前沿第5章K近邻与决策树K-NearestNeighborsDecisionTree均为非概率模型Outline用sklearn中的KNN做分类(乳腺癌数据集)KNN模型结构和预测使用sklearn的决策树做分类(鸢尾花数据集)决策树模型结构和预测决策数模型的训练常用决策树模型单棵决策树集成学习2026/10/435.1用sklearn实现K近邻分类K-NearestNeighbors,KNN用KNN实现乳腺癌分类代码forkinrange(1,10):clf_knn=KNeighborsClassifier(n_neighbors=k).fit(X_train,y_train)y2_pred=clf_knn.predict(X_test)print('k=',k,'knnAccuracy=',np.sum(y2_pred==y_test)/len(y_test))训练集大小:(455,30)(455,)测试集大小:(114,30)(114,)k=1knnAccuracy=0.9473684210526315k=2knnAccuracy=0.9473684210526315k=3knnAccuracy=0.9298245614035088k=4knnAccuracy=0.9385964912280702k=5knnAccuracy=0.9473684210526315k=6knnAccuracy=0.9473684210526315k=7knnAccuracy=0.9473684210526315k=8knnAccuracy=0.9473684210526315k=9knnAccuracy=0.9385964912280702LogisticRegressionAccuracy=0.9649122807017544运行结果(与逻辑回归比较)K近邻分类的误差不会高于最佳分类器的两倍5.2K近邻模型结构和预测Lazylearner近朱者赤,近墨者黑KNN模型结构和预测利用样本直接预测没有参数没有显式的训练过程预测方法基于距离或相似度近朱者赤,近墨者黑表决优点简单缺点预测速度慢准确度差模型预测示例基于欧氏距离KNN决策边界
5.3用sklearn构建决策树鸢尾花分类用sklearn创建决策树模型fromsklearn.treeimportDecisionTreeClassifier,plot_tree#criterion{“gini”,“entropy”,“log_loss”},default=”gini”clf=DecisionTreeClassifier(random_state=42)
#使用训练集训练分类器clf.fit(X_train,y_train)
#预测测试集的标签y_pred=clf.predict(X_test)
#评估模型的准确度accuracy=accuracy_score(y_test,y_pred)print(f"Accuracyofthedecisiontreemodel:{accuracy*100:.2f}%")鸢尾花数据集运行结果:Accuracyofthedecisiontreemodel:100.00%鸢尾花类别决策树基于sklearn实现概念分裂特征(Splittingfeature)分裂值(SplittingValue)基尼不纯度(GiniImpurity)定制criterion(可选gini、entropy、log_loss)splitter(可选best或random)max_depth(最大深度)min_samples_split(分割的最小样本数)min_samples_leaf(叶子节点包含的最小样本数)“sepallength”、“sepalwidth”、“petallength”、“petalwidth”X_test[0]=[6.1,2.8,4.7,1.2]y_pred[0]=?决策树优缺点
5.4决策树的模型结构和预测结构学习、参数学习模型结构和预测非概率模型模型结构:树节点:对应分裂特征和分裂值叶子:无法再细分的样本集合模型参数分裂特征分裂值预测从根到叶子查找在叶子处表决:样本类别最多的标签5.5决策树模型训练分治,DivideandConquer贪心,Greedy决策树的训练全局优化为NPhard,不可行“局部”损失函数采用贪心策略,每次优化子样本的“不纯度”训练方法启发式算法(HeuristicAlgorithm),不确保最优解分治+贪心分治分区(Partition)递归贪心选择特征时采用最大信息增益或最低基尼不纯度决策树训练:分治策略
P1P2
P
P1P2决策树训练:贪心策略
ABABGini不纯度
分裂特征及其分裂值的选择贪心算法对每个特征每个可能的分裂值产生的样本集,分别计算其基尼不纯度选择基尼不纯度最低的特征及其分裂值作为该节点的判断条件不能保证全局最优基于分治和基尼不纯度实现鸢尾花决策树代码略5.6常用决策树模型单棵决策树:ID3,C4.5,CART集成学习:随机森林,GBDT,
XGBoost,LightGBM,CatBoost单棵决策树ID31986年,RossQuinlan提出了ID3(IterativeDichotomiser3)使用信息增益选择特征倾向于选择具有较多取值的特征,容易过拟合C4.51993年,RossQuinlan对ID3进行了改进,提出了C4.5使用信息增益率选择特征,引入剪枝CART1986年,LeoBreiman等人提出CART(ClassificationandRegressionTrees)二叉树结构,使用基尼不纯度作为分裂准则集成学习(EnsembleLearning)三个臭皮匠,顶个诸葛亮随机森林(RandomForest)2001年由LeoBreiman提出使用随机特征子集来选择最佳分裂特征,降低了树之间的相关性使用自助法(Bootstrapsampling)从训练数据中生成多个子集,每个子集训练一棵树
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 保险行业基础知识巩固习题
- 保险投资与资产管理专项训练题库
- 六盘水市住房和城乡建设领域现场专业人员培训考试(土建施工员专业基础知识)题库(2026年)
- 上海建平中学新初一分班英语试卷含答案解析
- 职业资格中级数控车工模拟考试题库(及答案)
- 质量管理总监笔试题与参考答案(某大型国企)备考策略解析
- 医保政策考试试题
- 2026年应急人员面试题目及答案
- 2026年职业健康安全内审员考核题库
- 2026年护士资格《护理管理》阶段测试卷
- 2026年非接触式物位仪表行业技术创新与应用报告
- 2026中国新能源电池材料技术突破与市场前景研究报告
- 2026年综合管理岗试题及答案
- 2026年发展对象培训班考试题库(含完整答案解析)
- ASCVD一级预防:他汀联合依折麦布策略
- 近年文言文《岳阳楼记》中考真题30套
- 广西贵百河联考2025-2026学年高一上学期10月月考政治试卷
- 2025年统计学期末考试题库:统计学在法律学中的应用综合案例分析试题集
- 青光眼相关围手术期护理
- TCECA-G 0330-2024 磁悬浮离心式鼓风机 技术条件
- 人教版九年级上册数学第一次月考试卷含答案
评论
0/150
提交评论