生物医学数据挖掘:05-分类_第1页
生物医学数据挖掘:05-分类_第2页
生物医学数据挖掘:05-分类_第3页
生物医学数据挖掘:05-分类_第4页
生物医学数据挖掘:05-分类_第5页
已阅读5页,还剩39页未读, 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第四章分类2内容一、分类的功能

二、分类的方法

三、分类的应用1四、分类的应用2

3一、分类的功能定义:根据特征属性的值,确定属于预先知道类别中的哪一类。特征属性:归类的依据,数值型或分类型等类别标记:预先知道类别中的一种。(聚类:预先不知道)上述两项存在因果关系45一、分类的功能一般方法建模测试

应用再学习建模(学习)测试分类6一、分类的功能一般方法:有指导的学习学习样本的类别是已知的无指导的学习(聚类)学习样本的类别标记未知误分原因:特征属性属于非典型值分类器7一、分类的功能步骤(1):建立模型8一、分类的功能步骤(2):使用模型进行分类9一、分类的功能分类模型性能分类正确率计算成本鲁棒性(robustness)扩展性(scalability)可解释性(interpretability)

10一、分类的功能评估分类模型随机分组:训练集2/3和测试集1/3交叉验证:如10折交叉验证留一法11二、分类的方法性能依赖的因素分类依据-特征属性的选择分类器的选择12二、分类的方法特征属性的选择(数值型)可靠性:类内距离,越小可靠性越高可区别性:类间距离,越大可区别性越高Fisher系数:综合考虑以上两项,越大分类效果越好独立性:相关性-0:特征间完全不相关

1:特征间高度相关1314二、分类的方法特征属性的选择(分类型)例4.5,计算信息增益相似性度量(第五章)分类>2类,如何实现直接分类逐次降阶:和↓和↓和15二、分类的方法常用分类器决策树基于统计(贝叶斯分类器)ANN近邻分类器遗传算法粗糙集模糊集……16二、分类的方法决策树分类器树结构内部节点:属性分支叶结点:所属分类决策树的生成过程树的建构树剪枝决策树的使用:为一个未知的样本分类

17二、分类的方法由决策树提取分类规则用IF-THEN规则的形式表达知识规则易于理解例如IFrank=‘professor’ORyears>6THENtenured=‘yes’

18二、分类的方法决策树分类器所有属性为分类型,可计算信息增益Gain。选择具有高信息增益的属性。越大,分类效果越好信息增益公式,P62式4.10~12类别Ci的熵特征属性A的信息增益

19二、分类的方法决策树分类器例:P62例4.5计算学习样本集的熵:计算特征属性的信息增益:

20二、分类的方法决策树分类器-信息增益“年龄”的信息增益最大,因此,根节点为“年龄”按信息增益,可去掉“血脂”21二、分类的方法决策树分类器不按信息增益值,以“血压”来分类22二、分类的方法决策树分类器两种分类方法的比较:方法1:2层,简洁,易理解、易解释;方法2:3层方法1:用到3个特征属性,舍去信息增益小的、对结果无影响;方法2:用到4个特征属性

23二、分类的方法决策树分类器-按最大比例例:P62例4.5

24二、分类的方法决策树分类器-按最大比例例:P62例4.5

25二、分类的方法决策树分类器对数据敏感表达知识的形式直观、易于理解不同节点的选择,结果有差别软件可实现繁复的计算(如信息增益)

26二、分类的方法基于统计的分类器(朴素贝叶斯分类器)需满足某些条件,即朴素假设:属性独立属性是分类型计算条件概率,式4.14属性是连续型计算高斯密度函数,式4.15

27二、分类的方法基于统计的分类器(朴素贝叶斯分类器)例:P65例4.6,未知样本X{青年,血脂偏高,患糖尿病,患高血压}:

Y{老年,血脂高,无糖尿病,血压正常}是否患冠心病?两类的先验概率(式4.13)

P(冠)=9/14=0.643P(非冠)=5/14=0.357

28二、分类的方法基于统计的分类器(朴素贝叶斯分类器)例:X的归类,例4.6,以下计算Y:两类的条件概率:根据Y的四个不同的状态{老年,血脂高,无糖尿病,血压正常}

P(老年|冠)=3/9=0.333

P(老年|非冠)=2/5=0.4

P(血脂高|冠)=2/9=0.222

P(血脂高|非冠)=2/5=0.400P(无糖尿病|冠)=3/9=0.333P(无糖尿病|非冠)=4/5=0.8

P(血压正常|冠)=3/9=0.333

P(血压正常|非冠)=3/5=0.6

29二、分类的方法基于统计的分类器(朴素贝叶斯分类器)例:条件概率,Y{老年,血脂高,无糖尿病,血压正常}P(Y|冠)=0.333×0.222×0.333×0.333=0.0082P(Y|非冠)=0.4×0.4×0.8×0.6=0.0768P(Y|冠)×P(冠)=0.0082×0.643=0.0053P(X|非冠)×P(非冠)=0.0768×0.357=0.0274则Y属于类别“非冠”,即Y可能未患冠心病

30二、分类的方法ANN神经网络分类器可用于回归和分类输入[0.1],输出:数值、分类(回归)分类型不同的多种因素对结果的多重影响,及各因素间的相互作用。

31二、分类的方法ANN神经网络分类器

32二、分类的方法近邻分类器无显式模型

计算相似性单个特征:如身高,相差小则更相似两个特征:DBA<DBC

,B和A较相似。AB。。C>两个特征:近邻分类器,P67式4.16

33二、分类的方法近邻分类器最近邻分类器:找一个距离最短的样本。容易受随机误差的影响。K近邻分类器:在学习样本中找K个最相邻的样本,即将样本从小到大排列,找前K个较相似样本,则K个样本可能:均属A,则未知样本属A有属A、也有属B,若A>B的个数,则未知样本判属A

34二、分类的方法近邻分类器例:12个样本有两个特征属性f1、f2,分两类A和B2个待定样本X,Y的归类?

35二、分类的方法近邻分类器

36二、分类的方法近邻分类器对非典型样本当K取值较小时,其归属随机、不确定;当K取值较大时,其归属易确定,误差较小学习样本多,则K可取大;样本少,K取大无意义K取大时,若分类的结果收敛较慢,则说明未知样本不够典型。最好依据学科知识放入学习样本(再学习)对特征属性为分类型数据,如何计算距离、相似性?要进行转换(见第五章相似性度量)

37三、分类的应用冠心病预测失语症分类

38应用实例:大脑胶质瘤恶性程度判别目的以数据挖掘的方法,根据已有的历史数据,构建预测术前大脑胶质瘤患者恶性程度的分类模型,便于制定治疗方案、降低手术风险和开支研究目标变为DM的问题:预测型-分类数据采集:280个病例:169例为低度恶性、111例为高度恶性特征属性:14项39年龄(1~30、31~60、61~90)增强后强化:无、均匀、不均匀性别:男、女血供:一般、中等、丰富胶质瘤形态:圆、椭圆、不规则坏死:无、有轮廓:清晰、部分清晰、不清晰出血:无、急性、慢性包膜:有、无钙化:无、有水肿:无、轻、中、重T1加权:低、低+等、低+等+高占位效应:轻、中、重T2加权:高、高+等、高+等+低数据预处理14项特征属性:40决策树ANN(1)ANN(2)归一化年龄1~3031~6061~90原值1、2、3水肿:无、轻、中、重0、1、2、30、0.333、0.667、1增强后强化:无、均匀、不均匀缺失值为-1(126例)恶性程度:低度、高度1、2数据预处理(部分)41数据的组织:十折交叉验证法数据挖掘-建立模型决策树人工神经网络42模型的性能比较可理解性和易用性比较决策树采用了与自然语言相近的表达方式,结果直观而容易

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论