全文预览已结束
下载本文档
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
在机器学习、统计学、模糊逻辑和粗糙集等领域提出了许多属性相关分析的方法。属性相关分析的基本思想就是针对给定的数据集或概念,对相应属性进行计算已获得(描述属性相关性)的若干属性相关参量。这些参量包括:信息增益、Gini值、不确定性和相关系数等。采用属性相关分析方法,以帮助滤去统计无关或弱相关的属性并保留(与挖掘任务)最相关的属性。包含属性(维)相关分析的定性概念描述就称为分析定性概念描述(analytical characterization )。包含属性(维)相关分析的对比定性概念描述也就称为分析对比定性概念描述(analytical comparison)。直观上讲,若一个属性(维)的取值可以帮助有效地区分不同类别的数据集(class,那么这个属性(维)就被认为是与相应类别数据集密切相关的。例如:一个汽车的颜色不太可能用于区分贵贱汽车(类别);但是汽车的型号、品牌、风格可能是更相关的属性。此外即使同一个属性(维),其不同抽象层次的概念对不同类别数据集的分辨能力也不同。例如:在出生日期(birth date)维中,birth day和birth month都不太可能与雇员的工资相关;而只有birth decade(年龄)可能与雇员的工资相关。这也就意味着属性(维)相关分析应该在多层次抽象水平上进行,只有最相关的那个层次的属性(维)应被包含到数据分析中。当属性相关分析应用在聚类算法时,它根据数据在每个属性上的分布情况来删除稀疏的属性和数据,最终达到降维和缩小数据集的目的;当属性相关分析应用在离群数据挖掘时,它根据数据在每个属性上的稀疏程度删除稠密的属性和数据,通过删除稠密属性和数据,也能达到降维和缩小数据集的目的。利用属性相关分析,首先,可以删除在所有维组合中都处于稠密区域的数据,由于这些数据不可能出现在稀疏区域内,因此他们也不可能出现在离群子空间中;第二,利用属性相关分析删除不相关属性,不相关属性是指在这个属性中所有的数据都分布在稠密区域内,容易知道由稠密区域构成的维不可能成为构成离群子空间的维,因此,不相关属性可以删除。关于属性相关分析,在机器学习、统计、模糊和粗糙集理论等方面都有许多研究。属性相关分析的基本思想是计算某种度量,用于量化属性与给定类或概念的相关性。这种度量包括信息增益、Gini索引、不确定性和相关系数。这里,我们介绍一种方法,它将信息增益分析技术(诸如在学习决策树ID3和C4.5算法中提供的)和基于多维数据分析的方法集成在一起。该方法删除信息量较少的属性,收集信息量较多的属性,用于概念描述分析。 信息增益计算如何工作?设S是训练样本的集合,其中每个样本的类标号是已知的。事实上,每个样本是一个元组,一个属性用于确定训练样本的类。例如,属性status可以用于定义每个样本的类标号或者是“graduate”,或者是“undergraduate”。假定有m个类。设S包含si个Ci类样本,i=1,.,m。一个任意样本属于类Ci的可能性是si/s,其中s是集合S中对象的总数。对一个给定的样本分类所需的期望信息是: 具有值a1,a2,.,av的属性A可以用来将S划分为子集S1,S2,.,Sv,其中,Sj包含S中A值为aj的那些样本。设Sj包含类Ci的sij个对象。根据A的这种划分的期望信息称作A的熵。它是加权平均:A上该划分的信息增益定义为 : 在这种相关分析方法中,我们可以计算定义S中样本的每个属性的信息增益。具有最高信息增益的属性是给定集合中具有最高区分度的属性。通过计算信息增益,我们可以得到属性的秩评定。这种秩评定可用于相关分析,选择用于概念描述的属性。概念描述的属性相关分析执行步骤如下:1数据收集:通过查询处理,收集目标类和对比类的数据。对于类比较,目标类和对比类都由用户在数据挖掘查询中提供。对于类特征,目标类是要特征化的类,而对比类是不在目标类中的可比较数据。2使用保守的AOI进行预相关分析:这一步识别属性和维的集合,选择的相关性度量用于它们。由于维的不同层次对于给定的类具有很不相同的相关性,原则上,定义维概念层的每个属性都应当包含在相关分析中。通过删除或泛化具有大量不同值的属性(如,name和phone),面向属性的归纳(AOI)可以用来进行一些预相关分析。对于概念描述,具有大量的不同值的属性多半没有意义。保守一点,这里进行的AOI使用的属性分析阈值要合理的大,使得更多的(但非所有的)属性在进一步相关分析(下面的步骤3)中被考虑。这样使用AOI得到的关系称作挖掘任务的候选关系。3使用选定的相关分析度量删除不相关和弱相关属性:使用选定的相关分析度量,评估候选关系中的每个属性。此步所用的相关性度量可以建立在数据挖掘系统中,或由用户提供。例如,可以使用上面介绍的信息增益度量。根据计算的属性与数据挖掘任务的相关性,对属性排序(即确定秩)。然后删除与类描述任务不相关或弱相关的属性。可以设置一个阈值来定义“弱相关”。其结果为初始目标类工作关系和初始对比类工作关系。4使用AOI产生概念描述:使用一组不太保守的属性泛化阈值进行AOI。如果类描述任务是类特征,这里只包含初始目标类工作关系。如果类描述任务是类比较,初始目标类工作关系和初始对比类工作关系都要包含在分析中。基于改进光流和HMM的人脸表情识别研究本文利用特征化与比较中所用的属性相关分析成功对人脸表情特 征子区域进行了相关性分析,对多个子区域特征进行了相关度由高到底的排序, 从众多特征中做出了选择。 在判断一个样本属于哪个类时,用这个样本或类的属性(特征)判断,但是一般样本或类有多个属性,对于我们来说,确定哪些属性应该包含在类特征分析中是比较困难的。如果包含的属性太少,会造成特征不完整;如果包含的属性太多,也会降低系统的性能,甚至加入干扰信息。我们希望对任何一个样本以属性值分类,现在的问题是选择哪些属性作为分类属性。属性分析就是要解决这一类问题。属性的相关性要根据属性区分一个类和其他类的能力来评估。属性相关分析的基本思想是计算某种度量,用于量化属性与给定类或概念的相关性。这种度量有很多,如信息增益、索引、不确定性和相关系数等。 选择一个样本空间,根据已有的知识给每一个样本赋予一个类标号。设共有m个类,样本有属性等等,我们希望对任何一个样本以属性分类。在样本数很大时一个任意样本属于类的可能性是,其中是集合中对象的总数。对一个给定的样本分类所需的期望信息是: 属性可以依据值在样本空间上产生一个划分,设将划分为个子集,其中,包含中值为的那些样本。设包含类的个样本。根据的这种划分的期望信息称作的熵。它是加权平均: 上该划分的获得的信息增益定义为:运用这种相关性分析方法,我们可以计算出定义中样本的每一个属性的信息增益。具有最高信息增益的属性是具有最高区分度的属性。通过计算信息增益,可以得到属性的秩评定。这种秩评定可用于相关分析,选择用于概念描述的属性。 将上文中检测出的特征子区域作为属性,在这些属性中要挖掘出具有较好区分度的属性,分别计算各个子区域特征的信息增益,从而对每个属性按此划分的信息增益排序可得每个属性的区分能力由大到小的排列顺序。具体步骤为选择若干组表情序列表情变化最为显著时的图片,分别测量各子
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 导数习题中档题(附答案)
- 2025-2026学年山西省吕梁市兴县数学四年级下学期期末学业质量监测试题含答案解析
- 信息员思想动态报告2026(3篇)
- 财务审计考试题目及答案解析
- 人道主义考试题目及参考答案
- 换电模式考试题目及答案
- 英语书法考级考试题目及参考答案
- 教材教法测试题与答案解析
- ISO 3691-62021 工业车辆安全要求和验证第6部分负担和人员运输工具标准立项发展报告
- 化工高工考试相关题目及答案分享
- 2026年昆山经济技术开发区公开招聘社区编外工作人员18人考试备考题库及答案详解
- 抗耐药革兰阴性菌治疗指南2026
- 2026年四川德阳电子科技大学德阳研究院(德阳三星湖传感技术产业研究中心)面向社会公开招聘3人笔试备考试题及答案详解
- 2026CSCO结直肠癌诊疗指南解读课件
- 2026年留疆战士考试题库及答案含解析
- 《中国古代文学》课程思政教学设计一等奖
- 外研版八年级英语上册各单元作文范文
- 《煤矿井下供电计算》培训课件2024
- 《项目管理学》课件
- 《广西基本医疗保险医疗费用申报表》
- 重庆市长寿区某工程岩土勘察报告
评论
0/150
提交评论