厦门大学数据挖掘数据准备课件_第1页
厦门大学数据挖掘数据准备课件_第2页
厦门大学数据挖掘数据准备课件_第3页
厦门大学数据挖掘数据准备课件_第4页
厦门大学数据挖掘数据准备课件_第5页
已阅读5页,还剩53页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

厦门大学数据挖掘数据准备§3.1问题的提出

我们在上面已经提及到,随着各种技术的不断发展,收集数据的技术和渠道日益广泛,比如银行业通过信用卡消费记录,连锁超市通过POS机记录销售情况,企业通过专题市场调查或者直接通过向外购买数据来搜集信息等等,这些收集到的数据储存到企业的数据库或数据仓库中,构成了企业用于数据挖掘的源数据.但是由于各种各样的原因,如市场调查中的无回答,数据输入错误等,导致了源数据的各种质量问题.例如,数据缺失、异常点的出现等,都会为数据的挖掘带来困难.1/7/20242

数据准备是模型开发过程中最重要的步骤之一.从最简单的分析到最复杂的模型,所使用的数据质量是项目成功的关键.好的数据和有效的技术一样,决定着一个模型产生有力结果的能力.因此,在本章我们探讨数据的准备.1/7/20243§3.2数据选择一、数据读取

数据准备的第一步骤就是获得具有可用格式的数据.根据所开发的模型类型的不同,可以将所有的数据中提取或者从外部数据源中寻找数据.如果要用现有的数据进行数据的开发,就可以直接从数据仓库里提取需要的数据.一般这些数据都具有可用的形式,如SAS数据集.如果在外部列表或潜在客户文件上开发模型,就可以在数据记录格式上进行一些选择.1/7/20244

如果所需的数据是从外部数据源或另外一个的内部数据源获得的,那么这些数据必须是ASCII格式的.ASCII文件也就是平面文件(flatfile)或文本文件,行记录或观察样本,列或字段表示与记录相关的特征或变量.ASCII文件有两种基本的长度记录格式,即固定长度格式和可变长度格式.1/7/20245二、原始数据的表述数据样本是数据挖掘过程的基本组成部分1/7/20246每个样本都用几个特征来描述,每个特征有不同类型的值。常见的类型有:数值型和分类型。数值型包括实型变量和整型变量注:具有数值型值的特征有两个重要的属性:其值有顺序关系和距离关系。

1/7/20247分类型变量的两个值可以相等或不等。一个有两个值的分类型变量原则上可以转化成一个二进制的数值型变量,这种数值型变量有两个值:0或1;而有N值的分类型变量原则上可以转化成一个二进制的数值型变量,这种数值型变量有N个值。1/7/20248

例如:如果变量“眼睛颜色”有4个值:黑色、蓝色、绿色、褐色。

特征值编码黑色1000蓝色0100绿色0010褐色00011/7/20249

三、数据分类

一种基于变量值的数据分类方法就是定性(qualitative)和定量(quantitative).定性数据也可以看作是离散型数据,是用描述性术语来区分值.例如,性别通常分为男性(M)和女性(F).有一种特殊的定性数据就是周期型数据,例如星期、月或年中的日期.1/7/202410

定量型也叫连续型或度量型,是以数字值为特征,用于开发预测.如果建立了优先规则,定性型数据也可以转换成定量型数据.如,性别就可以规定性别值为1和2,1表示“M”或男性,2表示“F”或女性.1/7/202411定量型共有四种1、标称数据(nominaldata).

表示类别或属性的数值数据,如表示性别的数字值.表示性别的数字值(1或2)就是标称数据值.标称数据的一个重要特性是它没有相关重要性.如,即使男性=1,女性=2,也不意味着女性的值是男性的2倍或更高.对于建模来说,只有两个值的标称变量应编码为0和1.

1/7/202412

2.序数数据(ordinaldata).

序数数据是表示有相对重要性的类别的数值数据,可用于给强度、重要性分等级.例如,用1-5表示用户对某产品的质量评价,分别表示很差、较差、中等、较好、很好.1/7/2024133.间隔数据(intervaldata).

间隔数据是有相对重要性,没有0点的数值数据.对它而言,加、减是有意义的操作.例如,可以用更详细的数字来分析产品质量的好坏,可以用0-100之间的数字具体分析产品之间的差距.1/7/2024144.连续数据(continuousdata).连续数据是开发预测模型时最常用的数据,适用于所有基本的算术运算,包括加、减、乘、除.大多数业务数据如销售额、余款、差额等都是连续数据.1/7/202415

另一种数据分类维度是基于数据与时间有关的行为特性.我们把那些不随时间的变化而变化的数据称为静态数据.而另一部分随时间变化而变化的属性值,我们称之为动态数据或时间数据.在大多数的数据挖掘算法中都使用的静态数据,若要使用动态数据,则需要进行特殊的考虑和预处理.

这方面的内容将在后面介绍.1/7/202416§3.3数据预处理一、噪声数据的处理

噪声(noise)是一个被测变量中的随机误差或偏差.下面我们将要讨论给定一个数值型属性,要如何平滑数据去除噪声的方法.1.数据的平整

一个数值型的特征y可能包括许多不同的值,这些数据之间的小小差异也许并不重要,但是却有可能影响到挖掘方法的性能甚至最终结果.实际上我们也可以把这些数据之间的差异看成是同一数值的随机变差,因此有时对这些数据进行平整处理还是很重要的.1/7/2024171/7/202418

有些情况下的平整算法比较复杂,这将在以后的章节详细讨论.减少不同的数值数目意味着同时减少了数据空间的维度,这对数据挖掘的方法十分有利.这样的平整方法可用于将连续型特征分解成一系列离散二元“真假”值的特征.1/7/2024192.Bin方法.Bin方法也就是分箱方法,是通过利用相应被平滑数据点的“邻居”(即周围的值),对一组排序数据进行平滑.排序成的这些数据被分配到一些“桶”或箱中.由于Bin方法考察的是相邻的值,因此它进行局部平滑.1/7/202420下面给出了一些Bin的方法技术1/7/2024211/7/2024221/7/2024233.聚类方法.通过聚类分析可以检测到异常数据,也就是孤立点.聚类将相似或相邻近的数据聚合到一起形成了各个聚类集合.直观地看,落在聚类集合之外的值就被认为是孤立点.孤立点之值作为噪声处理,将其删除,试用“聚类”中心值代替.有关聚类分析的思想和方法将在第五章中详细讨论.1/7/2024244.计算机与人工检查结合.这也是一种识别孤立点的方法.例如:在实际应用中,使用信息理论度量可以帮助识别手写符号库中的异常模式.度量值反映要判断的字符与已知的符号要相比的“差异”程度.孤立点模式可能是提供有用的信息(识别有用的数据异常),也可能是错误的信息.将所识别出的孤立点输出到一个列表中,然后使用人工对这一列表中的孤立点进行检查,识别出真正的垃圾,这种人机结合的方法要比单单使用人工来搜索整个数据库快得多了.在其后的数据挖掘中,这些垃圾模式将由数据库中清除掉.1/7/2024255.回归分析法可以通过回归关系,根据大量统计数据,找出变量之间在数量变化方面的统计规律,从而消除变量之间的随机关系,以达到拟合函数对数据平滑的目的.例如可以借助线性回归(linearregression),拟合一个变量与其他多个变量之间的关系,这样就可以用这一关系以一组变量值来帮助预测另一个变量.通过回归分析可以消除随机因素,除去噪声.1/7/2024266.样条方法样条方法是以适当控制通过一组给定的数据点的曲线.B样条(Basicsplines)在样版权法的理论和应用研究中起着很基本的作用.局部性质是B样条曲线最重要的性质之一,在部分参数区域上的一点到多与k+1个控制顶点有关,与其他的无关,因此改变这部分的控制顶点至多影响到这部分的曲线,其余不会受到影响.它在每曲线段内部是无限次可微,并且随着次数k的升高,曲线会越来越光滑.通过用B样条去拟合数据,可以经过调整增加曲线的光滑度去除噪声.1/7/202427二、异常的分析1/7/2024281/7/2024292.距离检测法例如:数据集为:S={S1,S2,S3,S4,S5,S6,S7}={(2,4),(3,2),(1,1),(4,3),(1,6),(5,3),(4,2)}欧氏距离d=[(X1-X2)2+(Y1-Y2)2]1/2取阈值距离为d=31/7/2024301/7/202431

根据所用程序的结果和所给的阈值,可选择S3和S5作为异常点。1/7/2024321/7/202433三、缺失数据1/7/2024341/7/2024351/7/2024361/7/2024371/7/202438

我们看一个替代的例子

注1:缺点是替代值并不是正确值,会引起数据的偏差。

注2:假设这些丢失值对最终的数据挖掘结果没有任何影响,我们可以将一个丢失值的样本扩展成为一组人工样本(会引起样本的组合爆炸)。

例如:如果一个三维样本被假定为,其中第二个特征值丢失,这样在特征定义内产生5个人工样本:1/7/202439§3.4数据变换一、标准化

一些数据挖掘方法,需要对数据进行标准化以获得最佳的效果。

1、小数缩放小数缩放移动小数点,但是要仍然保持原始数据的特征。典型的缩放是保持数值在-1和1范围内。可以用格式描述1/7/202440

2、最小-最大标准化最小-最大标准化的格式:

注:这种转换可能会导致标准化值无意识的集中。1/7/2024413、标准差标准化标准差标准化的格式是

其中:是均值;是标准差1/7/202442二、高维度问题大多数数据挖掘问题的出现是因为有大量的样本具有不同类型的特征。此外,这些样本往往是高维度的,这就意味着它们有相当大数目的可测量特征。大型数据集中这种高维现象会产生“高维祸根”(维数灾),这种现象可以用高维空间几何学来解释,这是数据挖掘问题的典型。1/7/202443

1、数据集的大小随维数呈指数增长,这个数据集在一个n维空间中生成数据点的相同密度

例如:n个数据点的一维样本,其密度令人满意的,那么,要在k维空间中获得同样的密度,需要nk个数据点。高维空间的物体比低维空间的物体拥有更大的面积。高维数据有四大属性:1/7/202444

2、如果想得到相同比例的数据子样,在高维空间中需要一个更大的半径才能把一小部分数据点放入。

超立方体的边界长度公式是e(p)=p1/d,d是维数,p是预先指定的子样本。1/7/202445

3、在高维空间中,数据点与点之间的距离变大。几乎每一个点都比其他样本点更接近某一个边界。

对容量为n的样本而言,在d维空间中数据点之间的期望距离为

例如:对于一个10000个点的二维空间期望距离为

对于一个10000个点的10维空间期望距离为

这里要注意:到边界的距离最大的点是在分布的中心处,所有维数最大距离的规范值是0.51/7/202446

4、几乎每一个点都是异常点随着空间维数的增大,预测点到分类点中心的距离也在增大。

注意:在处理高维空间的有限样本时,“高维祸根”会带来严重的后果。

从1和2中可以看到对高维度样本进行局部评估的难度;3和4说明对一个给定的点做预测响应的困难。.1/7/2024471/7/2024481/7/202449三、差值和比率

设数值型变量的数值为,其差值转换为;比率转换为。1/7/202450

应该注意:有时是对于样本的不同属性进行转换。例如:在很多的医学数据集中,一个病人有两个属性特征,身高和体重,应用表明用一个新的叫做身体素质指标——体重和身高加权比,来反映诊断结果会更好。

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论