数据挖掘的模型及计算方式_第1页
数据挖掘的模型及计算方式_第2页
数据挖掘的模型及计算方式_第3页
数据挖掘的模型及计算方式_第4页
数据挖掘的模型及计算方式_第5页
已阅读5页,还剩270页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、数据挖掘导论相关的参考文献1 M. Berryy and G. Liinoff, Dataa Miniing Teechniqques, John Wileyy, 199972 Willliam S. Cllevelaand, TThe Ellementts of Graphhing DData, revissed, Hobaart Prress, 19943 Howward WWainerr, Vissual RRevelaationss, Copeernicuus, 199974 R.KKenneddy, Leee, Reeed, aand Vaan Royy, Sollving Patt

2、eern Reecogniition Probllem , Prenttice-HHall, 19985 U. Fayyaad, Piiatetssky-Shhapiroo, Smyyth, aand Utthurussamy, Advannces iin KnoowledggeDiscoveery annd Datta Minning, MIT PPress, 199666 Dorrian PPyle, Data Prepaaratioon forr Dataa Miniing, Morggan Kaaufmannn, 199997 C. Westpphal aand T. Blaxxton

3、, Data Mininng Sollutionns, Johnn Wileey, 199988 Vassant DDhar aand Rooger SStein, Seveen Metthods for TTransfforminng Corrporatte Datta inttoBusinesss Inttelliggence, Prenntice Hall 19979 Briieman, Freiidman, Olshhen, aand Sttone, Classsificaation and RRegresssion Treess,Wadsworrth, 1198410 J. R. Q

4、Quinlaan, C44.5: PPrograams foor Macchine Learnning, Morgaan Kauufmannn, 19992目录 HYPERLINK l a1 介绍 HYPERLINK l a2 什么是数据挖掘掘 HYPERLINK l a3 数据挖掘:不能能干什么 HYPERLINK l a4 数据挖掘和数据据仓库 HYPERLINK l a5 数据挖掘和在线线分析处理(OLAP) HYPERLINK l a6 数据挖掘,机器器学习和统计计 HYPERLINK l a7 软硬件发展对数数据挖掘的影影响 HYPERLINK l a8 数据挖掘应用 HYPERLI

5、NK l a9 成功的数据挖掘掘 HYPERLINK l b1 描述型数据挖掘掘 HYPERLINK l b2 统计和可视化 HYPERLINK l b3 聚集(分群) HYPERLINK l b4 关联分析 HYPERLINK l b5 预言型数据挖掘掘 HYPERLINK l b6 你需要选择的 HYPERLINK l b7 一些术语 HYPERLINK l b8 分类(Classsificcationn) HYPERLINK l b9 回归(Regrressioon) HYPERLINK l b10 时间序列(Tiime seeries) HYPERLINK l b11 数据挖掘模型和和

6、算法 HYPERLINK l b12 神经网络(Neeural netwoorks) HYPERLINK l b13 决策树(Deccisionn treees) HYPERLINK /zs19.htm 数据挖掘过程介绍什么是数据挖掘掘当今数据库的容容量已经达到到上万亿的水水平(T)- 11,000,000,0000,0000个字节。在在这些大量数数据的背后隐隐藏了很多具具有决策意义义的信息,那那么怎么得到到这些“知识”呢?也就是是怎样通过一一颗颗的树木木了解到整个个森林的情况况?计算机科学对这这个问题给出出的最新回答答就是:数据据挖掘,在“数据矿山”中找到蕴藏藏的“知识金块”,帮助企业业减少

7、不必要要投资的同时时提高资金回回报。数据挖挖掘给企业带带来的潜在的的投资回报几几乎是无止境境的。世界范范围内具有创创新性的公司司都开始采用用数据挖掘技技术来判断哪哪些是他们的的最有价值客客户、重新制制定他们的产产品推广策略略(把产品推推广给最需要要他们的人),以以用最小的花花费得到最好好的销售。数据挖掘是一个个利用各种分分析工具在海海量数据中发发现模型和数数据间关系的的过程,这些些模型和关系系可以用来做做出预测。数据挖掘的第一一步是描述数据 - 计算统计计变量(比如如平均值、均均方差等),再再用图表或图图片直观的表表示出来,进进而可以看出出一些变量之之间的相关性性(比如有一一些值经常同同时出现

8、)。选选择正确的数数据源对整个个数据挖掘项项目的成败至至关重要,在在后面数据挖挖掘的步骤中中我们会着重重强调这一点点。单单是数据描述述并不能为人人们制订行动动计划提供足足够的依据,你你必须用你的的这些历史数数据建立一个个预言模型,然然后再用另外外一些数据对对这个模型进进行测试。一个好好的模型没必必要与数据库库中的数据1100%的相相符(城市交交通图也不是是完全的实际际交通线路的的等比缩小),但但他在你做决决策时是一个个很好的指南南和依据。最后一步是验证证你的模型。比比如你用所有有对你的产品品推广计划做做出回应的人人的数据库做做了一个模型型,来预测什什么样的人会会对你的产品品感兴趣。你你能在得到

9、这这个模型后就就直接利用这这个模型做出出决策或采取取行动吗?还还是更稳妥一一点先对一小小部分客户做做一个实际的的测试,然后后再决定?数据挖掘:不能能干什么数据挖掘是一个个工具,而不不是有魔力的的权杖。它不不会坐在你的的数据库上一一直监视着数数据库,然后后当他发现有有意义的模型型时给你发一一封电子邮件件。他仍然需需要了解你的的业务,理解解你的数据,弄弄清分析方法法。数据挖掘掘只是帮助商商业人士更深深入、更容易易的分析数据据 - 他无法告诉诉你某个模型型对你的企业业的实际价值值。而且数据据挖掘中得到到的模型必须须要在现实生生活中进行验验证。注意数据挖掘中中得到的预言言模型并不会会告诉你一个个人为什

10、么会会做一件事、采采取某个行动动,他只会告告诉你他会这样做,为什什么要人去考考虑。比如,数数据挖掘可能能会告诉你,如如果这个人是是男的、年收收入在5万到6万之间,那那么他可能会会买你的商品品/服务。你可可能会利用这这条规则,集集中向这类人人推销你的商商品而从中获获益,但是数数据挖掘工具具不会告诉你你他们为什么么会买你的东东西,也不能能保证所有符符合这条规则则的人都会买买。为了保证数据挖挖掘结果的价价值,你自己己必须了解你你的数据,这这一点至关重重要。输入数数据库中的异异常数据、不不相关的字段段或互相冲突突的字段(比比如年龄和生生日不一致)、数数据的编码方方式等都会对对数据挖掘输输出结果的质质量

11、产生影响响。虽然一些些算法自身会会对上面提到到的这些问题题做一些考虑虑,但让算法法自己做所有有这些决定是是不明智的。数据挖掘不会在在缺乏指导的的情况下自动动的发现模型型。你不能这这样对数据挖挖掘工具说,“帮我提高直接邮件推销的响应率”,你应该让数据挖掘工具找(1)对你的推销回应的人,或(2)即回应又做了大量订单的人的特征。在数据挖掘中寻找这两种模型是很不相同的。虽然数据挖掘工工具使你不必必再掌握艰深深的统计分析析技术,但你你仍然需要知知道你所选用用的数据挖掘掘工具是如何何工作的,他他所采用的算算法的原理是是什么。你所所选用的技术术和优化方法法会对你的模模型的准确度度和生成速度度产生很大影影响。

12、数据挖掘永远不不会替代有经经验的商业分分析师或管理理人员所起的的作用,他只只是提供一个个强大的工具具。每个成熟熟的、了解市市场的公司都都已经具有一一些重要的、能能产生高回报报的模型,这这些模型可能能是管理人员员花了很长时时间,作了很很多调查,甚甚至是经过很很多失误之后后得来的。数数据挖掘工具具要做的就是是使这些模型型得到的更容容易,更方便便,而且有根根据。数据挖掘和数据据仓库大部分情况下,数数据挖掘都要要先把数据从从数据仓库中中拿到数据挖挖掘库或数据据集市中(见见图1)。从数据据仓库中直接接得到进行数数据挖掘的数数据有许多好好处。就如我我们后面会讲讲到的,数据据仓库的数据据清理和数据据挖掘的数

13、据据清理差不多多,如果数据据在导入数据据仓库时已经经清理过,那那很可能在做做数据挖掘时时就没必要在在清理一次了了,而且所有有的数据不一一致的问题都都已经被你解解决了。数据源数据仓库数据源数据仓库各分公司数据集市分析数据集市数据挖掘数据集市图1:数据挖掘库从数据仓库中得出数据挖掘库可能能是你的数据据仓库的一个个逻辑上的子子集,而不一一定非得是物物理上单独的的数据库。但但如果你的数数据仓库的计计算资源已经经很紧张,那那你最好还是是建立一个单单独的数据挖挖掘库。当然为了数据挖挖掘你也不必必非得建立一一个数据仓库库,数据仓库库不是必需的的。建立一个个巨大的数据据仓库,把各各个不同源的的数据统一在在一起

14、,解决决所有的数据据冲突问题,然然后把所有的的数据导到一一个数据仓库库内,是一项项巨大的工程程,可能要用用几年的时间间花上百万的的钱才能完成成。只是为了了数据挖掘,你你可以把一个个或几个事务务数据库导到到一个只读的的数据库中,就就把它当作数数据集市,然然后在他上面面进行数据挖挖掘。数据源数据挖掘库数据源数据挖掘库图2:数据挖掘库从事务数据库中得出数据挖掘和在线线分析处理(OLAP)一个经常问的问问题是,数据据挖掘和OLLAP到底有有何不同。下下面将会解释释,他们是完完全不同的工工具,基于的的技术也大相相径庭。OLAP是决策策支持领域的的一部分。传传统的查询和和报表工具是是告诉你数据据库中都有什

15、什么(whaat happpenedd),OLAPP则更进一步步告诉你下一一步会怎么样样(Whatt nextt)、和如果果我采取这样样的措施又会会怎么样(WWhat iif)。用户户首先建立一一个假设,然然后用OLAAP检索数据据库来验证这这个假设是否否正确。比如如,一个分析析师想找到什什么原因导致致了贷款拖欠欠,他可能先先做一个初始始的假定,认认为低收入的的人信用度也也低,然后用用OLAP来验验证他这个假假设。如果这这个假设没有有被证实,他他可能去察看看那些高负债债的账户,如如果还不行,他他也许要把收收入和负债一一起考虑,一一直进行下去去,直到找到到他想要的结结果或放弃。也就是说,OLLA

16、P分析师师是建立一系系列的假设,然然后通过OLLAP来证实实或推翻这些些假设来最终终得到自己的的结论。OLLAP分析过过程在本质上上是一个演绎绎推理的过程程。但是如果果分析的变量量达到几十或或上百个,那那么再用OLLAP手动分分析验证这些些假设将是一一件非常困难难和痛苦的事事情。数据挖掘与OLLAP不同的的地方是,数数据挖掘不是是用于验证某某个假定的模模式(模型)的的正确性,而而是在数据库库中自己寻找找模型。他在在本质上是一一个归纳的过过程。比如,一一个用数据挖挖掘工具的分分析师想找到到引起贷款拖拖欠的风险因因素。数据挖挖掘工具可能能帮他找到高高负债和低收收入是引起这这个问题的因因素,甚至还还

17、可能发现一一些分析师从从来没有想过过或试过的其其他因素,比比如年龄。数据挖掘和OLLAP具有一一定的互补性性。在利用数数据挖掘出来来的结论采取取行动之前,你你也许要验证证一下如果采采取这样的行行动会给公司司带来什么样样的影响,那那么OLAPP工具能回答答你的这些问问题。而且在知识发现现的早期阶段段,OLAPP工具还有其其他一些用途途。可以帮你你探索数据,找找到哪些是对对一个问题比比较重要的变变量,发现异异常数据和互互相影响的变变量。这都能能帮你更好的的理解你的数数据,加快知知识发现的过过程。数据挖掘,机器器学习和统计计数据挖掘利用了了人工智能(AI)和统计分析的进步所带来的好处。这两门学科都致

18、力于模式发现和预测。数据挖掘不是为为了替代传统统的统计分析析技术。相反反,他是统计计分析方法学学的延伸和扩扩展。大多数数的统计分析析技术都基于于完善的数学学理论和高超超的技巧,预预测的准确度度还是令人满满意的,但对对使用者的要要求很高。而而随着计算机机计算能力的的不断增强,我我们有可能利利用计算机强强大的计算能能力只通过相相对简单和固固定的方法完完成同样的功功能。一些新兴的技术术同样在知识识发现领域取取得了很好的的效果,如神神经元网络和和决策树,在在足够多的数数据和计算能能力下,他们们几乎不用人人的关照自动动就能完成许许多有价值的的功能。数据挖掘就是利利用了统计和和人工智能技技术的应用程程序,

19、他把这这些高深复杂杂的技术封装装起来,使人人们不用自己己掌握这些技技术也能完成成同样的功能能,并且更专专注于自己所所要解决的问问题。软硬件发展对数数据挖掘的影影响使数据挖掘这件件事情成为可可能的关键一一点是计算机机性能价格比比的巨大进步步。在过去的的几年里磁盘盘存储器的价价格几乎降低低了99%,这在在很大程度上上改变了企业业界对数据收收集和存储的的态度。如果果每兆的价格格是¥10,那存放放1TB的价格格是¥10,0000,0000,但当每兆兆的价格降为为1毛钱时,存存储同样的数数据只有¥100,0000!计算机计算能力力价格的降低低同样非常显显著。每一代代芯片的诞生生都会把CPPU的计算能能力

20、提高一大大步。内存RRAM也同样样降价迅速,几几年之内每兆兆内存的价格格由几百块钱钱降到现在只只要几块钱。通通常PC都有64M内存,工工作站达到了了256M,拥拥有上G内存的服务务器已经不是是什么新鲜事事了。在单个CPU计计算能力大幅幅提升的同时时,基于多个个CPU的并行行系统也取得得了很大的进进步。目前几几乎所有的服服务器都支持持多个CPUU,这些SMPP服务器簇甚甚至能让成百百上千个CPPU同时工作作。基于并行系统的的数据库管理理系统也给数数据挖掘技术术的应用带来来了便利。如如果你有一个个庞大而复杂杂的数据挖掘掘问题要求通通过访问数据据库取得数据据,那么效率率最高的办法法就是利用一一个本地

21、的并并行数据库。所有这些都为数数据挖掘的实实施扫清了道道路,随着时时间的延续,我我们相信这条条道路会越来来越平坦。数据挖掘应用由于数据挖掘带带来的显著的的经济效益,使使数据挖掘越越来越普及。他他不仅能用于于控制成本,也也能给企业带带来效益。很多企业都在利利用数据挖掘掘技术帮助管管理客户生命命周期的各个个阶段,包括括争取新的客客户、在已有有客户的身上上赚更多的钱钱、和保持住住好的客户。如如果能够确定定好的客户的的特点,那么么就能提供为为客户提供针针对性的服务务。比如,已已经发现了购购买某一商品品的客户的特特征,那么就就可以向那些些具有这些特特征但还没有有购买此商品品的客户推销销这个商品;找到流失

22、的的客户的特征征就可以,在在那些具有相相似特征的客客户还未流失失之前进行针针对性的弥补补,因为保留留一个客户要要比争取一个个客户便宜的的多。数据挖掘可以应应用在各个不不同的领域。电电讯公司和信信用卡公司是是用数据挖掘掘检测欺诈行行为的先行者者。保险公司司和证券公司司也开始采用用数据挖掘来来减少欺诈。医医疗应用是另另一个前景广广阔的产业:数据挖掘可可以用来预测测外科手术、医医疗试验和药药物治疗的效效果。零销商商更多的使用用数据挖掘来来决定每种商商品在不同地地点的库存,通通过数据挖掘掘更灵活的使使用促销和优优惠卷手段。制制药公司通过过挖掘巨大的的化学物质和和基因对疾病病的影响的数数据库来判断断哪些

23、物质可可能对治疗某某种疾病产生生效果。成功的数据挖掘掘有保证数据挖掘掘成功的两个个关键要素。一一是准确的定定义你所要解解决的问题,定定位准确的问问题通常会带带来最好的回回报。二是使使用正确的数数据,选定了了你所能得到到的数据,也也许还要从外外部购买数据据,你需要对对这些数据做做有效的数据据整合和转换换。 HYPERLINK 数据挖掘入门 二 HYPERLINK 数据挖挖掘入门 三三 数据挖掘过程在实施数据挖掘掘之前,先制制定采取什么么样的步骤,每每一步都做什什么,达到什什么样的目标标是必要的,有有了好的计划划才能保证数数据挖掘有条条不紊的实施施并取得成功功。很多软件件供应商和数数据挖掘顾问问公

24、司投提供供了一些数据据挖掘过程模模型,来指导导他们的用户户一步步的进进行数据挖掘掘工作。比如如SPSS的5A-评估估(Asseess),访访问(Acccess),分分析(Anaalyze),行行动(Actt),自动化化(Autoomate),和和SAS的SEMMAA-采样(Sammple),探探索(Expplore),修修正(Moddify),建建模(Moddel),评评估(Asssess)。最近,一些软件件供应商和用用户组织成立立了行业协会会,包括NCCR Sysstems Enginneerinng Coppenhaggen(丹麦麦)Daimmler-BBenz AAG(德国)SPPSS/

25、Innternaal Sollutionns Ltdd.(英国),和和OHRA Verzeekerinngen een Bannk Greep B.VV(荷兰)。这这个组织的目目的就是建立立跨行业数据据挖掘过程标标准(CRISPP-DM),在在1999年9月的时候CRRISP-DDM仍在建立立之中。我们下面详细讨讨论Two Crowss公司的数据据挖掘过程模模型,他与正正在建立的CCRISP-DM有许多多相似之处。数据挖掘过程模模型虽然我们把各个个步骤按顺序序排列,但要要注意数据挖挖掘过程并不不是线性的要取得好的的结果就要不不断反复重复复这些步骤。比比如在“分析数据”时你可能觉觉得在“建立数据

26、挖挖掘数据库”时作的不够够好,要往里里面添加一些些新的数据。这些基本数据挖挖掘步骤包括括:1. 定定义商业问题题2. 建建立数据挖掘掘模型3. 分分析数据4. 准准备数据5. 建建立模型6. 评评价模型7. 实实施1. 定定义商业问题题。在开始知知识发现之前前最先的同时时也是最重要要的要求就是是了解的你的的数据和业务务问题。如果果事先没有这这种了解,没没有任何算法法,不管他有有多么复杂玄玄妙,能够为为你提供有价价值的结果,即即使有也难以以使人信赖他他。缺少了这这些背景知识识,你就没办办法明确定义义要解决的问问题,不能为为挖掘准备数数据,也很难难正确的解释释得到的结果果。要想充分分发挥数据挖挖掘

27、的价值,必必须要对你的的目标有一个个清晰明确的的定义,即决决定到底想干干什么。比如如你说你想提提高直接邮件件推销的用户户回应时,你你想做的可能能是“提高用户响响应率”,也可能是是“提高一次用用户回应的价价值”,要解决这这两个问题而而建立的模型型几乎是完全全不同的,你你必须做出决决定。有效的的问题定义还还应该包含一一个对你的知知识发现项目目得到结果进进行衡量的标标准。当然还还应该有整个个项目预算和和理性的解释释。2. 建建立数据挖掘掘库。连同下下面的两个步步骤,这三步步构成了数据据预处理的核核心。这三步步和在一起比比其他所有的的步骤加在一一起所花得时时间和精力还还多。一旦你你从数据挖掘掘的结果中

28、学学到一些什么么之后,你很很可能要修改改数据以得到到更好得结果果,因此就需需要把数据准准备和数据挖挖掘不断的反反复进行。数数据准备工作作大概要花去去整个数据挖挖掘项目的550%-900%的时间和和精力。应该把要挖掘的的数据都收集集到一个数据据库中。注意意这并不是说说一定要使用用一个数据库库管理系统。根根据要挖掘的的数据量的大大小、数据的的复杂程度、使使用方式的不不同,有时一一个简单的平平面文件或电电子表格就足足够了。一般来说,直接接在公司的数数据仓库上进进行数据挖掘掘是不合适的的。你最好建建立一个独立立的数据集。数数据挖掘会使使你成为数据据仓库非常活活跃的用户,这这可能会带来来一些资源申申请上

29、的问题题。你需要经经常把许多表表连接在一起起,访问数据据仓库的细节节数据。一个个简单的试验验在数据仓库库内都要很多多步才能完成成。大部分情况下你你肯定需要修修改要挖掘的的数据。而且且还会遇到把把企业外部的的数据拿到数数据仓库内和和在原有的表表中增加新的的字段的情况况。其他的数数据挖掘用户户可能也要对对数据仓库进进行与您相似似或完全不同同的修改。而而对数据仓库库管理员来说说,这恐怕是是他最不愿意意遇到的事情情。需要建立独立的的数据挖掘库库的另一个理理由是,数据据仓库可能不不支持你要对对数据进行各各种复杂分析析所需的数据据结构。这包包括对数据进进行统计查询询,多维分析析,和各种复复杂的图表和和可视

30、化。最后,你可能希希望把这些要要挖掘的数据据存贮在与公公司的数据仓仓库在物理设设计上不同的的DBMS上。人人们越来越倾倾向于使用DDBMS本身身很好的支持持数据挖掘的的数据库程序序,这样能使使数据挖掘工工作进行的更更容易一些。当当然如果你的的数据仓库允允许你建立一一个在逻辑上上独立的数据据库并且在计计算资源上也也足够的话,那那么在他上面面进行数据挖挖掘也是可以以的。可以把建立数据据挖掘库分成成下面几个部部分:a. 数数据收集b. 数数据描述c. 选选择d. 数数据质量评估估和数据清理理e. 合合并与整合f. 构建元数据据g. 加加载数据挖掘掘库h. 维维护数据挖掘掘库注意这些步骤并并不需要一定

31、定要按步骤执执行,而应该该按需要进行行。比如你可可能在收集数数据时就开始始构建元数据据,并随着工工作的进行不不断的对其进进行修改。在在数据整合和和数据质量评评估过程中了了解到得东西西也有可能是是你修改最初初的数据选择择。a. 数数据收集。确确定要挖掘的的数据源。可可能一些外部部的数据也是是必须的,需需要在公共数数据库中获取取(人口统计计或天气数据据)或向数据据拥有者购买买(比如信用用卡使用数据据)。用以一个数据搜搜集报告把所所需的各种不不同的数据源源的属性列出出来。此报告告至少应包含含如下的内容容: 数据源(内内部数据库或或外部提供者者) 拥有者 负责维护护此数据的人人/组织 DBA 费用(如

32、如果需要购买买) 存储方式式(如:Orracle数数据库、MSSAM文件等等) 表、字段段、记录的数数目 字节数 物理存储储方式(CDD-ROM、磁磁带、服务器器等) 安全需求求 使用上的的限制 隐私上的的需求注意一旦应用了了在安全和隐隐私上有特殊殊限制的数据据,那么你的的数据挖掘库库在安全和隐隐私上也就继继承了同样的的限制。比如如许多欧洲的的数据在隐私私上的限制要要比美国严格格的多。b. 数数据描述。描描述每个文件件和数据库表表的内容。数数据描述报告告中应包含如如下内容: 字段/列的数目 字段是空空(缺值)的的数目/百分比 字段的名名字对每个字段 数据类型型 定义 描述 源 计量单位位 所有

33、不同同值的个数 值的列表表 值的范围围 空值的百百分比 收集信息息(比如:怎怎么得到的,在在哪,什么条条件下) 时间频度度(Timeeframee)(每天,每每周,还是每每月) 特别时间间数据(比如如:每个周一一或每个周三三) 主键/外键关系c. 选选择。接下来来就要选择用用于数据挖掘掘的数据(源源数据的子集集)。这与对对数据进行采采样和选择预预测变量是不不同的,这里里只是粗略的的把一些冗余余或无关的数数据除去,或或由于资源的的限制、费用用的限制、数数据使用的限限制、和质量量问题而必须须做出的选择择。d. 数数据质量评估估和数据清理理。“龙生龙,凤凤生凤”对数据挖掘掘也是非常适适用的,要想想得

34、到好的模模型必须用好好的数据。数数据质量评估估就是要确定定数据的哪些些性质会最终终影响模型的的质量。你不不仅要保证数数据值的正确确性和一致性性,还要保证证这些值是按按同样的方法法记录的同一一件事情。由各种各样的数数据质量问题题。数据域中中可能包含了了不正确的值值。比如,身身份证号码被被粗心的数据据录入人员录录入了年龄。即即使每个单个个域中包含的的数据都是正正确的,但这这些域组合起起来时可能就就出现了错误误的记录,如如男性怀孕。有有时域中的值值为空。当从从多个不同的的源整合数据据时一定要注注意不同源之之间数据的一一致性。缺值是一个非常常有害的问题题。如果只要要有一个数据据域缺值就把把这个记录删删

35、除掉,那么么最后可能得得到一个很小小的数据库,同同时你得到的的这个数据库库很可能已经经丢失了实际际数据中蕴含含的一些信息息,因为你已已经改变了原原数据的组成成。缺值这件件事本身可能能就是非常有有意义的,比比如也许只有有富有的顾客客才经常忽略略“收入”这一项。你你可以增加一一个新的变量量来标识这些些缺值的记录录,然后用它它建立一个模模型,然后与与按其他方法法建立的模型型进行比较,看看哪个准确度度更高一些。另一种方法是为为缺失的值计计算一个替代代值。计算替替代值的常用用方法包括使使用形式值(为为名词变量),中中间值(为可可排序变量),平平均值(为连连续变量)。还还有一个不是是很常用的方方法是按照数

36、数据库中值的的分布规律为为缺值的字段段添值。比如如如果数据库库中包含400%男性和60%女性,那么么在为那些性性别子段缺失失的记录添值值时也按这个个比例随机赋赋值。还有一一种方法是为为这个缺值的的字段用数据据挖掘技术建建立一个预测测模型,然后后按照这个模模型的预测结结果添值,这这种方法效果果应该最好,当当然也最花时时间。承认生活并不是是十全十美是是必要的,数数据挖掘也是是一样,你也也不可能解决决所有遇到的的问题,只能能做得尽量好好一点。检查查和修正数据据质量问题是是一项非常耗耗费时间和金金钱的工作,对对解决不了的的问题,通常常你只能采取取折衷的办法法,先用现有有的数据建立立一个模型,把把问题放

37、到将将来去解决。e. 合合并与整合。如如果幸运的话话,你需要的的所有数据都都在同一个数数据库中(比比如数据仓库库),但大部部分情况下这这些数据是分分布在不同的的数据库中。数数据可能分布布在公司不同同的部门、不不同的应用中中,甚至在公公司外(人口口数据)。数据合并与整合合把来自不同同数据源的数数据合并到同同一个数据挖挖掘库中,并并且要使那些些本来存在冲冲突和不一致致的数据一致致化。不恰当当的一致化是是数据质量问问题的一个主主要来源。不不同的数据库库间在数据定定义和使用上上通常都存在在巨大的差异异。有些不一一致问题是容容易解决的,如如同一客户的的不同住址问问题。然而有有些则非常棘棘手。例如同同一个

38、客户有有不同的名字字甚至更遭的的情况多个不同的的客户标识号号码。同一个个名字被用在在不同的数据据项上(同名名异意),或或同一个数据据项用了不同同的名字(同同意不同名)。还还有单位上的的不统一。比比如人民币和和港元之间不不能不做换算算就直接加减减。f. 构建元数据据。数据收集集报告和数据据描述报告是是建立元数据据的基础。本本质上,这是是一个描述数数据库的数据据库。他用于于建立实际的的数据库和为为分析数据和和建立模型提提供辅助信息息。g. 加加载数据挖掘掘库。大多数数情况下,用用于挖掘的数数据应该放到到他自己独立立的数据库中中。如果数据据量大并且复复杂,那么他他通常是一个个RDMS,反反之只是一个

39、个简单的平面面文件即可。经经过前面所有有的搜集、整整理之后,现现在开始把这这些数据实际际的加载过来来了。依赖于于所涉及的DDBMS和操操作系统,和和数据库设计计的复杂程度度,有时这一一步也可能变变得很复杂,需需要靠专家的的帮助来完成成。h. 维维护数据挖掘掘库。挖掘库库一旦建好,就就需要对他进进行维护。需需要定期备份份;监视他的的性能;不时时的增加存储储空间或提高高性能。对存存放在DBMMS内的复杂杂的挖掘库来来说,维护他他需要计算机机专业人员来来完成。3. 分分析数据。请请察看“描述型数据据挖掘”以获得更详详细的关于可可视化、连结结分析,及其其他数据分析析方法。分析析的目的是找找到对预测输输

40、出影响最大大的数据字段段,和决定是是否需要定义义导出字段。如果数据集包含含成百上千的的字段,那么么浏览分析这这些数据将是是一件非常耗耗时和累人的的事情,这时时你需要选择择一个具有好好的界面和功功能强大的工工具软件来协协助你完成这这些事情。4. 准准备数据。这这是建立模型型之前的最后后一步数据准准备工作。可可以把此步骤骤划分成4个部分:a. 选选择变量b. 选选择记录c. 创创建新变量d. 转转换变量a. 选选择变量。理理想情况下,你你可以选择你你所有的全部部变量,把他他们输入到数数据挖掘工具具中,让他来来帮你选择哪哪些是最好的的预测变量。实实际上这样做做并不是很好好,一方面是是由于随着变变量个

41、数的增增加,模型的的建立时间也也随之上升;另一方面盲盲目的把所有有的变量都加加进去会导致致建立错误的的模型。比如如,建立预测测模型的一个个常见错误就就是把一个依依赖于目标变变量的变量(由由目标变量导导出)作为预预测变量,像像用生日来“预测”年龄。在原理上说,一一些数据挖掘掘算法自动忽忽略不相关的的变量、自动动计算相关的的(协)变量量,在实际应应用中完全依依赖这些工具具是不明智的的,毕竟最了了解你的数据据的还是你自自己。利用你你的领域知识识,你会做出出大部分正确确的选择。例例如,用身份份证号或人名名做预测变量量要么不会有有任何用处,要要么甚至降低低了其他重要要变量的影响响力。b. 选选择记录。与

42、与选择变量类类似,你可能能也想用你所所有的数据行行来建立模型型,然而如果果你的数据量量确实非常巨巨大的话,要要么要花费很很长的时间来来建立这个模模型,要么买买一台计算能能力非常强大大的机器。因此,如果数据据量特别大,进进行抽样就是是一个很好的的主意。如果果做的足够仔仔细,保证抽抽样是按真正正的随机来进进行的,采样样对大部分商商业问题来说说都不会丢失失信息。你可可以用所有的的数据建立一一个模型;你你还可以用采采样的方法根根据不同得采采样方法建立立几个模型,然然后评价这几几个模型选择择一个最好的的。我们认为为后面这种方方法得到的方方法更准确、更更健壮。你可能选择数据据中明显的异异常数据删除除掉。然

43、而在在某些情况下下,这些看来来异常的数据据可能包含了了你要建立模模型的重要信信息。基于你你对问题的理理解方式的不不同,通常可可以把这些异异常忽略掉。比比如可以把异异常认为是人人为的录入错错误。有时也需要向数数据中添加一一些新的数据据(如,那些些没有做出购购买得客户)。c. 创创建新变量。很多情况下需要从原始数据中衍生一些新的变量作为预测变量。比如,用负债占收入百分比来预测信用风险比直接用负债和收入做预测变量更准确一些,也更容易理解一些。很多变量如果组合起来(加、减、比率等)会比这些变量自身影响力更大。一些变量如果扩大它的范围也会成为一个非常好的预测变量,比如用一段时间内收入变化情况代替一个单一

44、的收入数据。d. 转转换变量。你你所选择的算算法和工具决决定了都要对对数据做哪些些转换工作。如如神经网络要要求所有的变变量都在0-1之间,因因此在这些数数据被提交到到算法之前就就必须先对不不在0,11内的变量量进行映射。同同样一些决策策树算法不接接受数值型变变量作为输入入,在使用他他们之前也要要把这些数值值映射到“高、中、低低”等。当然你你的转换方式式也在一定程程度上影响了了模型的准确确度。5. 建建立模型。对对建立模型来来说要记住的的最重要的事事是它是一个个反复的过程程。你需要仔仔细考察不同同的模型以判判断哪个模型型对你的商业业问题最有用用。你在寻找找好的模型的的过程中学到到的的东西会会启发

45、你修改改你的数据,甚甚至改变最初初对问题的定定义。一旦决定了预测测的类型之后后(分类还是是回归),就就需要为这个个预测选择模模型的类型。可可能是一棵决决策树、神经经网络、甚至至传统的数学学统计。选择择什么样的模模型决定了你你需对数据做做哪些预处理理工作。如神神经网络需要要做数据转换换,有些数据据挖掘工具可可能对输入数数据的格式有有特定的限制制,等。一旦旦所有的数据据准备好之后后,就可以开开始训练你的的模型了。为了保证得到的的模型具有较较好的精确度度和健壮性,需需要一个定义义完善的训练练验证协议。有有时也称此协协议为带指导导的学习。他他的主要思想想就是先用一一部分数据建建立模型,然然后再用剩下下

46、的数据来测测试和验证这这个得到的模模型。有时还还有第三个数数据集,称为为验证集,因因为测试集可可能受模型的的特性的影响响,这时需要要一个独立的的数据集来验验证模型的准准确性。训练和测试数据据挖掘模型需需要把数据至至少分成两个个部分:一个个用于模型训训练,另一个个用于模型测测试。如果不不使用不同的的训练和测试试集,那么模模型的准确度度就很难使人人信服。用训训练集把模型型建立出来之之后,就可以以先在测试集集数据上先试试验一把,此此模型在测试试集上的预测测准确度就是是一个很好的的指导数字,它它说明如果将将来与训练集集和测试集类类似的数据用用此模型预测测时,正确的的百分比会有有多大。这并并不能保证模模

47、型的正确性性,他只是说说相似的数据据用此模型会会得出相似的的结果。简单验证。最基基本的测试方方法是被称为为简单验证的的方法。做法法是从原始数数据中拿出一一定百分比的的数据作为测测试数据,这这个百分比大大概在5%到33%之间。注注意在把数据据库分成几部部分时,一定定要保证选择择的随机性,这这样才能使分分开的各部分分数据的性质质是一致的。先用数据库的主主体把模型建建立起来,然然后用此模型型来预测测试试集中的数据据。出现错误误的预测与预预测总数之间间的比,称为为错误率。正确确的预测与总总数的比,是是准确率(准确确率=1 - 错误率)。对对回归模型来来说,可以用用方差来描述述准确的程度度。在一次模型的

48、建建立过程中,即即使这种最简简单的验证就就要执行几十十次。例如在在训练神经网网络时,有时时每一个训练练周期就要求求在测试集上上运行一次,不不断的训练测测试,直到在在测试集上的的准确率不再再提高为止。交叉验证。如果果数据不是很很多(比如只只有几千条),那那么你可能承承受不了再把把一部分数据据拿到一边不不用,单用来来做简单验证证。交叉验证证提供了一种种让你使用全全部数据的方方法。首先把把原始数据随随机平分成两两份,然后用用一部分做训训练集另一部部分做测试集集计算错误率率,做完之后后把两部分数数据交换再计计算一次,得得到另一个错错误率,最后后再用所有的的数据建立一一个模型,把把上面得到的的两个错误率

49、率进行平均作作为最后用所所有数据建立立的模型的错错误率。更通用的算法是是n-维交叉验验证。先把数数据随机分成成不相交的nn份。比如,如如果把数据分分成10份,先把把第一份拿出出来放在一边边用作模型测测试,把其他他9份合在一起起来建立模型型,然后把这这个用90%的数据建立立起来的模型型用上面放在在一边的第一一份数据做测测试。这个过过程对每一份份数据都重复复进行一次,得得到10个不同的的错误率。最最后把所有数数据放在一起起建立一个模模型,模型的的错误率为上上面10个错误率率的平均。自举法是另一种种评估模型错错误率的技术术。在数据量量很小时尤其其适用。与交交叉验证一样样模型是用所所有的数据建建立。依

50、据所得到的模模型和你对模模型的预期结结果,你可能能修改参数用用同样的算法法再建立新的的模型,甚至至采用其他的的算法建立模模型。别的方方法说不定能能提高预测的的准确度。当当然,没有一一种算法或工工具适应所有有的数据,通通常也很难在在开始决定那那种算法对你你所面临的问问题来说是最最好的,因此此很多情况下下,需要建立立用不同的方方法(参数或或算法)几个个模型,从中中选择最好的的。6. 评评价和解释。a. 模模型验证。模模型建立好之之后,必须评评价他的结果果、解释他的的价值。记住住从测试集中中得到的准确确率只对用于于建立模型的的数据有意义义。在实际应应用中,随着着应用数据的的不同,模型型的准确率肯肯定

51、会变化。更更重要的是,准准确度自身并并不一定是选选择最好模型型的正确评价价方法。你需需要进一步了了解错误的类类型和由此带带来的相关费费用的多少。无序矩阵。对分分类问题来说说,无序矩阵阵是理解结果果的非常好的的工具。如图图9所示,无序序矩阵把预测测的结果与实实际的情况进进行对比。它它不仅说明了了模型预测的的准确情况,也也把模型究竟竟在哪里出了了问题也展示示了出来。下下表是一个简简单的无序矩矩阵,其中的的列代表数据据的实际分类类情况,行是是预测的结果果。在这张表表值中,可以以看到此模型型在总共466个B类数据中成成功预测了338个,8个出了问题题:2个预测成了了A,6个成了C。显然这比比简单的说模

52、模型总体准确确度是82%要更详细的的多(1233个成功预测测除以总共1150)。预测实际类别A类别B类别C类别A4523类别B10382类别C4640图9:无序矩阵阵在实际应用中,如如果每种不同同的预测错误误所需付出的的代价(金钱钱)也不同的的话,那么代代价最小的模模型(而不一一定是错误率率最小的模型型)就是我们们所要选择的的。例如,上上面的无序矩矩阵中,如果果每个准确的的预测会带来来¥10的收益,错错误的预测AA要付出¥5的代价,B是¥10,C是¥20,那么整整个模型的纯纯价值是:(123*¥110)-(5*¥5)-(12*¥10)-(10*¥20)=¥885然而考察下面的的无序矩阵(图图1

53、0),虽然然准确度降低低到79%(118/1150),但但纯价值却升升高了:(118*¥110)-(22*¥5)-(7*¥10)-(3*¥20)=¥940预测实际类别A类别B类别C类别A401210类别B6381类别C2140图10:另一个个无序矩阵收益表(图111)也是一种种描述模型价价值的方法。它它显示了通过过应用模型响响应(如直接接邮件推销)的的变化情况。变变化的比率称称为liftt。例如,如如果用随机抽抽取的方法选选择10%的客户户响应率是110%,而通通过模型选取取10%的用户户响应率是330%,则liftt值为3。模型解释的另一一个重要组成成部分是确定定模型的价值值。一个模型型可能

54、看起来来很有意义,但但要实施它的的话很有可能能花的钱比赚赚的钱多。图图12是一个描描述模型投资资回报率(RROI)的图图表(这里定定义 ROII为利润与开开销的比值)。注注意图中当选选取比例超过过80%时,ROI变成了了负数,ROOI最高是在在横坐标为22时。当然,也可以直直接看利润的的变化情况(利利润为收入与与花费的差值值),如图113所示:注意到我们上面面的例子中,最最大liftt在第一个1/10处(10%),最最大ROI在第2个1/10(20%),而而最大利润在在第3、4个1/10处。理想情况下,应应该按照利润润表行事,但但很多情况下下利润表并不不能很容易的的计算出来。b. 外外部验证。

55、如如前面指出的的,无论我们们用模拟的方方法计算出来来的模型的准准确率有多高高,都不能保保证此模型在在面对现实世世界中真实的的数据时能取取得好的效果果。经验证有有效的模型并并不一定是正正确的模型。造造成这一点的的直接原因就就是模型建立立中隐含的各各种假定。例例如,在建立立用户购买模模式的模型时时,可能没有有考虑通货膨膨胀的影响,但但实施模型时时通货膨胀率率突然由3%增加为17%,这显然会会对人们的购购买意向产生生重大影响,因因此再用原来来的模型来预预测客户购买买情况必然会会出现重大失失误。因此直接在现实实世界中测试试模型很重要要。先在小范范围内应用,取取得测试数据据,觉得满意意之后再向大大范围推

56、广。7. 实实施。模型建建立并经验证证之后,可以以有两种主要要的使用方法法。第一种是是提供给分析析人员做参考考,由他通过过察看和分析析这个模型之之后提出行动动方案建议。比比如可以把模模型检测到的的聚集、模型型中蕴含的规规则、或表明明模型效果的的ROI图表拿拿给分析人员员看。另一种是把此模模型应用到不不同的数据集集上。模型可可以用来标示示一个事例的的类别,给一一项申请打分分等。还可以以用模型在数数据库中选择择符合特定要要求的记录,以以用OLAPP工具做进一一步的分析。通常情况下,模模型是某个商商业过程的组组成部分,如如风险分析,信信用授权,或或欺诈检测。在在这些情况下下,模型一般般都合并到应应用

57、程序的内内部。例如,在在抵押贷款应应用程序内部部可能集成了了一个预测模模型,来向贷贷款官员提供供一项贷款申申请风险大小小的建议。或或在定购系统统中,当预测测到库存有可可能降低到一一个最低限度度时自动发出出购买订单。数据挖掘模型通通常一次只能能处理一个事事件或一个事事务。每个事事务的处理时时间和事务到到达的速度,决决定了模型运运行所需的计计算能力,和和是否要用并并行技术来加加快速度。比比如,贷款申申请程序可能能PC机上就运运行的很好,而而用于信用卡卡欺诈的模型型则需要在服服务器上用并并行算法才能能应付每天的的大量事务。当提交一个复杂杂的应用时,数数据挖掘可能能只是整个产产品的一小部部分,虽然可可

58、能是最关键键的一部分。例例如,常常把把数据挖掘得得到的知识与与领域专家的的知识结合起起来,然后应应用到数据库库中的数据。在在欺诈检测系系统中可能既既包含了数据据挖掘发现的的规律,也有有人们在实践践中早已总结结出的规律。模型监控。在应应用了模型之之后,当然还还要不断监控控他的效果。即即使你在开始始使用这个模模型之后觉得得他非常成功功,也不能放放弃监控,因因为事物在不不断发展变化化,很可能过过一段时间之之后,模型就就不再起作用用。销售人员员都知道,人人们的购买方方式随着社会会的发展而变变化。因此随随着使用时间间的增加,要要不断的对模模型做重新测测试,有时甚甚者需要重新新建立模型。 HYPERLIN

59、K 数据挖掘入门 一 HYPERLINK 数据挖挖掘入门 二二 数据挖掘过程在实施数据挖掘掘之前,先制制定采取什么么样的步骤,每每一步都做什什么,达到什什么样的目标标是必要的,有有了好的计划划才能保证数数据挖掘有条条不紊的实施施并取得成功功。很多软件件供应商和数数据挖掘顾问问公司投提供供了一些数据据挖掘过程模模型,来指导导他们的用户户一步步的进进行数据挖掘掘工作。比如如SPSS的5A-评估估(Asseess),访访问(Acccess),分分析(Anaalyze),行行动(Actt),自动化化(Autoomate),和和SAS的SEMMAA-采样(Sammple),探探索(Expplore),修

60、修正(Moddify),建建模(Moddel),评评估(Asssess)。最近,一些软件件供应商和用用户组织成立立了行业协会会,包括NCCR Sysstems Enginneerinng Coppenhaggen(丹麦麦)Daimmler-BBenz AAG(德国)SPPSS/Innternaal Sollutionns Ltdd.(英国),和和OHRA Verzeekerinngen een Bannk Greep B.VV(荷兰)。这这个组织的目目的就是建立立跨行业数据据挖掘过程标标准(CRISPP-DM),在在1999年9月的时候CRRISP-DDM仍在建立立之中。我们下面详细讨讨论Tw

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论