版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第1章绪论信息爆炸与大数据原始时期农业社会工业社会2原子时代信息时代人类已进入一个崭新的信息时代3信息社会计算机互联网大数据感知智能……数据量呈现出指数增长的态势4大数据的概念520世纪90年代,数据仓库之父BillInmon,经常提及BigData2011年5月,在“云计算相遇大数据”为主题的EMCWorld2011会议中,EMC抛出了BigData概念。所以,很多人认为,2011年是大数据元年。大数据的特点数据的体量巨大6大数据的特点数据的体量巨大数据类型繁多7大数据的特点数据的体量巨大数据类型繁多商业价值高,而价值密度却较低8大数据的特点数据的体量巨大数据类型繁多商业价值高,而价值密度却较低数据产生速度快9大数据的概念10数据的体量巨大数据类型繁多商业价值高,而价值密度却较低数据产生速度快处理速度快大数据的特点数据的体量巨大数据类型繁多商业价值高,而价值密度却较低数据产生速度快数据的真实性数据的波动性数据的复杂性11大数据的特点12大数据的特点13大数据的概念14体量特别大,数据类别特别大的数据集,并且这样的数据集无法用传统数据库工具对其内容进行抓取、管理和处理。"大数据"的概念远不止大量的数据和处理大量数据的技术,或者所谓的"4个V"之类的简单概念,而是涵盖了人们在大规模数据的基础上可以做的事情,而这些事情在小规模数据的基础上是无法实现的。换句话说,大数据让我们以一种前所未有的方式,通过对海量数据进行分析,获得有巨大价值的产品和服务,或深刻的洞见,最终形成变革之力。"大数据"是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。从数据的类别上看,"大数据"指的是无法使用传统流程或工具处理或分析的信息。它定义了那些超出正常处理范围和大小、迫使用户采用非传统处理方法的数据集。大量信息带来问题信息过量,难以消化信息真假难以辨识信息安全难以保证信息形式不一致,难以统一处理大量信息带来问题信息不处理就成为“信息垃圾”各行业各领域政府、企业等组织也滋生出信息处理、数据处理的需求提升管理提升服务提升竞争力16商业企业要处理信息大量数据被收集、存储在数据库\数据仓库中Web数据,电子商务商场,实体店银行/信用卡业务数据竞争压力越来越大提供更好的、更为突出的个性化服务(例如CRM)计算机越来越便宜,功能越来越强大17科研院所要处理信息数据以极快的速度收集和存储(GB/hour)卫星上的远程传感器射电望远镜空间扫描产生基因表达数据的微阵列科学仿真(产生以TB计的数据量)数据挖掘可能帮助科学家进行数据的分类和划分生成假设传统的技术难以处理这些海量原始数据18金融机构要处理信息积累了海量的业务数据互联网金融业务银行卡/信用卡交易数据国民经济运行数据通过数据处理和应用,完成电信欺诈预警反洗钱个性化服务19信息处理的理论与技术发展数据库技术与系统可以高效地实现数据的录入、查询、统计等功能但无法发现数据中存在的关系和规则无法根据现有的数据预测未来的发展趋势20随着数据库技术的迅速发展以及数据库管理系统的广泛应用,人们积累的数据越来越多;海量数据被收集、存放在大型数据库中,且呈快速增长的趋势;如果不进行处理和利用,则成为“数据坟墓”。信息处理的理论与技术发展专家系统由于专家系统工具过分依赖用户或专家人工地将知识输入知识库中,而且分析结果往往带有偏差和错误,再加上耗时、费用高,故不可行。21专家系统:智能计算机程序系统,管理大量的某领域专家水平的知识与经验,能够利用人类专家的知识和解决问题的方法来处理该领域问题。专家系统是一个具有大量的专门知识与经验的程序系统,应用人工智能技术和计算机技术,根据某领域一个或多个专家提供的知识和经验,进行推理和判断,模拟人类专家的决策过程,以便解决那些需要人类专家处理的复杂问题,简而言之,专家系统是一种模拟人类专家解决领域问题的计算机程序系统。信息处理的理论与技术发展KDD(KnowledgeDiscoveryinDatabase)从数据集中识别出有效的、新颖的、潜在有用的,以及最终可理解的模式的非平凡过程22数据矿山信息金块数据挖掘工具信息处理的理论与技术发展KDD的发展23基于数据库的知识发现(KDD)一词首次出现在国际人工智能联合大会IJCAI-89Workshop上。19891995第一届KDD国际学术会议(KDD’95)加拿大蒙特利尔召开1997第一本学术刊物《KnowledgeDiscoveryandDataMining》创刊KluwersPublishers出版信息处理的理论与技术发展KDD的内容数据分类数据聚类衰退和预报关联和相关性顺序发现描述和辨别时间序列分析24信息处理的理论与技术发展KDD的过程问题的理解和定义相关数据收集和提取数据探索和清理数据工程算法选择运行数据挖掘算法结果的评价25信息处理的理论与技术发展KDD也会被称为数据挖掘(datamining)知识抽取(informationextraction)信息发现(informationdiscovery)智能数据分析(intelligentdataanalysis)探索式数据分析(exploratorydataanalysis)信息收获(Informationharvesting)数据考古(dataarchaeology)26KDDvs数据挖掘数据挖掘是KDD过程的一个基本步骤包括特定的从数据库中发现模式的挖掘算法KDD过程使用数据挖掘算法根据特定的度量方法和阈值从数据库中提取或识别出知识包括对数据库的预处理、样本划分和数据变换。27商业数据到商业信息的进化
进化阶段商业问题支持技术产品厂家产品特点数据搜集
(60年代)过去五年中我的总收入是多少?计算机、磁带和磁盘IBMCDC提供历史性的、静态的数据信息数据访问
(80年代)在新英格兰的分部去年三月的销售额是多少?关系数据库(RDBMS)结构化查询语言(SQL)ODBCOracleSybaseInformixIBMMicrosoft在记录级提供历史性的、动态数据信息数据仓库决策支持
(90年代)在新英格兰的分部去年三月的销售额是多少?波士顿据此可得出什么结论?联机分析处理(OLAP)多维数据库数据仓库PilotComshareArborCognosMicrostrategy在各种层次上提供回溯的、动态的数据信息数据挖掘
(正在流行)下个月波士顿的销售会怎么样?为什么?高级算法多处理器计算机海量数据库PilotLockheedIBMSGI其他初创公司提供预测性的信息数据挖掘的发展趋势视频和音频数据挖掘科学和统计数据挖掘数据挖掘的应用探索可伸缩的数据挖掘方法数据挖掘与数据库系统、数据仓库和Web数据库系统的集成数据挖掘语言的标准化可视化数据挖掘复杂数据类型挖掘的方法Web挖掘数据挖掘中的隐私保护与信息安全第1章绪论什么是数据挖掘数据挖掘的定义商业应用角度数据挖掘是一种新的商业信息处理技术,其主要特点是对商业数据库中的大量业务数据进行抽取、转换、分析和其他模型化处理,从中提取辅助商业决策的关键性数据。数据处理技术角度(本书定义)数据挖掘(DataMining)就是从大量的、不完全的、有噪声的、模糊的、随机的实际应用数据中,提取隐含在其中的、人们事先不知道的、但又是潜在有用的信息和知识的过程31许多不同定义数据挖掘的定义JiaWeiHan的定义从大型数据集中提取有趣的(非平凡的,蕴涵的,先前未知的并且是潜在有用的)信息或模式其他定义在大型数据存储库中,自动地发现有用信息的过程。Exploration&analysis,byautomaticorsemi-automaticmeans,oflargequantitiesofdatainordertodiscovermeaningfulpatternsNon-trivialextractionofimplicit,previouslyunknownandpotentiallyusefulinformationfromdata32数据挖掘de定义数据挖掘是从大量数据中提取或“挖掘”知识。类似但不完全相同的术语:从数据库中发现知识(KDD)知识提取(Knowledgeextract)数据/模式分析(Data/Modelanalysis)数据考古数据捕捞数据挖掘de特点数据挖掘是多学科的产物数据挖掘统计学数据库技术可视化高性能计算机器学习人工智能、模式识别统计学的抽样、估计和假设检验数据库系统提供有效的存储、索引和查询处理支持可视化算法和高性能计算(最优化、进化计算)机器学习的搜索算法、建模技术和学习理论人工智能、模式识别和分布式技术也能帮助处理海量数据信息论、信号处理、可视化和信息检索数据挖掘de特点数据挖掘是多技术的产物数据挖掘模式识别算法应用信息检索数据仓库异常检测概念区分数据挖掘vs知识发现数据挖掘vs联机分析OLAP数据挖掘vs统计学数据挖掘vs数据仓库数据挖掘vs数据分析数据挖掘vs知识发现数据挖掘(DataMining)知识发现(KDD)从大量的、不完全的、有噪声的、模糊的、随机的实际应用数据中,提取隐含在其中的、人们事先不知道的、但又是潜在有用的信息和知识的过程。是用数据库管理系统来存储数据,用机器学习的方法来分析数据,挖掘大量数据背后隐藏的知识,称为数据库中的知识发现。数据挖掘vs知识发现KDD是将未加工的数据转换为有用信息的整个过程38数据挖掘vs联机分析处理OLAPOLAP-联机分析处理,是一种软件技术,可使分析人员能够迅速、一致、交互地从各个方面观察信息,以达到深入理解数据的目的。具有共享多维信息的快速分析的特征。数据挖掘vs联机分析OLAPOLAP分析过程在本质上是一个演绎推理的过程,是决策支持领域的一部分用户首先建立一个假设,然后用OLAP检索数据库来验证这个假设是否正确传统的查询和报表工具是告诉你数据库中都有什么(whathappened)OLAP则更进一步告诉你下一步会怎么样(Whatnext)和如果采取这样的措施又会怎么样(Whatif)数据挖掘vs联机分析OLAP数据挖掘在本质上是一个归纳推理的过程与OLAP不同的地方是,数据挖掘不是用于验证某个假定的模式(模型)的正确性,而是在数据库中自己寻找模型。数据挖掘和OLAP具有一定的互补性。在利用数据挖掘出来的结论采取行动之前,OLAP工具能起辅助决策作用。而且在知识发现的早期阶段,OLAP工具用来探索数据,找到哪些是对一个问题比较重要的变量,发现异常数据和互相影响的变量。这都有助于更好地理解数据,加快知识发现的过程。数据挖掘vs统计学数据挖掘利用了统计分析的进步所带来的好处。这两门学科都致力于模式发现和预测。数据挖掘不是为了替代传统的统计分析技术。相反,它是统计分析方法学的延伸和扩展。数据挖掘vs统计学统计分析技术基于完善的数学理论和高超的技巧,预测的准确度令人满意的,但对使用者的要求很高随着计算机技术发展,可以利用计算机强大的计算能力,结合相对简单和固定的方法完成同样的功能在数据挖掘领域,促进了新的数据处理技术的发明和应用人工神经网络、支持向量机……如果数据充分和计算能力强大,可自动完成处理,得出结论数据挖掘vs统计学数据挖掘就是充分利用了统计学应用程序,并把这些高深复杂的技术封装起来,使人们不用自己掌握这些技术也能完成同样的功能,并且更专注于自己所要解决的问题。数据挖掘分析海量数据许多数据库都不适合统计学分析需要数据挖掘vs数据仓库数据仓库(DataWarehouse),是为企业所有级别的决策制定过程,提供所有类型数据支持的战略集合。单个数据存储,为分析性报告和决策支持目的而建,为需要业务智能的企业,提供指导业务流程改进、监视时间、成本、质量以及控制。数据挖掘vs数据仓库数据源数据仓库各分公司数据集市分析数据集市数据挖掘数据集市数据挖掘vs数据仓库外部数据业务数据系统文档资料数据源抽取清理装载刷新数据仓库管理系统数据集市数据存储与管理元数据管理服务数据分析数据报表数据挖掘OLAP服务器前端应用数据挖掘vs数据仓库不必为了数据挖掘非得建立数据仓库,它不是必需的建立一个庞大的数据仓库,是一项巨大的工程把各个不同源的数据统一在一起解决所有的数据冲突问题然后把所有的数据导到一个数据仓库内可能要用几年的时间花上百万的钱才能完成。可以把一个或几个事务数据库导到一个只读的数据库中,就把它当作数据集市,以此进行数据挖掘分析报告vs统计分析vs数据挖掘通过示例体会不同西游记在《大闹天宫》里,孙悟空与二郎神在花果山下大战三百回合……49分析报告vs统计分析vs数据挖掘一、分析报告孙悟空有金刚不坏火眼金睛筋斗云七十二般变化加上定海神针身法灵活二郎神杨戬有三只眼缚妖索哮天犬银袍金甲加上三尖两刃四窍八环刀力量无穷所以在大战开始三百回合时候不相上下,结果后来二郎神派出天兵天将放火烧花果山让大圣慌了心神被偷袭得手,最后二郎神赢了分析报告完成50分析报告vs统计分析vs数据挖掘二、统计分析做个数理统计来预测结果首先根据历史样本史书记载发现两人在之前的五百年里打过100次,其中孙悟空赢60次然后有记录显示,之前孙悟空和牛魔王战斗的胜率是80%,而杨戬斗牛魔王胜率是70%所以可以得出综合预测总体胜率是孙悟空赢面大结论依靠历史记录,使用样本预测总体,根据经验做出假设统计分析完成51分析报告vs统计分析vs数据挖掘三、数据挖掘孙悟空和杨戬终极决战,这次咱们根据两位的详细资料(如家庭出身、教育背景、工作经验、婚育情况等)让计算机做协同过滤关联分析。计算机通过数据清洗建模后发现:52贫苦出身的孩子一般比皇亲国戚更能吃苦所以功夫底子更好平时训练更加扎实战斗经验丰富的斗战胜佛因为平时经常打架擅长利用天时地利环境因素而胜算更大在都得到大师指点的情况下,贫苦出身的孩子可以利用后天的努力来弥补先天悟性的欠缺样貌奇特注定孤独终老的神仙总是会比同等条件下美若天仙喜欢拈花惹草处处留情的神仙功夫好分析报告vs统计分析vs数据挖掘三、数据挖掘综上所述,我们可知道:论出身两位大神不分伯仲。一个从石头出来,一个是凡人与神仙结合所生悟空的师父菩提老祖和二郎神的师父玉鼎真人的师父元始天尊同为鸿钧老祖的高足所以前者更胜一筹斗战胜佛战斗经验相对整日快活逍遥无忧无虑的二郎神来说更加丰富另孙行者由于样貌原因始终单身(好伤感)所以可以得出结论,这次大战孙悟空赢面大数据挖掘完成53分析报告vs统计分析vs数据挖掘四、最后总结:分析报告一般是整个事件发生结束以后的总结(马后炮)。统计分析能利用大量的历史样本来预测整个事件总体未来的走向(概率)。数据挖掘则透过事件的表象发现隐藏在背后的蛛丝马迹,从而找到潜伏的规律以及看似无关事物之间背后的联系。54小结数据挖掘是一个综合的、复杂的、需要运用各种技术的、与管理和业务相关的过程55第1章绪论数据挖掘的任务5758数据挖掘de任务:分类和预测1)定义分类(classification):是找出描述并区分数据类或概念的模型(或函数),以便能够使用模型预测类标记未知的对象的过程。注:导出模型(或函数)是基于对训练数据集(即其类标记已知的数据对象)的分析。2)分类模型的导出方式分类规则(IF-THEN)、决策树、数学公式、神经网络等。3)相关分析(relevanceanalysis)一般情况下,相关分析需要在分类和预测之前进行,它试图识别对于分类和预测无用的属性,且这些属性应被排除。数据挖掘de任务:分类定义给定一批记录----训练集(trainingset)Eachrecordcontainsasetofattributes,oneoftheattributesistheclasslabel(类标号).任务:建立一个模型(model)类标号属性是其他属性值的函数目标:previouslyunseenrecordsshouldbeassignedaclassasaccuratelyaspossible.Atestset(检验集)isusedtodeterminetheaccuracyofthemodel.Usually,thegivendatasetisdividedintotrainingandtestsets,withtrainingsetusedtobuildthemodelandtestsetusedtovalidateit60分类:例子61categoricalcategoricalcontinuousclassTestSetTrainingSetModelLearnClassifier分类:应用1DirectMarketingGoal:Reducecostofmailingbytargetingasetofconsumerslikelytobuyanewcell-phoneproduct.Approach:Usethedataforasimilarproductintroducedbefore.Weknowwhichcustomersdecidedtobuyandwhichdecidedotherwise.This{buy,don’tbuy}decisionformstheclassattribute.Collectvariousdemographic,lifestyle,andcompany-interactionrelatedinformationaboutallsuchcustomers.Typeofbusiness,wheretheystay,howmuchtheyearn,etc.Usethisinformationasinputattributestolearnaclassifiermodel.62分类:应用2FraudDetectionGoal:Predictfraudulentcasesincreditcardtransactions.Approach:Usecreditcardtransactionsandtheinformationonitsaccount-holderasattributes.Whendoesacustomerbuywhatdoeshebuyhowoftenhepaysontime,etcLabelpasttransactionsasfraudorfairtransactions.Thisformstheclassattribute.Learnamodelfortheclassofthetransactions.Usethismodeltodetectfraudbyobservingcreditcardtransactionsonanaccount.63分类:应用3SkySurveyCatalogingGoal:Topredictclass(starorgalaxy)ofskyobjects,especiallyvisuallyfaintones,basedonthetelescopicsurveyimages(fromPalomarObservatory).3000imageswith23,040x23,040pixelsperimage.Approach:Segmenttheimage.Measureimageattributes(features)-40ofthemperobject.Modeltheclassbasedonthesefeatures.SuccessStory:Couldfind16newhighred-shiftquasars,someofthefarthestobjectsthataredifficulttofind!64分类:应用365Attributes:Imagefeatures,Characteristicsoflightwavesreceived,etc.EarlyIntermediateLateDataSize:72millionstars,20milliongalaxiesObjectCatalog:9GBImageDatabase:150GB
Class:StagesofFormation决策树决策树提供了一种展示类似“在什么条件下会得到什么值”这类规则的方法。比如,在贷款申请中,要对申请的风险大小做出判断,为了解决这个问题而建立的一棵决策树,从中我们可以看到决策树的基本组成部分:决策节点、分支和叶子。决策树中最上面的节点称为根节点,是整个决策树的开始。决策树决策树是一个类似树形结构的流程图,每个内部节点表明在一个属性上的测试,树枝描述测试结果,叶子节点指明分类或分类的分布情况。构造决策树的方法采用自上而下递归的方式,如果训练例子集合中的所有例子是同类的,就将其作为一个叶子节点,节点内容为该类别的标记。
否则,根据某种策略确定一个测试属性,并按属性的各种取值把实例集合划分为若干个子集合,使每个子集上的所有实例在该属性上具有相同的属性值。
然后,再依次递归处理各个子集,直到得到满意的分类属性为止。
决策树数据挖掘de任务:聚类分析1)定义聚类(clustering):与分类和预测不同,它主要分析数据对象,而不考虑已知的类标记。一般情况下,训练数据中不提供类标记,因为不知道从何开始。聚类可以用于产生这种标记。2)聚类或分组的原则“最大化类内的相似性、最小化类间的相似性”对象的簇(聚类)的形成办法为:使得在一个簇中的对象具有很高的相似性,而与其它簇中的对象很不相似。所形成的每个簇可以看作一个对象类,由它可以导出规则。聚类(Clustering)
聚类(Clustering)是将物理或抽象的对象集合分成多个组的过程,聚类生成的组称为簇(Cluster),即簇是数据对象的集合。聚类就是要让生成的簇内部的任意两个对象之间具有较高的相似度,而属于不同簇的两个对象间具有较高的相异度。
聚类IntraclusterdistancesareminimizedInterclusterdistancesaremaximized聚类分析从统计学的观点看,聚类分析是对数据建模,从而简化数据的一种方法,作为多元统计分析的主要分支之一,聚类分析已被研究了很多年,主要集中在基于距离和基于相似度的聚类方法。从机器学习的观点看,簇相当于隐藏模式,聚类是搜索簇的无监督学习过程。从实际应用的角度看,聚类分析是数据挖掘的主要任务之一。数据挖掘领域主要研究面向大型数据库、数据仓库的高效和实用的聚类分析算法。聚类分析主要的数据挖掘聚类方法有:划分的方法、层次的方法、基于密度的方法、基于网格的方法、基于模型的方法等。聚类:定义给定一组具有多个属性的数据点,以及点与点的相似性衡量方法,则聚类即为使同一个簇中的点较与其他簇中的点更相似不同簇中的点比同一个簇中的点的相似性更弱相似性测度:欧几里得距离(对于连续属性)其他针对不同问题的测度方法74聚类:应用1MarketSegmentation:Goal:subdivideamarketintodistinctsubsetsofcustomerswhereanysubsetmayconceivablybeselectedasamarkettargettobereachedwithadistinctmarketingmix.Approach:Collectdifferentattributesofcustomersbasedontheirgeographicalandlifestylerelatedinformation.Findclustersofsimilarcustomers.Measuretheclusteringqualitybyobservingbuyingpatternsofcustomersinsameclustervs.thosefromdifferentclusters.75聚类:应用2DocumentClustering:Goal:Tofindgroupsofdocumentsthataresimilartoeachotherbasedontheimportanttermsappearinginthem.Approach:Toidentifyfrequentlyoccurringtermsineachdocument.Formasimilaritymeasurebasedonthefrequenciesofdifferentterms.Useittocluster.Gain:InformationRetrievalcanutilizetheclusterstorelateanewdocumentorsearchtermtoclustereddocuments76文档聚类:例ClusteringPoints:3204ArticlesofLosAngelesTimes.SimilarityMeasure:Howmanywordsarecommoninthesedocuments(aftersomewordfiltering).77CategoryTotalArticlesCorrectlyPlacedFinancial555364Foreign341260National27336Metro943746Sports738573Entertainment354278数据挖掘de任务:关联分析:定义用来发现描述数据中强关联特征的模式,所发现的模式通常用蕴涵规则或特征子集的形式表示。由于搜索空间是指数规模的,关联分析的目标是以有效的方式提取最有趣的模式;找出具有相关功能的基因组、识别一起访问的Web页面、理解地球气候系统不同元素之间的联系.RulesDiscovered:
{Diaper}-->{Milk}{Diaper,Milk}-->{Beer}关联规则:定义关联规则(associationrule)Givenasetofrecordseachofwhichcontainsomenumberofitemsfromagivencollection;Producedependencyruleswhichwillpredictoccurrenceofitemsbasedonoccurrencesofotheritems.79RulesDiscovered:
{Milk}-->{Coke}{Diaper,Milk}-->{Beer}关联规则:应用1MarketingandSalesPromotion:Lettherulediscoveredbe
{Bagels,…}
-->
{PotatoChips}PotatoChips
asconsequent=>Canbeusedtodeterminewhatshouldbedonetoboostitssales.Bagelsintheantecedent=>Canbeusedtoseewhichproductswouldbeaffectedifthestorediscontinuessellingbagels.Bagelsinantecedent
and
Potatochipsinconsequent
=>CanbeusedtoseewhatproductsshouldbesoldwithBagelstopromotesaleofPotatochips!80关联规则:应用2Supermarketshelfmanagement.Goal:Toidentifyitemsthatareboughttogetherbysufficientlymanycustomers.Approach:Processthepoint-of-saledatacollectedwithbarcodescannerstofinddependenciesamongitems.Aclassicrule--Ifacustomerbuysdiaperandmilk,thenheisverylikelytobuybeer.So,don’tbesurprisedifyoufindsix-packsstackednexttodiapers!81异常检测识别特征显著不同于其他数据的观测值应用:检测欺诈网络攻击疾病的不寻常模式生态系统扰动异常检测83异常检测84异常检测任务:识别其特征显著不同于其他数据的观测值这样的观测值称为异常点(anomaly)或离群点(outlier)发现真正的异常点,而避免错误地将正常的对象标注为异常点应用信用卡欺诈检测网络入侵检测85人工神经网络神经网络近来越来越受到人们的关注,因为它为解决大复杂度问题提供了一种相对来说比较有效的简单方法。神经网络可以很容易的解决具有上百个参数的。神经网络常用于两类问题:分类和回归。支持向量机需特别指出的是,在一般情况下,统计学习理论和支持向量机(SVM)比一般的神经网络更有效,而且可将SVM看作是广义化的神经网络。其优点是,具有深厚的数学基础,算法可靠、推广能力强,适用于小样本数据集的知识(或规则)发现。数据挖掘的应用数据库分析和决策支持市场分析和管理针对销售(targetmarketing),顾客关系管理,购物篮分析,交叉销售(crossselling),市场分割(marketsegmentation)风险分析与管理预测,顾客关系,改进保险,质量控制,竞争能力分析欺骗检测与管理其它应用文本挖掘(新闻组,email,文档资料)流数据挖掘(Streamdatamining)Web挖掘.DNA数据分析88市场分析与管理(1)用于分析的数据源在哪?信用卡交易,会员卡,打折优惠卷,顾客投诉电话,(公共)生活时尚研究针对销售(Targetmarketing)找出顾客群,他们具有相同特征:兴趣,收入水平,消费习惯,等.确定顾客随时间变化的购买模式个人帐号到联合帐号的转变:结婚,等.交叉销售分析(Cross-marketanalysis)产品销售之间的关联/相关基于关联信息的预测89市场分析与管理(2)顾客分类(Customerprofiling)数据挖掘能够告诉我们什么样的顾客买什么产品(聚类或分类)识别顾客需求对不同的顾客识别最好的产品使用预测发现什么因素影响新顾客提供汇总信息各种多维汇总报告统计的汇总信息(数据的中心趋势和方差)90法人分析和风险管理财经规划和资产评估现金流分析和预测临时提出的资产评估交叉组合(cross-sectional)和时间序列分析(金融比率(financial-ratio),趋势分析,等.)资源规划:资源与开销的汇总与比较竞争:管理竞争者和市场指导对顾客分类和基于类的定价在高度竞争的市场调整价格策略91欺骗检测和管理(1)应用广泛用于健康照料,零售,信用卡服务,电讯(电话卡欺骗),等.方法使用历史数据建立欺骗行为模型,使用数据挖掘帮助识别类似的实例例汽车保险:检测这样的人,他/她假造事故骗取保险赔偿洗钱:检测可疑的金钱交易(USTreasury'sFinancialCrimesEnforcementNetwork)医疗保险:检测职业病患者,医生和介绍人圈92欺骗检测和管理(2)检测不适当的医疗处置澳大利亚健康保险会(AustralianHealthInsuranceCommission)发现许多全面的检查是请求做的,而不是实际需要的(每年节省100万澳元).检测电话欺骗电话呼叫模式:通话距离,通话时间,每天或每周通话次数.分析偏离期望的模式.英国电讯(BritishTelecom)识别频繁内部通话的呼叫者的离散群,特别是移动电话,超过数百万美元的欺骗.零售分析家估计,38%的零售业萎缩是由于不忠诚的雇员造成的.93第1章绪论数据挖掘的应用数据挖掘的应用市场分析与管理数据集及来源产品的生产和销售数据电商网页的访问和点击数据信用卡交易会员卡打折优惠卷顾客投诉(公共)生活时尚研究95-生产与商务领域数据挖掘的应用市场分析与管理目标营销(targetmarketing)由兴趣,收入水平,消费习惯等确定顾客群,进行精准营销购物篮分析啤酒尿布案例确定顾客随时间变化的购买模式个人帐号到联合帐号的转变:结婚等交叉销售分析(Cross-marketanalysis)产品销售之间的关联/相关基于关联信息的预测96-生产与商务领域数据挖掘的应用市场分析与管理识别顾客需求对不同的顾客识别最好的产品使用预测发现什么因素影响新顾客顾客关系管理CRM市场分割(marketsegmentation)顾客分类(Customerprofiling)数据挖掘能够告诉我们什么样的顾客买什么产品(聚类或分类)97-生产与商务领域数据挖掘的应用市场分析与管理提供汇总信息各种多维汇总报告统计的汇总信息(数据的中心趋势和方差)98-生产与商务领域数据挖掘的应用市场分析与管理风险分析与管理风险分析与预测改进保险业务的品种和细则生产过程及产品的质量控制企业和行业的竞争能力分析99-生产与商务领域数据挖掘的应用市场分析与管理风险分析与管理欺骗检测与管理汽车保险:检测这样的人,他/她假造事故骗取保险赔偿洗钱:检测可疑的金钱交易(USTreasury'sFinancialCrimesEnforcementNetwork)医疗保险:检测职业病患者,医生和介绍人圈100-生产与商务领域检测不适当的医疗处置澳大利亚健康保险会(AustralianHealthInsuranceCommission)发现许多全面的检查是请求做的,而不是实际需要的(每年节省100万澳元).检测电话欺骗电话呼叫模式:通话距离,通话时间,每天或每周通话次数.分析偏离期望的模式.英国电讯(BritishTelecom)识别频繁内部通话的呼叫者的离散群,特别是移动电话,超过数百万美元的欺骗.零售分析家估计,38%的零售业萎缩是由于不忠诚的雇员造成的.数据挖掘的应用市场分析与管理风险分析与管理欺骗检测与管理企业运营与管理财经规划和资产评估资源规划竞争101-生产与商务领域其它应用文本挖掘(新闻组,email,文档资料)流数据挖掘(Streamdatamining)Web挖掘DNA数据分析102案例
-电信行业客户关系管理客户消费模式分析客户市场推广分析客户欠费分析和动态防欺诈客户流失分析103案例
-金融企业应用CredilogrosCíaFinancieraS.A.阿根廷第五大信贷公司,资产估计价值为9570万美元。一项重要工作就是识别与潜在预付款客户相关的潜在风险,以便将承担的风险最小化。搭建信贷申请系统公司核心系统+信用报告公司系统交互的决策引擎来处理信贷申请低收入客户群体的风险评分工具整合数据挖掘软件SPSSModeler,快速处理Credilogros平均每月使用该系统处理35000份申请,仅在3个月后就将贷款失误减少了20%104案例-物流企业帮助DHL实时跟踪货箱温度DHL是国际快递和物流企业美国FDA要求,药品运送装运温度必须达到标准递送各个阶段实时跟踪集装箱的温度对于最终客户来说,能够使医药客户对运送过程中出现的装运问题提前做出响应以较低的成本全面切实地增强了运送可靠性,提高了客户满意度和忠实度为保持竞争差异奠定坚实的基础,成为重要的新的收入增长来源105GUS日用品零售商店需要准确的预测未来的商品销售量,降低库存成本。。。。。。通过数据挖掘的方法使库存成本比原来减少了3.8%应用:零售商店美国国内税务局需要提高对纳税人的服务水平……合理安排税务官的工作,为纳税人提供更迅捷、更准确的服务应用:税务局汇丰银行需要对不断增长的客户群进行分类,对每种产品找出最有价值的客户……营销费用减少了30%应用:银行应用:竞技运动美国NBA教练利用IBM公司提供的IBMAdvancedScout数据挖掘工具,分析NBA的统计数据(阻挡投篮,助攻,和犯规),临场决定替换队员,获得了对纽约小牛队和迈艾米热队的竞争优势数据挖掘揭示13个隐藏的NBA球员位置应用:天文借助于数据挖掘的帮助,JPL和PalomarObservatory发现了22颗类星体(quasars)110JPL(JetPropulsionLaboratory)是位于加州帕萨迪那美国国家航空航天局的一个下属机构,负责为NASA开发和管理无人空间探测任务。PalomarObservatory(帕洛马山天文台)位于美国加州圣地亚哥的帕洛马山的山顶,海拔1706米,于1928年建立。著名的苏梅克-列维9号彗星就是在此发现的,与威尔逊天文台合称海尔天文台。应用:生物信息生物信息或基因数据挖掘基因的组合千变万化,得某种病的人的基因和正常人的基因到底差别多大?能否找出其中不同的地方,进而对其不同之处加以改变,使之成为正常基因?这都需要数据挖掘技术的支持。应用:生物信息生物信息或基因的数据挖掘,在数据的复杂程度、数据量还有分析和建立模型的算法上,都非常复杂从分析算法上讲,更需要一些新的和好的算法正在研究,尚未成熟小结数据挖掘应用广泛数据挖掘运用必不可少数据挖掘的过程和技术复杂多变持续探索与优化总结、积累、成长113第1章绪论数据挖掘的系统结构与技术115116117118119120121122数据挖掘系统结构123数据库数据清洗和集成过滤数据库或数据仓库服务器数据挖掘引擎模式评价图形用户接口数据仓库知识库124面向应用的系统构125银行、电信、零售、保险…各行业电子商务系统、平台…制药、生物、科学研究…基因挖掘基因表达分析基因功能分析…WEB挖掘网站结构优化网页推荐商品推荐…相关行业商业应用商业模型挖掘算法关联规则、序列模式、分类、聚类、偏差分析…CRM产品推荐客户细分客户流失分析客户响应…行业应用层商业逻辑层算法层数据挖掘技术126数据挖掘技术预测(Prediction)根据其他属性的值,预测特定属性的值描述(Description)导出概括数据中潜在联系的模式127PredictiveDescriptive数据挖掘任务分类(Classification)回归(Regression)关联规则发现(AssociationRuleDiscovery)序列模式发现(SequentialPatternDiscovery)聚类(Clustering)异常/偏差检测(Anomaly/DeviationDetection)128PredictivePredictivePredictiveDescriptiveDescriptiveDescriptive数据挖掘算法分类决策树基于规则贝叶斯支持向量机人工神经网络……数据挖掘算法关联AprioriFP-Growth……数据挖掘算法聚类K-MeansDBSCAN层次聚类BIRCHCURE……数据挖掘算法回归一元线性回归多元线性回归非线性回归……回归:定义回归(regression)Predictavalueofagivencontinuousvaluedvariablebasedonthevaluesofothervariables,assumingalinearornonlinearmodelofdependency.Greatlystudiedinstatistics,neuralnetworkfields.133xyy=x+1X1Y1Y1’回归:分析回归:应用Examples:Predictingsalesamountsofnewproductbasedonadvertisingexpenditure.Predictingwindvelocitiesasafunctionoftemperature,humidity,airpressure,
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 医保智能审核中药饮片的剂量问题总结2026
- 小学美术教资面试色彩知识及解析
- 2026年初中级工程师市政工程专业知识模拟试卷含解析答案
- DB23-T 3597-2023 黑龙江省超低能耗建筑评价技术标准
- 2026年执业药师中药学专业知识(一)冲刺试卷
- 2026年统招专升本计算机科学与技术数据结构专项训练试卷
- 2026年会计专业技术资格考试中级会计实务模拟试卷
- 四川省甘孜州2026年中考物理试卷附答案
- 2026年二级建造师施工组织设计专项考试模拟试卷
- 2026体育单招文化考试各科考试真题及参考答案
- 【感恩教育】教师节主题班会《有一种炫耀是“我的老师很严格”》(课件)
- 医院三管三必须培训课件
- 华为资源池管理办法
- 收银员的职业道德培训
- 醉驾担保协议书
- 甲状腺细针穿刺细胞学病理诊断
- 食品微生物控制加工技术
- 创新方法大赛TRIZ航天-氢敏变色材料
- 玻尔的原子模型
- GB/T 5140-2005叉车挂钩型货叉术语
- CB/T 3780-1997管子吊架
评论
0/150
提交评论