版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
数据挖掘技术第八章目录02关联规则挖掘AssociationRuleMining01数据挖掘技术概述Dataminingtechnology数据挖掘技术概述Dataminingtechnology018.1.1数据挖掘产生随着信息技术迅速发展,数据库的规模不断扩大,从而产生了大量的数据。激增的数据背后隐藏着许多重要的信息,人们希望能够对其进行更高层次的分析,以便更好地利用这些数据。为给决策者提供一个统一的全局视角,在许多领域建立了数据仓库。但大量的数据往往使人们无法辨别隐藏在其中的能对决策提供支持的信息,而传统的查询、报表工具无法满足挖掘这些信息的需求。因此,需要一种新的数据分析技术处理大量数据,并从中抽取有价值的潜在知识,数据挖掘(DataMining)技术由此应运而生。数据挖掘技术也正是伴随着数据仓库技术的发展而逐步完善起来的。从机器学习到知识工程,从知识工程到专家系统,80年代人们又在新的神经网络理论的指导下重新回到机器学习,随后又进入到数据库中的知识发现,接着又相辅相成地产生数据挖掘。在此期间,数据仓库技术的出现和逐步成熟为数据挖掘技术的繁荣注入了强劲的动力,最近人们又认识到把统计分析方法和数据挖掘有机地结合将是最好的策略。因此,数据挖掘是一门交叉学科,其发展是一个螺旋上升的过程。从进化的角度来看,数据挖掘技术的产生过程实际上反映了数据库技术的演化过程。数据挖掘技术是人们长期对数据库技术进行研究和开发的结果,同时,也是信息技术自然演化的结果。数据挖掘技术也是伴随着数据仓库技术的发展而逐步完善起来的。所谓数据挖掘(DataMining-DM),就是从大量的、不完全的、有噪声的、模糊的、随机的数据库中,提取隐含在其中的、人们事先不知道的、但又是潜在有用的信息和知识的过程。这个定义包括以下四个层次的含义:(1)数据源必须是真实的、大量的、含噪声的;(2)发现的是用户感兴趣的知识;(3)发现的知识要可接受、可理解、可运用,最好能用自然语言表达发现结果;(4)并不是要求发现放之四海而皆准的知识,也不是要去发现崭新的自然科学定理和纯数学公式,更不是什么机器定理证明,所有发现的知识都是相对的,是有特定前提和约束条件、面向特定领域的。8.1.2数据挖掘的概念8.1.3数据挖掘的主要方法规则归纳即通过统计方法归纳、提取有价值的规则,例如关联规则挖掘等。决策树该方法用树形结构表示决策集合,由决策集合通过对数据集的分类产生规则。决策树方法是利用信息嫡寻找数据库中具有最大信息量的字段,建立决策树的一个结点,再根据字段的不同取值建立树的分支,在每个分支子集中,重复建立树的下层结点和分支,最终形成决策树。国际上最有影响的决策树方法是由研制的方法。神经网络方法该方法模拟人脑神经网络的某些功能,以完成分类、聚类、特征规则等多种数据挖掘任务。遗传算法这是一种模拟生物进化过程的算法,它是基于群体的、具有随机和定向搜索特征的迭代过程,这些过程有基因组合、交叉、变异和自然选择四种典型操作。如何把数据挖掘任务表达为一种搜索问题则是遗传算法的应用关键。8.1.3数据挖掘的主要方法模糊技术利用模糊集理论对实际问题进行模糊评判、模糊决策、模糊模式识别和模糊聚类分析。模糊性是客观存在的,系统的复杂性越高,模糊性越强。模糊集理论用隶属度来刻画模糊事物的亦此亦彼性,而李德毅教授在传统模糊集理论和概率统计的基础上提出了定性定量不确定性转换模型—云模型,并形成了云理论。云模型用期望值、嫡和超嫡表达定性概念,将概念的模糊性和随机性结合在一起。为数据挖掘提供了概念和知识表达、定性定量转换、概念的综合和分解等新方法。粗糙集理论用来描述知识的不精确性和不完全性。粗糙集的一些理论和方法可用来从数据库中发现分类规则,其基本思想是将数据库中的属性分为条件和结论属性,对数据库中的一条记录根据各个属性的不同属性值分成相应的子集,然后基于条件属性划分的子集与结论属性划分的子集间的上下近似关系生成判定规则。粗糙集方法与传统的统计及模糊集方法不同的是它只依赖数据内部的知识,用数据之间的关系表示知识的不确定性而后者需要依赖先验知识对不确定性进行定量描述,如统计分析中的先验概率、模糊集理论中的模糊度等。用粗糙集方法处理不确定性问题的最大优点在于不需要数据的预先或附加的信息,而且容易掌握。可视化方法即采用直观的图形方式将信息模式、数据的关联或趋势呈现给决策者,决策者可以通过可视化技术交互地分析数据关系。可视化技术是指用图形、图像的方式来显示知识,是数据挖掘中一种很重要的技术。它拓宽了传统图表的功能,使用户对数据的剖析更清楚。通过可视化技术可以把数据库中的多维数据变成多种图形,这对提示数据的状况、内在本质及规律性起到了很大作用。可视化数据挖掘可以分为数据可视化、数据挖掘结果可视化、数据挖掘过程可视化和交互式数据可视化挖掘等。数据挖掘的任务是从大量数据中发现知识。知识是人类认识的成果或结晶,包括经验知识和理论知识。从工程角度定义,知识是有助于解决问题的有格式可复用的信息。在传统的决策支持系统中,知识库中的知识和规则是由专家或程序人员建立的,是由外部输入的。而数据挖掘的任务是发现大量数据中尚未被发现的知识,是从系统内部自动获取知识的过程。对于那些决策者明确了解的信息,可以用查询、联机分析处理(OLAP)或其它工具直接获取,比如”列出各子公司在上个月的销售情况”。而另外一些隐藏在大量数据中的关系、趋势,即使是管理这些数据的专家也是没有能力发现的。这些信息对于决策可能又是至关重要的,数据挖掘则可以发现这些关系。数据挖掘发现的知识通常有以下类型:广义知识:是指类别特征的概括性描述知识,也称为概念描述。它反映同类事物共同性质,是对数据的概括、精炼和抽象,是对大量数据的归纳、概括,提炼出带有普遍性的、概括性的描述统计知识。关联知识:反映一个事件和其他事件之间依赖或相互关联的知识,如果两项或多项属性之间存在关联,那么其中一项的属性值就可以依据其他属性值进行预测。分类知识:反映同类事物共同性质的特征型知识和不同事物之间的差异型特征知识。偏差型知识:对差异和极端特例的描述,揭示事物偏离常规的异常现象,如标准类外的特例,数据聚类外的离群值等。48.1.4数据挖掘的目的发现的知识可由以下形式表示:规则,规律,模式(PattemS),约束(ConstraintS),可视化(Visualizations)等。这些知识可以直接提供给决策者,用以辅助决策过程;或者提供给领域专家,修正专家己有的知识体系;也可以作为新的知识转存到应用系统的知识存储机构中,比如专家系统(ExpertSystem)、规则库(RuleBase)等。48.1.4数据挖掘的目的8.1.5数据挖掘过程010203这个阶段又可进一步分成3个子步骤:数据集成、数据选择、数据预处理。数据集成将多文件或多数据库运行环境中的数据进行合并处理,解决语义模糊性、处理数据中的遗漏和清洗脏数据等:数据选择的目的是辨别出需要分析的数据集合,缩小处理范围,提高数据挖掘的质量。预处理是为了克服目前数据挖掘工具的局限性。这个阶段进行实际的挖掘操作,包括的要点有:①要先决定如何产生假设,是让数据挖掘系统为用户产生假设,还是用户自己对于数据库中可能包含的知识提出假设。前一种称为发现型(DisCovery一Driven)的数据挖掘;后一种称为验证型(Verifieation一Driven)的数据挖掘。②选择合适的工具。③发掘知识的操作。④证实发现的知识。根据最终用户的决策目的对提取的信息进行分析,把最有价值的信息区分出来,并且通过决策支持工具提交给决策者。因此,这一步骤的任务不仅是把结果表达出来(例如采用信息可视化方法),还要对信息进行过滤处理。如果不能令决策者满意,需要重复以上数据挖掘的过程。数据准备数据挖掘结果表述和解释零售业是数据挖掘应用较为活跃的一个领域。了解客户的购买习性和趋向,对于零售商制定销售策略是至关重要的。销售分析人员运用关联规则挖掘技术对大量的销售数据进行分析,可以发现顾客购买模式和趋势,改进服务质量,取得更好的顾客保持力和满意程度,提高货品销售比率,设计更好的货品运输与分销策略,减少商业成本。购物篮分析是数据挖掘技术应用在零售业中的一种有效方式,可用于销售搭配、产品目录设计、产品定价和促销等。数据挖掘技术可以很好地为邮政部门解决上述问题,利用该技术,我们可以进行客户存款余额分析、客户存款结构分析、平均存款利率分析、不同储种余额分析、不同储种客户分析、揽储统计分析、业务量统计分析等等。利用数据挖掘对体质数据进行挖掘,很容易产生统计方法难以实现的结果。例如,根据积累和不断收集的数据,结合体质数据和营养学方面的知识,可以挖掘出造成不同地区体质好或差的营养方面的原因;同样,根据体质数据和医学方面的知识,能够挖掘出人们的健康状况,甚至分析出导致健康状况较低的可能的疾病原因,从而可以更好地为人们自我保健和健身等各方面提供有力的指导;此外,采用数据挖掘对有名运动员的早期体质数据进行分析,能够找出它们的共同特点,从而为体育选材提供有力的依据。邮政业体质数据分析8.1.6数据挖掘应用零售业关联规则挖掘AssociationRuleMining028.2.1大数据关联规则挖掘常识A.大数据背景我们知道”以史为鉴”,历史是一面镜子对人类发展起到辅助和推动作用。个人觉得不同时期的数据也是一面镜子,虽然不能像历史事件那样直观反映出某种规律,但如果我们稍加分析就会发现,数据中隐含了一些规律或者规则,这对我们来说可能相当有价值。能做到这个从数据中寻找到有价值规则的工具就是今天给大家聊的经典数据挖掘算法之关联规则挖掘算法。B.什么是规则其实我们”寻宝”就是找寻规则,我们理解的规则就如:”如果…那么…(If…Then…)”,前者为条件,后者为结果。C.什么规则我们会感兴趣?按照我们的兴趣度从高到低,分为以下四种情况:A经常发生,发生的时候B伴随发生的概率很高。A很少出现,但是一旦出现B出现的概率很高。A经常发生,发生的时候B伴随发生的概率一般。A很少出现,出现之后B出现的概率一般。D.规则对数据的要求要想得到有价值的规则,有个重要前提就是数据必须是真实的数据,没有污染的。一般情况下会针对各个数据库中的数据进行数据抽取,去掉干扰数据(数据表中为null的或者用户随意填写的或者不合法的值等等),为挖掘规则算法提供基本保障。8.2.1大数据关联规则挖掘常识关联规则最初提出的动机是针对购物篮分析(MarketBasketAnalysis)问题提出的。假设分店经理想要深入了解顾客的购物习惯,特别是想知道顾客有可能会在一次购物时同时购买哪些商品?为回答该问题,可以对商店的顾客购物零售数量进行购物篮分析。该分析可以通过发现顾客放入“购物篮”中的不同商品之间的关联分析顾客的购物习惯。这种关联的发现可以帮助零售商了解顾客同时频繁购买的商品有哪些,从而帮助零售商开发更好的营销策略。
关联规则(Associaterule)挖掘在数据挖掘中占有极其重要的地位,是数据挖掘的主要任务之一。关联规则的经典算法是Apriori算法,它是由美国学者Agrawal等在1993年提出的一种从大规模商业数据中挖掘关联规则的算法。Apriori算法是一种以概率为基础的具有影响的挖掘布尔型关联规则频繁项集的算法,它已被广泛用于商业决策、社会科学、科学数据处理等数据挖掘领域。Apriori算法可以比较有效地产生关联规则,但是也存在算法效率不高的缺陷。Apriori的一个缺点就是数据库的扫描次数比较多,并且每次都要扫描整个数据库一遍,这对于海量数据库来说,算法执行的速度是不能接受的;再者,在产生候选k项集时,需要Lk-1与Lk-1自身连接产生,然后再进行剪枝,效率也不高。提示:Apriori算法属于候选消除算法,是一个生成候选集,消除不满足条件的候选集,并不断循环直到不再产生候选集的过程。8.2.2关联规则挖掘算法:从数据里找规律Apriori算法Apriori算法是一种称作逐层搜索的迭代方法,k-项集用于产生(k+1)-项集。算法步骤如下:①每个项都是候选1-项集的集合C1的成员。算法简单扫描事务数据库中的所有事务,对每个项的出现次数进行计数,这样就得到了候选1-项集的集合C1。扫描C1,删除那些出现计数值小于阈值的项集,这样就得到1-频繁项集的集合L1。②为找Lk,通过Lk-1与自己进行连接产生候选k项集的集合,该侯选项集的集合就记作Ck。③对Ck进行剪枝,从Ck中删除所有(k-1)-子集不在Lk-1中的项集。④对事务数据库D进行扫描,将每个事务t与Ck中的候选项集c作比较,若c属于t则将c的计数值加1(在扫描之前,初始值为0)。扫描Ck,删除那些出现计数值小于给定支持度的项集,样就得到了k-频繁项集的集合Lk。⑤循环执行②到④,直到Lk为空。⑥对L1到Lk取并集即为最终的频繁集L。⑦对于每个频繁项集l,产生的所有非空子集,然后对于其中的每个非空子集s,如果support_count(l)/support_count(s)>=min_conf,则输出规则s->l-s。其中,min_conf是最小置信度域值。118.2.2关联规则挖掘算法:从数据里找规律Apriori算法02
FP-growth算法01为了更好地解释FP树的建立规则,我们以表10-1提供的数据清单为例进行讲解。FP树算法的第一步就是扫描样本数据库,将样本按递减规则排序,删除小于最小支持度的样本数。结果如下:果
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 烧伤外科护理分类真题(附答案)
- 多耐的课件护理:护理伦理与法律法规
- 养老护理环境清洁的可持续发展策略
- 护理技能操作标准化课件
- 卒中护理中的健康教育
- 小儿发热时如何进行背部护理
- 托幼所基础创设 3
- 护理师资沟通中的沟通能力培养
- 幼儿园活动方案
- 幼儿园活动课程方案
- 2026年全民健康生活方式宣传月专题讲座课件
- 企业声誉危机处理协议2026
- 2026年行政能力测试真题(附答案)
- 山东省淄博市2025-2026学年高二下学期7月期末考试英语试卷
- 2026内蒙古呼伦贝尔市人民医院合同制专业技术人员招聘97人笔试题库含完整答案详解(必刷)
- 机务安保考试题及答案
- 外墙真石漆工程施工方法及工程项目重点难点分析
- 2025-2026学年北师大版八年级数学下册期末考试模拟卷(二)
- 工业级混合油生产线项目节能评估报告
- 防火门施工质量通病及防治措施
- 2026年湖南省事业单位面试真题附答案
评论
0/150
提交评论