关联规则和关联分析_第1页
关联规则和关联分析_第2页
关联规则和关联分析_第3页
关联规则和关联分析_第4页
关联规则和关联分析_第5页
已阅读5页,还剩32页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、关于关联规则与关联分析第1页,共37页,2022年,5月20日,10点10分,星期四摘要关联规则挖掘是数据挖掘中成果颇丰而且比较活跃的研究分支。本章主要介绍了关联规则挖掘的基本概念及其分类,以单维单层布尔关联规则的挖掘理论为切入点,介绍关联规则挖掘理论模型以及算法方面的内容,并简单扼要介绍了多层关联规则挖掘、多维关联规则挖掘的相关内容,最后通过一个实例给出了关联分析的医学应用。第2页,共37页,2022年,5月20日,10点10分,星期四什么是关联规则挖掘?关联规则挖掘:从事务数据库,关系数据库和其他信息存储中的大量数据的项集之间发现有趣的、频繁出现的模式、关联和相关性。应用:购物篮分析、分类

2、设计、捆绑销售等第3页,共37页,2022年,5月20日,10点10分,星期四“尿布与啤酒”典型关联分析案例采用关联模型比较典型的案例是“尿布与啤酒”的故事。在美国,一些年轻的父亲下班后经常要到超市去买婴儿尿布,超市也因此发现了一个规律,在购买婴儿尿布的年轻父亲们中,有30%40%的人同时要买一些啤酒。超市随后调整了货架的摆放,把尿布和啤酒放在一起,明显增加了销售额。同样的,我们还可以根据关联规则在商品销售方面做各种促销活动。第4页,共37页,2022年,5月20日,10点10分,星期四购物篮分析如果问题的全域是商店中所有商品的集合,则对每种商品都可以用一个布尔量来表示该商品是否被顾客购买,则

3、每个购物篮都可以用一个布尔向量表示;而通过分析布尔向量则可以得到商品被频繁关联或被同时购买的模式,这些模式就可以用关联规则表示(0001001100,这种方法丢失了什么信息?)关联规则的两个兴趣度度量支持度置信度第5页,共37页,2022年,5月20日,10点10分,星期四关联(association):两个或多个变量的取值之间存在某种规律性。关联规则(association rule):指在同一个事件中出现的不同项的相关性。关联分析(association analysis):用于发现隐藏在大型数据集中的令人感兴趣的联系。所发现的联系可以用关联规则或者频繁项集的形式表示。关联规则挖掘就是从大

4、量的数据中挖掘出描述数据项之间相互联系的有价值的有关知识。应用:购物篮分析、生物信息学、医疗诊断、Web挖掘、科学数据分析、分类设计、捆绑销售和亏本销售分析第6页,共37页,2022年,5月20日,10点10分,星期四购物篮事务的例子第7页,共37页,2022年,5月20日,10点10分,星期四第一节 关联规则基本概念和关联规则挖掘分类关联规则的基本概念关联规则挖掘的基本过程与分类第8页,共37页,2022年,5月20日,10点10分,星期四关联规则的基本概念令I=i1, i2, ,id是购物篮数据中所有项的集合,而T=t1, t2, ,tn是所有事务的集合。每个事务ti包含的项集都是I的子集

5、。在关联分析中,包含0个或者多个项的集合被称为项集(itemset)如果一个项集包含k个项,则称它为k-项集。例如啤酒,尿布,牛奶是一个3-项集。空集是指不包含任何项的项集。第9页,共37页,2022年,5月20日,10点10分,星期四事务的宽度定义为事务中出现项的个数。如果项集X是事务tj的子集,则称事务tj包含项集X。项集的一个重要性质就是它的支持度计数,即包含特定项集的事务个数,数学上,项集X的支持度计数(X)可以表示为: (X)=|ti|Xti,tiT|第10页,共37页,2022年,5月20日,10点10分,星期四关联规则是形如XY的蕴含表达式,其中X和Y是不相交的项集。关联规则的强

6、度可以用它的支持度(support)和置信度(confidence)度量。支持度确定了规则可以用于给定数据集的频繁程度,而置信度确定了Y包含X的事务中出现的频繁程度。第11页,共37页,2022年,5月20日,10点10分,星期四规则度量:支持度和置信度Customerbuys diaperCustomerbuys bothCustomerbuys beer对所有满足最小支持度和置信度的关联规则支持度s是指事务集D中包含 的百分比置信度c是指D中包含A的事务同时也包含B的百分比假设最小支持度为50%,最小置信度为50%,则有如下关联规则A C (50%, 66.6%)C A (50%, 100

7、%)第12页,共37页,2022年,5月20日,10点10分,星期四关联规则挖掘的基本过程与分类关联规则挖掘的基本过程关联规则挖掘的分类第13页,共37页,2022年,5月20日,10点10分,星期四关联规则挖掘的基本过程给定事务的集合T,关联规则发现是指找出支持度大于等于minsup,并且置信度大于等于minconf的所有规则,其中minsup和minconf是对应的支持度和置信度的阈值。第14页,共37页,2022年,5月20日,10点10分,星期四原始关联规则挖掘方法:计算每一个可能规则的支持度和置信度。但是这种方法由于过高的代价而让人望而却步。第15页,共37页,2022年,5月20日

8、,10点10分,星期四关联规则挖掘任务的步骤找出所有频繁项集:其目标是发现满足最小支持度阈值的所有项集,这些项集称作频繁项集(frequent itemset)由频繁项集产生强关联规则:其目标是从上一步发现的频繁项集中提取所有高置信度的规则,这些规则称作强规则(strong rule)第16页,共37页,2022年,5月20日,10点10分,星期四关联规则挖掘分类 (1)关联规则有多种分类:根据规则中所处理的值类型布尔关联规则量化关联规则(规则描述的是量化的项或属性间的关联性)根据规则中涉及的数据维单维关联规则(仅涉及buys这个维)多维关联规则第17页,共37页,2022年,5月20日,10

9、点10分,星期四关联规则挖掘分类 (2)根据规则集所涉及的抽象层单层关联规则多层关联规则 (在不同的抽象层发现关联规则)根据关联挖掘的各种扩充挖掘最大的频繁模式(该模式的任何真超模式都是非频繁的)挖掘频繁闭项集(一个项集c是频繁闭项集,如果不存在其真超集c,使得每个包含c的事务也包含c)(最大的频繁模式和频繁闭项集可以用来减少挖掘中产生的频繁项集)第18页,共37页,2022年,5月20日,10点10分,星期四由事务数据库挖掘单维布尔关联规则最简单的关联规则挖掘,即单维、单层、布尔关联规则的挖掘。最小支持度 50%最小置信度 50%对规则A C,支持度 =50%置信度第19页,共37页,202

10、2年,5月20日,10点10分,星期四Apriori算法 (1)Apriori算法是挖掘布尔关联规则频繁项集的算法Apriori算法利用的是Apriori性质:频繁项集的所有非空子集也必须是频繁的。 模式不可能比A更频繁的出现Apriori算法是反单调的,即一个集合如果不能通过测试,则该集合的所有超集也不能通过相同的测试。Apriori性质通过减少搜索空间,来提高频繁项集逐层产生的效率第20页,共37页,2022年,5月20日,10点10分,星期四Apriori算法 (2)Apriori算法利用频繁项集性质的先验知识(prior knowledge),通过逐层搜索的迭代方法,即将k-项集用于探

11、察(k+1)-项集,来穷尽数据集中的所有频繁项集。先找到频繁1-项集集合L1,然后用L1找到频繁2-项集集合L2,接着用L2找L3,直到找不到频繁k-项集,找每个Lk需要一次数据库扫描。第21页,共37页,2022年,5月20日,10点10分,星期四Apriori算法步骤Apriori算法由连接和剪枝两个步骤组成。连接:为了找Lk,通过Lk-1与自己连接产生候选k-项集的集合,该候选k项集记为Ck。Lk-1中的两个元素L1和L2可以执行连接操作 的条件是Ck是Lk的超集,即它的成员可能不是频繁的,但是所有频繁的k-项集都在Ck中(为什么?)。因此可以通过扫描数据库,通过计算每个k-项集的支持度

12、来得到Lk 。为了减少计算量,可以使用Apriori性质,即如果一个k-项集的(k-1)-子集不在Lk-1中,则该候选不可能是频繁的,可以直接从Ck删除。第22页,共37页,2022年,5月20日,10点10分,星期四Apriori算法示例Database TDB1st scanC1L1L2C2C22nd scanC3L33rd scan最小支持计数:2第23页,共37页,2022年,5月20日,10点10分,星期四使用Apiori性质由L2产生C31 连接:C3=L2 L2= A,C,B,C,B,EC,E A,C,B,C,B,EC,E = A,B,C,A,C,E,B,C,E2使用Aprior

13、i性质剪枝:频繁项集的所有子集必须是频繁的,对候选项C3,我们可以删除其子集为非频繁的选项:A,B,C的2项子集是A,B,A,C,B,C,其中A,B不是L2的元素,所以删除这个选项;A,C,E的2项子集是A,C,A,E,C,E,其中A,E 不是L2的元素,所以删除这个选项;B,C,E的2项子集是B,C,B,E,C,E,它的所有2项子集都是L2的元素,因此保留这个选项。3这样,剪枝后得到C3=B,C,E第24页,共37页,2022年,5月20日,10点10分,星期四由频繁项集产生关联规则同时满足最小支持度和最小置信度的才是强关联规则,从频繁项集产生的规则都满足支持度要求,而其置信度则可由一下公式

14、计算:每个关联规则可由如下过程产生:对于每个频繁项集l,产生l的所有非空子集;对于每个非空子集s,如果 则输出规则“ ”第25页,共37页,2022年,5月20日,10点10分,星期四多层关联规则挖掘多层关联规则可以分为同层关联规则和层间关联规则,同层关联规则是指处于同概念层的关联规则;层间关联规则是指不同概念层的关联规则。多层关联规则基本上可以沿用“支持度-置信度”的框架,但是在设置问题上有一些要考虑的东西第26页,共37页,2022年,5月20日,10点10分,星期四统一的最小支持度:对于不同层次,都使用一个最小支持度。这样对于用户和算法实现来讲都比较容易,但是弊端也是显然的。递减的最小支

15、持度:每个层次都有不同的最小支持度,较低层次的最小支持度相对较小。同时还可以利用上层挖掘得到的信息进行一些过滤的工作第27页,共37页,2022年,5月20日,10点10分,星期四多维关联规则挖掘数值字段被分成一些预定义的层次结构:这些区间都是由用户预先定义的。得出的规则也称为静态数量关联规则数值字段根据数据的分布分成了一些布尔字段:每个布尔字段都表示一个数值字段的区间,落在其中为1,反之为0。这种分法是动态的,得出的规则称为布尔数量关联规则。第28页,共37页,2022年,5月20日,10点10分,星期四第29页,共37页,2022年,5月20日,10点10分,星期四第30页,共37页,2022年,5月20日,10点10分,星期四第3

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论