数据仓库与数据挖掘技术(共81页).ppt_第1页
数据仓库与数据挖掘技术(共81页).ppt_第2页
数据仓库与数据挖掘技术(共81页).ppt_第3页
数据仓库与数据挖掘技术(共81页).ppt_第4页
数据仓库与数据挖掘技术(共81页).ppt_第5页
已阅读5页,还剩75页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、 E-MAIL:BXXHSSINA.COM数据仓库与数据挖掘技术Electronic Commerce夏火松 E-MAIL:BXXHSSINA.COM 数据仓库与数据挖掘技术教案数据仓库与数据挖掘技术教案 E-MAIL:BXXHSSINA.COM第6章 数据挖掘根本算法本章内容:6.1 分类规那么挖掘6.2 预测分析与趋势分析规那么6.3 数据挖掘的关联算法6.4 数据挖掘的聚类算法6.5 数据挖掘的统计分析算法6.6 数据挖掘的品种优化算法6.7 数据挖掘的进化算法 E-MAIL:BXXHSSINA.COM6.1 分类规那么挖掘分类与估值分类与估值 1 分类分类为了理解事物特征并做出预测使用

2、历史数据建为了理解事物特征并做出预测使用历史数据建立一个分类模型即分类器的过程立一个分类模型即分类器的过程 。应用于信用卡系统中的信用分级、市场调查、应用于信用卡系统中的信用分级、市场调查、疗效诊断、寻找店址等疗效诊断、寻找店址等 实践应用参照课本实践应用参照课本 E-MAIL:BXXHSSINA.COM6.1 分类规那么挖掘 分类与估值分类与估值 2 估值估值 估值估值estimation与分类类似,不同之处在与分类类似,不同之处在于,分类描述的是离散型变量的输出,而估于,分类描述的是离散型变量的输出,而估值处理连续值的输出;分类的类别是确定的值处理连续值的输出;分类的类别是确定的数目,估值

3、的量是不确定的。数目,估值的量是不确定的。 3 分类方法与步骤分类方法与步骤 方法:决策树归纳、贝叶斯分类、贝叶斯网络、方法:决策树归纳、贝叶斯分类、贝叶斯网络、神经网络。还有神经网络。还有K-最临近分类、基于案例的最临近分类、基于案例的推理、遗传算法、粗糙集和模糊集方法。推理、遗传算法、粗糙集和模糊集方法。步骤:模型创立、模型使用步骤:模型创立、模型使用 E-MAIL:BXXHSSINA.COM6.1 分类规那么挖掘v分类与估值分类与估值v4 评估分类方法评估分类方法v要考虑的指标:预测准确率、速度、创立要考虑的指标:预测准确率、速度、创立速度、使用速度、鲁棒性、处理噪声和丧速度、使用速度、

4、鲁棒性、处理噪声和丧失值、伸缩性、对磁盘驻留数据的处理能失值、伸缩性、对磁盘驻留数据的处理能力、可解释性、对模型的可理解程度、规力、可解释性、对模型的可理解程度、规那么好坏的评价、决策树的大小和分类规那么好坏的评价、决策树的大小和分类规那么的简明性。那么的简明性。 E-MAIL:BXXHSSINA.COM6.1 分类规那么挖掘6.1.2 决策树父节点子节点子节点叶节点子节点子节点子节点根节点图6.1 一般决策树结构叶节点父节点 E-MAIL:BXXHSSINA.COM6.1 分类规那么挖掘6.1.2 决策树1决策树的构造过程ID3算法应用如下:)(log21pipmii)(log21pipmi

5、i)(log21pipmii)(log21pipmii),.,1(1)/).21(smjjsImjssmjjsjs)(log21pipmii信息量计算公式:I(s1,s2,sm)=- 6.1其中,pi为si占整个类别的概率利用属性A划分当前样本集合所需要的信息熵的计算公式为:EA= (6.2)信息增益公式:GainA= I(s1,s2,sm)-EA 6.3例如:一个销售的顾客数据库训练样本集合,对购置计算机的人员进行分类:字段为:年龄取值:40;收入(高,中,低);学生否Y,N;信用一般,很好;购置计算机否Y,N记录为14个,具体数据如下:X1=(30, 高,N, 一般,N);X2=(40,

6、中,N, 一般,Y)X5=(40, 低,Y, 一般,Y);X6=(40, 低,Y, 很好,N)X7=(30-40, 低,Y, 高,Y);X8=(30, 中,N, 一般,N)X9=(40, 中,Y, 一般,Y)X11=(40,中,N, 很好,N) E-MAIL:BXXHSSINA.COM6.1 分类规那么挖掘6.1.2 决策树1决策树的构造过程决策树的构造算法: 决策树的构造算法可通过训练集T完成,其中T=,而x=(a1,a2,an)为一个训练实例,它有n个属性,分别列于属性表(A1,A2,An)中,其中ai表示属性Ai的取值。CjC=C1,C2,Cm为x的分类结果。附属性表中选择属性Ai作为分

7、类属性;假设属性Ai的取值有ki个,那么将T划分为ki个子集,T1,Tki,其中Tij=|T,且x的属性取值A为第i个值;接下来附属性表中删除属性Ai;对于每一个Tij(1jK1),令T=Tij;如果属性表非空,返回第1步,否那么输出。 E-MAIL:BXXHSSINA.COM6.1 分类规那么挖掘6.1.2 决策树2分类器 定义:输入的数据含有千万个记录,每个记录又有很多个属性,其中有一个特别的属性叫做类例如信用程度的高,中,低。 具体步骤 :1树的建立。 2树的修剪,SLIQ采用了MDL最小表达长度的方法来修剪树。 E-MAIL:BXXHSSINA.COM6.1 分类规那么挖掘6.1.2

8、决策树3决策树的可扩展性决策树的可扩展性4基于决策树方法的数据挖掘工具基于决策树方法的数据挖掘工具 KnowledgSEEKER E-MAIL:BXXHSSINA.COM6.1 分类规那么挖掘6.1.3 贝叶斯分类贝叶斯分类1贝叶斯信任网络如何工作贝叶斯信任网络如何工作边缘主区域手机呼叫服务区域noyes外界图6.3 简单的贝叶斯网图 E-MAIL:BXXHSSINA.COM6.1 分类规那么挖掘6.1.3 贝叶斯分类贝叶斯分类2贝叶斯定理与朴素贝叶斯分类贝叶斯定理与朴素贝叶斯分类v贝叶斯定理: P(H|X)=P(X|H)P(H)/P(X) 其中,P(H|X)表示条件X下H的概率,也称为条件概

9、率或称为后验概率(posteriori probabilities)。v朴素贝叶斯分类:假定有m个类C1, Cm,对于数据样本X,分类法将预测X属于类Ci,当且仅当P(Ci|X) P(Cj|X), E-MAIL:BXXHSSINA.COM6.2预测分析与趋势分析规那么6.2.1 预言的根本方法预言的根本方法预言预言prediction是一门掌握对象变化动态是一门掌握对象变化动态的科学,它是对对象变动趋势的预见、分析的科学,它是对对象变动趋势的预见、分析和判断,也是一种动态分析方法。和判断,也是一种动态分析方法。 预测的根本步骤:预测的根本步骤: 确定预测目标,包括预测对象、目的、对象确定预测目

10、标,包括预测对象、目的、对象范围;范围; 收集分析内部和外部资料;收集分析内部和外部资料; 数据的处理及模型的选择;数据的处理及模型的选择; 预测模型的分析、修正;预测模型的分析、修正; 确定预测值。确定预测值。 E-MAIL:BXXHSSINA.COM6.2 预测分析与趋势分析规那么6.2.2 定量分析预测时间序列法回归预测非线性模型灰色预测模型GM1,1 组合预测 E-MAIL:BXXHSSINA.COM6.2 预测分析与趋势分析规那么预测的结果分析预测的结果分析预测的结果分析要考虑到的因素:预测的结果分析要考虑到的因素:相反的预测结果相反的预测结果 胜出裕度胜出裕度 本钱收益分析本钱收益

11、分析 E-MAIL:BXXHSSINA.COM6.2 预测分析与趋势分析规那么6.2.4 趋势分析挖掘趋势分析挖掘分析时间序列数据需要注意以下方面分析时间序列数据需要注意以下方面 :长时间的走向长时间的走向 周期的走向与周期的变化周期的走向与周期的变化 季节性的走向与变化季节性的走向与变化 不规那么的随机走向不规那么的随机走向 E-MAIL:BXXHSSINA.COM6.3 数据挖掘的关联算法数据挖掘的关联算法6.3.1 关联规那么的概念及分类关联规那么的概念及分类1关联规那么的概念关联规那么的概念定义定义1 设设I=i1、i2、i3,,im是由是由m个不同的数据工程组成的个不同的数据工程组成

12、的集合,其中的元素称为项集合,其中的元素称为项(item),项的集合称为项集,包含,项的集合称为项集,包含k个项的项集称为个项的项集称为k项集项集,给定一个事务交易给定一个事务交易D,即交易数,即交易数据库,其中的每一个事务交易据库,其中的每一个事务交易T是数据项是数据项I的一个子集,的一个子集,即,即,T有一个惟一的标积符有一个惟一的标积符TID;当且仅当时,称交易;当且仅当时,称交易T包含包含项集项集X;那么关联规那么就形如;那么关联规那么就形如“X=Y的蕴涵式;其的蕴涵式;其中,中,即表示满足,即表示满足X中条件的记录也一定满足中条件的记录也一定满足Y。关联。关联规那么规那么X=Y在交易

13、数据库中成立在交易数据库中成立, 具有支持度具有支持度s和具有置信和具有置信度度c 。 这也就是交易数据集这也就是交易数据集D中具有支持度中具有支持度s,即,即D中至少有中至少有s%的事务包含的事务包含,描述描述 为:为:support(X=Y)= 比方比方Support(X=Y )=同时购置商品同时购置商品X和和Y的交易数的交易数总交易数总交易数同时交易数据集同时交易数据集D中具有置信度中具有置信度c,即,即D中包含中包含X的事务至少有的事务至少有c%同时也包含同时也包含Y,描述为:描述为:confidence(X=Y)= 比方购置了商品比方购置了商品X,同时购置商品,同时购置商品Y可信度,

14、可信度,confidence(X=Y)=同时购置商品同时购置商品X和和Y的交易数的交易数购置了商购置了商品品X的交易数的交易数一般称满足一定要求的规那么为强规那么。通常称满足最小支一般称满足一定要求的规那么为强规那么。通常称满足最小支持度和最小置信度的关联规那么为强关联规那么持度和最小置信度的关联规那么为强关联规那么strong。一般将最小支持度简记为一般将最小支持度简记为minsup和最小置信度简记为和最小置信度简记为minconf。 E-MAIL:BXXHSSINA.COM6.3 数据挖掘的关联算法数据挖掘的关联算法6.3.1 关联规那么的概念及分类关联规那么的概念及分类2 关联规那么的分

15、类关联规那么的分类分类标准类别规则中所处理的值布尔关联规则,量化关联规则规则中所涉及的数据维单维关联规则和多维关联规则规则中所涉及的抽象层单层关联规则和多层关联规则规则中的扩充最大的模式和频繁闭项集关联特性分类分析与相关分析 E-MAIL:BXXHSSINA.COM6.3 数据挖掘的关联算法数据挖掘的关联算法6.3.2 简单形式的关联规那么算法单维、单层简单形式的关联规那么算法单维、单层和布尔关联规那么和布尔关联规那么1简单形式的关联规那么的核心算法简单形式的关联规那么的核心算法找到所有支持度大于最小支持度的项集找到所有支持度大于最小支持度的项集,即频集即频集,有有k个数据频集称为个数据频集称

16、为k项频集项频集.找出所有的频集找出所有的频集由由apriori算法实现。算法实现。Apriori性质具有一个频性质具有一个频集的任一非空子集都是频集。集的任一非空子集都是频集。使用第使用第1步找到的频集产生期望的规那么步找到的频集产生期望的规那么 apriori算法的详细介绍见课本。算法的详细介绍见课本。 E-MAIL:BXXHSSINA.COM6.3 数据挖掘的关联算法数据挖掘的关联算法6.3.2 简单形式的关联规那么算法单维、单层简单形式的关联规那么算法单维、单层和布尔关联规那么和布尔关联规那么2 频集算法的几种优化方法频集算法的几种优化方法基于划分的方法基于划分的方法基于基于hash的

17、方法的方法 基于采样的方法基于采样的方法 减少交易的个数减少交易的个数 E-MAIL:BXXHSSINA.COM6.3 数据挖掘的关联算法数据挖掘的关联算法6.3.2 简单形式的关联规那么算法单维、单层简单形式的关联规那么算法单维、单层和布尔关联规那么和布尔关联规那么3 其他的频集挖掘方法其他的频集挖掘方法FP-growth方法方法 min_hashing(MH)和和locality_sensitive_hashing(LSH) E-MAIL:BXXHSSINA.COM6.3 数据挖掘的关联算法数据挖掘的关联算法6.3.3 多层和多维关联规那么的挖掘多层和多维关联规那么的挖掘多层关联规那么多层

18、关联规那么 多维关联规那么多维关联规那么 关联规那么价值衡量的方法关联规那么价值衡量的方法 6.3.4 货篮子分析存在的问题货篮子分析存在的问题详见课本详见课本 E-MAIL:BXXHSSINA.COM6.3 数据挖掘的关联算法数据挖掘的关联算法6.3.5 关联分析的其他算法关联分析的其他算法v发现关联的更好方法 v统计相关以外的v理解关联 v有效可行的市场篮子分析 6.3.6 挖掘序列模式挖掘序列模式v序列模式的概念及定义序列模式的概念及定义 v序列模式挖掘的主要算法序列模式挖掘的主要算法 GSP算法描述 PrefixSpan算法 E-MAIL:BXXHSSINA.COM关联规那么挖掘一个例

19、子交易ID购买商品2000A,B,C1000A,C4000A,D5000B,E,F频繁项集支持度A75%B50%C50%A,C50%最小值尺度 50%最小可信度 50%v对于 A C:vsupport = support(A 、C) = 50%vconfidence = support(A 、C)/support(A) = 66.6%vApriori的根本思想:v频繁项集的任何子集也一定是频繁的 E-MAIL:BXXHSSINA.COM关键步骤:挖掘频繁集v频繁集:是指满足最小支持度的工程集合v频繁集的子集也一定是频繁的v如, 如果AB 是频繁集,那么 A B 也一定是频繁集v从1到kk-频繁

20、集递归查找频繁集v用得到的频繁集生成关联规那么 E-MAIL:BXXHSSINA.COMApriori算法v连接: 用 Lk-1自连接得到Ckv修剪: 一个k-项集,如果他的一个k-1项集他的子集 不是频繁的,那他本身也不可能是频繁的。v伪代码:vCk: Candidate itemset of size kvLk : frequent itemset of size kvL1 = frequent items;vfor (k = 1; Lk !=; k+) do beginv Ck+1 = candidates generated from Lk;v for each transaction

21、 t in database dov increment the count of all candidates in Ck+1 that are contained in tv Lk+1 = candidates in Ck+1 with min_supportv endvreturn k Lk; E-MAIL:BXXHSSINA.COMApriori算法 例子TID Items100 1 3 4200 2 3 5300 1 2 3 5400 2 5数据库 Ditemset sup.1223334153itemset sup.12233353扫描 DC1L1itemset1 21 31 52

22、 32 53 5itemset sup1 211 321 512 322 533 52itemset sup1 322 322 533 52L2C2C2扫描 DC3L3itemset2 3 5扫描 Ditemset sup2 3 52 E-MAIL:BXXHSSINA.COM如何生成候选集v假定 Lk-1 中的项按顺序排列v第一步: 自连接 Lk-1 insert into Ckselect p.item1, p.item2, , p.itemk-1, q.itemk-1from Lk-1 p, Lk-1 qwhere p.item1=q.item1, , p.itemk-2=q.itemk-

23、2, p.itemk-1 q.itemk-1v第二步: 修剪forall itemsets c in Ck doforall (k-1)-subsets s of c doif (s is not in Lk-1) then delete c from Ck E-MAIL:BXXHSSINA.COM如何计算候选集的支持度v计算支持度为什么会成为一个问题?候选集的个数非常巨大 一笔交易可能包含多个候选集v方法:用 hash-tree 存放候选集树的叶子节点 of存放项集的列表和支持度内部节点 是一个hash表Subset 函数: 找到包含在一笔交易中的所有候选集 E-MAIL:BXXHSSINA

24、.COM生成候选集的例子vL3=abc, abd, acd, ace, bcdv自连接 : L3*L3abc 和 abd 得到 abcd acd 和 ace 得到 acdev修剪:ade 不在 L3中,删除 acdevC4=abcd E-MAIL:BXXHSSINA.COM提高Apriori效率的方法v基于Hash的项集计数: 如果一个 k-项集在hash-tree的路径上的一个计数值低于阈值,那他本身也不可能是频繁的。v减少交易记录: 不包含任何频繁k-项集的交易也不可能包含任何大于k的频繁集v分割: 一个项集要想在整个数据库中是频繁的,那么他至少在数据库的一个分割上是频繁的。v采样: 在给

25、定数据的子集上挖掘,使用小的支持度+完整性验证方法v动态项集计数: 在添加一个新的候选集之前,先估计一下是不是他的所有子集都是频繁的。 E-MAIL:BXXHSSINA.COMApriori 够快了吗? 性能瓶颈vApriori算法的核心:v用频繁的(k 1)-项集生成候选的频繁 k-项集v用数据库扫描和模式匹配计算候选集的支持度vApriori 的瓶颈: 候选集生成v巨大的候选集:v104 个频繁1-项集要生成 107 个候选 2-项集v要找尺寸为100的频繁模式,如 a1, a2, , a100, 你必须先产生2100 1030 个候选集v屡次扫描数据库: v如果最长的模式是n的话,那么需

26、要 (n +1 ) 次数据库扫描 E-MAIL:BXXHSSINA.COM6.4数据挖掘的聚类算法数据挖掘的聚类算法6.4.1 聚类分析的概念与分类v聚类分析概念v聚类分析方法的分类 类别算法分裂(划分)法K-MEANS算法(K-平均)、K-MEDOIDS算法(K-中心点)、CLARANS算法(给予选择的方法)层次法BIRCH算法(平衡迭代归约和聚类)、CURE算法(代表聚类)、CHAMELEON算法(动态模型)基于密度的方法DBSCAN算法(基于高密度连接区域)、OPTICS算法(对象排序识别)、DENCLUE算法(密度分布函数)基于网格的方法STING算法(统计信息网格)、CLIQUE算法

27、(聚类高维空间)、WAVE-CLUSTER算法(小波变换)基于模型的方法统计学方法、神经网络方法 E-MAIL:BXXHSSINA.COM6.4数据挖掘的聚类算法数据挖掘的聚类算法6.4.2 聚类分析中两个对象之间的相异度计算方聚类分析中两个对象之间的相异度计算方法法v区间标度变量计算方法区间标度变量计算方法 v二元变量计算方法 v标称型、序数型和比例标度型变量计算方法 v混合类型的变量计算方法 E-MAIL:BXXHSSINA.COM6.4数据挖掘的聚类算法数据挖掘的聚类算法6.4.3 划分方法划分方法v典型的划分方法:典型的划分方法:k-平均和平均和k-中心点中心点 基于簇的重心技术:k-

28、平均方法 基于有代表性的对象的技术:k-中心点方法 v大型数据库中的划分方法:基于选择的K-中心点CLARANS方法 E-MAIL:BXXHSSINA.COM6.4数据挖掘的聚类算法数据挖掘的聚类算法v6.4.4 层次方法层次方法v凝聚的和分裂的层次聚类凝聚的和分裂的层次聚类 凝聚层次聚类方法AGNES 分裂层次聚类方法DIANA v利用层次方法的平衡迭代归约和聚类 综合的层次聚类方法 BIRCHv利用代表点聚类 一种新颖的层次聚类算法 CUREv一个利用动态模型的层次聚类算法 动态模型的聚类法动态模型的聚类法 chameleon (变色龙) E-MAIL:BXXHSSINA.COM6.4数据

29、挖掘的聚类算法数据挖掘的聚类算法6.4.5 基于密度的方法v一个基于高密度连接区域的聚类方法 DBSCAN 聚类方法v通过对象排序识别聚类结构 OPTICS聚类分析方法 v基于密度分布函数的聚类 基于一组密度分布函数的聚类算法 DENCLUE E-MAIL:BXXHSSINA.COM6.4数据挖掘的聚类算法数据挖掘的聚类算法6.4.6 基于网格的方法统计信息网络 STING是一种基于网格的多分辨率聚类技术 聚类高维空间 CLIQUEclustering in quest, CLIQUE聚类算法 6.4.7 基于模型的聚类方法增量概念聚类算法 COBWEB 6.4.8 模糊聚类算法 E-MAIL

30、:BXXHSSINA.COM6.5 数据挖掘的统计分析算法数据挖掘的统计分析算法v6.5.1 区分方法v6.5.2 回归模型v6.5.3 优点与缺点 E-MAIL:BXXHSSINA.COM6.6 数据挖掘的品种优化算法v6.6.1 品种优化v6.6.2 品种优化算法 E-MAIL:BXXHSSINA.COM6.7数据挖掘的进化算法数据挖掘的进化算法6.7.1 遗传算法v如何工作 v优缺点 6.7.2 神经网络算法v如何工作 v无指导的学习 v竞争学习竞争学习v自组织特征映射模型 v优缺点 E-MAIL:BXXHSSINA.COM6.7数据挖掘的进化算法数据挖掘的进化算法v神经网络模型性别区域

31、职位B类客户年龄交易额受教育的年限图6.10 神经网络模型C类客户跳槽客户隐节点隐节点A类客户隐节点隐节点 E-MAIL:BXXHSSINA.COM第7章 非结构化数据挖掘本章内容:v7.1 Web数据挖掘v7.2 空间群数据挖掘v7.3 多媒体数据挖掘 E-MAIL:BXXHSSINA.COM7.1 Web数据挖掘7.1.1 非结构化数据源Web数据挖掘的难点 对数据来源分析异构数据环境 半结构化的数据结构 解决半结构化的数据源问题 文本总结 XML与Web数据挖掘技术 XML的产生与开展 XML的主要特点 E-MAIL:BXXHSSINA.COM7.1 Web数据挖掘7.1.1 非结构化数

32、据源XML在Web数据挖掘中的应用两个或更多异质数据库之间进行通信的应用 大局部处理负载从Web效劳器转到Web客户端的应用 Web客户端将同样的数据以不同的浏览形式提供给不同的用户的应用 需要智能Web代理根据用户个人的需要裁减信息内容的应用 E-MAIL:BXXHSSINA.COM7.1 Web数据挖掘7.1.2 Web挖掘分类挖掘分类Web挖掘Web content mining(Web内容挖掘)Web structure mining(Web结构挖掘)Web usage mining(Web访问挖掘)Search result mining(搜索结果再挖掘)General access

33、 pattern tracking(一般访问模式跟踪)Customized usage tracking(定制的使用跟踪)Web page content mining(Web页面内容挖掘)图7.1 Web挖掘分类 E-MAIL:BXXHSSINA.COMWeb挖掘三种方法比较 Web内容挖掘Web结构挖掘Web访问挖掘处理数据类型IR方法数据库方法Web结构挖掘用户访问挖掘无结构和半结构化数据半结构化数据主要数据自由文本、HTML标记的超文本HTML标记的超文本文档内及文档间的超链接Serverlog,proxy serverlog,client log表示方法词集、段落、概念、IR的三种经

34、典模型OEM 关系图关系表、图处理方法TFIDF、统计、机器学习、自然语言理解数据库技术机器学习、专有算法(如HITS pagerank)统计、机器学习、关联规则主要应用分类、聚类、模式发现模式发现、数据向导、多维数据库、站点创建与维护页面权重分类聚类、模式发现用户个性化、自适应Web站点、商业决策 E-MAIL:BXXHSSINA.COM7.1 Web数据挖掘vWeb挖掘的根本构架 访问者注册用户网站交易信息浏览信息数据库、数据仓库Web日志文件Web Serer中其他信息数据预处理模块结构数据挖掘模块Web挖掘的基本构架页面访问情况Web结构模式Web内容模式知识非结构数据挖掘模块 E-M

35、AIL:BXXHSSINA.COM7.1 Web数据挖掘7.1.3 Web内容挖掘信息检索information retrieve ,IR方法 数据库方法 7.1.4 Web结构挖掘Page-Rank方法 7.1.5 Web访问挖掘对Web日志进行清洗、过滤和转换以及剔除无关记录 采用统计学、模式识别、人工智能、数据库数据挖掘等领域的成熟技术在Web的使用记录中挖掘知识 Web使用挖掘中的模式分析 E-MAIL:BXXHSSINA.COM7.1 Web数据挖掘7.1.6 利用利用Web日志的聚类算法日志的聚类算法v客户群体的模糊聚类算法客户群体的模糊聚类算法 v用户访问兴趣的算法用户访问兴趣的

36、算法 v客户群体聚类的客户群体聚类的Hamming距离算法距离算法 v基于模糊理论的基于模糊理论的Web页面聚类算法页面聚类算法 vWeb页面聚类的页面聚类的Hamming距离算法距离算法 E-MAIL:BXXHSSINA.COM7.1 Web数据挖掘电子商务中的电子商务中的Web挖掘挖掘电子商务中电子商务中Web挖掘的作用挖掘的作用 电子商务中电子商务中Web挖掘的根本问题挖掘的根本问题 电子商务中的数据挖掘工具电子商务中的数据挖掘工具 文本信息挖掘工具文本信息挖掘工具 用户访问模式挖掘工具用户访问模式挖掘工具 用户导航行为挖掘工具用户导航行为挖掘工具 综合性的综合性的Web分析工具分析工具

37、 E-MAIL:BXXHSSINA.COM7.2 空间群数据挖掘空间群数据挖掘7.2.1 空间群数据挖掘空间群数据挖掘概念 从空间数据中抽取隐含的知识、空间关系、空间及与非空间之间的有意义的特征或模式。 7.2.2 空间群数据挖掘分类空间群数据挖掘分类 v空间检索 v空间拓扑叠加分析 v空间模拟分析 E-MAIL:BXXHSSINA.COM7.2 空间群数据挖掘空间群数据挖掘v7.2.3 空间数据挖掘的体系结构空间数据挖掘的体系结构空间数据结构查询与优化原则的分析信息集成模式知识级处理语义级检索与索引领域知识模式知识对象和属性抽取物理级底层特性处理设计图7.4 空间数据挖掘的体系结构对象级特征

38、处理语义概念级处理用户空间数据处理 E-MAIL:BXXHSSINA.COM7.3多媒体数据挖掘多媒体数据挖掘7.3.1 多媒体数据挖掘的概念7.3.2 多媒体数据挖掘的分类v图像数据挖掘 v视频数据挖掘 v音频数据挖掘 E-MAIL:BXXHSSINA.COM7.3多媒体数据挖掘多媒体数据挖掘7.3.3 多媒体数据挖掘的体系结构原始数据媒体数据摄取媒体编码存档浏览引擎分类特征抽取查询引擎工具交互式学习索引的生成用户图7.5 功能驱动的多媒体挖掘体系结构基于底层特性的索引与检索元数据与数据抽取原则的分析信息集成模式知识级处理语义级检索与索引领域知识模式知识对象级的索引与检索物理级底层特性处理设

39、计图7.6 信息驱动的多媒体挖掘的结构对象级特征处理语义概念级处理用户多媒体处理 E-MAIL:BXXHSSINA.COM第8章 离群数据挖掘本章内容v离群数据挖掘概念v离群数据挖掘分类v离群数据挖掘算法v市场营销离群数据的特点 E-MAIL:BXXHSSINA.COM第8章 离群数据挖掘 8.1 离群数据挖掘的概念8.2 离群数据挖掘的分类基于统计学 基于距离的方法 基于偏移 高维数据的离群数据探测 基于规那么的分类离群数据挖掘方法 基于密度(density-based)的离群挖掘方法 E-MAIL:BXXHSSINA.COM8.3离群数据挖掘的算法离群数据挖掘的算法基于统计的方法基于统计的

40、方法基于距离的离群数据方法基于距离的离群数据方法基于距离的离群数据定义基于距离的离群数据定义 基于距离的离群数据挖掘的算法分类及算法描基于距离的离群数据挖掘的算法分类及算法描述述 基于距离的算法的改进基于距离的算法的改进 8.3.3 基于偏离的离群数据挖掘基于偏离的离群数据挖掘序列离群数据技术序列离群数据技术 OLAP数据立方体技术数据立方体技术 E-MAIL:BXXHSSINA.COM8.3离群数据挖掘的算法离群数据挖掘的算法v8.3.4 高维数据的离群数据挖掘高维数据的离群数据挖掘v8.3.5 基于小波的离群数据挖掘基于小波的离群数据挖掘 v时序数据的离群数据挖掘时序数据的离群数据挖掘 v

41、基于聚类的离群数据基于聚类的离群数据CL E-MAIL:BXXHSSINA.COM8.4市场营销离群数据挖掘市场营销离群数据挖掘市场营销离群数据挖掘特点市场营销离群数据挖掘特点8.4.2 基于分形的市场营销离群数据挖掘模型基于分形的市场营销离群数据挖掘模型v几个定义几个定义 E-MAIL:BXXHSSINA.COM第9章 数据挖掘语言与工具选择本章内容v9.1 数据挖掘语言及其标准化v9.2 数据挖掘研究热点v9.3 数据挖掘工具的选择 E-MAIL:BXXHSSINA.COM9.1 数据挖掘语言及其标准化v9.1.1 数据挖掘语言分类类别特点功能代表数据挖掘查询语言数据挖掘原语五种原语DMQ

42、L数据挖掘建模语言基于XML的语言文档类型定义、通用模式PMML通用数据挖掘语言集成全面OLE DB for DM E-MAIL:BXXHSSINA.COM9.1 数据挖掘语言及其标准化9.1.1 数据挖掘语言分类数据挖掘查询语言5种数据挖掘原语定义。 任务相关数据原语 被挖掘的知识的种类原语 背景知识原语 兴趣度测量原语 被发现模式的表示和可视化原语 E-MAIL:BXXHSSINA.COM9.1 数据挖掘语言及其标准化9.1.1 数据挖掘语言分类数据挖掘建模语言 头文件a header 数据模式a data schema数据挖掘模式a data mining schema预言模型模式a p

43、redictive model schema预言模型定义definitions for predictive models全体模型定义definitions for ensembles of models 选择和联合模型、全体模型的规那么rules for selecting and combining models and ensembles of models 异常处理的规那么rules for exception handling E-MAIL:BXXHSSINA.COM9.1 数据挖掘语言及其标准化9.1.1 数据挖掘语言分类通用数据挖掘语言 数据挖掘模型Data Mining Mod

44、el,DMM预言联接操作Predication Join Operation OLE DB for DM模式行集合Schema Rowsets 9.1.2 分析与评价 E-MAIL:BXXHSSINA.COM9.2数据挖掘的研究热点 v网站的数据挖掘 v生物信息或基因的数据挖掘 v文本的数据挖掘 E-MAIL:BXXHSSINA.COM9.3 数据挖掘工具的选择数据挖掘工具的选择9.3.1 评价数据挖掘工具的优劣指标评价数据挖掘工具的优劣指标v数据准备 v数据访问 v算法与建模 v模型的评价和解释 v用户界面 E-MAIL:BXXHSSINA.COM9.3 数据挖掘工具的选择数据挖掘工具的选择

45、9.3.2 通用数据挖掘产品与工具通用数据挖掘产品与工具POLY ANALYST IBM DB2 lntelligent Miner和并行可视化探索者和并行可视化探索者PVE DB Miner BO的的Business Miner SPSS股份公司股份公司SPPS CHAID SAS研究所股份公司研究所股份公司SAS,JMP NeuralWare股份公司股份公司 信息发现股份公司信息发现股份公司IDIS RightPoint公司的数据挖掘工具公司的数据挖掘工具DataCruncher DataMind公司公司DataMind专业版,专业版,DataMindCruncherPilot软件股份公司

46、软件股份公司Pilot 发现效劳器发现效劳器 Angoss国际国际Knowledge SEEKER Silicon Graphics计算机系统公司计算机系统公司MineSet 商务工程公司商务挖掘器商务工程公司商务挖掘器 Cognos软件公司软件公司Scenario 思维机器公司思维机器公司(Darwin) . E-MAIL:BXXHSSINA.COM9.3 数据挖掘工具的选择数据挖掘工具的选择9.3.3 国内的数据挖掘产品与工具国内的数据挖掘产品与工具菲奈特一融通公司菲奈特一融通公司广州华工明天科技广州华工明天科技 复旦大学数据采掘工具复旦大学数据采掘工具ARMiner 9.3.4 数据可视化工具的选择数据可视化工具的选择高

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论