已阅读5页,还剩33页未读, 继续免费阅读
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
在线教务辅导网: 教材其余课件及动画素材请查阅在线教务辅导网 QQ:349134187 或者直接输入下面地址: 1 第二篇 数据挖掘与空间数据挖掘 第五章 数据挖掘概念与数据预处理 2 第五章 目录 5.1 数据挖掘概述 5.2 数据挖掘分类 5.3 数据挖掘系统 5.4 数据预处理 5.5 数据挖掘与数据仓库 5.6 数据挖掘的应用和发展 5.7 本章小结 3 引例 美国加州某个超级连锁店通过数据挖掘,从 记录着每天销售和顾客基本情况的数据库中 发现,在下班后前来购买婴儿尿布的顾客多 数是男性,他们往往也同时购买啤酒。于是 这个连锁店的经理当机立断重新布置了货架 ,把啤酒类商品布置在婴儿尿布货架附近, 并在两者之间放上土豆片之类的佐酒小食品 ,同时把男士们需要的日常生活用品也就近 布置。这样一来,上述几种商品的销量几乎 马上成倍增长。 4 5.1 数据挖掘概述(1) 数据库中的知识发现(Knowledge Discovery in Database,简称KDD)是一个从数据库中挖掘有效 的、新颖的、潜在有用的和最终可理解的模式的复 杂过程。 1)数据是一组事实的集合,它可以来自不同的数据源,可 以是规则数据,也可以是非规则数据。 2)模式是关于数据子集的某种语言描述的表达式或某种可 应用的模型,又称为知识。 3)模式必须是有效的、新颖的、潜在有用的和最终可理解 的,分别用可信度、新颖度、可用度和简单度对其进行评 价。 4)KDD过程是一个复杂过程,其步骤如图5.1所示。 5 5.1 数据挖掘概述(2) 图5.1 KDD步骤 KDD步骤 研究问题域。包括掌握应预先了解的有关知识和确定数据挖掘任务; 选择目标数据集。根据上一步骤的要求选择要进行挖掘的数据; 数据预处理。将上一步骤的数据进行集成、清理、变换等,使数据转换为 可以直接应用数据挖掘工具进行挖掘的高质量数据; 数据挖掘。根据数据挖掘任务和数据性质选择合适的数据挖掘工具挖掘模 式; 模式解释与评价。去除无用的或冗余的模式,将有趣的模式以用户能理解 的方式表示,并储存或提交给用户; 应用。用上述步骤得到的有趣模式(或知识)指导人的行为。 数据挖掘(Data Mining,简称DM)是KDD过程中对数据真正应用算法 抽取知识的那一步骤,是KDD过程中的重要环节。人们往往不加区分地 使用KDD和DM,本书也不明确区分两者。 6 5.2 数据挖掘分类 5.2.1概述 1. 根据挖掘的数据源类型分类 2. 根据采用的挖掘技术分类 3. 根据发现的知识类型分类 5.2.2描述性挖掘 1. 特征与比较描述 2. 关联分析 3. 聚类分析 4. 异常检测 5.2.3预测性挖掘 1. 数据分类 2. 数值预测 7 5.3 数据挖掘系统 5.3.1 数据挖掘系统的结构 图5.2 数据挖掘系统的典型结构 8 5.3.2 数据挖掘系统的设计 在数据挖掘系统的设计中,需要考虑如下问 题。 1. 数据挖掘系统怎样与数据源集成 2. 数据挖掘系统怎样指定目标数据集 3. 数据挖掘系统怎样指定数据挖掘任务 4. 数据挖掘系统怎样解释与评价模式 5. 数据挖掘系统怎样利用领域知识 6. 数据挖掘系统怎样提交知识 9 5.4 数据预处理 5.4.1 数据清理(1) 1. 消除不完整 1)使用一个全局常量填充:例如,某顾客表中的 年龄属性,使用“unknown”填充。 2)使用属性平均值填充:例如,某顾客表中的薪 水属性,使用薪水属性平均值填充。 3)使用相同类的属性平均值填充:例如,在分类 规则挖掘中,可以使用与给定样本属于相同类的 其他样本的属性平均值填充。 4)使用最可能的值填充:例如,将某顾客表中的 薪水属性作为预测属性,采用预测算法,预测给 定样本的薪水属性最可能的值并填充。 10 5.4.1 数据清理(2) 2. 消除噪声 1)通过平滑数据消除噪声:例如,分箱技术,它将数据排序 ,根据分布规则将数据分布到不同箱中,根据平滑规则将同一 箱中的数据用相应数据替换。分布规则可以是等深、等宽。等 深是指每个箱中的数据个数相等;等宽是指每个箱的取值区间 大小相等。平滑规则可以是平均值平滑、中值平滑、边界平滑 。平均值平滑是指将同一箱中的数据全部用该箱中数据的平均 值替换;中值平滑是指将同一箱中的数据全部用该箱中数据的 中值替换;边界平滑是指将同一箱中的数据分别用该箱中最近 的边界值替换。 2)通过识别孤立点消除噪声:例如,采用聚类算法得到类( 或簇),在类之外的数据可以视为孤立点(或噪声)并消除。 3. 消除不一致 11 5.4.1 数据清理(3) 例5.1 假设某属性的值为18,12,3,9,7,6,15, 21,16,采用分箱技术平滑数据消除噪声。分布规 则为等深、深度为3,平滑规则为平均值平滑。 首先,将属性的值排序为3, 6, 7, 9, 12, 15, 16, 18, 21 然后,根据分布规则(等深、深度为3)将数据分布到 箱1:3, 6, 7 箱2:9, 12, 15 箱3:16, 18, 21 最后,根据平滑规则(平均值平滑)将数据替换为 箱1:5.3, 5.3, 5.3 箱2:12, 12, 12 箱3:18.3, 18.3, 18.3 12 5.4.2 数据集成 冗余是一个重要问题。一个属性是冗余的,如果它能 由另外的属性“导出” 。有些冗余可以被相关分析检测 到。 对给定的两个数值属性A、B,它们之间的相关性可以 根据下式计算 式中,n是元组个数, 、 分别是A、B的平均值 (即 ), 、 分别是A、B的标准差 (即 )。 如果rA,B0,则A与B正相关,A的值随着B的值的增加而增加; 如果rA,B0,则A与B负相关,A的值随着B的值的增加而减少; 如果rA,B=0,则A与B独立。因此,|rA,B|很大时,A与B可以去除 一个。 13 5.4.3 数据变换(1) 1. 最小-最大规格化 对给定的数值属性A, minA,maxA为A规格化前 的取值区间,new_ minA,new_ maxA 为A规格化 后的取值区间,最小-最大规格化根据下式将A的 值v规格化为值v 14 5.4.3 数据变换(2) 例5.2 假设某属性规格化前的取值区间为 100,100,规格化后的取值区间为0,1, 采用最小-最大规格化66,得 15 5.4.3 数据变换(3) 2. 零-均值规格化 对给定的数值属性A, 、 分别为A的平均值、标 准差,零-均值规格化根据下式将A的值v规格化为 值v 16 5.4.3 数据变换(4) 例5.3 假设某属性的平均值、标准差分别为 80、25,采用零-均值规格化66 17 5.4.3 数据变换(5) 3. 小数定标规格化 对给定的数值属性A,max|A|为A的最大绝对值,j为满足 下式的最小整数 小数定标规格化根据下式将A的值v规格化为值v 18 5.4.3 数据变换(6) 例5.4 假设属性A规格化前的取值区间为 120,110,采用小数定标规格化66,A的最 大绝对值为120,j为3,66规格化后为 19 5.4.4 数据归约(1) 属性归约:又称为维归约、属性子集选择、特征子 集选择,它通过删除不相关的或冗余的属性减小数 据集,它的目标是找出最小属性集, 使得数据在其 上的概率分布尽可能地接近在原属性集上的概率分 布。 粗糙集方法 决策树分类 记录归约 :通过用少量记录代表或替换原有记录来 减小数据集。 抽样 数据概化(面向属性归纳) 20 5.4.4 数据归约(2) 面向属性归纳:根据属性的概念分层,通过阈值控 制,将属性的低层属性值用相应高层概念替换,并 合并由此得到的相同记录,达到记录归约。 给定关系表、各个属性的概念层次树及属性阈值, 面向属性归纳对各个属性进行如下处理: 首先根据属性A的概念层次树,将关系表中A的属性值转换 为最低层的相应概念,也称为叶概念,统计关系表中A的不 同叶概念个数,如果A的不同叶概念个数大于A的属性阈值 ,再根据A的概念层次树,将关系表中A的叶概念转换为上 一层的相应概念,如此重复,直至关系表中A的不同概念个 数小于等于A的属性阈值;最后合并相同记录,并统计重复 记录数目。 21 5.4.4 数据归约(3) 例5.5 假设气温如表5.2所示,“地名”、“气 温”属性的概念层次树分别如图5.3、图5.4所 示,属性阈值均为4,采用面向属性归纳进行 记录归纳,气温如表5.3所示,记录由6个归 约为3个,count的值表示重复记录数目。 图5.3 “地名”属性的概念层次树 22 5.4.4 数据归约(4) 图5.4 “气温”属性的概念层次树 23 5.4.5 属性概念分层的自动生成(1) 离散属性概念分层的自动生成:这种方法基 于这样一个事实:概念层次树中高层的概念 个数一般少于低层的概念个数。 连续属性概念分层的自动生成:基于熵的离 散化技术。 24 5.4.5 属性概念分层的自动生成(2) 例5.6 “地址”属性的值由国家、省、市组成 ,如表5.4所示。首先统计国家、省、市的不 同值个数,不同值个数最少的在最高层,依 次类推,可以得到“地址”属性的概念层次树 结构,也称为模式定义的概念分层。如图5.5 所示,国家在最高层、省在中间层、市在最 低层。然后根据结构的从属关系,确定各层 的概念及从属关系,最终得到“地址”属性的 概念层次树。如图5.6所示,因为市从属于省 ,而昆明市、大理市、玉溪市、曲靖市的省 都是云南省,所以它们从属于云南省,同理 ,成都市从属于四川省,贵阳市从属于贵州 省。 25 5.4.5 属性概念分层的自动生成(3) 表5.4 “地址”属性 地址 国家省市 中国云南省昆明市 中国云南省大理市 中国四川省成都市 中国贵州省贵阳市 中国云南省玉溪市 中国云南省曲靖市 26 5.4.5 属性概念分层的自动生成(4) 27 5.4.5 属性概念分层的自动生成(5) 基于熵的离散化技术 1)给定关系表r及其连续属性A,计算在A的取值 区间V上的记录集合S的熵。 S的熵定义为: 式中,|c|为在S中属于目标类c的记录数,当目标 属性是A时,为A取属性值v(=c)的记录数,|S| 为S中的记录数。 28 5.4.5 属性概念分层的自动生成(6) 2)对A在V上取的每个v,用v划分V为v1(v)、 v2(v),划分S为S1,S2,计算在此划分下S的熵 。 在此划分下S的熵定义为: 式中,|S1|、|S2|、|S|分别为S1、S2、S中的记录数, E(S1)、E(S2)分别为S1、S2的熵。 29 5.4.5 属性概念分层的自动生成(7) 3)对在V上的每个划分v1(v)、v2(v),计算 在此划分下S的信息增益。 在此划分下S的信息增益定义为: 式中,E(S)为S的熵,E(S,v)为在此划分下S的熵。 4)选择使S的信息增益最大的划分作为最佳划分, 记为V1(T)、V2(T)(假设T是使S的信息增益 最大的v)。 5)递归地应用步骤1)4)于V1、V2及S1、S2上, 直至满足一定的结束条件,例如,最大信息增益小 于某个阈值。 30 5.4.5 属性概念分层的自动生成(8) 例5.7 假设“气温”属性就是目标属性,它的 取值区间为100,100,在此区间上的属性 值及记录数如表5.5所示,采用基于熵的离散 化技术生成“气温”属性的概念层次树。 表5.5 “气温”属性 属性值36182226 记录 数69362821 31 5.4.5 属性概念分层的自动生成(9) 首先,划分区间100,100 32 5.4.5 属性概念分层的自动生成(10) G(100, 100, 3)=2.03782.0378=0 G(100, 100, 6)= 2.03781.7465=0.2913 G(100, 100, 18)= 2.03781.464=0.5738 G(100, 100, 22)= 2.03781.0741=0.9637 G(100, 100, 26)= 2.03781.3323=0.7055 最佳划分为 V1=100, 22) (T=22) V=22, 100(T=22) 并且产生“气温”属性的概念层次树的相应最高层与 次高层,如图5.7所示。 33 5.4.5 属性概念分层的自动生成(11) 图5.7 “气温”属性的概念层次树的部分结构 其次,应用相同方法分别划分区间100,22) 、22,100,并且产生“气温”属性的概念层次 树的相应下一层,等等。 34 5.5 数据挖掘与数据仓库 数据挖掘需要高质量的数据,因此需要认真选择或 者建立一种适合数据挖掘应用的数据环境。 数据仓库能够满足数据挖掘技术对数据环境的要求 。因为数据仓库是一个用以更好地支持企业或组织 的决策分析处理的、面向主题的、集成的、不可更 新的、随时间不断变化的数据集合。 数据挖掘和数据仓库的协同工作,一方面,可以迎 合和简化数据挖掘过程中的重要步骤,提高数据挖 掘的效率和能力,确保数据挖掘中数据来源的广泛 性和完整性。另一方面,数据挖掘技术已经成为数 据仓库应用中极为重要和相对独立的方面和工具。 35 5.6 数据挖掘的应用和发展 5.6.1 数据挖掘的应用 1. 数据挖掘在零售业中的应用 2. 数据挖掘在金融业中的应用 3. 数据挖掘在电信业中的应用 4. 数据挖掘在生物医学中的应用 5. 数据挖掘在天文学中的应用 6. 数据挖掘在竞技运动中的应用 36 5.6.2 数据挖掘未来研究方向 1)数据库系统、数据仓库系统和Web数据库 系统的数据挖掘集成
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 酒店厨房专项考试题及答案
- 高考戏剧专项练习题及答案
- 2026年供应链采购专员考试题(含答案)
- 2026年妇科常见急症处置考试试卷试题及答案
- 2026年道路客运企业安全员考试试卷试题及答案
- 2026年县级医院临床医师岗招聘笔试试题及答案
- 2026年病案首页填写质量控制指南考试试卷试题及答案
- 2026年外贸业务员考试题库(含答案)
- 2026年糖尿病酮症酸中毒救治试题及答案
- 2026年输血科技术人员试题(附答案)
- 24J113-1 内隔墙-轻质条板(一)
- 实木家具工艺标准全流程
- 第五章空间分析原理与方法
- 危险品航材培训教材
- 亳州市通源门窗幕墙有限公司智能门窗及幕墙制造项目环境影响报告表
- GB/T 8804.2-2003热塑性塑料管材拉伸性能测定第2部分:硬聚氯乙烯(PVC-U)、氯化聚氯乙烯(PVC-C)和高抗冲聚氯乙烯(PVC-HI)管材
- GB/T 26773-2011智能运输系统车道偏离报警系统性能要求与检测方法
- 林业基础知识-1林业基础知识试题林业专业基础知识林业知识林业专业知识林业相关知识
- 转化医学课件
- 农村幼儿园简介六篇
- 水生生物学教案
评论
0/150
提交评论