(计算机应用技术专业论文)数据挖掘在电动车连锁管理系统中的应用研究.pdf_第1页
(计算机应用技术专业论文)数据挖掘在电动车连锁管理系统中的应用研究.pdf_第2页
(计算机应用技术专业论文)数据挖掘在电动车连锁管理系统中的应用研究.pdf_第3页
(计算机应用技术专业论文)数据挖掘在电动车连锁管理系统中的应用研究.pdf_第4页
(计算机应用技术专业论文)数据挖掘在电动车连锁管理系统中的应用研究.pdf_第5页
已阅读5页,还剩56页未读 继续免费阅读

(计算机应用技术专业论文)数据挖掘在电动车连锁管理系统中的应用研究.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

江苏大学工程硕士学位论文 摘要 近年来,绿色、节能、环保成为交通工具发展的主题,电动车作为顺 应这一主题的产品得到了大力的推广,市场需求迅速扩大,电动车产业也 有了爆炸式发展,使得电动车厂家、电动车营销公司对电动车连锁管理系 统软件的需求日益迫切。传统的管理软件只是为生产厂家、销售公司提供 日常业务管理功能,而不能为电动车企业提供生产和营销决策支持。本文 从提高企业业务支撑数据的利用率出发,用数据挖掘的方法找出数据中隐 藏的规律,从而为电动车企业的生产、销售等提出决策依据。 通过从专门为盐城绿源电动车开发的连锁管理系统软件着手,分析了 s q ls e r v e r 2 0 0 0 数据库的表结构,根据构建数据仓库的要求,对数据库内 的数据进行变换、选择、清理和集成,组建数据仓库。利用s q ls e r v e r 2 0 0 0 集成的a n a l y s i ss e r v i c e s 建立系统数据源连接,产生一个存放多维数据集、 角色、数据源、共享维度和挖掘模型的数据库结构,创建时间、车型、用 户、员工和分公司等维度,生成多维数据集,再创建计算成员和虚拟维度, 加入成员属性和角色。最后,针对电动车连锁管理系统,具体提出了三种 数据挖掘模型:一是用m i c r o s o f t 决策树创建o l a p 数据挖掘模型,展现了 用户收入与会员卡类型之间的关系;二是m i c r o s o f t 决策树创建关联挖掘模 型,揭示了用户学历与收入之间的关系;三是用聚集功能创建o l a p 数据 挖掘模型,反映了用户的收入情况。所有的这些工作都是在s q ls e r v e r 2 0 0 0 和a n a l y s i ss e r v i c e s 中统一完成。 通过对服务器上电动车用户的数据挖掘,可以发现用户收入、学历、 婚姻状况、会员卡和购车类型等之间有着丰富的联系,特别是当数据库中 数据足够多时,能进一步揭示区域、车型、故障率、季节等之间是密切关 联的,从而为电动车企业的生产、销售服务。 关键词:数据仓库,数据挖掘,a n a l y s i ss e r v i c e s ,决策树,关联挖掘, 聚集 江苏大学工程硕士学位论文 a b s t r a c t i nr e c e n ty e a r s ,g r e e n , e n e r g ys a v i n g ,e n v i r o n m e n t a lp r o t e c t i o ni n t ot h ed e v e l o p m e n t o ft h et h e m eo ft r a n s p o r t e l e c t r i cb i k e sa st h ep r o d u c t sc o n f o r n lt ot h i st h e m eh a sb e e n v i g o r o u s l yp r o m o t i n gt h em a r k e td e m a n df o rr a p i de x p a n s i o n ,t h ee l e c t r i cb i k ei n d u s t r yh a s a l s oe x p l o s i v e ,m a k i n gm a n u f a c t u r e r so fe l e c t r i cv e h i c l e s ,e l e c t r i cb i k em a r k e t i n gc o m p a n y f o re l e c t r i cb i k e sc h a i nm a n a g e m e n ts y s t e ms o f t w a r en e e d so f i n c r e a s i n g l yu r g e n t o n l yt h e t r a d i t i o n a l m a n a g e m e n t s o f t w a r ef o rm a n u f a c t u r e r sa n ds a l e s c o m p a n i e st op r o v i d e d a y t o - d a yb u s i n e s sm a n a g e m e n tf u n c t i o n s a n d c a nn o tp r o v i d ef o rt h ee l e c t r i cb i k e p r o d u c t i o na n dm a r k e t i n gd e c i s i o ns u p p o r t i nt h i sp a p e r , i m p r o v ee n t e r p r i s eb u s i n e s ss u p p o r t f r o mt h eu t i l i z a t i o no fd a t a , u s i n gd a t am i n i n gm e t h o d st oi d e n t i f yh i d d e nd a t ai nt h el a w , s o a st ot h ee l e c t r i cb i k eb u s i n e s sp r o d u c t i o na n ds a l e sm a d ep u r s u a n tt ot h ed e c i s i o n - m a k i n g t h r o u g hf r o mb e g a nf o rt h ey a n c h e n gl u y u a ne l e c t r i cb i k ed e v e l o p m e n t sc h a i n - l i k e m a n a g e m e n ts y s t e ms o t t w a r e t oa n a l y z es q ls p e c i a l l yt h es e r v e r 2 0 0 0d a t a b a s et a b l e s t r u c t u r e a c c o r d i n g t ot h ec o n s t r u c t i o nd a t aw a r e h o u s e s r e q u e s t 。c a r r i e d o nt h e t r a n s f o r m a t i o n t h ec h o i c e t h ec l e a n i n gu pa n dt h ei n t e g r a t i o nt ot h ed a t a b a s ed a t a s e tu pt h e d a t aw a r e h o u s e u s i n gs q ls e r v e r 2 0 0 0i n t e g r a t e da n a l y s i ss e r v i c e se s t a b l i s h m e n ts y s t e m d a t ap o o lc o n n e c t i o n h a sad e p o s i t i n gm u l t i - d i m e n s i o n a ld a t as e t t h er o l e t h ed a t ap 0 0 1 t h e s h a r i n gd i m e n s i o na n dt h ee x c a v a t i o nm o d e ld a t a b a s es t r u c t u r e d i m e n s i o n sa n ds oo n f o u n d a t i o nt i m e v e h i c l et y p e u s e r s t a f fa n d s u b s i d i a r yc o m p a n y t h ep r o d u c t i o n m u l t i d i m e n s i o n a ld a t as e t f o u n d sa g a i nc a l c u l a t e st h em e m b e ra n dt h eh y p o t h e s i z e d d i m e n s i o n j o i n st h em e m b e ra t t r i b u t ea n dt h er o l e f i n a l l y i nv i e wo ft h ee l e c t r i cb i k e c h a i n - l i k em a n a g e m e n ts y s t e mm a n a g e m e n ts y s t e m p r o p o s e dt h r e ek i n do fd a t am i n i n g m o d e ls p e c i f i c a l l y :f i r s t f o u n d st h eo l a pd a t am i n i n gm o d e lw i t ht h em i c r o s o f td e c i s i o n t r e e h a su n f o l d e db e t w e e nt h el a s e ri n c o m ea n dt h em e m b e r s h i pc a r dt y p er e l a t i o n s ;s e c o n d t h em i c r o s o f td e c i s i o nt r e ef o u n d a t i o nc o n n e c t i o ne x c a v a t i o nm o d e l h a sp r o m u l g a t e d b e t w e e nt h eu s e rs c h o o lr e c o r da n dt h ei n c o m er e l a t i o n s ;t h i r d f o u n d st h eo l a pd a t am i n i n g m o d e lw i t ht h ea c c u m u l a t i o nf u n c t i o n h a sr e f l e c t e du s e r si n c o m es i t u a t i o n a l lt h e s ew o r k a r eu n i f yi ns q ls e r v e r 2 0 0 0a n di na n a l y s i ss e r v i c e sc o m p l e t e t h r o u g ht ot h es e r v e ro nt h ee l e c t r i cb i k eu s c m j sd a t am i n i n g m a yd i s c o v e rt h a tt h e u s e i n c o m e , t h es c h o o lr e c o r d ,t h em a r i t a ls t a t u s t h em e m b e r s h i pc a r da n dt h et y p eo fb i k e h a st h er i c hr e l a t i o n s p e c i a l l yt h ed a t ai nt h ed a t a b a s et ob em a n ye n o u g h c a nf u r t h e r p r o m u l g a t et h er e g i o n t h ev e h i c l et y p e t h ef a il u r er a t e t h es e a s o nb e t w e e na n d o ni st h e c l o s ec o n n e c t i o n t h u ss e r v e sf o rt h ee l e c t r i cb i k ee n t e r p r i s e sp r o d u c t i o n k e yw o r d s :d a t aw a r e h o u s e d a t am i n i n g a n a l y s i ss e r v i c e s d e c i s i o nt r e e c o n n e c t i o n e x c a v a t i o n a c c u m u l a t i o n 学位论文版权使用授权书 本学位论文作者完全了解学校有关保留、使用学位论文的规定,同意学 校保留并向国家有关部门或机构送交论文的复印件和电子版,允许论文被 查阅和借阅本人授权江苏大学可以将本学位论文的全部内容或部分内容 编入有关数据库进行检索,可以采用影印、缩印或扫描等复制手段保存和汇 编本学位论文 本学位论文属于 保密口,在年解密后适用本授权书 不保密击 学位论文作者签名:枸金象 指导教师签名: 2 0 0 8 年z 月o 日 e 妊嗡 2 0 0 8 年6 月io 日 独创性声明 本人郑重声明:所呈交的学位论文,是本人在导师的指导下,独立进行 研究工作所取得的成果除文中已注明引用的内容以外,本论文不包含任 何其他个人或集体已经发表或撰写过的作品成果对本文的研究做出重要 贡献的个人和集体,均已在文中以明确方式标明本人完全意识到本声明 的法律结果由本人承担 学位论文作者签名:赤匀盈米 2 0 0 8 年占月f o 日 江苏大学工程硕士学位论文 第1 章绪论 1 1 研究背景 1 1 1 电动车行业的现状 电动车行业的发展在中国也仅仅是近十几年的事情,最早追溯到上世纪八十年代 的“电瓶车”,当时的“电瓶车”结构简单,功能单一,外观粗糙,其安全性、可控性 都比较差,只是在自行车的基础上加上电机、电池及传送机构,没有调速、过流保护等 功能。 到上世纪九十年代,随着电子、机械的发展,轮毂电机、大电流直流调速的出现和 发展,原有的电瓶车又焕发出新的生命力。并且,在国家大力提倡节能环保的今天,“电 瓶车”在相关法律层面上,也有了一个统一名称电动车( 或电动自行车) ,发展和 使用电动车对国家和社会都有好处。 1 ) 发展电动车是缓解我国石油资源紧缺的矛盾。我国是一个石油资源紧缺的国家, 并且,石油资源是一个不可再生的能源,为了解决这一矛盾,除了发展小排量汽车、节 能汽车以及限制摩托车之外,发展电动车是一个重要的方向,它不使用一次性的石油资 源,而是使用可再生的电力能源。 2 ) 节能。一般电动车每百公罩耗电不到一度半,折合人民币一块钱左右,非常节 能,既经济又实用。 3 ) 扩大就业,拉动内需。我国是一个自行车王国,用电动车取代自行车是一个发 展方向,现在越来越多的民间资本都投资入到这个行业中来。事实证明,电动车在我国 的发展f j 景是非常广阔的,电动车的发展对国家税收的贡献是同样不可以忽视的。 4 ) 环保。电动车行业是一个能耗低、污染小、能推动就业和拉动内需的新型产业, 其本身无污染、零排放,符合保护环境的基本国策,大多数地方政府都在大力扶持和促 进这一新型产业的健康发展 1 1 2 电动车行业发展存在的问题 截止2 0 0 4 年,经过短短八年的发展,我国电动自行车生产企业就有464 家,分布 在15 省、市。据中自协联同各省市协会对226 家企业的统计,电动自行车产量已达 3 99 72 万辆,应当说,电动车行业已具备了相当的规模,但从现阶段看,由于发 展时间还过于短暂,电动车的技术水平还参差不齐,法律法规的定义还不太明确,电动 车的标准还过于陈旧,跟不上形势,各个地方对电动车的管理还有很大的争议,生产厂 家的管理,商家的管理水平都不高,造成各厂家商家各自为战,缺少决策依据,总体上 不能适应经济发展的需要,与国际先进的管理水平有较大差距,主要存在的问题有: 1 ) 规模扩大,产量增长,但形成规模的企业依然很少: 2 ) 自行车企业生产电动自行车的依然不多,优势并不明显; 江苏大学工程硕士学位论文 3 ) 产品质量参差不齐,质量状况不容乐观; 4 ) 电动车企业管理不统一,自成体系,独自发展: 5 ) 电动车行业专业人才短缺,研究相对落后是电动车发展的一大障碍。 1 2 目的和意义 随着国家信息基础结构建设目标的实施,企业在各种活动中普遍采用现代信息技术 来提高竞争力。传统的基于数据的管理信息系统已不能满足决策者对数据质量的需求, 面向决策的知识管理系统正在蓬勃兴起。管理信息系统与决策支持系统的结合是目前最 为迫切需要的系统软件。 当前的电动车管理系统从功能上来讲只是为生产厂家和商家提供r 常订单、用户管 理、销量报表、发货管理、结算管理、出库管理、应收管理等管理功能,侧重于办公自 动化,起到一个对厂家和商家助手的作用,对经营者的决策影响很小。实际上,在生产 和销售活动中,研究市场需求、了解用户心理、挖掘营销潜力是整个活动的另外一个支 点,也是生产经营的最终目的,是获取最终利润的源泉。 适应这一要求,本文探讨了将数据挖掘应用在电动车连锁管理系统中,实现了数据 仓库与数据抽取、转换、装载( e t i 。) 、数据挖掘、联机分析处理( o l a p ) 的有机集成和各 种数据挖掘算法的无缝连接,提供了多种数据转换规则和数据挖掘算法,全面支持企业 的生产、销售、市场营销、财务管理、企业决策等领域活动。 在这方面,传统的分析方法有:区域经理的调查报告、经销商的信息反馈、销售部 的发货统计、财务部的收支状况等等,这些方法大多是采用问卷调查、电话回访、财务 报表等形式,有一定的适用性,但是对于一些未知市场进行面积大、精度高的预测,就 会显露出它的不足: 一是成本高,要一家一家调查,甚至连调查的对象都难找; 二是实时性不强,往往一个调查报告出来,要好长时间,等结果出来,市场又发生 了新的变化: 三是采样数据少,缺少数据支撑,结果不具有普遍性,实用性不强。 本文研究的目的是在现有的电动车管理系统中采用数据挖掘技术对已有数据进行 数据挖掘,提取出对我们有用的信息,以此作为厂家和商家的生产与销售的决策依据, 具有广泛的实际意义,它的挖掘结果具有真实性、实时性,有可靠的使用价值。 1 3 研究内容 系统研究电动车连锁管理系统的最终目的是从现有的电动车管理数据入手,用数据 挖掘的方法从中找出有利于电动车发展关联因素,其主要内容有: 分析s o ls e r v e r 2 0 0 0 数据库的表结构,对数据库内的数据进行变换、选择、清理和 集成,组建数据仓库。利用s q ls e r v e r 2 0 0 0 集成的a n a l y s i ss e r v i c e s 建立系统数据源 连接,产生一个存放多维数据集、角色、数据源、共享维度和挖掘模型的数据库结构, 2 江苏大学工程硕士学位论文 创建时间、车型、用户、员工和分公司等维度,生成多维数据集,再创建计算成员和虚 拟维度,加入成员属性和角色。最后,以如下三种挖掘模型进行数据挖掘: 一是用m i c r o s o f t 决策树创建o l a p 数据挖掘模型,展现了用户收入与会员卡类型之 问的关系; 二是m i c r o s o f t 决策树创建关联挖掘模型,揭示了用户学历与收入之间的关系; 三是用聚集功能创建o l a p 数据挖掘模型,反映了用户的收入情况。 所有的这些工作都是在s q ls e r v e r 2 0 0 0 和a n a l y s i ss e r v i c e s 中统一完成,尽管挖 掘结果不一定很权威,但随着数据的大量积累,数据挖掘的可靠性也在不断增加。 3 江苏大学工程硕士学位论文 第2 章数据仓库与数据挖掘技术 2 1 数据仓库技术 2 1 1 数据仓库的定义及主要特点 1 ) 数据仓库的定义 数据仓库( d a t aw a r e h o u s e ) 的概念是由在1 9 9 2 年出版的建立数据仓库( b u i l d i n g t h ed a t aw a r e h o u s e ) 一书中提出的。它是以关系数据库、并行处理和分布式技术为基 础的信息新技术。 第一种定义,也就是w h i n m o n 对数据仓库的定义是:面向主题的、集成的、稳定 的、随时问变化的、历史的、支持决策制定过程的数据集合。即数据仓库是在管理人员 决策中的面向主题的、集成的、非易失的并且随时间变化而变化的数据集合。 从逻辑上讲,数据仓库又是一个多维数据库,它为信息分析提供了良好的基础。 第二种定义,从数掘仓库的应用性来看,t i m s h e l t e r 提出了基于应用的数据仓库定 义:数据仓库是将分布在企业网络中的不同信息岛上的商业数据集成在一起,存储在一 个单一的集成关系型数据库中。利用这种集成信息,可方便用户对信息的访问,更可使 决策人员对一段时间内的历史数据进行分析,研究事务发展方向。 第三种定义,数据仓库是作为d s s 基础的分析型d b ,用来存放大容量的只读数据, 为制定决策提供所需的信息。 第四种定义,数据仓库是与操作型系统相分离的、基于标准企业模型集成的、带有 时间属性的,即与企业定义的时| 日j 区段相关,面向主题且不可更新的数据集合。 第五种定义,数据仓库是大量有关公司数掘的数据存储。 第六种定义,数据仓库提供公司数据以及组织数据的访问功能,其中的数据是一致 的,并且可以按每种功能的商业度量方式分解和组合:数据仓库也是一套查询、分析和 呈现信息的工具。 不管如何定义,他们都有共同的特征:首先,数据仓库包含大量数据,其中一些数 据来源于组织中的操作数据,也有一些数据可能来自于组织外部;其次,组织数据仓库 是为了更加便利地使用数据进行决策,可以看出,数据仓库是一种管理技术,旨在通过 通畅、合理、全面的信息管理,达到有效的决策支持,是明确为决策支持服务的,而数 据库是为事务处理服务的。 2 ) 数据仓库的特点口1 根据数据仓库的定义,可概括数据仓库具有如下几个特点: ( 1 ) 数据仓库是面向某一特定主题的 主题是数据归类的标准和要求,每一个主题基本对应一个宏观的分析领域。面向主 题的数据组织方式是在较高层次上对分析对象的一个完整的、一致的描述,能完整统一 4 江苏大学工程硕士学位论文 地刻画各个分析对象所涉及的企业的各项数据,以及数据间的关系。以电动车生产厂家 举例,面向应用的操作型数据可能是用户、车型、颜色、销售区域、经销商、销售价格 等主题范围。 数据仓库以企业或组织中固有的业务主题作为处理主题,是从整体全局的角度来衡 量这些主题在企业中的作用,是在较高层次上将信息系统中的数据综合、分类并进行分 析利用。 ( 2 ) 数据仓库是集成的 数据在进入数据仓库之前,必须经过加工与集成。对不同来源的数据进行数据结构 统一和编码,数据仓库的数据是从原有分散的数据库数据中提取出来的。这些数据是对 操作型数据进行清理和归整的结果,并不是简单的归并和拷贝。数据在进入数据仓库之 前,必然先经过加工和集成,将原始数据结构作一个从面向应用到面向主题的转变。 ( 3 ) 数据仓库是稳定的 数据仓库中数据是从事务操作型数据中抽取出来,这些数据并不是最新的、专有的, 而是来源于其它数据库的,反映了相当长时问内的历史数据,是不同时间点的数据库快 照的统计综合和重组的集合,平时只对数据进行相应的查询操作,而不会对其进行修改, 因此,它们是稳定的。 ( 4 ) 数据仓库是反映历史变化的 操作型数据库主要关心当前某一个时问段内的数据,而数据仓库中的数据却通常包 含历史信息,系统记录了企业从过去某一时间点到目前的各个时段的信息,因此,对于 不断增加数据的数据仓库,数据仓库需要不断提前更新数据,将数据仓库中的超过储存 期限的数据进行删除,数据仓库内大量的综合数据需要随时| 日j 变化不断进行重新综合, 这样才能对企业的发展历程和未来趋势做出定量的分析和预测。 3 ) 数据集市。” 数据仓库的工作范围和成本往往很大,信息技术部门必须对所有的用户并以全企业 的眼光对待任何一次的决策分析,这就形成了代价很高、时间较长的大项目,因此,就 形成了数据集市。 数据集市( d a t am a r t s ) 是一种更小、更集中的数据仓库,是具有特定应用的数据 仓库,主要针对某个具有战略意义的应用或者具体部门级的应用,支持用户利用已有的 数据获得重要的竞争优势或者找到进入新市场的具体解决方案 数据集市不等于数据仓库,多个数据集市简单合并起来并不能成为数据仓库,这主 要是由于各数据集市之间对详细数据和历史数据的存储存在大量冗余,同一个问题在不 同的数据集市的查询结果也可能不一致,甚至相互矛盾,以及各数据集市之问的源数据 库系统难以管理。 2 1 2 数据库与数据仓库关系 传统的数据库技术是以单一的数据资源,即数据库为中心进行事务处理、批处理、 5 江苏大学工程硕士学位论文 决策分析等各种数据处理工作。主要划分为两大类:操作型处理和分析型处理( 或信息 型处理) 。操作型处理也叫事务处理,是指对数据库联机的同常操作,通常是对一个或 一组纪录的查询和修改,主要为企业的特定应用服务的,注重响应时间,数据的安全性 和完整性:分析型处理则用于管理人员的决策分析,经常要访问大量的历史数据。传统 数据库系统优先使用在企业的同常事务处理工作上,而难于实现对数据的分析和处理要 求,已经无法满足数据处理多样化的要求。操作型处理和分析型处理的分离成为必然。 近年来,随着数据库技术的应用和发展,人们尝试对数据库中的数据进行再加工, 形成一个综合的,面向分析的环境,以更好支持决策分析,从而形成了数据仓库技术 ( d a t aw a r e h o u s i n g ,简称d w ) 。 作为决策支持系统( d e c i s i o n m a k i n gs u p p o r ts y s t e m ,简称d s s ) ,数据仓库系统 包括: 1 ) 数据仓库技术; 2 ) 联机分析处理技术( o n - l i n ea n a l y t i c a lp r o c e s s i n g ,简称o l a p ) : 3 ) 数据挖掘技术( d a t am i n i n g ,简称d m ) ; 它们之间具有极强的互补关系。数掘仓库是为了满足人们在高度数据积累基础上进 行数掘分析的需要而产生的,在数据仓库的三个概念中,数据仓库是企业进行数据分析 的基础,它的主要工作是将数据库中的原始数据进行归纳整理,聚集成一个可供高层次 使用的数据集合。数据仓库弥补了原有的数据库的缺点,将原来的以单一数据库为中心 的数据环境发展为一种新环境:体系化环境。 从数据库发展到数据仓库,主要有以下原因: 1 ) 数掘太多,信息贫乏。随着数据库技术的发展,企事业单位建立了大量的数据 库,数据越来越多,但这些数据对辅助决策却没有什么帮助,如何将大量的数据转化为 辅助决策信息就成了研究的重点。 2 ) 异构环境数据的转换和共享。对于各类数据库产品的增加,异构环境的数据也 随之增加,如何实现这些异构环境的数据转换和共享也成了研究热点。 3 ) 将数据库的事务处理功能转变成能支持决策的数据。数据库用于事务处理,若 要达到辅助决策,则需要更多的数据,对大量数据的综合分析来对未知事件进行预测, 因此,数据仓库的概念提出后,在几年内的时i 、日j 内就得到了迅速的发展陌1 。 2 1 3 数据仓库的内涵、功能 1 ) 数据仓库具有以下内涵: ( 1 ) 数据仓库应支持多种数据源,不仅仅是数据库,还应有各种数据文件、文本文 件、应用程序等。 ( 2 ) 数据仓库中存放的应该不仅是供分析使用的数据,还应有在一定激发条件下能 主动起作用的处理规则、算法、甚至是过程。 ( 3 ) 传统的物理数据仓库方法并非唯一的选择,应根据需求的具体情况,建立虚拟 6 江苏大学工程硕士学位论文 数据仓库的解决方案。 ( 4 ) 数据仓库中的数据并不完全是原始数据的简单归并和搬家,而应该是增值和统 一。因此“汇总并统一”是数据仓库的必须内涵描述m 。 2 ) 作为一种满足数据仓库管理要求的特殊的数据库系统,d w 具体包含以下五个基 本功能部分。 ( 1 ) 数据定义:主要完成数据仓库的结构和环境的定义,包括:定义数据仓库中数 据库的模式、数据仓库的数据源和从数据源提取数据的一组规则或模型。 ( 2 ) 数据提取:数据提取部分负责从数据源中提取数据,并对获得的源数据 ( s o u r c ed a t a ) 进行必要的加工处理,使其成为数据仓库可以管理的数据格式和语义规 范。 ( 3 ) 数据管理:数据管理由一组系统服务工具组成,负责数据的分配和数据分配完 成获取数据的存储分布及分发到多台数据库维护,支持数据应用。服务器,维护服务完 成数据的转储和恢复、安全性定义和检测等,另外,用户直接输入系统的数据也由该部 分完成。 ( 4 ) 数据应用:数据仓库的数据应用除了一般的直接检索性使用外,还应当能够完 成比较常用的数据表示和分析,如图表表示、统计分析、结构分析等。对于涉及到众多 数据的综合性较强的分析,可以借助专业数据分析工具。在客户机服务器体系结构下, 这部分功能可以放在客户端来完成,以便充分利用客户机上丰富的数据分析软件。这部 分主要包括了报表生成、o l a p 、数据挖掘、决策支持工具应用等方面,其中o l a p 和数据 挖掘是近年来研究的重点和热点。 3 ) 数据仓库是储存、管理信息数据的一种组织形式,其物理实质仍是计算机存储 数据的系统,只是由于使用目的不同,其存储的数据在量和质上以及前端分析工具上与 传统信息系统有所不同。数据仓库中的数据按照功能分为以下几部分盯1 : ( 1 ) 元( m e t a ) 数据。元数据是数据仓库的核心,是关于数据的数据,是关于数据 和信息资源的描述信息。它通过对数据的内容、质量、条件和其他特征进行描述和说明, 帮助人们有效地定位、评论、比较、获取和使用相关数据。 ( 2 ) 源数据。指分布在不同的应用系统中,存储在不同的平台和不同的数据库中的 大量的数据信息,是数据仓库的物质基础。 ( 3 ) 数据变换工具。为了优化数据仓库的分析性能,源数据必须经过变换以最适宜 的方式进入数据仓库。变换主要包括提炼、转换。数据提炼主要是指数据的抽取,并对 抽取数据删去不需要的运行信息,检查数据的完整性和相容性等:数据转换指统一数据 编码和数据结构、给数据加上时间标志、根据需要对数据进行各种运算以及语义转换等。 数据变换工具为数据库和数据仓库之间架起了一座桥梁,使源数据得到了增值和统一, 最大限度地满足了数据仓库高层次决策分析的需要。 ( 4 ) 源数据经过变换进入数据仓库。数据仓库以多维方式来组织数据和显示数据。 属性维和时自j 维是数据仓库反映现实世界动念变化的基础,他们的数据组织方式是整个 7 江苏大学工程硕士学位论文 数掘仓库技术的关键。 ( 5 ) 数据分析工具。数据仓库系统的目标是提供决策支持,它不仅需要一般的统计 分析工具,更需要功能强大的分析和挖掘工具,是数据仓库系统的重要组成部分。分析 工具主要实现对数据仓库中的数据进行分析和综合。挖掘工具负责从大量的数据中发现 数据的关系,找到可能忽略的信息,预测趋势和行为。 数据仓库并非是一个仅仅存储数据的简单信息库,它是一个以大型数据管理信息系 统为基础,附加在这个数据库系统之上,存储了从企业所有业务数据库中获取的综合数 据,并能利用这些综合数据为用户提供经过处理后的有用信息的应用系统。如果说传统 数据库系统的重点与要求是快速、准确、安全、可靠地将数据存进数据库中的话,那么 数据仓库的重点与要求就是能够准确、安全、可靠地从数据库中取出数据,经过加工转 换成有规律信息之后,再供管理人员进行分析使用。 2 1 4 数据仓库的工作过程 数据仓库的工作过程分为:数据的抽耿、数据的存储和管理、数据的展现等关键技 术川。 1 ) 数据的选取 数据的选取是数据进入仓库的入口。目的是确定发现任务的操作对象,即目标数据, 是根据用户的需要从原始数据库中抽取的一组数据。由于数据仓库是一个独立的数据环 境,它需要通过抽取过程将数据从联机事务处理系统、外部数据源、脱机的数据存储介 质中导入数据仓库。数据抽取在技术上主要涉及互连、复制、增量、转换、调度和监控 等几个方面的处理峥1 。在数据抽取方面,未来的技术发展将集中在系统功能集成化方面, 以适应数据仓库本身或数据源的变化,使系统更便于管理和维护。 2 ) 数据的存储和管理 数据仓库的组织管理方式决定了它有别于传统数据库的特性,也决定了其对外部数 掘的表现形式。数据仓库管理所涉及的数据量比传统事务处理大得多,且随时问的推移 而快速累积。在数据仓库的数据存储和管理中需要解决的是如何管理大量的数据、如何 并行处理大量的数据如何优化查询等。目前,许多数据库厂家提供的技术解决方案是 扩展关系型数据库的功能,将普通关系数据库改造成适合担当数据仓库的服务器。 3 ) 数据的展现 在数据展现方面主要的方式有: a 查询:实现预定义查询、动态查询、o l a p 查询与决策支持智能查询; b 报表:产生关系数据表格、复杂表格、o l a p 表格、报告以及各种综合报表: c 可视化:用易于理解的点线图、直方图、饼图、网状图、交互式可视化、动态模 拟、计算机动画技术表现复杂数据及其相互关系; d 统计:进行平均值、最大值、最小值、期望、方差、汇总、排序等各种统计分析; e 挖掘:利用数掘挖掘等方法,从数据中得到关于数据关系和模式的知识。 8 江苏大学工程硕士学位论文 2 2 数据挖掘技术 2 2 1 定义 数据挖掘( d m ,d a t am i n i n g ) ,又称数据库中的知识发现( k d d ,k n o w l e d g e d i s c o v e r y i nd a t a b a s e ) ,数据挖掘是从大量的数据中,抽取出潜在的、有价值的知识( 模型或规 则) 的过程。是- - f l 新兴的边缘交叉学科,它融合了数据库技术、人工智能、统计学、 信息检索等最新技术的研究成果。涉及到机器学习、模式识别、数据库、数理统计、数 据可视化、高性能计算、神经网络和空间数据分析等多门学科,被认为是目前具有广泛 应用的一个重要的研究课题n 驯。 数据挖掘与传统的数据分析( 如查询、报表、联机应用分析) 的本质区别是数据挖掘 是在没有明确假设的前提下去挖掘信息、发现知识。数据挖掘所得到的信息应具有先前 未知、有效和可实用三个特征。先前未知的信息是指该信息是预先未曾预料到的,即数 据挖掘是要发现那些不能靠直觉发现的信息或知识,甚至是违背直觉的信息或知识,挖 掘出的信息越是出乎意料,就可能越有价值。在商业应用中最典型的例子就是一家连锁 店通过数据挖掘发现了小孩尿布和啤酒之间有着惊人的联系。 2 2 2 数据挖掘的种类及方法 1 ) 数据挖掘能做以下六种不同事情( 分析方法) 1 : 分类、估值、预言、相关性分组或关联规则、聚集、描述和可视化。 2 ) 数据挖掘分类 以上六种数据挖掘的分析方法可以分为两类:直接数据挖掘、间接数据挖掘。直接 数据挖掘目标是利用可用的数据建立一个模型,这个模型对剩余的数据,对一个特定的 变量进行描述。日j 接数据挖掘目标中没有选出某一个具体的变量,而是用模型进行描述, 在所有的变量中建立起某种关系。 分类、估值、预测属于直接数据挖掘,相关性分组或关联规则、聚集、描述和可视 化属于间接数据挖掘。 3 ) 各种分析方法的简介n 幻 ( 1 ) 分类 分类就是找出一个类别的概念描述,它代表了这类数据的整体信息,即该类的内涵 描述,并用这种描述来构造模型,一般用规则模型或决策树模型来表示。分类是利用训 练数据通过一定的算法而求得分类规则,分类可被用于规则描述和预测。 首先,从数据中选出己经分好类的训练集,在该训练集上运用数据挖掘分类的技术, 建立分类模型,对于没有分类的数据进行分类。 例子:a 电动车客户,分类为收入高、中、低三类 b 分配客户到预先定义的三类 注意:类的个数是确定的,预先定义好的 ( 2 ) 估值 9 江苏大学工程项士学位论文 估值与分类类似,不同之处在于:分类描述的是离散型变量的输出;而估值则是处 理连续值的输出。分类的类别是确定类的数目的,估值的量是不确定的。 例子:a 根据购买车型,估计一个家庭的电动车数量 b 根据购买数量,估计一个家庭的收入 一般来说,估值可以作为分类的第一步。给定一些输入数据,然后通过估值,得 到未知的连续变化的值,再根据预先设定的值进行分类。 ( 3 ) 预测( p r e d i c a ti o n ) 预测是利用历史数据找出变化规律,建立模型,并由此模型对未来数据的种类及特 征进行预测。预测关心的是精度和不确定性,通常用预测方差来度量。 预测是通过分类或估值起作用的,也就是说,通过分类或估值得出模型,该模型用 于对未知变量的预言。从这种意义上说,预测其实没有必要分为一个单独的类。预测的 目的是对未来未知变量的预测,这种预测是需要时问来验证的,即必须经过一定时间后, 彳知道预言准确性是多少。 ( 4 ) 关联分析( a s s o c i a t i o na n a l y s i s ) 关联规则挖掘是由r a k e s ha p w a l 等人首先提出的。两个或两个以上变量的取值之间 存在某种规律性,就称为关联。数据关联是数据库中存在的一类重要的、可被发现的知 识。关联分为简单关联、时序关联和因果关联。关联分析的目的是找出数据库中隐藏的 关联网。一般用支持度和可信度两个阀值来度量关联规则的相关性,还不断引入兴趣度、 相关性等参数,使得所挖掘的规则更符合需求。 例如:电动车销售中客户在购买豪华车a 的同时,经常会购买双电池b ,h h a 二 b ( 关 联规则) 。 ( 5 ) 聚类分析( c l u s t e r i n g ) 聚类是把数据按照相似性归纳成若干类别,同一类中的数据彼此相似,不同类中的 数据相异。聚类分析可以建立宏观的概念,发现数据的分布模式,以及可能的数据属性 之f b j 的相互关系。 ( 6 ) 时序模式( ti m e - s e r i e sp a t t e r n ) 时序模式是指通过时i 日j 序列搜索出的重复发生概率较高的模式。与回归一样,它也 是用己知的数据预测未来的值,但这些数据的区别是变量所处时问的不同。 2 2 3 数据挖掘技术 数据挖掘常用技术有以下几种n 3 。: 1 ) 人工神经网络 仿照生理神经网络结构的非线形预测模型,通过学习进行模式识别。神经网络近来 越来越受到人们的关注,因为它为解决复杂度较大的问题时提供了一种相对来说比较有 效的简单方法。神经网络可以很容易的解决具有上百个参数的问题( 当然实际生物体中 存在的神经网络要比我们这罩所说的程序模拟的神经网络要复杂的多) 。 i o 江苏大学工程硕士学位论文 神经网络常用于两类问题:分类和回归。 在结构上,可以把一个神经网络划分为输入层、输出层和隐含层( 如图2 - 1 ) 。输 入层的每个节点对应个个的预测变量。输出层的节点对应目标变量,可有多个。在输 入层和输出层之问是隐含层( 对神经网络使用者来说不可见) ,隐含层的层数和每层节 点的个数决定了神经网络的复杂度。 图2 一l 神经元网络 除了输入层的节点,神经网络的每个节点都与很多它前面的节点( 称为此节点的输 入节点) 连接在一起,每个连接对应一个权重w 此节点的值就是通过它所有输入节点 的值与对应连接权重乘积的和作为一个函数的输入而得到,我们把这个函数称为活动函 数或挤压函数。如图2 2 中节点4 输出到节点6 的值可通过如下计算得到: w 。水节点1 的值+ w :,i :节点2 的值 神经网络的每个节点都可表示成预测变量( 节点l ,2 ) 的值或值的组合( 节点3 - 6 ) 。 注意节点6 的值已经不再是节点l 、2 的线性组合,因为数据在隐含层中传递时使用了活 动函数。实际上如果没有活动函数的话,神经元网络就等价于一个线性回归函数,如果 此活动函数是某种特定的非线性函数,那神经网络又等价于逻辑回归。 调整节点问连接的权重就是在建立( 也称训练) 神经网络时要做的工作。最早的也 是最基本的权重调整方法是错误回馈法,现在较新的有变化坡度法、类牛顿法、 l e v e n b e r g m a r q u a r d t 法、和遗传算法等。无论采用那种训练方法,都需要有一些参数 来控制训练的过程,如防止训练过度和控制训练的速度。 图2 - 2 带权重w x y 神经元网络 决定神经网络拓扑结构( 或体系结构) 的是隐含层及其所含节点的个数以及节点之 白j 的连接方式。要从头开始设计一个神经网络,必须要决定隐含层和节点的数目,活动 函数的形式,以及对权重做哪些限制等,当然如果采用成熟软件工具的话,他会帮你决 江苏大学工程硕士学位论文 定这些事情。 2 ) 决策树 决策树提供了一种展示类似在什么条件下会得到什么值这类规则的方法。比如,在 对电动车潜在用户的判断中,要先征对用户的年龄作了主观判断,图2 - 3 是为了解决这 个问题而建立的一棵决策树,从中我们可以看到决策树的基本组成部分:决策节点、分 支和叶子。 是否接 詹 、 一 年龄 3 5 岁 别 豪华车 架子车 豪华车架子车 图2 3 电动:乍h j 户决策树 决策树中最上面的节点称为根节点,是整个决策树的丌始。图中的根节点是“用户 年龄 3 5 岁”,对此问题的不同回答产生了“是 和“否”两个分支。决策树的每个节 点的个数与决策树所用的算法有关,如c a r t 算法得到的决策树每个节点有两个分支,这 种树称为二叉树,决策树中允许节点多于两个子节点的树称为多叉树1 。 每个分支要么是一个新的决策节点,要么是树的结尾,称为叶子,在沿着决策树从 上到下的判断过程中,在每个节点都会遇到一个问题,对每个节点的问题的不同回答会 导致不同的分支,最后才会到达一个叶子节点,这个过程就是利用决策树进行分类的过 程。 假如说电动

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论