已阅读5页,还剩51页未读, 继续免费阅读
(计算机系统结构专业论文)决策支持技术在企业erp中的研究与应用.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
大连理工大学硕士学位论文 摘要 信息技术的广泛发展,使得企业信息化建设的步伐越来越快。企业已经不满足于基 于业务的简单数据处理而进一步提出了从数据中发现对其发展有指导意义的知识,即 商业智能方面的需求。决策支持的概念正是针对这一需求而提出,它将企业中庞大繁杂 的数据转换为知识,进而辅助企业经营决策,甚至自动生成商业决策。因此,决策支持 已经成为企业竞相追逐的目标。 决策支持技术主要包括数据仓库、0 l a p ( 联机分析处理) 、数据挖掘三项。数据仓 库整合了分散在企业各个方面的数据,为提供决策准备了大量的有效数据;o l a p 提供 了从不同的角度分析数据的功能,能为企业经营者提供企业数据的全局视图:数据挖掘 从企业数据中找出隐藏在数字背后的有价值的模式和关联,为企业经营者制定决策提供 有参考意义的知识。 论文以辽宁某印染股份有限公司的实际需求为背景,合理处理历史数据,通过适当 的数学模型对数据进行整合,最后使用决策支持的关键技术,构建了历史销量分析模型 和新品种收益度预测模型,并将这些模型嵌入到该公司e r p 系统中。 企业经营者可以使用历史销量分析模型,分析产品的淡旺季、掌握不同客户对不同 品种的需求量,从而辅助经营者制定正确的营销战略,如定期促销、联系客户等等。新 品种收益度预测模型可用于企业开发新品种之前,对其销售前景、收益程度进行预测, 为制定是否开发该新品种的决策提供指导。 模型解决了企业经营者制定决策时,仅凭借经验判断,而缺少数据支持这一问题。 实践证明,使用模型之后,经营决策的正确率得到很大提高。可见,模型为企业制定正 确的发展战略提供强有力的支持。 关键词:数据仓库;0 l a p , 数据挖掘;s q ls e r v e r2 0 0 5 大连理工大学硕士学位论文 r e s e a r c ha n da p p l i c a t i o no f d e c i s i o ns u p p o r tt e c h n i q u e si ne r p a b s t r a c t e n t e r p r i s e i n f o r m a t i o nc o n s t r u c t i o ni s g r o w i n gf a s t e ra n d f a s t e rd u et o r a p i d d e v e l o p m e n to fi n f o r m a t i o nt e c h n o l o g y e n t e r p r i s e sn o ts a t i s f y i n g 、 ,i t ht h eb u s i n e s s - b a s e d s i m p l ed a t ap r o c e s s i n gp r o p o s eab u s i n e s si n t e l l i g e n c ed e m a n df o rd e v e l o p m e n tg u i d a n c eb y d i g g i n gk n o w l e d g eo u to fd a t a t h ec o n c e p to fd e c i s i o ns u p p o r ti sj u s tf o rt h i sd e m a n d d e c i s i o ns u p p o r to a rt r a n s f o r mt h eh u g ea n dc o m p l i c a t e dd a t ai n t ok n o w l e d g es oa st oa s s i s t t h ed e c i s i o nm a k i n go f b u s i n e s sm a n a g e m e n t , e v e nt om a k eb u s i n e s sd e c i s i o n sa u t o m a t i c a l l y s od e c i s i o ns u p p o r th a sb e c o m ea na i me n t e r p r i s e sc o m p e t i n gf o r t h et e c h n o l o g yo fd e c i s i o n s u p p o r ti n c l u d e s d a t aw a r e h o u s e , o l a p ( o nl i n e a n a l y t i c a lp r o c e s s i n g ) a n dd a t am i n i n g d a t aw a r e h o u s ei n t e g r a t e st h ed a t ad i s t r i b u t i n gi n a l lp a r t so fe n t e r p r i s e ,a n dp r e p a r e sa l a r g es c a l eo fe f f e c t i v ed a t af o rd e c i s i o nm a k i n g o l a p c a na n a l y z et h ed a t af i - o md i f f e r e n tp o i n t sa n dp r o v i d eg l o b a lv i e wo f e n t e r p r i s e sd a t af o ri t s m a n a g e r s d a t am i i l i n gd i g sv a l u a b l ep a t t e r n sa n dr e l a t i o n sb e h i n df i g u r e so u to fe n t e r p r i s e s d a t a , s ot h a ti tc a no f f e rs o m er e f e r e n c ef o rt h em a n a g e r s t h i sp a p e ri sb a s e do nt h ep r a c t i c a ld e m a n do fo n ep r i n t i n ga n dd y c i i i gc o m p a n yi n l i a o n i n gp r o v i n c e i tp r o p e r l yp r o c e s s e st h eh i s t o r i c a ld a t a , a n di n t e g r a t e st h ed a t aw i t ha s u i t a b l em a t h e m a t i c a lm o d e l f i n a l l yb yt h ek e yt e c h n o l o g yo fd e c i s i o ns u p p o r t , i tc o n s t r u c t s a l la n a l y s i sm o d e lo f h i s t o r i c a ls a l e sa n da p r e d i c t i o nm o d e lo f n e wb r e e dp r o f i ta n d , e m b e d s t h e s e sm o d e l si n t o t h ec o m p a n y se r p s y s t e m t h em a n a g e r so ft h ee n t e r p r i s ec a r tu s et h ea n a l y s i sm o d e lt oa n a l y z ed e a do rp e a k s l 朗s o l lo fab r e e dt og r a s pi n f o r m a t i o na b o u td i f f e r e n tb r e e d s n e e d sa m o n gd i f f e r e n t c u s t o m e r ss o 勰t om a k ec o r r e c ts a l e ss t r a t e g i e s ,l i k ep e r i o d i c a lp r o m o t i n gs a l e s ,c u s t o m e r c o n t a c te r e t h ep r e d i c t i o nm o d e lc a r lb eu s e db e f o r ed e v e l o p m 衄to fan e wb r e e dt op r e d i c t s a l e sp r o s p e c ta n dp r o f i ts o 勰t oh e l pd e c i d ew e a t h e ro rn o tt oi n v e s ti nt h i sn e wb r e e d t h em o d e l ss o l v et h ep r o b l e mt h a t m a n a g e r sm a k ed e c i s i o n so n l yb yt l l e i r o w l l e x p e r i e n c er a t h e rt h a n d a t as u p p o r t r e s n l t ss h o wt h ec o r r e c t n e s so fd e c i s i o nm a k i n g i m p r o v e sg r e a t l ya f t e ru s i n gt h e s em o d e l sw h i c hp r o v e st h a tt h em o d e l sp r o v i d eap o w e r f u l s u p p o r tf o rt h ec o m p a n y t om a k er i g h td e v e l o p m e n ts t r a t e g i e s k e yw o r d s :d a t aw a r e h o u s e ;o l a p ;d a t am i n i n g ;s q ls e r v e r2 0 0 5 - i i i 独创性说明 作者郑重声明:本硕士学位论文是我个人在导师指导下进行的研究工 作及取得研究成果尽我所知,除了文中特别加以标注和致谢的地方外, 论文中不包含其他人已经发表或撰写的研究成果,也不包含为获得大连理 工大学或者其他单位的学位或证书所使用过的材料与我一同工作的同志 对本研究所做的贡献均已在论文中做了明确的说明并表示了谢意。 作者签名:_ 二阻日期:丕与l 业 大连理工大学硕士研究生学位论文 大连理工大学学位论文版权使用授权书 本学位论文作者及指导教师完全了解“大连理工大学硕士、博士学位 论文版权使用规定”,同意大连理工大学保留并向国家有关部门或机构送 交学位论文的复印件和电子版,允许论文被查阅和借阅。本人授权大连理 工大学可以将本学位论文的全部或部分内容编入有关数据库进行检索,也 可采用影印、缩印或扫描等复制手段保存和汇编学位论文。 作者签名:酞金 导师签名韶仁 扛 年止月日 大连理工大学硕士学位论文 1绪论 1 1 研究背景及意义 计算机和信息处理的广泛应用,标志着人类已经步入了一个迅猛发展的新时期。在 这个时期内,社会生产力大大提高,经济结构、社会结构和人类的生活方式发生了深刻 的变化和变革。人们已经不再满足于传统的数据库系统中对数据的增、删、改等业务操 作,而是希望能通过对历史数据的查询和统计,发现一些有价值的规律。人们更希望能 够从数据背后发现其隐藏的关系和规则,根据现有数据预测未来的发展趋势,为决策制 定提供帮助。数据仓库、o l a p 、数据挖掘等概念正是为了解决这些问题而提出,它们 构成了决策支持的关键技术,近年来已经引起学术界的广泛关注,逐渐成为r r 行业的 热门研究方向。 近年来,我国印染企业发展较快,加工能力位居世界首位,已经成为纺织生产大国。 但与此同时,国内印染行业的竞争也越来越激烈,而且同时又受到国外企业的竞争。可 以说,在这种环境下,一个错误的决策往往会影响企业的发展,严重的情况下,会使企 业一蹶不振,丧失优势。因此,如何得到正确的企业决策,已经成为印染企业一个刻不 容缓的问题。 本课题正是在这一背景下提出,其任务是对某印染企业的历史数据进行处理,通过 合理的数学模型整合数据,建立数据仓库。并使用o l a p 建立销量分析模型,通过模型, 企业经营者可以掌握不同时期、不同客户对不同产品的需求,从而辅助其制定正确的营 销战略;又通过分类算法建立预测模型,通过模型可以预测一个即将开发的新品种的销 售前景和收益程度,从而为制定是否生产该新品种的决策提供参考信息。 1 2 国内外研究现状 2 0 世纪7 0 年代,美国麻省理工的s m m i c h a e l 和g w i cp e t e r 首次提出决策支持 系统的概念,标志着信息系统的研究进入一个新的发展阶段【l 】。1 9 8 0 年,s p r a g u e 提出 了决策支持系统三部件结构( 对话部件、数据部件、模型部件) ,明确了决策支持系统的 基本组成,推动了决策支持系统的发展。2 0 世纪8 0 年代末9 0 年代初,决策支持系统开 始与专家系统相结合,形成智能决策支持系统t 2 l 。 9 0 年代初出现的数据仓库技术,是一种适用于决策支持系统的数据组织与管理的技 术。随之出现的联机分析处理技术和数据挖掘技术,为决策支持注入了新的活力【3 l 。 三大技术出现之后,国外企业以这三大技术为核心,结合计算机数据图形展现技术, 开始研究企业决策支持应用系统平台软件。平台的主要研发企业有m m 、微软、 决策支持技术在企业e r p 中的研究与应用 o r a c l e 、s y b a s e 、c a 、s a s 、b o 等。主要产品有m m 研发的数据仓库平台d b 2 、 i n f o r m i xo l 廿服务器。0 i 认c l e 研发的数据仓库平台o r a c l ee ) o i 也s so l a p 服务器及o r a c l ed i s c o v e r e r 前端展现工具。s y s b a s e 研发的数据仓库平台 w a r e h o u s eo l a p 服务器及p o 、e rd i m e n s i o n s 前端展现工具。c a 研发的数据 仓库平台i n f o b e a c o nr o l a p 服务器及f 也s t - t r e e s 前端展现工具。微软研发的 数据仓库平台s q ls e r v e ro l a p 服务器及e x c e l 前端展现工具。此时,国外企业 决策支持系统已进入大规模应用部署阶段,在金融业、保险业、零售业、医疗、司法、 工业部门等均有应用,较著名的应用例子有沃尔玛的啤酒和尿布案例、亚马逊的网上客 户购书潜在关联等。 国内对决策支持系统的研究和应用起步较晚,始于1 9 8 5 年1 9 9 1 年4 月全国首届 决策支持系统学术交流会的召开以及全国首届决策支持系统专业委员会的成立,是我国 决策支持系统研究和应用走向正规化的重要标志。决策支持系统在我国取得了较快的发 展。例如,清华大学经济管理学院开发的基于知识的决策支持原型系统,可以用于反通 货膨胀政策决策支持、对台经济贸易政策决策支持、计划决策支持和气候决策支持等多 个方面;西安交通大学战略与决策研究所设计开发的三峡工程决策支持原型系统,集数 据处理、模型处理、人工智能技术于一体,能够自动调度数据管理、模型管理或者决策 专家子系统等模块,为用户提供多方面的信息;天津大学系统工程研究所开发的城市交 通宏观决策系统,具有预测、评价、规划和决策四大功能。目前,关于决策支持系统的 研究已经成为我国信息系统领域的热点,受到人们的普遍关注。 1 3 本文的主要工作及组织结构 本文首先分析了决策支持中的几项关键技术数据仓库、o l a p 和数据挖掘,对 比了数据挖掘中分类任务的经典算法。继而以实际需求为背景,针对企业中决策制定的 不完善环节,建立合理的销量分析模型和品种收益度预测模型,用以辅助决策。 建立销量分析模型过程如下:首先通过预处理工具,对数据进行提取、转换和加载, 去除噪声数据、同步异构系统中的数据格式,构成数据仓库;继而建立星型多维数据集, 为数据分析提供数据源;在企业原有e r p 中建立查询导航工具,将用户的输入转化成 多维数据集的查询语言m d x ,对数据源进行筛选;最后通过前端显示工具,将分析结 果返回给用户。 建立销量预测模型的过程如为:选择合适的历史数据,通过预处理工具对其进行处 理,构建预测训练集;通过合理的数学模型,将训练集中的连续销量转换成离散的收益 大连理工大学硕士学位论文 等级:选择准确率最高的预测算法,构成模型;通过企业原有e r p 系统中的接口。将 模型部署到e r p 中。 论文的结构组织如下: 第一章主要介绍了文章研究的背景、国内外研究现状、相关的工作和组织结构。 第二章对决策支持技术进行了概述,介绍了数据仓库、o l a p 和数据挖掘的一些基 本概念,以及数据挖掘和数据仓库的关系。 数据挖掘是决策支持的一个重点研究方向,也是商业智能更深层次的体现。因此, 在论文第三章重点对数据挖掘任务及相关算法进行了描述。 论文第四章介绍构建销量分析模型的过程。并展示模型使用效果 第五章介绍品种收益度预测模型的建立过程,并将模型部署到企业原有e r p 中, 辅助经营者制定企业决策。 最后,对全文做以总结和展望。 一3 一 决策支持技术在企业e r p 中的研究与应用 2 决策支持技术概述 决策支持体系的关键技术有数据仓库、o l a p 和数据挖掘三项【】,下面分别介绍。 2 1 数据仓库 科学技术的飞速发展,使得经济和社会都取得了极大的进步,与此同时,各个领域 都产生了大量的数据。人们希望能从这样的海量数据中提取信息或者知识为决策服务, 首先就需要提出一个新的方法来处理这些海量般的数据。在这样的背景下,数据仓库概 念应运而生,它是一个综合的解决方案,用来帮助企业有关部门和业务人员做出更符合 业务发展规律的决策。 2 1 1 从数据库到数据仓库 数据库技术的广泛应用,使得对数据的增、删、改等基本处理操作成为任何一个管 理系统必备的功能。但随着数据在日常决策中的重要性越来越显著,用户逐渐发现单靠 拥有联机事务处理已经不足以获得市场竞争的优势,他们需要对其自身业务的运作以及 整个市场相关行业的情况进行分析,从而做出有利的决策。这种决策需要对大量的业务 数据,包括历史业务数据进行分析才能得到。因此,著名的数据库专家r a l p hk i m b a l l 提出这样的观点“我们花了二十多年的时间将数据放入数据库,如今是该将它们拿 出来的时候了”。 然而,在实际操作中,人们发现想要获得有用的信息并非如想象中那么简单,原因 主要有以下几个方面【5 】: ( 1 ) 所有联机事务处理强调的都是密集的数据更新处理性能和系统的可靠性,并不 关心数据查询的方便与快捷。联机分析和事务处理对系统的要求不同。同一个数据库在 理论上都难以做到两全。 ( 2 ) 业务数据往往存放于分散的异构环境中,不易统一查询访问,而且还有大量的 历史数据处于脱机状态,形同虚设。 ( 3 ) 业务数据的模式是针对业务处理系统而设计的,数据的格式和描述方式并不适 合非计算机专业人员进行业务上的分析和查询。 因此,有人感叹:2 0 年前查询不到数据是因为数据太少了,而今天查询不到数据是 因为数据太多了。针对这一问题,人们设想专门为业务的统计分析建立一个数据中心。 它的数据从联机的事务处理系统中来、从异构的外部数据源来、从脱机的历史业务数据 中来这个数据中心是一个联机的系统,它是专门为分析统计和决策支持应用服务 大连理工大学硕士学位论文 的,通过它可以满足决策支持和联机分析应用所需要的一切要求。这个数据中心就是数 据仓库,这个概念在2 0 世纪9 0 年代初被提出来。 数据仓库的兴起实际上是数据管理的一种回归,它正符合了当年关系数据库所倡导 的目的。然而,今天的数据仓库已不必再为联机事务处理的特性而无谓奔忙,由于技术 的专业化,它可更专心于联机分析领域的发展和探索 2 1 2 效据仓库定义 数据仓库的概念出现以来,不少学者从不同的角度为数据仓库下了不同的定义。 i n f o r m i x 公司的定义:数据仓库将分布在企业网络中不同信息岛上的业务数据集成 到一起,存储在一个单一的集成关系型数据库中,利用这种集成信息,可方便用户对信 息的访问,更可使决策人员对一段时间内的历史数据进行分析,研究事务发展走势。 s a s 软件研究所的定义:数据仓库是一种管理技术,旨在通过通畅、合理、全面的 信息管理,达到有效的决策支持。 斯坦福大学数据仓库研究小组的定义:数据仓库是集成信息的存储中心,这些信息 可用于查询或分析。 业界公认的数据仓库概念的创始人w h i n m o n 在1 9 9 3 年所写的著作 b u i l d i n gt h e d a t aw a r e h o u s e ) 一书中,首次系统的阐述了关于数据仓库的思想、理论,他对数据仓 库的定义是:数据仓库就是面向主题、集成的、稳定的、随时阅不断变化的数据集合, 用以支持经营管理中的决策制定过程【6 】。 2 1 3 数据仓库特性 w h 。i n m o r l 对于数据仓库的定义,同时揭示了数据仓库的特性,即:面向主题性、 数据集成性、数据非易失性、时变性和支持决策作用【刀。 ( 1 ) 面向主题性 面向主题性是数据仓库中数据组织的基本原则,数据仓库中的所有数据都是围绕着 某一个主题组织展开的。从数据组织的角度看,主题就是一些数据集合,这些数据集合 对分析对象做了比较完整的、一致的描述,这种描述不仅涉及到数据自身,而且还涉及 到数据之间的联系;而从信息管理的角度看,主题就是在一个较高的管理层次上对信息 系统中的数据按照某一具体的管理对象进行综合、归类所形成的分析对象。数据仓库的 创建、使用都是围绕主题实现的。在主题的划分中,必须保证每一个主题的独立性,也 就是说每一个主题要有独立的内涵和明确的界线。 ( 2 ) 数据集成性 决策支持技术在企业e r p 中的研究与应用 业务系统中的数据直接来之于业务,而数据仓库的数据则不然,它是从业务处理系 统中获得数据。然而,业务系统中的数据往往有其独特的格式,不一定适合为管理决策 分析服务,因此,数据仓库从业务处理系统那里获取数据时,并不能将源数据库中的数 据直接加载到数据仓库中,而是需要进行一系列的数据预处理,即数据的抽取、筛选、 清理、综合等集成工作。这也是数据仓库建设中最复杂、关键的一步。 ( 3 ) 数据非易失性 数据一旦进入数据仓库以后,就会保持一个相当长的时间,而不进行更新处理,这 就是数据仓库的数据非易失性。因为数据仓库中数据大多表示过去某一时刻的数据,主 要用于查询、分析,而且数据仓库中的数据在数据集成的环节已经保证了数据的正确性, 因此不需要像业务系统中的数据库那样经常进行修改。数据的非易失性可以支持不同的 用户在不同的时间查询、分析相同的问题时,获得同一结果。避免了以往决策分析中面 对同一问题。因为数据的变化而导致结论不同的尴尬。 ( 4 ) 时变性 数据仓库的数据非易失性,指的是相当长的一段时间之内,数据自身是不需要更新 的。但是,数据仓库还是会随着时间的推移而发生变化,这就是时变性。其主要表现在 以下三个方面: 第一,数据仓库必须能够不断捕捉主题的变化数据,将那些变化的数据追加到数据 仓库中。尽管数据仓库中的数据并不像业务数据库那样要反映业务处理的实时状况,但 是数据也不能长期不变,如果依据十年前的数据进行决策分析,那么分析的结果无疑是 不准确的。 第二,数据仓库必须随着时间的变化不断删去旧的数据内容。数据仓库的数据也有 存储期限,一旦超过了这一期限,过期数据就要被删除。只是数据仓库内的数据时限相 对较长。 第三,数据仓库包含有大量的概括数据,而这些概括数据中有很多与时间有关,需 要按照时间进行综合,按照时间进行抽取。因此,数据仓库的概括数据必须随着时间的 变化而重新进行概括处理。 ( 5 ) 支持决策作用 建立数据仓库的根本目的在于对决策的支持。企业各级管理人员可以利用数据仓库 进行各种决策的分析,利用自己敏锐的商业洞察力和业务知识从貌似平淡的数据中发现 众多的商机。因此,可以说,数据仓库为管理者利用数据进行管理决策分析提供了极大 的便利。 大连理工大学硕士学位论文 总之,建立数据仓库的目的就是把企业中分布在不同硬件、数据库、网络环境中, 为不同的业务部门服务的数据进行结构上的重组,并对其进行集成,按更方便决策分析 的角度去设计,得出企业的宝贵资源擞据,为企业的决策者进行全面分析和查询服 务 2 1 4 数据仓库体系结构 数据仓库是面向主题、面向分析和知识发现的一种数据处理技术,对数据仓库的使 用没有固定的模式,数据仓库的数据来源广泛,使用要求多变,查询要求复杂,传统的 数据库系统结构无法提供足够的灵活性来满足这种复杂多变的使用要求,因此数据仓库 的结构与操作型事务处理系统的结构有很大的不同【8 】。 信息系统的总体框架一般采用著名的z a c h r n a n 框架。数据仓库专家r a l p hk i m b a l l 针对数据仓库的具体情况对z a c h m a n 框架进行了简化,从数据体系结构、系统体系结构 和技术体系结构三个方面来描述数据仓库系统的总体框架。数据仓库的这三个体系结构 分别回答了数据仓库三方面的问题,即:数据仓库的内容是什么? 基于什么系统平台? 采用什么技术实现? 数据仓库体系结构框架的内容如表2 1 所示。 表2 1 数据仓库体系结构框架 t a b 2 1f r a m eo f d a t aw a r e h o u s es y s t e ms 咖d c i e 数据体系结构 系统体系结构技术体系结构 商务需进行商务分析与决策的信息 求需求 如何用多为数据模型来表达 体系结信息,应该包括哪些事实表 构模型和维表? 事实表和维表怎样 连接? 对网络环境、软硬件平台的 性能要求 选择什么样的网络环境和软 硬件平台? 数据具体存放在 哪里? 系统能否满足数据计 算、数据存储和数据传递的 性能要求? 如何获得信息? 如何使用信 息 如何将原始数据变换成所需 的信息,在适当的时间以正确 的内容和恰当的格式存储或 输出? 实翌紧曼黧拳攀御翼曩篇踅熟熟 法索引,进行数据库的维护平台 茹;孟釜磊藁曩簇善鬲; 决策支持技术在企业e r p 中的研究与应用 当谈论数据仓库的结构时,人们往往指的是数据仓库的技术体系结构。一个数据仓 库系统的技术体系结构总体来说包括后台数据预处理( 数据获得) ,数据仓库数据管理和 数据仓库的前台查询服务( 应用服务) 三大部分例,如图2 1 所示。 t 量程腿i 具 蠡据仓库f 曩i j 应用i a 抽毫帕洗 t 蛔挖 # 舳l i t r 篓国 萁乜 i i c i i 园国j ( 二) t - 堆鲁匡j l 、, i 。器5 、 图2 1 数据仓库的技术体系结构 f i g 2 1t e c h n o l o g ys y s t e ms h u c n i o f d a t aw a x e h o u s e 数据仓库中的数据来自企业内部不同的业务系统,甚至是企业外部的商业数据库, 这些数据在组织方式、数据格式等许多方面与数据仓库对数据的要求有很大的差别,因 此在载入数据仓库之前,需要对这些数据进行预处理。预处理包括数据源的定义、从数 据源提取数据到预处理数据区( 数据准备区) 、在数据准备区中对数据进行净化处理、作 必要的转换、再将数据加载到数据仓库,等等。后台数据预处理部分就实现这部分功能。 数据仓库的管理包括数据仓库的创建、数据仓库的维护、对数据仓库中数据的重整 和数据仓库的元数据管理等。该部分的核心功能是完成数据仓库的建模、确定数据的粒 度级别、指定数据仓库的物理存储模式、确保数据仓库的运行效率,等等。 数据仓库的应用服务部分提供了数据挖掘工具、特别查询工具、在线分析处理、交 互报告、静态报告等各种应用工具,可以使用这些工具对数据仓库中的数据进行复杂的 查询分析和知识挖掘等等。 2 20 u p 建立数据仓库的目的是为了对数据仓库中的数据进行灵活多样的查询分析。数据仓 库中数据的组织方式为进行这种查询分析提供了可能,但仅仅依靠数据仓库本身并不能 完成这种复杂的数据查询分析。为了对数据仓库中的数据进行多角度、多视图的查询, 卧l 眵 大连理工大学硕士学位论文 方便地获得概括性的或更详细的信息,就必须依靠其他技术或工具。联机分析处理 ( o l a p ) 就是这样一种技术【1 0 l 。 2 2 10 l 舻的定义 o l a p 的概念最早是由关系数据库之父e f c o d d 于1 9 9 3 年提出的。当时,c o d d 认 为联机事务处理己不能满足终端用户对数据库查询分析的需要,结构化查询语言 ( s t r u e a m :dq u e r yl a n g u a g e ,简称s q l ) 对大型数据库的简单查询也不能满足用户决策分 析的需求。因此,c o d d 提出了多维数据库和多维分析的概念,即o l a p 。 随后,根据o l a p 产品的实际应用倩况和用户对o l a p 产品的需求,人们对o l a p 做出了如下的简单明确的定义: 定义1o l a p 是针对某个特定的主题进行联机数据访问、处理和分析,并通过直 观的方式从多个维度、多种数据综合程度将系统的运行情况展现给使用者【1 1 1 。 定义2o l a p 是使分析人员、管理人员或执行人员能够从多角度对信息进行快速、 一致、交互地存取,从而获得对数据的更深入了解的一类软件技术。( o l a p 委员会的 定义) o l a p 的目标是满足决策支持或者满足多维环境下特定的查询和报表需求,它的技 术核心是“维”这个概念,因此,o l a p 也可以说是多维数据分析工具的集合。 2 2 2 0 l p 的相关概念 ( 1 ) 变量 变量从现实系统中抽象出来,用于描述数据的实际意义,即描述数据“是什么”( 人 数、单价、销售额等) 。变量都有一定取值范围,这是具体问题对变量的约束。 ( 2 ) 维 维是人们观察客观世界的角度,是一种高层次的类型划分( 时间维、地理维等) 。 ( 3 ) 维的层次 数据的维还可以存在细致程度不同的多个描述方面,即维的层次。比如时间维可分 为日期、月份、季度、年等不同的层次。 ( 4 ) 维成员 维成员即维的取值。如果一个维是多层次的。那么该维的维成员是由各个不同维层 次的取值组合而成的。如“2 0 0 7 年9 月3 0 日”是在具有3 个层次的时间维上的一个取 值。 ( 5 ) 多维数组 决策支持技术在企业e r p 中的研究与应用 多维数组是维和变量的组合表示。一个多维数组可以表示为:维l ,维2 ,。 维n ,变量。 ( 6 ) 数据单元( 单元格) 数据单元是多维数组的取值。当多维数组的各个维都选中一个维成员,这些维成员 的组合就唯一确定了一个变量的值。 2 2 30 l a p 的基本数据模式 o l a p 中的数据是为分析而用的,它们的模式结构应便于分析。在传统的数据库中, 数据模式以e - r 图与二维表为主,而在数据仓库中则以多维模式为主,它们可以有三种 结构方式【1 2 1 :星型模式( s t a rs c h e m a ) 、雪花型模式( s n o w f l a k es c h e m a ) 以及星座模式( f a c t c o n s t e l ! a 矗o ns c h e m a ) 。 ( 1 ) 星型模式 星型模式是一种多维结构,它一般由两种不同性质的表组成:一种称为事实表( f a c t t a b l e ) ,它负责存放多维结构中的主要事实;另一种称为维表( d i m e n s i o n t a b l e ) 用以建立 多维结构中的维值。一般一个r l 维的结构往往有一个事实表和n 个维表,它们构成了一 个星型形式,称为星型模式,星型模式反映了观察对象的角度。在星型模式中,主体是 事实表,而有关维的细节则描述在维表内,以达到简化事实表的目的。事实表与维表间 由公共属性相连而构成一个整体。在星型模式中,依据维表给出的取值条件,从事实表 中获得相应的结果。这种星型结构非常适合于数据分析、统计。图2 2 给出了一个星型 模式的简单实例。 图2 2 星型模式实例 f i g 2 2e x a m p l eo f s t a rs c h e m a ( 2 ) 雪花型模式 在星型模式中“维”呈单点状,但在很多情况中,“维”呈层次状,即具有一定深 度。如产品维中的层次结构为产品产品类别,客户维中的层次结构为客户地区 等。这种在维中有纵向层次所构成的星型模式的扩充称为雪花型模式。雪花型模式比星 大连理工大学硕士学位论文 型模式更为复杂,但也更有利于数据分析与决策,它反映了对对象的观察角度与深度。 图2 3 给出了一个雪花型模式的简单实例。 图2 3 雪花型模式实例 f i g 2 3e x a m p l e0 f m o w t i a k e h e n m ( 3 ) 星座模式 星座模式是星型模式的直接扩充,为了表示多个事实间的关系,可以通过共享维, 将多个星型模式连接在一起构成一个新的模式,称为星座模式。所谓共享维即指两个或 多个事实表所共同拥有的维,其对每个拥有它的事实表具有相同的意义。例如,产品维 和时间维被采购事实表和销售事实表所共同拥有。 2 2 40 l p 多维分析操作 在o l a p 多维结构上可以做多种操作,以便分析人员做实验以验证其主观分析意 图。这些操作包括:切片、切块、旋转、下钻及上探【刀。各种分析动作均以剖析数据为 目标,使分析人员能从多个角度、多侧面地观察多维结构中的数据,从而深入地了解包 含在数据中的规则性信息。 ( 1 ) 切片 在多维分析过程中,对多维数据集的某一个维选定一个维成员的操作,称为切片 ( s l i c e ) 。也就是说,如果有( 维1 ,维2 ,维i ,维n ,度量) 多维数据集, 对维i 选定了某个维成员,那么( 维l ,维2 ,维i 成员,维n ,度量) 就是 多维数据集( 维1 ,维2 ,维i ,维1 1 ,度量) 在维i 上的一个切片。这种切 片的数量完全取决于维i 上维成员的个数,个数越多,可以做的切片也就越多。 显然,这个切片不一定是我们所想象中的一个二维的“平面”切片。切片的维数取 决于原来多维数据集的维数。只有在多维数据集是三维的情况下,才能获得一个二维“平 面”切片。 ( 2 ) 切块 与切片类似,在一个多维数据集上对两个及两个以上的维选定维成员的操作,称为 切块( d i c e ) ,即在( 维l ,维2 ,维i ,维k ,维n ,度量) 多维数据 决策支持技术在企业e r p 中的研究与应用 集上,对维i ,维k 选定了维成员,那么( 维1 ,维2 ,维i 成员, 维k 成员,维n ,度量) 就是多维数据集( 维1 ,维2 ,维i ,维k , 维n ,度量) 在维i ,维k 上的一个切块。当i = k 时,切块操作就退化成了切片操 作 ( 3 ) 旋转 旋转( r o t a t e ) 即改变多维数据集中维的捧列次序,即多维数据集( 维1 ,维2 , 维n ,度量) 经旋转操作后可变换成为( 维n ,维l ,维2 ,维n - l ,度量) 。 ( 4 ) 钻探 钻探操作是用户对数据深度的操作。在多层数据中,通过钻探操作可以使用户自由 往返于不同深度的数据层次之间。钻探一般是指向下钻探,称为下钻;有时也能向上钻 探,称之为上探。 2 3 数据挖掘 人们将大量的数据存进数据仓库之后,就希望计算机自动智能地分析这些数据以获 得有益的信息,这就是数据挖掘( d a t am i n i n g ,d m ) 产生并发展的强大动力。 数据挖掘能为决策支持提供非常重要的、极有价值的信息或知识,从而产生不可估 量的效益。因此,数据挖掘市场份额正在日益扩大,越来越多的大中型企业开始利用数 据挖掘来分析公司的数据,以辅助决策,数据挖掘正逐渐成为他们在市场竞争中立于不 败之地的法宝。 2 3 1 数据挖掘概念 从技术的角度出发,所谓数据挖掘,就是从大量的、不完全的、有噪声的、模糊的, 随机的数据中,提取隐含在其中的、人们事先不知道的、但又是潜在有用的信息和知识 的过程【”】。这个定义包括以下四个层次的含义: ( 1 ) 数据源必须是真实的大量的、含噪声的; ( 2 ) 发现的是用户感兴趣的知识; ( 3 ) 发现的知识要可接受、可理解、可运用,最好能用自然语言表达发现结果; ( 4 ) 并不是要求发现放之四海皆准的知识,也不是要去发现崭新的自然科学定理和 纯数学公式,更不是什么机器定理证明,所有发现的知识都是相对的,是有特定前提和 约束条件、面向特定领域的。 从商业的角度出发,数据挖掘可以描述为:按企业既定业务目标,对大量的企业数 据进行探索和分析,揭示隐藏的、未知的或验证已知的规律性,并进一步将其模型化的 先进有效的方法。 大连理工大学硕士学位论文 2 3 2 数据挖掘的目的 数据挖掘的目的是从大量的数据中发现知识。知识是人类认识的成果或结晶,包括 经验知识和理论知识。从工程角度定义,知识是有助于解决问题的有格式的可复用的信 息。在传统的决策支持系统中,知识库中的知识和规则是有专家或程序人员建立的,是 外部输入的;而数据挖掘的任务是发现大量数据中尚未被发现的知识,是从系统内部自 动获取知识的过程。对于那些决策者已经明确了解的信息,可以用查询、联机分析处理 ( o l a p ) 或其他工具直接获得;而另外一些隐藏在大量数据中的关系、趋势,即使是管 理这些数据的专家也没有能力发现,这些信息对于决策者而言有可能是至关重要的,数 据挖掘的目的正是为了解决此类问题。 数据挖掘发现的知识通常用以下形式表示f 1 】:概念( c o n c e p t s ) 、规则( r u l e s ) 、规律 ( r e g u l a r i t i e s ) 、模式( p a t t e r n s ) 、约束( c o n s t r a i n t s ) 、可视化( v i s u a l i z a t i o n s ) 等。 这些知识可以直接提供给决策者,用以辅助决策过程;或者提供给领域专家,修正 专家已有的知识体系;也可以作为新的知识专门存储到应用系统的知识存储机构中,比 如专家系统( e x p e r ts y s t e m ) 、规则库( r u l eb a s e ) 等。 2 3 3 数据挖掘过程 数据挖掘一般需要经历数据准备、数据开采、结果表达和解释三个步骤【幅l ,如图 2 4 所示 图2 4 数据挖掘流程 f i g 2 4f l o w c h a r t o f d a t a m i n i n g 决策支持技术在企业e r p 中的研究与应用 ( 1 ) 数据准备 数据准备是数据挖掘中的一个重要步骤,数据准备是否做好将直接影响到数据挖掘 的效率、准确度以及最终模式的有效性。这个阶段又可以进一步分成三个子步骤:数据 集成、数据选择、数据预处理。 数据集成:数据集成是将多文件或多数据库运行环境中的数据进行合并处理, 解决语义模糊性、处理数据中的遗漏和清洗脏数据等。 数据选择:数据选择的目的是辨别出需要分析的数据集合,缩小处理范围,提 高数据采掘的质量。 数据预处理:该阶段的目的是将数据转换成适合于数据挖掘的形式,并进行一 些必要的数据约简。 如果数据挖掘的对象是数据仓库,那么上述这些工作往往在生成数据仓库鲍时候准 备妥当。 ( 2 ) 数据开采 选定某个特定的数据挖掘算法,用于搜索数据中的模式。它是数据挖掘过程中最关 键的一步。也是技术难点。 ( 3 ) 结果表述和解释 根据最终用户的决策目的对提取的信息进行分析,把最有价值的信息区分出来,并 且通过决策支持工具提交给决策者。因此,这一步骤的任务不仅是把结果表达出来,还 要对信息进行过滤处理。如果不能令决策者满意,需要重复以上数据挖掘过程。 在理解数据挖掘的具体实施过程中,我们还应该注意以下几点:首先,数据挖掘仅 仅是整个挖掘过程中的一个重要步骤;其次,数据挖掘质量的好坏不但取决于所选用的 数据挖掘技术而且还取决于所挖掘数据的质量和数量,如果选择了错误的数据或不恰 当的数据,或对数据进行了不恰当的转换,则挖掘结果不会成功;第三,整个挖掘过程 是一个不断反馈的过程。比如:用户在挖掘过程中发现选择的数据不太满意,或使用的 挖掘技术产生不了期望的结果,这时,用户需要重复先前的过程,甚至重新开始;第四, 可视化技术在数据挖掘的各个阶段都应起着重要的作用。比如在数据预处理阶段,用户 可以使用散点图、直方图等统计可视化技术来显示有关数据,以期对数据有一个初步的 了解,从而为更好地选取数据打下基础;在数据挖掘阶段,用户则要使用与领域问题有 关的可视化工具;在结果表示阶段,则可能要用到可视化技术以使发现的知识更易于理 解等。 大连理工大学硕士学位论文 2 4 数据挖掘与数据仓库 原则上讲,数据挖掘可以在任何类型的信息存储上进行,包括关系数据库、数据仓 库、事务数据库、面向对象的数据库、对象一关系数据库、空间数据库、多媒体数据库 和万维网等等。 然而,数据挖掘需要高质量的数据,合理而科学的数据环境是确保数据挖掘有效和 正确实施的基础和关键,因此需要认真选择或建立一种适合数据挖掘应用的数据环境。 这个数据环境需要支持o l a p 和o l t p 数据系统的分离,需要服务于数据挖掘
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 科技金融组织成长阶段盈利模式研究
- 2026年吉林省教师公需课《人工智能赋能制造业高质量发展》试题及答案解析
- 2026年药品质量管理(药品质量检测)试题及答案
- 2026年医疗器械(设备操作)试题及答案
- 2026年营销策划(方案执行)试题及答案
- 2026年幼儿保健(幼儿传染病预防)试题及答案
- 2026年瑜伽策划经理(瑜伽策划管理)试题及答案
- 2026年瑜伽教练(瑜伽拉伸)试题及答案
- 2026年山西省阳泉市盂县多校中考考前三模自测化学试卷(含解析)
- 2026四川广安市武胜县第七批城镇公益性岗位招聘22人备考题库带答案详解(培优A卷)
- 云南省全域土地综合整治政策及技术要点课件
- 贵州省贵阳市2024-2025学年八年级下学期期末考试数学试卷(含答案)
- TSG-21-2016-固定式压力容器安全技术监察规程
- oa安全保密管理制度
- DB33- 1001-2003:建筑地基基础设计规范
- 车辆配装配载方案
- GB/T 14233.3-2024医用输液、输血、注射器具检验方法第3部分:微生物学试验方法
- DL∕T 5210.4-2018 电力建设施工质量验收规程 第4部分:热工仪表及控制装置
- 智研数据中心部分可吸收止血材料市场调研分析报告
- HG+20231-2014化学工业建设项目试车规范
- 高一入学分班考试-数学试题含答案
评论
0/150
提交评论