(计算机科学与技术专业论文)面向链接分析的数据仓库及联机分析处理系统的研究与应用.pdf_第1页
(计算机科学与技术专业论文)面向链接分析的数据仓库及联机分析处理系统的研究与应用.pdf_第2页
(计算机科学与技术专业论文)面向链接分析的数据仓库及联机分析处理系统的研究与应用.pdf_第3页
(计算机科学与技术专业论文)面向链接分析的数据仓库及联机分析处理系统的研究与应用.pdf_第4页
(计算机科学与技术专业论文)面向链接分析的数据仓库及联机分析处理系统的研究与应用.pdf_第5页
已阅读5页,还剩71页未读 继续免费阅读

(计算机科学与技术专业论文)面向链接分析的数据仓库及联机分析处理系统的研究与应用.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

面向链接分析的数据仓库及联机分析处理系统的研究与应用 面向链接分析的数据仓库及联机分析处理系统的研究与应用 摘要 数据仓库和o l a p 是9 0 年代初提出的概念,到9 0 年代中期已经 形成潮流。在美国,数据仓库已成为仅次于i n t e r n e t 之后的又一技术 热点,以数据仓库和o l a p 相结合建立的辅助决策支持系统是决策支 持系统的新形式。为了便于对单一主题进行分析,对于表征主题间关 系的数据,目前的数据仓库技术是通过将其转化成对应的单一主题数 据的方式来实现的,从而忽视了这些表征主题间关系数据的存储问 题。随着生物信息、互联网和电信等领域数据的不断丰富,数据仓库 的应用逐步向链接丰富的数据集发展,新兴的多关系数据挖掘、基于 图的数据挖掘、链接挖掘等已逐渐成为数据挖掘研究中的热点,对于 表征对象间链接关系数据的提取需求已变得越来越强烈。同时,在这 些链接丰富的应用领域,对于链接关系的o l a p 分析也同样有着重要 的商业需求,如何对链接关系进行多维分析已成为一个重要课题。 本文针对目前数据仓库技术对链接分析支持不足的现状,通过对 电信领域中用户间通话数据的深入分析,对于表征对象间链接关系的 数据,作者提出了一种新的存储方式,并扩展了传统的基于单一对象 属性的多维数据模型,使其可以对表征对象问链接关系的统计数据进 行有效的表示,且给出了其相关的数学描述,并对各种面向链接的多 维分析操作的具体含义给予了解释。同时,本文对面向链接分析的 o l a p 系统的总体架构进行了设计,给出了其中各个模块的详细描 述,并针对链接分析的自身特点,设计出了一种新的前端展示方式, 即以对象间关系图的方式进行分析结果的展现,从而可以使读者更直 观地把握整个网络结构,更好地对对象问的关系进行分析。最后,本 文将面向链接分析的数据仓库及o l a p 技术应用于电信领域,针对某 省某移动运营商的用户群间通话数据,编码实现了一个面向链接分析 的o l a p 原型系统。通过该实验,不仅验证了针对表征对象间链接关 系数据所提出的新存储方式的可行性,也验证了面向链接分析的 o l a p 技术的重要研究价值。 关键字:数据仓库联机分析处理链接分析多维数据模型可视化 北京邮电大学论文第1 页 面向链接分析的数据仓库及联机分析处理系统的研究与应用 r e s e a r c ha n da p p l i c a t i o no nl 胍b a s e d d a t a r a r e h o u s ea n do n l i n e a n a i ,y t i c a lp r o c e s s i n g a b s t r a c t p r o p o s e di nt h ee a r l y1 9 9 0 s ,d a t aw a r e h o u s ea n do l a p w e r ea p p l i e d i nal o to ff i e l d si nt h em i d d l e19 9 0 s a n dn o w t h e yh a v eb e e ni m p o r t a n t t e c h n o l o g i e st os u p p o rt h eb u s i n e s sd e c i s i o nm a k i n g i no r d e rt om a k e t h es u b j e c t o r i e n t e da n a l y s i se a s i e r ,i nt h et r a d i t i o n a ld a t aw a r e h o u s e ,t h e d a t aa b o u t l i n k s o r r e l a t i o n s h i p sa m o n gt w os u b j e c t s h a sb e e n t r a n s f o r m e di n t ot h ed a t aw h i c hi sf o c u s e do no n l yo n es i n g l es u b j e e t a n dt h i sm a k e s l i n k s e x t r a c t i o nv e r yd i 伍c u l t a st h ed a t a s e t sa r eg e e i n g m o r ea n dm o r ec o m p l i c a t e d ,n e w l ye m e r g i n gm u l t i r e l a t i o n a ld a t am i n i n g , g r a p h - b a s e dd a t am i n i n g ,l i n km i n i n g ,e t c h a v eb e c o m eo b j e c t so f i n t e r e s tf o rt h ea c a d e m i cw o r l da n dt h en e e do fe x t r a c t i n gl i n k sf r o mt h e d a t aw a r e h o u s eh a sb e c o m em o r ea n dm o r ei n t e n s i v e i no r d e rt om i n e t h e s e r i c h l ys t r u c t u r e d ,h e t e r o g e n e o u sd a t a s e t s 1 i n k 。b a s e d o l a p t e c h n o l o g yi sa l s on e e d e d i no r d e rt om a k el i n ka n a l y s i se a s i e r , i nt h i sp a p e rw ef i r s t l yp r o p o s ea n e ww a yt os t o r et h e s e l i n k s a n de x t e n dt h et r a d i t i o n a lm u l t i d i m e n s i o n d a t am o d e la n dg i v et h ei n t e r p r e t a t i o no fl i n k b a s e do l a p t h e n w e d e s i g nt h e a r c h i t e c t u r ef o rt h el i n k - b a s e do l a ps y s t e ma n dg i v et h e d e s c r i p t i o no fe a c hm o d u l e a tl a s t ,w ea p p l yt h i st e c h n o l o g yt ot h e t e l e c o m i n d u s t r y a n di m p l e m e n tap r o t o t y p e s y s t e m b yu s i n g t h e t e c h n i q u eo ft h ev i s u a l i z a t i o no fc o m p l e xn e t w o r kt op r e s e n tt h er e s u l ti n t h i sp r o t o t y p es y s t e m ,w eg e tal o to f m e a n i n g f u lr e s u l t s a n dt h i st e s th a s v a l i d a t e dn o to n l yt h ef e a s i b i l i t yo ft h en e w s t o r a g ep a t t e n ,b u ta l s ot h e i m p o r t a n tv a l u eo fl i n k - b a s e0 l a pt e c h n o l o g y k e yw o r d s :d a t aw a r e h o u s e ,o n l i n ea n a l y t i c a lp r o c e s s i n g ,l i n ka n a l y s i s , m u l t i d i m e n s i o nd a t am o d e l ,v i s u a l i z a t i o n 北京邮电大学论文第1 1 页 独创性( 或创新性) 声明 本人声明所星交的论文是本人在导师指导下进行的研究工作及取得的研究 成果。尽我所知,除了文中特别加以标注和致谢中所罗列的内容以外,论文中不 包含其他人已经发表或撰写过的研究成果,也不包含为获得北京邮电大学或其他 教育机构的学位或证书而使用过的材料。与我一同工作的同志对本研究所做的任 何贡献均已在论文中作了明确的说明并表示了谢意。 申请学位论文与资料若有不实之处,本人承担一切相关责任。 本人签名:邀坌 日期:婴z :! ! 关于论文使用授权的说明 学位论文作者完全了解北京邮电大学有关保留和使用学位论文的规定,即: 研究生在校攻读学位期间论文工作的知识产权单位属北京邮电大学。学校有权保 留并向国家有关部门或机构送交论文的复印件和磁盘,允许学位论文被查阅和借 阅;学校可以公布学位论文的全部或部分内容,可以允许采用影印、缩印或其它 复制手段保存、汇编学位论文。( 保密的学位论文在解密后遵守此规定) 保密论文注释:本学位论文属于保密在一年解密后适用本授权书。非保密论 文注释:本学位论文不属于保密范围,适用本授权书。 本人签名: 导师签名; 鱼塞釜 红孕 v 日期:型z ! :! ! 日期:2 霉:兰:! ! 面向链接分析的数据仓库及联机分析处理系统的研究与应用 1 1 论文背景 第一章绪论 当各大数据库厂商纷纷宣传其产品支持数据仓库,提出一躲套用以建立和使 用数据仓库产品时,业界掀起了数据仓库热。同时也引起了学术界的极大兴趣, 国际上许多重要的学术会议,例如超大型数据库国际会议( v l d b ) 、数据工程 国际会议( d a me n g i n e e r i n g ) 等,都出现了研究数据仓库、o l a p 和数据挖掘的 论文。在国外,数据仓库己得到了非常广泛的应用,调查其投资回报情况,统计 发现数据仓库三年投资回报率( r o i ) 竟然超过4 0 。在国内,数据仓库也在金 融、保险、电信等行业得到了广泛的应用,数据仓库和o l a p 技术已成为企业获 得竞争优势的关键武器,是企业决策支持系统的重要组成部分。 面向主题的数据组织方式是数据仓库中最为重要的一个特点,它将各个业务 系统中关于该主题的数据组织在一起,它符合最终分析人员对数据的理解方式, 可以在较高层次上对分析对象的数据提供一个完整、统一并一致的描述,从而展 示出分析对象的完整视图。为了便于对单一主题进行分析,对于表征主题间关系 的数据,目前的数据仓库技术是通过将其转化成对应的单一主题数据的方式来实 现的,而忽视了这些表征主题间关系数据的存储问题。显然,这种数据的组织方 式,不仅造成了数据存储上的冗余,也使企业很难从中提取出这些表征对象问关 系的数据,从而很难在对象分析中考虑到对象间的相互作用对该对象造成的影 响。 是不是对象问的链接关系对对象没有任何影响,对象间的链接关系没有任何 研究价值呢? 显然,答案是否定的。有研究表明,在选择购买某种商品时,超过 5 0 的人会听取朋友、同事的意见,约3 0 的人愿意采纳第三方建议( 如报纸、 杂志等媒体的推荐或比较) ,仅有不到2 0 的人会相信商家对其产品的广告和宣 传。因此,任何对象都不是孤立地存在的,有效地分析对象问的链接关系对正确 地理解对象行为的产生及预测对象的进一步发展将有着重要的指导意义。 近年来,随着生物信息、互联网和电信等领域数据的不断丰富,越来越多的 国内外学者致力于对象间链接关系的研究,数据仓库的应用也逐步向链接丰富的 数据集发展,多关系数据挖掘( m u l t i - r e l a t i o n a ld a t am i n i n g ) 、基于图的数据挖 掘( g r a p h - b a s e dd a t am i n i n g ) 及链接挖掘( l i n km i r f i n g ) 等己成为数据挖掘中 的研究热点,链接分析( l i n ka n a l y s i s ) 已成为数据挖掘中不可忽视的问题。在 数据挖掘中,考虑周围对象对中心对象行为的影响,将对象置于一个大的背景环 北京邮电大学论文 第1 页 面向链接分析的数据仓库及联机分析处理系统的研究与应用 境中去分析,发现了许多有意义的知识。如文献 1 】中发现,在电信社群网络分 析中,用户所在的呼叫图中最大团的大小( 即团值) 越大,用户忠诚度及价值越 高,用户离网的可能性越小,反之亦然;随着用户所在的最大团中其他用户的流 失,该用户也逐渐趋于流失。文献【2 】中在提取并分析呼叫图的极大团、节点膨 胀率、节点聚集度等与节点稳定性相关的链接属性及其时变特征的基础上,提出 了一种适合海量数据的基于链接的电信客户流失预测算法,显著地提高了传统的 基于单一客户属性进行流失预测的准确率和涵盖率。 另一方面,我们发现,在一些链接丰富的应用领域,对于链接关系的多维分 析,如电信领域中不同用户群间的通话量分析、运营商问的结算关系等,也同样 有着重要的商业需求,我们相信,利用面向链接的多维分析一定能得到许多有意 义的结果。然而,由于传统数据仓库中的数据难以支撑这些分析需求,对于面向 链接关系的o l a p 的研究至今还是一片空白,国内外学者对于面向链接的多维分 析方面的研究甚少。 本文针对目前数据仓库技术对链接分析支持不足的现状,通过对电信领域中 用户自j 通话数据的深入研究,对于表征对象l 日j 链接关系的数据,作者提出了一种 新的存储方式,并扩展了传统的基于单一对象属性的多维数据模型,使其可以对 表征对象问链接关系的统计数据进行有效的表示,以期更好地发挥数据仓库及 o l a p 的决策支持作用。 1 2 论文的主要工作 为了更好地发挥数据仓库的价值,以更好地为企业提供决策支持,作者做了 以下工作: 学习数据仓库、联机分析处理、数据挖掘等基础理论知识,调研数据仓 库及联机分析处理系统的应用现状: 借鉴数据挖掘领域中新兴的多关系数据挖掘、基于图的数据挖掘、链接 挖掘的研究思路,研究面向链接的多维数据模型和多维分析方法,并针 对表征对象间链接关系的数据设计新的数据仓库存储方式; 研究已有的o l a p 系统的体系结构,并总结设计面向链接分析的o l a p 系统的体系结构,根据面向链接的多维分析的自身特点,设计新的前端 展示方式; 将面向链接分析的数据仓库及o l a p 技术应用于电信领域,研究如何利 用该技术解决实际问题,以更好地发挥数据仓库的决策支持作用。 本文取得的主要成果有: 北京邮电大学论文第2 页 面向链接分析的数据仓库及联机分析处理系统的研究与应用 1 提出数据仓库除了要围绕一个个主题进行数据组织外,对于表征主题间 关系的数据也需进行合理地存储。 2 通过对电信领域中用户间通话数据进行深入研究,对于表征对象间链接 关系的数据,提出了一种合理的数据仓库存储方式。 3 扩展了传统的基于单一对象属性的多维数据模型,使其可以对表征对象 间链接关系的统计数据进行有效的表示,并给出其数学描述形式。 4 针对链接分析的自身特点,设计出面向链接分析的o l a p 系统的体系结 构,并给出各个模块的功能描述。 5 针对电信领域用户间通话量统计数据,编码实现了一个面向链接分析的 o l a p 原型系统,并通过相关的实验分析,验证了该技术的实用性。 1 3 论文结构 本论文按以下章节进行组织: 第一章是绪论部分,简要介绍了本文的研究背景,总结了本文的主要研究内 容和研究成果,并给出了全文的组织结构; 第二章是对一些基础理论知识的介绍,包括数据仓库及o l a p 的基本概念, 并在此基础上归纳出了数据仓库和o l a p 的关系,并对多维数据模型进行了详细 的介绍,包括对其数学描述形式及基本多维分析操作的介绍; 第三章对于表征对象问链接关系的数据,提出了一种新的存储方式,并扩展 了传统的基于单一对象属性的多维数据模型,给出了其相关的数学描述,同时对 面向链接的多维分析操作的具体含义给予了解释: 第四章首先给出面向链接分析的o l a p 系统的体系结构,并对各层的实现细 节进行了介绍,然后对其中功能最为复杂的o l a p 引擎层,给出了该层的功能体 系结构,并对其中的各个功能模块进行了描述。 第五章将面向链接分析的数据仓库及o l a p 技术应用于电信领域,首先对某 省某移动运营商的用户群间通话量统计数据的准备过程进行了详细介绍,然后给 出面向链接分析的o l a p 系统中最有特色的关系图展示子模块的具体实现过程, 最后对利用该原型系统进行实验分析的过程及结果进行了描述,充分验证了该技 术的重要研究价值。 第六章是结束语,总结了全文的主要内容,并指出了该课题的下一步研究方 向。 北京邮电大学论文第3 页 面向链接分析的数据仓库及联机分析处理系统的研究与应用 第二章相关理论 本章主要介绍了面向链接分析的数据仓库及联机分析处理技术的研究中所 涉及到的一些理论知识,以便为后续研究奠定理论基础。 2 1 数据仓库概述 2 1 1 数据仓库的定义及特点 对于数据仓库的定义,数据仓库创始人w h 1 n m o n 在其著作( b u i l d i n gt h e d a t aw a r e h o u s e ) ) 书中对数据仓库给出如下描述:数据仓库是一个面向主题的 ( s u b j e c to r i e n t e d ) 、集成的( i n t e g r a t e ) 、相对稳定的( n o n v o l a t i l e ) 、随时间变 化( t i m ev a r i a n t ) 的数据集合,用于支持管理决策制定过程。对概念的理解可 以从三个层面看,首先从面向的应用来说,数据仓库用于支持管理决策,面向分 析型数据处理,它不同于企业现有的操作型数据库;其次从数据的组织来说,数 据仓库是对多个异构的数据源有效集成,集成后按照主题进行了重组,并包含历 史数据,再者从数据的处理来说,进入数据仓库中的数据一般不再修改,所作的 操作大部分是查询操作。 根据数据仓库定义,可以将数据仓库特点总结如下: ( 1 ) 面向主题的 主题是一个抽象的概念,是在较高层次上将企业的信息系统中的数据综合, 归类后进行分析利用的抽象。在逻辑意义上,它是对应企业中某一宏观分析领域 所涉及的分析对象,即企业的业务术语,如在电信领域客户,渠道,业务等。操 作型数据库的数据组织面向事务处理任务,各个业务系统之间各自分离,对于分 析对象来说,相关的数据分布于不同的业务系统中,单独的一个业务系统往往不 能提供对该对象的完整视图。将数据按照主题组织符合最终分析人员对数据的理 解方式。面向主题的数据组织方式,就是在较高层次上对分析对象的数据提供一 个完整,统一并一致的描述,即把各个业务系统中关于该主题的数据组织在一起, 建立数据之间的关联,从而展示出分析对象的完整视图,因此面向主题的数据组 织方式和操作型数据库的各个业务系统在数据组织上有一个交叠,例如在电信企 业中“客户”是一个分析主题,而在电信企业中的业务系统已经分成营业,帐务, 计费,客服等各个子系统,每个系统都提供了关于客户主题的部分信息,两种数 据组织的差异,如下图所示: 北京邮电大学论文第4 页 面向链接分析的数据仓库及联机分析处理系统的研究与应用 营业 帐务 计费 客户产品 l 【 f 图2 - 1 按主题组轵和按业务组织敷据的不同 c 2 ) 集成的 由上所述可知,数据仓库中是将数据从原来分散的各个业务系统中提取出来 按照主题集中展现,但是这种集中不是数据的简单拷贝,是经过统一和综合的集 中,即集成数据,这样才能保证数据的完整性,准确性和可分板型。同时保持数 据之间的关联性,从而展示企业的全局视图。其中要处理的主要有: 夺数据格式的统一:处理不同业务系统中相同含义的字段不同的数据格式 的统一。 夺数据内容的统一:处理不同信息中相同含义的字段不同表示方式的统 一。 夺数据键码的统一:处理不同系统中相同实体的识别和统一主键标识。 夺数据关联的统一:处理关联实体问的关联关系的统一, ( 3 ) 相对稳定的 从数据的使用方式上,数据仓库的数据是不可更新的。即数据一旦保存到数 据仓库中后。就不再发生变化,最终用户只能通过分析工具进行查询和分析,而 不能对其进行修改,正是由于这个特点保证了数据仓库保存了大量的历史数据, 而大量的历史数据正是许多分析方法的基础。对于业务系统来说一般只保存当 前的数据,数据是可以被更新的,它记录的是系统中每一个变化的瞬态,因此是 不稳定的。 ( 4 ) 随时间变化的 数据仓库中数据的不可更新是针对其应用而言,而在数据仓库的运行期间, 每隔一定的时间间隰后就会从业务系统中提取出变化的数据,经过转换后集成到 数据仓库中,因此数据仓库实际上是记录系统的各个瞬态,并通过将各个瞬态联 接起来从而提供系统运动的全部过程,正是由于这个特点使得数据仓库中的数据 总伴随一个时间维度。 北京邮电大学论文第5 页 面向链接分析的数据仓库及联机分析处理系统的研究与应用 2 1 2 数据仓库的体系结构 企业数据仓库的建设,是以现有企业业务系统和大量业务数据的积累为基 础。数据仓库不是静态的概念,只有把信息及时交给需要这些信息的使用者,供 他们做出改善其业务经营的决策,信息才能发挥作用,信息才有意义。而把信息 加以整理归纳和重组,并及时提供给相应的管理决策人员,是数据仓库的根本任 务。因此,从产业界的角度看,数据仓库建设是一个工程,是一个过程。 整个数据仓库 。 固 篁3 日 撼鬻糍 熬蠹氧帝 :o t 冉争盟蠡麓 j 图2 - 2 数据仓库体系结构 具体由下图表示。 稿麟z 魅i 满x - a t t t z - x a 屡丑势祈工是 飚t 黼:r a t f f 盥 数据源:是数据仓库系统的基础,是整个系统的数据源泉。通常包括企业内 部信息和外部信息。内部信息包括存放于r d b m s 中的各种业务处理数据和各类 文档数据。外部信息包括各类市场信息、竞争对手信息和各种手工收集的信息等 等。 数据的存储与管理:是整个数据仓库系统的核心。数据仓库的真正关键是数 据的存储和管理。数据仓库的组织管理方式决定了它有别于传统数据库,同时也 决定了其对外部数据的表现形式。要决定采用什么产品和技术来建立数据仓库的 核心,则需要从数据仓库的技术特点具体需求着手分析。针对现有各业务系统的 数据,进行抽取、清理,并有效集成,按照主题进行组织。数据仓库按照数据的 覆盖范围可以分为企业级数据仓库和部门级数据仓库( 通常称为数据集市) 。 o l a p 服务器:对分析需要的数据进行有效集成,按多维模型予以组织,以 便进行多角度、多层次的分析,并发现趋势。其具体实现可以分为:r o l a p 、 m o l a p 和h o l a p 。r o l a p 基本数据和聚合数据均存放在r d b m s 之中; m o l a p 基本数据和聚合数据均存放于多维数据库中;h o l a p 基本数据存放于 r d b m s 之中,聚合数据存放于多维数据库中。 前端工具:主要包括各种报表工具、查询工具、数据分析工具、数据挖掘工 具以及各种基于数据仓库或数据集市的应用开发工具。其中数据分析工具主要针 北京邮电大学论文第6 页 面向链接分析的数据仓库及联机分析处理系统的研究与应用 对o l a p 服务器,报表工具、数据挖掘工具主要针对数据仓库。 2 1 3 数据仓库的数据组织结构 数据仓库中保存了大量的历史数据,为了保证数据的存储效率和数据组织的 清晰,数据仓库中的数据以不同的粒度进行存储,数据仓库数据的组织结构如下 图所示: 图2 - 3 数据仓库数据组织 四个数据级别分别是:早期细节级,当前细节级,轻度综合级和高度综合级。 四个级别的数据分别反映提供不同的数据需求,由上可以得出数据仓库中数据生 存周期,源数据经过综合后,首先进入当前细节级,并根据具体需要进行进一步 的综合,从而进入轻度综合级乃至高度综合级,老化的数据将进入早期细节级。 由此可见,数据仓库中存在着不同的综合级别,一般称之为“粒度”。粒度越大, 表示细节程度越低,综合程度越高。因此,数据仓库的核心就是在系统中保留最 有可能被用户使用的数据。 元数据( m e t a d a t a ) 是关于数据的数据。在数据仓库系统中,元数据可以帮 助数据仓库管理员和数据仓库的开发人员非常方便地找到他们所关心的数据:元 数据是描述数据仓库内数据的结构和建立方法的数据,可将其按用途的不同分为 两类:技术元数据( t e c h n i c a lm e t a d a t a ) 和业务元数据( b u s i n e s sm e t a d a t a ) 。技 术元数据是存储关于数据仓库系统技术细节的数据,是用于开发和管理数据仓库 使用的数据,它保证了数据仓库系统的正常运行。业务元数据从业务角度描述了 数据仓库中的数据,它提供了介于使用者和实际系统之间的语义层,使得数据仓 库使用人员也能够“读懂”数据仓库中的数据。 北京邮电大学论文第7 页 面向链接分析的数据仓库及联机分析处理系统的研究与应用 2 2 联机分析处理概述 2 2 1o l a p 的定义 联机分析处理( o n l i n ea n a l y t i c a lp r o c e s s i n g ,简称o l a p ) 的概念最早是由 关系数据库之父e f c o d d 于1 9 9 3 年提出的。当时,c o d d 认为联机事务处理( o n l i n e t r a n s a c t i o np r o c e s s i n g ,简称o l t p ) 已不能满足终端用户对数据库查询分析的需 要,s q l 对大型数据库进行的简单查询也不能满足用户分析的需求。用户的决策 分析需要对关系数据库进行大量计算才能得到结果,而查询的结果并不能满足决 策者提出的需求。因此c o d d 提出了多维数据库和多维分析的概念即0 l a p 。 o l a p 理事会给出的o l a p 定义为:“o l a p 是一种软件技术,它使分析人员 能够迅速、一致、交互地从各个方面观察信息,以达到深入理解数据的目的”。 联机分析处理技术侧重对分析人员和高层管理人员的决策支持,可以应分析人员 的要求快速、灵活地进行大数据量的复杂查询处理,并以一种直观易懂的形式将 查询结果提供给决策者。o l a p 软件,以它先进的分析功能和以多维形式提供数 据的能力,正作为一种支持决策的解决方案而迅速崛起。 联机分析处理技术以数据仓库为基础,是数据仓库的重要表现形式,它具有 数据分析和报表功能,是数据仓库中存取和使用模块的重要构件。 2 2 2o l a p 的特征 对于o l a p 技术,c o d d 提出过1 2 条o l a p 准则中,其中心内容可以概括 成两点。第一点是对o l a p 数据的多维可操作性进行规定,第二点是对0 l a p 的数据透明性的要求,定义了c s 的体系结构准则,并在此基础上提供多用户访 问的功能。随着o l a p 的发展,提出了对于o l a p 系统比较简洁的f a s m i ( f a s t a n a l y s i so f s h a r e dm n l t i d i m e n s i o n a li n f o r m a t i o n ) 5 条原则: 快速性( f a s t ) 是指系统应当使用各种技术,尽量提高对最终用户的响应速度。 可分析性( a n a l y s i s ) 是指o l a p 系统必须能够对数据进行逻辑分析。 共享性( s h a r e d ) 是指提供多个用户共享同一份o l a p 数据。 多维性( m u l t i d i m e n s i o n a l ) 是o l a p 最本质的特征,即必须向用户呈现一致的多维视图。 信息型( i n f o r m a t i o n ) 北京邮电大学论文第8 页 面向链接分析的数据仓库及联机分析处理系统的研究与应用 是指在o l a p 系统中给出的不再是o l t p 系统中散乱的数据,而是能够 导入具有指导意义的信息,同时要求数据能够以多种图形方式进行展示。 2 3 数据仓库与o l a p 的关系 2 3 1 数据仓库与o l a p 的关系 夺o l a p 是一种多维分析技术,而数据仓库是一种数据的存储管理技术, 为o l a p 的分析提供了支持平台。 夺数据仓库侧重于存储和管理其中的数据,而o l a p 则侧重于数据仓库中 的数据分析,并将其转换成决策信息。 夺数据定期地从操作型系统导入数据仓库中,因此数据仓库中存放的仍然 是原始数据。o l a p 系统则将这些数据进行聚集和合计,并以o l a p 立 方或其他形式对其进行组织,从而快速地从查询结果或报表中获得相关 信息。 夺数据仓库中的数据以多维形式组织,是最适合o l a p 多维分析的数据组 织方式,两者形成了相互结合、相互补充的关系。 2 3 2 数据仓库与o l a p 数据库的关系 o l a p 数据库是一种特殊的数据库,用来存储o l a p 多维数据信息,它与数 据仓库的区别是: 夺数据仓库能容纳细节数据,o l a p 数据库保存的是各种轻度综合的数据, 但可以通过o l a p 的钻取操作得到数据仓库的细节级。 夺数据定期从数据仓库中导入到0 l a p 数据库中,o l a p 中产生的汇总信 息以实视图方式存在数据仓库中。 夺数据仓库存有大量的数据,而o l a p 数据库中的数据至少要少一个数量 级。 夺数据仓库只适合少量的灵活访问,o l a p 数据库适合大量的非预知的访 问和分析。 夺数据仓库存储时间一般很长,o l a p 数据库中数据存储时间较短。 夺数据仓库中数据的访问有一定限制,而o l a p 数据库则可以自由访问。 北京邮电大学论文第9 页 面向链接分析的数据仓库及联机分析处理系统的研究与应用 2 4 多维数据模型 数据仓库和o l a p 工具基于多维数据模型,该模型将数据看作是数据立方 体( d a m c u b e ) 形式,数据立方体允许以多维对数据建模和观察,它由维和事实 定义。多维模型与其它的数据组织形式相比,对数据进行了大量的预汇总操作以 提高数据的查询速度,这对于要处理大量的数据同时要保证用户的查询效率的数 据仓库系统更为适用。同时,数据立方体是o l a p 的基础,o l a p 的过程就是根 据数据分析的要求,从原始数据中构造数据立方体,并对数据立方体执行有关的 操作,再把结果返回给用户的过程。 2 4 1 一些基本概念 ( 1 ) 变量 变量是数据的实际意义,即描述数据“是什么”。例如,数据1 0 0 本身并没 有意义或者说意义未定,它可能是一个学校的学生人数,也可能是某产品的单价 还可能是某商品的销售量等等。一般情况下,变量总是一个数值度量指标,例如 人数、单价、销售量等都是变量,而1 0 0 则是变量的一个值。 ( 2 ) 维 维是人们观察数据的特定角度。例如,企业常常关心产品销售数据随着时间 推移而产生的变化情况,这是从时间的角度来观察产品的销售,所以时间是个 维( 即时间维) 。企业也时常关心自己的产品在不同地区的销售分布情况,这是 从地理分布的角度来观察产品的销售,所以地理分布也是一个维( 即地理维) 。 其他还有如产品维、顾客维等。 ( 3 ) 维的层次 人们观察数据的某个特定角度( 即某个维) 还可以存在细节程度不同的多个 描述方面,一般称这多个描述方面为维的层次。一个维往往具有多个层次,例如 描述时间维,可以从日期、月份、季度、年等不同层次来描述,那么日期、月份、 季度、年等就是时间维的层次。同样,城市、地区、国家等构成了一个地理维的 多个层次。 ( 4 ) 维成员 维的一个取值称为该维的一个维成员。如果一个维是多层次的,那么该维的 维成员是由各个不同维层次的取值组合而成。例如,我们考虑时间维具有日期、 月份、年这三个层次,分别在日期、月份、年上各取一个值组合起来,就得到了 时间维的一个维成员,即“某年某月某日”。一个维成员并不一定在每个维层次 上都要取值,例如,“某年某月”、“某月某日”、“某年”等等都是时间维的维 北京邮电大学论文第1 0 页 面向链接分析的数据仓库及联机分析处理系统的研究与应用 成员。对应一个数据项来说,维成员是该数据项在某维中位置的描述。例如对一 个日用品销售额来说,时间维的维成员“某年某月某日”就表示该销售额是“某 年某月某日”的销售额,“某年某月某日”是销售额在时间维上位置的描述。 ( 5 ) 多维数组 一个多维数组可以表示为:( 维1 ,维2 ,维n ,变量) 例如,如图2 4 所示的是日用品销售数据按时问、地区和产品组织起来的三维立方体,加上变量 销售额,就组成了一个多维数组( 时间,地区,产品,销售额) 。 万元 i 常l 嘲砌锄i 稠卑 图2 4 按产品,时间和地区组织的销售錾船 ( 6 ) 数据单元( 单元格) 多维数组的取值称为数据单元。当多维数组的各个维都选中一个维成员,这 些维成员的组合就唯一确定了一个变量的值。那么数据单元就可以表示为( 维1 的一个成员,维2 台勺一个成员二,维栉的一个成员,交量的值 。例如,图 2 4 所示,我们在时间、地区、产品上各取维成员“2 0 0 0 年”、“北京”和“洗涤 用品”就唯一确定了变量销售额的一个值( 假设为1 0 0 ) ,则该数据单元可表示 为( 2 0 0 0 年,北京,沈涤用品,1 0 0 ) 。 2 4 2 数学描述 2 4 2 1 数据立方体的定义 由文献 7 】可知,一个数据立方体可以简单的定义为一个四元组 表示一个包含刀个维度的集合,其中一个4 表示一 个维度名称,4 的取值域为d o m e ( 2 仁 铂,m 2 ,) 表示一个包含k 个度量的集合,其中一个铂表示 一个度量名称,啊的取值域为d o m 一。; 3 d n 膨= a ,即维度名称集合和度量名称集合是不相交的; 北京邮电大学论文第【l 页 面向链接分析的数据仓库及联机分析处理系统的研究与应用 4 么= q ,a 2 ,q ) 表示一个包含t 个维层次属性的集合,其中一个q 表 示一个维层次属性名称,呸的取值域为d 咖m ; 5 厂是一个一对多的映射关系,正d 叫,且v f ,i 工f ( d , ) r l f ( d j ) = 矿,即 映射将维度名称和其维层次属性关联起来,且不同的维度对应不同的维 层次属性集合。 对于图2 - 4 中所示的数据立方体,按照上面的定义,也可表示为: , ,电0 5 0 , , : g ( ) = ; g ( ) = 电o o o ; g ( ) = : 北京邮电大学论文第1 2 页 面向链接分析的数据仓库及联机分析处理系统的研究与应用 g ( ) = ; g ( ) = ; g ( ) = 电0 5 0 ; g ( ) = ; g ( ) = ; 为便于阐述,对于后面的数据立方体操作我们都定义在数据立方体实例上。 2 4 2 3 数据立方体的基本操作 ( 1 ) 限制操作( r e s t r i c t i o n ) 限制操作限制了数据立方体在一个或多个维上的取值范围。 设原子谓词p 是定义在一个维度上的逻辑表达式,复合谓词p 是由多个原子 谓词p 用逻辑操作符八( “与”) 和v ( “或”) 连成的形如 p = a p 2 p ,u i ) 的表达式,则限制操作可定义如下: 输入:数据立方体实例c := d , 办彳,ng 和一个限制条件p ; 输出:数据立方体实例c o - - ,其中见= d ,m o = m , a o = a ,z = 厂,圪互v ,v v 圪,9 0 1 ( v ) 满足条件 p 且v k 豇1 ( v ) ,g o ( k ) = g ( k ) 。 数学描述为:占。( c ) = c o 对于图2 4 中所示的数据立方体,如果我们想观察化妆品在北京的销售额, 则可以取条件p = ( 产品= 化妆品) 八( 地区= 北京) ,对数据立方体进行限制 操作。 由定义可知,限制操作的输入输出都是数据立方体的实例,通过它可以实现 多维分析中的切片和切块操作,通过限定某一个或多个维度的取值,可以从原数 据立方体实例中提取出所需要的一个子集,如果在原立方体实例中没有满足条件 ,的立方体单元,则将得到一个空立方体。值得注意的是,限制操作只能用来限 定各个维度的取值,如果要限定某个度量的取值,则需要首先通过后面介绍的 p u l l 操作将度量转换成维度,然后再通过限制操作来实现。 ( 2 ) 聚集操作( a g g r e g a t i o n ) 聚集操作实现在数据立方体的某一个或多个维的某些层次属性上进行诸如 s u m ,a v g ,m i n 等聚集函数操作,通过该操作可以实现多维分析中的上卷操作。 北京邮电大学论文 第1 3 页 面向链接分析的数据仓库及联机分析处理系统的研究与应用 设h 为需在度量埘,上进行的聚集函数,s = g i ,口2 ,口。 ,s a ,s 为选定的 需向上攀升到的维度层次属性集合,s 中元素的个数为g ,同时,为便于描述, 定义一个用来将需向上攀升的维度层次属性与维度名称相关联的一对一映射 函4 寸d ,则聚集操作可定义如下: 输入:数据立方体实例e = ,需聚集的度量所,需攀 升到的维度层次属性集合s 和一个聚集函数 ; 输出:数据立方体实例c o d o ,m o ,a o ,正,圪,g 。 ,其中d o = 碱,以,d q ) , 且v a ,s ,z = j ( 口,) ,m 。= 所, ,以= u 婀哦,( z ) ,正= f ,v o 中 的元素为坍在指定的维度层次属性上通过聚集函数h 得到的结果, g 。:咖m 嘲1 ) x d o m d i m 【2 ) d o m d 衄g ) 斗v o 。 数学描述为:皖矗。( e ) = c o 对于图2 - 4 中所示的数据立方体,如果我们想知道在哪年哪个省的日用品销 售额最大,则可取m = 销售额,s = 年,省 ,h = n 1 a x ( ) 对数据立方体进行聚 集操作。 由上面定义可知,聚集操作的输入输出立方体并不是同一个数据立方体的实 例。 ( 3 ) 笛卡尔乘积( c a r t e s i a np r o d u c t ) 笛卡儿乘积操作是用于关联两个数据立方体的二元操作,其定义如下: 输入:数据立方体实例e 。d l ,m ,a i ,z ,k ,g 。 和 c ,2 = ; 输出:数据立方体实例c o = ,其中d o = d lu d 2 , g o = m l u 肘2 ,a o = 4 u 4 ,v o = k ,且i v o i 爿k i i 吒l ,五是 由z 和五推导出来的,g o = 咖他州1 ) x d o m d 城2 ) x x d o m 蜘g ) 一v o , 其中鼋刊d oi ; 数学描述为:c ,】= e 一般地,由于笛卡儿乘积没有任何限定条件,将得到两个数据立方体关联后 的所有值,并没有什么实际意义。下面介绍的连接操作是在笛卡儿乘积的基础上 利用某些条件进行限制,以便选出有意义的数据的操作,它是笛卡儿乘积操作的 一个特例。 ( 4 ) 连接( j o i n ) 北京邮电大学论文第1 4 页 面向链接分析的数据仓库及联机分析处理系统的研究与应用 进行连接操作的两个数据立方体实例必须存在某个或多个相同的维度,且这 些共同的维度有着相同的维度层次属性,即对于数据立方体实例 e 。= 和e 2 = 必须满足下面两个条 件: ( 1 ) d 1 nd 2 彩,设d l nd 2 = 嵋,啦,嘲 ; ( 2 ) v a , ( d ln 0 2 ) z ( z ) = 石( z ) ; 连接操作可以看成是对笛卡儿乘积操作的结果作条件 p = ( c v c d l = c 2 c d i ) ( c 1 c d 2 = c 2 c d 2 ) 人 ( c 1 嘲= c 2 嘲) 】的限制操作后的结 果。 其数学描述为:c f o c := j 。( g 。x c , :) ( 5 ) 并( u n i o n ) 并操作和后面将要介绍的补操作,都是

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论