(计算机软件与理论专业论文)数据挖掘的元数据管理及可集成研究.pdf_第1页
(计算机软件与理论专业论文)数据挖掘的元数据管理及可集成研究.pdf_第2页
(计算机软件与理论专业论文)数据挖掘的元数据管理及可集成研究.pdf_第3页
(计算机软件与理论专业论文)数据挖掘的元数据管理及可集成研究.pdf_第4页
(计算机软件与理论专业论文)数据挖掘的元数据管理及可集成研究.pdf_第5页
已阅读5页,还剩68页未读 继续免费阅读

(计算机软件与理论专业论文)数据挖掘的元数据管理及可集成研究.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

数据挖掘的冗数据管理及n j 集成研究 数据挖掘的元数据管理及可集成研究 摘要 数据仓库系统的信息供应链( i s c ) 涉及数据库半台、e t l 工具、 o l a pt 具、数据挖掘工具等。目前数据挖掘技术在电信、金融等领 域得到j ,越来越多的应用,如何实王见数据挖掘的信息在整个数据仓库 系统乃至系统外部交换和共享,是建立数据仓库这样一个集成系统面 临的一个问题。元数据管理是实现集成的有效技术。数据挖掘的元数 据管理与可集成研究正是在以卜- 背景之下进行的研究和实践。 o m g 组织发布的c w m 规范为数据挖掘的统一的元数据模型提 供了参考;而模型驱动体系架构( m d a ) 规范为元数据管理提供了 方法论参考;元数据管理的目的是提供元数据服务,标准的a p i 接口 和w e b 服务技术为元数据服务的实现提供技术参考;这些理论和技 术上的参考为本文数据挖掘的元数据管理与可集成研究提供了可能。 在以上理论和技术的指导下,作者首先阐述了采用分层的元数据 管理方法构建数据挖掘的元数据管理体系结构,包含元数据源层、元 数据集成管理层和元数据发布层。接着探讨了每层的信息内容及 功能。元数据源层信息由数据挖掘工具本身提供,由数据挖掘组织发 布的预测标记语言( p m m l ) 来描述。由于数据挖掘工具特有的元模 型和c w m 元模型的异构性,在元数据集成管理层采用c w m 适配 器的方式建立两个元模型之问的桥梁。元数据集成进中央元数据库 后,采_ 数据库管理上具对元数据库进行管理。在元数据发佑层根据 元数据服务的f i 同需求,将元数据服务分为对内服务和对外服务。对 内服务卞要面向数据挖掘应用开发人员,采用j a v a a p i 的方提供: 对外服务主要面向元数据平台管理人员,采用w e b 服务的力式提供。 在以上体系结构下,作者深入研究j ,c w m 数据挖掘适配器,提 j 了适配器的结构、工作原理。适配器的核心是转换规则,作者通过 深入研究p m m l 表示的元模型和c w m 数据挖掘元模型,丌发了采 用x s l t 表示的转换规则。9 - 且实例研究一个p m m l 文件通过x s l t 编写的规则转换到c w m 的x m i 文件。j d m 足c w m 数据挖掘在j a v a 语言中的接口映射,本文在将j 二具相关的数据挖掘模型转换剑c w m 数据挖掘的儿数据管理技町集j 也研究 元模型后 ,接着探讨了数据挖掘的 元数据服务的机制:通过实现j d m 的部分接口的方式提供元数据服 务。在文章的最后举例说明一个具体的数据挖掘元数据服务的实现并 用w e b 服务方式提供。 关键词:c w mp m m l 数据挖掘适配器转换规则w e b s e r v i c e 数据挖掘的儿数据管理搜n i 集成叫究 d a ! i am i n i n gm e t a d a l l am a n a g e m e n t a n di n t e g r a t i o ns t u d y a b s t r a c t a t y p i c a ld a t aw a r e h o u s i n gs y s t e m ,o f t e nd e s c r i b e da si n f o r m a t i o n s u p p l yc h a i n ( i s q ,c o n s i s t s o f d a t a b a s e ,e t lt o o l s ,o l a pt o o l s ,d a t a m i n i n g t o o l sa n ds oo n d a t am i n i n gi sm o r ea n dm o r eu s e de s p e c i a l l yi n t h e i n d u s t r y o ft e l e c o ma n df i n a n c e h o wt om a k et h ei n f o r m a t i o n e x c h a n g e a n ds h a r ei n s i d ea n do u t s i d eo ft h ed a t a w a r e h o u s i n gi s a p r o b l e mf o rc o n s t r u c t i n gs u c hal a r g es c a l eo fi n t e g r a t i n gs y s t e m m e t a d a t a m a n a g e m e n ti s a ne f f e c t i v et e c h n o l o g yt o i m p l e m e n ti n t e g r a t i o n w i t ht h i sb a c k g r o u n d ,t h ef o l l o w i n gr e s e a r c h e sa n d p r a c t i c e s a r ed o n e c w m s p e c i f i c a t i o np u b l i s h e db y o m gg r o u po f f e r st h em o d e l r e f e r e n c ef o rd a t a m i n i n g m e t a d a t a m a n a g e m e n t ;m o d e l d r i v e n a r c h i t e c t u r e ( m d a ) o f f e r sm e t h o d l o g y f o rd a t a m i n i n g m e t a d a t a m a n a g e m e n t ;o n eo ft h ep u r p o s e so fm e t a d a t am a n a g e m e n t i sp r o v i d i n g m e t a d a t as e r v i c e s ,a n d t e c h n o l o g i e s s u c ha sa p ii n t e r f a c ea n dw e b s e r v i c e so f f e rt e c h n o l o g yr e f e r e n c e a l lt h e s ep r i n c i p a l sa n dt e c h n o l o g i e s g i v et h ef o u n d a t i o n o ft h i sp a p e r i nt h i s p a p e r ,t h e a r c h i t e c t u r ew i t ht h r e e l a y e r s f o rd a t a m m m g m e t a d a t am a n a g e m e n ti sc o n s t r u c t e d ,i n c l u d i n gm e t a d a t ar e s o u r c el a y e r , m e t a d a t ai n t e g r a t i o n m a n a g e m e n t l a y e r a n dm e t a d a t ap u b l i s h i n g l a y e r t h ei n f o r m a t i o ni nt h em e t a d a t ar e s o u r c e l a y e r i s p r o d u c e db y d a t a m i n i n gt o o l s ,d e s c r i b e db yp m m ll a n g u a g e ,b e c a u s eo ft h eh e t e r o g e n e i t y b e t w e e nd a t am i n i n gs p e c i f i cm e t a m o d e la n dc w mm e t a m o d e l ,c w m a d a p t e ri sb u i l ta sab r i d g ei nt h em e t a d a t ai n t e g r a t i o n m a n a g e m e n tl a y e r 1 nt h em e t a d a t a p u b l i s h i n gl a y e r a c c o r d i n g t ot h ed i f f e r e n ts e r v i c e 第3 贝 数据挖掘的儿数据管理及町集成研宄 r e q u e s t ,t h em e t a d a t as e r v i c e si s d i v i d e di n t oi n n e rs e r v i c e sp r o v i d e di n t h ew a yo fj a v aa p ia n do u t e rs e r v i c e s p r o v i d e d i nt h ew a yo fw e b s e r v i c e s b a s e do nt h ea r c h i t e c t u r ed e s c r i b e da b o v e ,t h ea u t h o rd e e p l yw o r k s o v e rt h es t r u c t u r e ,t h ew o r k i n gp r i n c i p a l sa n dt h et r a n s f o r m a t i o nr u l e s , w h i c hi st h ek e r n e lo ft h ea d a p t e r , o fc w md a t am i n i n g a d a p t e r a c a s ei s a l s os t u d i e da b o u tt r a n s f o r m i n gap m m lf i l et ot h ex m if i l ew i t ht h e r u l e sw r i t t e n b y x s l t l a n g u a g e t b e j a v ad a t a m i n i n gf j d m ) s p e c i f i c a t i o nb a s e do nc w m ,a d d r e s s e st h en e e df o rap u r ej a v aa p it o f a c i l i t a t ed e v e l o p m e n to fd a t am i n i n g e n a b l e da p p l i c a t i o n s d a t am i n i n g m e t a d a t as e r v i c em a c h n i s mi sd i s c u s s e db a s e do nj d m a n ds o i t i ej d m a _ p i sa r ei m p l e m e n t e d a n da l s oa s p e c i f i cd a t am i n i n gm e t a d a t as e r v i c ei s s t u d i e da n d p r o v i d e di naw a y o fw e bs e r v i c e k e yw o r d s :c w mp m m l d a t a m i n i n ga d a p t e r t r a n s f o r m a t i o nr u l e sw e bs e r v i c e 辩4 贞 墼型丝塑塑! ! 塑塑笪些丝! 墨些业塑 图2 一l : 图2 2 : 图2 3 : 图2 - 4 : 图2 5 : 图2 - 6 : 图2 7 : 图z 一8 : 图2 - 9 : 图2 10 图2 1 1 图3 - 1 : 图3 2 : 图3 3 : 图3 - 4 : 图3 5 : 图4 1 : 图4 2 : 图4 3 : 图5 1 : 图5 2 : 图5 3 : 图形目录 c r i s p d m 过程6 统一经营信息服务系统9 元数据集成一一“桥”( n + ( n - 1 ) 2 ) 1 2 元数据集成一一c w m 适配器13 m i ) a 三个重要转换1 5 m d a 基本架构一1 6 模型双向转换17 p i i d l 描述的数据挖掘元模型1 9 o m g 提供的c w m 相关组件2 3 c w m 元模型的包结构2 4 数据挖掘元模型:m o d el 2 6 集中式元数据管理2 9 分布式元数据管理3 0 混合式元数据管理3 1 数据仓库元数据管理环境3 2 数据挖掘元数据管理架构 数据挖掘适配器结构一 源文档结构树 目标文档结构树 j 2 e e 系统的w e b 服务结构 数据挖掘元数据服务结构 j d m 的三种可选架构 第3 页 3 4 3 8 4 8 4 8 5 5 5 7 5 9 独创性( 或创新性) 卢明 本人声明所呈交的论文足本人在导师指导下进行的研究工作及取得的研究 成果。尽我所知,除了文中特别加必标注和敛鲥中所罗列的内容以外,论文中不 包含其他人已经发表或撰写过的研究成果,也不包含为获得北京邮电大学或其他 教育机构的学位或证书而使用过的材料。与我一同工作的同志对本研究所做的任 何贡献均已在论文l 卜i 作了明确的说明并表示了谢意。 申清学位论文弓资料若有不实之处,本人承担一切相关责任。 本人签名日期 关于论文使用授权的说明 学位论文作者完全了解北京邮电犬学有关保留和使用学位论文的规定,即: 研究7 l 存校攻读学位期间论文工作的知识产权单位属北京邮电大学。学校有权保 留并阳囡家有关部门或机构送交论文的复印件和磁盘,允许学位论文被查阅和借 阅;学校可以公布学位论文的全部或部分内容,可以允许采用影印、缩印或其它 复制手段保存、汇编学位论文。( 保密的学位沦文在解密后遵j r 此规定) 保密论文注释:术学位论文属于保密在一年解密后适用本授权书。非保密论 文注释:奉学位论文不属于保密范围,适用本授权书。 小人签名: 导师签名: 同期 h 期 数错挖掘的儿数据管理及町集成研究 第一章绪论 1 1 论文的背景 数据仓库技术从逻辑上、物理卜分布的多个数据库系统中抽耿数据、集成信 息,并将集成后的信息存储在一个大规模的数据仓库中,是继数据库技术之后的 新一代信息管理技术。目前存国内外的电信、会融、零售等领域,该技术得到了 广泛的应用。数据挖掘就是从海量的数据中找卅潜在的有价值的信息,足数据仓 库技术的个重要应用。数据挖掘为企业充分了解客户、决策支持提供有力帮助, 为实现“以客户为中心”的经营理念提供一种技术手段。 数据仓库系统的信息供应链( i s c ) 涉及数据库平台、e t l 工具、o l a p _ : 具、数据挖掘平台和工具等,建赢这样一个大型系统,集成是关键。不同工具能 否、同工作,特定工具如数据挖掘t = 具,产,# 的有用信息能否在整个数据仓库环 境中交换和共享,是集成面临的主要问题。元数据通常定义为描述数据的数据, 旨在便利存取、管理、共享和处理大量结构化和或非结构化的数据。成功地实 现冗数据交换和管理是实现集成的有效技术。 整个信息供应链中的每个产品,如数据挖掘,都有自己的元数据组织方式, 也就是元模型。那么元数据交换的关键就是不同产品的元模型的交换。如果有n 个异构产品实行一对一的交换模式的话,就需要开发n + ( n 一1 ) 2 种交换策略。为 节约丌发成本和丌发复杂度,o m g 组织定义了公共数据仓库元模型( c w m ) , 符合c w m 规范的数据仓库产品之i 训可以相互交换元数掘。c w m 中对数据挖掘 ,i 模型也进行了很好的定义,如果能将某种数据挖掘产品的元模型转换为c w m 数据挖掘元模型,那么就能对该数据挖掘产品进行有效管理,与其他符合c w m 规范的数据仓库产品进行无缝集成,从而最终实现信息的共享,节约丌发和维护 成本。 1 2 论文的目标 ,| 二数据管理一卣是围内外研究的热点问题,尤其足c w m 标准、m d a 方法 等的提出,为研究提供了很好的参考和方法论指导。文献1 1 1 中提南了种利用逆 向工程的方法将遗留系统升级演进罕m d a 的体系结构,中要贡献在于提取遗留 系统的体系结构,片用形式化的语言表示出来,但没有提出完整的转换演进机制。 蚺1 顶 数据挖击f ;| 的,数据管璀艟“r 集成酬宄 文献【2 j 中利用w e b 服务技术和公共数据仓库元模型( c w m ) ,设计了一个具有 平台无关性的数据挖掘服务中心。该文只设计了- 个基于w e b 服务的粗粒度的 服务架构,提出有前端展现接口和数据仓库接口,没有涉及具体的接口类型和服 务类型。 基于上述背景和国内外研究现状,本文旨在开发一种基于c w m 标准的数据 挖掘元数据管理策略,并对外提供平台无关的元数据服务,使数掘挖掘工具与数 据仓库信息链中的其他产品( e t l 产品、数据库产品等) 进行无缝集成。具体的 说:抽取数据挖掘工具的元数据,存储元数据,并对外提供元数据服务;由于目 前特定数据挖掘工具的元模型与c w m 的元模型是异构的,所以存本文中引入数 据挖掘适配器的研究,适酉己器在工具相必的元模型与c w m 元模型之间起到桥梁 的作用。作者在适配器的研究巾主要借鉴m d a 的方法,实现平台无关的模型与 平台棚哭的模型之问的转化。 1 3 论文的主要工作 本文的主要目标是解决数据挖掘的元数据管理及与数据仓库环境无缝集成 的问题,所以作者的主要丁作包含: 理论研究:模型驱动体系结构原理、通用数据仓库元模型( c w m ) 、预 测模型标记语言( p m m l ) 、元数据交换标准x m i 和e x t e n s i b l es t y l e s h e e t l a n g u a g et r a n s f o r r n a t i o n ( x s l t ) 、j a v a d a t am i n i n g ( j d m ) : 数据挖掘适配器的设计:借鉴m d a 思想,将p m m l 表示的元模型( p s m ) 转换到符合c w m 规范的数据挖掘元模型( p i m ) ,并涉及转换规则的更 新,规则的执行机制等。转换规则用x s l t 表示。 实例研究:采用x s l t 表示的转换规则,将一个具体的数据挖掘中最常 见的决策树模型,转换到x m 表示的c w m 元模型。 数据挖掘元数据服务的设计:包含元数据服务体系结构的设计,元数据 服务机制的探讨,在实现部分j d m 标准接口的基础上对外丌放元数据服 务供用户调用。 儿数据服务实例研究:利用w e b 服务的方式丌放个只_ 体的元数据服 务,垓服务是对r 输入的设置名返同具体的挖掘设置的内容,沦文中给 h “袭服务的s o a p 消息的输入和返回。 第2 贝 数据挖掘的几敬据管删及叫集成_ _ j f 究 1 。4 论文的结构 本文的结构组织如下: 第二章相天知识 介绍了本文研究中需要的理论知识,包括数据挖掘的基础知识、元数据的基 本类型、模型驱动体系结构( m d a ) 、预测模型标记语言( p m m l ) 以及公共数 据仓库元模型( c w m ) 等。这些理论知识足卜面研究的基础。 第三章元数据管理体系架构 介绍了数据仓库领域集中式、分布式以及混合式的元数据管理方法,作者根 据这i 种方法的优缺点以及作者的实践环境选用集中式的元数据管理方法。在此 方法指导下,作者构建了数据挖掘的元数据管理架构,并介绍了架构中各部件的 功能以及部件问的输入输出。数据挖掘工具的元模型与c w m 元模型是异构的, 因此在此架构中作者引入了数据挖掘适配器,实现特定平台的元模型到c w m 元 模型的转换,具体的适配器的内部结构在第四章进行研究。 第四章适配器结构 本章手要讨论元数据管理体系架构中的一个核心部件适配器。作者提出 了适配器的结构以及工作原理,同刚重点研究并描述了适配器的核心转换规 则。本章最后举例说明将一个决策树的p m m l 模型转换为c w m 数据挖掘元模 型。 第l 章数据挖掘的元数据服务 元数据管理的一个蕈要目标是提供元数据服务。在采用适配器成功的将数据 挖掘工具的元模型转换到c w m 公共元模型并存储进中央元数据库之后,奉章重 点探讨在元数据库e 部署的数据挖掘元数据服务。本章首先根据应用需求的不 同,将元数据服务在内容卜分为对内服务和对外服务;接着介绍了w e b 服务的 基本原理和最新发御的j d m ,据此构建了数据挖掘的w e b 服务体系结构;然后 探讨了元数据服务的机相j ,最后通过个实例研究一个具体的元数据服务的实现 并用w e b 服务方式对外提供。本章最后讨论了与数据仓库元数据管理平台集成 的可行性。 第3 姐 数据挖掘的几数据管理及町集成研究 第二章相关知识 本章重点介绍了本文研究所涉及的理论基础,首先比较详细的介绍了数据挖 掘,数据挖掘概念、数据挖掘过程、数据挖掘应用实例以及数据挖掘系统集成的 需求。对丁数据挖掘的深入理解是完成本文尤其足适配器部分的个前提。接着 介绍了集成的一个重要手段元数据管理,包含元数据的概念、类型以及元数 据集成。最后介绍了本文研究借鉴的模型驱动体系结构( m d a ) 方法,用作平 台相关模型的p m m l 和用作平台无天模型的c w m ,以及这二三者之间的关系。 2 1数据挖掘 2 1 1数据挖掘产生背景 随着数据库技术的迅速发展以及数据库管理系统的广泛应用,人们积累的数 据越来越多。激增的数据背后隐藏着许多重要的信息,人们希望能够对其进行更 高层次的分析,以便更好的利用这些数据。目前的数据库系统无法发现数据中存 在的关系和规则,无法根据现有数据预测未来趋势。另一方面,人工智能自1 9 5 6 年诞生以后取得了重大进展,目前研究热点是机器学习,机器学习是用计算机模 拟人类学习的一门科学,比较成熟的算法有神经网络、遗传算法等。用数据库来 存储数据,用机器学习来分析数据,挖掘数据背后的知识,这两者的结合就促成 了数据挖掘技术的出王见。数据挖掘也称为知识发现( k d d :k n o w l e d g ed i s c o v e r y i nd a t a b a s e ) ,是一门交叉性学科,涉及到人工智能、数据库、统计学、数据可 视化、专家系统等多个领域。 现在数据挖掘技术已绎投入到商业应用中,因为对数据挖掘技术进行支持的 三种基础技术已经发展成熟,他们是: 海最数据搜集:商业数据库现存正在以空前的速度增长,并且数据仓库 l f 在广泛应用于各个行业: 强大的多处理器计算机:计算机硬件性能越来越高,并行多处理机技术 已经成熟; 数据挖掘算法:数据挖掘算法经过了1 0 多年的发展也已经成为一种成 熟,稳定,并作为组件集成进数据挖掘工具中,便于普通用户面非数掘 挖掘专家使用,这进一步推动了数据挖掘技术的发展。 第4 贝 数据挖掘的,数掘管理发可集j 垃研究 2 1 2 数据挖掘功能 数据挖掘通过预测未来趋势及行为,做出前摄的、基于知识的决策。数据挖 掘的目标是从大量数据中发现隐含的、有意义的知识,又称为模式。 模式按功能可分为两大类:描述型和预测型。描述型模式是对数据中存在的 规则做种描述,或者根据数据的相似性把数据分组,包括分类、回归及时问序 列分析等。预测型模式是可以根据数据项的值精确确定某种结果的模式。挖掘预 测型模式所使用的数据也都是可以明确知道结果的,包括概念描述、聚类及关联 分析等。 分类:分类模式是一个分类函数( 分类器) ,能够把数据集中的数据项映射到 某个给定的类上。分类模式往往表现为一棵分类树,根据数据的值从树根丌始搜 索,沿着数据满足的分支往上走,走到树叶就能确定类别。 回归:回归模式的函数定义与分类模式相似,它们的差别在于分类模式的预 测值是离散的,回归模式的预测值是连续的。一般情况f ,回归采用的是线性回 归、1 f 线性回归这样的标准统计技术。一般同一个模型既可用于回归也可用于分 类。常见的算法有逻辑回归、决策树、神经网络等。 时间序列:时间序列是用变量过玄的值来预测未来的值。 概念描述:继承于数据分析中的统计分析。概念描述的目的是对数据进行浓 缩,给出它的紧凑描述。传统统计方法如求和值、平均值、方差值等都是有效方 法。另外还可以用直力图、饼状图等图形方式表示这些值。 聚类:聚类模式把数据划分到不同的组中,组之| r j 的差别尽可能大,组内的差 别尽町能小。与分类模式不| 司,进行聚类前并不知道将要划分成几个组和什么样 的组,也4 i 知道根据哪一( 几) 个数据项柬定义组。般来说,业务知识丰富的人应 该可以理解这些组的含义,如果产生的模式无法理解或小可用,则该模式可能是 兀意义的,需要回到上阶段重新组织数据。 关联分析:是寻找数据库r i 值的相关性。两种常用的技术是关联舰则和序列 模,。关联规则是寻找在同个事件中出现的不同项的相关性;序列模式与此类 似,寻找的是事件之间时间t :的相关件,如对股票涨跌的分析等。 2 1 3 数据挖掘过程 数据挖掘,是一个利用数学或统计的方法从大量数据中抽取挖掘出未知的、 有价值的摸j 或规律等知识的复杂过程。整个知u 挖掘( k d d ) 过j 鼙是由若i 挖捌步骤组成,而挖掘建模足其中的一个主要步骤。c r i s p d m 是c r o s si n d u s t r y 第5 负 数捌挖掘晌儿数据管脞殷。j 集成彤究 s t a n d a r dp r o c e s sf o rd a t am i n i n g 的缩写,由s p s s 、n c r 、d a i m l e r b e n z 在1 9 9 6 年制定。c r i s p 是当今数据挖掘、i p 界通用流行的标准之一。c r i s p d m 将数据挖 掘过程分为6 部分,分别为商业理解、数据理解、数据准备、建立模型、模型评 估和模型发布。各部分的关系见图2 1 : 图2 - 1 :c r i s p - d m 过程 商业理解:找问题一确定商业日标,对现有资源的评估,确定问题是否能够 通过数据挖掘| 米解决,确定数据挖掘的目标,制定数据挖掘计划; 数据理解:确定数据挖掘所需要的数据,对数据进行描述,数据的书u 步探索, 检查数据的质量; 数据准备:选择数据,清理数据,对数据进行重建,调整数据格式使之适合 建模; 建立模型:对各个模型进行评价,选择数据挖掘模型,建立模型; 模型评估:评估数据挖掘的结果对整个数槲挖掘过程的f j i f 面步骤进行评估, 确定下一步怎么办,是发布模型还是对数据挖斯d 过程进行进步的调整,产牛 新的模型; 詈f l6 页 数据挖掘的兀数据管删及n ,集成州究 模型发布:把数据挖掘模型的结果送到相应的管理人员手中,对模型进行h 常的监测和维护,定期更新数据挖掘模型。 在c r i s p d m 的6 部分中,每部分在项目中发费的时问和占项目的重要性 的重要性并不是平分的,各部分和发费的时间和重要性的关系如卜表 花费的时间占项目的重要性 商业理解1 0 7 9 数据理解 2 0 3 0 3 数掘准备5 0 7 0 1 5 建模、评估 1 0 2 模型发布 5 1 0 1 利用数据挖掘过程可以帮助获得决策所需的多种知识。在许多情况下,用户 并不知道数据存在哪些有价值的信息知识,因此对于一个数据挖掘系统而占,它 应该能够同时搜索发现多种模式的知识,以满足用户的期望和实际需要。 数据仓库为数据挖掘提供大量高质量的数据,所以,数据挖掘在数据仓库环 境之e 得到了高效的应用。数据挖掘工具也成为整个数据仓库系统中的一个重要 组件,这也是本文研究集成的意义所在。 本义讨论的数据挖掘是以卜c r i s p d m 过程中的关键步骤数据准备和建模, 而不涉及前期的数据理解、后期的模型评估等,因为这些是在数据挖掘1 具中模 型最终结果没发布之前完成的。 2 1 4 数据挖掘应用领域及技术热点 1 4 4 1应用领域 基于w e b 的数据挖掘 基十w e b 的数据挖掘的定义是:针对包含w e b 页面内容、页面之间的结构、 用户访问信息、电子商务信息等存内的各种w e b 数据,应用数据挖掘方法以发 现有用的知识来帮助人们从w w w 中提取知识,改进站点的躞计,更好地丌展 电子商务等。 生物信息或基因的数据挖掘 q i 物信息或基因数据挖掘则完令属丁另外个领域,在阶k 上很难讲有多大 擒7 数据挖掘的儿数据管理殷口j 集成_ f l 究 的价值,但对于人类却受益非浅。例如,基因的组合t i 变万化,得某种病的人的 基因和j 卜常人的基因到底差别多大? 能否找出其中不同的地方,进而对其不同之 处加以改变,使之成为f 常基因? 这都需要数据挖掘技术的支持。 对于生物信息或基因的数据挖掘和通常的数据挖掘相比,无论在数据的复杂 程度、数据量还有分析和建立模型的算法而言,都要复杂得多。从分析算法上讲, 更需要一些新的和好的算法。现在很多商正在致力于这方面的研究。但就技术 和软件而占,还远没有达到成熟的地步。 文本的数据挖掘( t e x t u a lm i n i n g ) 人们很关心的另外一个话题是文本数据挖掘。举个例子,在客户服务中心, 把同客户的谈话转化为文本数据,再对这些数据进行挖掘,进而了解客户对服务 的满意程度和客,、的需求以及客户之间的相互关系等信息。从这个例了町以看 出,无论是在数据结构还是在分析处理方法方面,文本数据挖掘和莳而谈到的数 据挖掘相差很大。文本数据挖掘并不是一件容易的事情,尤其是在分析方法方面, 还有很多需要研究的专题。目前市场上有一些类似的软件,但大部分方法只是把 文本移柬移去,或简单地计算一f 某些词汇的出现频率,并没有真正的分析功能。 随着训算机计算能力的发展和业务复杂性的提高,数据的类型会越来越多、 越来越复杂,数据挖掘将发挥出越来越大的作用。 2 1 4 1 技术热点 当f j 数据挖掘技术方面的研究比较注重以下方面: 灵活的预言性模型 包括神经网络、支持向量机等。一个1 常重要的研究方向是模型的组合算法, 例如b a g g i n g 、b o o s t i n g 等。 改进统计算法,使之可应用在新的大规模的应用中 前面已经提到数据挖掘的算法许多来自数理统计,把统计学的方法加以改进 使之能适应新的环境是重要的研究课题之一。 挖掘结果的可视化 结果可视化也是数据挖掘研究的重要内容之,甚至有人把可视化也作为数 掘挖掘的重要功能之一。 可集成的灵活的数据挖掘环境 个可集成的数据挖掘环境是从数据挖掘技术中获得商业价值的重要冈素, 第8 舡 数摄挖掘的儿数据管埋搜u f 集成研究 一些大型应用问题中可能需要适合自己特点的数据挖掘环境。 2 1 5数据挖掘应用统一经营信息服务系统 中国联通统一经营服务系统体系结构如图2 - 2 所示,从综合营帐了系统、统 一客广i 资料了系统、窖服子系统等数据源系统中采集数据,经过清沽、转换、装 载到操作型数据存储( o d s ) 中,从o d s 中经过进一步抽取转换装载( e t l ) 进数据仓库,通过数据仓库的数据接口发布数据的应用。数据的应用有固定报表、 定制报表、在线分析处理( o l a p ) 、数据挖掘等。而这些应用如果是针对某 方面如客户流失的话,这些隧用集合起来构成一个专题分析,如客户流失专题。 目前专题分析是统一经营信息服务系统的一个热点应用,因为它能带柬比o l a p 分析更加深入的分析,从来带来更高的价值信息。统经营信息服务系统要顺利 的运行起来离不开调度管理、f i 志管理、安全管理、接几管理、元数据管理等系 统管理i :作。 目2 - 2 :统一经营信息服务系统 数据挖拥作为数据仓库的一个应用,对于统一经营信息服务系统的意义很 大,同时也是专题分析的一个技术灵魂。通过数据挖掘技术,中国联通r 叮以发现 客户的深层次信息,比如客户流失预测、客户价值细分、客户活跃度划分等,为 食业实现“以客户为中心”的经营理念提供技术支持。通过加深对客,的了解, 为快速m 应市场变化提供可能,剧此也提高了企业的竞争力。因此数据挖掘技术 第9 且 数据挖掘的儿数据管理发可集成埘究 受到了电信、会融、零售等领域的广泛应用。 2 1 6数据仓库系统集成 在2 1 5 订中给出了数据仓摩系统的一个重要实例中固联通统一经营信 息服务平台,这节首先给出数据仓库的描述性定义。著名的数据仓库专家 w h i n m o n 存其著作( ( b u i l d i n gt h ed a t aw a r e h o u s e ) ) 一书中给数据仓库如下定义: 数据仓库是一个而向主题的、集成的、相对稳定的、反映历史变化的数掘集合, 用于支持管理决策。一个数据仓库环境涉及数掘存储系统、e t l 工具、o l a p 服 务器、数据挖掘工具等异构系统和工具,如何把这些系统集成整合起来提供一个 统一的数据仓库环境是数据仓库系统集成欲解决的问题。因为只有形成集成的数 据仓库环境,才能使数据自动的从数据源到最后的分析前端展现流动起来,方便 数据仓库系统的统一管理;j 甫e 使数据仓库系统有一个整体的系统感,而不是一 个一个孤立的子系统。 构建集成的数据仓库系统,一个统一的数据仓库管理平台是关键。而构建一 个统一的数据仓库管理平台要求数据仓库系统的每一个子系统是可集成的,也就 是基于标准开放接口的,或者是符合该数据仓库管理平台标准接口的。数据挖掘 系统作为数据仓库环境中的一个重要予系统,必须是可集成的。 系统集成的关键是子系统能否被访问和系统州能甭互操作,元数据是实现系 统集成的有效手段,抽取源系统中的元数据,对其按照国际标准或者行业规范的 方法进行管理,是解决集成问题的有效手段。2 2 节将详细介绍元数据的概念及 元数据管理。 2 2元数据管理 2 _ 2 _ 1引言 元数据通常定义为描述数掘的数据,旨存便利存取、管理、共享和处理人量 结构化和或非结构化的数据。在过去的几年里,元数据的概念在现实中大晕使 用,有时为了支持信息检索,有时为了软件配置,有时为了小同系统之间的数据 交互。对于不同领域的专家,元数据有着不同的应用,但至少有两点是共同的: 元数据对数据进行描述:元数据的存侄是为了更有效地使用数据。近年来,随着 计算机技术应用的广泛化,元数据得到人们越来越多的关注,这是由多方面的需 求决定的。 首先是管理数据的需求。当系统数据量越来越大时,检索、使用这砦数据的 效率就会降低,通过存储天于系统和数据的内容、射【织、特性等细 ,可以帮助有 第1 f l 贞 数据挖掘的儿数据管理披町集业蚪究 效地进行管理,从而提高效率。 第二是系统分和、互通和重用的要求。目前信息系统一个共同的趋势就是信 息共享,要实现异构系统中的信息共享,就需要描述数据语义、软件丌发过程的 i 数据,而且这些元数据必须标准化,以充分实现分稚、互通和重用。 第三是元数据重用、综合的需求。目前,很少有单一工具能满足大型商业应 用的需求,用户常常需要使用多种工具的组合,不同工具之间的数据交换的途径 之一就足通过标准的元数据。这。点j t 是本论文的研究范围。 2 2 2元数据的类型 理解和利用存在于系统中的元数据能大大的节约f 发和维护成本,但是冗数 据存系统中无处不在,因此了解元数据的类型、过滤和限制元数掘、抽取出最实 用的元数据是一项必不可少的技能。本节就是介绍系统中有哪些元数据可以抽 取,而本文讨论的元数据的重点又是什么。 为描述元数据世界的多样性,以下简单的列举出企业有哪些元数据可以抽取 【8 】: 遗留大型主机系统; 数据库系统; 面向对象应用系统; 逻辑模型信息: 企业资源计划( e r p ) 软件; x m l 文档中的几数据; 办公自动化文档; 成功的元数据管理需要对企业的元数据通盘考虑,针埘某个特定的f 1 标确定 哪些元数据是至关重要的,从【f i 抽取出来进行管理。搜集元数据的方法定要仔 细考虑,不能草牢。甭则兀数据集将越来越人,最终使得元数据集变得非常复杂 而无法管理,这样就失去了抽取元数据便于高效管理的初衷。 本文讨论的元数据是数据挖捌模型的元数据,包龠生成模型所需的输入数据 元数据、训练模型时对输入数据的预处理以及模型的参数没置、数据挖掘模型描 述自身的元数据。而不涉及数据挖掘模型的软硬件环境等。 第1 1 负 数据挖掘的元数捌管理及日集成石j f 宄 2 2 3 元数据集成一一c w l i l 适配器 由于各种工具软件在设计其元数据的格式、语义及访问接口时,主要考虑的 是如何方便奉工具的使用和存储,而并未过多地考虑冗数据间的集成问题。解决 各种元数据集成问题的方法之足:在各种j :具之间建立复杂的元数据“桥”, 如图2 - 3 所示。元数据“桥”是能够将- - * 0 格式的元数据转换为另一种格式的冗 数据的软件产品。这种元数据“桥”必须非常清楚所要集成的工具中元数据的结 构和访问接口。图2 3 中灰色箭头代表彳i 同工具之间的元数据“桥”。在有n 个 包含不同种类元数据的产品和1 1 具情况下,必需要有n + ( n 一1 ) 2 个元数据“桥”, j 能实现所有产品和i :具之间元数据的交换和互通。另外,兀数据“桥”应该是 双向的。例如,在将数据从事务处理系统移动到数据仓库系统时,“桥”必须能 将事务处理系统的元数据映射为数据仓库系统的多维元数据( 如将事务处理系统 巾表的定义映射到关系型数据库系统的星型模型) ;同时,为了使用户能够钻回 到事务处理系统,“桥”还需要将多维元数据映射回事务处理系统的元数据。然 而,这种从一种元数据格式到另一种元数据格式的转换,经常会导致数据缺损和 丢失。 图2 - 3 :元数据集成一一“桥”( n ,( n 一1 ) 2 ) 虽然,元数据“桥”能够解决各种t 具间的元数据集成问题,但“桥”不 仅复杂,而且代价昂贵。“桥”不仅必须清楚地所要集成的元数据的模璎和接广| , 而 l 要包含从种元数据到另外一种元数据的复杂映射。“桥”的内部处理逻辑 也很难为其他“桥”所重用。这种复杂性大大降低了数据仓库和商业智能所带柬 数捌挖掘的儿数据管埋及n j 集成研究 的经济效益。 c w m 规范及模型驱动体系结构,为各种元数据的集成提供了一条全新的解 决途径:c w m 适配器,如图2 - 4 所示。c w m 适配器提供: 种通用语占( c w m 元模型) 一一描述元数据; 元数据的x m l 格式描述一一交换元数掘; 元数据a p i s 一一访问元数据。 上述标准与技术能很好地解决数据仓库的建模及管理问题。 图2 4 :元数据集成一c v m 适配器 2 3模型驱动体系结构( m d a ) 2 。3 1 m d a 介绍 o m g 组纵为降低软件开发复杂度、业务逻辑和底层技术平台相分离,在2 0 0 1 年采纳了模刑驱动体系结构( m d a ) ,利用模型进行软件丌发的方法。m d a 为 系统集成提供了条开放的、厂商独立的解决途径,旨在使商、i l 应用的发展独立 丁二技术的发展。m d a 足软件开发上的又一次革命。1 9 9 7 年起,o m g 组织先后 采纳了统一建模语考u m l 、元对象设施m o f 、x m l 元数据交换x m i 和通用数 据仓库元模型c w mi ,q 个非c o r b a 标准的规范。m d a 是基于以上儿个觇范的。 m d a 将软件系统的模型分离为乎台无关模型p i m 和特定平台模型p s m , 同时又能通过转换规则将它们统一起来,以这样的方式试图去摆脱需求变更所带 来的网境。平台无关模型p i m 足对系统高层次的抽象,其l 小包括任何弓实现 数据挖掘的儿数据管理及一t 集成研究 技术相关的信息;特定平台模型p s m 是跟特定平台相关的模型。在m d a 框架 中,首先使片j 平台无关的建模语言来搭建平台无关的模型p 1 m ,然后根掘特定平 台和实现语言的映射规则,将p i m 转换以生成平台相关的模型p s m ,最终生成 应用程序代码和测试框架。 p i m :从平台无关视角描述系统的平台无关操作的模型。由系统的数据、处 理进程等平台无关的信息组成。为了体现平台无关,p i m 的目标平台必须是一个 技术无关的虚拟机。虚拟机提供了许多平台无关的通用服务,例如文件服务、安 全服务等,它们可以在多个特定的平台上被实现。p i m 代表软件生命周期中的分 析模型。 p s m :从平台相关视角描述系统的平台相关操作的模型。p s m 由系统的数 据、处理进程等平台相天的信息组成。p s m 代表软件生命周期中的设计模型。 映射( m a p p i n g ) :是一种规约,用丁- 将p i m 转换成p s m 。转换是具体的规则 和转换过程。m d a 方法中,最关键的特性就是映射。映射是将一个模刑转变为

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论