版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
PartI数据仓储技术篇
第1章数据仓储与数据采掘概述
1.1资料仓储的发展与展望
1.2资料仓储的架构
1.3数据仓储的参照结构
1.4数据采掘技术
1.5数据采掘技术与工具
1.6数据仓储与数据采掘的应用
1.7数据仓储应用
1.8数据仓储导向的决策支持系统
1.9数据仓储的商业应用
1.10数据仓储与数据采掘的应用
习题
随着信息技术的不断推广和应用,许多企业都已经在使用管理信息系统(MIS)处理管理交易和日常业务。这些管理信息系统为企业累积了大量的信息因此,在信息处理中,产生了与传统数据库有很大差异的数据环境要求,和从这些巨量数据中获取特殊知识的工具的需要。
1.1资料仓储的发展与展望传统数据库只保留了当前的业务处理信息,缺乏决策分析所需要的大量历史信息。为满足管理人员的决策分析需求,就需要在数据库的基础上产生适应决策分析的数据环境─资料仓储(DW,DataWarehouse)。
1.1.1从传统数据库到数据仓储决策处理的系统响应问题在传统的业务处理系统中,客户对系统和数据库的要求是数据存取频率要高,操作时间要快。在决策分析处理中,客户对系统和数据的要求则发生了很大的变化。这些操作必然要消耗大量的系统资源,这是对业务处理实时反应的事务处理系统所无法忍受的。
决策数据需求的问题在进行决策分析时,需要有整体、正确的整合式资料,这些整合式数据不仅包含企业内部各部门的有关数据,而且还包含企业外部的,甚至竞争对手的相关资料。但是在传统数据库中,只储存了本部门的事务处理资料,而没有与决策问题有关的整合式数据,更没有企业外部的资料。
在决策数据的整合中还需要解决数据混乱问题。例如,企业进行并购活动之后,被并购企业的信息系统与并购企业的系统不兼容,数据无法共享。例如,在系统开发中,由于资金的缺乏,只考虑了一些关键系统的开发,而对其他系统不予考虑,使决策数据无法整合。
例如,员工的性别在人力信息系统中可能用逻辑值“M”和“F”表示,在财务系统中可能用数字“0”和“I”表示。例如,名称为“GH”的域名在人事系统中表示为员工的“员工号码”,但是在销售管理系统中却表示为“购货号码”。这样在使用这些数据作出决策之前,必须对这些数据作分析,确认其真实含义。
在决策分析中,系统常常需要从数据库中萃取资料、搜寻有用的数据,然后将这些数据导入其他文件或数据库中,供客户使用。这些被萃取出来的资料,有可能被其他客户再次萃萃取。由于这种不加限制的数据连续萃取,使企业的数据空间构成了一个错综复杂的资料“蜘蛛网”(Spider’sWeb),即形成了自然演化架构数据的整合还涉及到外部数据与非结构化数据的应用问题。例如行业的统计报告、顾问公司的市场调查分析资料。这些数据必须经过格式、类型的转换,才能被决策系统应用。为完成事务处理的需求,传统数据库中的数据一般只保留当前的资料。但是对于决策分析而言,历史的、长期的数据却具有重要的意义。
在决策分析程序中,决策人员往往需要的并不是非常详细的资料,而是一些经过汇总、汇总的数据。决策数据操作的问题决策分析人员则往往希望以专业客户的身份而不是参数客户的身份对数据进行操作,他们往往希望能够用各种工具对数据进行多种形式的操作,希望资料操作的结果能以商业智慧(BusinessIntelligence,BI)的形式呈现出来。数据仓储与传统数据库的对比数据仓储虽然是从数据库发展而来的,但是两者在许多方面都存在着相当大的差异,如表1-1所示。
数据库只存放当前之值,而数据仓储则存放历史值数据库中数据的目标是面对业务操作人员数据仓储则是面对中高层主管数据库内的数据是动态变化的,数据仓储则是静态的历史性数据数据库中的数据结构比较复杂,数据仓储中的数据结构则较为简单。
数据库中数据的存取频率较高,但是存取数据的数量较少;数据仓储的存取频率较低,但是数据存取量要远高于数据库。数据库在存取数据时要求响应速度很快,数据仓储的反应时间则可能长达数小时。
1.1.2数据仓储的定义与基本特色WilliamH.Inmon在1993年所写的论著《BuildingtheDataWarehouse》则首先系统地阐述了关于数据仓储的理论,为资料仓储的发展奠定了里程碑。在内文中,他将数据仓储定义为:
“一个主题是导向的、整合式、随时间变化的、不易失漏性数据的集合,用于支持管理层的决策程序”。主题式导向(Subjectoriented)数据仓储的创建、使用都是焦距于主题执行的。因此,我们必须了解如何按照决策分析来萃取主题;所萃取出的主题应该包含哪些数据内容;这些数据内容应该如何组织。
在确定主题之后,需要确定主题所应该包含的资 料。此时,应该注意不能将锁定主题的数据与事务处理系统中的数据相混淆。
在主题的数据组织中应该注意,不同的主题之间可能会出现相互重迭的信息。主题在数据仓储中可以用多维数据库方式进行储存。
整合式数据(IntegratedData)资料仓储的整合性是指根据决策分析的需求,将分散于各处的原始数据进行萃取、筛选、净化、整合等工作,使数据仓储中的数据具有整合性。
资料的时变性(Time-Variant)数据仓储的时变性,就是数据应该随着时间的推移而不断发生变化。数据仓储数据的时变性,不仅反映在数据的追加方面,而且还反映在数据的删除上。数据仓储中数据的时变性还表现在汇总数据的变化上。
资料的不易失漏性(Nonvolatile)数据的不易失漏性可以支持不同的客户在不同的时间查询、分析相同的问题时,获得同一结果。
资料的聚合性(Aggregate)
数据仓储所采用的数据聚合方式,主要是以多维资料库方式进行储存的多维模式、以关系数据库方式进行储存的关系模型或以两者相整合的方式进行储存的混合模式。
支持管理中的决策制定程序企业各级主管可以利用资料仓储进行各种管理决策的分析,利用自己独特而敏锐的商业透视力和业务知识,从貌似平淡的资料中发现潜在的商机。
1.1.3资料仓储的未来趋势
关系型对象数据库的数据仓储关系型对象数据库的出现使得数据仓储设计人员可以将对象引入到数据仓储环境中。面向对象技术引入数据仓储之后,客户可以定义适合某种数据类型的最佳操作。关系型对象数据库作为数据仓储平台不仅为复杂数据类提供了可延伸功能,而且还为数据仓库平台提供了对数据处理的功能延伸。
网络的影响未来的数据仓储将越来越依赖于网络作数据的传输、数据的使用申请处理。客户可以藉助于内部网路或外部网络使用数据仓储,这就需要数据仓储具有网络使用方面的能力。
操作型数据仓储“操作型数据仓储”就能够以一种可以接受的标准对数据仓储进行操作。这些标准包括可预测性、可利用性和可存取性。
Web应用中的代理技术资料仓储的Web应用主要是指客户利用合作伙伴(partner)的资料仓储或Intranet(企业内部网络)系统中的多维数据集合进行决策分析活动。
1.2资料仓储的架构
1.2.1数据仓储的概念架构1.2.2虚拟数据仓储结构
1.2.3资料市集架构1.2.4单一数据仓储结构
1.2.5分布式数据仓储结构
1.3数据仓储的参照结构数据仓储的基本功能包括:数据萃取、数据筛选和净化、清理之后的数据加载、建构数据市集、完成资料仓储的查询、决策分析和知识采掘等。1.3.1数据仓储基本功能层数据仓储的基本功能部份包含了数据源、数据准备区、数据仓储架构、数据市集或知识采掘库以及数据的存取与使用功能部分,如图1.7所示。资料仓储的数据源业务资料业务数据是指那些从组织目前正在执行的业务处理系统那里收集到并保储存在业务处理系统数据储存中的资料。历史性资料指组织在长期的信息处理程序中所累积下来的资料,这些数据一般进行了脱机处理。
办公资料主要是指组织内部的办公系统数据,这些数据分为电子数据和非电子数据两种。Web资料Web数据是企业透过因特网所获取的数据,这些数据可以透过企业的电子商务系统获取,也可以透过网络调查获取。
外部数据外部数据是指那些不为企业所操作、所拥有、所控制的数据,这些数据有的是电子形式的。数据源超资料数据源数据属于超数据管理层范围,在数据仓储中的所有数据都需要透过超数据管理层来进行管理、控制。
数据准备区的功能结构数据的标准化处理数据准备区的标准化处理主要是将同名不同内容的、同内容不同名的、同名同内容但不同结构的资料进行统一处理。数据的过滤与适配
数据的过滤与适配主要是对进入数据仓储的数据按照客户的需要进行筛选。
数据的净化处理数据的净化处理主要是对准备加载到数据仓储中的数据进行正确性判断。加盖数据的时间戳由于在数据仓储中要进行数据的汇总,以分析交易的发展趋势。
确认数据质量
数据仓储中数据品量的高低是资料仓储能否成功的关键因素之一。超资料萃取与创建数据的持续改善程序中,还需要从数据源中确定这些源数据的超数据内容。
数据仓储功的能结构资料重整数据重整是为使数据仓储能够更好地为客户服务所进行的一系列预先操作。数据的整合与分解对来自不同系统的数据进行整合,创建新的数据。资料的汇总与聚集数据的概括聚集处理就是根据某一属性将数据进行汇总。
数据的预算与推导预算与推导的结果都是事先进行的计算,并作为资料仓储的字段储存在数据仓储中。数据的编译与格式化对来自不同数据源的数据进行编译和格式化处理,便于今后的统一处理。
数据的转换与映像对己经储存好的数据进行转移或再映像到数据源中,有利于对新生成或发生变化的数据添加更新。资料仓储创建数据仓储创建作为数据仓储的核心功能应该完成资料仓储的建模、数据的一般性、数据的整合、数据的调整与确认、建构结构化查询。
资料仓储的建模从己经创建的数据模型中导出资料仓储的数据模型(星状模型或雪花模型)。资料的汇总根据客户的需要,从初步的一般性资料中创建客户所需的高度汇总资料。
资料的聚集从拥有大批量数据的数据仓储中进行查询分析是一个非常费时的操作。数据的调整与确认在数据完成汇总与聚集之后,需要对汇总与聚集后的数据进行确认。
建构结构化查询为提高一些结构化查询,可以预定义这些查询,并将这些结构化查询作为超数据储存在超数据库中。超数据管理超数据管理功能主要包含超数据浏览与导览、超资料的萃取与创建、创建字汇表。
超数据浏览与导览数据仓储的建构者在数据仓储的建设和维护程序中需要利用数据仓储的超数据浏览和导览功能。超资料的萃取与创建在数据重整程序中需要从整合数据、汇总数据和衍生数据中捕获超数据。
创建词汇表在创建数据仓储的程序中,需要根据所捕获的超资料建构超资料的词汇表。资料市集/知识采掘库结构数据仓储的数据存取与使用结构
1.3.2数据仓储的管理层1.3.3数据仓储的超数据管理层
数据仓储、数据市集和超数据词汇表管理超数据管理层利用超数据词汇表来管理数据仓储和数据市集中的逻辑数据模型、实体数据模型以及与技术和业务相关的资料说明。
超数据萃取、创建、储存和更新管理超数据在数据仓储对数据源进行数据萃取、清理、加载等操作程序中需要对所涉及到的超数据进行萃取、创建、储存和更新处理。
预订定义的查询、报表和索引管理在超数据管理中还需要对设计人员为数据仓储客户预订定义的查询和报表进行管理,将预定义的查询和报表的处理方式甚至处理结果置于超数据库中。
更新、复制、恢复、登录、归档与净化管理数据仓储所连接的数据源发生了变化时,数据仓储的内容也要定期更新。这些更新工作的进行需要依靠超数据库中所包含约有关说明。
1.3.4数据仓储的环境支持层
数据仓储的数据传输层数据传输层的架构数据传输层中的数据传输和传送网络包括网络协定、网络管理框架、网络操作系统和网络。客户端/服务器与中间组件客户端/服务器代理和中间组件部分包括数据库网路、数据仓储的中间组件、传输层的数据仓储数据发布和复制系统等。
数据复制系统在传输层的复制系统中有发布与复制系统、数据库网关内所定义的复制工具、专用的数据仓储产品等。
数据仓储的基础层数据仓储的基础层中包括系统管理、工作流程管理、储存系统、处理系统等部分,如图1.16所示。1.4数据采掘技术1989年8月,在第11届国际人工智能联合会议的专题研讨会上首次提出了数据库导向的知识发现(KDD,KnowledgeDiscoveryinDatabase)技术。
该技术涉及到机器学习,模式识别、统计学、智能型数据库、知识获取、专家系统、数据可视化、高性能计算等领域。
1.4.1资料采掘的发展超大型数据库的出现依靠计算机自动收集的各种业务处理资料使许多大规模数据库或数据仓储拥有了大量的业务处理数据、市场变化资料。先进的计算机技术先进的计算机技术水准已成为促进数据采掘技术发展的第二个重要因素。
管理的需求企业所面临的市场竞争压力日趋严重,企业经营管理者希望能够从企业累积的大量历史资料中,找到应对日趋严重竞争压力的良方,希望能够从这些数据中找到管理中发生问题的根本原因。
对数据采掘的精深计算能力大规模数据的采掘需要复杂的、精深的计算能力,这些精深的计算能力主要以统计学、集合论、信息论、认识论和人工智能等各种学科理论为基础。
1.4.2数据采掘的定义数据采掘的定义现在很多,在不同的教科书上有不同的定义。呈现方式虽然不同,但本质都是一样的。这里主要从技术角度和商业角度给出数据采掘的定义。数据采掘的技术定义从技术角度看,资料采掘是从大量的、不完全的、有噪音的、模糊的、随机的实际数据中提取隐含在其中的、人们所不知道的但又是潜在有用的信息和知识的程序。
数据采掘的商业定义商业应用角度来看,数据采掘是一种崭新的商业资讯处理技术,其主要特点是对商业数据库中的大量业务数据进行萃取、转化、分析和模式化处理,从中提取辅助商业决策的关键知识,即从一个数据库中自动发现相关商业模式。
1.5数据采掘技术与工具
1.5.1常用的数据采掘技术资料采掘的发展受到数据库系统、统计学、机器学习、可视化技术、信息技术以及其他学科的影响,例如类神经网络、模糊/粗糙集理论、知识表示、归纳技术、高性能计算等。如果从常用的数据采掘技术来看可以分成三大类:传统分析类传统的统计分析(或称资料分析)技术中使用的数据采掘模型有线性分析、非线性分析、回归分析、逻辑回归分析、单变量分析、多变量分析、时间序列分析、最近近邻算法、群集分析等。
知识发现类知识发现类数据采掘技术包括类神经网络、决策树、基因算法、粗糙集、规则发现、关联顺序等。类神经网络是仿真人脑神经元结构判定树是一个类似于流程图的树结构基因算法是近几年发展起来的一种崭新的整体优化算法粗糙集能够在缺少关于数据先验知识的情况下
资料采掘技术的发展在资料采掘技术的最新发展中包括了文字数据采掘、Web数据采掘、可视化系统、空间数据采掘和分布式数据采掘技术等。
文字数据采掘和Web资料采掘是近几年新发展起来的崭新资料采掘技术可可视化系统是为了便数据采掘能够以图形或影像的方式在屏幕上显示出来空间数据采掘是地理信息系统导向的数据采掘技术。分布式数据采掘是分布式数据库导向并利用分布式算法从分布式数据库中采掘知识的技术。
1.5.2常用数据采掘工具按使用方式分类的数据采掘工具决策方案生成工具往往是针对某个特定行业或特定问题而开发的一类数据采掘工具。商业分析工具有两种类型。一种是只为客户提供一个黑箱,另一种数据采掘工具则向客户展示数据采掘模型
按数据采掘技术分类的数据采掘工具按照数据采掘的技术可以分成:类神经网络导向的工具规则和判定树导向的工具模糊逻辑导向的工具整合性数据采掘工具等
按应用范围分类的数据采掘工具专用型数据采掘工具专用型数据采掘工具主要用于某一特定领域。通用型数据采掘工具通用型数据采掘工具一般不考虑所采掘对象的实际含义,只提供各种通用采掘算法。
通用型数据采掘工具:IBM公司的IM智能型采掘器,这是一套包括了Explorer、Diamond和Quest在内的软件产品。SPSS公司统计软件包SPSS在统计领域处于领先的地位RedBrick公司的RedBrick数据采掘工具是第一个将数据采掘解决方案与数据库整合在一起的数据采掘组件。
1.5.3数据采掘工具的评估标准如何选择满足需要的数据采掘工具就成了数据采掘应用中首先要解决的问题。在选择数据采掘工具时,一般可以参照以下评价标准。
模式种类的数量数据采掘工具能够提供的模式越多,它的知识发现能力越强,而且多种类型模式的整合应用,有助于降低问题的复杂性。解决复杂问题的能力为了解资料采掘工具解决复杂问题的能力,可以从采掘工具的模式应用、数据选择和转换能力、可视化程度和延伸性等方面审视。数据采掘工具的延伸性也是提高采掘工具解决复杂问题能力的一个重要因素。
操作性能操作性能的好坏是一个影响采掘工具性能的重要因素。数据采集能力没有一种工具可以支持所有类型的数据库或数据仓储,但应该可以通过通用接口连接大多数流行的资料库或数据仓储,这有利于提高数据采掘工具的使用范围。
采掘结果的输出数据采掘工具不仅能够将采掘结果以多种方式输出,而且要求输出的结果便于客户的了解与应用。噪音数据的处理及采掘工具的稳健性噪音数据的处理从另一个角度说明采掘工具需要具有一定的稳定性,从数据采掘工具的目标来看,是希望能够对未知的对象做出正确的判断。
1.5.4常用数据采掘工具的选择 由于数据采掘工具种类繁多,客户在选择采掘工具时,需要从工具的实用性和技术性方面进行研究。
从技术性方面审视资料采掘工具时,需要根据资料采掘工具评估标准,选择那些技术性能指针良好的数据采掘工具。
1.6数据仓储与数据采掘的应用
1.6.1数据采掘与数据仓储 根据数据采掘的定义,我们可以看出,数据采掘包含了一系列旨在从数据集合中发现有用而未发现的模式的技术,如果将其与数据仓储紧密联结在一起,将获得意外的成功。 传统的观点认为数据采掘技术扎根于计算机科学和数学,不需要也不会得益于数据仓储。这种观点是不正确的
当然从数据采掘与数据仓储的整合情况来看,资料采掘技术己经成为数据仓储应用的强大支柱。资料采掘技术在数据仓储中的应用,正好弥补了数据仓储只能提供大量数据,而无法进行深度信息分析的缺陷。1.6.2数据采掘程序确定采掘物件定义清晰的采掘对象,认清数据采掘的目标是数据采掘的第一步。在资料采掘的第一步中,有时还需要客户提供一些先验知识,例如概念树等。准备资料数据的选择在确定数据采掘的业务对象之后,就需要搜寻所有与业务对象有关的内部数据和外部数据,从中选择出适合于数据采掘应用的数据。
数据的预先处理
在选择好数据之后,还需要对资料进行预先处理,对数据进行净化,解决数据中的遗漏值、冗余、资料值的不一致、数据定义的不一致、过时的数据等问题。
采掘模型的建构这个分析模型是锁定采掘算法而建构的。建构一个真正适合采掘算法的分析模型是数据采掘成功的关键。模型的建构必须从数据的分析开始。接着,从原始资料中建构新的预示值。下一步,就需要从数据中选取一个子集或样本来建构模型。最后,需要转换变量,使之和选定用来建构模型的算法一致。
资料采掘对所得到的经过转化的数据采掘,除了完善与选择合适的算法需要人工干预之外,数据采掘工作主要由采掘工具自动完成。
结果分析当数据采掘出现结果之后,需要对采掘结果作解读与评估。具体的解读与评估方法一般应根据资料采掘操作结果所制定的决策成败来决定。知识的应用数据采掘结果要能够在实际中得到应用,需要将分析所得到的知识整合到组织机构中去使这些知识在实际的管理决策分析中得到应用。
1.6.3资料采掘的客户
如果从数据采掘的程序看,不同的数据采掘程序需要不同专长的人员,大致为:业务分析人员、资料分析人员和数据管理人员。业务分析人员或称其为企业管理顾问。资料分析人员。要求这些人员精通资料采掘分析技术。数据管理人员。这些人员需要精通数据管理技术。
1.7数据仓储应用
1.7.1数据仓储与数据采掘
信息处理、分析处理和数据采掘是三种主要的数据仓储应用。信息处理支持查询和基本的统计分析,并使用交叉分析表、列表、图表或图形报告结果。
在线分析处理支持基本的OLAP操作,包括切片、切块、下钻、上卷和转轴。资料采掘支持知识发现,找出隐藏的模式和关联,建构分析模型,进行分类和预测,并用可视化工具提供采掘结果。
1.7.2数据采掘和数据仓储的关系
数据采掘库是数据仓储的一个逻辑上的子集,而不一定是实体上单独的数据库。
数据采掘是一个相对独立的系统,可以独立于数据仓储存在。数据仓储为数据采掘打下了良好的基础,包括数据萃取、数据净化整理、数据一致性处理等。
1.8数据仓储导向的决策支持系统在线分析处理工具(OLAP)
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 中医院消防安全评估报告
- 2026事业单位工勤技能-江苏-江苏理疗技术员四级(中级工)历年参考题库含答案详解3套试卷
- 2026事业单位工勤技能-江苏-江苏工程测量员二级(技师)历年参考题库含答案详解3套试卷
- 2026事业单位工勤技能-新疆-新疆水利机械运行维护工二级(技师)历年参考题库含答案详解3套试卷
- 未来职业规划书模板
- 2026年秋季开学高三坚持到底晨会讲话课件
- 2026年秋季开学高中一年级新生军训纪律意识课件
- 2026年秋季开学初中一年级新生军训征兵宣传课件
- 2026年上海医院品牌宣传专员招聘考试练习试卷【含答案】
- 2025年八年级历史期末中国古代史综合测试卷:古代宗教信仰与宗教政策
- 2026年陆军战士留疆任职考试真题(附答案)
- 《韦氏智力量表第四版(wais-iv)中文版指导手册》
- 配送企业员工工作制度
- 上海申能集团有限公司招聘笔试题库2026
- 新课堂、新课堂、新高考++2025年版《普通高中语文课程标准》解读
- 2026年高考物理二轮复习(全国)专题01 力与物体的平衡(专练)(原卷版)
- 结构化面试技巧课件
- 药物中毒安全课件
- 直营商品管理流程制度
- 2025年海南省事业单位招聘考试《公共基础知识》真题及答案
- (2025年)望江县中小学教师招聘真题含答案
评论
0/150
提交评论