版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
数据仓库和数据挖掘的OLAP技术数据仓库和数据挖掘的OLAP技术什么是数据仓库?多维数据模型数据仓库的体系结构数据仓库实现数据立方体技术的进一步发展从数据仓库到数据挖掘什么是数据仓库?数据仓库的定义很多,但却很难有一种严格的定义它是一个提供决策支持功能的数据库,它与公司的操作数据库分开维护。为统一的历史数据分析提供坚实的平台,对信息处理提供支持“数据仓库是一个面向主题的、集成的、随时间而变化的、不容易丢失的数据集合,支持管理部门的决策过程.”—W.H.Inmon(数据仓库构造方面的领头设计师)建立数据仓库(datawarehousing):构造和使用数据仓库的过程。数据仓库关键特征一——面向主题围绕一些主题,如顾客、供应商、产品等关注决策者的数据建模与分析,而不是集中于组织机构的日常操作和事务处理。排除对于决策无用的数据,提供特定主题的简明视图。数据仓库关键特征二——数据集成一个数据仓库是通过集成多个异种数据源来构造的。关系数据库,一般文件,联机事务处理记录使用数据清理和数据集成技术。确保命名约定、编码结构、属性度量等的一致性。当数据被移到数据仓库时,它们要经过转化。数据仓库关键特征三——随时间而变化数据仓库的时间范围比操作数据库系统要长的多。操作数据库系统:主要保存当前数据。数据仓库:从历史的角度提供信息(比如过去5-10年)数据仓库中的每一个关键结构都隐式或显式地包含时间元素,而操作数据库中的关键结构可能就不包括时间元素。数据仓库关键特征四——数据不易丢失尽管数据仓库中的数据来自于操作数据库,但他们却是在物理上分离保存的。操作数据库的更新操作不会出现在数据仓库环境下。不需要事务处理,恢复,和并发控制等机制只需要两种数据访问:数据的初始转载和数据访问(读操作)数据仓库与异种数据库集成传统的异种数据库集成:在多个异种数据库上建立包装程序(wrappers)和中介程序(mediators)查询驱动方法——当从客户端传过来一个查询时,首先使用元数据字典将查询转换成相应异种数据库上的查询;然后,将这些查询映射和发送到局部查询处理器缺点:复杂的信息过虑和集成处理,竞争资源数据仓库:更新驱动将来自多个异种源的信息预先集成,并存储在数据仓库中,供直接查询和分析高性能数据仓库与操作数据库系统操作数据库系统的主要任务是联机事务处理OLTP日常操作:购买,库存,银行,制造,工资,注册,记帐等数据仓库的主要任务是联机分析处理OLAP数据分析和决策OLTP和OLAP的主要区别:用户和系统的面向性:顾客VS.市场数据内容:当前的、详细的数据VS.历史的、汇总的数据数据库设计:实体-联系模型(ER)和面向应用的数据库设计VS.星型/雪花模型和面向主题的数据库设计视图:当前的、企业内部的数据VS.经过演化的、集成的数据访问模式:事务操作VS.只读查询(但很多是复杂的查询)OLTP系统和OLAP系统的比较特征OLTPOLAP任务特点操作处理信息处理面向事务分析用户办事员、DBA、数据库专业人员经理、主管、数据分析员功能日常操作长期信息分析、决策支持DB设计基于E-R,面向应用星型/雪花,面向主体数据最新的、详细的历史的、汇总的视图详细的、二维关系型汇总的、多维的任务单位简短的事务复杂的查询访问数据量数十个数百万个用户数数千个数百个DB规模100M-数GB100GB-数TB优先性高性能、高可用性高灵活性、端点用户自治度量事务吞吐量查询吞吐量、响应时间为什么么需要要一个个分离离的数数据仓仓库?提高两两个系系统的的性能能DBMS是为OLTP而设计计的::存储储方式式,索引,并发控控制,恢复数据仓仓库是是为OLAP而设计计:复复杂的的OLAP查询,多维视视图,,汇总总不同的的功能能和不不同的的数据据:历史数数据:决策支支持需需要历历史数数据,,而这这些数数据在在操作作数据据库中中一般般不会会去维维护数据汇汇总::决策策支持持需要要将来来自异异种源源的数数据统统一((如聚聚集和和汇总总)数据质质量:不同的的源使使用不不一致致的数数据表表示、、编码码和格格式,,对这这些数数据进进行有有效的的分析析需要要将他他们转转化后后进行行集成成从关系系表和和电子子表格格到数数据立立方体体数据仓仓库和和数据据仓库库技术术基于于多维数数据模模型。这个个模型型把数数据看看作是是数据立立方体体形式。。多维维数据据模型型围绕绕中心心主题题组织织,该该主题题用事实表表表示。。事实是数值值度量量的。。数据立立方体体允许以以多维维数据据建模模和观观察。。它由由维和事实定义。。维是关于于一个个组织织想要要记录录的视视角或或观点点。每每个维维都有有一个个表与与之相相关联联,称称为维表。事实表表包括事事实的的名称称或度度量以以及每每个相相关维维表的的关键键字在数据据仓库库的研研究文文献中中,一一个n维的数数据的的立方方体叫叫做基本方方体。给定定一个个维的的集合合,我我们可可以构构造一一个方体的的格,每个个都在在不同同的汇汇总级级或不不同的的数据据子集集显示示数据据,方方体的的格称称为数据立立方体体。0维方体体存放放最高高层的的汇总总,称称作顶点方方体;而存存放最最底层层汇总总的方方体则则称为为基本方方体。教科书书第31页数据立立方体体——一个方方体的的格alltimeitemlocationsuppliertime,itemtime,locationtime,supplieritem,locationitem,supplierlocation,suppliertime,item,locationtime,item,suppliertime,location,supplieritem,location,suppliertime,item,location,supplier0-D(apex)cuboid1-Dcuboids2-Dcuboids3-Dcuboids4-D(base)cuboid数据仓仓库的的概念念模型型最流行行的数数据仓仓库概概念模模型是是多维维数据据模型型。这这种模模型可可以以以星型型模式式、雪雪花模模式、、或事事实星星座模模式的的形式式存在在。星型模模式((Starschema):事实表表在中中心,,周围围围绕绕地连连接着着维表表(每每维一一个)),事事实表表含有有大量量数据据,没没有冗冗余。。雪花模模式((Snowflakeschema):是星型型模式式的变变种,,其中中某些些维表表是规规范化化的,,因而而把数数据进进一步步分解解到附附加表表中。。结果果,模模式图图形成成类似似于雪雪花的的形状状。事实星星座((Factconstellations):多个事事实表表共享享维表表,这种模模式可可以看看作星星型模模式集集,因因此称称为星星系模模式((galaxyschema),或或者事事实星星座((factconstellation)星型模模式实实例time_keydayday_of_the_weekmonthquarteryeartimelocation_keystreetcitystate_or_provincecountrylocationSalesFactTabletime_keyitem_keybranch_keylocation_keyunits_solddollars_soldavg_salesMeasuresitem_keyitem_namebrandtypesupplier_typeitembranch_keybranch_namebranch_typebranch雪花模模式实实例time_keydayday_of_the_weekmonthquarteryeartimelocation_keystreetcity_keylocationSalesFactTabletime_keyitem_keybranch_keylocation_keyunits_solddollars_soldavg_salesMeasuresitem_keyitem_namebrandtypesupplier_keyitembranch_keybranch_namebranch_typebranchsupplier_keysupplier_typesuppliercity_keycitystate_or_provincecountrycity事实星座模模式实例time_keydayday_of_the_weekmonthquarteryeartimelocation_keystreetcityprovince_or_statecountrylocationSalesFactTabletime_keyitem_keybranch_keylocation_keyunits_solddollars_soldavg_salesMeasuresitem_keyitem_namebrandtypesupplier_typeitembranch_keybranch_namebranch_typebranchShippingFactTabletime_keyitem_keyshipper_keyfrom_locationto_locationdollars_costunits_shippedshipper_keyshipper_namelocation_keyshipper_typeshipper一种数据挖挖掘查询语语言:DMQLDMQL首先包括括定义数数据仓库库和数据据集市的的语言原原语,这这包括两两种原语语定义::一种是是立方体体定义,,一种是是维定义义立方体定定义(事实表)definecube<cube_name>[<dimension_list>]:<measure_list>维定义(维表)definedimension<dimension_name>as(<attribute_or_subdimension_list>)特殊案例例(共享维表表的定义义)第一次作作为维表表定义“cubedefinition”然后:definedimension<dimension_name>as<dimension_name_first_time>incube<cube_name_first_time>实例:使使用DMQL定义星型型模式definecubesales_star[time,item,branch,location]:dollars_sold=sum(sales_in_dollars),avg_sales=avg(sales_in_dollars),units_sold=count(*)definedimensiontimeas(time_key,day,day_of_week,month,quarter,year)definedimensionitemas(item_key,item_name,brand,type,supplier_type)definedimensionbranchas(branch_key,branch_name,branch_type)definedimensionlocationas(location_key,street,city,province_or_state,country)实例:使用DMQL定义雪花模式式definecubesales_snowflake[time,item,branch,location]:dollars_sold=sum(sales_in_dollars),avg_sales=avg(sales_in_dollars),units_sold=count(*)definedimensiontimeas(time_key,day,day_of_week,month,quarter,year)definedimensionitemas(item_key,item_name,brand,type,supplier(supplier_key,supplier_type))definedimensionbranchas(branch_key,branch_name,branch_type)definedimensionlocationas(location_key,street,city(city_key,province_or_state,country))度量量的的分分类类一个个数数据据立立方方体体的的度度量量是是一一个个数数值值函函数数,,该该函函数数可可以以对对数数据据立立方方体体的的每每一一个个点点求求值值。。度度量量可可以以根根据据其其所所用用的的聚聚集集函函数数分分为为三三类类::分布布的的(distributive):将将函函数数用用于于n个聚聚集集值值得得到到的的结结果果和和将将函函数数用用于于所所有有数数据据得得到到的的结结果果一一样样。。比如如::count(),sum(),min(),max()等代数数的的(algebraic):函函数数可可以以由由一一个个带带M个参参数数的的代代数数函函数数计计算算((M为有有界界整整数数)),,而而每每个个参参数数值值都都可可以以有有一一个个分分布布的的聚聚集集函函数数求求得得。。比如如::avg(),min_N(),standard_deviation()整体体的的(holistic):描描述述函函数数的的子子聚聚集集所所需需的的存存储储没没有有一一个个常常数数界界。。比如如::median(),mode(),rank()概念念分分层层::location维的的一一个个概概念念分分层层allEuropeNorth_AmericaMexicoCanadaSpainGermanyVancouverM.WindL.Chan..................allregionofficecountryTorontoFrankfurtcity多维维数数据据模模型型上上的的OLAP操作作上卷卷(roll-up):汇总总数数据据通过过一一个个维维的的概概念念分分层层向向上上攀攀升升或或者者通通过过维维规规约约下钻钻(drill-down):上上卷卷的的逆逆操操作作由不不太太详详细细的的数数据据到到更更详详细细的的数数据据,,可可以以通通过过沿沿维维的的概概念念分分层层向向下下或或引引入入新新的的维维来来实实现现切片和和切块块(sliceanddice)投影和和选择择操作作转轴(pivot)立方体体的重重定位位,可可视化化,或或将一一个3维立方方体转转化维维一个个2维平面面序列列其他OLAP操作钻过(drill_across):执行行涉及及多个个事实实表的的查询询钻透(drill_through):使用用关系系SQL机制,,钻到到数据据立方方体的的底层层,到到后端端关系系表数据仓仓库设设计::一个个商务务分析析框架架数据仓仓库设设计中中必须须考虑虑的四四种视视图自顶向向下视视图允许我我们选选择数数据仓仓库所所需的的相关关信息息,这这些信信息能能够满满足当当前和和未来来商务务的需需求。。数据源源视图图揭示被被操作作数据据库系系统所所捕获获、存存储和和管理理的信信息数据仓仓库视视图有事实实表和和维表表所组组成,,提供供存放放在数数据仓仓库内内部的的信息息,包包括预预先计计算的的综合合与技技术,,以及及关于于源、、日期期和源源时间间等信信息商务查查询视视图从最终终用户户的角角度透透视数数据仓仓库中中的数数据数据仓仓库的的设计计过程程(P43)自顶向向下法法、自自底向向上法法或者者两者者的混混合方方法自顶向向下法法:由由总体体设计计和规规划开开始((成熟熟)自底向向上法法:以以实验验和原原型开开始((快速速)从软件件过程程的观观点瀑布式式方法法:在在进行行下一一步前前,每每一步步都进进行结结构化化和系系统的的分析析螺旋式式方法法:功功能渐渐增的的系统统的快快速产产生,,相继继版本本之间间间隔隔很短短典型的的数据据仓库库设计计过程程选取待待建模模的商务过过程选取商商务过过程的的粒度选取用用于每每个事事实表表记录录的维选取将将安放放在事事实表表中的的度量三层数数据仓仓库架架构DataWarehouseExtractTransformLoadRefreshOLAP服务器器AnalysisQueryReportsDataminingMonitor&IntegratorMetadata数据源源前端工工具ServeDataMartsOperational
DBsothersources数据仓仓库服服务器器OLAPServer三种数数据仓仓库模模型((从结结构的的角度度)企业仓仓库搜集关关于跨跨越整整个组组织的的主题题的所所有信信息,,来自自一个个或多多个操操作的的系统统,跨跨功能能的。。数据集集市企业范范围数数据的的一个个子集集,对对于特特定的的客户户是有有用的的。其其范围围限于于选定定的主主题,,比如如一个个商场场的数数据集集市独立的的数据据集市市VS.非独立立的数数据集集市((数据据来自自于企企业数数据仓仓库))虚拟仓仓库操作数数据库库上的的一系系列视视图只有一一些可可能的的汇总总视图图被物物化数据仓仓库开开发自顶向向下开开发::一种种系统统的而而解决决方法法,并并能最最大限限度地地减少少集成成问题题。但但费用用高,,长时时间开开发,,缺乏乏灵活活性,,因为为整个个组织织的共共同数数据模模型达达到一一致是是困难难的。。自底向向上:设计、、开发发、部部署独独立的的数据据集市市方法法提供供了灵灵活性性、低低花费费,并并能快快速回回报投投资。。然后后,将将分散散的数数据集集市集集成,,形成成一个个一致致的企企业数数据仓仓库时时,可可能导导致问问题。。数据仓仓库开开发——一个推推荐的的方法法定义高高层数数据模模型数据集市市数据集市市分布式数数据集市市多层数据据仓库企业数据据仓库模型提炼炼模型提炼炼OLAP服务器类类型关系OLAP服务器(ROLAP)使用关系系数据库库或扩展展的关系系数据库库存放并并管理数数据仓库库的数据据,而用用OLAP中间件支支持其余余部分包括每个个DBMS后端优化化,聚集集导航逻逻辑的实实现,附附加的工工具和服服务较大的可可扩展性性多维OLAP服务器(MOLAP)基于数组组的多维维存储引引擎(稀稀疏矩阵阵技术))能对预计计算的汇汇总数据据快速索索引混合OLAP服务器(HOLAP)结合上述述两种技技术,更更大的使使用灵活活性特殊的SQL服务器在星型和和雪花模模型上支支持SQL查询数据仓库库的实现现难点海量数据据快速反应应OLAP服务器要要在几秒秒内响应应决策支支持查询询方法高效的数数据立方方体计算算技术高效的存存取方法法高效的查查询处理理技术数据立方方体的有有效计算算数据立方方体可以以被看成成是一个个方体的格格最底层的的方体是是基本方方体最顶端的的方体((顶点))只包含含一个单单元的值值一个n维的数据据立方体体,每维维Li层,可能能产生的的方体总总数是多多少?数据立方方体的物化(materialization)预先计算算所有方方体(全物化):需要海量量存储空空间,存存放预先先计算的的方体不预先计计算任何何“非基基本”方方体(不物化),在运运行时计计算昂贵贵的多维维聚集,,可能很很慢有选择的的计算一一个所有有方体的的适当子子集(部分物化化):相应应时间和和存储空空间的折折中。确定物化化哪些方方体考虑工作作负荷下下的查询询、它们们的频率率和它们们的开销销等等方体的操操作DMQL中的方体体定义和和计算definecubesales[item,city,year]:sum(sales_in_dollars)computecubesales上述的computecube子句可以以转化为为一个类类似于SQL的语句SELECTitem,city,year,SUM(amount)FROMSALESCUBEBYitem,city,year需要计算算以下的的groupby子句(item,city,year)(item,city),(itemyear),(city,year)(item),(city),(year)()(item)(city)()(year)(city,item)(city,year)(item,year)(city,item,year)方体计算算:关系系型OLAP的方法(ROLAP)方体计算的有有效方法基于ROLAP的方体算法(Agarwaletal’96)基于数组的算算法(MOLAP)(Zhaoetal’97)自底向上的计计算方法(Beyer&Ramarkrishnan’99)H-cubing技术(Han,Pei,Dong&Wang:SIGMOD’01)基于ROLAP的方法将排序、散列列(hashing)和分组操作应应用于维的属属性,以便对对相关元组重重新排序和聚聚类在某些子聚集集上分组,作作为“部分分分组步骤”。。可以由以前计计算的聚集计计算新的聚集集,而不必有有基本事实表表计算方体计算的多多路数组聚集集方法(1)将数组分成块块(chunk,一个可以装入入内存的小子子方)压缩的稀疏数数组寻址:(chunk_id,offset)通过访问立方方体单元,计计算聚集。可可以优化访问问单元组的次次序,使得每每个单元被访访问的次数最最小化,从而而减少内存访访问和磁盘I/O的开销。A(month)B29303132123459131415166463626148474645a1a0c3c2c1c0b3b2b1b0a2a3C(item)B(city)442856402452362060哪个是多路数数组聚集的最最佳遍历次序序?方体计算的多多路数组聚集集方法(2)A(month)40B29303132123459131415166463626148474645a1a0c3c2c1c0b3b2b1b0a2a3C(item)4000442856402452362060B(city)400方体计算的多多路数组聚集集方法(3)AB29303132123459131415166463626148474645a1a0c3c2c1c0b3b2b1b0a2a3C442856402452362060B方体计算的的多路数组组聚集方法法(4)方法:各平平面要按他他们大小的的升序排列列进行排序序和计算详见书P50例2.12思想:将最最小的平面面放在内存存中,对最最大的平面面每次只是是取并计算算一块这种方法的的限制:只只有在维数数比较小的的情况下,,效果才比比较理想(要计算的立立方体随维维数指数增增长)如果维的数数目比较多多,可以考考虑使用““自底向上上的计算””或者时““冰山方体体”计算算元数据存储储在数据仓库库中,元数数据就是定定义数据仓仓库对象的的数据。关关于数据的的数据。有有以下几种种:数据仓库结结构的描述述仓库模式、、视图、维维、层次结结构、导出出数据的定定义,以及及数据集市市的位置和和内容操作元数据据包括数据血血统(datalineage)、数据类别别(currencyofdata),以及监视视信息汇总用的算算法:包括度量和和维定义算算法,数据据粒度、分分割、主题题领域、聚聚集、汇总总、预定义义的查询和和报告由操作环境境到数据仓仓库的映射射:数据提取、、清理、转转换规则、、剪裁规则则、安全等等关于系统性性能的数据据索引,profiles,数据刷新新、更新或或复制事件件的调度和和定时商务元数据据商务术语和和定义、数数据拥有者者信息、收收费政策等等元数据的使使用元数据与数数据一起,,构成了数数据仓库中中的数据模模型,元数数据所描述述的更多的的是这个模模型的结构构方面的信信息。在数据仓库库中,元数数据的主要要用途包括括:用作目录,,帮助决策策支持系统统分析者对对数据仓库库的内容定定义作为数据仓仓库和操作作性数据库库之间进行行数据转换换时的映射射标准用于指导当当前细节数数据和稍加加综合的数数据之间的的汇总算法法,指导稍稍加综合的的数据和高高度综合的的数据之间间的汇总算算法。数据仓库后后端工具和和使用程序序用于加载和和刷新它的的数据数据提取::从多个外部部的异构数数据源收集集数据数据清理检测数据种种的错误并并作可能的的订正数据变换将数据由历历史或主机机的格式转转化为数据据仓库的格格式装载载排序序、、汇汇总总、、合合并并、、计计算算视视图图,,检检查查完完整整性性,,并并建建立立索索引引和和分分区区刷新新将数数据据源源的的更更新新传传播播到到数数据据仓仓库库中中数据据仓仓库库的的应应用用数据据仓仓库库的的三三种种应应用用信息息处处理理支持持查查询询和和基基本本的的统统计计分分析析,,并并使使用用交交叉叉表表、、表表、、图图标标和和图图进进行行报报表表处处理理分析析处处理理对数数据据仓仓库库中中的的数数据据进进行行多多维维数数据据分分析析支持持基基本本的的OLAP操作作,,切切块块、、切切片片、、上上卷卷、、下下钻钻、、转转轴轴等等数据据挖挖掘掘从隐隐藏藏模模式式中中发发现现知知识识支持持关关联联分分析析,,构构建建分分析析性性模模型型,,分分类类和和预预测测,,并并用用可可视视化化工工具具呈呈现现挖挖掘掘的的结结果果三种种应应用用间间的的差差别别((P62)从联机分分析处理理到联机机分析挖挖掘为什么要要联机分分析挖掘掘(P63)数据仓库库中有高高质量的的数据数据仓库库中存放放着整合合的、一一致的、、清理过过的数据据围绕数据据仓库的的信息处处理结构构存取、集集成、合合并多个个异种数数据库的的转换,,ODBC/OLEDB连接,Web访问和和访问问工具具等基于OLAP的探测测式数数据分分析使用上上卷、、下钻钻、切切片、、转轴轴等技技术进进行数数据挖挖掘数据挖挖掘功功能的的联机机选择择多种数数据挖挖掘功功能、、算法法和任任务的的整合合联机分分析挖挖掘的的体系系结构构数据仓仓库元数据据多维数数据库库OLAM引擎OLAP引擎用户图图形界界面API数据方方体API数据库库API数据清清理数据集集成Layer3OLAP/OLAMLayer2多维数数据库库Layer1数据存存储Layer4用户界界面数据的的过滤滤、集集成过滤数据库库基于约约束的的数据据挖掘掘挖掘结果数据预处理理主要内容为什么要预预处理数据据?数据清理数据集成和和变换数据归约约为什么要要预处理理数据??现实世界界的数据据是“肮肮脏的””不完整的的:有些些感兴趣趣的属性性缺少属属性值,,或仅包包含聚集集数据含噪声的的:包含含错误或或者“孤孤立点””不一致的的:在编编码或者者命名上上存在差差异没有高质质量的数数据,就就没有高高质量的的挖掘结结果高质量的的决策必必须依赖赖高质量量的数据据数据仓库库需要对对高质量量的数据据进行一一致地集集成数据质量量的多维维度量一个广为为认可的的多维度度量观点点:精确度完整度一致性合乎时机机可信度附加价值值可访问性性跟数据本本身的含含义相关关的内在的、、上下文文的、表表象的数据预处处理的主主要任务务数据清理理填写空缺缺的值,,平滑噪噪声数据据,识别别、删除除孤立点点,解决决不一致致性数据集成成集成多个个数据库库、数据据立方体体或文件件数据变换换规范化和和聚集数据归约约得到数据据集的压压缩表示示,它小小得多,,但可以以得到相相同或相相近的结结果数据离散散化数据归约约的一部部分,通通过概念念分层和和数据的的离散化化来规约约数据,,对数字字型数据据特别重重要数据预处处理的形形式空缺值数据并不不总是完完整的例如:数数据库表表中,很很多条记记录的对对应字段段没有相相应值,,比如销销售表中中的顾客客收入引起空缺缺值的原原因设备异常常与其他已已有数据据不一致致而被删删除因为误解解而没有有被输入入的数据据在输入时时,有些些数据应应为得不不到重视视而没有有被输入入对数据的的改变没没有进行行日志记记载空缺值要要经过推推断而补补上如何处理理空缺值值忽略元组:当当类标号缺少少时通常这么么做(假定挖挖掘任务设计计分类或描述述),当每个个属性缺少值值的百分比变变化很大时,,它的效果非非常差。人工填写空缺缺值:工作量量大,可行性性低使用一个全局局变量填充空空缺值:比如如使用unknown或-∞使用属性的平平均值填充空空缺值使用与给定元元组属同一类类的所有样本本的平均值使用最可能的的值填充空缺缺值:使用像像Bayesian公式或判定树树这样的基于于推断的方法法噪声数据噪声:一个测测量变量中的的随机错误或或偏差引起不正确属属性值的原因因数据收收集工工具的的问题题数据输输入错错误数据传传输错错误技术限限制命名规规则的的不一一致其它需需要数数据清清理的的数据据问题题重复记记录不完整整的数数据不一致致的数数据如何处处理噪噪声数数据分箱(binning):首先排排序数数据,,并将将他们们分到到等深深的箱箱中然后可可以按按箱的的平均均值平平滑、、按箱箱中值值平滑滑、按按箱的的边界界平滑滑等等等聚类类::监测测并并且且去去除除孤孤立立点点计算算机机和和人人工工检检查查结结合合计算算机机检检测测可可疑疑数数据据,,然然后后对对它它们们进进行行人人工工判判断断回归通过让数数据适应应回归函函数来平平滑数据据数据平滑滑的分箱箱方法price的排序后后数据((单位::美元)):4,8,15,21,21,24,25,28,34划分为((等深的的)箱::箱1:4,8,15箱2:21,21,24箱3:25,28,34用箱平均均值平滑滑:箱1:9,9,9箱2:22,22,22箱3:29,29,29用箱边界界平滑::箱1:4,4,15箱2:21,21,24箱3:25,25,34聚类回归xyy=x+1X1Y1Y1’数据集成成数据集成::将多个数据据源中的数数据整合到到一个一致致的存储中中模式集成::整合不同数数据源中的的元数据实体识别问问题:匹配配来自不同同数据源的的现实世界界的实体,,比如:A.cust-id=B.customer_no检测并解决决数据值的的冲突对现实世界界中的同一一实体,来来自不同数数据源的属属性值可能能是不同的的可能的原因因:不同的的数据表示示,不同的的度量等等等处理数据集集成中的冗冗余数据集成多个数数据库时,,经常会出出现冗余数数据同一属性在在不同的数数据库中会会有不同的的字段名一个属性可可以由另外外一个表导导出,如““年薪”有些冗余可可以被相关关分析检测测到仔细将多个个数据源中中的数据集集成起来,,能够减少少或避免结结果数据中中的冗余与与不一致性性,从而可可以提高挖挖掘的速度度和质量。。数据变换平滑:去除除数据中的的噪声聚集:汇总总,数据立立方体的构构建数据概化::沿概念分分层向上汇汇总规范化:将将数据按比比例缩放,,使之落入入一个小的的特定区间间最小-最大大规范化z-score规范化小数定标规规范化属性构造通过现有属属性构造新新的属性,,并添加到到属性集中中。数据变换——规范化最小-最大大规范化z-score规范化小数定标规规范化其中,j是使Max(||)<1的最小整数数数据归约策策略数据仓库中中往往存有有海量数据据,在其上上进行复杂杂的数据分分析与挖掘掘需要很长长的时间数据归约数据归约可可以用来得得到数据集集的归约表表示,它小小得多,但但可以产生生相同的((或几乎相相同的)分分析结果数据归约策策略数据立方体体聚集维归约数据压缩数值归约离散化和概概念分层产产生用于数据归归约的时间间不应当超超过或“抵抵消”在归归约后的数数据上挖掘掘节省的时时间。数据立方体体聚集最底层的方方体对应于于基本方体体基本方体对对应于感兴兴趣的实体体在数据立方方体中存在在着不同级级别的汇总总数据立方体体可以看成成方体的格格每个较高层层次的抽象象将进一步步减少结果果数据数据立方体体提供了对对预计算的的汇总数据据的快速访访问使用与给定定任务相关关的最小方方体在可能的情情况下,对对于汇总数数据的查询询应当使用用数据立方方体维归约通过删除不不相干的属属性或维减减少数据量量属性子集选选择找出最小属属性集,使使得数据类类的概率分分布尽可能能的接近使使用所有属属性的原分分布减少出现在在发现模式式上的属性性的数目,,使得模式式更易于理理解启发式的((探索性的的)方法逐步向前选选择逐步向后删删除向前选择和和向后删除除相结合判定归纳树树探索性选择方方法d个属性有2d个可能的子集集逐步向前选择择由空属性集开开始,选择原原属性集中最最好的属性,,并将其添加加入该集合,,重复该步骤骤。逐步向后删除除由整个属性集集开始,每一一步都删除掉掉尚在属性集集中的最坏属属性向前选择和向向后删除相结结合每一步选择一一个最好属性性,并删除一一个最坏属性性可以使用一个个临界值来判判定上述三种种方法的结束束条件判定归纳树数据压缩有损压缩VS.无损压缩字符串压缩有广泛的理论论基础和精妙妙的算法通常是无损压压缩在解压缩前对对字符串的操操作非常有限限音频/视频压缩通常是有损压压缩,压缩精精度可以递进进选择有时可以在不不解压整体数数据的情况下下,重构某个个片断两种有损数据据压缩的方法法:小波变换换和主要成分分分析数值归约通过选择替代代的、较小的的数据表示形形式来减少数数据量有参方法:使使用一个参数数模型估计数数据,最后只只要存储参数数即可。线性回归方法法:Y=α+βX多元回归:线线性回归的扩扩充对数线性模型型:近似离散散的多维数据据概率分布无参方法:直方图聚类选样直方图一种流行的数数据归约技术术将某属性的数数据划分为不不相交的子集集,或桶,桶桶中放置该值值的出现频率率桶和属性值的的划分规则等宽等深V-最优MaxDiff聚类将数据集划分分为聚类,然然后通过聚类类来表示数据据集如果数据可以以组成各种不不同的聚类,,则该技术非非常有效,反反之如果数据据界线模糊,,则方法无效效数据可以分层层聚类,并被被存储在多层层索引树中聚类的定义和和算法都有很很多选择选样允许用数据的的较小随机样样本(子集))表示大的数数据集对数据集D的样本选择::简单随机选择择n个样本,不回回放:由D的N个元组中抽取取n个样本简单随机选择择n个样本,回放放:过程同上上,只是元组组被抽取后,,将被回放,,可能再次被被抽取聚类选样:D中元组被分入入M个互不相交的的聚类中,可可在其中的m个聚类上进行行简单随机选选择(m<M)分层选样:D被划分为互不不相交的“层层”,则可通通过对每一层层的简单随机机选样得到D的分层选样离散化三种类型的属属性值:名称型——e.g.无序集合中的的值序数——e.g.有序集合中的的值连续值——e.g.实数离散化将连续属性的的范围划分为为区间有效的规约数数据基于判定树的的分类挖掘基于判定树的的分类挖掘的的大部分时间间花在数据的的分类和比较较上(比如一一个判定条件件为:>400?,0-1000的整数将在比比较1000次后得出结果果,但是如果果先将这1000个值划分为10个区间:0-100,100-200…900-1000,则只要比较较10次就可以得出出结果)离散化的数值值用于进一步步分析离散化和概念念分层离散化通过将属性域域划分为区间间,减少给定定连续属性值值的个数。区区间的标号可可以代替实际际的数据值。。概念分层通过使用高层层的概念(比比如:青年、、中年、老年年)来替代底底层的属性值值(比如:实实际的年龄数数据值)来规规约数据概念念分分层层后后,,数数据据的的细细节节丢丢失失了了,,但但是是概概化化后后的的数数据据更更有有意意义义
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年生成式人工智能办公应用课件
- 2026年秋季开学幼儿园小班:我长大了我能行课件
- 供配电系统的负荷分析
- 2026 年月圆思亲弘扬中华亲情文化课件
- 2026 年全球携手合作共迎时代挑战课件
- 2026 年保护耕地守护百姓饭碗课件
- 骨科医院2026年护理管理者年度护理综合能力测试试题及答案
- 金属文物修复师安全宣传强化考核试卷含答案
- 贵金属首饰检验员道德竞赛考核试卷含答案
- 2025年石狮市三下数学期末达标检测模拟试题含答案
- 2025年全国普通高校招生全国统一考试数学试卷(新高考Ⅰ卷)含答案
- 贵州省2024年12月普通高中学业水平合格性考试 数学试卷
- GB/T 19973.2-2025医疗产品灭菌微生物学方法第2部分:用于灭菌过程的定义、确认和维护的无菌试验
- JJF(津)118-2024 分布式光纤振动传感系统计量校准规范
- DB11T 211-2017 园林绿化用植物材料 木本苗
- Chapter-1工程英语翻译概述
- 2024年大学生创新创业训练计划流程
- 江堤绿化养护投标方案(技术方案)
- 新教师如何备课课件
- 民航服务心理学高职PPT完整全套教学课件
- “千名医师下基层”对口支援活动工作鉴定表
评论
0/150
提交评论