版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第三章
数据采集与数据预处理大数据概论及应用实践IntroductiontoBigDataandApplicationPractice第3章
数据采集与数据预处理随着云计算、大数据、人工智能、物联网、5G移动通信等新一代信息技术的发展和应用,产生了海量的数据。这些数据增长速度迅速,来源广泛,类型多样,且有时效性,如通过网站、政务系统、办公系统、微博等应用系统收集的数据,抖音小视频、快手、视频号等收集的音频视频数据,监控摄像头,传感器等技术收集的图像,微信、Email、购物网站等收集的文本、日志相关的数据。对于这些来源广泛且类型多样的数据,数据缺失、数据重复、语义模糊等问题是不可避免的,通常是无法直接使用,实现数据的最大价值,这就必须要采取相应的措施解决这些问题,通过对数据做必要的清洗、集成、转换等被称之为“数据预处理”的过程,是对数据进行分析的第一步,也是为后续的数据挖掘和分析的奠定良好基础。概述3.1数据采集3.2数据预处理3.3拓展实训3.4目录CONTENTS本章小结3.5习题3.6
数据采集(DataAcquisition,DAQ)也称为数据获取或数据收集,是指利用不同的设备和技术通过一系列的流程自动采集数据,并传到存储空间中进行分析、处理的过程。概
述PART013.1
概述在大数据时代,数据的价值在各个行业的推广和应用过程中已经充分显现,数据也成为至关重要的资产。如何有效的获取这些规模巨大、产生速度迅速、类型多的数据,即数据采集,是进行数据挖掘和分析的重要前提。数据采集(DataAcquisition,DAQ)也称为数据获取或数据收集,是指利用不同的设备和技术通过一系列的流程自动采集数据,并传到存储空间中进行分析、处理的过程。在很多情况下,即使采集的数据得到了有效的集成,也难以直接使用,主要有两大原因,一是数据源数据的单位、类型、格式和应用要求等难以统一;二是在数据采集、传输、集成等一系列的步骤中难免产生错误。因此,在应用之前,需要对数据进行预处理,可以通过数据清洗、类型转换、数据脱敏等操作,达到数据完整性、一致性、有效性的管理。
本节主要介绍数据采集的概念、数据采集的原则、数据采集的数据来源和数据采集的方法。数据采集PART023.2.1
数据采集的概述数据采集,是大数据分析的前奏,是数据价值挖掘和分析的重要一环,数据价值的挖掘和分析都是建立在数据采集的基础之上。不同的数据类型在采集时既有联系又有区别,如表3-1所示。3.2.2数据采集的原则数据采集的原则如下:大。数据量越大其分析的价值就越大。数据量越大,越能提供准确的统计结果,减少数据量少引起的偏差,从而帮助人们发现更多的趋势和模式,提高预测和预测精度,从而能够该晒决策和规划,为进一步的决策提供有利的基础数据支撑。全。数据信息的缺失、不全面很可能导致不能得出正确的结果。比如对某本书籍销量的分析,我们尽可能地收集信息,比如那些人群购买的,通过什么渠道购买的,所属地区等多种类型的信息,足够多的数据面来支撑分析需求,能够精准的获某一类型的信息,能够进行精准分析,制定进一步的营销策略。3.2.2数据采集的原则数据采集的原则如下:细。数据更重要的是能满足分析需求,收集充分全面的属性、维度、指标,使存储的数据更高质量,最终实现直通、高效的数据分析。准。只有正确的信息和数据才能整理分析后得到正确的结果和结论。数据信息的正确性要求我们通过各种渠道获取信息进行比对。时。高效性和及时性。高效性是指在采集数据时一定要有明确的目标,带着问题去收集数据,使数据更加高效和针对性。同时,采集数据的及时性,提高了数据应用的及时性,能够创造更大的价值。3.2.3数据采集的来源数据来源大致分为四类管理信息系统通常是指企事业单位、政府机关等组织内部的业务平台,在业务活动中会产生大量的数据,这些数据既包括终端用户输入的原始数据,也包括系统二次加工处理产生的数据,与企业的经营、管理密不可分,具有极高的潜在应用价值,通常存储于关系型数据库中,多为结构化数据。互联网信息系统主要是指互联网上的各种信息系统或网络平台,例如电子商务系统(如淘宝商城、京东商城)、社交平台(如新浪微博、微信)、搜索引擎(如百度)、自媒体系统(如抖音、快手)、电子政务平台、在线医疗、在线教育以及各种POS终端、网络支付系统等.3.2.3数据采集的来源数据来源大致分为四类物联网信息系统主要是指通过传感器设备或智能设备感知、监控、樊哙、控制现实世界客观事物的信息系统,广泛应用于智能交通、现场指挥、行业生产等场合。与互联网系统系统相比,物联网信息系统收集到的数据,具有如下特点:数据规模更大、数据传输速率更快、数据类型更加多样化。科学研究信息系统主要是指科学大数据,可以来自科研院所、个人观察所得到的科学实验数据及传感数据。3.2.4
数据采集的方法针对四种不同的数据源,相应的采集方法也分为四类管理信息系统的数据采集方法管理信息系统的数据通常使用关系型数据库MySQL、SQLServer和Oracle等来存储业务数据,即数据以单行记录或多行记录的形式被写入到数据库中。随着数据源源不断地增加,经过长年累月的累积,积累了海量又珍贵的数据。可以借助ETL工具,把分散在不同位置的系统数据,通过抽取、转换、加载到数据仓库中,再由特定的处理分析系统对数据进行后续的分析,满足各种决策分析需求。对于产生的数据比如客户数据、财务数据等保密性要求极高的数据,一般会与专业的数据技术服务商合作,使用特定的系统接口等技术手段来保护数据的完整性和私密性。3.2.4
数据采集的方法针对四种不同的数据源,相应的采集方法也分为四类互联网信息系统的数据采集方法作为当下大数据时代最大的数据来源之一,互联网源源不断地产生各种数据,比如网上商城产生的数据,像商品数据、订单数据、用户反馈、浏览记录等大量的信息,有文档、音频、视频、图片等多种类型,可以数据可以用于个性化推荐、营销策略制定等多方面的分析与预测。互联网上的很多数据都是动态产生的,实时性很强,一般为非结构化数据或半结构化数据。目前主要的采集方法是通过网络爬虫(如Nutch、Scrapy等)或者是通过某些网上提供的公开的API(如百度、新浪微博),并根据用户需求将某些数据属性进行抽取。而访问日志等信息则可以使用系统日志的方法进行采集。3.2.4
数据采集的方法针对四种不同的数据源,相应的采集方法也分为四类网络爬虫网络爬虫是一种按照一定的规则,自动抽取信息的程序或脚本,又成网络蜘蛛或网络机器人。通过网络爬虫采集方法倾向于获取尽可能多的数据,但是考虑到数据的效率和质量,关键在于爬虫策略,也就是说在网络爬虫过程中,采取何种策略能够保证抽取到的内容更全、速度更快、匹配度更高。常见的策略包括深度优先策略、宽度优先策略、反向链路书策略、大站优先策略等。3.2.4
数据采集的方法针对四种不同的数据源,相应的采集方法也分为四类API采集API定义了一个网站与另一个网站之间通信的标准语法,即便是这两个网站的架构不同或者是实现的语言不同。通常是网站的管理者自行编写的一种程序接口。这类接口封装了网站的核心算法,只通过简单调用即可实现对网站数据的请求,满足使用者快速获取网站的部分数据。API采集技术很大程度上受限于平台开发者,一般免费提供API服务的网站中,通常都会限制采集时间和采集频率,对于开放的免费数据也因为数据的安全性和私密性,不能完全放开,从而不能完全满足用户需求。3.2.4
数据采集的方法针对四种不同的数据源,相应的采集方法也分为四类物联网信息系统的数据采集方法物联网信息系统的数据主要是通过传感器进行数据传输,把物理世界的信息转化为可读的数字信号以待出来。目前根据各行各业的特定应用,大量的传感器设备被广泛部署,会周期性并持续地产生海量数据。在基于传感器技术进行采集的过程,涉及到众多数据源的选取,同时由于受传感器设备和通信传输系统的限制,采集到的数据类型差异很多、组织形式也多种多样、量纲也差异很多,存在文本、图片、音频、视频等多种不同的形式。3.2.4
数据采集的方法针对四种不同的数据源,相应的采集方法也分为四类科学研究信息系统的数据采集方法科研数据因其特殊性,数据的采集方案都是经过科研人员精心设计的,需要通过特定的仪器进行采集并传送到数据中心进行处理。但是在不同科研领域,采用的方法也各不相同,比如舆情分析、用户行为分析及个性化推荐、交通监管等,可采用前面介绍的爬虫技术结合数据感知层的通用感知设备完成数据采集;而在宇宙奥秘探索、基因组研究、量子等领域,数据是需要特定的以前,比如射电望远镜、电子显微镜、LHC等。3.2.4
数据采集的方法针对四种不同的数据源,相应的采集方法也分为四类其他数据采集方法系统日志采集方法。系统日志是由系统运行产生,包含了系统的行为、状态以及用户和系统的交互。其含义是非常广泛的,可以是感知层采集到的数据、计算机软硬件系统运行的记录、网络监控的性能测量及流量管理等都属于系统日志。在进行系统日志设计时,遵循以用户/系统行为认知的原则,需要根据应用的要求选择日志需要包含的内容,并根据内容的形式和应用方法设计有效的存取格式。例如,对于通话记录一类的需要频繁查询的海量日志仓库,可以选择数据库而不是文本文件,确保高效的查询。PART03数据预处理
大数据预处理,是指对采集到的海量数据进行挖掘和分析处理前,需要先原始数据进行数据清洗、数据转换、数据集成及数据归约等多项工作,从而提高数据质量,尽可能满足后续数据分析的目的,得出切实可行的结论,为客户的应用提供有利的支撑。3.3数据预处理大数据预处理,是指对采集到的海量数据进行挖掘和分析处理前,需要先原始数据进行数据清洗、数据转换、数据集成及数据归约等多项工作,从而提高数据质量,尽可能满足后续数据分析的目的,得出切实可行的结论,为客户的应用提供有利的支撑。大数据预处理的流程如图3-3所示。图3-3大数据预处理流程图3.3.1数据清洗数据质量
高质量的数据应该具备四大要素:完整性、一致性、准确性和及时性。数据的完整性主要指数据记录和数据信息是否完整,是否存在缺失的情况。数据的一致性主要包括数据记录的规范性和数据逻辑的一致性。数据记录中准确性通常是指数据具有不正确的字段活不符合要求的数值。数据从产生到可以采集有一定的时间要求,在数据的刷新、修改和提取等方面的快速响应,这也是保证数据质量的一个重要方面。高质量的数据是数据应用的基础核心,必须把握以下几点:①制定规范的数据质量度量标准;②建立有效的数据质量监管体系;③建立完善的数据质量管理制度。高质量的数据离不开数据标准、数据分析、数据检验及管理制度的综合作用。3.3.1数据清洗数据清洗的内容及方法
对于采集到的“脏数据”,分析产生的原因和存在的形式,构建数据清洗的模型和算法,利用对应的技术手段进行“清洗”把原始数据转换成满足数据分析或应用要求的格式,从而提高数据的质量。(1)不完整性处理
一般从三个方面进行处理,即补充缺失值、直接删除记录和重新采集。(2)不一致性处理可以利用数据自身与外部的联系手动进行修车,或者通过已知属性间的依赖关系查找违反函数依赖的值,或使用知识工程检测违反规则的数据。不完整性处理
对于数据记录出现缺失的情况,一般从三个方面进行处理,即补充缺失值、直接删除记录和重新采集。①补充缺失值
人工补充
针对缺失值非常少的情况,可以根据业务知识或经验推测进行人工补充,但是在大数据集中通常是不可行的。
使用全局常量补充
将缺失的字段值用同一个常数、缺省值、最大值等进行替换,但是这种方式容易误导数据分析程序出现误差,甚至是错误的结论。该方法虽然简单,但是可用性太差,不推荐使用。3.3.1数据清洗不完整性处理①补充缺失值
统计补充法统计补充法有两种:均值不变法和标准差不变法。
均值不变法是指使用该字段的一般水平的统计数据进行补充,比如均值、中位数或众数等。在此情况下,补充后的数据均值保持不变,从而降低了填充数据对数据整体特征的影响。例如,某一门票的平均价格是35,则可以使用这个数值来补充价格所有缺失的记录。
标准不变法是指在确保补充前后字段的标准差保持不变的前提下,对缺失值进行补充。其数值是由字段的所有非缺失值计算而得。3.3.1数据清洗不完整性处理①补充缺失值
预测估算法
预测估算法是指有些字段的值可以根据其他同类别没有缺失值的字段进行推断,从而得出该字段最大可能的数值并进行填充。比如可以用身份证号码推算出年龄,或者使用回归、决策树归纳、贝叶斯推理、最近邻方法、神经网络等方法推断出最有可能的值,是目前主流的用于补充缺失值的方法。3.3.1数据清洗不完整性处理②删除缺失值当数据记录数量很多并且出现缺失值的数据记录再整个数据中的占比比较小时,或者字段的缺失率高但字段不重要,或者字段虽然重要但没有有效办法进行补充,都可以直接进行删除。这种方法尽管操作起来比较便捷,但是可能会改变数据的整体分布,对于只缺失某个字段就忽略其他的所有字段,也是对数据资源的一种浪费,因此进行此类处理时需要慎重。③重新采集对于某些字段非常重要且缺失率又比较高,又没有有效的方法进补充时,可以尝试通过其他的渠道重新采集获取所需的信息。3.3.1数据清洗不一致性处理
分析不一致数据产生的根本原因,通过和原始记录对比进行更正数据输入的错误。对于数据记录所有属性值完全相同的,则保留一个数据对象,删除其他重复数据;对于相似但属性值不完全相同的数据记录,则先确定是否代表同一对象,若是,则进行数据归并,出来不一致的值,否则需要确定相似数据对象的区分属性,避免意外的合并,比如同盟同性的数据记录,需要通过身份证号码来加以区分。此外,对于不一致性数据情况的处理,可以利用数据自身与外部的联系手动进行修车,或者通过已知属性间的依赖关系查找违反函数依赖的值,或使用知识工程检测违反规则的数据。3.3.1数据清洗不准确性处理不准确性数据产生的原因有很多,针对不同的原因采取对应的策略,我们可以采用不完整性和不一致性的某些处理方法。这里我们重点介绍对噪声数据的预处理。噪声数据是由于随机错误或者偏差等多种原因,造成的错误或异常的数据。对于这些噪声数据需要进行平滑处理,常用的方法有分箱法、回归法、聚类以及人机交互检测法等。①分箱法
分箱法是通过考察邻近的数据来对有序数据进行平滑处理的方法。它将有序的数据等宽或等深分配到一系列箱中,然后考察箱子中相邻数据的值进而实现数据的平滑。
通常来说,宽度越大,平滑效果越明显。3.3.1数据清洗不准确性处理
②回归法
回归法是采用构造拟合函数,利用一个(或一组)变量值来预测另一个变量值,根据实际值和预测值的偏离情况识别出噪声数据,然后将得到的预测值替换数据中引起噪声的属性值,从而实现噪声数据的平滑处理。通常使用线性回归法和非线性回归法。其中,线性回归是旨在找出拟合两个变量的最佳直线,使得当已知一个变量的值时,能够预测出另外一个变量的值。多线性回归涉及两个以上的变量,是线性回归的扩展,它将数据拟合到一个多维面上。3.3.1数据清洗不准确性处理
③人机交互检测法
人机交互检测法是使用人与计算机交互检查的方法来帮助发现噪声数据。利用专分析人员的背景知识和实践经验,进行人工筛选或制作规则集,再由计算机自动处理,从而检测出不符合也就逻辑的噪声数据。当规则集设计合理,比较贴近数据集合的应用领域需求时,这种方法有助于提高数据筛选的准确率。3.3.1数据清洗3.3.1数据清洗数据清洗的注意事项
根据对数据质量的要求和数据清洗的内容及方法,在进行数据清洗时,需要注意以下事项。①数据清洗时可优先进行缺失值、异常值和数据类型转换的操作,最后进行重复值处理。②在对缺失值、异常值进行处理时,要根据业务需求选择恰当的处理方法。③在数据清洗之前,最重要的是了解数据存储表的结构和发现需要处理的值,才能将数据清洗彻底。④数据量的大小也直接影响着处理方式,根据数据对结果的影响,选择合适的处理方法。⑤对于直接导入数据表的数据,一般需要对所有列依次地进行清洗,来保证数据处理的彻底。3.3.1数据清洗数据清洗的过程
不管采用那种数据清洗的方法,数据清洗的过程大概由六个基本步骤组成。
如右图所示。3.3.2数据集成基本概念
数据集成是将来自多个数据源的数据按照一定的规则整合成起来进行统一存储,维护数据源整体的上数据一致,以便提升挖掘的速度和准确度。数据集成时,按照不同需求在不同数据源与集成目标之间,通过统一的数据源访问接口,执行用户对数据源的访问请求,并根据一定的规则进行匹配,完成完成数据的转换和整合,还需要消除数据冗余,并针对不同特征或数据间的关系进行关联性分析。
如右图所示需要解决的问题
在数据集成过程中,数据的转换、移动等都不可避免,同时由于技术的不断更新换代,在集成过程中难免出现一些问题,主要集中在以下几个方面:
(1)异构性
异构性包括模式异构性和系统异构性。模式异构是指在数据源在存储模式上的差异,比如关系模式、对象模式、文档模式等。异构模式是指数据源所依赖的应用系统、数据库系统以及操作系统之间的差异。因此,在进行数据集成时需要为异构数据提供统一的标识、存储和管理,屏蔽它们之间的差异,提供统一的访问模式。3.3.2数据集成需要解决的问题
(2)一致性和冗余
数据的一致性设计冲突数据的识别和处理,即判断来自不同数据源的实体是否为同一实体。
冗余是数据集成中另一个常见问题。在数据集中,某个属性(如产品总价)可能会由另一个属性或多个属性(产品单价和销售数量)组成,这就导致数据挖掘需要对相同的信息进行重复处理,从而降低了工作效率。对于冗余问题,可以利用相关性分析方法来进行检测。3.3.2数据集成需要解决的问题
(3)数据的转换
根据不同的集成目标的需求,对于不同类型的数据,制定转换规则,完成数据的整合、转换成统一的数据格式。在数据集成过程中,元数据和主数据是非常重要的,通常需要主数据引用作为元数据标签附加到非结构化数据上,在此基础上完成多种异构数据源的集成。例如,某段视频可能包含某家企业的信息(主数据),通过将其与企业商标、名称等图像进行匹配,增设标签(元数据)从而与企业信息建立关联。3.3.2数据集成需要解决的问题
(4)数据的迁移及协调更新
随着用户业务的更新,当新的应用系统替代原有的应用系统时,根据目标应用系统的数据结构需求,必须将原有应用系统的业务数据进行转换并迁移到新的应用系统。处于统一数据集成环境中的多个应用系统,当其中某些应用系统的数据发生更新时,其他的应用系统需要及时被通知,以便及时的完成必要的数据移动。3.3.2数据集成3.3.3数据转换通过数据清洗,原始数据中的“脏数据”被逐一清理;通过数据集成,解决了不同来源数据不一致的问题;而数据转换,是将待处理的数据进行转换或归并,构成一个适合数据挖掘的形式。
数据转换的方法有很多,常见的包括数据平滑处理、数据聚集处理、数据泛化处理、数据规范化处理、属性构造、数据离散化处理等,通过线性或非线性的数据转换方法讲维数较高的数据压缩成维数教授的数据,从而减少不同数据源的原始数据之间的差异,进而获得高质量的数据,提高分析价值。3.3.3数据转换1.数据平滑处理数据平滑处理主要是针对噪声数据和无关数据进行的处理,也可以处理缺失数据和清洗脏数据,提高数据的信噪比。具体方法包括分箱、回归和聚类等,这些方法也常应用于数据清洗。2.数据规范化处理数据规范化处理是数据转换策略比较重要的一种方法。它将一个属性取值范围投射到一个特定范围,以消除数值型属性因大小不一而造成挖掘结果的偏差。规范化特别适用于分类算法,比如神经网络的分类算法和基于距离度量的分类算法。前者有助于确保学习结果的正确性,提高学习的效率。后者有助于消除因属性取值范围不同儿详细挖掘结果的公正性的情况。3.3.4数据脱敏数据脱敏是在给定的规则、策略下对敏感数据进行转换、修改的技术,它会根据数据保护规范和脱敏策略,通过对数据中的敏感信息实时自动变形,实现对敏感信息的隐藏和保护,最大程度上解决了敏感数据在非可信环境中使用的问题。比如在涉及客户安全数据或商业性敏感数据的情况下,在不违反系统规则的条件下,需对身份证号、手机号、银行卡号等进行脱敏处理。数据脱敏不是必须的数据预处理的环节,可以根据需求对数据进行脱敏处理,也可以不进行脱敏处理。1.数据脱敏原则数据脱敏不仅需要执行“数据漂白”,抹去数据中的敏感内容,同时需要保持原有的数据特征、业务规则和数据关联性,保证进行大数据分析时不会受到脱敏的影响,达成脱敏前后的数据一致性和有效性,具体如下:
(1)保持原有数据特征。数据脱敏前后必须保持原有数据特征。
(2)保持数据之间的一致性。在不同业务中,数据和数据之间具有一定的关联性。
(3)保持业务规则的关联性。保持数据业务规则的关联性是指数据关联性和业务语义等保持不变。(4)多次脱敏数据之间的数据一致性。保证数据的持续一致性和广野业务的持续一致性。3.3.4数据脱敏2.数据脱敏方法数据脱敏方法包括以下几种方法:(1)数据替换。用设置的固定虚构值替换真值。(2)无效化。通过对数据值的截断、加密等方式对敏感数据进行脱敏处理,使其不再具有使用价值。数据无效化与数据替换所达成的效果基本类似。(3)随机化。采用随机数据值代替真值,保持替换值的随机性以模拟样本的真实性。(4)偏移和取整。通过随机移位改变数据值,偏移取整在保持了数据的安全性的同时,也最大程度上保证了数据的真实性。(5)掩码屏蔽。掩码屏蔽是针对账户类数据的部分信息进行脱敏的有利方法,(6)灵活编码。对于需要特殊脱敏规则时,可使用灵活编码的方法。3.3.4数据脱敏
企业员工360度信息整合案例拓展实训PART04企业员工360度信息整合案例
案例介绍:A公司是一家创新性原料型生产企业,成立于2001年,由于A公司报销、人力、评优等系统之间没有打通,员工入职后需要在各信息系统中填写信息。管理层决定由人力资源部牵头实现各系统间信息联通,建设员工全方位信息数仓作为公司对人才管理的基本资料,用以完善员工发展制度、晋升机制、奖励机制、招聘机制等制度,为员工制定合理的成长计划和培养计划。3.4
拓展实训(一)案例实验步骤一(数据采集)(1)创建模型参照表实3-1基础信息表,在DMP“【数据加工厂】-【设计区】-【工厂分层】-【ODS操作数据】”路径下新建主题域和主题,通过“创建自定义模型(全部字段需要手动定义)”的方式创建指定名称的表。打开数据管理平台,登录浪潮数据管理平台软件。执行【数据加工厂】-【设计区】-【工厂分层】-【ODS操作数据】。依次点击右键顺序创建“新建ODS”、“新建主题域”、“新建主题”。主题创建后,点击“维表”模块,点击“添加维表”在弹出的“请选择一种创建方式”窗口中,选择“创建自定义维表”。(2)数据抽取参照表实3-3原始路径,在DMP“【数据加工厂】-【设计区】-【工厂分层】-【ODS操作数据】-【ETL转换】”路径下创建指定名称的ETL转换。3.4
拓展实训【操作步骤】第一步,根据表实3-3信息新建分组。依次执行【数据加工厂】-【设计区】-【工厂分层】-【ODS操作数据】,选中新建的“编号+姓名”的ODS层,右键点击“新建ETL转换节点”。在新建的ETL转换节点下,右键点击“新建分组”,填写信息保存成功,如图实3-5、图实3-6所示。第二步,右键点击“新建ETL转换”,根据表实3-4填写信息,选择组件保存成功,如图实3-7所示。第三步,点击“运行”,运行成功,如图实3-8所示。第四步,选中创建的维表,查看抽取的结果,如图实3-9、图实3-10所示。3.4
拓展实训(二)案例实验步骤二(数据处理)(1)创建数据模型
参照表实3-6,在DMP“【数据加工厂】-【设计区】-【工厂分层】【DW数据仓库】”路径下主题,通过“创建自定义模型(全部字段需要手动定义)”方式创建指定名称的模型。【操作步骤】第一步,执行【数据加工厂】-【数据加工厂】-【设计区】-【工厂分层】-【DW数据仓库】,选中DW数据仓库,右键点击“新建主题域”,如图实3-11所示。第二步,选中第一步新建的主题域,右击“新建主题”,填写信息保存成功,如图实3-12所示。第三步,点击“模型管理”模块,点击“添加模型”,在弹出的“请选择一种创建方式”窗口选择“创建自定义模型(全部字段需要手动定义)”,如图
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 合规转利润:降本增效全指南(2026)《GBT 38989-2020无机结合料稳定类材料单轴压缩弹性模量试验方法(中间段法)》
- 合规转利润:降本增效全指南(2026)《GBT 38651.4-2020公共信息标志载体 第4部分:维护要求》从合规成本到利润增长全案:避坑防控+降本增效+商业壁垒构建
- 支气管镜介入治疗喉
- 脑梗塞病人健康教育
- 游乐场员工劳动合同
- 临沂大学英语语言学期末考试试卷级参考答案
- 南安人工智能招聘专场
- 2026年新公司法知识竞赛题库与答案
- 胆囊结石护理查房
- 货物运输应急预案
- 2026年继续教育公需课(科目三)
- “化危为安”线上讲堂第153期-用好重大隐患判定准则 准确排查整治风险隐患-程长进
- 2026年秋新教科版五年级上册科学全册教案+教学计划
- 回复供应商询价的回复函3篇范文
- 高空作业平台倾覆现场处置方案
- 口腔颌面部感染诊疗临床应用专家共识(2025版)
- 2026年芯片设计DFT工程师高频面试题包含详细解答
- 网络传播概论(第5版)全套教学课件(完整版)
- 三宝四口五临边安全防护施工方案
- 临床肝紫癜病影像学表现
- 2026江苏法院招聘聘用制书记员202人考试参考题库及答案解析
评论
0/150
提交评论