大数据技术导论 第3版(项目化教程)课件 程显毅- 项目5、6 数据管理与分布式存储技术、数据预处理组件MapReduce部署及应用_第1页
大数据技术导论 第3版(项目化教程)课件 程显毅- 项目5、6 数据管理与分布式存储技术、数据预处理组件MapReduce部署及应用_第2页
大数据技术导论 第3版(项目化教程)课件 程显毅- 项目5、6 数据管理与分布式存储技术、数据预处理组件MapReduce部署及应用_第3页
大数据技术导论 第3版(项目化教程)课件 程显毅- 项目5、6 数据管理与分布式存储技术、数据预处理组件MapReduce部署及应用_第4页
大数据技术导论 第3版(项目化教程)课件 程显毅- 项目5、6 数据管理与分布式存储技术、数据预处理组件MapReduce部署及应用_第5页
已阅读5页,还剩131页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

项目5数据管理与分布式存储技术Catalogue目录非关系型数据库(NoSQL)5.1.数据管理发展历程列式数据库HBaseHDFS分布式文件系统2.6.项目实施SecondaryNameNode冷备份机制3.7.总结与展望HDFS常用操作命令4.8.01数据管理发展历程五个发展阶段概述资源管理职责包括CPU、内存、文件与设备四大模块。Part01文件操作粒度提供文件名的增删改查,属于粗粒度控制。Part02管理局限性无法深入内容层面进行精细化操作。Part03应用场景限制适用于通用计算环境,难以支撑复杂数据处理。Part04操作系统级管理可对文件内容执行增删改查,提升操作精度。粒度细化优势基于表结构组织数据,便于查询与维护。结构化数据支持Oracle、MySQL、PostgreSQL等关系型数据库。典型代表在超大规模数据面前,性能下降明显。面临瓶颈数据库管理系统行式存储弊端图5.7展示行式存储模式,列扩展困难。存储效率低下大表操作需频繁移动数据,影响响应速度。单一对象管理表作为不可分割单元,难以水平拆分。扩展性差难以通过增加节点实现线性扩容。传统数据库问题分析02HDFS分布式文件系统体系结构01主从架构组成040203一个NameNode、若干DataNode和一个SecondaryNameNode。分布式协作意义合作是突破个体局限的关键,也是系统可靠性的基础。类比书籍模型NameNode=目录,DataNode=正文内容,块=章节。存储基本单位块(默认128MB),远大于传统文件系统。体系结构解析将大文件切分为固定大小的数据单元。块的定义与作用降低元数据管理压力,提高吞吐量。大块设计原因减少寻址开销,简化系统设计,利于备份。优势分析支持PB级文件存储,满足大数据处理需求。实际应用价值块机制详解FsImage(静态快照)+EditLog(动态日志)。两文件构成维护文件、块与DataNode之间的映射关系。元数据存储负责创建、删除、复制等关键操作。统一调度中心010304提高访问速度,确保快速响应。内存中保存02NameNode核心功能数据写入本地磁盘,保证可靠性。磁盘持久化实际存放数据块的物理节点。文件内容存储记录BlockID到本地文件的对应关系。映射关系维护定期上报自身状态,协助集群健康监测。心跳机制DataNode工作原理03SecondaryNameNode冷备份机制冷备份流程图冷备份流程图1)SecondaryNameNode会定期和NameNode通信,请求其停止使用EditLog文件,暂时将新的写操作写到一个新的文件edit.new上,这个操作是瞬间完成,上层写日志的函数完全感觉不到差别。2)SecondaryNameNode通过HTTPGET方法从NameNode上获取到FsImage和EditLog文件,并下载到本地的相应目录下。3)SecondaryNameNode将下载下来的FsImage载入内存,然后逐条执行EditLog文件中的各项更新操作,使得内存中的FsImage保持最新;这个过程就是EditLog和FsImage文件合并。4)SecondaryNameNode执行完第3)步操作之后,会通过post方法将新的FsImage文件发送到NameNode节点上。5)NameNode将从SecondaryNameNode接收到新的FsImage替换旧的FsImage文件,同时将edit.new替换EditLog文件,通过这个过程EditLog变小了。防止元数据丢失为系统提供可恢复的完整快照。降低重启时间避免从零开始重建整个元数据结构。适合生产环境成为标准运维策略的重要组成部分。提升可用性支持定期维护而不中断服务。01020304备份机制意义04HDFS存储原理写数据策略第三副本同机架位于第一副本同机架的另一节点,兼顾性能与冗余。第一副本位置上传节点所在机器,若为外部提交则随机选择。更多副本随机分配保证整体分布均衡,最大化系统可靠性。第二副本跨机架放置在不同机架的节点上,提升容灾能力。写数据策略2134若客户端与某副本同属一机架,则优先读取。获取数据块副本的位置列表及所属机架信息。当无同机架副本时,从其余副本中任选其一。清晰展示客户端与服务器间的交互路径。机架匹配优先客户端调用API无匹配则随机选择图5.6:读取流程图示读数据过程本地读取优势网络负载均衡缓存机制支持多副本并行读取减少跨机架传输,显著降低延迟。分散读请求,避免热点节点过载。可结合缓存层进一步加速访问。支持同时从多个副本读取,提高吞吐。性能优化策略++海量日志存储如网站访问日志、系统运行日志。数据仓库底层作为Hive、Spark等上层引擎的数据源。++备份与归档用于长期保存重要业务数据。机器学习训练集存储大规模样本数据,支持分布式训练。实际应用场景停止服务sbin/stop-all.sh安全关闭各组件。启动集群sbin/start-all.sh启动所有Hadoop服务。地址说明注意根据实际部署修改IP和端口。Web监控访问http://<IP>:8088查看YARN资源情况;http://<IP>:9870查看HDFS状态。1、启动与关闭HDFS操作命令创建目录hadoopfs-mkdir-ptest创建嵌套目录。列出文件hadoopfs-lspath显示指定路径下内容。重命名文件hadoopfs-mvREADME.txtrm.txt修改文件名。查看文件内容hadoopfs-cat1.txt输出文本文件全部内容。文件系统操作HDFS操作命令复制本地到HDFShadoopfs-put/usr/*.jpgslave1:/opt上传文件。删除文件hadoopfs-rm-rf*.txt批量删除匹配文件。本节点内部复制hadoopfs-cp*.jpg/usr在同一节点内复制。从HDFS复制到本地hadoopfs-get*.jpg/usr下载文件。删除与移动HDFS操作命令hadoopfs-chmod777/input设置读写执行权限。01修改权限hdfsdfs可替代hadoopfs,语法一致。03命令别名说明hadoopfs-mvspark-2.1.0spark重命名文件夹。02重命名目录注意区分Linux本地命令与HDFS命令差异。04命令对比提示权限与重命名HDFS操作命令06非关系型数据库(NoSQL)行式存储局限图5.7显示行式存储导致列扩展困难。移动成本高昂插入新列需大量数据迁移,影响性能。表不可分割大表管理效率急剧下降,难以水平扩展。适应性不足难以应对Web2.0时代高并发、多样化数据需求。传统数据库困境SNS类网站爆发式增长,传统数据库不堪重负。互联网发展推动面对多重数据类型与规模挑战,催生新型数据库。技术演进必然展现从传统数据库到NoSQL的演进轨迹。图5.8:概念演变图示弹性扩展、高可用、低延迟成为新标准。核心驱动力NoSQL兴起背景无需预定义模式每条记录可具有不同属性与格式。无共享架构数据分散存储于多个节点,避免单点依赖。动态扩展能力运行中可增删节点,无需停机维护。分区与复制机制数据分区提升并行性能,副本保障可靠性。NoSQL共同特征使用键唯一标识数据,值可为任意复杂对象。工作原理01Redis:内存型,高性能,支持持久化。代表产品02缓存系统、会话存储、实时计数器。适用场景03读写速度快,支持原子操作,易于部署。优势特点04键值数据库模型优势以节点与边表示实体及其关系,天然适合关联分析。图5.9:黑客帝国人物关系展示如何轻松回答“谁是Neo的朋友”等问题。代表产品Neo4j:最成熟图数据库,支持复杂查询。应用领域社交网络、知识图谱、欺诈检测。图数据库查询语言强大类似面向对象语法,接近关系型查询能力。代表产品MongoDB:功能丰富,支持索引与聚合查询。松散结构支持允许每个文档拥有不同字段,灵活性强。文档数据库XML是典型代表,用于描述数据结构。01.本质是标记语言HTML用于显示,XML用于传输。03.与HTML区别跨平台兼容性强,易于程序解析。02.传输与交换优势配置文件、消息协议、数据接口定义。04.应用实例标签数据库06列式数据库HBase四维坐标体系[行键,列族,列限定符,时间戳]精确定位单元格。优势分析支持稀疏矩阵存储,适合海量稀疏数据。HBase模型详解三大核心组件客户端、Master主服务器、多个Region服务器。客户端行为不直接连接Master,而是通过Zookeeper获取位置信息。Master职责管理分区信息,负责Region分配与负载均衡。Region服务器角色存储与处理分配给自己的数据区域。系统架构解析存储Region与服务器映射关系。元数据表(.META.)记录所有元数据表的位置,唯一且固定。根数据表(-ROOT-)保存-ROOT-表位置,实现快速定位。Zookeeper记录010203三层结构设计应用场景广泛构建流程数据导入→Cube构建→查询服务发布。在线报表支持满足秒级响应的复杂查询需求。性能优势相比传统数据库查询速度快10倍以上。Kylin工具介绍基于离线计算构建Cube,底层存储于HBase。CubeDBOLAP分析通话记录、短信同步基于HBase实现。电信领域应用订单查询、交易流水高效存储。银行系统使用支持每秒数万次读写请求。高并发支持保障金融级服务体验。低延迟特性消息与订单系统1342多个节点并行接收更新请求。分布式写入支持按时间范围扫描,返回最新内容。读取优化用户动态按时间轴推送,支持高吞吐写入。朋友圈类场景可轻松扩展至百万级用户规模。可扩展性强Feeds流应用Phoenix插件功能提供二级索引与标准SQL支持。满足非事务性SQL查询需求。与传统系统对接向统一数据平台演进,实现“一库多用”。未来发展方向结合列式存储与关系型查询能力。优势互补NewSQL融合07项目实施启动Hadoop#cd

/apps/hadoop/sbin

#./start-all.sh执行jps,检查Hadoop守护进程是否启动#hadoop

fs

-touchz

/test1/file.txt

在test1文件夹中创建一个file.txt文件#hadoop

fs

-mkdir

/test1在HDFS根目录创建一个test1文件夹任务5.1HDFS基本操作查看HDFS根目录下所有文件#hadoop

fs

-ls

/

将根目录下test1文件夹下的file.txt重命名为file2.txt#hadoop

fs

-mv

/test1/file.txt

/file2.txt

将Linux本地/data目录下的data.txt文件,上传到HDFS中的/test1目录下#cd

/data

#touch

data.txt

#echo

hello

hadoop!

>>

data.txt

在Linux本地/data目录下,创建一个data.txt文件,并向其中写入hellohadoop!任务5.1HDFS基本操作#hadoop

fs

-put

/data/data.txt

/test1

查看HDFS中/test1目录下的data.txt文件#hadoop

fs

-cat

/test1/data.txt将HDFS中/test1目录下的data.txt文件,下载到Linux本地/apps目录中#hadoop

fs

-get

/test1/data.txt

/apps将Linux本地/data目录下的data.txt文件,上传到HDFS中的/test1目录下#cd

/data

#touch

data.txt

#echo

hello

hadoop!

>>

data.txt

在Linux本地/data目录下,创建一个data.txt文件,并向其中写入hellohadoop!任务5.1HDFS基本操作#hadoop

fs

-put

/data/data.txt

/test1

任务5.2HBase部署(1)系统环境LinuxUbuntu16.04jdk-7u75-linux-x64hadoop-2.6.0-cdh5.4.5hbase-1.0.0-cdh5.4.5.tar.gz(2)任务内容在已安装好的Hadoop环境基础上,安装并配置HBase。HBase安装包存放在/data/hbase1下。(3)任务步骤1)切换到/data/hbase1。2)将/data/hbase1目录下,HBase的安装包hbase-1.0.0-cdh5.4.5.tar.gz,解压缩到/apps目录下。#tar

-xzvf

hbase-1.0.0-cdh5.4.5.tar.gz

-C

/apps

任务5.2HBase部署3)将/apps目录下hbase-1.0.0-cdh5.4.5/重命名为hbase。#mv

/apps/hbase-1.0.0-cdh5.4.5/

/apps/hbase

4)添加HBase环境变量。#sudo

vim

~/.bashrc

在环境变量文件末尾位置,追加HBase的bin目录路径相关配置,并保存退出。即:#hbase

export

HBASE_HOME=/apps/hbase

export

PATH=$HBASE_HOME/bin:$PATH

执行source命令,使环境变量生效。任务5.2HBase部署5)配置HBase相关文件(在/apps/hbase/conf目录下)。①追加配置内容到hbase-env.sh中,并保存退出。export

JAVA_HOME=/apps/java

export

HBASE_MANAGES_ZK=true

export

HBASE_CLASSPATH=/apps/hbase/conf

说明:JAVA_HOME为java程序所在位置;HBASE_MANAGES_ZK表示是否使用HBase自带的Zookeeper环境;HBASE_CLASSPATH指向HBase配置文件的路径。②在hbase-site.xml文件的两个<configuration>之间添加相关内容。③在regionservers文件,添加HBase集群节点的IP地址。6)查看HBase的版本信息。#hbase

version

7)启动Hadoop。8)启动HBase。#cd

/apps/hbase/bin/

.#/start-hbase.sh

9)查看HBase相关进程。#jps

任务5.2HBase部署为了进一步测试HBase安装是否正常,进入HBaseShell接口。#hbase

shell

HBaseShell启动成功后的界面如图5.19所示。任务5.3HBaseShell基本操作表5.2HBaseShell基本操作命令名称命令表达式DDL操作创建表create'表名’,列族1','列族2''列族n'列出表list获取表的描述desc'表名’修改表alter‘表名’,应先disable‘表名”删除表drop‘表名’,应先disable‘表名”判断表是否存在exists‘表名'判断表是否enableis_enabled‘表名'判断表是否disableis_disabled‘表名’DML操作插入数据put‘表名',‘行健','列族名:列名:',‘值获取数据get‘表名,行健’,列族名:列名全表扫描scan‘表名”删除数据delete‘表名’,行健,列族名:列名:'查询行数count‘表名'清空该表truncate‘表名’更新数据重新插入一遍数据进行覆盖任务5.3HBaseShell基本操作1)create——创建一张表。创建一张表table_name,表中含有一个列簇f1。再次输入list,列出HBase中的表,如图5.21所示。任务5.3HBaseShell基本操作2)put——向表插入一行数据。put

'table_name','rowkey001','f1:col1','value1'

put

'table_name','rowkey001','f1:col2','value2'

put

'table_name','rowkey002','f1:col1','value1'

3)获取表中数据。通过get命令,获取table_name表,rowkey001中的f1下的col1的值:get

'table_name','rowkey001',

'f1:col1'

通过scan命令获取全表数据:scan

'table_name'

任务5.4HBaseShell应用实践1.HBase数据导入将本地文件(test.csv)上传到HDFS的根目录下,然后导入数据到HBase。1)本地写一个文件进行测试,文件名为test.csv,内容如下:1,“wang”2,“zhao1”3,“cheng”4,“liu”5,“sun”6,“gao”2)将文件上传到Hadoop。hadoopfs-puttest.csv/3)查看是否上传成功(文件存在,则表示上传成功,见图5.24)。任务5.4HBaseShell应用实践4)进入HbaseShell,创建表hbase-tb1-001,列簇为cf。create‘hbase-tb1-001’,’cf’5)执行文件导入(以Hadoop用户身份执行),如图5.25所示。格式:hbase[类][分隔符][行键,列簇][表][导入文件](默认分隔符为空格)6)查看是否导入成功(见图5.26)。任务5.4HBaseShell应用实践2.HBase过滤器1)创建表:create'test1','lf','sf'lf:columnfamilyofLONGvalues(binaryvalue)--sf:columnfamilyofSTRINGvalues2)导入数据:put'test1','user1|ts1','sf:c1','sku1'说明:用户user1在时间ts1,对产品sku1进行了c1操作,下同。put'test1','user1|ts2','sf:c1','sku188'put'test1','user1|ts3','sf:s1','sku123'put'test1','user2|ts4','sf:b1','sku2'put'test1','user2|ts5','sf:c2','sku288'put'test1','user2|ts6','sf:s1','sku222'其中,c1:通过主页点击;c2:通过广告点击;s1:通过主页搜索;b1:购买。任务5.4HBaseShell应用实践3)谁的值=sku188:scan'test1',FILTER=>"ValueFilter(=,'binary:sku188')"4)谁的值包含88:scan'test1',FILTER=>"ValueFilter(=,'substring:88')"5)通过广告点击进来的值包含88的用户:scan'test1',FILTER=>"ColumnPrefixFilter('c2')ANDValueFilter(=,'substring:88')"6)通过搜索进来的值包含123或者222的用户:scan'test1',FILTER=>"ColumnPrefixFilter('s')AND(ValueFilter(=,'substring:123')ORValueFilter(=,'substring:222'))"7)user1的操作记录:scan'test1',FILTER=>"PrefixFilter('user1')"08总结与展望数据管理演进规律从粗粒度到细粒度,从集中到分布,从结构到灵活。技术选型应匹配场景不同数据库各有优势,需根据需求合理选择。分布式是大势所趋水平扩展、高可用、弹性伸缩已成为标配。合作创造价值个人力量有限,团队协作才能成就伟大事业。核心观点回顾混合架构普及多类型数据库协同工作,形成统一数据平台。边缘数据管理兴起数据采集与处理向终端下沉。自动化运维增强AI驱动的智能调度与故障预测成为主流。可信数据生态构建加强隐私保护与数据安全治理。未来发展趋势持续学习更新关注Apache社区动态,掌握新技术。构建监控体系实时跟踪集群状态,及时发现异常。注重数据质量严控输入源头,防止脏数据污染系统。从基础开始掌握HDFS与HBase基本操作,建立实操经验。实践建议小处着手每一次文件操作都是对细节的尊重。信任合作一个人走不远,一群人走得更远。拥抱变化技术不断革新,唯有持续学习才能领先。技术向善掌握核心技术,为社会创造更大价值。人生启示2026.4谢谢大家2026.4项目6数据预处理组件MapReduceMapReduce工作原理01实战案例:词频统计执行过程02数据治理03数据清晰04项目实施05CONTENTS总结与展望06目录00项目目标与核心理念理解MapReduce编程模型一种用于大规模数据集并行运算的分布式计算框架。掌握其在数据预处理中的应用适用于清洗、转换、聚合等任务,提升处理效率与可扩展性。深入理解工作原理包括分而治之思想、Map阶段与Reduce阶段协同机制。具备复杂程序设计能力能应对多类型数据、复杂结构及高级分析需求(如文本、图像处理)。知识目标4321编写基础MapReduce程序实现简单的键值对映射与归约逻辑。应用场景适配根据业务需求选择合适策略,优化处理流程。完成关键预处理任务包括缺失值处理、异常值识别、格式转换与分组统计。实践环境搭建掌握从开发到提交的全流程操作。技能目标高质量的数据是精准决策的基础,也是创新起点。用技术解决真实问题,推动社会进步。小错误可能引发系统级故障,需保持高度严谨。追求高质量而非速度或数量,实现自我价值与社会尊重。03040201“质量第一”人生启示细节决定成败机会藏于细节技术向善素养目标数据量大、维度高、格式杂、精度低,难以直接分析。清洗脏数据、统一格式、提取特征,为建模提供可靠输入。分布式架构支持海量数据并行处理,具备容错与弹性扩展能力。构建完整数据链路,从原始数据到可用信息的跃迁路径。大数据挑战预处理必要性MapReduce优势项目意义项目背景概述01MapReduce工作原理Hadoop集群可用性必须部署完整的Hadoop生态,包括HDFS与YARN。系统权限配置设置用户权限、免密登录、SSH连接等基础通信机制。Java运行环境安装JDK8或以上版本,确保兼容性。网络连通保障所有节点间网络互通,端口开放,避免防火墙拦截。环境前提条件core-site.xml配置设置HDFS访问地址、默认文件系统名称。定义块大小、副本数、存储路径等参数。hdfs-site.xml配置指定作业运行模式(本地/集群)、资源管理器地址。mapred-site.xml配置配置资源调度策略、容器内存与CPU分配。yarn-site.xml配置01020304Hadoop核心配置start-dfs.sh启动分布式文件系统。启动NameNode与DataNode通过Web界面访问http://<IP>:9870和http://<IP>:8088验证功能。测试连接start-yarn.sh启动资源管理系统。启动ResourceManager与NodeManager使用jps命令确认各进程正常运行。查看服务状态集群启动流程推荐使用IntelliJIDEA或Eclipse进行代码编写。IDE选择使用MavenAssemblyPlugin生成可执行JAR包。JAR打包工具添加hadoop-client、hadoop-common等核心包依赖。Maven依赖管理配置SSH远程连接与日志查看方式。远程调试支持开发工具准备03MapReduce逻辑架构解析MapReduce概念MapReduce是一种分布式离线计算引擎,其基本思想是分而治之。以图书馆藏书统计场景为例,先由不同执行者分别统计各区域书架的藏书数量,这一拆解计算的过程对应“Map”阶段,参与计算的节点越多,整体统计效率越高;再将各节点的统计结果汇总并计算出总数,这一结果聚合的过程对应“Reduce”阶段。

启示:MapReduce源自分而治之,“分”最终的目的不是“分”,而是整体。分而治之主要的技巧是将一个大的复杂的问题划分为多个子问题,而这些子问题可以作为终止条件,或者在一个递归步骤中得到解决,所有子问题的解决结合起来就构成了对原问题的解决。MapReduce架构MapReduce新型架构(Hadoop2.0/YARN)每个应用程序启动时创建独立的ApplicationMaster。动态注册向ResourceManager请求特定类型的资源容器。资源申请运行、跟踪、重启任务,处理失败与异常。任务协调支持多种编程模型(如Spark、Flink)运行在同一集群。可扩展性强ApplicationMaster机制多框架兼容一个集群可同时运行批处理、流处理、交互式查询等多种任务。故障恢复更优失败任务由ApplicationMaster自动重启,不依赖中心节点。资源利用率提升以内存为单位表示资源,打破map/reduceslot固定划分限制。弹性伸缩能力动态增删节点,无需停机维护。架构优势对比核心思想:分而治之数据必须先存储在分布式文件系统中。所有阶段均以<key,value>形式传递数据。保证持久化与后续系统可读取。Map输入、输出;Reduce输入、输出。输入来自HDFS输出也写回HDFS键值对形式传输四组键值对说明输入输出规范数据划分与初步处理,是计算最小单位。Map阶段Map与Reduce之间不能直接通信,需经Shuffle。通信方式结果聚合与汇总,数量少于Map阶段。Reduce阶段可无Reduce阶段,仅执行Map任务。阶段可选性阶段划分机制根据Key哈希值确定输出到哪个Reducer。数据分区在每个Reducer本地完成组内排序与归并。排序与合并通过网络将中间结果从Map节点传送到Reduce节点。数据传输利用缓冲区暂存,溢出写入磁盘,避免内存溢出。内存与磁盘平衡Shuffle过程解析02实战案例:词频统计执行过程abcbca.文件1内容01abbb.文件3内容03abca.文件2内容02共计15个单词,含重复项。三文件总览04输入数据示例文件1输出<a,1><b,1><c,1><b,1><c,1><a,1>.文件2输出<a,1><b,1><c,1><a,1>.文件3输出<a,1><b,1><b,1><b,1>.合并后中间结果所有键值对按顺序列出,待进入Shuffle。Map阶段处理按Key分组将相同Key的所有值聚类在一起。输出形式<a,<1,1,1,1,1>>,<b,<1,1,1,1,1,1>>,<c,<1,1,1>>.组内排序对每个键对应的值列表进行升序排列。图6.4:全过程可视化展示每一步的键值对变化。Shuffle阶段统计a出现次数5次→输出<a,5>.统计b出现次数6次→输出<b,6>.统计c出现次数3次→输出<c,3>.最终结果三个键值对构成最终输出,可用于进一步分析。Reduce阶段03数据治理权威机构定义DAMA:对数据资产管理行使权利与控制的活动集合。简明描述一套制度、规范、流程与技术体系,保障数据质量与安全可控。DGI定义通过信息流程实现决策权与职责分工的系统。通俗理解数据在全生命周期中产生的问题,治理是综合解决方案。数据治理定义时间维度管理维度覆盖产生、采集、存储、应用、销毁全过程。涉及战略、组织、文化、方法、制度与流程。技术维度综合性行为包括标准、模型、集成、安全、元数据管理等。是全面的数据资产管理实践,非单一环节。治理覆盖维度与实体资产等价数据具有价值,应视为企业核心资产。01如设备管理员承担遗失责任,数据责任人亦然。责任主体明确治理定方向,管理抓执行,质量验成果。治理高于管理从采购、使用、维护到报废,全过程管控。管理思路一致020403数据资产属性治理=做正确的事决策层制定规则与标准。执行层落实流程与脚本。管理=把事做正确分析层产出准确率报告。质量=结果可验证通识类比治理如学术委员会,管理如教务处,质量如评教分数。三者关系对照表(见表6.1)

维度

数据治理

数据管理

数据质量

目标

定规矩、做决策

照规矩、执行活

达指标、可度量

主体

董事会/数据委员会

数据工程师/DBA

质量分析师

输出

政策、标准、角色表

清洗脚本、权限配置

准确率99%报告

通识类比

校学术委员会

教务处排课

学生评教分数

支撑科学决策如AlphaGo依赖棋谱数据做出精准判断。降低误判风险一步失误可能导致满盘皆输。释放潜在价值高质量数据驱动创新与增长。图6.5:价值体现图示展示治理如何提升准确性、一致性与可靠性。数据治理价值防止数据泄露、篡改与滥用。加强安全管控规范数据使用行为,规避侵权风险。减少法律纠纷符合GDPR、《个人信息保护法》等法规。满足合规要求自动化流程减少人工干预。降低管理成本降低运营风险STEP.01促进跨部门共享实现信息互通,避免重复建设。STEP.02提升协作效率业务联动更顺畅,响应更快。STEP.03构建统一视图企业级数据湖成为可能。STEP.04推动数字化转型数据成为驱动发展的核心动力。打破数据孤岛01.设立专门团队推进治理工作。组织支持02.制定数据标准与审批流程。制度保障03.使用Atlas、GreatExpectations等平台。工具赋能04.培训宣贯,全员参与治理。文化培育三大支柱支撑自评价值快速识别标准化短板。应在统一数据字典中定位字段含义。问1:业务含义在哪查?同一字段在校内不同系统中应一致。问2:命名是否统一?建立主数据管理系统,避免歧义。检查建议元数据与标准1应设定量化阈值,如空值率<1%。问1:空值/重复值有指标吗?2明确归档与删除责任人。问2:五年后谁负责销毁?3制定数据保留策略与审计机制。流程建议4适合高校、中小企业快速评估。适用场景质量与生命周期01问1:敏感信息已脱敏?身份证号等需加密或替换。02问2:撤授权能否72小时内删除?系统应支持即时响应。03法律依据依据《个人信息保护法》第47条。04合规要点用户有权要求删除其数据。隐私与合规问1:谁能导出整张成绩表?仅限授权管理员,且需审批。安全措施实施最小权限原则与双因素认证。问2:导出操作留痕吗?所有操作应记录日志。监控建议部署审计系统,实时告警异常行为。权限与安全问1:哪些主体受益?明确数据带来的可量化收益。问2:收益分配有文件吗?应签署正式协议。激励机制建立数据贡献激励制度。共享文化鼓励开放协作,共建数据生态。价值与共享微软“数据管理器”一键识别身份证、银行卡等敏感信息。GoogleDataStudio创建数据质量仪表盘,可视化展示指标。适用人群数据分析师、普通员工均可使用。使用便捷插件式集成,无需编码。个人级工具ApacheAtlas元数据血缘追踪,可视化数据流转路径。集成能力可嵌入CI/CD流程,实现自动化校验。GreatExpectations为数据构建单元测试体系,确保质量达标。企业级应用适用于大型组织数据治理平台。组织级工具中国个人信息安全规范,合规检查表。GB/T35273-2020美国政府数据门户通用标签,便于跨域检索。DCAT-US标准促进跨境数据流通与合作。国际互认可作为企业数据治理参考依据。标准落地国家/国际级标准04数据清洗机械故障与人为失误两大类。图6.5:缺失原因分类存储损坏、采集中断、设备故障。机械原因举例拒绝填写、录入遗漏、故意隐瞒。人为原因举例缺失本身可能是有意义的信息。特殊情况缺失值处理找出在其他维度上最相似的完整样本。原理说明需要计算距离矩阵,适合小规模数据。计算复杂度高更加精准,避免简单平均带来的偏差。优点医疗健康、金融风控等领域。应用场景处理方法一:邻近替代01优先使用众数,其次中位数。数值型数据推荐03某公司薪资:12000,5000,8000,3000,4000→平均6400。示例说明02在偏斜分布中易引入偏差。平均值慎用04每人减去平均值,使新均值为0。中心化处理处理方法二:集中趋势填充时间序列适用移动平均法、线性回归预测。临时保留策略若后续清理会自动移除,则可暂不处理。适用性判断仅当存在合理演化规律时才有效。建立模型利用相关变量建立回归方程。处理方法三:规律推断应用范围适用于连续型数值数据。正态分布判断落在均值±3σ之外的概率仅为0.27%,视为异常。四分位数计算Q1=第25%分位数,Q3=第75%分位数。图6.6:箱线图检测箱体外超出1.5倍四分位距的数据为离群点。异常值检测建立拟合模型如线性回归、聚类模型。基于模型法异常值检测孤立点即为潜在异常。图6.8:聚类检测02异常点不与其他对象强相关。发现局部关联01聚类分析法图6.9:邻近度检测距离远的对象被视为异常。定义距离度量如欧氏距离、曼哈顿距离。邻近度检测法公式:z=(x-μ)/σ,使均值0,标准差1。标准化(z-score)标准化适合大多数机器学习算法。选择建议公式:xnorm=(x-xmin)/(xmax-xmin)归一化(0-1)公式:x'=x-μ,使均值为0。中心化规范化处理快速汇总大量数据,支持多维分析。功能概述操作步骤选中数据→插入透视表→拖拽字段。图6.13~6.14:创建过程展示界面操作与字段布局。应用价值用于财务报表、销售分析、绩效考核。数据透视表按两个及以上定性变量交叉分类的频数表。定义表6.2家庭开支→表6.3透视表。示例说明可生成热力图、堆叠柱状图。可视化呈现检验变量间独立性(卡方检验)。分析用途列联表01020304One-Hot、LabelEncoding、Embedding。特征编码字符串转数字、日期格式统一。类型转换对数变换、平方根变换,缓解偏态。函数变换为模型训练提供良好输入。重要性其他变换方法05项目实施任务6.1统计词频1)在/data目录下,使用vim编辑一个data.txt文件,内容为helloworldhellohadoophelloipieuvre。#cd

/data

#vi

data.txt

2)在HDFS的根目录下创建in目录,并将/data下的data.txt文件上传到HDFS的in目录。#hadoop

fs

-put

/data/data.txt

/in

3)执行hadoopjar命令。在Hadoop的/apps/hadoop/share/hadoop/mapr

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论