版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
2026.4项目6数据预处理组件MapReduceMapReduce工作原理01实战案例:词频统计执行过程02数据治理03数据清晰04项目实施05CONTENTS总结与展望06目录00项目目标与核心理念理解MapReduce编程模型一种用于大规模数据集并行运算的分布式计算框架。掌握其在数据预处理中的应用适用于清洗、转换、聚合等任务,提升处理效率与可扩展性。深入理解工作原理包括分而治之思想、Map阶段与Reduce阶段协同机制。具备复杂程序设计能力能应对多类型数据、复杂结构及高级分析需求(如文本、图像处理)。知识目标4321编写基础MapReduce程序实现简单的键值对映射与归约逻辑。应用场景适配根据业务需求选择合适策略,优化处理流程。完成关键预处理任务包括缺失值处理、异常值识别、格式转换与分组统计。实践环境搭建掌握从开发到提交的全流程操作。技能目标高质量的数据是精准决策的基础,也是创新起点。用技术解决真实问题,推动社会进步。小错误可能引发系统级故障,需保持高度严谨。追求高质量而非速度或数量,实现自我价值与社会尊重。03040201“质量第一”人生启示细节决定成败机会藏于细节技术向善素养目标数据量大、维度高、格式杂、精度低,难以直接分析。清洗脏数据、统一格式、提取特征,为建模提供可靠输入。分布式架构支持海量数据并行处理,具备容错与弹性扩展能力。构建完整数据链路,从原始数据到可用信息的跃迁路径。大数据挑战预处理必要性MapReduce优势项目意义项目背景概述01MapReduce工作原理Hadoop集群可用性必须部署完整的Hadoop生态,包括HDFS与YARN。系统权限配置设置用户权限、免密登录、SSH连接等基础通信机制。Java运行环境安装JDK8或以上版本,确保兼容性。网络连通保障所有节点间网络互通,端口开放,避免防火墙拦截。环境前提条件core-site.xml配置设置HDFS访问地址、默认文件系统名称。定义块大小、副本数、存储路径等参数。hdfs-site.xml配置指定作业运行模式(本地/集群)、资源管理器地址。mapred-site.xml配置配置资源调度策略、容器内存与CPU分配。yarn-site.xml配置01020304Hadoop核心配置start-dfs.sh启动分布式文件系统。启动NameNode与DataNode通过Web界面访问http://<IP>:9870和http://<IP>:8088验证功能。测试连接start-yarn.sh启动资源管理系统。启动ResourceManager与NodeManager使用jps命令确认各进程正常运行。查看服务状态集群启动流程推荐使用IntelliJIDEA或Eclipse进行代码编写。IDE选择使用MavenAssemblyPlugin生成可执行JAR包。JAR打包工具添加hadoop-client、hadoop-common等核心包依赖。Maven依赖管理配置SSH远程连接与日志查看方式。远程调试支持开发工具准备03MapReduce逻辑架构解析MapReduce概念MapReduce是一种分布式离线计算引擎,其基本思想是分而治之。以图书馆藏书统计场景为例,先由不同执行者分别统计各区域书架的藏书数量,这一拆解计算的过程对应“Map”阶段,参与计算的节点越多,整体统计效率越高;再将各节点的统计结果汇总并计算出总数,这一结果聚合的过程对应“Reduce”阶段。
启示:MapReduce源自分而治之,“分”最终的目的不是“分”,而是整体。分而治之主要的技巧是将一个大的复杂的问题划分为多个子问题,而这些子问题可以作为终止条件,或者在一个递归步骤中得到解决,所有子问题的解决结合起来就构成了对原问题的解决。MapReduce架构MapReduce新型架构(Hadoop2.0/YARN)每个应用程序启动时创建独立的ApplicationMaster。动态注册向ResourceManager请求特定类型的资源容器。资源申请运行、跟踪、重启任务,处理失败与异常。任务协调支持多种编程模型(如Spark、Flink)运行在同一集群。可扩展性强ApplicationMaster机制多框架兼容一个集群可同时运行批处理、流处理、交互式查询等多种任务。故障恢复更优失败任务由ApplicationMaster自动重启,不依赖中心节点。资源利用率提升以内存为单位表示资源,打破map/reduceslot固定划分限制。弹性伸缩能力动态增删节点,无需停机维护。架构优势对比核心思想:分而治之数据必须先存储在分布式文件系统中。所有阶段均以<key,value>形式传递数据。保证持久化与后续系统可读取。Map输入、输出;Reduce输入、输出。输入来自HDFS输出也写回HDFS键值对形式传输四组键值对说明输入输出规范数据划分与初步处理,是计算最小单位。Map阶段Map与Reduce之间不能直接通信,需经Shuffle。通信方式结果聚合与汇总,数量少于Map阶段。Reduce阶段可无Reduce阶段,仅执行Map任务。阶段可选性阶段划分机制根据Key哈希值确定输出到哪个Reducer。数据分区在每个Reducer本地完成组内排序与归并。排序与合并通过网络将中间结果从Map节点传送到Reduce节点。数据传输利用缓冲区暂存,溢出写入磁盘,避免内存溢出。内存与磁盘平衡Shuffle过程解析02实战案例:词频统计执行过程abcbca.文件1内容01abbb.文件3内容03abca.文件2内容02共计15个单词,含重复项。三文件总览04输入数据示例文件1输出<a,1><b,1><c,1><b,1><c,1><a,1>.文件2输出<a,1><b,1><c,1><a,1>.文件3输出<a,1><b,1><b,1><b,1>.合并后中间结果所有键值对按顺序列出,待进入Shuffle。Map阶段处理按Key分组将相同Key的所有值聚类在一起。输出形式<a,<1,1,1,1,1>>,<b,<1,1,1,1,1,1>>,<c,<1,1,1>>.组内排序对每个键对应的值列表进行升序排列。图6.4:全过程可视化展示每一步的键值对变化。Shuffle阶段统计a出现次数5次→输出<a,5>.统计b出现次数6次→输出<b,6>.统计c出现次数3次→输出<c,3>.最终结果三个键值对构成最终输出,可用于进一步分析。Reduce阶段03数据治理权威机构定义DAMA:对数据资产管理行使权利与控制的活动集合。简明描述一套制度、规范、流程与技术体系,保障数据质量与安全可控。DGI定义通过信息流程实现决策权与职责分工的系统。通俗理解数据在全生命周期中产生的问题,治理是综合解决方案。数据治理定义时间维度管理维度覆盖产生、采集、存储、应用、销毁全过程。涉及战略、组织、文化、方法、制度与流程。技术维度综合性行为包括标准、模型、集成、安全、元数据管理等。是全面的数据资产管理实践,非单一环节。治理覆盖维度与实体资产等价数据具有价值,应视为企业核心资产。01如设备管理员承担遗失责任,数据责任人亦然。责任主体明确治理定方向,管理抓执行,质量验成果。治理高于管理从采购、使用、维护到报废,全过程管控。管理思路一致020403数据资产属性治理=做正确的事决策层制定规则与标准。执行层落实流程与脚本。管理=把事做正确分析层产出准确率报告。质量=结果可验证通识类比治理如学术委员会,管理如教务处,质量如评教分数。三者关系对照表(见表6.1)
维度
数据治理
数据管理
数据质量
目标
定规矩、做决策
照规矩、执行活
达指标、可度量
主体
董事会/数据委员会
数据工程师/DBA
质量分析师
输出
政策、标准、角色表
清洗脚本、权限配置
准确率99%报告
通识类比
校学术委员会
教务处排课
学生评教分数
支撑科学决策如AlphaGo依赖棋谱数据做出精准判断。降低误判风险一步失误可能导致满盘皆输。释放潜在价值高质量数据驱动创新与增长。图6.5:价值体现图示展示治理如何提升准确性、一致性与可靠性。数据治理价值防止数据泄露、篡改与滥用。加强安全管控规范数据使用行为,规避侵权风险。减少法律纠纷符合GDPR、《个人信息保护法》等法规。满足合规要求自动化流程减少人工干预。降低管理成本降低运营风险STEP.01促进跨部门共享实现信息互通,避免重复建设。STEP.02提升协作效率业务联动更顺畅,响应更快。STEP.03构建统一视图企业级数据湖成为可能。STEP.04推动数字化转型数据成为驱动发展的核心动力。打破数据孤岛01.设立专门团队推进治理工作。组织支持02.制定数据标准与审批流程。制度保障03.使用Atlas、GreatExpectations等平台。工具赋能04.培训宣贯,全员参与治理。文化培育三大支柱支撑自评价值快速识别标准化短板。应在统一数据字典中定位字段含义。问1:业务含义在哪查?同一字段在校内不同系统中应一致。问2:命名是否统一?建立主数据管理系统,避免歧义。检查建议元数据与标准1应设定量化阈值,如空值率<1%。问1:空值/重复值有指标吗?2明确归档与删除责任人。问2:五年后谁负责销毁?3制定数据保留策略与审计机制。流程建议4适合高校、中小企业快速评估。适用场景质量与生命周期01问1:敏感信息已脱敏?身份证号等需加密或替换。02问2:撤授权能否72小时内删除?系统应支持即时响应。03法律依据依据《个人信息保护法》第47条。04合规要点用户有权要求删除其数据。隐私与合规问1:谁能导出整张成绩表?仅限授权管理员,且需审批。安全措施实施最小权限原则与双因素认证。问2:导出操作留痕吗?所有操作应记录日志。监控建议部署审计系统,实时告警异常行为。权限与安全问1:哪些主体受益?明确数据带来的可量化收益。问2:收益分配有文件吗?应签署正式协议。激励机制建立数据贡献激励制度。共享文化鼓励开放协作,共建数据生态。价值与共享微软“数据管理器”一键识别身份证、银行卡等敏感信息。GoogleDataStudio创建数据质量仪表盘,可视化展示指标。适用人群数据分析师、普通员工均可使用。使用便捷插件式集成,无需编码。个人级工具ApacheAtlas元数据血缘追踪,可视化数据流转路径。集成能力可嵌入CI/CD流程,实现自动化校验。GreatExpectations为数据构建单元测试体系,确保质量达标。企业级应用适用于大型组织数据治理平台。组织级工具中国个人信息安全规范,合规检查表。GB/T35273-2020美国政府数据门户通用标签,便于跨域检索。DCAT-US标准促进跨境数据流通与合作。国际互认可作为企业数据治理参考依据。标准落地国家/国际级标准04数据清洗机械故障与人为失误两大类。图6.5:缺失原因分类存储损坏、采集中断、设备故障。机械原因举例拒绝填写、录入遗漏、故意隐瞒。人为原因举例缺失本身可能是有意义的信息。特殊情况缺失值处理找出在其他维度上最相似的完整样本。原理说明需要计算距离矩阵,适合小规模数据。计算复杂度高更加精准,避免简单平均带来的偏差。优点医疗健康、金融风控等领域。应用场景处理方法一:邻近替代01优先使用众数,其次中位数。数值型数据推荐03某公司薪资:12000,5000,8000,3000,4000→平均6400。示例说明02在偏斜分布中易引入偏差。平均值慎用04每人减去平均值,使新均值为0。中心化处理处理方法二:集中趋势填充时间序列适用移动平均法、线性回归预测。临时保留策略若后续清理会自动移除,则可暂不处理。适用性判断仅当存在合理演化规律时才有效。建立模型利用相关变量建立回归方程。处理方法三:规律推断应用范围适用于连续型数值数据。正态分布判断落在均值±3σ之外的概率仅为0.27%,视为异常。四分位数计算Q1=第25%分位数,Q3=第75%分位数。图6.6:箱线图检测箱体外超出1.5倍四分位距的数据为离群点。异常值检测建立拟合模型如线性回归、聚类模型。基于模型法异常值检测孤立点即为潜在异常。图6.8:聚类检测02异常点不与其他对象强相关。发现局部关联01聚类分析法图6.9:邻近度检测距离远的对象被视为异常。定义距离度量如欧氏距离、曼哈顿距离。邻近度检测法公式:z=(x-μ)/σ,使均值0,标准差1。标准化(z-score)标准化适合大多数机器学习算法。选择建议公式:xnorm=(x-xmin)/(xmax-xmin)归一化(0-1)公式:x'=x-μ,使均值为0。中心化规范化处理快速汇总大量数据,支持多维分析。功能概述操作步骤选中数据→插入透视表→拖拽字段。图6.13~6.14:创建过程展示界面操作与字段布局。应用价值用于财务报表、销售分析、绩效考核。数据透视表按两个及以上定性变量交叉分类的频数表。定义表6.2家庭开支→表6.3透视表。示例说明可生成热力图、堆叠柱状图。可视化呈现检验变量间独立性(卡方检验)。分析用途列联表01020304One-Hot、LabelEncoding、Embedding。特征编码字符串转数字、日期格式统一。类型转换对数变换、平方根变换,缓解偏态。函数变换为模型训练提供良好输入。重要性其他变换方法05项目实施任务6.1统计词频1)在/data目录下,使用vim编辑一个data.txt文件,内容为helloworldhellohadoophelloipieuvre。#cd
/data
#vi
data.txt
2)在HDFS的根目录下创建in目录,并将/data下的data.txt文件上传到HDFS的in目录。#hadoop
fs
-put
/data/data.txt
/in
3)执行hadoopjar命令。在Hadoop的/apps/hadoop/share/hadoop/mapreduce路径下存在hadoop-mapreduce-examples-2.6.0-cdh5.4.5.jar包,执行其中的worldcount类,数据来源为HDFS的/in目录,数据输出到HDFS的/out目录。#hadoop
jar
/apps/hadoop/share/hadoop/mapreduce/hadoop-mapreduce-examples-2.6.0-cdh5.4.5.jar
wordcount
/in
/out
4)查看单词统计结果。#hadoop
fs
-ls
/out
#hadoop
fs
-cat
/out/*
结果如图6.16所示。任务6.2数据清洗(1)运用CONCATENATE函数对日期和商品名称进行合并打开(库存数据)工作表,查看库存数据中日期和商品名称的重复值,具体操作如下。
1)输入公式合并字段。添加“合并日期和商品名称”字段,合并库存数据中的日期和商品名称,选中单元格E2,输入“=CONCATENATE(A2,B2)”,如图6.17所示。
任务6.2数据清洗2)确定公式。按下<Enter>键,将鼠标指针移到单元格E2的右下角,当指针变为黑色加粗的“+”指针时,双击左键即可合并剩下的日期和商品名称。CONCATENATE函数用于合并两个文本字符,在合并日期与商品名称时,由于Excel2016会自动将日期格式转换为常规文本格式(General格式),导致合并后的日期无法保留年/月/日的显示形式。以2018年8月6日为例,Excel默认的日期计算体系以1900年1月1日为起始点,数值43318即为该日期与起始日期之间的天数差(见图6.18)。
任务6.2数据清洗(2)利用“条件格式”图标突显重复值
在“开始”选项卡的“样式”命令组中,单击“条件格式”图标,依次选择“突出显示单元格格式(H))命令和(重复值(D)”命令,弹出“重复值”对话框,如图6.19所示,单击“确定”按钮
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 江苏盐城市2026届高三下学期二模历史试题(文字版含答案)
- 山东省东营市利津县2023-2024学年六年级下学期期末考试历史试题(文字版含答案)
- 【人教版2019必修第一册】高一物理4力学单位制(教学设计)教案
- 荆州市江陵县2027届数学六年级第一学期期末经典模拟试题含解析
- 2027届汕头市濠江区六年级数学第一学期期末学业水平测试模拟试题含解析
- 生鲜项目配送合同(范本)
- 2027届中江县三年级数学第一学期期末检测模拟试题含解析
- 黑龙江省牡丹江市阳明区2027届六上数学期末监测试题含解析
- 2027届河南省鹤壁市山城区数学六年级第一学期期末调研模拟试题含解析
- 甘肃省张掖市高台县城关初级中学2027届四年级数学第一学期期末达标检测试题含解析
- 2026年浙江省综合性评标专家库评标专家考试在线题库
- 2025-2026学年四年级数学下学期期末真题重组试题01(山东专用 青岛版五四制) 含答案
- 2026年国企招聘副总测试题及答案
- 2026年留疆战士考核综合应试能力提升练习题含答案
- 重庆市2026年普通高等学校招生全国统一考试 生物+答案
- 2026年及未来5年市场数据中国城市客运行业市场调研分析及投资前景预测报告
- STEMI诊疗新指南课件
- 护理课题申报的流程与要点
- 2025四川九洲君合私募基金管理有限公司招聘高级风控经理等岗位3人笔试历年典型考点题库附带答案详解2套试卷
- 急诊科加强培训核心制度
- 人体工程学管理制度(3篇)
评论
0/150
提交评论