数据基础存储 2_第1页
数据基础存储 2_第2页
数据基础存储 2_第3页
数据基础存储 2_第4页
数据基础存储 2_第5页
已阅读5页,还剩21页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

任务1零售数据存储与分析——分布式大数据平台部署实战内容导航01任务描述与集群规划工单1.1分布式集群规划02环境部署实战工单1.2虚拟机配置、工单1.3Linux安装03Hadoop安装与配置工单1.4Hadoop集群部署五大环节04ZooKeeper安装与配置工单1.5ZooKeeper集群配置05HDFS数据应用与知识链接工单1.6HDFS操作与大数据理论06任务总结任务总结与素质拓展任务描述与集群规划本工单为分布式零售数据分析平台的主机、节点角色命名,为后续环境部署奠定基础本任务涵盖分布式大数据平台存储与分析六大环节集群规划虚拟机配置Linux安装Hadoop部署ZooKeeper部署HDFS数据应用工单1.1:分布式集群规划知识目标掌握分布式集群主机、节点等角色的命名方式能力目标能够独立创建分布式集群节点素养目标培养学生主动思考、自主学习的能力命名规则说明采用

master+slave

namenode+datanode

结合方式仅可使用

小写字母与数字禁止包含

-_

等特殊字符主机配置主机名IP地址master33datanode134datanode235虚拟机NAT网络环境配置主机名IP地址HDFS角色YARN角色master33NameNodeResourceManagerdatanode134DataNodeNodeManagerdatanode235DataNodeNodeManager虚拟网络编辑器编辑→虚拟网络编辑器→更改设置选NAT选中NAT模式→子网IP设置/24→网关设置→DHCP范围128-254→VMnet8重置禁用再启用→确认IPv4地址192.168.135.X至此,虚拟机网络环境的配置完成。三维目标知识目标掌握互联网协议地址的构成及其配置方法能力目标能够独立完成网络配置素养目标培养学生的创新意识和创新精神Linux操作系统安装(上)掌握Linux操作系统的安装与配置,能够在虚拟机中安装Linux操作系统,培养学生细致严谨的工作态度创建虚拟机与开始安装01打开VMware,创建新的虚拟机,选择"典型"02选择CentOS7光盘映像文件03创建VMOS/master文件夹,虚拟机名称设为"master"04最大磁盘大小调整为40GB05自定义硬件,内存容量修改为2048MB06确认后单击"确定"按钮07选择"InstallCentOS7",按Enter键08DATE&TIME选择时区Asia/Shanghai09NETWORK&HOSTNAME设置网络为ON10Hostname输入master,Apply后Done核心配置参数40GB磁盘容量2048MB内存容量Asia/Shanghai时区设置Linux操作系统安装(下)安装步骤01返回"INSTALLATIONSUMMARY",单击"BeginInstallation"开始安装02单击"ROOTPASSWORD",设密码为root,两次"Done"确认03提示"Complete!"时,单击"Reboot"重启系统04重启中单击"我已完成安装"按钮05出现命令行界面,输入用户名和密码登录06执行命令servicesshdstatus查询SSH服务状态工单小结完成虚拟机环境搭建与CentOS7安装创建。登录后检查虚拟机配置,若因物理机内存或磁盘容量限制导致无法正常启动,可适当调整配置。登录完成后即可查询SSH服务状态。Hadoop安装配置要求工单1.4:Hadoop的安装与配置集群进程分配要求需运行进程master、datanode1、datanode2分别运行进程datanode1、datanode2实施环节(5步)网络配置SSH免密登录配置MobaXterm安装和配置准备Java安装Hadoop安装和配置启动集群的HDFS和YARN服务,确保集群能正常提供服务网络配置与节点克隆配置命令速查systemctlrestartnetwork重启网络服务ipaddr验证IP地址vi/etc/hosts修改hosts映射halt安全关机节点克隆流程复制master文件夹目录:VMOS重命名slave1、slave2打开.vmx文件VMware中选择正确配置虚拟机重命名datanode1、datanode2逐个启动避免IP冲突,不可同时启动选择复制选项"我已复制该虚拟机"节点网络配置与验证datanode节点配置与集群连通验证datanode1配置01修改主机名vi/etc/hostname输入datanode1;hostnamedatanode1即时生效02修改IP地址vi/etc/sysconfig/network-scripts/ifcfg-ens33将IPADDR改为3403重启验证systemctlrestartnetwork;ipaddr确认生效datanode2配置01修改主机名vi/etc/hostname输入datanode2;hostnamedatanode2即时生效02修改IP地址vi/etc/sysconfig/network-scripts/ifcfg-ens33将IPADDR改为3503重启验证systemctlrestartnetwork;ipaddr确认生效SSH免密登录配置Master节点配置01修改/etc/ssh/sshd_config,允许root登录及公钥认证02执行servicesshdrestart重启服务03执行servicesshdstatus确认状态04执行ssh-keygen-trsa生成密钥对(提示输入时直接回车)05执行ssh-copy-id-i~/.ssh/id_rsa.pubroot@datanode1分发公钥06执行sshroot@datanode1测试免密登录,成功后exit退出07重复配置到datanode2及master自身DataNode节点配置05生成各自密钥对在datanode1、datanode2上执行ssh-keygen-trsa09配置到所有节点(含自身)的免密登录在各节点执行相似操作10实现3个节点全互通免密登录最终目标达成依赖RPC进行数据交互,配置SSH免密登录是保障跨节点组件正常通信的前提MobaXterm安装与配置MobaXterm是一款增强型终端工具,集成多种网络工具,用于远程访问和管理Linux/UNIX服务器远程会话管理多标签终端SSH客户端(密码/密钥认证)RDP/VNC客户端文件传输连接SFTP客户端X11转发SSH端口转发网络诊断工具ping/traceroutenslookup/dig插件扩展配置步骤(5步完成3节点连接)01官网下载免费版,免安装直接运行02新建SSH会话:Session→SSH,Remotehost输入

3303输入用户名密码登录,提示对话框单击"Yes"04右击会话→Renamesession,命名为

master05对datanode1(34)和datanode2(35)重复步骤②-④,完成集群三节点远程连接Java环境安装Java的安装主要包括复制环境包资源、配置环境变量、验证安装成功以及将配置同步到其余节点master节点操作01单击MobaXterm左侧"Sftp"选项卡,进入/opt目录,将环境包资源文件拖曳上传02执行cd/opt切换到该目录,执行ls查看上传状态03执行tar-zxvfjdk-8u311(按Tab自动补全)解压压缩包04执行mvjdk1.8.0_311jdk1.8重命名文件夹05执行vi/etc/profile编辑环境变量,末尾添加配置exportJAVA_HOME=/opt/jdk1.8exportPATH=$PATH:$JAVA_HOME/bin06执行source/etc/profile使变量生效,执行java-version验证配置多节点同步07同步JDK目录执行scp-rjdk1.8datanode1:'pwd'

scp-rjdk1.8datanode2:'pwd'08同步/etc/profile文件分发到datanode1和datanode2节点09更新并确认版本两节点分别执行source/etc/profile和java-versionHadoop核心配置配置根目录

/opt/hadoop/etc/hadoop,workers

文件决定集群节点归属01解压并重命名tar-zxvf解压后mv重命名为hadoop02配置core-site.xml配置NameNode地址与临时目录03创建数据目录cd/opt/hadoop并mkdirdata04配置hdfs-site.xml设置副本数及NameNode/DataNode存储目录05配置yarn-site.xml配置ResourceManager与NodeManager参数06配置mapred-site.xml指定MapReduce运行框架为YARN07编辑hadoop-env.sh添加Java环境变量08配置workers文件写入master/datanode1/datanode209添加Hadoop环境变量编辑/etc/profile后source生效10同步至DataNode节点分发hadoop文件夹与profile并source生效配置根目录/opt/hadoop/etc/hadoop,workers文件决定集群节点归属Hadoop集群启动与验证集群启动与验证五步流程—从HDFS格式化到功能测试的完整验证链路集群启动与验证五步流程01HDFS格式化hdfsnamenode-format—初始化文件系统02启动HDFSstart-dfs.sh→jps—确认NameNode+SecondaryNameNode03DataNode确认jps(datanode1/2)—确认DataNode进程存在04HDFS状态验证浏览器访问:9870—Datanodes选项卡确认连接05HDFS功能测试hadoopfs-mkdir/-put—Browse验证文件存储YARN启动与MapReduce测试06启动YARNstart-yarn.sh→yarnnode-list—查看节点连接情况07NodeManager确认jps(其他节点)—确认NodeManager进程存在08YARN状态验证浏览器访问:8088—Nodes页面确认连接09MapReduce测试hadoopjar...grepinputoutput—刷新确认运行成功工单小结:完成3台虚拟机网络配置、SSH免密登录、MobaXterm配置、Java安装、Hadoop安装配置,为大数据平台组件安装做好准备ZooKeeper安装配置(上)工单1.5:ZooKeeper的安装与配置掌握ZooKeeper的安装与配置方法,了解其在集群中的位置及作用内存配置优化01节点内存升级master节点内存增至4096MB02重启集群服务执行start-dfs.sh和start-yarn.sh03禁用swap分区注释/etc/fstab中swap行,执行swapoff-a04验证swap状态执行free-h确认swap已关闭ZooKeeper安装步骤01解压安装包进入/opt目录解压ZooKeeper二进制文件02重命名文件夹mvzookeeper-3.4.5zookeeper03复制配置文件cpzoo_sample.cfgzoo.cfg04编辑配置项设置dataDir、客户端端口和服务器节点05创建数据目录mkdirdata手动创建data文件夹ZooKeeper安装配置(下)ZooKeeper配置与启动ZooKeeper配置与启动01dataDir放置myid与initialize文件myid数字与server.<num>一致:master=1,datanode1=2,datanode2=3;initialize为空文件02同步配置并修改各节点myid同步到datanode1、datanode2,分别修改对应myid03配置环境变量并生效编辑/etc/profile添加ZooKeeperbin目录,source生效后同步到其余节点04三节点启动集群zkServer.shstart/opt/zookeeper/conf/zoo.cfg验证测试01查看集群状态zkServer.shstatus/opt/zookeeper/conf/zoo.cfg02进入CLI客户端zkCli.sh-servermaster:218103查看根路径子节点ls/ls204创建节点并设置数据05验证数据同步/zk-test初始值设为3,另一客户端get确认06退出CLIquit工单小结:集群安装配置完成。各节点执行jps均可看到QuorumPeerMain进程HDFS零售数据存储应用三维目标知识目标掌握HDFS的操作命令能力目标熟练使用HDFS命令进行数据存取操作素养目标培养实践动手能力HDFS常用命令操作01上传数据文件至/opt02ls验证+head预览03fs命令操作分布式文件系统04put上传本地文件到HDFS05mv重命名简化文件名06head查看HDFS文件前几行07count-v-h查询文件数量及大小08df显示HDFS剩余容量09du-v-h查看已用文件和目录10cp复制文件或文件夹11rm删除多余文件通过HDFS命令完成零售数据存储应用——查看、展示、存储、复制、删除数据大数据概念与4V特征大数据是数量巨大、类型多样、处理时效短、数据源可靠性保证度低的综合属性海量数据集合Volume(大量)数据量巨大,社交网络、移动网络、智能终端等均为数据来源Variety(多样)结构化数据(财务报表、医疗数据库)、非结构化数据(文档、图片、音视频)与半结构化数据(XML、JSON);智能语音助手为典型应用Velocity(高速)数据生成快(欧洲核子研究中心年产生约90PB数据)与处理快(批处理、流处理);电商实时分析用户行为并推送商品Value(价值)价值密度低,以小区监控视频为例——大量日常数据无价值,仅事件片段有价值,但需投入大量资源存储全部数据大数据发展历程从概念到战略,大数据成为国家竞争力核心1980—2006萌芽期:概念提出与技术积淀1980年,托夫勒首次提出"大数据"概念互联网普及带来数据量爆炸式增长Google三篇论文奠定分布式技术基础Hadoop标志分布式计算技术成熟2011—2012成长期:技术突破与全球关注IBM"沃森"战胜人类;麦肯锡宣告"大数据时代"联合国发布《大数据开发》报告经合组织、世行等加速大数据研究2015—2023应用期:政策驱动与产业落地政策持续加码,数据要素战略地位不断提升大数据应用与技术体系大数据在各行业的应用行业或领域应用方向制造业产品故障诊断与预测、工艺流程优化、能耗管理、供应链分析金融行业高频交易策略、市场情绪分析、动态信用风险评估汽车行业自动驾驶技术研发、车辆性能提升、预防性维护电商行业精准用户画像、个性化推荐、广告投放与营销优化餐饮行业菜品推荐、门店选址优化、客流分析、供应链智能管理电信行业客户离网预警、网络资源优化分配能源行业智能电网运营、用电负荷预测、分布式能源管理物流行业运输路径优化、仓储智能布局、大数据决策支持城市管理智能交通调控、环境监测预警、公共安全感知、基础设施规划生物与医学精准医疗、疾病风险预测、临床辅助决策、药物研发与基因组学大数据技术核心流程核心流程功能数据采集与预处理从多渠道获取原始数据,通过清洗、转换和集成将数据转化为可用状态数据存储与管理利用分布式文件系统、数据仓库、NoSQL数据库等技术实现海量数据存储管理数据处理与分析利用分布式并行计算框架,结合机器学习算法,实现数据分析和可视化数据安全与治理构建数据安全体系和隐私保护体系,有效保护数据安全和个人隐私大数据存储系统与基本形式互联网数据存储数据规模庞大、增长迅速,催生大数据处理技术体系个人、企业和机构数据存储智能手机、信息系统持续产生数据,传统技术难以满足科学计算数据存储高性能计算机使实验数据量急剧增长数据挖掘与人工智能人脸检测、物体追踪等依赖大量数据存储数据归档不常用数据需完善索引,确保快速检索分布式文件系统多机扩展,统一目录树适合非结构化数据,提供文件级操作分布式键值对结构简单,易于大规模扩展许多数据库底层采用此机制分布式数据库关系数据库向分布式架构演进支持关系运算,多节点协同提高性能大数据存储关键技术大数据存储涵盖五项关键技术扩展性·可靠性·共享扩展性技术数据与访问负载均衡,支持动态扩容,避免热点集中可靠性与容灾保障技术副本技术防节点故障;冗余备份与容灾机制应对数据中心级灾难数据共享技术多应用安全流通,权限控制,支撑科学计算多级流程衔接优化·编码重复数据删除技术识别冗余数据,提升空间与带宽利用率,降低存储成本纠删码技术编码替代副本,消除冗余,保障可靠性同时处理多节点并发故障Hadoop概述Hadoop的发展简史2004年开发NDFS受GFS启发,开发Nutch分布式文件系统2006年纳入Hadoop项目NDFS和MapReduce被纳入Hadoop项目2008年Apache顶级项目成为Apache顶级项目,大数据时代最具影响力的开源分布式平台之一核心特性存储与计算分布式存储HDFS分块存储,高可靠可扩展分布式计算MapReduce并行计算数据本地性就近计算,提升性能系统能力可扩展性按需增减节点容错性自动故障处理,任务重分配多种数据处理方式批处理、流处理等开放性和生态系统开源社区丰富应用现状阿里巴巴淘宝集群,日处理数万个任务百度日志存储统计、网页分析挖掘、商业分析、在线数据反馈HDFS分布式文件系统HDFS——高容错分布式文件系统,采用一次写入多次读取模式,提供高吞吐量流式访问,支撑PB级超大文件存储五大核心特点高容错性数据多副本存储,自动故障检测与恢复流式数据访问顺序读取大规模数据集,支

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论