《大数据平台部署与应用》 项目实施课件 项目6 部署与应用Sqoop_第1页
《大数据平台部署与应用》 项目实施课件 项目6 部署与应用Sqoop_第2页
《大数据平台部署与应用》 项目实施课件 项目6 部署与应用Sqoop_第3页
《大数据平台部署与应用》 项目实施课件 项目6 部署与应用Sqoop_第4页
《大数据平台部署与应用》 项目实施课件 项目6 部署与应用Sqoop_第5页
已阅读5页,还剩28页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

部署Sqoop任务描述在使用Sqoop迁移中国工业产品产量数据之前,要先在平台中部署Sqoop,在本任务中,小数将基于项目2中部署的Hadoop集群,在master虚拟机上部署Sqoop。任务环境已部署完全分布式Hadoop集群的CentOS7操作系统的虚拟机(主节点)。任务描述与任务环境目录1解压Sqoop下载Sqoop2修改Sqoop名称3从Sqoop官网下载Sqoop安装包“sqoop-1.4.7.bin__hadoop-2.6.0.tar.gz”。使用Xftp8远程传输工具将Sqoop安装包传输至master虚拟机/opt/software目录下。下载Sqoop目录1解压Sqoop下载Sqoop2修改Sqoop名称3在master虚拟机解压安装包sqoop-1.4.7.bin__hadoop-2.6.0.tar.gz至/opt/module目录下。解压操作完成后查看解压目录,结果中能够看到“sqoop-1.4.7.bin__hadoop-2.6.0”,说明文件已解压成功。解压Sqoop目录1解压Sqoop下载Sqoop2修改Sqoop名称3修改sqoop-1.4.7.bin__hadoop-2.6.0的名称为sqoop-1.4.7。修改Sqoop名称目录4查看Sqoop版本修改配置文件5去除警告信息6执行“vim/etc/profile”命令进入文件中配置环境变量,在文件末尾添加Sqoop环境变量并保存退出。执行“source/etc/profile”命令使环境变量立即生效。修改配置文件进入Sqoop安装目录下的conf目录中,复制sqoop-env-template.sh文件并重命名。执行“vimsqoop-env.sh”命令修改sqoop-env.sh文件内容:修改HADOOP_COMMON_HOME以设置Hadoop路径修改HADOOP_MAPRED_HOME以设置hadoop-*-core.jar路径在配置文件中HADOOP_COMMON_HOME和HADOOP_MAPRED_HOME是必须配置的,其他配置(如Hive和HBase等路径)可以待后续需要时再进行添加。修改配置文件目录4查看Sqoop版本修改配置文件5去除警告信息6查看Sqoop版本,若出现如下内容,则说明Sqoop部署成功。查看Sqoop版本在查看Sqoop版本时返回的日志信息中包含了多个警告信息,这些警告的出现是由于在当前Hadoop集群环境中,未在配置文件或环境变量中指定如HBase和Accumulo等路径。由于这些警告信息不影响Sqoop的正常部署,因此可以不用对这些警告信息进行特别的处理或干预。目录4查看Sqoop版本修改配置文件5去除警告信息6Sqoop在启动时会去检查配置文件和环境变量中是否有配置相关组件路径,如果想去除这些警告,可以通过修改$SQOOP_HOME/bin/configure-sqoop文件。在文件中,对警告信息(HBase、HCatalog、Accumulo等路径)进行注释处理。去除警告信息再次查看Sqoop版本,可以发现警告已经去除成功。去除警告信息使用Sqoop实现中国工业产品产量数据迁移任务描述在部署好Sqoop之后,小需要配合数据迁移工程师,将散落在各个系统中的历史工业产品产量数据迁移至大数据平台,其中就包含在MySQL中的数据。在本任务中,小数将对大数据平台进行测试,将MySQL数据库中的中国工业产品产量数据迁移至HDFS上,并进行简单的数据查询操作。任务环境已部署完全分布式Hadoop集群的3台CentOS7操作系统的虚拟机,且主节点已部署MySQL和Sqoop。任务描述与任务环境中国工业产量数据来源于国家统计局统计的1998-2022年的工业产量数据,该数据集包括指标、年份、产量3个特征,部分中国工业产量数据如下。数据示例指标年份产量笔记本计算机产量(万台)202222717.83钢材产量(万吨)2022134033.48集成电路产量(万块)202232418500轿车产量(万辆)20221044.95水泥产量(万吨)2022212927.18原盐产量(万吨)20225359.88中成药产量(万吨)2022244.66重轨产量(万吨)2022355.49目录1使用Sqoop迁移MySQL表数据至HDFS在MySQL中创建数据表2中国工业产品产量数据是存储在某大型制造企业的系统数据库里,此处模拟存储在MySQL数据库中。在MySQL中创建表的实现流程如下。在MySQL中创建数据表在MySQL中创建数据库,数据库名为sqoop_data,并查看所有数据库。创建数据库在准备创建数据表时,可以选择不预先创建数据库,而是直接在默认数据库中建立数据表。这种方法虽然可行,但从数据管理的角度来看,它并非最佳方案。不创建独立数据库而直接在默认数据库中构建数据表,可能会导致数据组织不够清晰,从而在未来的数据维护、更新和检索过程中带来不便。因此,为了确保数据结构的合理性和管理的便捷性,建议在创建数据表之前先定义并创建相应的数据库。使用“usesqoop_data;”命令切换到创建的数据库sqoop_data。切换数据库创建数据表industrail_product_output,表字段包括“指标”“年份”和“产量”3列。创建MySQL表在MySQL中,若表名或字段名涉及关键字、中文、特殊字符或标点符号时,通常会使用反引号将其括起来,确保能够正常识别。查看表的字段及特征构成。创建MySQL表先将数据“1998-2022年中国工业产品产量.csv”上传至master虚拟机/opt/data目录下。通过load命令将数据导入创建好的表中导入数据至MySQL表中在将本地数据导入至MySQL中的数据表之前,应确保启用了客户端和服务器中的“local_infile”功能。启动客户端“local_infile”功能方法为在登录MySQL时加上“--local_infile”参数,如“mysql-uroot-p123456--local_infile”;启动服务器中的“local_infile”功能方法为进入MySQL后执行“setgloballocal_infile=ON;”命令。查看industrail_product_output表中的前10行数据。验证数据是否导入成功目录1使用Sqoop迁移MySQL表数据至HDFS在MySQL中创建数据表2启动Hadoop集群,之后通过import命令把MySQL中的表数据导入到HDFS中。使用Sqoop迁移MySQL表数据至HDFS在Linux操作系统中,若需要将一段长代码进行换行处理以提升可读性或便于管理,可以在代码行的末尾添加反斜杠符号“\”,这样系统会认为命令尚未结束,从而允许将代码延续到下一行。这种做法在处理复杂或长度超过终端窗口宽度的命令时尤为有用,通过恰当的换行,可以更有效地输入、查看和编辑代码,进而提高工作效率和代码维护的便捷性。import命令参数说明。使用Sqoop迁移MySQL表数据至HDFS参数参数解释参数--connect连接关系型数据库的URL数据库主机地址为master,端口号为3306,数据库名称为sqoop_data--driver指定JDBC驱动类的名称com.mysql.cj.jdbc.Driver--username连接数据库的用户名root--password连接数据库的密码123456--table指定要导入的表industrail_product_output--target-dir指定数据将要存储的目标目录保存到HDF的/production_data/mysql_data--num-mappers指定并行度,即同时运行的Ma

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论