任务8.2 使用Hive实现铁路客流量分析_第1页
任务8.2 使用Hive实现铁路客流量分析_第2页
任务8.2 使用Hive实现铁路客流量分析_第3页
任务8.2 使用Hive实现铁路客流量分析_第4页
任务8.2 使用Hive实现铁路客流量分析_第5页
已阅读5页,还剩19页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

使用Hive实现铁路客流量分析任务描述在部署好本好模式的Hive后,小数需对其部分功能进行验证,他打算使用Hive对铁路部门提供的数据进行存储和和管理,并实现客流量分析。任务环境已部署Hadoop集群和本地模式Hive(master节点)的3台CentOS7操作系统的虚拟机。任务描述与任务环境本任务所使用的数据是铁路部门抽取的某线路1~3月的车次数据、客流数据进行合并与预处理后的数据,可直接用于铁路客流量分析,部分数据示例如下。数据示例站点上车人数/人下车人数/人开行日期车次出发日期离站时间到站时间ST326982770109—0109GT1301-0917:1317:12ST326982890304—0304GT1003-0415:2915:28ST326991910115—0115GT1301-1517:1317:12ST326992160121—0121GT0801-2113:4313:41ST326993350115—0115GT1001-1515:2915:28目录1在Hive中创建数据表上传铁路数据至HDFS2导入HDFS数据至Hive数据表3分析不同站点客流量分布4在master虚拟机中使用“mkdir/opt/data”命令创建目录/opt/data。之后先通过Xftp文件传输工具,上传“铁路车次与客流数据.csv”数据至/opt/data目录下。再启动Hadoop集群,并上传数据文件到HDFS的/user/hive/warehouse文件下。上传铁路数据至HDFS上传完成后,即可在浏览器HDFSWeb界面中查看到文件。上传铁路数据至HDFS目录1在Hive中创建数据表上传铁路数据至HDFS2导入HDFS数据至Hive数据表3分析不同站点客流量分布4启动Hive元数据服务并进入HiveCLI中,先创建train数据库并进入到train数据库中。在Hive中创建数据表创建用于存储“铁路车次与客流数据.csv”数据的train_passenger表。在Hive中创建数据表Hive支持使用中文字符创建表,为了确保系统能够准确识别和区分这些中文字符,需要使用反引号(`)将中文字符进行引用。然而,直接在Hive中创建带有中文字符的表时会出现如下报错。这是因为在执行建表语句时,需要更新Hive的元数据,而在Hive的元数据进行更新时,需要向元数据存储数据库MySQL的hive数据库的COLUMNS_V2表中插入表结构信息。报错信息中说明,在向MySQL中hive数据库的表COLUMNS_V2中插入字段名称时出现了问题。在Hive中创建数据表使用“mysql-uroot–p123456”命令登录MySQL服务器,查看数据库hive中的COLUMNS_V2表的创建语句。观察输出的信息,可以看到COLUMN_NAME字段的编码字符集为默认的latin1字符集,因此中文名无法识别。要想能识别中文字段名,需要将该字段的字符集编码改为utf8。在Hive中创建数据表通过SQL命令将COLUMN_NAME字段的字符集编码修改为utf8。修改字符集编码后,再创建带有中文字符的Hive表时,即可正常运行。在Hive中创建数据表建表成功后通过desc命令查看表结构。在Hive中创建数据表目录1在Hive中创建数据表上传铁路数据至HDFS2导入HDFS数据至Hive数据表3分析不同站点客流量分布4使用load命令将HDFS上的数据加载至Hive中创建的train_passenger结构表中。导入HDFS数据至Hive数据表通过先创表、再将查询到的数据导入至表中的方法,可以有效地管理数据,同时确保数据的准确性和一致性。这种方法有助于在处理数据时遵循一定的组织结构和模式,从而简化后续的数据分析和处理步骤。成功导入数据后使用“select*fromtrain_passengerlimit5;”命令查询数据前5行示例。查看数据前5行示例结果可看到结果中只有6个字段,这是由于该部分数据均为客车始发数据,因此并没有“下车人数/人”和“到站时间”两个字段。导入HDFS数据至Hive数据表通过“select*fromtrain_passenger;”命令查看全部数据,命令执行结果末尾如下。从结果可知表格总数据共有8135条,且最后5条数据中并无缺失值,均有8个字段。导入HDFS数据至Hive数据表目录1在Hive中创建数据表上传铁路数据至HDFS2导入HDFS数据至Hive数据表3分析不同站点客流量分布4为了提升各个站点的服务质量,铁路部门需要分析不同站点的客流量高低。从管理后的客流数据中提取出所有的站点,统计所有站点每天的日均上下车人数进行图形化展示。分析不同站点客流量分布从表名为train_passenger的数据表中选择出唯一的站点值,并将其列出。提取所有的站点数据将train_passenger表中的数据按站点进行分组,并计算每个站点的平均上车人数和平均下车人数,然后将结果存储到名为avg_table的新数据表中。计算不同站点的日均客流量使用“select*fromavg_table;”查看avg_table表。计算不同站点的日均客流量ST013站点只有上车人数且上车人数最高,此站点应该是线路的始发站;ST190-01站点只有下车人数且下车

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论