版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第六章Spark
SQL6.1
SparkSQL简介6.2分布式SQL引擎6.3使用DataFrame
API处理结构化数据习题第六章SparkSQL6.1SparkSQL简介6.6.1SparkSQL简介第六章SparkSQLSpark的结构化数据处理模块
提供分布式SQL查询引擎提供处理结构化数据的编程接口DataFrame6.1SparkSQL简介第六章SparkSQLSp第六章SparkSQL6.1SparkSQL简介Spark支持的结构化数据源第六章SparkSQL6.1SparkSQL简介Sp第六章SparkSQL6.1SparkSQL简介分布式SQL引擎的使用场景JDBC/ODBC命令行第六章SparkSQL6.1SparkSQL简介分布第六章SparkSQL6.1SparkSQL简介DataFrame编程接口的使用第六章SparkSQL6.1SparkSQL简介DaSparkSQL特性兼容Hive与Spark程序无缝集成统一的数据访问方法兼容Hive的数据、查询、用户定义函数在Spark程序中使用DataFrame
API或SQL处理结构化数据第六章SparkSQLDataFrame
API与SQL类似,提供了一种操作结构化数据的标准方法6.1SparkSQL简介多数据源支持HDFS、Hive、HBase、Parquet等SparkSQL兼容Hive与Spark程序无缝集成统一的第六章SparkSQL6.1SparkSQL简介SparkSQL架构第六章SparkSQL6.1SparkSQL简介Sp第六章SparkSQL6.1SparkSQL简介SparkSQL原理–Catalyst优化器第六章SparkSQL6.1SparkSQL简介Sp第六章Spark
SQL6.2
分布式SQL引擎6.1SparkSQL简介6.3使用DataFrame
API处理结构化数据习题第六章SparkSQL6.2分布式SQL引擎6.1第六章SparkSQL6.2分布式SQL引擎SparkSQL环境配置机器名Spark角色Hadoop角色IP地址cloud1
Master
NameNodeSecondaryNameNodeResourceManager
192.168.100.10
cloud2
SlaveMySQL元数据库
DataNodeNodeManager
192.168.100.11
cloud3
SlaveThriftJDBC/ODBCServer
DataNodeNodeManager
192.168.100.12
在第五章Spark集群中增加MySQL元数据库和ThriftJDBC/ODBCServer第六章SparkSQL6.2分布式SQL引擎Spark第六章SparkSQL6.2分布式SQL引擎MySQL元数据库搭建准备MySQL数据库创建数据库用户sparksql创建元数据库hiveMetastoreMySQL-connector的配置下载mysql-connector-java-5.1.41-bin.jar
配置conf/spark-env.sh
配置hive-site.xml第六章SparkSQL6.2分布式SQL引擎MySQL第六章SparkSQL6.2分布式SQL引擎使用SparkSQLCLI启动Spark
SQL
CLIcd~/spark-2.1.0-bin-hadoop2.7./bin/spark-sql第六章SparkSQL6.2分布式SQL引擎使用Spa第六章SparkSQL6.2分布式SQL引擎使用SparkSQLCLI使用SQL操作数据常用数据操作SQL创建数据库createdatabasemytestdb
查看数据库showdatabases
指定当前数据库use
mytestdb创建表createtabletest_tbl(idint,namestring,valueint)
查看表定义desctest_tbl
列出所有表showtables
插入数据insertintotabletest_tblvalues(0,"blue",10)
查询数据select*fromtest_tbl
where
value>15删除表drop
table
test_tbl删除数据库drop
database
mytestdb第六章SparkSQL6.2分布式SQL引擎使用Spa第六章SparkSQL6.2分布式SQL引擎Thrift
JDBC/ODBC
Server的搭建与测试启动Thrift
JDBC/ODBC
Server./sbin/start-thriftserver.sh查看日志,检查是否启动成功:使用netstat命令查看thrift
server监听的端口号:第六章SparkSQL6.2分布式SQL引擎Thrif第六章SparkSQL6.2分布式SQL引擎Thrift
JDBC/ODBC
Server的搭建与测试使用Beeline测试Thrift
JDBC/ODBC
Server启动beeline./bin/beeline连接Thrift
JDBC/ODBC
Server!connect
jdbc:hive2://cloud3:10000第六章SparkSQL6.2分布式SQL引擎Thrif第六章SparkSQL6.2分布式SQL引擎Thrift
JDBC/ODBC
Server的搭建与测试使用SQL操作数据查看数据库:指定当前数据库:usemytestdb第六章SparkSQL6.2分布式SQL引擎Thrif第六章SparkSQL6.2分布式SQL引擎Thrift
JDBC/ODBC
Server的搭建与测试使用SQL操作数据查看数据库中的表:查询数据:第六章SparkSQL6.2分布式SQL引擎Thrif第六章Spark
SQL6.3
使用DataFrameAPI处理结构化数据6.1SparkSQL简介6.2
分布式SQL引擎习题第六章SparkSQL6.3使用DataFrameA第六章SparkSQL6.3使用DataFrameAPI处理结构化数据准备工作准备多行Json数据格式文件test.json上传文件至Hadoop
hdfs中./bin/hadoopfs-put./test.json/testdata/
第六章SparkSQL6.3使用DataFrameA第六章SparkSQL6.3使用DataFrameAPI处理结构化数据使用SparkShell编写程序启动Spark
Shell./bin/spark-shell读取json文件
过滤选择数据第六章SparkSQL6.3使用DataFrameA第六章SparkSQL6.3使用DataFrameAPI处理结构化数据使用SparkShell编写程序选择字段输出结果第六章SparkSQL6.3使用DataFrameA第六章SparkSQL6.3使用DataFrameAPI处理结构化数据使用SparkShell编写程序通过Spark
Web查看Spark
SQL的执行情况第六章SparkSQL6.3使用DataFrameA第六章SparkSQL6.3使用DataFrameAPI处理结构化数据使用SparkShell编写程序DataFrame转换流程第六章SparkSQL6.3使用DataFrameA第六章SparkSQL6.3使用DataFrameAPI处理结构化数据使用SparkShell编写程序分析后的逻辑计划优化后的逻辑计划第六章SparkSQL6.3使用DataFrameA第六章SparkSQL6.3使用DataFrameAPI处理结构化数据使用SparkShell编写程序物理计划第六章SparkSQL6.3使用DataFrameA第六章Spark
SQL习题6.1SparkSQL简介6.2
分布式SQL引擎6.3使用DataFrameAPI处理结构化数据第六章SparkSQL习题6.1SparkSQL1.SparkSQL作为分布式SQL引擎有哪几种使用方法?2.SparkSQL中的DataFrame与RDD有何区别?3.DataFrameAPI支持哪些数据源?请列举3个。4.Catalyst优化器对DataFrame操作优化吗?5.SparkSQLCLI的元数据库和数据默认情况下分别存在什么地方?习题:1.SparkSQL作为分布式SQL引擎有哪几种使用方法?感谢聆听感谢聆听第六章Spark
SQL6.1
SparkSQL简介6.2分布式SQL引擎6.3使用DataFrame
API处理结构化数据习题第六章SparkSQL6.1SparkSQL简介6.6.1SparkSQL简介第六章SparkSQLSpark的结构化数据处理模块
提供分布式SQL查询引擎提供处理结构化数据的编程接口DataFrame6.1SparkSQL简介第六章SparkSQLSp第六章SparkSQL6.1SparkSQL简介Spark支持的结构化数据源第六章SparkSQL6.1SparkSQL简介Sp第六章SparkSQL6.1SparkSQL简介分布式SQL引擎的使用场景JDBC/ODBC命令行第六章SparkSQL6.1SparkSQL简介分布第六章SparkSQL6.1SparkSQL简介DataFrame编程接口的使用第六章SparkSQL6.1SparkSQL简介DaSparkSQL特性兼容Hive与Spark程序无缝集成统一的数据访问方法兼容Hive的数据、查询、用户定义函数在Spark程序中使用DataFrame
API或SQL处理结构化数据第六章SparkSQLDataFrame
API与SQL类似,提供了一种操作结构化数据的标准方法6.1SparkSQL简介多数据源支持HDFS、Hive、HBase、Parquet等SparkSQL兼容Hive与Spark程序无缝集成统一的第六章SparkSQL6.1SparkSQL简介SparkSQL架构第六章SparkSQL6.1SparkSQL简介Sp第六章SparkSQL6.1SparkSQL简介SparkSQL原理–Catalyst优化器第六章SparkSQL6.1SparkSQL简介Sp第六章Spark
SQL6.2
分布式SQL引擎6.1SparkSQL简介6.3使用DataFrame
API处理结构化数据习题第六章SparkSQL6.2分布式SQL引擎6.1第六章SparkSQL6.2分布式SQL引擎SparkSQL环境配置机器名Spark角色Hadoop角色IP地址cloud1
Master
NameNodeSecondaryNameNodeResourceManager
192.168.100.10
cloud2
SlaveMySQL元数据库
DataNodeNodeManager
192.168.100.11
cloud3
SlaveThriftJDBC/ODBCServer
DataNodeNodeManager
192.168.100.12
在第五章Spark集群中增加MySQL元数据库和ThriftJDBC/ODBCServer第六章SparkSQL6.2分布式SQL引擎Spark第六章SparkSQL6.2分布式SQL引擎MySQL元数据库搭建准备MySQL数据库创建数据库用户sparksql创建元数据库hiveMetastoreMySQL-connector的配置下载mysql-connector-java-5.1.41-bin.jar
配置conf/spark-env.sh
配置hive-site.xml第六章SparkSQL6.2分布式SQL引擎MySQL第六章SparkSQL6.2分布式SQL引擎使用SparkSQLCLI启动Spark
SQL
CLIcd~/spark-2.1.0-bin-hadoop2.7./bin/spark-sql第六章SparkSQL6.2分布式SQL引擎使用Spa第六章SparkSQL6.2分布式SQL引擎使用SparkSQLCLI使用SQL操作数据常用数据操作SQL创建数据库createdatabasemytestdb
查看数据库showdatabases
指定当前数据库use
mytestdb创建表createtabletest_tbl(idint,namestring,valueint)
查看表定义desctest_tbl
列出所有表showtables
插入数据insertintotabletest_tblvalues(0,"blue",10)
查询数据select*fromtest_tbl
where
value>15删除表drop
table
test_tbl删除数据库drop
database
mytestdb第六章SparkSQL6.2分布式SQL引擎使用Spa第六章SparkSQL6.2分布式SQL引擎Thrift
JDBC/ODBC
Server的搭建与测试启动Thrift
JDBC/ODBC
Server./sbin/start-thriftserver.sh查看日志,检查是否启动成功:使用netstat命令查看thrift
server监听的端口号:第六章SparkSQL6.2分布式SQL引擎Thrif第六章SparkSQL6.2分布式SQL引擎Thrift
JDBC/ODBC
Server的搭建与测试使用Beeline测试Thrift
JDBC/ODBC
Server启动beeline./bin/beeline连接Thrift
JDBC/ODBC
Server!connect
jdbc:hive2://cloud3:10000第六章SparkSQL6.2分布式SQL引擎Thrif第六章SparkSQL6.2分布式SQL引擎Thrift
JDBC/ODBC
Server的搭建与测试使用SQL操作数据查看数据库:指定当前数据库:usemytestdb第六章SparkSQL6.2分布式SQL引擎Thrif第六章SparkSQL6.2分布式SQL引擎Thrift
JDBC/ODBC
Server的搭建与测试使用SQL操作数据查看数据库中的表:查询数据:第六章SparkSQL6.2分布式SQL引擎Thrif第六章Spark
SQL6.3
使用DataFrameAPI处理结构化数据6.1SparkSQL简介6.2
分布式SQL引擎习题第六章SparkSQL6.3使用DataFrameA第六章SparkSQL6.3使用DataFrameAPI处理结构化数据准备工作准备多行Json数据格式文件test.json上传文件至Hadoop
hdfs中./bin/hadoopfs-put./test.json/testdata/
第六章SparkSQL6.3使用DataFrameA第六章SparkSQL6.3使用DataFrameAPI处理结构化数据使用SparkShell编写程序启动Spark
Shell./bin/spark-shell读取json文件
过滤选择数据第六章SparkSQL6.3使用DataFrameA第六章SparkSQL6.3使用DataF
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2025-2026学年一年级下体育备课说课稿
- 2025-2026学年上学途中说课稿
- 水路危险货物运输员安全规程水平考核试卷含答案
- 搅拌工岗前实操知识实践考核试卷含答案
- 淡水捕捞工岗前安全知识宣贯考核试卷含答案
- 纤维板原料制备工安全理论考核试卷含答案
- 露天采矿单斗铲司机岗位行为意识考核试卷含答案
- 电力电缆安装运维工岗中达标考核试卷含答案
- 纺织纤维梳理工安全文化知识考核试卷含答案
- 甲醇制烯烃操作工岗中技术水平考核试卷含答案
- T/QX 011-2025管壳式热交换器管程高压水射流机械化清洗作业安全规范
- 小学生综合素质评价方案
- 小型水库除险加固项目地质灾害危险性评估报告
- 2026年度广东省珠海市交通事故人身损害赔偿标准和计算公式
- 高炉冲渣系统煤气中毒事故现场处置方案培训
- 2026年渠道维护工(技师)技能理论考试题库(含答案)
- 小学四年级上册计算题专项练习(30天每日一练 可直接打印 )
- 八年级劳动国家质量监测考试模拟卷(四)
- 新时代中职生礼仪规范全套课件
- 内保单位安全管理条例
- 肘关节超声病变的超声诊断与评估
评论
0/150
提交评论