大数据实践课件 Spark SQL_第1页
大数据实践课件 Spark SQL_第2页
大数据实践课件 Spark SQL_第3页
大数据实践课件 Spark SQL_第4页
大数据实践课件 Spark SQL_第5页
已阅读5页,还剩51页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第六章Spark

SQL6.1

SparkSQL简介6.2分布式SQL引擎6.3使用DataFrame

API处理结构化数据习题第六章SparkSQL6.1SparkSQL简介6.6.1SparkSQL简介第六章SparkSQLSpark的结构化数据处理模块

提供分布式SQL查询引擎提供处理结构化数据的编程接口DataFrame6.1SparkSQL简介第六章SparkSQLSp第六章SparkSQL6.1SparkSQL简介Spark支持的结构化数据源第六章SparkSQL6.1SparkSQL简介Sp第六章SparkSQL6.1SparkSQL简介分布式SQL引擎的使用场景JDBC/ODBC命令行第六章SparkSQL6.1SparkSQL简介分布第六章SparkSQL6.1SparkSQL简介DataFrame编程接口的使用第六章SparkSQL6.1SparkSQL简介DaSparkSQL特性兼容Hive与Spark程序无缝集成统一的数据访问方法兼容Hive的数据、查询、用户定义函数在Spark程序中使用DataFrame

API或SQL处理结构化数据第六章SparkSQLDataFrame

API与SQL类似,提供了一种操作结构化数据的标准方法6.1SparkSQL简介多数据源支持HDFS、Hive、HBase、Parquet等SparkSQL兼容Hive与Spark程序无缝集成统一的第六章SparkSQL6.1SparkSQL简介SparkSQL架构第六章SparkSQL6.1SparkSQL简介Sp第六章SparkSQL6.1SparkSQL简介SparkSQL原理–Catalyst优化器第六章SparkSQL6.1SparkSQL简介Sp第六章Spark

SQL6.2

分布式SQL引擎6.1SparkSQL简介6.3使用DataFrame

API处理结构化数据习题第六章SparkSQL6.2分布式SQL引擎6.1第六章SparkSQL6.2分布式SQL引擎SparkSQL环境配置机器名Spark角色Hadoop角色IP地址cloud1

Master

NameNodeSecondaryNameNodeResourceManager

192.168.100.10

cloud2

SlaveMySQL元数据库

DataNodeNodeManager

192.168.100.11

cloud3

SlaveThriftJDBC/ODBCServer

DataNodeNodeManager

192.168.100.12

在第五章Spark集群中增加MySQL元数据库和ThriftJDBC/ODBCServer第六章SparkSQL6.2分布式SQL引擎Spark第六章SparkSQL6.2分布式SQL引擎MySQL元数据库搭建准备MySQL数据库创建数据库用户sparksql创建元数据库hiveMetastoreMySQL-connector的配置下载mysql-connector-java-5.1.41-bin.jar

配置conf/spark-env.sh

配置hive-site.xml第六章SparkSQL6.2分布式SQL引擎MySQL第六章SparkSQL6.2分布式SQL引擎使用SparkSQLCLI启动Spark

SQL

CLIcd~/spark-2.1.0-bin-hadoop2.7./bin/spark-sql第六章SparkSQL6.2分布式SQL引擎使用Spa第六章SparkSQL6.2分布式SQL引擎使用SparkSQLCLI使用SQL操作数据常用数据操作SQL创建数据库createdatabasemytestdb

查看数据库showdatabases

指定当前数据库use

mytestdb创建表createtabletest_tbl(idint,namestring,valueint)

查看表定义desctest_tbl

列出所有表showtables

插入数据insertintotabletest_tblvalues(0,"blue",10)

查询数据select*fromtest_tbl

where

value>15删除表drop

table

test_tbl删除数据库drop

database

mytestdb第六章SparkSQL6.2分布式SQL引擎使用Spa第六章SparkSQL6.2分布式SQL引擎Thrift

JDBC/ODBC

Server的搭建与测试启动Thrift

JDBC/ODBC

Server./sbin/start-thriftserver.sh查看日志,检查是否启动成功:使用netstat命令查看thrift

server监听的端口号:第六章SparkSQL6.2分布式SQL引擎Thrif第六章SparkSQL6.2分布式SQL引擎Thrift

JDBC/ODBC

Server的搭建与测试使用Beeline测试Thrift

JDBC/ODBC

Server启动beeline./bin/beeline连接Thrift

JDBC/ODBC

Server!connect

jdbc:hive2://cloud3:10000第六章SparkSQL6.2分布式SQL引擎Thrif第六章SparkSQL6.2分布式SQL引擎Thrift

JDBC/ODBC

Server的搭建与测试使用SQL操作数据查看数据库:指定当前数据库:usemytestdb第六章SparkSQL6.2分布式SQL引擎Thrif第六章SparkSQL6.2分布式SQL引擎Thrift

JDBC/ODBC

Server的搭建与测试使用SQL操作数据查看数据库中的表:查询数据:第六章SparkSQL6.2分布式SQL引擎Thrif第六章Spark

SQL6.3

使用DataFrameAPI处理结构化数据6.1SparkSQL简介6.2

分布式SQL引擎习题第六章SparkSQL6.3使用DataFrameA第六章SparkSQL6.3使用DataFrameAPI处理结构化数据准备工作准备多行Json数据格式文件test.json上传文件至Hadoop

hdfs中./bin/hadoopfs-put./test.json/testdata/

第六章SparkSQL6.3使用DataFrameA第六章SparkSQL6.3使用DataFrameAPI处理结构化数据使用SparkShell编写程序启动Spark

Shell./bin/spark-shell读取json文件

过滤选择数据第六章SparkSQL6.3使用DataFrameA第六章SparkSQL6.3使用DataFrameAPI处理结构化数据使用SparkShell编写程序选择字段输出结果第六章SparkSQL6.3使用DataFrameA第六章SparkSQL6.3使用DataFrameAPI处理结构化数据使用SparkShell编写程序通过Spark

Web查看Spark

SQL的执行情况第六章SparkSQL6.3使用DataFrameA第六章SparkSQL6.3使用DataFrameAPI处理结构化数据使用SparkShell编写程序DataFrame转换流程第六章SparkSQL6.3使用DataFrameA第六章SparkSQL6.3使用DataFrameAPI处理结构化数据使用SparkShell编写程序分析后的逻辑计划优化后的逻辑计划第六章SparkSQL6.3使用DataFrameA第六章SparkSQL6.3使用DataFrameAPI处理结构化数据使用SparkShell编写程序物理计划第六章SparkSQL6.3使用DataFrameA第六章Spark

SQL习题6.1SparkSQL简介6.2

分布式SQL引擎6.3使用DataFrameAPI处理结构化数据第六章SparkSQL习题6.1SparkSQL1.SparkSQL作为分布式SQL引擎有哪几种使用方法?2.SparkSQL中的DataFrame与RDD有何区别?3.DataFrameAPI支持哪些数据源?请列举3个。4.Catalyst优化器对DataFrame操作优化吗?5.SparkSQLCLI的元数据库和数据默认情况下分别存在什么地方?习题:1.SparkSQL作为分布式SQL引擎有哪几种使用方法?感谢聆听感谢聆听第六章Spark

SQL6.1

SparkSQL简介6.2分布式SQL引擎6.3使用DataFrame

API处理结构化数据习题第六章SparkSQL6.1SparkSQL简介6.6.1SparkSQL简介第六章SparkSQLSpark的结构化数据处理模块

提供分布式SQL查询引擎提供处理结构化数据的编程接口DataFrame6.1SparkSQL简介第六章SparkSQLSp第六章SparkSQL6.1SparkSQL简介Spark支持的结构化数据源第六章SparkSQL6.1SparkSQL简介Sp第六章SparkSQL6.1SparkSQL简介分布式SQL引擎的使用场景JDBC/ODBC命令行第六章SparkSQL6.1SparkSQL简介分布第六章SparkSQL6.1SparkSQL简介DataFrame编程接口的使用第六章SparkSQL6.1SparkSQL简介DaSparkSQL特性兼容Hive与Spark程序无缝集成统一的数据访问方法兼容Hive的数据、查询、用户定义函数在Spark程序中使用DataFrame

API或SQL处理结构化数据第六章SparkSQLDataFrame

API与SQL类似,提供了一种操作结构化数据的标准方法6.1SparkSQL简介多数据源支持HDFS、Hive、HBase、Parquet等SparkSQL兼容Hive与Spark程序无缝集成统一的第六章SparkSQL6.1SparkSQL简介SparkSQL架构第六章SparkSQL6.1SparkSQL简介Sp第六章SparkSQL6.1SparkSQL简介SparkSQL原理–Catalyst优化器第六章SparkSQL6.1SparkSQL简介Sp第六章Spark

SQL6.2

分布式SQL引擎6.1SparkSQL简介6.3使用DataFrame

API处理结构化数据习题第六章SparkSQL6.2分布式SQL引擎6.1第六章SparkSQL6.2分布式SQL引擎SparkSQL环境配置机器名Spark角色Hadoop角色IP地址cloud1

Master

NameNodeSecondaryNameNodeResourceManager

192.168.100.10

cloud2

SlaveMySQL元数据库

DataNodeNodeManager

192.168.100.11

cloud3

SlaveThriftJDBC/ODBCServer

DataNodeNodeManager

192.168.100.12

在第五章Spark集群中增加MySQL元数据库和ThriftJDBC/ODBCServer第六章SparkSQL6.2分布式SQL引擎Spark第六章SparkSQL6.2分布式SQL引擎MySQL元数据库搭建准备MySQL数据库创建数据库用户sparksql创建元数据库hiveMetastoreMySQL-connector的配置下载mysql-connector-java-5.1.41-bin.jar

配置conf/spark-env.sh

配置hive-site.xml第六章SparkSQL6.2分布式SQL引擎MySQL第六章SparkSQL6.2分布式SQL引擎使用SparkSQLCLI启动Spark

SQL

CLIcd~/spark-2.1.0-bin-hadoop2.7./bin/spark-sql第六章SparkSQL6.2分布式SQL引擎使用Spa第六章SparkSQL6.2分布式SQL引擎使用SparkSQLCLI使用SQL操作数据常用数据操作SQL创建数据库createdatabasemytestdb

查看数据库showdatabases

指定当前数据库use

mytestdb创建表createtabletest_tbl(idint,namestring,valueint)

查看表定义desctest_tbl

列出所有表showtables

插入数据insertintotabletest_tblvalues(0,"blue",10)

查询数据select*fromtest_tbl

where

value>15删除表drop

table

test_tbl删除数据库drop

database

mytestdb第六章SparkSQL6.2分布式SQL引擎使用Spa第六章SparkSQL6.2分布式SQL引擎Thrift

JDBC/ODBC

Server的搭建与测试启动Thrift

JDBC/ODBC

Server./sbin/start-thriftserver.sh查看日志,检查是否启动成功:使用netstat命令查看thrift

server监听的端口号:第六章SparkSQL6.2分布式SQL引擎Thrif第六章SparkSQL6.2分布式SQL引擎Thrift

JDBC/ODBC

Server的搭建与测试使用Beeline测试Thrift

JDBC/ODBC

Server启动beeline./bin/beeline连接Thrift

JDBC/ODBC

Server!connect

jdbc:hive2://cloud3:10000第六章SparkSQL6.2分布式SQL引擎Thrif第六章SparkSQL6.2分布式SQL引擎Thrift

JDBC/ODBC

Server的搭建与测试使用SQL操作数据查看数据库:指定当前数据库:usemytestdb第六章SparkSQL6.2分布式SQL引擎Thrif第六章SparkSQL6.2分布式SQL引擎Thrift

JDBC/ODBC

Server的搭建与测试使用SQL操作数据查看数据库中的表:查询数据:第六章SparkSQL6.2分布式SQL引擎Thrif第六章Spark

SQL6.3

使用DataFrameAPI处理结构化数据6.1SparkSQL简介6.2

分布式SQL引擎习题第六章SparkSQL6.3使用DataFrameA第六章SparkSQL6.3使用DataFrameAPI处理结构化数据准备工作准备多行Json数据格式文件test.json上传文件至Hadoop

hdfs中./bin/hadoopfs-put./test.json/testdata/

第六章SparkSQL6.3使用DataFrameA第六章SparkSQL6.3使用DataFrameAPI处理结构化数据使用SparkShell编写程序启动Spark

Shell./bin/spark-shell读取json文件

过滤选择数据第六章SparkSQL6.3使用DataFrameA第六章SparkSQL6.3使用DataF

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论