《大数据平台部署与应用》 项目实施课件 项目4 部署与应用Flume_第1页
《大数据平台部署与应用》 项目实施课件 项目4 部署与应用Flume_第2页
《大数据平台部署与应用》 项目实施课件 项目4 部署与应用Flume_第3页
《大数据平台部署与应用》 项目实施课件 项目4 部署与应用Flume_第4页
《大数据平台部署与应用》 项目实施课件 项目4 部署与应用Flume_第5页
已阅读5页,还剩28页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

部署Flume任务描述在使用Flume采集农村电商网站服务器日志数据之前,需要在Linux操作系统中部署Flume。本任务中,小数将基于项目2中部署的Hadoop平台,在master虚拟机上部署单机版Flume。任务环境已部署完全分布式Hadoop集群的CentOS7操作系统的虚拟机(主节点)。任务描述与任务环境分布式部署分布式部署模式主要用于复杂的数据流管理或大数据量的采集任务,即数据流向复杂,如从多个数据源到多个数据存储目的地,或者是数据量较大,需要跨网络中的多个机器进行数据聚合、路由和可靠传输的数据采集任务。分布式部署可以利用Flume的强大特性,如故障转移、负载均衡、多路径传输等,来确保数据的高可用性和高可靠性。该模式主要用于企业中的大规模数据中心、云环境或者需要处理高速、持续产生的数据流等场景中。Flume的部署模式单机版部署单机版部署模式主要用于简单数据流或小型数据的采集任务,即数据流向简单,如从单一数据源到单一数据存储目的地,或者是数据量较小,且不需要跨机器进行数据聚合的数据采集任务。由于单机版Flume占用资源较少,因此可以直接部署在小型服务器或个人计算机,且单机版Flume可以快速部署和测试配置的有效性,更适合于初学者。Flume的部署模式目录1解压Flume下载Flume2修改Flume名称3修改配置文件4查看Flume版本5从Flume官网下载Flume安装包“apache-flume-1.9.0-bin.tar.gz”。使用Xftp8远程传输工具将Flume安装包传输至master虚拟机的/opt/software目录下。下载Flume目录1解压Flume下载Flume2修改Flume名称3修改配置文件4查看Flume版本5在master虚拟机解压安装包apache-flume-1.9.0-bin.tar.gz至/opt/module目录下。解压操作完成后查看解压目录,结果中能够看到“apache-flume-1.9.0-bin”,说明文件已解压成功。解压Flume目录1解压Flume下载Flume2修改Flume名称3修改配置文件4查看Flume版本5修改apache-flume-1.9.0-bin的名称为flume-1.9.0。修改Flume名称目录1解压Flume下载Flume2修改Flume名称3修改配置文件4查看Flume版本5执行“vim/etc/profile”命令进入/etc/profile文件中配置环境变量,在文件末尾添加Flume环境变量并保存退出。执行“source/etc/profile”命令使环境变量立即生效。修改配置文件将Flume安装目录下的conf目录里面的flume-env.sh.template文件重命名为flume-env.sh。执行“vimflume-env.sh”命令配置flume-env.sh文件,在flume-env.sh文件中添加Java环境变量。修改配置文件将Flume安装目录下的lib目录里面的guava-11.0.2.jar删除以兼容3.1.3版本的Hadoop。修改配置文件在Hadoop生态系统中,组件之间的版本冲突通常与guava库的Jar包有关。由于Hadoop中可能包含较新的guava版本,这可能会导致与其他组件或库中的guava版本不兼容。为了解决这种冲突,通常需要先删除其他组件中旧版本的guava库的Jar包,再将Hadoop中的新版本的guava库的Jar包复制到其他组件的依赖中,通常为lib文件夹。目录1解压Flume下载Flume2修改Flume名称3修改配置文件4查看Flume版本5查看Flume版本,若出现如下内容,则说明单机版Flume部署成功。查看Flume版本“flume-ng”命令代表的是从Flume1.0.0版本开始的FlumeNG(NextGeneration),而Flume的早期版本,即0.9.x系列,被称作FlumeOG(OriginalGeneration)。使用Flume采集农村电商网站服务器日志数据任务描述在成功部署Flume后,小数将配合数据采集工程师,使用搭建好的采集环境进行模拟,实时捕获农村电商网站服务器生成的日志文件access.log,并将其保存到HDFS中。任务环境已部署完全分布式Hadoop集群的3台CentOS7操作系统的虚拟机,且主节点已部署单机版Flume。任务描述与任务环境农村电商网站服务器生成的日志文件access.log日志文件部分数据如下。数据示例access.log部分数据1--[22/Jan/2023:03:56:14+0330]"GET/filter/27|13%20%D9%85%DA%AF%D8%A7%D9%BE%DB%8C%DA%A9%D8%B3%D9%84,27|%DA%A9%D9%85%D8%AA%D8%B1%20%D8%A7%D8%B2%205%20%D9%85%DA%AF%D8%A7%D9%BE%DB%8C%DA%A9%D8%B3%D9%84,p53HTTP/1.1"20030577"-""Mozilla/5.0(compatible;AhrefsBot/6.1;+http://***/robot/)""-"1--[22/Jan/2023:03:56:16+0330]"GET/image/60844/productModel/200x200HTTP/1.1"2005667"https://***/m/filter/b113""Mozilla/5.0(Linux;Android6.0;ALE-L21Build/HuaweiALE-L21)AppleWebKit/537.36(KHTML,likeGecko)Chrome/66.0.3359.158MobileSafari/537.36""-"1--[22/Jan/2023:03:56:16+0330]"GET/image/61474/productModel/200x200HTTP/1.1"2005379"https://***/m/filter/b113""Mozilla/5.0(Linux;Android6.0;ALE-L21Build/HuaweiALE-L21)AppleWebKit/537.36(KHTML,likeGecko)Chrome/66.0.3359.158MobileSafari/537.36""-"目录1编写采集脚本定时抽取数据2启动采集程序3将农村电商网站服务器日志文件access.log和抽取日志的脚本文件createLog.sh上传至master虚拟机的/opt/data目录下。createLog.sh脚本文件用于从access.log文件中随机抽取100行数据并存储至/opt/flumeproject。注意:需先在master虚拟机的/opt目录下创建新文件夹flumeproject,用于存放抽取的数据。定时抽取数据在master虚拟机输入代码“crontab-e”,编辑定时任务。在定时任务中输入内容“*****sh/opt/data/createLog.sh”,模拟日志文件的产生。定时抽取数据crontab是Linux系统中用于调度定时任务的工具,它允许用户按照预定的时间间隔执行特定的命令或脚本。crontab的时间格式采用5个空格分隔的字段,分别代表不同的时间单位,格式为“分钟小时日期月份星期命令”。等待几分钟后,在/opt/flumeproject目录下查看定时生成的日志文件。定时抽取数据目录1编写采集脚本定时抽取数据2启动采集程序3编写Flume采集脚本,实现采集日志文件并保存至HDFS的配置,Flume采集脚本具体配置如下:Source:SpoolingDirectorySource,表示从本地目录中采集数据Sink:HDFSSink,表示将数据写入HDFS文件系统上Channel:FileChannel,表示将数据存储在磁盘上的文件中编写采集脚本编写采集脚本编写采集脚本目录1编写采集脚本定时抽取数据2启动采集程序3先启动Hadoop集群,再启动FlumeAgent程序采集农村电商网站服务器日志数据。Flume采集命令说明如下。启动采集程序命令说明/opt/module/flume-1.9.0/bin/flume-ngagent通过flume-ng命令启动FlumeAgent-c/opt/module/flume-1.9.0/conf指定Flume配置文件所在的目录-f/opt/module/flume-1.9.0/conf/spool-file-hdfs.conf指定具体的采集配置文件的名称-na指定配置文件中的Agent的名称-Dflume.root.logger=INFO,console指定Flume的日志级别为INFO,并输出到控制台采集配置文件不必局限于Flume安装路径下的

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论