版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
项目3大数据平台架构与Hadoop生态01小数据与大数据上网对比06集群与分布式计算02大数据平台核心架构07Hadoop版本与计算模式03Hadoop核心技术解析08Zookeeper集群管理04Hadoop生态系统全景09总结与展望CONTENTS目录05大数据平台典型应用01小数据与大数据上网对比S/C架构工作流程客户端向单一服务器发送请求,服务器处理后返回响应,结构简单但存在单点故障风险。B/S架构运行机制浏览器作为客户端,通过HTTP协议与服务器通信,依赖中心化服务节点。传统系统瓶颈分析单服务器并发能力有限,难以应对高流量访问;数据存储集中,扩展性差,维护成本高。性能局限性响应时间受单机性能制约,无法实现大规模数据实时处理。小数据时代网络架构大数据时代处理过程分布式架构优势将任务拆分到多个节点并行执行,显著提升处理效率。多层级数据流转数据从采集、存储、计算到分析形成完整闭环,支持复杂业务场景。弹性伸缩能力可根据负载动态增减节点数量,适应不同规模的数据处理需求。高可用保障机制多副本冗余存储,任一节点失效不影响整体服务连续性。大数据时代处理过程图3.1:小数据处理过程解析展示传统集中式架构的请求-响应流程,强调单一服务器核心地位。图3.2:大数据处理过程详解揭示分布式环境下多组件协同工作的完整链条,体现“分而治之”思想。关键差异点总结数据处理方式由串行变为并行,由集中转为分布;系统可靠性从依赖单点转向容错设计。010203技术范式转型启示从“以机器为中心”到“以数据为中心”的根本转变。04架构演进对比图示电商网站访问小数据:单台服务器承载所有用户请求,易出现卡顿;大数据:负载均衡分配请求至多个节点,保证流畅体验。社交媒体内容推送小数据:按用户列表顺序逐条发送,延迟高;大数据:异步批量处理,支持毫秒级响应。金融交易系统小数据:每笔交易需等待前一笔完成,吞吐量低;大数据:并发处理海量交易,满足高频需求。医疗影像分析小数据:单机处理一张图像耗时数分钟;大数据:多节点并行分析,实现秒级诊断。典型应用场景对比02大数据平台核心架构DFS(分布式文件系统)、MapReduce(计算框架)、BigTable(数据库)构成核心技术基础。Google三驾马车奠基2006年开源实现,命名为Hadoop,致敬其儿子的小象玩具。DougCutting创立项目“Hadoop”源自名字“HadooptheElephant”,象征庞大与可靠。项目命名由来成为全球最广泛使用的大数据处理框架之一。开源社区影响力Hadoop起源与发展使用Flume、Sqoop等工具从数据库、日志、API等来源获取原始数据。数据采集层数据处理层MapReduce实现批处理计算,Spark提供内存计算加速。HDFS用于分布式文件存储,HBase支持列式非关系型数据库访问。数据存储层数据分析层Hive构建数据仓库,支持SQL查询;Impala实现低延迟交互式分析。平台组成要素Flume:日志采集引擎支持多源输入(如Nginx日志、应用日志),具备高吞吐和容错能力。Sqoop:数据迁移工具实现关系型数据库与Hadoop之间的双向数据同步。HDFS:分布式文件系统将大文件切分为块分布在集群各节点,自动管理副本一致性。HBase:NoSQL数据库提供随机读写能力,适用于实时查询场景。组件功能定位01将大数据集拆解为小任务,在多个节点上并行处理。02通过增加节点即可线性提升系统处理能力,无需更换硬件。04优化数据传输路径,减少网络延迟,提高整体系统效率。03数据多副本存储,节点故障后自动切换至备用节点继续运行。“分而治之”设计理念横向扩展能力容错机制设计高吞吐率保障核心技术融合03Hadoop核心技术解析批量静态数据访问侧重吞吐量而非响应时间,适合离线分析任务。高可靠性保障通过数据冗余(默认3副本)确保即使部分节点失效仍可正常工作。低成本硬件兼容可在普通商用服务器上运行,降低部署门槛。超大规模数据处理支持GB-TB级别的文件处理,可扩展至千节点集群。Hadoop核心特性分为Map阶段(数据分区)和Reduce阶段(结果聚合),实现并行计算。将大文件分割为块(默认128MB),分布在不同节点上存储。MapReduce:计算框架HDFS:分布式文件系统HDFS负责存储,MapReduce负责读取与计算,二者无缝集成。组件协同工作机制NameNode监控数据块状态,发现异常后自动重建副本。故障恢复机制两大核心组件详解Hadoop集群组件依赖关系04Hadoop生态系统全景生态系统组成Spark:内存计算引擎Flume:日志采集系统Zookeeper:分布式协调服务Hive:数据仓库工具01020304提供类SQL语法接口,将查询转换为MapReduce任务执行。提供配置管理、命名服务、分布式锁等功能。相比MapReduce速度提升10-100倍,支持流式、批处理、图计算。支持多源数据收集,具备高可靠性和可扩展性。生态系统组成管理复杂的数据处理流程,支持定时触发与依赖控制。Oozie:工作流调度器03支持毫秒级事件处理,适用于实时监控、告警系统。Storm:实时流处理框架01高吞吐量、持久化存储,常作为数据管道连接上下游系统。Kafka:消息队列系统02提供WebUI,简化Hadoop集群管理和数据分析操作。Hue:可视化操作界面04主要组件功能说明阿里巴巴应用场景使用Hadoop进行商业数据排序,支撑ISEARCH搜索引擎;15台机器构成集群,8核CPU+16G内存+1.4T硬盘。百度日志分析实践周数据量达3000TB,主要用于日志挖掘与网页数据处理。Facebook大数据平台两个主要集群:1100节点(8800核)+300节点(2400核);基于Hive开发了基于SQL的分析系统。Twitter微博数据处理存储压缩后的LZO格式数据,采用ClouderaCDH2系统。企业级应用案例05大数据平台典型应用集群规模25,000台机器,4,000个节点,每节点2×4核CPU+4×1TB硬盘+16GB内存。应用目标支持广告投放精准匹配与实时竞价系统。技术实现利用Hadoop处理用户行为数据,构建兴趣画像模型。商业价值提升广告点击率与转化率,增加平台收入。雅虎广告系统明确列出阿里巴巴、百度、Facebook、Twitter、雅虎的应用细节。01表3.2:各公司具体应用搜索引擎优化、日志分析、用户画像构建、推荐系统等。02应用类型分类从百TB到数千TB不等,反映不同业务的数据体量差异。03数据规模对比根据数据特征选择合适计算模式与引擎。04技术选型依据互联网行业应用汇总图3.7:契合度分析展示各种应用场景与对应技术的匹配程度。流式计算适用场景实时监控、在线推荐、欺诈检测。批处理适用场景离线报表生成、历史数据分析、机器学习训练。查询分析适用场景即席查询、数据探索、报表制作。场景契合度评估根据数据类型选择结构化数据优先考虑Hive,非结构化数据可选Spark。01根据时效性要求选择实时需求选流式计算,离线分析选批处理。02根据团队技能匹配若熟悉Java可优先选择MapReduce,若擅长Python可选Spark。03根据预算控制成本选用开源免费方案,避免商业软件授权费用。04应用选型建议06集群与分布式计算01020304定义与本质多台服务器联合工作,共同承担同一项任务,形成高性能计算单元。核心优势提升系统容量、增强容错能力、实现负载均衡。适用场景高并发访问、大数据处理、复杂计算任务。常见部署形态本地物理机集群、虚拟机集群、云服务器集群。集群概念解析并发压力缓解多节点分担请求,避免单点过载。单点故障防护任一节点宕机,其余节点可接管服务,保障系统可用性。计算能力扩展通过横向扩容解决复杂计算任务的性能瓶颈。成本效益优化利用廉价硬件构建高性能系统,降低总体拥有成本。集群必要性分析定义与特征将一个大型任务分解为多个子任务,分发给不同节点并行执行。解耦设计思想各模块独立开发、部署、更新,降低系统耦合度。优势与挑战优点:易于扩展、维护方便;缺点:网络通信开销大、一致性难保证。典型架构模式Master-Slave、Peer-to-Peer、Broker-Based。4321分布式计算原理“分布式+集群”综合架构07Hadoop版本与计算模式ApacheHadoop官方开源版本,功能完整但依赖复杂,不适合生产环境。推荐使用,集成度高,版本兼容性强,安装简便。CDH(ClouderaDistribution)HDP(HortonworksDataPlatform)国内较少使用,安装升级较繁琐,文档丰富。版本选择建议生产环境首选CDH,学习研究可用Apache。Hadoop发行版本对比1.X:JobTracker单点故障;2.X:引入YARN,实现资源统一管理。1.Xvs2.X对比(见图3.9)新增纠删码(EC)、容器化支持、安全增强等特性。2.Xvs3.X对比(见表3.4)资源调度更灵活,支持多租户隔离,提升安全性。重大改进点从1.X升级至2.X需重构作业,从2.X至3.X可平滑过渡。迁移策略建议Hadoop版本演进01处理有界、持久、大量静态数据集,计算完成后返回结果。定义与特征02将任务分为Map与Reduce两阶段,适合离线分析。典型引擎:MapReduce03数据清洗、报表生成、机器学习训练。应用场景04磁盘I/O频繁,中间结果需落盘,影响效率。性能瓶颈批量计算模式架构优势无需等待批次完成,实现即时反馈与决策。应用场景实时监控、告警系统、实时推荐。典型引擎:Storm、SparkStreaming支持持续计算、在线学习、迭代优化。实时数据处理对每条记录立即产生输出,支持毫秒级响应。流式计算模式定义与价值将数据表示为节点与边的关系图,揭示隐藏关联。典型应用社交网络分析、金融反欺诈、知识图谱构建。优势分析有效解决最短路径、连通分量等问题,效率远超传统方法。代表性引擎Neo4j(图形数据库)、GraphX(基于Spark的图计算框架)。图计算模式0102传统数据库局限面对半结构化/非结构化数据处理能力弱,扩展性差。交互式分析需求用户需要快速查询、探索数据,返回结果延迟应低于秒级。0304性能对比Impala比Hive快10倍以上,适合交互式分析。新一代解决方案Dremel、Hive、Impala等支持跨源、多模态数据查询。查询分析计算模式在同一平台上同时支持批处理、流式、图计算、查询分析。所有计算引擎共享统一数据湖,避免重复存储。任务调度优化通过统一调度器合理分配资源,提升整体利用率。构建“一站式”大数据平台,覆盖全生命周期数据处理。未来发展方向数据共享机制多模式协同混合计算架构09Zookeeper集群管理核心功能提供配置管理、命名服务、分布式锁、组服务。是Hadoop生态中关键的协调中枢,保障系统一致性。重要性服务注册与发现、分布式协调、状态同步。适用场景系统架构概述事务请求唯一调度者,保证操作顺序性;负责生成Proposal并广播给其他节点。Leader不参与投票,仅处理非事务请求;可提升非事务请求处理能力,不影响集群性能。Observer处理非事务请求,参与投票;一旦接收到Leader的Proposal即执行并返回结果。Follower初始启动或主节点宕机后触发重新选举,基于ZAB协议。角色选举机制三种角色详解基本规则只要有超过半数节点存活,集群即可正常工作。节点数量建议通常为奇数(3、5、7),防止脑裂现象。实际部署建议生产环境至少部署5个节点,确保高可用性。容错能力3节点集群最多容忍1个节点故障;5节点集群最多容忍2个节点故障。半数机制原理010项目实施集群规划IP映射在CentOS7系统中,查看主机名可执行命令hostname;若需修改主机名,可编辑配置文件/etc/hostname。IP地址与主机名的映射关系,需通过配置文件/etc/hosts进行管理,该文件的典型配置内容示例如下。
00hadoop0110hadoop0220hadoop03…集群拓扑1.0集群拓扑2.0集群主机和软件3.主机规划
制定各个节点的守护进程,以图3.15为例,hadoop01的守护进程为NameNode;hadoop02的守护进程为SecondaryNameNode;hadoop03的守护进程为ResourceManager、ProxyServer和HistoryServer;hadoop04~hadoop09的守护进程为DataNode、NodeManager。
4.软件规划
软件规划需明确集群部署所需的各类软件及对应版本,主要涵盖Linux操作系统版本、JDK版本、Hadoop版本、数据库选型,以及Zookeeper、HBase、Hive、Flume等大数据生态组件的版本。5.数据目录规划
为了方便集群管理,需要规定组件压缩文件存放位置、组件安装位置和临时数据存放位置。网络配置与时钟同步1.动态获得IP
网络配置与时钟同步2.上网模式
网络配置与时钟同步2.上网模式
网络配置与时钟同步3.通过虚拟机设置静态IP
网络配置与时钟同步4.网络配置1)更改配置文件:
vi/etc/sysconfig/network-scripts/ifcfg-eth0①
将ONBOOT=no改为yes。
②
将BOOTPROTO=dhcp改为BOOTPROTO=static。
③
并在后面增加几行内容。
IPADDR=28NETMASK=GATEWAY=//查看GATEWAY方法:iproute或者route-nDNS1=9//查看DNS1的方法:cat/etc/resolv.conf2)保存配置文件后,重新启动网络服务。
systemctlrestartnetwork.service3)测试是否配置成功。
ping-c44)通过机器名字访问网络。网络配置与时钟同步5.关闭防火墙2)关闭、查看、开启防火墙的方法。
①
关闭CentOS防火墙:systemctlstopfirewalld.service或Systemctldisablefirewalld.service或sudoufwdisable。②
查看防火墙状态:systemctlstatusfirewalld.service或sudoufwstatus。
③
开启防火墙:systemctlstartfirewalld.service或sudoufwenable。网络配置与时钟同步6.时钟同步①rpm-qa|grepntp:查看是否安装NTP。
②yuminstallntpntpdate-y:安装NTP,已安装则跳过此步骤。
③systemctlstatusntpd:查看NTP服务器状态。
④vi/etc/ntp.conf:配置同步NTP服务器时间,文件内容如下。
systemctlstartntpd:启动NTP服务。
systemctlenablentpd:设置开机启动。
ntpdate-u3:手动同步一次时间。
网络配置与时钟同步7.HTTP和HTTPS请求的区别1)HTTPS需向CA(电子认证服务机构)申请数字证书,一般免费证书很少,需要付费获取。
2)HTTP是超文本传输协议,信息是明文传输;HTTPS则是具有安全性的SSL加密传输协议。3)HTTP和HTTPS使用的是完全不同的连接方式,用的端口也不一样,前者是80,后者是443。
4)HTTP的连接很简单,是无状态的;HTTPS是由SSL+HTTP构建的可进行加密传输、身份认证的网络协议,比HTTP安全。网络配置与时钟同步8.常用状态码301:永久重定向。
403:服务器已经理解请求,但是拒绝执行。
404:页面丢失。
500:服务器错误。通信免密1.SSH协议通信免密2.免密过程JDK部署1.查看Linux系统是否正常显示Java版本信息。输入java-version,如果显示Java版本信息正常(见图3.28),结束JDK部署;否则进入步骤2)~7)。JDK部署2.新建文件夹java。JDK部署3.在官网下载对应版本的安装包(自行下载)。
4.执行解压操作,运行命令tar-zxvfjdk-8u131-linux-x64.tar.gz。5.执行vi/etc/profile命令进入文件编辑模式,配置Java环境变量,如图3.31所示JDK部署6.查看安装情况
①
输入java-version,查看Java版本信息,如图3.28所示。②
输入java,查看Java基础运行信息。
至此,JDK安装完成。Hadoop部署1.解压
tar-zxvf./soft-install/hadoop-2.7.2.tar.gz-C/opt/soft/
2.修改环境变量
#修改配置文件
vi/etc/profile#在profile文件末尾添加以下配置内容
exportHADOOP_HOME=/opt/soft/hadoop-2.7.2exportPATH=$PATH:$HADOOP_HOME/bin#配置文件生效
source/etc/profileHadoop部署3.修改配置文件
配置文件全部位于/opt/soft/Hadoop-2.7.2/etc/hadoop文件夹下。
1)在hadoop-env.sh文件中添加JAVA_HOME,如图3.32所示。图3.32配置hadoop-env.sh2)配置core-site.xml文件。
<configuration><!--指定HDFS(namenode)的通信地址--><property><name>fs.defaultFS</name><value>hdfs://hadoop1:9000</value></property><!--指定Hadoop运行时产生文件的存储路径--><property><name>hadoop.tmp.dir</name><value>/opt/soft/hadoop-2.7.2/tmp</value></property></configuration>Hadoop部署3.修改配置文件
3)配置mapred-site.xml文件。
必须先修改文件名:mvmapred-site.xml.templatemapred-site.xml<configuration><!--通知框架MR使用YARN--><property><name></name><value>yarn</value></property></configuration>Hadoop部署3.修改配置文件
3)配置mapred-site.xml文件。
必须先修改文件名:mvmapred-site.xml.templatemapred-site.xml<configuration><!--通知框架MR使用YARN--><property><name></name><value>yarn</value></property></configuration><property><name>.dir</name><value>/opt/soft/hadoop-2.7.2/name</value></property><!--设置hdfs副本数量--><property><name>dfs.replication</name><value>2</value></property><!--设置datanode存放的路径--><property><name>dfs.datanode.data.dir</name><value>/opt/soft/hadoop-2.7.2/data</value></property></configuration>Hadoop部署3.修改配置文件
4)配置mapred-site.xml文件。
必须先修改文件名:mvmapred-site.xml.templatemapred-site.xml<configuration><!--通知框架MR使用YARN--><property><name></name><value>yarn</value></property></configuration>Hadoop部署3.修改配置文件
5)配置yarn-site.xml文件。
<configuration><!--设置resourcemanager在哪个节点--><property><name>yarn.resourcemanager.hostname</name><value>hadoop1</value></property><!--reducer取数据的方式是mapreduce_shuffle--><property><name>yarn.nodemanager.aux-services</name><value>mapreduce_shuffle</value></property><property><name>yarn.nodemanager.aux-services.mapreduce.shuffle.class</name><value>org.apache.hadoop.mapred.ShuffleHandler</value></property></configuration>6)配置Masters文件。该文件中指定SecondaryNamenode对应的主机名为hadoop2。
Hadoop部署4.创建文件夹
mkdirtmpnamedata5.同步其他主机
1)复制/etc/hosts。
scp/etc/hostshadoop1:/etc/scp/etc/hostshadoop2:/etc/2)复制/etc/profile(注意:环境变量生效)。
scp/etc/profilehadoop1:/etc/scp/etc/profilehadoop2:/etc/3)复制/opt/soft(注意:在hadoop1和hadoop2上环境变量生效)。
scp-r/etc/softhadoop1:/opt/scp-r/etc/softhadoop2:/opt/4)查看Hadoop版本。
hadoop-versionHadoop部署6.启动
1)第一次启动需要格式化。
./bin/hdfsnamenode-format2)启动dfs。
./sbin/start-dfs.sh3)启动YARN。
./sbin/start-yarn.sh7.查看Hadoop1)查看hadoop1,如图3.33所示。
2)查看hadoop2,如图3.34所示。3)查看hadoop3,如图3.35所示。010总结与展望架构演进本质从集中式走向分布式,从单点走向集群,从批处理走向实时计算。自主可控意义掌握核心技术才能保障国家信息安全。技术融合趋势人才是关键多种计算模式共存,形成统一数据平台。理解底层原理才能高效利用平台能力。核心观点回顾Kubernetes整合大数据平台,实现弹性调度。云原生架构普及数据处理下沉至终端设备,减少传输延迟。边缘计算延伸加密、审计、权限控制全面集成。安全可信成为标配内嵌机器学习模型,实现智能分析。AI与大数据深度融合未来发展趋势掌握命令行操作、文件系统、权限管理。学习基础知识动手搭建环境使用虚拟机或云服务器部署Hadoop集群。跟踪阿里、华为、腾讯等企业的技术布局。贡献代码、报告问题、分享经验。参与开源项目关注产业动态01030402实践建议分工协作的力量个人能力有限,团队合作才能成就大事。技术改变世界掌握核心技术,就能掌握未来话语权。从小到大的积累每一次小进步都是通往成功的基石。持续创新的精神唯有不断突破才能引领时代潮流。人生启示2026.4谢谢大家项目4数据采集技术CONTENTS目录数据是什么01数据采集02日志采集组件Flume03项目实施04总结与展望0501数据是什么数据是现实世界的快照数据如同照片记录瞬间,是对客观现象属性的具体描述。数据的多维表达不仅包含数字,还涵盖文本、图像、音频等多元形式。数据的价值层级模型图4.1展示数据→信息→知识→智慧的四层跃迁路径。智慧源于数据积累从原始数据到决策智慧,需经历系统性加工与认知提升。数据的定义与意义数据到信息:结构化转换通过知识加工使无序数据具备语义,形成可理解的信息。信息到知识:综合提炼对多条信息进行关联分析,提取规律与模式,构建知识体系。知识到智慧:洞察决策运用知识指导实践,在复杂环境中做出前瞻性判断。分析报告的生成逻辑报告基于数据,但依赖知识支撑,最终实现价值输出。四层次关系解析专家经验的核心价值知识管理的重要性建立知识库,提升团队整体数据分析能力。知识贯穿全过程无论是数据转信息还是信息变报告,均需专业知识引导。知识的普遍适用性高质量的知识输入直接影响最终分析结果可信度。在不同阶段发挥作用,决定转化效率与质量。转化过程中的关键作用定义与特征可用传统关系数据库存储,具有固定格式和明确字段。典型代表数字、符号、表格类数据,如订单表、用户档案。应用场景金融交易记录、库存管理系统、客户信息管理。处理技术使用SQL语言进行查询与分析,支持高效索引。结构化数据01经过转换后可用关系数据库管理,先有数据再建结构。定义与本质02HTML、XML、JSON等标记语言文档。常见类型03RDF、OWL等本体语言用于语义解析与知识表示。处理技术04网页内容抓取、配置文件读取、API接口交互。典型应用半结构化数据定义与挑战无法用传统数据库直接管理,缺乏统一结构。主要形式语音、图像、视频、自然语言文本等。技术解决方案采用NoSQL、NewSQL数据库,结合AI算法处理。处理难点需要复杂的预处理与特征提取,计算资源消耗大。非结构化数据结构化数据特点先有结构后有管理,适合精确查询与统计分析。半结构化数据优势保留原始内容的同时支持部分结构化操作。非结构化数据趋势随着大数据发展,占比持续上升,成为重点处理对象。小数据时代局限以结构化数据为主,难以应对海量非结构化数据挑战。三类数据对比(见表4.1)定义与特征原始未加工的数据,无明显语义或上下文。价值极低无法直接用于决策,需经过清洗与标注。获取难度通常来自传感器、日志文件、原始数据库导出。示例说明服务器日志中的一行“2024-05-1014:30:22[ERROR]Connectionfailed”。裸数据阶段定义与内涵经过专业人员解读、标注、分类后的数据。重要性决定后续分析准确率的关键环节。质量影响专家水平直接决定数据可信度与可用性。获取挑战需投入大量人力与时间,是最耗时环节。专家数据阶段已具备语义的信息,可被理解并用于交流。通过聚合、过滤、去重等手段提升可用性。支持报表生成、趋势分析、异常检测。“北京地区近一周内新增用户数达876人”。处理方式定义与特征示例说明应用价值信息阶段形成可指导行动的洞察与建议。数据分析报告、商业策略、产品优化方案。是否带来实际业务增长或效率提升。如发现某商品复购率高,建议加大推广力度。定义与目标输出形式判断标准价值体现价值阶段”一次性录入,如历史档案、纸质资料数字化。周期长,更新慢,易滞后于现实变化。持续产生,如用户点击流、设备传感器数据。实时性强,反映最新动态,更具决策参考价值。线上数据优势流动数据特征线下数据劣势静态数据特征数据价值维度字段列表Part01订单ID、用户ID、地区、年龄、订单金额、订单商品、订单时间。数据项差异识别Part02区分哪些为描述性属性,哪些为量化指标。核心变量定位Part03“订单金额”为唯一度量,其余均为维度。数据结构特点Part04明确区分维度与度量,便于后续分析建模。表4.2数据实例分析度量本质用于计算的量化数值,支持数学运算。必须能进行加减乘除、平均值、最大最小值等操作。销售额、访问次数、停留时长、转化率。数值不等于度量,如订单ID虽为数字但属分类变量。03040201可计算性要求典型示例注意事项度量定义与特征示例验证“北京”、“上海”等地区属于典型维度字段。维度本质描述事物属性的信息,用于分类与筛选。用途说明作为分组依据,支持多维分析(OLAP)。常见类型文本类(地区、商品)、时间类(订单时间)、数值类(年龄)。维度定义与功能同一字段根据需求可变身为度量或维度。动态角色切换从“地区”派生“大区”,如“华北大区”。衍生维度创建“年龄”作度量时求平均值;作维度时划分年龄段。案例演示用“收入”减“成本”得“利润”这一新度量。衍生度量生成维度与度量的转换机制02数据采集定义与目的自动获取来自传感器、网站等源头的数据。采集频率分类低频:每日/每周一次;高频:每秒数十次甚至更高。采集方式分类定时采集:按固定周期执行;实时采集:事件驱动,即时响应。采集策划要点明确业务需求→转化为数据需求→确定采集主体与渠道。采集基本概念将模糊业务目标细化为具体数据字段与采集规则。01需求转化原则02指定责任人、时间节点、操作平台。执行主体明确03考虑数据完整性、实时性、安全性与成本。渠道选择标准04设置校验机制,防止虚假、重复、缺失数据干扰系统。数据质量保障采集流程设计安全合规要求符合《个人信息保护法》等法规,避免隐私泄露。一致性维护多源异构数据需统一格式与标准。虚假数据干扰恶意注入、程序错误可能污染数据集。数据丢失风险网络中断、系统崩溃可能导致数据中断。采集核心挑战引入数据血缘追踪记录数据流转路径,便于问题溯源。构建数据治理框架实现采集—存储—使用全过程管控。建立采集清单列出所有需要采集的数据项及其来源。设计容错机制采用队列缓存、断点续传等技术保障可靠性。采集策略建议分布式系统,支持每秒数百MB日志传输。Flume架构介绍二者均为大型互联网公司自研日志系统。Chukwa与Scribe对比通过Channel暂存,确保传输成功后再删除缓存。数据流向机制Source(数据源)、Channel(缓冲区)、Sink(目的地)。Flume三大组件日志采集工具核心功能实现关系型数据库与Hadoop生态间双向数据同步。支持场景将MySQL数据导入HDFS,或将Hive结果写回数据库。架构图示(见图4.5)展示Sqoop在数据湖与传统数据库间的桥梁作用。技术原理底层基于MapReduce任务,提供并发与容错能力。Sqoop数据迁移解决的问题缓解生产与消费速度不匹配导致的数据积压。核心概念Producer(生产者)、Topic(话题)、Consumer(消费者)。工作流程生产者发布消息至指定Topic,消费者订阅后接收处理。系统定位高吞吐分布式发布订阅消息中间件。Kafka消息系统返回结果冗余,难以满足特定主题检索需求。通用搜索引擎局限针对特定领域抓取相关网页,构建垂直数据资源库。爬虫核心动机可抽取非结构化数据并转化为结构化格式。技术优势使用PythonRequests+BeautifulSoup或Scrapy框架。采集方法网络爬虫技术传感器类型电阻式传感器利用变阻器将非电量转为电阻信号,用于测量位移、压力等。电容式传感器通过改变电容几何尺寸或介质性质实现传感。电感式传感器改变磁路参数调节电感量,适用于位移、振动检测。磁电式传感器基于电磁感应原理,用于流量、转速测量。04.03.02.01.电学式传感器光电式传感器利用光电器件光电效应,测量光强、浓度等。电势型传感器基于热电、光电、霍尔效应,用于测温、测速。半导体传感器利用半导体特性,广泛应用于温湿度、有害气体检测。电荷传感器利用压电效应,测量力与加速度。光电与电势型传感器传感器部署建议谐振式传感器多传感器协同采集,提升感知精度与鲁棒性。数据融合处理合理布局,避免干扰,定期校准维护。以离子导电为基础,用于成分分析、酸碱度检测。通过改变固有参数调整谐振频率,用于压力测量。电化学式传感器其他类型传感器03日志采集组件Flume01一个JVM进程,是Flume运行的最小单位。Agent定义02Source:负责数据收集;Channel:临时缓存数据;Sink:负责数据输出。三大核心组件03先存入Channel,确认送达后才删除缓存。数据传输机制04Avro、Thrift、Exec、Jms、Spoolingdirectory等。支持多种Source类型Flume架构组成多个Source收集不同格式的数据输出到同一个Sink中多个Source收集的数据输出到多个Sink中#mkdir
-
/data/flume1
创建目录下载安装包使用wget命令从指定地址下载flume-ng-1.5.0-cdh5.4.5.tar.gz。解压与重命名解压至/apps目录,并将文件夹重命名为flume。配置环境变量#sudo
vim
~/.bashrc
将以下内容,追加到系统环境变量文件中。export
FLUME_HOME=/apps/flume
export
FLUME_CONF_DIR=$FLUME_HOME/conf
export
PATH=$FLUME_HOME/bin:$PATH
Flume部署#flume-ng
version
测试Flume#source
~/.bashrc
切换到/apps/flume/conf目录,并将配置文件flume-env.sh.template重命名为flume-env.sh。#cd
/apps/flume/conf
#mv
flume-env.sh.template
/apps/flume/conf/flume-env.sh
使用vim打开flume-env.sh文件。#vim
flume-env.sh
并将JDK的路径添加到flume-env.sh文件中。export
JAVA_HOME=/apps/java
配置Flume环境变量生效04项目实施Source:exec,Channel:memory,Sink:logger,数据是/data/flume2/目录下的goods文件。定义组件启动Hadoop#mkdir
/data/flume2
#cd
/data/flume2
#wget
00:60000/allfiles/flume2/goods
#wget
00:60000/allfiles/flume2/exec_mem_logger.conf
#wget
00:60000/allfiles/flume2/exec_mem_hdfs.conf
#wget
00:60000/allfiles/flume2/exec_file_hdfs.conf
#wget
00:60000/allfiles/flume2/syslog_mem_logger.conf下载数据加密传输、权限控制、脱敏处理。编辑conf文件01020304任务4.1采集文件数据保存到日志#定义各个组件
agent1.sources
=
src
agent1.channels
=
ch
agent1.sinks
=
des
#配置Source
agent1.sources.src.type
=
exec
mand
=
tail
-n
20
/data/flume2/goods
#配置Channel
agent1.channels.ch.type
=
memory
编辑conf文件04任务4.1采集文件数据保存到日志#配置Sink
agent1.sinks.des.type
=
logger
##下面是把上面设置的组件关联起来(用线把点连起来)
agent1.sources.src.channels
=
ch
agent1.sinks.des.channel
=
ch
#flume-ng
agent
-c
/conf
-f
/apps/flume/conf/exec_mem_logger.conf
-n
agent1
-Dflume.root.logger=DEBUG,console
启动Flume。查看输出效果任务4.1采集文件数据保存到日志配置conf文件#定义各个组件
agent1.sources
=
src
agent1.channels
=
ch
agent1.sinks
=
des
#配置Source
agent1.sources.src.type
=
exec
mand
=
tail
-n
20
/data/flume2/goods
#配置Channel
agent1.channels.ch.type
=
memory
agent1.channels.ch.keep-alive
=
30
agnet1.channels.ch.capacity
=
1000000agent1.channels.ch.transactionCapacity
=
100
#配置Sink
agent1.sinks.des.type
=
hdfs
agent1.sinks.des.hdfs.path
=
hdfs://localhost:9000/myflume2/exec_mem_hdfs/%Y%m%d/
agent1.sinks.des.hdfs.useLocalTimeStamp
=
true
#设置flume临时文件的前缀为
.
或
_,
在HIVE加载时,会忽略此文件。
agent1.sinks.des.hdfs.inUsePrefix=_
#设置flume写入文件的前缀
agent1.sinks.des.hdfs.filePrefix
=
abc
agent1.sinks.des.hdfs.fileType
=
DataStream
agent1.sinks.des.hdfs.writeFormat
=
Text
#hdfs新建文件的时间间隔,0为不基于时间判断,单位为s
agent1.sinks.des.hdfs.rollInterval
=
30
任务4.2采集文件数据保存到HDFS#hdfs写入文件达到指定大小后新建文件,0表示不基于大小判断,单位为B
agent1.sinks.des.hdfs.rollSize
=
100000
#hdfs累计指定消息条数后新建文件,0表示不基于条数判断
agent1.sinks.des.hdfs.rollCount
=
10000
#hdfs空闲指定时长后新建文件,单位为s
agent1.sinks.des.hdfs.idleTimeout
=
30
##下面是把上面设置的组件关联起来(用线把点连起来)
agent1.sources.src.channels
=
ch
agent1.sinks.des.channel
=
ch
任务4.2采集文件数据保存到HDFS2)启动Flume。#flume-ng
agent
-c
/conf
-f
/apps/flume/conf/exec_me
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2025年芜湖前湾集团有限公司下属公司招聘正式员工7人笔试历年典型考点题库附带答案详解
- 2025年独山子石化分公司秋季高校毕业生招聘(210人)笔试历年备考题库附带答案详解
- 2025年湖北农商行新员工社会招录笔试历年典型考题及考点剖析附带答案详解
- 2025年河南内黄县农村信用合作联社综合柜员招聘笔试历年典型考题及考点剖析附带答案详解
- 电击伤急救试题及答案
- 2026电梯营销考试题及答案解析
- 2026电声设计考试题库及答案
- 2026电气维修笔试题及答案
- 2026电路排线考试题及答案
- 2026电力监理考试题及答案
- 2026秦皇岛华勘地质工程有限公司招聘12人笔试参考题库及答案详解
- 2026年电子商务运营推广策略方案
- JBT 14828-2025 土方机械行业绿色工厂评价导则标准立项发展报告
- 2025-2030中国全屋净水系统消费者行为与品牌战略发展报告
- 《中医体重管理临床指南》
- YY/T 1740.2-2021医用质谱仪第2部分:基质辅助激光解吸电离飞行时间质谱仪
- YC/T 486-2014烟草商业企业车辆安全管理规范
- GB/T 37340-2019电动汽车能耗折算方法
- 第三课奇才李叔同
- 变频器-vsd2000安装操作维护手册
- 施工现场机械维修保养记录表
评论
0/150
提交评论