版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
大数据导论第3章大数据处理第3章数据处理目录3.1数据采集3.2数据清洗3.3数据变换3.5数据归约3.4数据集成3.6大数据处理工具京东实时数据仓库扮演着核心角色,为京东的各个业务部门提供实时数据分析和报告的能力,帮助京东更好地理解用户行为、实时掌握市场动态和销售情况、优化业务流程,提高经营效率。实时实时数据仓库(Real-timeDataWarehouse)是一种集成了多种数据源的大规模数据存储和处理平台,能够实时收集、处理和分析海量数据,并为企业的决策提供快速、准确的数据支持。开篇案例-京东实时数据仓库采用分布式处理框架和大数据技术,实现了海量数据的实时采集、处理、存储管理和分析服务。采用数据建模、数据质量监控等一系列的技术手段,以保证数据的准确性和可靠性。多样化的数据服务和接口,方便用户进行数据分析和应用开发,保证系统的可扩展性和可维护性。高可用架构和容错机制保证系统的稳定性和可靠性。一系列数据安全和隐私保护措施保障用户的数据安全和隐私。灵活的数据模型和数据处理框架,支持多种数据源和数据类型,保证系统的灵活性。开篇案例-京东实时数据仓库数据采集>>>3.1数据采集数据采集方法数据质量评估数据质量影响因素3.1.1数据采集方法系统日志采集:使用日志收集系统,收集业务日志数据供离线和在线的分析系统使用。1.系统日志采集数据采集数据采集方法数据质量评估数据质量影响因素数据采集产品数据采集产品有很多,较为常用的是以下6种:ApacheFlume、Scribe、Fluentd、ApacheChukwa、Logstash、Splunk3.1.1数据采集方法数据采集数据采集方法数据质量评估数据质量影响因素网络数据采集:通过网络爬虫或网站公开API等方式从网站上获取数据信息。可以将非结构化数据以结构化的方式存储。1.2.系统日志采集:使用日志收集系统,收集业务日志数据供离线和在线的分析系统使用。3.1.1数据采集方法网络数据采集数据采集数据采集方法数据质量评估数据质量影响因素数据采集产品/activities/learn3.1.1数据采集方法数据采集数据采集方法数据质量评估数据质量影响因素八爪鱼采集器八爪鱼数据采集系统是一款免费的、不需要编程语言的一款数据采集器。它可以帮助任何需要从网页获取信息的客户实现数据自动化采集、编辑和规范化,摆脱对人工搜索及收集数据的依赖,并且降低获取信息的成本,提高效率。八爪鱼最基本的是模板采集,模板采集模式内置上百种主流网站数据源,比如京东、天猫、大众点评等热门采集网站,只需参照模板简单设置参数,就可以快速获取网站公开数据。3.1.1数据采集方法数据采集数据采集方法数据质量评估数据质量影响因素系统日志采集:使用日志收集系统,收集业务日志数据供离线和在线的分析系统使用。网络数据采集:通过网络爬虫或网站公开API等方式从网站上获取数据信息。可以将非结构化数据以结构化的方式存储。数据库采集:在采集端部署大量数据库,并对如何在这些数据库之间进行负载均衡和分片进行深入的思考和设计。1.2.3.数据库采集3.1.1数据采集方法数据采集数据采集方法数据质量评估数据质量影响因素数据采集产品3.1.1数据采集方法数据采集数据采集方法数据质量评估数据质量影响因素系统日志采集:使用日志收集系统,收集业务日志数据供离线和在线的分析系统使用。网络数据采集:通过网络爬虫或网站公开API等方式从网站上获取数据信息。可以将非结构化数据以结构化的方式存储。数据库采集:在采集端部署大量数据库,并对如何在这些数据库之间进行负载均衡和分片进行深入的思考和设计。1.2.3.感知设备数据采集3.1.1数据采集方法感知设备数据采集:通过传感器、摄像头和其他智能终端自动采集信号、图片或录像来获取海量数据。4.数据采集数据采集方法数据质量评估数据质量影响因素数据采集产品3.1.1数据采集方法数据采集数据采集方法数据质量评估数据质量影响因素评估标准完整性一致性准确性及时性3.1.2数据质量评估评估标准数据采集数据采集方法数据质量评估数据质量影响因素完整性:数据信息是否存在缺失的情况,数据缺失的情况可能是整个数据的缺失,也可能是数据中某个字段信息的缺失。数据完整性是数据质量最为基础的一项评估标准。1.一致性:数据是否遵循了统一的规范,数据之间的逻辑关系是否正确和完整。规范指的是,一项数据存在它特定的格式,逻辑指的是,多项数据间存在着固定的逻辑关系。2.3.1.2数据质量评估评估标准数据采集数据采集方法数据质量评估数据质量影响因素准确性:数据中记录的信息和数据是否准确,数据记录的信息是否存在异常或错误。3.及时性:数据从产生到可以查看的时间间隔,也叫数据的延时时长,是数据世界与客观世界的同步程度。数据的及时性主要跟数据的同步和处理过程的效率相关。4.评估标准3.1.2数据质量评估数据采集数据采集方法数据质量评估数据质量影响因素信息因素技术因素流程因素管理因素元数据对数据的描述及理解错误、数据源规格不统一等。信息因素3.1.3数据质量影响因素数据采集数据采集方法数据质量评估数据质量影响因素元数据(Metadata):又称中介数据、中继数据,为描述数据的数据(dataaboutdata),主要是描述数据属性property)的信息,用来支持如指示存储位置、历史数据、资源查找、文件记录等功能。“元”:事物或对象。“数据”:该对象的相关数据。元数据3.1.3数据质量影响因素数据采集数据采集方法数据质量评估数据质量影响因素信息因素技术因素流程因素管理因素元数据对数据的描述及理解错误、数据源规格不统一等。指由于具体技术处理的异常造成的数据质量问题。指由于系统流程和操作流程设置不当造成的数据质量问题。指由于人员素质及管理机制方面的原因造成的数据质量问题。3.1.3数据质量影响因素数据清洗>>>3.2处理残缺数据处理噪声数据处理冗余数据为何进行数据清洗?3.2数据清洗数据清洗残缺数据:是指不完整的数据,可能是整个数据的缺失,也可能是数据中某个字段信息的缺失。残缺数据噪声数据冗余数据是指数据之间的重复,也可以说是同一数据存储在不同文件中的现象。冗余数据噪声数据:在测量一个变量时测量值可能出现的相对于真实值的偏差或错误,主要包括错误数据、假数据和异常数据。数据的“脏”在于数据有重复、数据有缺失、数据有不一致。脏数据主要有残缺数据、噪声数据和冗余数据。处理残缺数据处理噪声数据处理冗余数据数据清洗3.2数据清洗弊端:采用忽略元组的方法,意味着不能使用该元组的剩余属性值,而这些剩余属性值很可能是分析问题所必须的。除非元组有多个属性残缺,否则该方法不是很有效。当某个属性有很多元组缺失时,它的性能特别差。当元组的某个属性残缺时,忽略整个元组处理残缺数据处理噪声数据处理冗余数据数据清洗3.2.1处理残缺数据忽略整个元组仅适用于数据量小且缺失值少的情况,当数据量很大、缺失很多值时,该方法可能行不通。需要注意的是,在某些情况下,缺失值并不意味数据有错误。通过人工填写或者设立某一规则确定残缺值的填写内容填写残缺值处理残缺数据处理噪声数据处理冗余数据数据清洗3.2.1处理残缺数据如果缺失值是数值型的,就根据该变量在其他所有对象的取值的平均值来填充该缺失值的变量值;如果缺失值是非数值型的,则可以使用众数来填充该缺失的变量值。缺失值填充:均值填充法其他填充缺失值的方法全局常量法、就近补齐法、期望最大法、K最近距离邻法处理残缺数据处理噪声数据处理冗余数据数据清洗均值填充法3.2.1处理残缺数据处理残缺数据处理噪声数据处理冗余数据数据清洗3.2.2处理噪声数据噪声数据文献综述3.聚类1.分箱
把待处理的数据按照一定规则放进“箱子”中,采用某种方法对各个箱子中的数据进行处理。数据清洗处理残缺数据处理噪声数据处理冗余数据2.平滑处理4.回归等深分箱法:每箱具有相同的记录数,每个箱子的记录数称为箱子的深度。等宽分箱法:在整个数据值的区间上平均分割,使得每个箱子的区间相等,这个区间被称为箱子的宽度。用户自定义分箱法:根据用户自定义的规则进行分箱处理。分箱3.2.2处理噪声数据文献综述分箱练习
以下是客户收入属性的取值,请按照上述三种方案进行分箱处理
800100012001500150018002000230025002800300035004000450048005000数据清洗处理残缺数据处理噪声数据处理冗余数据3.2.2处理噪声数据文献综述分箱方法具体标准分箱结果等深分箱法箱子深度为4箱1:800100012001500箱2:1500180020002300箱3:2500280030003500箱4:4000450048005000等宽分箱法箱子宽度为1000箱1:80010001200150015001800箱2:20002300250028003000箱3:350040004500箱4:48005000用户自定义分箱法将客户收入划分为1000以下、1000~2000、2001~3000、3001~4000和4000以上五组箱1:800箱2:100012001500150018002000箱3:2300250028003000箱4:35004000箱5:450048005000参考答案
800100012001500150018002000230025002800300035004000450048005000处理残缺数据处理噪声数据处理冗余数据数据清洗3.2.2处理噪声数据文献综述4.回归2.平滑处理
在分箱之后,要对每个箱子中的数据进行平滑处理。数据清洗处理残缺数据处理噪声数据处理冗余数据3.聚类1.分箱按平均值:对同一箱子中的数据求平均值,用均值代替箱子中的所有数据按中值:取箱子中所有数据的中值,用中值代替箱子中的所有数据按边界值:对箱子中的每一个数据,使用离边界值较小的边界值代替3.2.2处理噪声数据文献综述对上一题中的等宽分箱的结果进行不同的平滑处理,并合并最后的结果(注:在按边界值进行平滑处理时,若距离两侧边界相同时,取较小的边界)箱1:80010001200150015001800箱2:20002300250028003000箱3:350040004500箱4:48005000数据清洗处理残缺数据处理噪声数据处理冗余数据平滑处理练习3.2.2处理噪声数据文献综述平滑处理方式平滑处理结果合并后的结果按平均值箱1:1300130013001300130013001300130013001300130013002520252025202520252040004000400049004900箱2:25202520252025202520箱3:400040004000箱4:49004900按中值箱1:1350135013501350135013501350135013501350135013502500250025002500250040004000400049004900箱2:25002500250025002500箱3:400040004000箱4:49004900按边界值箱1:8008008001800180018008008008001800180018002000200020003000300035003500450048005000箱2:20002000200030003000箱3:350035004500箱4:48005000参考答案箱1:80010001200150015001800箱2:20002300250028003000箱3:350040004500箱4:48005000数据清洗处理残缺数据处理噪声数据处理冗余数据3.2.2处理噪声数据簇:是指一组数据对象的集合,同一簇内的数据具有相似性,不同簇之间的数据的差异性较大。文献综述
将数据集合分组为若干个簇,在簇外的值即为孤立点,这些孤立点就是噪声数据,对这些孤立点进行删除或替换。
相似或相临近的数据聚合在一起形成各个聚类集合,在这些聚类集合之外的数据即为异常数据。数据清洗处理残缺数据处理噪声数据处理冗余数据如图所示的A、B、C三点即为异常数据1.分箱3.聚类4.回归2.平滑处理3.2.2处理噪声数据文献综述数据清洗处理残缺数据处理噪声数据处理冗余数据聚类方法3.2.2处理噪声数据文献综述2.平滑处理4.回归通过发现两个相关的变量之间相关关系,构造一个回归函数使得该函数能够更大程度地满足两个变量之间的关系,使用这个函数来平滑数据。数据清洗处理残缺数据处理噪声数据处理冗余数据1.分箱3.聚类3.2.2处理噪声数据重复过滤:在已知重复数据内容的基础上,从每一个重复数据中取出一条记录保留下来,删去其他的重复数据。重复过滤=识别重复数据+过滤操作。条件过滤:根据一个或多个条件对数据进行过滤。对一个或多个属性设置条件,将符合条件的记录放入结果集,将不符合条件的数据过滤掉。实际上,重复过滤就是一种条件过滤。冗余数据通常采用过滤数据的方法来处理冗余数据。对于重复的数据采用重复过滤的方法,对于无关的数据则采用条件过滤的方法。数据清洗处理残缺数据处理噪声数据处理冗余数据处理冗余数据3.2.3处理冗余数据原始数据信息数据清洗要求筛选出职能类别为大数据/分析的数据整理工作地点、薪酬数据清洗案例数据清洗处理残缺数据处理噪声数据处理冗余数据3.2.3处理冗余数据数据数据工具分列查找替换薪资单位统一为元时长单位统一为月最终数据薪酬数据处理/group-live-share/index.htm?encCid=9ba3b45e3dd76000621ae5b24a1db1dc&liveUuid=13cbde06-1484-4566-9568-6a4ebfdea84a3.2数据清洗数据清洗处理残缺数据处理噪声数据处理冗余数据数据变换>>>3.3数据变换可分为属性类型变换与属性值变换。数据概化Eg.街道属性可以概化到城市的层次,城市可以概化到国家的层次;街道也可以直接概化到国家的层次。Eg.年龄属性可以概化为青年、中年、老年等。用更抽象(更高层次)的属性来代替低层或原始数据。属性类型变换可以使用数据概化与属性构造等方法进行属性的变换。数据变换属性类型变换属性值变换3.3.1属性类型变换属性构造根据原属性与目标属性之间的映射关系,可将属性变化分成一对一映射和多对一映射两种。一对一映射:原数据类型与目标数据类型之间为一一对应的关系,如将“××年××月××日”的日期转换为“××/××/××”,只是形式上的转换,是一对一的关系。多对一映射:原数据类型与目标数据类型之间为多对一的关系,如下表所示之间的关系即为多对一关系。构造新的属性并添加到属性集合中以便帮助挖掘。原数据类型(得分,int)目标数据类型(品质,string)9~10优等品6~8中等品1~5劣等品表3-1多对一关系表数据变换属性类型变换属性值变换3.3.1属性类型变换最大-最小标准化0-1标准化属性值变换小数定标标准化零-均值标准化已知属性的原范围[old_min,old_max],将其映射到新范围[new_min,new_max]
这种方法简单,但是存在着缺陷,当新加入的数据超过了原范围[old_min,old_max]是,必须更新old_min与old_max的值,否则会出错。最大-最小标准化即数据标准化,将属性值按比例进行缩放,使之落入一个特定的区间以消除数值型属性因大小不一而造成的挖掘效果的偏差。数据变换属性类型变换属性值变换3.3.1属性类型变换0-1标准化是最大-最小标准化的一种特殊形式,即new_min=0,new_max=1的情况
0-1标准化数据变换属性类型变换属性值变换3.3.2属性值变换最大-最小标准化0-1标准化属性值变换小数定标标准化零-均值标准化最大-最小标准化0-1标准化属性值变换小数定标标准化零-均值标准化适用于数据符合正态分布的情况其中,μ为均值,σ为标准差。
通过移动小数点的位置,将属性值映射到[0,1]之间,使用小数的科学计数法来达到规范化地目的其中,j是使max(|x'|)<1成立的最小值。
属性值变换数据变换属性类型变换属性值变换3.3.2属性值变换数据集成>>>3.403彼此独立、相互封闭,难以交流、共享和融合数据源02异构、运行在不同软硬件平台上信息系统01开发时间和开发部门不同企业信息孤岛数据集成数据匹配与数据值冲突数据冗余3.4数据集成信息孤岛数据集成(DataIntegration)是把不同来源、格式、特点性质的数据有机地集中起来,通过一致的、精确地表示方法,对同一种实体对象的不同数据做整合的过程。传统数据集成跨域数据集成3.4数据集成数据集成数据集成数据匹配与数据值冲突数据冗余1模式匹配
数据值冲突
数据冗余
数据集成解决的主要问题3.4数据集成数据集成数据集成数据匹配与数据值冲突数据冗余数据集成模式匹配的实质就是实体识别问题,实体识别就是为了匹配不同数据源的现实实体,如A.user-id=B.customer_id。通常以元数据为依据进行实体识别,避免模式集成时出现错误。每个属性的元数据包括属性名字、含义、数据类型、允许取值范围、空值规则等。元数据还可以用来帮助变换数据。在集成期间,当一个数据库的属性与另一个数据库的属性匹配时,需要注意匹配数据的结构以保障原模式数据之间的关系在集成后的模式中仍然适用。对于同一现实世界的实体而言,在不同的系统中的同一属性的数据值可能不同,可能的原因有:属性的表示方式不同、单位不同等等。针对数据值冲突,需要根据元数据提取该属性的规则,并在目标系统中建立统一的规则,将原始属性值转换为目标属性值。数据集成数据匹配与数据值冲突数据冗余3.4.1数据匹配与数据值冲突在数据集成时,数据冗余是不可避免的:同一属性在不同系统中使用不同的字段名,如同样的顾客ID,在A系统中字段名是Cust_id,在B系统中是Cutromer_Num;集成后某个数据属性可以由其他数据属性经过计算得出,如A系统中有月营业额属性,在B系统中有日营业额属性,而月营业额是可以由日营业额导出的。可以通过相关分析来检验属性之间的相关度,进而判断是否存在数据冗余。数据集成数据匹配与数据值冲突数据冗余3.4.2数据冗余数据集成数据冗余标称数据检测对于标称数据,两个属性A和B之间的相关联系可以通过卡方检验发现
卡方检验假设A、B之间是独立的,如果可以拒绝该假设则说明A、B之间是统计相关的。数据集成数据匹配与数据值冲突数据冗余3.4.2数据冗余数据集成数据冗余对于数值数据,可以通过检测它们之间的相关系数来估计这两个属性之间相关度
数值数据检测
数据集成数据匹配与数据值冲突数据冗余3.4.2数据冗余数据归约>>>3.5大型数据集数据仓库中往往存有海量数据,在其上进行复杂的数据分析与挖掘需要很长的时间高维度数据由于高维度会引起数据超负,一些挖掘算法不适用数据归约为什么进行数据归约?数据归约也称数据削减,是指在尽可能保持数据原貌的前提下,最大限度地精简数据量。主要介绍数据归约的两种方法:维归约、数值归约。3.5数据归约数据归约维归约数值归约逐步向前选择从一个空属性集开始,该集合作为属性子集的初始值,每次从原属性集中选择一个当前最优的属性添加到属性子集中,迭代地选最优并添加直至无法选出最优为止。向前选择与向后删除结合可以将向前选择和向后删除的方法结合在一起,每一步选择一个最好的属性,并在剩余属性中删除一个最差的属性。1.2.3.维归约维归约是从原有的数据中删除不重要或不相关的属性,或者通过对属性进行重组来减少属性的个数。维归约的目的是为了找到最小的属性子集,且该子集的概率分布尽可能地接近原数据集的概率分布,找到最小属性子集的方法有以下几种:逐步向后删除从一个拥有所有属性的属性集开始,该集合是属性子集的初始值,每次从当前子集中选择一个当前最差的属性并将其从属性子集中删除,迭代地选最差并删除直至无法选出最差为止。数据归约维归约数值归约3.5.1维归约数据归约维归约逐步向前选择逐步向后删除维归约3.5.1维归约数据归约维归约数值归约数据归约维归约数值归约抽样参数回归数值规约聚类直方图使用分箱来近似数据分布,是一种流行的数据归约形式。属性A的直方图将A的数据分布划分为不相交的子集/桶。如果每个桶只代表单个属性值/频率对,则该桶称为单值桶。通常,桶表示给定属性的一个连续区间。聚类技术把数据元组看作对象。它将对象划分为群或簇,使得在一个簇中的对象相互“相似”,而与其他簇中的对象“相异”。在数据归约中,用数据的簇代表替换实际数据。3.5.2数值归约数据归约维归约数值规约直方图聚类数值规约参数回归抽样抽样可以作为一种数据归约技术使用,因为它允许用数据的小得多的随机样本(子集)表示大型数据集。采用抽样进行数据归约的优点是:得到样本的花费正比例于样本集的大小,而不是数据集的大小。参数回归通常采用一个模型来评估数据,该方法只需要存放参数而不用存放实际数据。这种方法能极大地减少数据量,但只对数值型数据有效。3.5.2数值归约大数据处理工具>>>3.6大数据处理工具传统工具AI驱动工具TableauPrep数据处理技术应用3.6.1传统工具传统工具依赖人工配置规则或固定流程模板,需要用户明确清洗逻辑,适合数据规模较小、规则明确的场景。其核心特点是“可控性强”,但自动化程度较低。数据处理产品轻量通用类专业流程类行业专用类编程类大数据处理工具传统工具AI驱动工具TableauPrep数据处理技术应用3.6.2AI驱动工具AI驱动工具基于机器学习、自然语言处理(NLP)等技术,实现清洗规则的“自动生成”“智能推荐”和“持续优化”,减少人工干预,尤其适合大规模、高复杂度或高频更新的数据场景。其核心特点是“自动化”和“自适应”。与传统工具对比维度传统工具AI工具规则生成方式依赖人工定义,需明确处理逻辑基于数据特征,AI自动推荐或生成错误识别人工检测为主自动识别和纠正数据匹配基于规则机器学习算法处理时间批量处理实时动态处理自动化程度半自动化,需手动触发步骤高自动化,自主决策,支持实时监控、自动修复适用数据规模中小规模(万级至十万级)大规模(百万级以上)用户门槛依赖规则设计或技术能力低代码或无代码,门槛较低学习成本低,易上手中高,需理解AI推荐逻辑,部分工具需配置灵活性人工可控性强,适合结构化、规则固定规则场景自适应数据变化,适合非结构化、规则频繁调整场景典型特征按指令执行按数据规律自主优化大数据处理工具传统工具AI驱动工具数据处理产品3.6.2AI驱动工具TableauPrep数据处理技术应用大数据处理工具传统工具AI驱动工具TableauPrep数据处理技术应用3.6.2AI驱动工具不同的数据处理工具有各自的功能特点和使用场景。传统工具是数据处理的“基础工具包”,适合简单场景、固定规则或非技术人员操作。AI工具是“智能加速器”,通过自动化和自适应能力解决大规模、高复杂度数据的清洗难题。选择工具要综合考虑数据规模、技术背景、场景需求和工具生态等多方面因素,精准找到适配自身实际的“利器”,让数据处理工作事半功倍,而不是盲目追求功能全面。实际应用中,两者结合使用大数据,任何数据无论是电子表格、数据库还是Hadoop和云服务,任何数据都可以轻松探索。自动更新通过实时连接获取最新数据,或者根据制定的日程表获取自动更新。快速分析在数分钟内完成数据连接和可视化。Tableau比现有的其他解决方案快10到100倍。3.6.3TableauPrep数据处理技术应用TableauPrep数据处理步骤:打开TableauPrep,连接数据源,此处从中国统计年鉴上搜集了2016年中国高技术产业新产品开发的一些相关数据,见表3-3。表3-32016年高技术产业新产品开发数据表高技术产业名称新产品开发项目数(个)开发经费支出(万元)销售收入(万元)出口销售收入(万元)医药制造业253204978805.7054227526.504896556.00化学药品制造126422532006.0028629122.903034577.30中成药制造5431966074.3013037868.60352638.40生物、生化制品的制造3720827242.505807140.50921788.60航空航天器制造业19791909534.6015336595.901373118.40电子及通信设备制造业4259222741770.00318206467.80138247189.30通信设备制造业612010458336.30154306436.8077281533.30雷达及配套设备制造业468248228.602024144.50151710.70广播电视设备制造业2143544664.404884347.401224889.00电子器件制造业100574387057.6052854160.0024546514.70电子元件制造业115362912731.8039478279.2018011787.40家用视听设备制造业34271579533.5031026890.0010520890.80其他电子设备制造36411080824.2011263319.602264787.90电子计算机及办公设备制造业53472457057.2054641230.1032686511.10电子计算机整机制造业10301254812.2036421771.7022503619.20电子计算机外部设备制造业1482388950.006149683.403795880.60医疗器械及仪器仪表制造业168333034640.8025014345.503109374.20医疗仪器设备及器械制造业4515933322.404628267.80823536.00仪器仪表制造业123182101318.4020386077.702285838.203.6.3TableauPrep数据处理技术应用连接到数据源后,能够看到如下图的页面:3.6.3TableauPrep数据处理技术应用接下来转到工作表,在此页面进行可视化的操作:将“高技术产业名称”拖动到右侧的行中,将“新产品开发项目数”拖到列中,就可以得到各个产业在2016年开发项目数的条形图。按照开发项目数量由高到低进行降序排列,为了更直观的看到每个产业开发项目的具体数量,将“新产品开发项目数”拖到标记的“标签”内。得到图3-5。3.6.3TableauPrep数据处理技术应用根据图3-6,直观地显示了各个高技术产业新产品开发项目的数量,其中电子及通信设备制造业新产品开发项目数量最高,医药制造业次之,雷达及配套设备制造业新产品开发数量位居最后。图3-62016年高技术产业新产品开发项目条形图3.6.3TableauPrep数据处理技术应用分析各个高技术产业新产品开发的收入和出口收入情况,具体操作步骤如下:新建一个工作表。将“高技术产业名称”拖动到右侧的列中,分别将“销售收入”和“出口销售收入”拖到行中,选择“双轴”并设置为“同轴”,此时两种数据处于一个图中且单位相同。将“销售收入”的“标记类型”设置为条形图,将“出口销售收入”的“标记类型”设置为“线”。得到图3-7。3.6.3TableauPrep数据处理技术应用从图3-7中,可以观察到电子及通讯设备制造业新产品开发的销售收入和出口销售收入都是最高的,其次是通信设备制造业。结合两个图来看,可以得到电子及通讯设备制造业不仅新产品开发项目数量位居第一,而且该技术产业的销售收入和出口销售收入都是最高的,可见该高技术产业发展前景较好。图3-72016年高技术产业新产品开发收入情况3.6.3TableauPrep数据处理技术应用数据处理的常见案例Hiding将数据替换成一个常量,常用作不需要该敏感字段时。男—M
Hashing将数据映射为一个hash值,常用作将不定长数据映射成定长的hash值Tom—5601
Permutation将数据映射为唯一值,允许根据映射值找回原始值,支持正确的聚合或连接操作。Mary—abd
Shift为数量值增加一个固定的偏移量,隐藏数值部分特征。163——1637
Enumeration将数据映射为新值,同时保持数据顺序。500—25000
Truncation将数据尾部截断,只保留前半部分。001-23456—001
Mask数据长度不变,但只保留部分数据信息。123456—12---6
Floor数据或是日期取整94—90本章小结本章主要介绍了数据挖掘之前的必经之步——数据采集、数据处理。数据采集部分着重介绍了数据采集方法、数据质量评估标准以及影响数据质量的因素。数据处理部分,按照数据处理的一般阶段,按照数据清洗
数据变换
数据集成
数据归约这一顺序详细介绍每一阶段的处理方法。数据清洗分成三类介绍不同的清洗方法,即处理残缺数据、处理噪声数据、处理冗余数据。数据变换包括类型的变换与属性值的变换,介绍了数据概化与属性构造等属性类型变换方法,讲解了四种数据标准化的方法。数据集成部分介绍了模式匹配问题与集成时数据冗余的解决办法,同时介绍了两种冗余数据的检测算法。数据归约部分介绍了两种方法:维归约与数值归约。最后大数据处理工具部分介绍了传统工具和AI驱动工具,以及如何利用TableauPrep对搜集的数据进行可视化分析,得到直观的数据信息。希望通过本章的讲解,读者可以了解数据采集、数据处理的基本概念,掌握原始数据的采集方法以及数据处理的基本方法,为读者学习数据挖掘部分打下基础。谢谢观看BIGDATA导论V3目录第四章数据分析与数据挖掘案例--用大数据挖掘《觉醒年代》4.1数据分析概述4.2常见数据分析方法4.3数据挖掘基本概念4.4数据挖掘经典算法案例--基于YOLOv8的火焰烟雾检测案例—用大数据挖掘《觉醒年代》八爪鱼大数据平台数据采集过程如下:在建党一百周年之际播出的革命历史题材电视剧《觉醒年代》在豆瓣获得了9.3的高分,微博评论超过26亿。(1)设置数据采集的字段,包括:用户性别、年龄以及微博评论内容。(2)数据来源于微博关键词“觉醒年代”相关的博文及微博评论。(3)数据采集和数据清洗。数据采集的时间段为《觉醒年代》播出后的两周内的微博热搜数据,数据清洗包括去除无效信息以及疑似“水军”的账号内容,共获取有效信息3624条。大数据分析扮演着一个针对影视制作及投资决策建议平台的角色,它可以提供对市场的理性预期,用精准的量化数字计算可能的投资回报率。大数据虽然解决不了艺术性的问题,但是却有商业借鉴的意义。另外,大数据的分析还直接影响后期广告投放,以及衍生品物料的开发,有利于全价值链研究。4.1数据分析概述数据分析概念数据分析数据分析是指用适当的统计分析方法对收集来的大量数据进行分析,将他们加以汇总和理解并消化,以求最大化地开发数据的功能,发挥数据的作用。数据分析的三大作用包括现状分析、原因分析以及预测分析。过程数据分析过程理解数据分析目的,确定分析思路。数据分析目的可大致分为四个层次:描述性数据分析、诊断性数据分析、预测性数据分析以及指令性数据分析。描述性数据分析简要概括即“发生了什么”,通过描述性统计指标反映数据的波动情况和变化趋势,并且通过描述性数据分析可以观察到数据中是否出现了异常情况。数据分析概念过程数据分析过程数据分析概念过程诊断性数据分析是在描述性数据分析基础上更深入了一步,即“怎么发生的”。诊断性数据分析通过对数据的分析发现事件的起因与结果;预测性数据分析是综合描述性数据分析和诊断性数据分析的结果,进一步发现数据的走向,预测接下来可能发生的情况,即“可能发生什么”;指令性数据分析是在前三个层次的基础上提出解决方案的过程,即“应该做什么”。数据分析过程数据分析概念过程数据收集,根据数据分析目的,收集所需的相关数据。数据预处理,是指对收集到的数据进行降噪、加工处理,使之成为适用于数据分析的数据。数据分析,根据数据分析目的,选择相应的数据分析方法,并通过对应的数据分析工具对预处理后的数据进行数据分析,提取数据中有价值的信息,得出数据分析结果。数据可视化,将数据分析的结果通过图形或者表格的形式进行呈现,可以清楚地展示数据分析结果,也可以快速地发现其中的问题。常见数据分析方法4.2AHP层次分析法是一种定性与定量研究相结合的数据分析方法,多用于研究一些难以直接通过定量方法解决的问题。层次分析法是一种多目标决策方法,往往通过决策者的经验判断来决定因子的重要程度,并计算出每个决策方案的权重,通过优劣排序得到最优决策。层次分析法步骤:(1)建立层次结构,包括目标层、准则层和方案层。(2)构造判断矩阵。通过因子之间两两相互比较这种相对尺度的度量方法来构造判断矩阵,提高了决策的准确度。(3)权向量处理及一致性检验。数据分析方法层次分析法多元回归分析智能分析方法数据分析方法层次分析法多元回归分析智能分析方法某工厂有一笔新到资金,要决定如何使用,可供选择的方案有:用作奖金(P1);投资集体福利设施(P2);引进设备技术(P3)。所考虑的决策准则包括调动职工积极性(C1)、提高技术水平(C2)以及改善职工生活条件(C3)。建立层次结构模型。GC1C2C3WC111/51/30.105C25130.637C331/310.258G-C判断矩阵C1P1P2WP111/30.25P2310.75C2P2P3WP211/50.167P3510.833C3P1P2WP1120.667P21/210.333C1C2C3W(C)0.1050.6370.258P10.2500.667P20.750.1670.333P300.8330W(P)0.1980.2710.531由此可得,方案P3,优于方案P2优于方案P1,为合理使用资金,可将53%的资金用于引进设备技术,27%的资金用于投资集体福利设施,20%用作奖金。C1-P判断矩阵C2-P判断矩阵C3-P判断矩阵组合权向量数据分析方法层次分析法多元回归分析智能分析方法多元线性回归社会经济现象的变化往往受到多个因素的影响,因此,一般要进行多元回归分析,我们把包括两个或两个以上自变量的回归称为多元线性回归。数据分析方法层次分析法多元回归分析智能分析方法多元线性回归/learn/XMU-1206305809?tid=1454348451#/learn/content?type=detail&id=1227083084视频资料:中国大学MOOC,多元统计分析数据分析方法层次分析法多元回归分析智能分析方法智能分析方法随着数据规模不断扩大、类型日益多样,分析任务对自动化特征提取与高维模式建模的需求持续提升。在这种背景下,一系列能够自主学习特征表示的智能分析方法得到发展,其中以深度学习和强化学习为代表的方法在图像、文本、语音等多种数据场景中展现出强大适应性和泛化能力。数据分析方法层次分析法多元回归分析智能分析方法智能分析方法深度学习通过多层神经网络自动学习特征,适合高维、非结构化数据卷积神经网络(ConvolutionalNeuralNetwork,CNN):提取图像空间特征(分类、检测、医学影像),局部感知+权值共享。循环神经网络(RecurrentNeuralNetwork,RNN):处理序列数据(语音、文本),长期依赖问题→LSTM/GRU改进。Transformer:基于自注意力机制,支持全局建模和并行处理,是LLM(如DeepSeek、GPT)的核心架构。发展趋势:单一架构→混合型模型(Transformer+RNN/CNN)数据分析方法层次分析法多元回归分析智能分析方法智能分析方法强化学习基于环境反馈学习最优策略,强调“试错—评估—调整”循环建模:马尔可夫决策过程(MDP)常见算法:Q-learning、SARSA、DQN应用场景:智能博弈与机器人控制(AlphaGo)个性化推荐与动态定价(优化长期用户价值)自动驾驶(路径规划、避障、实时决策)自然语言生成与交互优化(RLHF提升LLM内容相关性)传统方法强调可解释性;智能方法在处理大规模、非结构化、高维数据方面优势明显,他们共同构成现代分析工具体系数据挖掘基本概念4.3视频资料:央视《开讲啦》数据挖掘的深度和应用的广度才是大数据的本质视频来源:/2018/03/11/VIDEONaWnDdHwRI5mv6YBOhd180311.shtml数据挖掘就是从大量的、不完全的、有噪声的、模糊的、随机的实际应用数据中,提取隐藏在其中但又潜在有价值的信息和知识的过程。主要包含以下几层含义:1)数据源必须是真实的、大量的、含噪声的。2)发现的是用户感兴趣的知识。3)发现的知识要可接受、可理解、可运用。4)并不要求发现放之四海而皆准的知识,仅支持特定的发现问题。数据挖掘基本概念数据挖掘的定义数据挖掘的分类数据挖掘的过程数据挖掘基本概念数据挖掘的定义数据挖掘的分类数据挖掘的过程数据挖掘的分类分类与预测聚类分析关联分析1.2.3.多个学科方向4.异常分析数据挖掘分类分类与预测聚类分析关联分析异常分析分类与预测分类算法是从数据集中选出已经分好类的数据子集作为训练集,在此训练集上运用数据挖掘分类计数构造一个分类模型,然后根据此分类模型对数据集中未分类的数据进行分类。例如,为了将银行信用卡申请者分为低、中和高风险三类,首先根据还款记录将已有的客户分成三类,并根据客户的收入情况、工作性质等因素建立一个分类模型,然后对新申请者根据他的工作性质等因素用此分类模型进行分类预测,估计他的还款风险,以决定是否批准申请。数据挖掘分类分类与预测聚类分析关联分析异常分析聚类分析例如,市场营销中可以将客户聚集成几个不同的客户群,从而发现客户群及其相应的特征,由此对不同的客户群采用不同的营销策略。聚类与分类的区别在于,聚类不依赖于预先定义好的类,不需要训练集。聚类指将数据集聚集成几个簇(聚类),使得同一个聚类中的数据集之间最大程度地相似,而不同聚类中的数据集最大程度地不同。数据挖掘分类分类与预测聚类分析关联分析异常分析关联分析最为典型的关联规则例子是“尿布与啤酒”的故事:沃尔玛的超市管理人员分析销售数据时发现了一个令人难于理解的现象:在某些特定的情况下,啤酒与尿布两件看上去毫无关系的商品会经常出现在同一个购物篮中。数据关联是数据集中的一类重要的可被发现的知识,反映了事件之间依赖或相关性。数据挖掘分类分类与预测聚类分析关联分析异常分析异常分析少量数据与通常数据的行为特征不一样,在数据的某些属性方面有很大的差异,即为异常子集,或称离群点。异常检测的基本方法1)请领域专家标记部分正常数据对象和离群点对象。2)统计学方法:对数据的表现作出一个统计模型假定,不符合该模型的数据是离群点。3)基于临近性的方法:如果数据远离它最邻近的数据,则认为它是离群点。4)聚类方法:小的或者稀疏的簇中数据可判定为离群点。数据挖掘基本概念数据挖掘的定义数据挖掘的分类数据挖掘的过程数据挖掘一般是指从大量的数据中通过算法搜索隐藏于其中信息的过程。挖掘过程的流程挖掘步骤具体内容第一步:建模(Modeling)选择和应用不同的技术模型,并进行调参优化。有些技术在数据形成上有特殊要求,因此需要经常跳回到数据准备阶段。第二步:评估(Evaluation)评估模型,检查构造模型的步骤。在这个阶段的关键目的是确认是否有重要业务问题没有被充分考虑。第三步:部署(Deployment)产生简单的报告或者是实现一个比较复杂的,可重复的数据挖掘过程。这个阶段一般是由客户而不是由数据分析人员承担部署工作。数据挖掘基本概念数据挖掘的定义数据挖掘的分类数据挖掘的过程数据挖掘经典算法4.4数据挖掘分类K-MeanKNN随机森林CNNRNN强化学习生成式AIK-Means算法是一个经典的聚类算法,它接受输入参数k,然后将n个数据对象划分为k个聚类,使所获得的聚类满足以下两个条件。1)同一聚类中的对象之间的相似度较高;2)不同聚类中的对象之间相似度较小。其中,“聚类相似度”是利用各聚类中对象的均值所获得一个“中心对象”的方式计算。K-Means算法的基本步骤如图所示。数据挖掘分类K-MeanKNN随机森林CNNRNN强化学习生成式AI1)在原始数据集中任意选择k个对象作为“初始聚类中心对象”,如k=2;2)计算其他对象与初始聚类中心之间的距离,并根据最小距离,将其他结点合并入对应的最小聚类中心结点所在的聚类,形成k=2个“中间聚类结果”;3)计算每个“中间聚类结果”的均值,在k中间聚类中找出k=2个“新的聚类中心对象”;4)重新计算每个对象与“新的聚类中心对象”之间的距离,并根据最小距离重新分类,形成k=2个“中间聚类结果”5)重复执行步骤3,4。当所有对象的聚类情况不再变化或已经达到规定的循环次数时,结束执行,并得到最终聚类结果。K-Means算法的基本步骤数据挖掘分类K-MeanKNN随机森林CNNRNN强化学习生成式AI
K-Means聚类分析视频来源/video/BV1Vt411v7YS?from=search&seid=15014250055469454611&spm_id_from=333.337.0.0数据挖掘分类K-MeanKNN随机森林CNNRNN强化学习生成式AIKNN(k-NearestNeighbour,k邻近)算法:在训练样本集中每个样本的分类标签为已知的条件下,如何为一个新增数据给出对应的分类标签。KNN算法的计算过程如图所示。数据挖掘分类K-MeanKNN随机森林CNNRNN强化学习生成式AI随机森林随机森林(RandomForests)是机器学习中一种基于bagging集成学习的算法。简单来说,随机森林就是将每棵决策树集合成森林,综合每棵树的计算结果成为最终输出结果。在数据集中随机有放回地抽取N个子样本。在子样本中随机选取k个特征,并据此构建决策树。重复以上步骤,所构建的每棵决策树聚在一起形成随机森林。更新数据,通过每棵决策树进行分类或预测,最终投票确认分类结果或者通过算数平均法计算最终预测值。数据挖掘分类K-MeanKNN随机森林CNNRNN强化学习生成式AI随机森林资料来源:/learn/BIT-1206703821?tid=1465418543#/learn/content?type=detail&id=1244637572&cid=1268948684视频资料:中国大学MOOC随机森林算法讲解数据挖掘分类K-MeanKNN随机森林CNNRNN强化学习生成式AICNN卷积神经网络(ConvolutionalNeuralNetwork,CNN)是一种典型的深度学习结构,擅长从图像中自动提取空间结构特征,广泛应用于图像分类、目标检测和医学影像分析等场景。其核心机制包括局部感知和权值共享,能够显著减少模型参数数量,在保证表达能力的同时提升训练效率与泛化性能。卷积操作过程输入:多通道图像(如RGB三通道)卷积核:在输入图像上滑动,对局部区域加权求和输出:生成新的特征图,逐层提取边缘、纹理、形状等特征多个卷积核可并行工作,提取不同特征→形成更丰富的深层表示数据挖掘分类K-Mea
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026智能门锁安全芯片加密等级与攻防技术演进
- 2026人工智能产业发展驱动力分析及科技创新投资价值报告
- 慢性瘙痒管理指南重点2026
- 2026中国现代化农业机械装备行业市场现状需求分析投资评估规划竞争格局研究报告
- 2026中国细胞培养肉监管审批路径与消费者接受度区域对比研究报告
- 2026中国汽车电子传感器国产化替代进程与供应链安全评估报告
- 2026年汽车焊接机器人智能化改造技术路线
- 2026中国整形外科定制化植入物医工结合模式与产业化报告
- 2026中国智能机器人制造自动化行业市场分析及工业机器人应用拓展报告
- 2026中国商业航天发射服务市场化与轨道资源竞争分析报告
- 城配物流知识培训课件
- 2025一级消防工程师继续教育题库及答案
- 【课件】工作危害分析法(JHA)专项培训课件丨
- 电工四级练习题库(含参考答案)
- 2024年陕西延长石油集团招聘笔试真题
- 《湖南省房屋建筑和市政工程消防质量控制技术标准》
- 2024年建筑三类人员考试题库(多选题)
- (高清版)JTGT 5440-2018 公路隧道加固技术规范
- 新闻评论写作五步法课件
- 工程造价咨询服务方案(技术方案)
- 国际红十字运动的基本知识
评论
0/150
提交评论