版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
人工智能技术及应用——上篇目录01大数据基本概念02数据挖掘原理与算法简介03大数据技术案例分析04本章小结01大数据基本概念目前业界对大数据还没有一个统一的定义。常见的研究机构基于不同的角度给出如下定义:大数据是指大小超出常规的数据库工具获取、存储、管理和分析能力的数据集。(并不是说一定要超过特定TB的数据集才能算大数据)。——麦肯锡大数据是指无法在一定时间内用常规软件工具对其内容进行抓取、管理和处理的数据集。
——维基百科大数据是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。——Gartner数据量大、获取速度快或形态多样的数据,难以用传统关系型数据分析方法进行有效分析,或者需要大规模的水平扩展才能高效处理。——美国国际标准技术研究院(NIST)大数据一般会涉及两种或两种以上的数据形式,它需要收集超过100TB(1TB=240B)的数据,并且是高速实时数据流;或者是从小数据开始,但数据每年增长速率至少为60%。——国际数据公司大数据的定义Volume(巨量性):数据量巨大。这是大数据的显著特征,数据集合的规模不断扩大,已从GB到TB再到PB级,甚至开始以EB和ZB来计数。(B、KB、MB、GB、TB、PB、EB、ZB、YB)Variety(多样性):数据类型复杂多样。以往产生或者处理的数据部分是结构化数据,如今,还包含大量半结构化或者非结构化数据。Velocity(高速性):数据具有高速性。数据产生、处理和分析的速度持续在加快,数据流量大。Value(高价值,低价值密度):数据具有潜在价值。大数据由于数据体量不断增大,单位数据的价值密度不断降低,而数据的整体价值在提高。现在普遍以4V特征来描述大数据,其反映了大数据在4个方面的特点:大数据的特点数据量大根据IDC作出的估测,数据一直都在以每年50%的速度增长,也就是说每两年就增长一倍(大数据摩尔定律)人类在最近两年产生的数据量相当于之前产生的全部数据量到2020年,全球将总共拥有35ZB的数据量,相较于2010年,数据量将增长近30倍预计到2030年全球新增数据量将突破1YB级,人类将进入”YB时代“(1YB约等于一亿亿亿字节)。1B=8bit1KB=1024B1MB=1024KB1GB=1024MB1TB=1024GB1PB=1024TB1EB=1024PB1ZB=1024EB1YB=1024ZB大数据的特点数据类型繁多大数据是由结构化和非结构化数据组成的10%的结构化数据,存储在数据库中90%的非结构化数据,它们与人类信息密切相关科学研究–基因组–LHC加速器–地球与空间探测企业应用–Email、文档、文件–应用日志–交易记录Web1.0数据–文本–图像–视频Web2.0数据–查询日志/点击流–Twitter/Blog/SNS–Wiki大数据的特点处理速度快从数据的生成到消耗,时间窗口非常小,可用于生成决策的时间非常少1秒定律:这一点也是和传统的数据挖掘技术有着本质的不同
大数据时代的很多应用,都需要基于快速生成的数据给出实时分析结果,用于指导生产和生活实践,因此,数据处理和分析的速度通常要达到秒级甚至毫秒级响应,这一点和传统的数据挖掘技术有着本质的不同,后者通常不要求给出实时分析结果。大数据的特点价值密度低价值密度低,商业价值高以视频为例,连续不间断监控过程中,可能有用的数据仅仅有一两秒,但是具有很高的商业价值大数据的特点传统数据与大数据的区别传统数据和大数据区别如下表所示:类型传统数据大数据数据规模小规模,以MB、GB为单位大规模,以TB、PB为单位生成速度每小时、每天每秒,甚至更快数据源集中的数据源分散的数据源数据的结构类型单一的结构化数据结构化、半结构化、非结构化等多源异构数据数据存储关系型数据管理系统(RDBMS)非关系型数据库(NoSQL)、分布式存储系统(如HDFS)处理工具一种或少数几种处理工具不存在单一的全处理工具大数据的特征
所谓结构化数据,简单来说就是数据库,也称作行数据,是由二维表结构来逻辑表达和实现的数据,严格地遵循数据格式与长度规范,它的特点是每一列数据具有相同的数据类型,每一列数据不可以再细分。此类数据主要通过关系型数据库进行存储和管理,常用的关系型数据库如SQLServer、DB2、MySQL、Oracle。结构化数据01用户ID姓名班级爱好手机号码1张阿三119游泳138546212982孙德120乒乓构化数据表举例大数据的结构类型半结构化数据02
半结构化数据和普通纯文本相比具有一定的结构性,但和具有严格理论模型的关系数据库的数据相比更灵活。它是一种适于数据库集成的数据模型,也就是说,适于描述包含在两个或多个数据库(这些数据库含有不同模式的相似数据)中的数据。例如,邮件、报表、HTML文档、具有定义模式的XML数据文件等。典型应用场景如邮件系统、档案系统等。半结构化数据举例<person><name>A</name><age>13</age><gender>female</gender></person>大数据的结构类型大数据的结构类型非结构化数据03
非结构化数据,是与结构化数据相对的,不适合用数据库二维表来表现,包括所有格式的办公文档、图片和咅频、视频信息等。支持非结构化数据的数据库采用多值字段、变长字段等机制进行数据项的创建和管理,广泛应用于全文检索和各种多媒体信息处理领域。数据采集的概念
数据采集又称“数据获取”,是数据分析的入口,也是数据分析过程中相当重要的一个环节,即通过各种技术手段对外部各种数据源产生的数据实时或非实时地采集并加以利用。在数据爆炸的互联网时代,被采集的数据也是复杂多样的,包括结构化数据、半结构化数据、非结构化数据。数据采集可以分为传统的数据采集和大数据采集。大数据采集与传统的数据采集既有联系又有区别。大数据采集是在传统的数据采集基础之上发展起来的,一些经过多年发展的数据采集架构、技术和工具都被继承下来。同时,由于大数据本身具有数据量大、数据类型丰富、处理速度快等特性,因此大数据采集又表现出不同于传统数据采集的一些特点。传统的数据采集大数据采集数据源来源单一,数据量相对较少来源广泛,数据量巨大数据类型结构单一数据类型丰富,包括结构化、半结构化和非结构化数据存储关系数据库和并行数据仓库分布式数据库,分布式文件系统传统的数据采集与大数据采集区别数据采集的概念大数据采集传感器数据:指通过传感器等物联网设备获取到的数据。
传感器是一种检测装置,能“感受”到被测量的信息,并将其按一定规律变换成为电信号或其他所需形式的信息输出,以满足信息的传输、处理、存储、显示、记录和控制等要求。在工作现场,我们会安装各种类型的传感器,如压力传感器、温度传感器、流量传感器、声音传感器、电参数传感器等。传感器对环境的适应能力很强、可以应对各种恶劣的工作环境。在日常生活中,温度计、话简、摄像头等都属于传感器,支持图片、音频、视频等文件或附件的采集。根据数据来源形式不同,数据大致分为如下三种:大数据采集互联网数据:互联网数据的采集通常是借助于网络爬虫来完成的。所谓“网络爬虫”,就是一个在网上到处或定向抓取网页数据的程序。抓取网页的一般方法是,定义一个入口页面,一般一个页面中会包含指向其他页面的URL,于是从当前页面获取到这些网址加人到爬虫的抓取队列中然后进人到新页面后再递归地进行上述的操作。爬虫数据采集方法可以将非结构化数据从网页中抽取出来,将其存储为统一的本地数据文件,并以结构化的方式存储。它支持图片、音频、视频等文件或附件的采集,附件与正文可以自动关联。根据数据来源形式不同,数据大致分为如下三种:大数据采集日志文件:许多公司的业务平台每天都会产生大量的日志文件。日志文件一般由数据源系统产生,用于记录针对数据源执行的各种操作,如网络监控的流量管理、金融应用的股票记账和Web服务器记录用户访问行为。利用这些日志文件,我们可以得到很多有价值的数据。通过对这些日志信息进行采集,然后进行数据分析,人们可以挖掘到具有潜在价值的信息,为公司决策和公司后台服务器平台性能评估提供可靠的数据保证。日志采集系统做的事情就是收集日志数据,供离线和在线实时分析使用。根据数据来源形式不同,数据大致分为如下三种:网络爬虫技术网络爬虫概述01
尽管目前移动端的应用较为广泛,但由于涉及用户隐私,企业知识产权等相关问题,因此,APP采集通常是企业内部需要对用户行为进行分析时采用的常规方式。而在学术领域,传统Web端数据采集应用广泛。而针对Web端的数据采集从一定程度上又可以被称为网络爬虫。百度定义:网络爬虫(又被称为网页蜘蛛,网络机器人,在FOAF社区中间,更经常的称为网页追逐者),是一种按照一定的规则,自动地抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁、自动索引、模拟程序或者蠕虫。网络爬虫技术网络爬虫概述01网络爬虫引用广泛,常见的应用包括:服务于搜索引擎:网络爬虫采集互联网上尚未索引的数据,索引到搜索引擎到索引,方便用户搜索。采集网络数据,用于数据分析:数据分析到数据来源,一部分来自于互联网,在对数据进行分析之前,需要使用爬技术,将数据采集到以后,进行数据清洗,结构化,然后才能对数据进行分析。舆情监测:舆情监测,整合互联网信息采集技术及信息智能处理技术通过对互联网海量信息自动抓取、自动分类聚类、主题检测、专题聚焦,实现用户的网络舆情监测和新闻专题追踪等信息需求,形成简报、报告、图表等分析结果,为客户全面掌握群众思想动态,做出正确舆论引导,提供分析依据。产品基础服务:根据产品的具体要求,通过网络爬虫技术,对互联网中的信息进行爬取,为产品进行基础服务支持。网络爬虫技术网络爬虫工作流程共4步,分别是:第一步:选取一部分精心挑选的种子URL。第二步:将这些URL放入待抓取URL队列。工作流程02网络爬虫工作流程共4步,分别是:第三步:从待抓取URL队列中取出待抓取URL,解析DNS,并且得到主机的ip地址,并将URL对应的网页下载下来,存储进已下载网页库中。此外,将这些URL放进已抓取URL队列。工作流程02网络爬虫技术网络爬虫工作流程共4步,分别是:第四步:分析已抓取URL队列中的URL,分析其中的其他URL,并且将URL放入待抓取URL队列,从而进入下一个循环。工作流程02网络爬虫技术分布式文件系统HDFS
大数据时代必须解决海量数据的高效存储问题,为此,分布式文件系统应运而生。相对于传统的本地文件系统而言,分布式文件系统(distibutedflesystem,DFS)是一种通过网络实现文件在多台主机上进行分布式存储的文件系统。分布式文件系统的设计一般采用“客户端/服务器”(ClienVServer)模式,客户端以特定的通信协议通过网络与服务器建立连接,提出文件访问请求,客户端和服务器可以通过设置访问权来限制请求方对底层数据存储块的访问。
谷歌开发了分布式文件系统(Googleflesystem,GFS),通过网络实现文件在多台机器上的分布式存储,较好地满足了大规模数据存储的需求。Hadoop分布式文件系统(Hadoopdis-tibutedflesystem,HDFS)是针对GFS的开源实现,它是Hadoop两大核心组成部分之一,提供了在廉价服务器集群中进行大规模分布式文件存储的能力。HDFS具有很好的容错能力,并且兼容廉价的硬件设备,因此,可以以较低的成本利用现有机器实现大流量和大数据量的读写。分布式文件系统在物理结构上是由计算机集群中的多个节点构成的,这些节点分为两类,一类叫“主节点”(MasterNode)或者也被称为“名称节点”(NameNode),另一类叫“从节点”(SlaveNode)或者也被称为“数据节点”(DataNode)
大规模文件系统的整体结构分布式文件系统HDFSHDFS简介总体而言,HDFS要实现以下目标:●兼容廉价的硬件设备●流数据读写●大数据集●简单的文件模型●强大的跨平台兼容性HDFS特殊的设计,在实现上述优良特性的同时,也使得自身具有一些应用局限性,主要包括以下几个方面:●不适合低延迟数据访问●无法高效存储大量小文件●不支持多用户写入及任意修改文件HDFS的存储原理冗余存储01HDFS采用了多副本方式对数据进行存储,一个数据块(默认128MB)的多个副本会被分布到不同的数据节点上。加快数据传输速度。当多个客户端需要同时访问同一个文件时,可以让各个客户端分别从不同的数据块副本中读取数据,这就大大加快了数据传输速度。容易检查数据错误。HDFS的数据节点之间通过网络传输数据,采用多个副本可以很容易判断数据传输是否出错。保证数据的可靠性。即使某个数据节点出现故障失效,也不会造成数据丢失。HDFS的存储原理存储策略02第一个副本:放置在上传文件的数据节点;如果是集群外提交,则随机挑选一台磁盘不太满、CPU不太忙的节点第二个副本:放置在与第一个副本不同的机架的节点上第三个副本:与第一个副本相同机架的其他节点上更多副本:随机节点Block的副本放置策略大数据处理
MapReduce是大家熟悉的大数据处理技术,当人们提到大数据时就会很自然地想到MapReduce,可见其影响力之广。实际上,由于企业内部存在多种不同的应用场景,因此,大数据处理的问题复杂多样,单一的技术是无法满足不同类型的计算需求的,MapReduce其实只是大数据处理技术中的一种,它代表了针对大规模数据的批量处理技术,除此以外,还有查询分析计算、图计算、流计算等多种大数据处理分析技术。批处理计算
批处理计算主要解决针对大规模数据的批量处理,也是我们日常数据分析工作中非常常见的一类数据处理需求。MapReduce是最具有代表性和影响力的大数据批处理技术,可以并行执行大规模数据处理任务,用于大规模数据集(大于1TB)的并行运算。MapReduce将复杂的、运行于大规模集群上的并行计算过程高度地抽象到了两个函数Map和Reduce上,编程人员在不会分布式并行编程的情况下,也可以很容易地将自己的程序运行在分布式系统上,完成海量数据集的计算。批处理计算的实例较为著名的还有Spark。Spark使用内存替代HDFS或本地磁盘来存储中间结果,因此要比MapReduce的速度快许多。传统并行计算框架MapReduce集群架构/容错性共享式(共享内存/共享存储),容错性差非共享式,容错性好硬件/价格/扩展性刀片服务器、高速网、SAN,价格贵,扩展性差普通PC机,便宜,扩展性好编程/学习难度what-how,难what,简单适用场景实时、细粒度计算、计算密集型批处理、非实时、数据密集型批处理计算传统并行计算框架与MapReduce的区别MapReduce概述MapReduce工作流程
在MapReduce中,一个存储在分布式文件系统中的大规模数据集会被切分成许多独立的小数据块,采用“分而治之”,策略这些小数据块可以被多个Map任务并行处理。MapReduce框架会为每个Map任务输入一个数据子集,Map任务生成的结果会继续作为Reduce任务的输入,最终由Reduce任务输出最后结果,并写入分布式文件系统。MapReduce实例输入文档:Map结果:词频统计MapReduce实例Reduce结果:词频统计02数据挖掘原理与算法简介数据挖掘的背景海量数据的分析需求
现在无论是线下的大超市还是线上的商城,每天都会产生TB级以上的数据量。以往人们得不到想要的数据,是因为数据库中没有数据,而现在仍然无法快捷地得到想要的数据,其原因是数据库里面的数据太多了,缺少获取数据库中利于决策的有价值数据的有效方法。大量的信息在给人们带来便利的同时也带来了许多问题:信息过量,难以消化;信息真假难以辨识;信息安全难以保证;信息的形式并不总是相同的,很难统一处理。
人们开始考虑:“怎么样才能不被信息的海洋所淹没,并且从大量的信息中发理现有价值的知识、提高信息利用率?”。因此,海量数据的分析需求催生了数据挖掘。另外,各行各业的高价值数据的需求也催生了数据挖掘。数据挖掘的背景海量数据的分析需求信息不处理就成为“信息垃圾”各行业各领域政府、企业等组织也滋生出信息处理、数据处理的需求
提升管理
提升服务
提升竞争力
数据挖掘的背景海量数据的分析需求商业企业要处理信息大量数据被收集、存储在数据库\数据仓库中Web数据,电子商务商场,实体店银行/信用卡业务数据竞争压力越来越大提供更好的、更为突出的个性化服务(例如CRM)计算机越来越便宜,功能越来越强大数据挖掘的背景海量数据的分析需求科研院所要处理信息数据以极快的速度收集和存储(GB/hour)卫星上的远程传感器射电望远镜空间扫描产生基因表达数据的微阵列科学仿真(产生以TB计的数据量)数据挖掘可能帮助科学家进行数据的分类和划分生成假设传统的技术难以处理这些海量原始数据数据挖掘的背景海量数据的分析需求金融机构要处理信息积累了海量的业务数据互联网金融业务银行卡/信用卡交易数据国民经济运行数据通过数据处理和应用,完成电信欺诈预警反洗钱个性化服务数据挖掘的背景“数据爆炸但知识贫乏”的现象
数据库技术的飞速发展和数据库管理系统的广泛应用,导致数据的积累速度变快,积累量不断增加。在这爆炸性增长的数据中隐藏着许多重要的、有价值的信息,人们希望能够深入分析这些数据,以达到提高数据利用率的目的。数据库管理系统现在已经实现了高效地输入、查询、统计等功能,但是数据中存在的关联关系和规则仍然无法被发现,无法通过分析现有的数据来预测未来的发展趋势,缺少挖掘数据背后有用知识的手段,导致“数据爆炸但知识贫乏”的现象出现。因此,人们迫切需要功能强大的工具去挖掘海量数据背后的知识,让数据成为真正意义上的知识泉源,于是数据挖掘技术应运而生。数据挖掘的原理数据挖掘的定义
数据挖掘就是从大量的、不完全的、有噪声的、模糊的、随机的数据中,提取隐含在其中的、人们事先不知道的但又是潜在有用的信息和知识的过程。这些信息的表现形式为:规则、概念、规律及模式等。这一定义包括多层含义:数据源必须是真实的、海量的、含噪声的。发现的是用户感兴趣、新颖的知识。发现的知识应该可接受、可理解、可运用、有价值。知识的形式可以是概念、规则、模式、规律等形式。
数据挖掘是知识获取的核心,它是从大量不完全的、有噪声的、模糊的和随机的应用数据中,提取隐含在其中、事前不知道的,但又是潜在有用信息的过程。数据挖掘的主要对象如下:数据挖掘的原理文本数据库数据对象关系数据库面向对象的数据库时态数据库多媒体数据库空间数据库NoSQL数据库异质数据库数据仓库数据挖掘的对象数据挖掘的原理数据挖掘的意义
数据挖掘是数据库中知识发现(knowledgediscoveryindatabase,KDD)不可缺少的一部分,而KDD是将未加工的数据转换为有用信息的整个过程。知识发现的过程数据矿山信息金块数据挖掘工具数据挖掘算法简介聚类是一种查找隐藏在数据之间内在结构的技术。聚类是将所有的样本数据组织成一些相似的组,根据样本数据的特点对其进行分类,使得同一类别中的数据实例具有相似性的特点,不同类别的数据实例相似性应尽可能小。聚类技术通常被称为无监督学习,进行聚类分析时并不知道数据能够被分成多少类,在聚类中数据类别或者分组信息是未知的。聚类分析完全基于原始数据,没有任何关于类别的信息可供参考。典型应用:客户分类文本分类医疗图像自动监测等聚类分析01聚类聚类分析算法的分类聚类分析算法的分类图
数据挖掘算法简介分类是找出描述和区分数据类或概念的模型,以便使用模型预测类标号未知的对象类标号。分类是一种监督学习。分类算法要求基于数据属性值来定义类别,并且通常通过给定类别的数据的特征来描述类别。(决策树、支持向量机、K近邻、朴素贝叶斯)分类的过程可分为两步:模型的创建,通过学习训练集建立分类模型模型的应用,利用分类模型对数据进行分类。典型应用:科学实验医疗诊断气象预报商业预测预测建模——分类02预测建模——分类02目前比较常用的分类方法:决策树最近邻法贝叶斯法支持向量机法分类器组合法人工神经网络数据挖掘算法简介数据挖掘算法简介回归分析就是先进行拟合,然后得到一个相应的数学表达式,拟合时需要参照具有相关关系(例如天道酬勤)的变量所具有的变化规律。它研究的是一个变量与其他变量之间的依存关系,并用数学模型进行模拟,目的在于根据已知的解释变量的值,预测因变量的总体平均值。回归分析的步骤:根据研究问题的要求建立回归模型。根据样本观测值对回归模型参数进行估计,进而求得回归方程。对回归方程、参数估计值进行显著性检验,并从影响因变量的自变量中判断哪些显著,哪些不显著。利用回归方程进行预测。典型应用:最近知乎推出视频收益的东西,就可以根据自己发视频的时间,主题,播放量等等因素,预测收益值的多少药物剂量和疗效、饮食习惯和身体健康等预测建模——回归02数据挖掘的主要任务预测建模——回归02回归方法适用条件算法描述线性回归(LinearRegression)因变量与自变量是线性关系对一个或多个自变量和因变量间的线性关系进行建模,可用最小二乘法求解模型系数非线性回归因变量与自变量间不都是线性关系对一个或多个自变量和因变量间的非线性关系进行建模。若非线性关系可通过简单的函数变换转化成线性关系,用线性回归的思想求解,若不能转化,用非线性最小二乘法求解逻辑回归(LogisticRegression)因变量一般有1和0(是、否)两种取值广义线性回归模型的特例,利用Logistic函数将因变量的取值范围控制在0、1之间,表示取值为1的概率多项式回归(PolynomialRegression)自变量的指数大于1在这种回归技术中,最佳拟合线不是直线,而是一个用于拟合数据点的曲线岭回归参与建模的自变量间具有多重共线性是一种改进最小二乘估计的方法主成分回归参与建模的
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026中国玩具制造行业技术创新与市场竞争力发展研究报告
- 某电子集团公司薪资管理制度
- 2026全球数据中心市场供需竞争格局分析投资发展前景规划研究报告
- 2026中国食品饮料连锁经营行业市场供需分析及投资评估规划分析研究报告
- 2026中国医药流通业市场运营分析研究报告
- 2026中国涡流泵在食品饮料行业的卫生标准升级影响
- 2026中国污水处理提标改造工程市场机会与投资回报分析
- 2026-2030中国青公寓市场供需风险及营销模式发展趋势分析研究报告
- 2026-2030包装用生物基胶粘剂行业市场现状供需分析及重点企业投资评估规划分析研究报告
- 2026-2030全球电声元器件行业投资规模与发展趋势预判研究报告
- 2026年时事政治考试题库及答案(100题)
- 2026年危险化学品生产单位安全生产管理人员安全生产模拟考试题库及答案
- 高标准农田建设技术工作手册
- 魏家凉皮考勤制度
- 无刷电机培训
- 临床医学大三《急性脑梗塞合并一氧化碳中毒》教学设计
- 全口吸附性义齿知情同意书
- 《大明太祖高皇帝实录》(点校标注版1-30卷)
- 健身房安全应急预案
- 养老机构销售技巧培训
- 深层卤水锂资源勘探开发的技术进展与前景展望
评论
0/150
提交评论