智能基础技术 1_第1页
智能基础技术 1_第2页
智能基础技术 1_第3页
智能基础技术 1_第4页
智能基础技术 1_第5页
已阅读5页,还剩5页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

课程教案课程名称人工智能技术及应用学时2授课教师授课班级授课学期课程考核使用教材人工智能技术及应用课程目标课程目标1能够简述大数据的基本概念、4V特征、采集与存储方法,掌握分布式文件系统HDFS的架构原理(名称节点与数据节点的功能)及MapReduce的核心思想与工作流程;能够针对健康大数据、智慧城市等行业应用场景,了解其中涉及的复杂工程问题及所运用的智能处理技术。课程目标2能在多学科环境下(包括模拟环境),通过综合健康服务平台等案例分析,阐述大数据在满足特定需求(如海量数据存储、批量数据处理、关联规则挖掘等)中的智能设计方法,并考虑HDFS存储与MapReduce计算各模块之间的关联与影响,分析大数据工程中的实际问题,提升学生的智能技术应用能力和系统化问题解决能力。教案课程内容人工智能技术与应用上篇第二章大数据技术2.1大数据基本概念授课时间年月日授课学时1课时教学目标(知识、能力两个方面内容)知识目标:掌握大数据的基本概念和特点,掌握大数据采集与传统数据采集的区别,了解数据采集的主要数据源有哪些;掌握分布式文件系统HDFS的概念和原理,以及架构;掌握MapReduce的核心思想和工作流程。能力目标:根据掌握的大数据技术,尝试在大数据平台上配置HDFS和MapReduce命令。教学内容摘要(注明重点、难点)教学方法、手段与课程思政设计12.1.1大数据的特点现在普遍以4V特征来描述大数据,其反映了大数据在4个方面的特征:数据量大(Vlume)、数据类型繁多(Variety)、处理速度快(Velocity)和价值密度低(Value)。讨论:请同学们以小组为单位通过生活中的例子来说明大数据的4个特点。22.1.2大数据的采集(一)数据采集的概念数据采集是大数据产业的基石。大数据具有很高的商业价值,但是,如果没有数据,价值就无从谈起,就好比不开采石油,就不会有汽油。数据采集,又称“数据获取”,是数据分析的入口,也是数据分析过程中相当重要的一个环节。它通过各种技术手段把外部各种数据源产生的数据实时或非实时地采集并加以利用。在数据大爆炸的互联网时代,被采集的数据的类型也是复杂多样的,包括结构化数据、半结构化数据、非结构化数据。大数据采集与传统的数据采集既有联系又有区别传统数据采集大数据采集数据源来源单一,数据量相对较少来源广泛,数据量巨大数据类型结构单一数据类型丰富,包括结构化、半结构化和非结构化数据数据存储关系数据库和并行数据仓库分布式数据库,分布式文件系统(二)数据采集的三大要点(1)全面性。全面性是指数据量足够具有分析价值、数据面足够支撑分析需求(2)多维性。数据更重要的是能满足分析需求。数据采集必须能够灵活、快速自定义数据的多种属性和不同类型,从而满足不同的分析目标要求。(3)高效性。高效性包含技术执行的高效性、团队内部成员协同的高效性,以及数据分析需求和目标实现的高效性。(三)数据采集的数据源数据采集的主要数据源包括传感器数据、互联网数据、日志文件、企业业务系统数据等。(四)数据采集方法数据采集是数据系统必不可少的关键操作,也是数据平台的根基。根据不同的应用环境及采集对象,有多种不同的数据采集方法,包括系统日志采集、分布式消息订阅分发、ETL、网络数据采集等。提问:1、说出大数据采集和传统数据采集的区别。2、什么是爬虫?32.1.3大数据的存储(重点、难点)(一)HDFS的概述分布式文件系统的设计一般采用“客户端/服务器”(Client/Server)模式,客户端以特定的通信协议通过网络与服务器建立连接,提出文件访问请求,客户端和服务器可以通过设置访问权来限制请求方对底层数据存储块的访问。谷歌开发了分布式文件系统(GoogleFileSystem,GFS),通过网络实现文件在多台机器上的分布式存储,较好地满足了大规模数据存储的需求。Hadoop分布式文件系统(HadoopDistributedFileSystem,HDFS)是针对GFS的开源实现,它是Hadoop两大核心组成部分之一,提供了在廉价服务器集群中存储大规模分布式文件的能力。HDFS具有很好的容错能力,并且兼容廉价的硬件设备,因此,可以以较低的成本利用现有机器实现大流量和大数据量的读写操作。(二)分布式文件系统的架构与普通文件系统类似,分布式文件系统也采用了块的概念,文件被分成若干个块进行存储。块是数据读/写的基本单元,只不过分布式文件系统中块的大小要比操作系统中块的大小大很多。例如,HDFS默认的一个块的大小是64MB。与普通文件不同的是,在分布式文件系统中,如果一个文件的大小小于一个文件块的大小,那么它并不占用整个文件块的存储空间。分布式文件系统在物理结构上是由计算机集群中的多个节点构成的。这些节点分为两类:一类被称作“主节点”(MasterNode),或者也称为“名称节点”;另一类被称作“从节点”(SlaveNode),或者也称为“数据节点”。名称节点负责文件和目录的创建、删除和重命名等,同时管理着数据节点和文件块的映射关系,因此客户端只有访问名称节点才能找到请求的文件块所在的位置,进而到相应位置读取所需文件块。数据节点负责数据的存储和读取,在存储数据时,先由名称节点分配存储位置,然后由客户端把数据直接写入相应数据节点;在读取数据时,客户端从名称节点获得数据节点和文件块的映射关系,就可以到相应位置访问文件。数据节点也要根据名称节点的命令创建、删除文件块和冗余复制。计算机集群中的节点可能发生故障,因此为了保证数据的完整性,分布式文件系统通常采用多副本存储。文件块会被复制为多个副本,存储在不同的节点上,而且存储同一文件块的不同副本的各个节点会分布在不同的机架上,这样,在单个节点出现故障时,就可以快速调用副本重启单个节点上的计算过程,而不用重启整个计算过程。整个机架出现故障时便不会丢失所有文件块。文件块的大小和副本个数通常由用户指定。(三)HDFS的设计目标HDFS要实现以下目标:(1)兼容廉份的硬件设备(2)流数据读写(3)大数据集(4)简单的文件模型(5)强大的跨平台兼容性HDFS特殊的设计,在实现上述优良特性的同时,也使得自身具有一些应用局限性,主要包括以下几个方面:不适合访问低延迟数据无法高效存储大量小文件不支持多用户写入及任意修改文件社会的发展需要多个部门协调,相互合作才能共同发展,集群的概念在当今社会发展中体现在共同发展中。教学方法:互动式教学讲授,着重讲解名称节点与数据节点的功能思政一:工作中关键数据要时常备份,避免数据丢失。思政二:生活中要各司其职,提高工作效率。42.1.4大数据的处理(重点、难点)MapReduce是大家熟悉的大数据处理技术,当人们提到大数据时就会很自然地想到MapReduce,可见其影响力之广。实际上,由于企业内部存在多种不同的应用场景,因此,大数据处理的问题复杂多样,单一的技术是无法满足不同类型的计算需求的,MapReduce其实只是大数据处理技术中的一种,它代表了针对大规模数据的批量处理技术,除此以外,还有查询分析计算、图计算、流计算等多种大数据处理分析技术。(一)MapReduce简介MapReduce是谷歌的核心计算模型。MapReduce将复杂的、运行于大规模集群上的并行计算过程高度地抽象为两个函数:Map和Reduce,这两个函数及其核心思想都源自函数式编程语言。在MapReduce中,一个存储在分布式文件系统中的大规模数据集会被切分成许多独立的小数据块,这些小数据块可以被多个Map任务并行处理。MapReduce框架会为每个Map任务输入一个数据子集,Map任务生成的结果会继续作为Reduce任务的输入,最终由Reduce任务输出最后结果,并写入分布式文件系统。特别需要注意的是,适合用MapReduce来处理的数据集需要满足一个前提条件:待处理的数据集可以分解成许多小的数据集,而且每一个小数据集都可以完全并行地进行处理。MapReduce设计的一个理念就是“计算向数据靠拢”,而不是“数据向计算靠拢”。因为移动数据需要大量的网络传输开销,尤其是在大规模数据环境下,这种开销尤为惊人,所以,移动计算要比移动数据更加经济。本着这个理念,在一个集群中,只要有可能,MapReduce框架就会将Map程序就近地在HDFS数据所在的节点运行,即将计算节点和存储节点放在一起运行,从而减少节点间的数据移动开销。(二)MapReduce的工作流程MapReduce的核心思想可以用“分而治之”来描述,也就是把一个大的数据集拆分成多个小数据块在多台机器上并行处理。MapReduce的核心是Map函数和Reduce函数,一个大的MapReduce作业,首先会被拆分成许多个Map任务在多台机器上并行执行,每个Map任务通常运行在数据存储的节点上。这样计算和数据就可以放在一起运行,不需要额外的数据传输开销。当Map任务结束后,会生成以<key,value>形式表示的许多中间结果。然后,这些中间结果会被分发到多个Reduce任务在多台机器上并行执行,具有相同key的<key,value>会被发送到同一个Reduce任务,Reduce任务会对中间结果进行汇总计算得到最后结果,并输出到分布式文件系统。函数输入输出说明Map<k1,v1>List(<k2,v2>)将小数据集进一步解析成一批<key,value>(键值对),输入Map函数中进行处理;每个输入的<k1,v1>会输出一批<k2,v2>,<k2,v2>是计算的中间结果Reduce<k2,List(v2)><k3,v3>输入的List(v2)表示属于同一个k2的value教学方法:互动式教学教学手段:提问、举例引入。例如:要用编程语言实现一个大的项目,往往需要对项目的功能进行拆分,拆分成若干个函数来实现功能,所有函数编写完毕后,这个大型项目也就完成了。课程思政:人多力量大、效率高。课程思政:结合大数据作为国家基础性战略资源的战略定位,引导学生认识数据安全与数据主权的重要性,增强维护国家网络空间安全的使命感。结合我国在大数据处理技术(HDFS、MapReduce等)领域的自主创新成果,引导学生认识突破核心技术、实现科技自立自强的紧迫性,激发自主创新意识。结合数据采集的全面性与隐私保护的平衡,引导学生树立数据伦理意识与法治观念,强化《数据安全法》《个人信息保护法》等法律法规的合规意识。结合分布式存储与计算“计算向数据靠拢”的设计理念,引导学生理解集约高效、绿色低碳的技术发展导向,培养资源节约的工程思维。结合大数据在国家安全、社会治理、民生服务等领域的广泛应用,引导学生认识技术服务国家战略、造福人民群众的价值导向,坚定科技报国的职业信念。作业与思考:课后习题教案课程内容2.2数据挖掘原理与算法简介授课时间年月日授课学时1课时教学目标(知识、能力两个方面内容)1.知识目标:了解数据挖掘产生的背景和掌握数据挖掘的基本原理;掌握数据挖掘中常用的算法。2.能力目标:面对实际问题,能够将其抽象为数据挖掘问题,设计合适的解决方案,并运用所学的原理和算法进行解决。教学内容摘要(注明重点、难点)教学方法、手段与课程思政设计1前课复习测验、讲授22.2.1数据挖掘技术的产生与发展(一)数据挖掘的背景(1)海量数据的分析需求世界知名数据库专家阿尔夫·金博尔曾言,我们耗费多年将数据存入数据库,如今是时候将它们有效利用起来了。当下,无论是线下大超市还是线上商城,每日都会产生TB级以上的数据量。过去,人们难以获取所需数据是因为数据库数据匮乏;而今,即便数据库数据海量,却仍无法快捷获取利于决策的有价值数据,根源在于数据量过大且缺乏有效获取方法。大量信息在带来便利的同时,也引发了信息过量难以消化、真假难辨、安全难保、形式不一难以统一处理等诸多问题。在此背景下,人们开始思考如何不被信息海洋淹没,并从海量信息中挖掘有价值知识、提升信息利用率,海量数据的分析需求因而催生了数据挖掘。(2)“数据爆炸但知识贫乏”的现象数据库技术的飞速发展和数据库管理系统的广泛应用,导致数据的积累速度变快,数量不断增加。在爆炸性增长的数据中隐藏着许多重要的、有价值的信息,人们希望能够深入分析这些数据,以达到提高数据利用率的目的。数据库管理系统已经实现了高效输入、查询、统计等功能,但是数据中存在的关联关系和规则仍然无法被发现,无法通过分析现有数据来预测未来的发展趋势,缺少挖掘数据背后有用信息的手段,导致“数据爆炸但知识贫乏”现象的出现。因此,人们迫切需要功能强大的工具去挖掘海量数据背后的有用信息,让数据成为真正意义上的知识源泉,于是数据挖掘应运而生。(二)数据挖掘的意义数据挖掘是一门新兴技术,它的历史比较短,但自从1995年提出这个概念以来其发展十分迅猛。由于它是多学科交叉综合的产物,所以还没有一个公认的、完整的定义。现在人们都比较认可的定义是:数据挖掘是指从大量的、不完全的、有噪声的、模糊的、随机的数据中,提取隐含在其中的、人们事先不知道但又是潜在有用信息的过程。这些信息的表现形式为规则、概念、规律及模式等。这一定义包括以下多层含义。(1)数据源必须是真实的、海量的、有噪声的。(2)发现的是用户感兴趣、新颖的信息。(3)发现的信息应该可接受、可理解、可运用、有价值。(4)信息的形式可以是概念、规则、模式、规律等。此外还存在一些与数据挖掘具有类似含义的术语,如数据库知识发现(KnowledgeDiscoveryinDatabase,KDD)、数据/模式分析、数据考古和数据捕捞等。许多人把数据挖掘等同于数据库中的KDD,实际上数据挖掘是数据库中KDD不可缺少的一部分,而KDD是将未加工的数据转换为有用信息的过程。该过程包括一系列转换步骤,从数据的预处理到数据挖掘结果的后处理。教学方法:互动式教学教学手段:提问、视频引入32.2.2数据挖掘的原理数据挖掘是指从大量的数据中通过算法搜索隐藏于数据中的信息的过程。数据挖掘可视为机器学习与数据库的交叉,它主要利用机器学习界提供的算法来分析海量数据,利用数据库界提供的存储技术来管理海量数据。从知识的来源角度而言,数据挖掘领域的很多知识也间接来自于统计学界,之所以说“间接”,是因为统计学界一般偏重于理论研究而不注重实用性,统计学界中的很多技术需要在机器学习界进行验证和实践并变成有效的机器学习算法以后,才可能进入数据挖掘领域,对数据挖掘产生影响。讲授42.2.3数据挖掘算法简介典型的数据挖掘算法包括分类、聚类、回归分析和关联规则等。(1)分类。分类是指找出数据库中的一组数据对象的共同特点,并按照分类模式将其划分为不同的类,其目的是通过分类模型,将数据库中的数据项映射到某个给定的类别中。(2)聚类。聚类类似于分类,但与分类的目的不同,是针对数据的相似性和差异性将一组数据分为几个类别。属于同一类别的数据之间的相似性很大,但不同类别之间数据的相似性很

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论