深度学习理论及实践-从机器学习到深度强化学习 课件 第1章 人工智能与深度学习概述_第1页
深度学习理论及实践-从机器学习到深度强化学习 课件 第1章 人工智能与深度学习概述_第2页
深度学习理论及实践-从机器学习到深度强化学习 课件 第1章 人工智能与深度学习概述_第3页
深度学习理论及实践-从机器学习到深度强化学习 课件 第1章 人工智能与深度学习概述_第4页
深度学习理论及实践-从机器学习到深度强化学习 课件 第1章 人工智能与深度学习概述_第5页
已阅读5页,还剩49页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第1章人工智能与深度学习概述魏翼飞北京邮电大学教授博导目录1.1人工智能与机器学习1.1.1人工智能发展历程1.1.2机器学习及深度学习的发展历程1.1.3人工智能与机器学习及深度学习的关系1.2机器学习的分类1.2.1监督学习1.2.2非监督学习1.2.3半监督学习1.2.4强化学习1.2.5其他分类方式目录1.3深度学习的分类及发展趋势1.3.1深度神经网络1.3.2卷积神经网络1.3.3其他深度神经网络1.3.4深度学习发展趋势1.4深度学习与强化学习的结合1.4.1强化学习1.4.2强化学习算法分类1.4.3深度强化学习1.5小结人工智能是什么?人工智能(ArtificialIntelligence,AI),是通过研究人的某些思维过程和动作行为(如学习、推理、思考、规划等),并使用计算机进行模拟、延伸和扩展人的智能的学科。经历60多年的发展,人工智能方兴未艾,全面渗透人类生产生活各个领域,协助人们完成很多任务,辅助人们做出决策,甚至开始出现代替人类的可能。目录1.1人工智能与机器学习1.1.1人工智能发展历程1.1.2机器学习及深度学习的发展历程1.1.3人工智能与机器学习及深度学习的关系1.2机器学习的分类1.2.1监督学习1.2.2非监督学习1.2.3半监督学习1.2.4强化学习1.2.5其他分类方式1.1.1人工智能的发展历程1.1人工智能与机器学习上世纪五十年代,深度学习的原型感知机,强化学习中的贝尔曼方程等被提出,人工智能的简单应用出现八十年代,人工智能计算机的兴起,著名的多层神经网络和反向传播算法的出现使得人工智能领域出现了第二次浪潮2016年的一场围棋人机世纪对战,将人工智能浪潮再一次推到了新的高度1974年以后,受限于人工智能所基于的数学模型的缺陷和计算复杂度的指数增加,人工智能出现了第一次寒冬随着现代计算机的出现,人工智能逐渐淡出了人们的视线,寒冬再次降临2022年ChatGPT引领大模型呈现井喷式爆发态势,理解推理能力快速迭代,模态持续拓展。

1.1人工智能与机器学习人工智能发展历程第一次浪潮:大致在1950年至1970年,“人工神经网络”、“感知器”、“人工智能”、“图灵测试”第二次浪潮:大致在1980年至2000年,以“支持向量机”为代表的各种“机器学习”算法的兴起第三次浪潮:始于2006年,机器学习界的著名学者GeofferyHinton和他的学生在《Science》上发表了一篇关于深层神经网络训练算法的文章1.1.2机器学习及深度学习的发展历程机器学习(MachineLearning,ML)是人工智能的一个重要分支,在人工智能领域内最能够体现其智能特性,对人工智能的发展起到了推动作用。机器学习主要研究让机器或计算机学习人类的思维方式,可以模拟或者实现人类的行为,从而可以获取新的知识以及技能。机器学习已广泛应用于智能推理系统、模式识别、数据挖掘、计算机视觉、自然语言处理、证券市场分析等不同领域。1.1人工智能与机器学习1.1.2机器学习及深度学习的发展历程1.1人工智能与机器学习人依靠经验学习机器依靠数据学习1.1.2机器学习及深度学习的发展历程1.1人工智能与机器学习19491981199519601986“赫布理论”将机器学习推入大众视野,PaulWerbos提出多层感知机的设想与反向传播算法支持向量机出现,统计机器学习进入大众视野感知机与差量学习的结合,创建线性分类器提出决策树算法,衍生很多改进的算法与模型机器学习的发展历程1.1.2机器学习及深度学习的发展历程1.1人工智能与机器学习深度学习的发展历程1.1.2机器学习及深度学习的发展历程1.1人工智能与机器学习人工神经网络阶段(20世纪40年代~20世纪60年代)1943年,提出了第一个脑神经元的抽象模型,被称为M-P模型1949年,心理学家DonaldHebb提出了Hebb学习规则1958年,提出了一个二元输入的感知机模型1969年,证明单层结构的感知机模型仅能解决线性可分问题,基于神经网络的相关研究陷入停滞状态01联结主义阶段(20世纪80年代~20世纪90年代)分布式知识表达和神经网络反向传播算法的提出促进了第二波神经网络研究的兴起多隐藏层深层神经网络的参数训练存在重大缺陷,被各种浅层机器学习模型所超越浅层机器学习模型逐渐成为了当时流行的方法,人工神经网络的发展再次进入了瓶颈期02深度学习阶段(21世纪以来)2006年,提出无监督贪婪逐层地预先训练和有监督微调,解决梯度消失的问题Hinton教授在论文中首次提出了“深度学习”的概念2012年,在著名的ImageNet图像大赛中,深度学习模型AlexNet夺得冠军,在深度学习时代,卷积神经网络(CNN)和循环神经网络(RNN)等模型得到了广泛应用。在大模型时代,基于Transformer的ChatGPT具有革命性的意义,展示了人工智能技术的无限潜力。而基于DiffusionModel的Sora大模型在此惊艳了世人,进入多模态的人工智能时代031.1.3人工智能与机器学习及深度学习的关系1.1人工智能与机器学习人工智能范围最大,涵盖机器学习、深度学习和强化学习学习能力是人工智能的关键人工智能是目的和结果,机器学习和深度学习都是方法和工具以“推理”为重点以“推理”为重点以“学习”为重点1.1.3人工智能与机器学习及深度学习的关系1.1人工智能与机器学习人工智能研究、开发用于模拟、延伸和扩展人的智能的理论、方法、技术及应用系统的一门新技术科学。人工智能的一种途径或子集,机器学习算法是一类从数据中自动分析获得规律,并利用规律对未知数据进行预测的算法。需要人为设计有效的特征集合。机器学习深度学习一种实现机器学习的技术,是机器学习中一种基于对数据进行表征学习的方法,用无监督或半监督学习特征和分层特征提取高效算法来替代手工获取特征。目录1.1人工智能与机器学习1.1.1人工智能发展历程1.1.2机器学习及深度学习的发展历程1.1.3人工智能与机器学习及深度学习的关系1.2机器学习的分类1.2.1监督学习1.2.2非监督学习1.2.3半监督学习1.2.4强化学习1.2.5其他分类方式

1.2机器学习的分类基于学习的形式,机器学习可以分为以下几类:1.2.1监督学习机器学习在给定的训练数据集中进行学习,从而得出一个模型。当新的数据到来时,依据这个模型预测新数据的结果。监督学习中,提供给算法的训练集中要求既有输入也有输出,输入则称为特征,与输入相对应的输出即称为标签。如垃圾邮件过滤系统,当过滤系统收到一封新邮件,就可以根据通过训练得到的模型将该邮件分类到正常邮件或垃圾邮件。1.2机器学习的分类垃圾邮件过滤系统1.2.1监督学习监督学习的问题中,根据预测输出结果是连续的还是离散的,可以将其分为回归问题、分类问题两种,下面将从这两个问题角度出发,对于监督学习进行介绍。1.回归问题1.2机器学习的分类定义:如果预测输出结果为连续的,则该问题为回归问题举例:通过学习得到的模型对房子售卖价格进行预测再如预测某人在观看视频所需要的时间长度等对于类似的回归问题,可以通过建立线性回归模型对训练集中已有的数据进行数据拟合,进而得到输入与输出结果之间的某种依赖关系,当训练完成之后,在新的数据加入之后,通过模型快速的输出该组输入的预测结果。1.2.1监督学习1.回归问题1.2机器学习的分类单变量线性回归多变量线性回归线性回归模型训练集(TrainingSet)70%测试集(TestingSet)30%数据集

1.2机器学习的分类

1.2.1监督学习2.分类问题如果标签即输出结果为离散的,则该问题属于分类问题,例如:垃圾邮件分类系统、根据肿瘤的某些特征判断肿瘤是良性还是恶性,属于比较简单的二分类问题,这类问题则需要使用逻辑回归模型对其进行解决,逻辑回归模型输出结果可以用0或1来表示,逻辑回归模型主要用到的是sigmoid函数,由于该模型建立求解的过程与线性回归模型相类似。1.2机器学习的分类1.2.2非监督学习非监督学习使用的数据是没有标签的,系统需要尝试通过学习并且对数据进行一些处理。1.2机器学习的分类通过数据的某些方面的相似性将数据分成多类的一种分类方法。通常判断数据相似性的方法是计算样本之间的距离,比较常用的欧式距离、曼哈顿距离、马氏距离等。聚类中经常使用的算法:K均值(K-Means)算法、均值偏移(Meanshift)聚类算法、DBSCAN聚类算法、层次聚类算法、使用高斯混合模型(GMM)的期望最大化(EM)聚类。聚类(Clustering)在保证数据所具有代表性特性或者分布的情况下,将高维数据转化为低维数据的过程称为降维。在机器学习中实现数据的可视化或者中间过程,起到精简数据,提高其他机器学习算法效率的作用。降维中经常使用算法:主成分分析(PrincipalComponentAnalysis,PCA)算法、奇异值分解(SVD)等算法。降维(DimensionReduction)1.2.2非监督学习1.2机器学习的分类首先,确定将数据分为几组,将组数K输入到系统中,系统会随机初始化K种点作为每个组的中心点。每个数据点分别计算与K种中心点之间的距离,并将这个数据点分类为最接近它的那个中心点那一组。第一次分组完成之后,取每组数据的所有向量的均值为新的中心点,再次计算每个数据点与中心点之间的距离,重新进行分组,再次选取每一组新的中心点,不断重复这两个步骤,直到中心点不再发生变化为止。聚类—K均值算法:该算法主要是将高维的线性相关的变量合成为低维的线性无关的变量,通常将转换后的这组线性无关变量称为主成分;同时根据实际需要从中可以取出几个尽可能多地反映原来变量信息的线性无关变量进行分析。该算法经常使用在一些高维数据情况下,主要目的是对高维数据进行探索并实现高维数据可视化,必要时需要对数据预处理以及数据压缩等一些简单处理。降维—主成分分析算法:1.2.3半监督学习1.2机器学习的分类定义:选择少部分无标签数据进行人工标记,与大量未标记数据一起使用半监督学习的学习方式。应用举例:网页推荐需要根据用户标记出喜欢的界面进行推荐常见方式:纯半监督学习(所有数据用于模型训练)、直推学习(未标记数据作为预测数据检测模型)常用的基本假设有:平滑假设、聚类假设、流行假设。依赖于模型假设,当模型假设正确时,无类标签的样例可以帮助改进学习性能。1.2.4强化学习强化学习(ReinforcementLearning)是指机器以“试错”的方式进行学习,通过与环境进行交互获得的奖赏指导行为,而强化学习的目标从环境中获得最大的奖赏。通俗来说,机器并不知道怎么做是正确的,只能通过环境给出的奖励或者惩罚才知道什么样的行为是正确的,通过不断的得到环境反馈学习,达到强化学习的目的。1.2机器学习的分类1.2.4强化学习1.2机器学习的分类与其他类型的机器学习的主要区别:环境并不是告诉强化学习系统应该怎样去学习,而只是反馈给系统学习结果的一种评价。系统做出了不同的两个动作,环境为其中一个动作评价了笑脸,为另一个动作评价了难过的表情,那么系统就知道得到笑脸的动作的是好的,而另一个动作是不好的,经过不断训练,就会得到预期的训练结果。一般来说,通过这样训练后的系统相比使用其他学习方式的系统,思维能力较强,可以更加出色地完成其他任务。1.2.4其他分类方式1.基于学习策略的分类学习策略具体是指机器学习在学习过程中系统所采用的推理策略。一个学习系统主要是由环境和学习两大部分组成的。环境负责向系统中提供信息,例如书本上文字或者教师传授的内容,而学习则是将环境提供的信息转换成自身系统可以理解的内容并记忆,从中获取一些有价值的信息。1.2机器学习的分类可以假设一个场景:学生在整个学习过程中,如果不用自己的推理思维对于老师讲授的内容进行理解记忆将其转化为自己可以掌握的知识,那么他在运用知识的时候便会对老师有很大的依赖性。类似的,在整个系统中,如果学习部分使用的推理较少,那么系统则会较多的依赖环境提供的信息。而基于学习策略的分配标准则是系统学习过程中需要使用多少推理思维和难易程度来进行分类的。1.2.4其他分类方式1.

基于学习策略的分类1.2机器学习的分类(1)机械学习指一种单纯依靠系统记忆学习材料,无需系统对于学习材料进行任何的理解和推论的学习方法,将所需要的学习材料进行简单的记忆存储,在需要时进行检索调用即可(2)示教学习系统从环境中获取信息,并且把所获取的知识转化为自身可以理解和使用的形式,与系统原有的旧知识相互有机结合成一体储存起来(3)演绎学习系统从外界环境中接收到的信息为一般规律、公理或定理等,通过演绎学习,可以得到特殊情况下的一些特定的结论,即“从一般到特殊”的过程。(4)类比学习将两类情形或事物进行相互比较,寻找出他们在某一方面所具有的相似性,并作为相关依据存储在系统中,当系统再次获取关于某一事物的特性之后,相应变换对应到另一事物或情况。(5)基于解释的学习环境向系统中输入一个概念和相关的先例,系统通过先例得出为什么概念适用于这个先例的结论,并且推广该解释,变成满足可操作准则的充分条件,系统就可以在训练过程中使用这个概念描述。(6)归纳学习“从具体到一般”,归纳学习的主要过程是从一些实例中总结事物或情形的一般规律的过程。1.2.4其他分类方式2.基于所获取知识的表现形式分类1.2机器学习的分类1)代数表达式参数系统学习的目的是得到一个理想的函数形式的代数表达式进而表现系统所需要的理想性能。2)决策树在已知各种情况发生概率的基础上,通过画决策树的方法,来求得期望大于零的概率,进而评价项目风险程度并判断其可行性的方法,是一种较为直观的图解法。3)形式文法在机器学习中,可能会学习到不同的语言,在某一种特定的语言中,系统将所学到的一些知识或者表达方式进行总结归纳,进而可以形成的一套与本语言相关的规则则为形式文法。4)产生式规则产生式最早是由美国数学家波斯特(E•POST)提出的。产生式的基本结构主要包括两部分:前提部分与结论部分。前提部分(IF)主要负责描述某种状态,即为条件;而结论部分(THEN)则负责描述在该种状态存在的条件下系统所做出的响应或动作。5)形式逻辑表达式形式逻辑也称为普通逻辑,是人们研究思维形式以及其规律性的科学。而形式逻辑表达式的基本成分是命题、谓词、变量、约束变量范围的语句,及嵌入的逻辑表达式。1.2.4其他分类方式2.基于所获取知识的表现形式分类1.2机器学习的分类6)图和网络在某些机器学习的系统中,简单的文字描述并不能准确的表达系统学习的结果,因此需要采用图和网络的表达方式来进行有效的索引和比较,具体的模式有图匹配和图转换方案。7)框架和模式在每一组机器学习的框架中都包含一组槽,用来表现事物的各个方面,例如事物的概念、个体等。8)计算机程序和其他的过程编码机器学习除了需要对于环境中的信息进行分析之外,有时所获取知识的表现形式还为计算机程序和一些其他的过程编码,这类表现形式主要是为了获得某种可以实现在特定环境下的特定能力,而不需要推断系统内部的某种关系或者结构。9)神经网络神经网络主要应用到联接学习中,将所获取的知识最终归纳为一个神经网络。10)多种表现形式的组合有时一个系统所获取的知识需要综合上面几种知识表现形式。根据知识表现形式的精细程度可以将其大致分为两种:泛化程度较高的粗粒度符号表示类,例如决策树、产生式规则、框架和模式等;第二种则为范化程度较低的精细度亚符号表示类,例如神经网络,代数表达式参数、图和网络等,都属于亚符号表示类。1.2.4其他分类方式3.基于应用领域分类1.2机器学习的分类1)经验性归纳学习采用一些数据较为密集的经验方法,对于环境中给出的例子做出归纳学习。对于这类机器学习中的例子与学习结果一般多采用谓词、关系、属性等符号来表示。2)分析学习该类学习方法采用的推理策略主要为演绎推理;根据已有的问题得出的求解经验进行指导得出新的问题的解决方案,或者得出可以更加有效地利用领域知识的搜索控制规则;分析学习的主要目的是对于学习系统进行性能优化。3)遗传算法遗传算法是模拟达尔文生物进化论的自然选择定律和遗传学机制的生物进化过程的一种计算机模型,该种计算机模型通过模拟自然选择的生活进化过程可以较为快速的搜索最优解。同神经网络一样,遗传算法的研究目前已经发展为人工智能的一个独立分支。4)联接学习联接学习目前较为典型的应用就是人工神经网络,主要应用在类似于神经元的简单的计算单元以及单元之间的联接。5)增强学习增强学习的特点是通过与外界的试探交互性再确定和优化所做出的选择。系统在最初不具有任何知识,也不知道自己需要完成怎样的目的,需要通过外界对其动作做出的对应评价来判断自己的动作是否正确,不断在错误中进行尝试,最后找到规律,用以达到目的的方法。目录1.3深度学习的分类及发展趋势1.3.1深度神经网络1.3.2卷积神经网络1.3.3其他深度神经网络1.3.4深度学习发展趋势1.4深度学习与强化学习的结合1.4.1强化学习1.4.2强化学习算法分类1.4.3深度强化学习1.5小结深度学习是一种拥有多级别表示的特征学习方法,将原始数据通过一些简单非线性模型转换成更高层次更加抽象的表达。通过足够多的这样表示的组合,复杂函数也可以被学习。深度学习的关键在于特征层不是被人工设计的,它们是通过使用通用的学习步骤从数据中学习。有如下应用:1.3深度学习的分类及发展趋势图像识别语音识别预测潜在的药物分子的活性分析粒子加速器数据重建大脑回路预测在非编码DNA突变对基因表达和疾病的影响主题分类情感分析自动问答语言翻译1.3.1深度神经网络最初受生物神经系统启发,人工神经网络(ArtificialNeuralNetwork,ANN)由大量的处理单元(神经元)互相连接,形成一种模仿大脑神经网络的复杂网络结构,能对人脑组织结构和运行机制进行数学抽象、简化和模拟。每个神经元能够都对它的输入和权重进行点积,然后加上偏差,最后经过激活函数输出。将神经元相互连接组织起来,不同层神经元之间采用全连接方式就形成了人工神经网络,当隐含层的数目(网络的深度)非常大时就形成了深层神经网络(DeepNeuralNetwork,DNN)。增加网络的深度能够减小每层需拟合的特征数,用较少的参数表示复杂的函数,能提取高层特征信息,因此深层神经网络获得了更广泛的应用。1.3深度学习的分类及发展趋势1.3.1深度神经网络DNN通过学习一种深层非线性网络结构,实现复杂函数逼近,表征输入数据的分布式表示。1.3深度学习的分类及发展趋势上层输出是下层神经元的输入的表示,输入值从输入层神经元通过加权连接逐层前向传播,经过隐含层,最后到达输出层得到输出;输出层计算损失函数来衡量网络实际输出与期望输出之间的差异;网络根据求得的梯度对参数进行调整,直到损失函数达到最小。1.3.2卷积神经网络卷积神经网络(ConvolutionalNeuralNetwork,CNN)是第一个真正成功训练多层网络结构的学习算法。它利用局部连接,权重共享和下采样等特点极大降低了模型的参数数量,以提高一般BP网络的训练性能。CNN由卷积层,池化层,及激励函数,全连接层组成,用于处理以多维数组数据。卷积神经网络的特点是权值共享,局部连接,池化和多网络层的使用。CNN能够提取对平移、缩放和旋转不变的观测数据的显著特征,在图像处理、语音处理等领域得到了广泛而深入的应用。1.3深度学习的分类及发展趋势1.3.2卷积神经网络输入图像的根据所属颜色通道不同分离成不同的特征图,卷积层的神经元形成特征图,通过卷积核连接到上一层特征图的神经元,得到的加权和经过一个非线性函数(激活函数),值得注意的是同一个层的特征图共享相同的权重,不同层的特征图使用不同的卷积核,卷积核滑动整个特征图后得到下一层的特征图。1.3深度学习的分类及发展趋势1.3.3其他深度神经网络1.3深度学习的分类及发展趋势对于涉及到序列输入的任务,比如语音和语言,循环神经网络(RecurrentNeuralNetwork,RNN)表现出更好的性能,它是为了对序列数据进行建模而产生的。由于梯度爆炸和梯度消失问题,训练它们仍然存在问题。长短期记忆网络(LSTM)引入一个特殊的单元称为记忆细胞(MemoryCell)作用是类似于累加器和门控单元,它在下一时刻有一个权值并与自身连接,拷贝了自身真实状态并累加到外部信号,它的自身连接由另一个学习决定如何清除记忆内容的单元乘法门控制。LSTM被证实比传统的RNN更有效,在机器翻译中表现良好。LSTM在预测文本中下一个字符和序列中下一个单词方面表现良好,但是它们可以胜任更多复杂任务,如情感分析:分析一句话所蕴含的情感含义并进行评价;机器翻译:将法语句子的意思翻译成英语句子;生成图片标题:将图片内容翻译成英语序列等1.3.3其他深度神经网络1.3深度学习的分类及发展趋势生成式AI。生成式模型目的是从训练数据的相同分布中产生新的样本,使生成样本分布尽可能相似于训练数据的分布。生成式模型用于估计数据的内在分布(密度函数),通过最大化训练数据似然估计模型参数从而直接对数据建模。由于生成式任务没有标准答案,不能做监督学习,

人们设计了生成图像的神经网络架构,例如生成对抗网络(GAN)和变分自编码器(VAE)生成式对抗网络采用博弈论的方法,生成器网络用于生成样本,判决器网络用于判决样本属于生成样本或真实训练样本,基于两个玩家的博弈,模型学会从训练分布中生成数据。生成式网络有着广泛的应用前景,如提高图像分辨率;按文本生成图像;图像到图像的翻译(将一种类型的图像转换为另一种类型的图)如将草图具象化、根据卫星图生成地图;人脸图像生成;视频自动生成如基于过去的帧生成未来的帧捕捉运动信息等。同时,生成式对抗网络还可以应用在强化学习,迁移学习等领域,不同的领域结合会极大促进人工智能的发展。1.3.4深度学习发展趋势深度学习在未来仍然具有极大的发展空间。虽然目前纯粹的监督学习的成功盖过了无监督学习,但是无监督学习对于重燃深度学习的浪潮有着促进作用。无监督学习在人类和动物学习中有着重要的作用,人类是通过观察而不是被告知每个物体的名称发现世界的结构,因此无监督学习将会在未来大放异彩。1.3深度学习的分类及发展趋势未来机器视觉方面,由于端到端的训练和将CNN与RNN结合并且使用强化学习决定走向,将会有更多的发展。结合深度学习和强化学习的深度强化学习在分类任务中的表现超过了被动视觉系统,并在操作不同的视频游戏中产生令人印象深刻的结果。自然语言理解是深度学习在未来几年有巨大影响的另一个领域。当神经网络学习选择性加入某一时刻部分策略后,利用RNN可以更好地理解句子或整个文本。建立深度学习模型的一个巨大的挑战是建立数据集,生成式对抗网络可以通过从少量数据中生成大量数据,从而为深度学习模型提供更多的数据。模型压缩技术可以让大规模的深度学习模型部署在移动设备上进行推理可以优化用户体验,充分利用移动设备的计算能力。目录1.3深度学习的分类及发展趋势1.3.1深度神经网络1.3.2卷积神经网络1.3.3其他深度神经网络1.3.4深度学习发展趋势1.4深度学习与强化学习的结合1.4.1强化学习1.4.2强化学习算法分类1.4.3深度强化学习1.5小结很多最新的技术方案开始将深度学习的感知能力和强化学习的决策能力相结合,从围棋程序AlphaGoZero的横空出世,到自动驾驶FSD,再到人形机器人Optimus,以及大模型ChatGPT等,这些模型的训练和调优,无不用到基于人类反馈的强化学习,使得深度强化学习受到了人们的重视。深度强化学习一方面可以利用强化学习的试错算法和累计奖励函数来加速神经网络设计,另一方面可以利用深度学习的高维数据处理和快速特征提取能力来解决强化学习中的值函数逼近问题,能够进行“从零开始”、“无师自通”的学习模式,是一种更接近人类思维方式的人工智能方法。1.4深度学习与强化学习的结合1.4.1强化学习使用强化学习能够让机器学着如何在环境中拿到高分,表现出优秀的成绩,而这些成绩背后却是他所付出的辛苦劳动,不断的试错,不断地尝试,累积经验,学习经验。强化学习是一类从无到有的算法,是让计算机实现从一开始什么都不懂,脑袋里没有一点想法,通过不断地尝试,不断从错误中学习,最后找到规律,学会了达到目的的方法。1.4深度学习与强化学习的结合1.4.1强化学习1.4深度学习与强化学习的结合

传统编程方法以机器人取苹果场景为例简单说明强化学习的优势传统编程方法:设置机器人向右走8步、再向上走5步,但是如果场景稍有变化,就需要重新设计移动步骤并配置一次机器人,该方法只适合解决固定场景的问题强化学习方法:机器人可以尝试不同的移动策略,例如向右走1步,执行动作之后观察一下环境的反馈。这种尝试-误差(Trial-And-Error)的方法就是强化学习的基本特性,其数学本质也是梯度下降,这种方法的适用性比较广,即使场景发生变化(例如换了一个房间),也不需要重新写程序、不需要重新配置机器人,只需要让机器人在新的场景训练几次、就能自己学习到新场景下的最优策略强化学习方法1.4.1强化学习1.4深度学习与强化学习的结合解决智能感知问题让智能体根据输入中大量带有标签的数据,对这些数据进行学习,从而得到抽象的特征来进行分类监督学习解决序贯决策的问题通过采取一系列动作,之后改进一系列动作最终达到最优。要使整个序列达到最优就需要智能体与环境不断交互强化学习1.4.1强化学习如图所示,这是一个智能体和环境不断交互不断试错的过程。强化学习是观察、奖励、行动措施的时间序列。时间序列代表着智能体的经验,这个经验就是用于强化学习的数据。强化学习的问题就是聚焦这个数据来源(即数据流)也就是图中的观测信息、动作和回报。1.4深度学习与强化学习的结合1.4.2强化学习算法分类1.4深度学习与强化学习的结合(1)根据是否具备环境信息分类如果智能体(Agent)具备所处环境信息的所有取值,这种情况被称为基于模型(Model-based)方法,即智能体能理解其所处的环境、并用一个模型(Model)来表示环境。如果智能体(Agent)不知道所处环境的所有信息,不断地与所处环境进行交互,通过执行动作与获得反馈的迭代优化,找到最优策略,这种方案被称为无模型(Model-free)方法,例如Q-learning,SARSA,PolicyGradients等。(2)根据策略的更新方法分类基于价值的(Value-Based)强化学习算法,智能体先学习值函数,再根据值函数的大小选择动作。Value-Based方法包括策略评估和策略改善两个步骤,当值函数最优时,策略也就是最优的,即在状态S下,选择对应最大Q值的动作,是一个状态空间向动作空间的映射,这种映射就对应的是最优策略。例如经典的Q-learning,SARSA,DQN等。基于策略(Policy-Based)的强化学习算法借鉴将值函数参数化的思路,可以用线性或非线性函数直接给出参数化策略,根据具体问题定义累计回报最大的目标函数,然后沿着梯度上升的方向对所有参数进行迭代优化,找到使目标函数最大的参数集就得到了最优策略。例如:蒙特卡洛策略梯度(Monte-CarloPolicyGradient)。1.4.2强化学习算法分类1.4深度学习与强化学习的结合(3)根据迭代更新的方式分类回合更新方法:值函数(动作值函数或者状态值函数)要等待整个序列事件全部结束后再更新,即等到一个回合结束再总结这一回合中的所有动作的值函数,更新策略函数。例如MonteCarlo强化学习算法。单步更新方法:在序列事件进行中的每一步都要更新值函数(动作值函数或者状态值函数),不用等待一个回合的结束,这样就能一边给出动作一边更新策略函数。因为单步更新制效率更高,所以现在大多方法都是基于单步更新的方式,例如Q-learning、SARSA、TD-learning等。(4)最后一种分类方式是在线策略和离线策略。在线策略(on

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论