版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
机器学习
MachineLearning
第13讲:强化学习-1ReinforcementLearning-1(TabularSolution)强化学习的基本问题强化学习(增强学习)(reinforcementlearning,RL)研究智能体基于对环境的认知做出行动来最大化长期收益,是解决智能控制问题的重要方法。强化学习的主体为智能体(agent)。智能体面对一个环境(environment),与环境的交互,感知环境的状态并获得当前环境的奖励(reward),决策当前要采取的动作(action),以最大化决策策略所能获得的长期收益。1.强化学习的基本结构模型交互中产生:“状态、动作、奖励”的序列
一个简化的猫抓老鼠游戏强化学习的简单示例强化学习解决的实际示例AlphaGo对弈麻将(MSRA)机器人控制2.马尔可夫决策过程RL的大部分问题可建模为马尔可夫决策过程(Markovdecisionprocess,MDP)定义:一个MDP由一个五元组
构成
表示状态集合;
表示动作集合
表示状态转移概率
是奖励函数
表示折扣因子。MDP定义的进一步解释状态转移满足:马尔可夫性
状态转移概率的定义决策过程产生一个样本序列
奖励函数的定义例:猫和老鼠的例子
状态集合动作集合
状态转移概率例子
奖励例子
描述规则!状态和返回值
出发所获得的累积奖励:返回值(return)
3.强化学习的基本元素策略函数确定性策略
随机策略
状态值函数(在给定策略下)
动作-值函数
4.贝尔曼(Bellman)方程决策过程中各状态之间有转移,表示MDP的状态之间值函数关系的一组方程称为贝尔曼(Bellman)方程
第一组形式方程贝尔曼方程证明
第2组形式
第2组方程的导出和关系第2组方程的导出和关系(续)第2组方程的导出和关系(续)第2组方程的导出和关系(续)5.MDP的最优性最优值函数:OptimalValueFunction最优策略:OptimalPolicy求最优策略:FindanOptimalPolicy
贪婪策略6.Bellman最优方程
由
得例:猫和老鼠的例子右侧是上下左右等概率策略的值函数以下,左侧为一个更好的策略右侧为该策略对于的值函数,实际上这是最优策略7.动态规划PlanningbyDynamicProgramming完全知道MDP模型!7.1策略迭代方法第一步:对于一个策略(起始时给出一个初始策略),利用贝尔曼期望方程迭代求策略对应的状态值函数,这一步称为策略评估(policyevaluation);第二步:利用所求的状态值函数,对策略进行改进,得到更好的策略,然后回到第二步,这一步称为策略改进(policyimprovement)。以上过程反复迭代,当改进后的策略不再变化,已得到最优策略7.1.1迭代策略评估IterativePolicyEvaluation迭代表示为
直到满足
7.1.2策略优化(ImproveaPolicy)
改进策略的贪婪算法策略迭代过程示意(
PolicyIteration)例:猫和老鼠初始策略为四方向等概率。(a)初始值函数,(b)值函数第一步迭代,(c)值函数收敛,(d)策略改进7.2广义策略迭代generalizedpolicyiteration,GPI策略评估不必到收敛,只做部分策略评估,则进入策略改进,形成一个链式算法
例:猫和老鼠初始策略为四方向等概率。(a)初始值函数,(b)值函数第一步迭代,(c)一步值函数迭代后更新的策略7.3值函数迭代(ValueIteration)利用贝尔曼最优方程,直接迭代最优值函数最后由最优值函数,得到最优策略
8.MC强化学习Monte-CarloReinforcementLearning通过实际交互学习需要有一个完整EPISODE!智能体通过与环境的交互进行学习,最终得到一种逼近最优的策略由于需要智能体在环境中进行实际交互,将智能体从开启到结束的过程称为一次试验,一种类型是一次试验的步数有限,将这种类型的试验称为一分幕(episode)蒙特卡洛方法只用于分幕环境用MC做策略评估的基本思路MC策略评估算法-1:首次访问计数每次完成一个episode,计算Gt,然后按如下更新VMC策略评估算法-2:每次访问计数每次完成一个episode,计算Gt,然后按如下更新V均值的增量计算,启发MC的增量算法MC的增量算法
动作-值函数更新表示为学习率形式
简记为:MC的策略改进利用一幕的序列计算部分策略评估,进行策略改进9.时间差分学习(TD类算法)Temporal-DifferenceLearning通过实际交互学习!实时!给出一种实时性更高、更灵活的算法。在最基本的情况下,交互过程每进行一步,就可以更新状态值函数MC方法要求一幕结束后,才可以更新值函数算法称为时序差分算法(temporaldifference,TD),基本的TD算法或称为TD(0)算法参考增量MC算法导出TD算法TD算法:值函数的一步更新
重写MC计算值函数的迭代公式
其中可近似为
定义TD误差(TDerror)
更新公式为
更经常使用的是动作-值函数,其更新为
每次值函数更新后,立刻用更新后的值函数,进行策略更新,用
Sarsa算法10.三种方法的Backup关系图比较11.Q-学习Off-PolicyQ-学习Q-学习算法Off-PolicyQ-学习算法描述12.学习算法比较(DP和TD)(续)机器学习
MachineLearning
强化学习-2ReinforcementLearning-2(函数逼近、策略梯度、连续动作)1.值函数逼近ValueFunctionApproximation大规模强化学习问题Large-ScaleReinforcementLearning状态取值空间
动作的取值空间
状态空间和/或动作空间巨大甚至取值连续的情况下,经典的表格方法不再适用,这时可用函数逼近的方法表示值函数。1.1值函数逼近解大规模MDP问题值函数逼近:用一种参数化的函数分别表示值函数和动作-值函数值函数逼近的几种类型注:其中第3种情况是状态空间巨大,但只有很少动作的情况下,可针对每一动作给出“动作值函数”可用监督学习中的参数回归模型表示一种值函数1.2值函数逼近的随机梯度方法特征向量FeatureVector为了有效表示值函数,用特征向量表示状态线性值函数逼近LinearValueFunctionApproximation例:表方法可认为是线性值函数逼近的特例1.3增量类值函数预测算法MC-增量类值函数预测算法TD(0)-增量类值函数预测算法1.4增量类控制算法实际中用“动作-值函数Q”取代值函数V动作-值函数逼近线性动作-值函数逼近线性动作-值函数的增量逼近算法结合贪婪改进策略算法,构造控制算法。函数逼近情况下的策略改进选择当前逼近函数下的最优动作贪婪策略
1.5基本函数逼近方法的收敛性值函数预测的收敛性控制过程的收敛性1.6神经网络Q函数逼近和学习DeepQ-Networks:DQN为保证收敛,引入经验回放(experiencereplay)和目标Q网络示例:针对Atari游戏的DQNDQN的实验结果(Atari)2.策略梯度算法通过学习直接得到一个参数化的策略函数假设动作是离散的,策略是随机的一个策略表示性能评价函数为策略梯度算法表示为迭代过程策略梯度算法PolicyGradient策略学习的三种基本方法常用离散策略函数用Softmax表示一个例子是线性函数逼近这里策略函数举例2.1策略梯度方法的目标函数策略梯度方法的梯度算法2.2策略梯度定理预备知识:记分函数(ScoreFunction)特例说明:梯度定理一步MDPs作为说明策略梯度定理梯度定理基于梯度定理的基本算法:Reinforce以Gt取代梯度定理的Q函数2.3Actor-Critic方法Weuseacritictoestimatetheaction-valuefunctionActor-criticalgorithmsUpdatesaction-valuefunctionparametersUpdatespolicyparametersθ,indirectionsuggestedbycritic
Actor-Critic算法加入一个Critic降低方差
动作-值函数Actor-Critic算法描述3.DRL中连续动作空间的策略梯度算法进展确定策略梯度算法(DPG,2014)确定策略(针对随机策略)、Actor-Critic、线性Q函数逼近,连续动作空间,确定策略函数深度Q网络(DeepQ-Network,2015)用深度CNN网络逼近Q函数和策略函数,解决不收敛问题(replay
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2027届新疆乌鲁木齐水磨沟区四校联考数学九上期末达标检测模拟试题含解析
- 北京市西城区月坛中学2027届数学七年级第一学期期末经典模拟试题含解析
- 2026学年湖北省广水市六年级语文期末评估绝密预测题(附答案)详细答案和解析
- 福建省福州市平潭县2027届数学九年级第一学期期末监测试题含解析
- 2026年重庆医科大学附属永川医院诚聘笔试试题及答案解析
- 2026年山东威海智慧谷职业中等专业学校有限公司招聘教师6人笔试试题及答案解析
- 2026年全国自考财务管理学练习题及答案解析
- 2027届四川省巴中学市巴州区数学九上期末经典模拟试题含解析
- 2027届山东省枣庄市中学区永安乡黄庄中学九上数学期末调研模拟试题含解析
- 2025年9月住院医师规范化培训《口腔科》题库及参考答案解析
- 中石化秋招笔试考试题库
- 建材行业领域主要职业危害及防治
- 山中问答课件
- 2026届新高考英语冲刺热点复习With的复合结构
- 数字营销基础(第二版)课件 2.2数字营销技术
- 2025年注册环保工程师专业基础考试真题卷(附解析)
- 《医事法学》电子教案
- DB35T 2162-2023 基于分布式光纤传感的跨江燃气管道运行监测技术规范
- 师德师风专题讲座主题课件
- 2024年高中英语衡水体书法练字字帖
- 工业设计技术-Geomagic Design X 逆向设计实用教程 课件 项目5、6 遥控器建模、连杆建模
评论
0/150
提交评论