版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1第7章强化学习《人工智能》第7章强化学习目录CONTENTS问题描述7.1基于值函数的方法7.2基于策略函数的方法7.3演员-评论员算法7.4习题7习题7.1.1典型例子3强化学习的应用领域包括:控制系统、推荐算法、电子游戏、棋类游戏和迷宫游戏等。这里介绍两个典型的强化学习例子。多臂赌博机问题
给定赌博机的个拉杆,每个拉杆按照一个事先设定的但是用户不知道的概率分布掉出一块钱或不掉钱。要求在给定的有限次机会中,期望累积收益最大。多臂赌博机问题涉及强化学习中经典的“探索-利用”困境,相关技术可应用在投资组合和广告推荐等领域中。7.1.1典型例子4悬崖行走问题如图7.2所示,在网格世界中每个格子表示一个状态:式中,格子(2,1)到(6,1)是悬崖(Cliff)。有一个醉汉,从左下角的开始位置走到右下角的结束位置。如果走到“悬崖”,则醉汉会跌落身亡。在每个状态中,醉汉可以选择的动作空间为上下左右,即。每走一步,都有一定的概率滑到周围的其他格子。醉汉的目标是安全到达位置E。图7.2
悬崖行走问题7.1.2问题的定义5
7.1.2|原书第210页4S:环境的状态空间,可为离散或连续空间。T:当前状态和动作决定下一状态的概率分布。A:智能体的动作空间,可为离散或连续空间。R:环境根据状态和动作反馈给智能体的奖励。四元组首字母构成“STAR”。7.1.2问题的定义7.1.2问题的定义7确定性策略与随机性策略
7.1.2问题的定义8
智能体—环境交互循环图7.3智能体与环境的交互示意图7.1.2问题的定义9智能体与环境的交互过程可以用马尔可夫决策过程(MarkovDecisionProcess,MDP)来刻画。“马尔可夫”是指下一个时刻的状态只取决于当前状态,即
其概率为为状态转移概率,7.1.2目标函数10
7.1.2目标函数
7.1.2目标函数行为策略:与环境交互并采集经验数据。演员与评论员:演员是待学习策略;评论员以值函数或损失函数评价行为。同策略/异策略:采样策略与学习策略相同/不同。基于模型/模型无关:环境模型已知/仅从经验中学习。图7.4强化学习的框架:λ++目录CONTENTS问题描述7.1基于值函数的方法7.2基于策略函数的方法7.3演员-评论员算法7.4习题7习题1314
7.2基于值函数的方法7.2.1动态规划15
7.2.1动态规划16(1)策略迭代算法。(2)价值迭代算法。7.2.1动态规划17
7.2.1动态规划18(3)价值迭代算法VS策略迭代算法。比较项策略迭代价值迭代更新方式交替进行策略评估与策略改进直接利用贝尔曼方程更新值函数收敛结果策略稳定时得到最优策略收敛值函数即最优值函数时间复杂度迭代特点迭代次数通常更多两种算法在实际应用中都不必等待完全收敛。7.2.1|原书第216页19环境模型要求已知:实际应用中很难获得状态转移概率和奖励函数。模型未知时:可让智能体与环境交互,估计转移概率和奖励函数。采样重构限制:只适合状态数较小的场景。状态数较多时:算法低效,可通过神经网络近似值函数。7.2.1动态规划7.2.2蒙特卡罗方法
7.2.2蒙特卡罗方法
(1)探索(eXploration)与利用(eXploitation)。
7.2.2蒙特卡罗方法(2)同策略(on-policy)VS异策略(off-policy)。同策略:采样策略和改进策略相同。异策略:采样策略与优化的目标策略不同。异策略可通过重要性采样和重要性权重优化目标策略类型采样策略优化策略on-policy与目标策略相同同一策略off-policy7.2.3时序差分方法
蒙特卡罗方法效率低下是因为需要拿到一条完整的轨迹,才能对策略进行评估和更新。时序差分学习(TemporalDifferenceLearning)是蒙特卡罗方法的改进,它模拟一段轨迹,每行动一步就利用贝尔曼期望方程组来评估行动前状态的价值。时序差分方法本质上利用了动态规划的思想来提高学习效率。平均值的更新方式
7.2.3时序差分方法SARSA是同策略算法,因为采样和优化都使用当前策略π。它与蒙特卡罗方法的主要区别是:蒙特卡罗不依赖马尔可夫性质,但必须等完整路径;时序差分依赖马尔可夫性质,只用一步样本就能更新,因此学习效率更高。时序差分方法和动物的学习机制类似:在大脑神经元中,多巴胺的释放来自对实际奖励和预期奖励的差异,而不是奖励本身。人们常说的“知足常乐”是因为没有预期,因此任何小的奖励和惊喜都可能带来多巴胺的分泌。7.2.4深度Q网络直接估计:Q学习直接估计最优状态—动作价值函数。行为策略:仍可使用ε-greedy选择实际动作。更新目标:不使用实际下一动作,而直接选择最大Q值。异策略:更新后的Q函数对应目标策略,而不是行为策略。
7.2.4深度Q网络比较项蒙特卡罗时序差分更新时机获得完整轨迹后每执行一步马尔可夫性质不依赖依赖回报使用真实完整回报用一步奖励与下一Q值近似学习效率相对较低相对较高7.2.4深度Q网络
Q学习:异策略时序差分目标Q网络参数固定一段时间经验回放随机抽取样本训练采用随机梯度下降法,目标函数为
7.2.4深度Q网络带经验回放的DQN
7.2.4深度Q网络
Q学习完整算法7.2.4深度Q网络比较项SARSAQ学习下一步目标采样与优化使用同一策略使用不同策略类型on-policyoff-policy7.2.4深度Q网络
目录CONTENTS问题描述7.1基于值函数的方法7.2基于策略函数的方法7.3演员-评论员算法7.4习题7习题7.3|原书第221页34
7.3基于值函数VS基于策略函数7.3基于值函数VS基于策略函数7.3|原书第221页34基于值函数基于策略函数先学习值函数,再由值函数导出策略直接显式学习目标策略学习过程中没有显式目标策略在策略空间中直接搜索代表方法:REINFORCE、PPO策略搜索:本质上是优化问题,可分为基于梯度和无梯度优化。7.3.1策略梯度
7.3.2REINFORCE7.3.2|原书第222页36
结合随机梯度上升算法,每次采集一条轨迹后就可以计算每个时刻的梯度并更新参数,该算法由Williams等人于1992年提出,称为“REINFORCE”算法。7.3.2REINFORCE7.3.2|原书第222页36REINFORCE—原始版本原始REINFORCE压缩流程:随机初始化策略参数;按当前策略生成一条完整轨迹;对轨迹中每个时刻计算后续折扣回报;用该回报乘以动作对数概率的梯度来做随机梯度上升;不断采样和更新直到策略收敛7.3.2|原书第222—223页39
7.3.2REINFORCE7.3.2|原书第222—223页397.3.2REINFORCE带基准线的REINFORCE
7.3.2|原书第222—223页397.3.3PPO算法PPO算法是一种策略梯度算法,由OpenAI于2017年提出,主要用于解决强化学习中的策略优化问题。它是TrustRegionPolicyOptimization(TRPO)算法的简化版本,在保持TRPO算法优点的同时,降低了计算复杂性。PPO算法由于比较稳定且效率高,广泛应用在机器人控制、游戏AI、模拟环境决策和资源管理等应用中。本节先介绍TRPO算法,再介绍其改进的版本PPO算法。策略梯度算法的缺点在于:当策略网络是深度神经网络时,沿着策略梯度更新参数时可能会因步长的设置不合理导致策略梯度变化显著,从而影响训练效果。针对这一问题,可以考虑在梯度更新时,寻找一块信任区域(TrustRegion),在这个区域上更新策略时可以得到某种策略性能的安全性保证,这就是信任区域策略梯度优化的主要思想。TRPO算法于2015年被提出,在理论上能够保证策略学习的单调性,并且在实际应用中取得了比策略梯度算法更好的效果。7.3.2|原书第222—223页397.3.3PPO算法TRPO(1/2):近似—构造新的目标函数
7.3.2|原书第222—223页397.3.3PPO算法TRPO(2/2):最大化—用某种数值算法求解带约束的最大化问题超参数1:信任域半径Δ,在运行过程中逐渐减小。超参数2:求解最大化问题的数值算法学习率。第二步的最大化算法实现起来非常不容易。7.3.2|原书第222—223页397.3.3PPO算法TRPO算法中有两个超参数需要调整:一个是置信域的半径,在算法的运行过程中需要逐渐减小;另一个是求解最大化问题的数值算法的学习率。TRPO算法中可以使用的数值算法包括泰勒展开近似、共轭梯度和线性搜索等方法。但是,第二步的最大化算法真正实现起来非常不容易。PPO算法的优化目标函数与TRPO算法的相同,但是PPO算法用了一些相对简单的方法来求解最大化问题。通常有两种形式:PPO-惩罚和PPO-截断。PPO-惩罚用拉格朗日乘子法直接将KL散度的限制放进目标函数中,将带约束条件的优化问题转化为不带约束条件的优化问题,在迭代的过程中,不断更新KL散度前的系数。PPO-截断根据优势函数,即时序差分的残差:
7.3.2|原书第222—223页397.3.3PPO算法比较项TRPOPPO优化目标近似目标+KL约束与TRPO相同求解方式带约束数值优化相对简单的惩罚或截断实现特点第二步实现较困难降低计算复杂性形式信任区域约束PPO-惩罚、PPO-截断目录CONTENTS问题描述7.1基于值函数的方法7.2基于策略函数的方法7.3演员-评论员算法7.4习题7习题7.3.2|原书第222—223页397.3.4基于人类反馈的强化学习大语言模型(LargeLanguageModel,LLM)在进行监督微调(SupervisedFine-Tuning,SFT)后,具备了遵循指令和多轮对话的能力,并且能够初步与用户对话。但是LLM由于巨大的参数数量和训练语料库,其复杂性难以被理解和预测。当模型频繁地与用户互动,可能会产生严重的后果。因此,研究者需要将人工智能与人类价值观进行对齐。通常来讲,大语言模型输出的结果应该满足帮助性(Helpfulness)、真实性(Honesty)及无害性(Harmless)的3H原则。由于上述3H原则体现了人类偏好,因此基于人类反馈的强化学习(ReinforcementLearningfromHumanFeedback,RLHF)很自然地被引入通用对话模型的训练流程中。基于人类反馈的强化学习分为奖励模型训练和近端策略优化两个步骤。奖励模型通过由人类反馈标注的偏好数据来学习人类的偏好,判断模型回复的有用性及保证内容的无害性。奖励模型模拟了人类的偏好信息,能够不断地为模型的训练提供奖励信号。在获得奖励模型后,需要借助强化学习对大语言模型继续进行微调。7.3.2|原书第222—223页397.3.4基于人类反馈的强化学习对齐目标:SFT后仍需使大语言模型与人类价值观对齐。3H原则:帮助性、真实性和无害性。两个步骤:奖励模型训练与近端策略优化。奖励信号:奖励模型从人类偏好数据中学习,并为策略优化提供奖励。RLHF:3H原则与训练步骤7.3.2|原书第222—223页397.3.4基于人类反馈的强化学习RLHF中的四个模型策略模型(PolicyModel):生成模型回复。奖励模型(RewardModel):输出奖励分数来评估回复质量的好坏。评论模型(CriticModel):预测回复的好坏,并选择对未来累积收益最大的行为。参考模型(ReferenceModel):提供SFT模型的备份,限制策略发生过于极端的变化。OpenAI在大多数任务中使用的强化学习算法都是近端策略优化(PPO)算法。PPO算法可以根据奖励模型获得的反馈优化模型,通过不断地迭代,让模型探索和发现更符合人类偏好的回复策略。PPO算法从整体上来看是一个“演员-评论员”,这里的“演员”指的是“策略模型”,“评论员”指的是“评论模型”。7.3.2|原书第222—223页397.3.4基于人类反馈的强化学习近端策略优化的实施流程如下。环境采样:策略模型基于给定输入生成一系列的回复,奖励模型则对这些回复进行打分获得奖励。优势估计:利用评论模型预测生成回复的未来累积奖励,并借助广义优势估计(GeneralizedAdvantageEstimation,GAE)算法来估计优势函数,能够有助于更准确地评估每次行动的好处。优化调整:使用优势函数来优化和调整策略模型,同时利用参考模型确保更新的策略不会有太大的变化,从而维持模型的稳定性。图7.5近端策略优化算法的实施流程7.3.2|原书第222—22
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 采购笔试题全解及答案
- 心电图考试试题及答案
- 四川幼儿师范高等专科学校 2026年助学助管员招用的(第二批)考试备考试题及答案详解
- 2026重庆市铜梁区市场监督管理局招聘食品药品监管公益性岗位人员4人考试备考题库及答案详解
- 四川省什邡市职业中专学校(什邡市综合高级中学)2026年教师招聘笔试备考试题及答案详解
- 2026年内江市招募见习岗位(98人)笔试备考试题及答案详解
- 2026天津市和平区教育系统事业单位第二次招聘4人考试备考题库及答案详解
- 2026广西现代物流集团有限公司中层领导岗位招聘3人笔试参考题库及答案详解
- 2026广东省卫生健康委全国爱牙日主题宣传展示活动委托业务遴选受托方笔试备考题库及答案详解
- 2026年隆林各族自治县网格员招聘考试备考试题及答案解析
- 电梯装修施工方案
- GB/T 47911-2026小微型企业安全生产标准化管理体系要求
- 2025年证券营业部招聘真题及答案
- 2026年8月株洲市公共交通集团有限责任公司无人售票车驾驶员招聘30人笔试模拟试题及答案详解
- TCFLP0030-2021国有企业网上商城采购交易操作规范
- 医疗设备仪器的清洁消毒
- JJG 270-2008血压计和血压表
- 患者出院的护理
- 颈椎病推拿治疗课件
- 管道闭水试验记录自动计算
- 内镜粘膜下剥离术(ESD)
评论
0/150
提交评论