现代深度学习教程 课件 第9章RLHF_第1页
现代深度学习教程 课件 第9章RLHF_第2页
现代深度学习教程 课件 第9章RLHF_第3页
现代深度学习教程 课件 第9章RLHF_第4页
现代深度学习教程 课件 第9章RLHF_第5页
已阅读5页,还剩24页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

《现代深度学习教程》第9章

基础模型核心技术——RLHF主讲:XXX时间:2026/9/21目录CONTENTS01近端策略优化03强化Transformer02RLHF04本章小结AI9.1近端策略优化9.1近端策略优化(PPO)是什么近端策略优化(PPO)是一种由OpenAI于2017年提出的深度强化学习算法,属于Actor-Critic方法的扩展范畴。为什么提出解决TRPO在实践中的限制:高计算成本、优化约束实现复杂、超参数敏感性强、不易并行。核心思想采用剪切代理目标(ClippedSurrogateObjective)函数,限制策略更新幅度,通过限制优势函数的增长实现稳定性控制。优化过程策略评估与策略更新两个阶段交替进行;采用mini-batch更新,并引入调节新旧策略KL散度的超参数。04/299.1本节导览:PPO算法的演进脉络本节内容按照PPO算法演进的逻辑脉络展开:先介绍策略梯度算法的基本原理,再介绍TRPO及其核心思想,最后阐述PPO如何在TRPO的优化目标上实现更稳定、更高效的策略优化。策略梯度直接对策略函数求导,沿梯度方向更新参数9.1.1→TRPO引入KL散度置信域约束,保证策略单调提升9.1.2→PPO剪切代理目标+自适应KL惩罚,实现简单且稳定9.1.305/299.1.1策略梯度策略梯度(PolicyGradient)是一种基于梯度的强化学习算法,用于直接优化策略函数的参数θ。其主要思想是通过最大化期望回报函数J(πθ)

来更新策略函数的参数,使得策略函数能够更好地选择动作,优化长期回报。式(9.1)期望回报式(9.2)轨迹概率式(9.3)两边取对数06/299.1.1策略梯度的推导由于环境对θ没有任何依赖,式(9.1)~式(9.3)中的ρθ(s0)、P(s(t+1)|s(t),a(t))和R(τ)对θ求导后梯度均为0。式(9.4)对θ求导式(9.5)(9.6)对数求导法则式(9.7)策略梯度训练时通过当前策略与环境交互采样轨迹(蒙特卡洛采样),沿该梯度方向做梯度上升,迭代更新策略参数。07/299.1.1直接应用式(9.7)的两个问题问题①

高回报轨迹可能采不到R(τ)是非负值,优化时每一对(s(t),a(t))出现的概率都会增加;但轨迹是采样得到的,回报值高的轨迹没被采到时概率反而会降低。解决:添加基线函数b(s(t)),最常见的是V(π)(s(t))。问题②

已获奖励不应影响决策智能体在状态s(t)下决策的回报只与它未来的奖励有关,决策前已经获得的奖励不应影响决策;定义优势A(t)=Q(s(t),a(t))−V(s(t)),取b=V(s(t))得到经典策略梯度公式。式(9.8)式(9.9)式(9.10)式(9.9)意味着:计算梯度时需要计算每一时刻下的动作相比于所有动作的平均水平是好还是坏,这让策略学习更快、更稳定。08/299.1.2置信域策略优化算法(TRPO)传统策略梯度采用标准梯度上升更新参数,缺乏对更新幅度的有效控制,容易出现策略剧烈变化,甚至新策略性能劣于旧策略,影响训练稳定性与收敛性。TRPO引入以KL散度为约束的优化机制:每次策略更新前计算新旧策略间的期望KL散度,用预定义阈值δ控制其不超过置信域范围;该约束通常通过拉格朗日乘子或二次近似求解。KL约束有效防止策略更新发生过大变化,避免策略退化,保障策略性能的单调提升,增强收敛性与稳健性。式(9.11)TRPO优化问题θ(old)代表更新之前的参数;可用共轭梯度算法近似求解:目标函数线性逼近、约束二次逼近。09/299.1.2TRPO推导:从回报分解到局部逼近式(9.13)新策略的回报可分解为旧策略回报+优势项,只要该项≥0即可保证回报单调不减式(9.14)定义状态访问频率式(9.15)替换掉时间序列求和操作式(9.16)式(9.15)同时含有新策略,难以优化→用L(π)对η做局部逼近(用访问频率ρ而非ρ(π))其中L(π)(π̃)用来表示相对于旧策略,新策略产生的奖励。10/299.1.2TRPO推导:策略更新的下界式(9.17)保守策略迭代(CPI):新策略=当前策略+贪婪策略的混合式(9.19)整体方差散度(TotalVariationDivergence)式(9.20)利用D(π‖q)²≤D(KL)(p‖q),得到η的下界系数式(9.22)通过最大化M(i)即可保证η单调递增;使M(i)最大的新策略就是待更新策略注:ε=maxE[A′(s,a)](式9.18)。此界限仅适用于式(9.17)生成的混合策略,实践中存在局限。11/299.1.2TRPO推导:置信域形式式(9.23)惩罚系数C=4εγ/(1−γ)²太大会使更新步伐很小、收敛很慢式(9.24)实际中把惩罚项转为约束项,即置信域式(9.25)(9.26)最大KL散度需要遍历每个状态,实际中难以实现→用平均KL散度代替12/299.1.2蒙特卡洛逼近与重要性采样式(9.27)(9.28)将L(θ)(old)扩展为求和形式,并用期望表示访问频率,便于蒙特卡洛逼近式(9.29)重要性采样定理:无法在分布p中采样时,可从已知分布q采样间接得到期望式(9.30)将重要性采样应用于目标函数,并用Q(θ)(old)值替换A(θ)(old),得到TRPO的目标函数与约束项13/299.1.3PPO算法TRPO求解时可用共轭梯度算法对目标函数做线性逼近、对约束项做二次逼近;也可以将约束项作为惩罚项,求解一个无约束的优化问题。然而式(9.31)中的参数β难以确定,且针对不同的数据分布有不同的最优值,因此PPO提出了两种目标函数:剪切代理目标函数、自适应KL散度惩罚项。式(9.31)无约束化14/299.1.3目标函数一:剪切代理目标函数为方便起见,令比率r(t)(θ)=π(θ)(a(t)|s(t))/π(θ(old))(a(t)|s(t)),TRPO的目标函数可表示为最大化剪切代理目标函数;当新旧策略相同时r(t)(θ(old))=1,因此增加一个裁剪项防止r远离1。式(9.32)图9.1A为正和为负时,某一时刻下L(CLP)与r的关系(注:r=1的点即优化起始点)15/299.1.3剪切机制为什么有效当A>0(当前函数行为好)当更新的比率r>1+ε时,参数更新的幅度过大,须对其限制;当更新比率r<1时,可以不加限制。当A<0(当前函数行为不好)当更新的比率r<1−ε时,参数更新的幅度过大,须对其限制。通过在初始策略参数和更新的策略参数之间进行插值,经过PPO迭代一次后计算得到目标函数值,可更直观地看到L(CLP)相比于其他目标函数更具优势。图9.2PPO迭代后目标函数值的插值计算min(x,y)表示取二者中的最小值;clip(r(t)(θ),1−ε,1+ε)表示对r(t)(θ)的值进行裁剪,将其限制在[1−ε,1+ε],ε

是一个超参数。16/299.1.3目标函数二:自适应KL散度惩罚项通过让KL散度惩罚项的系数β自适应地变化,在每一次策略更新时让散度与预期的散度d(target)更加接近。每一次策略更新时执行两步操作:①在mini-batch上利用随机梯度下降优化式(9.31)。②计算新旧策略的KL散度d;若d<d(target)/1.5,则β←β/2;若d>d(target)·1.5,则β←β·2。为了进一步加速收敛,PPO利用状态价值函数V(s)来降低优势函数的方差;由于策略和价值函数共享参数,还需利用一个损失项,并添加熵奖励项以扩大搜索范围。散度最终目标式中S表示信息熵,VF表示价值函数(ValueFunction);L(VF)(t)=(V(θ)(s(t))−V(targ))²表示价值函数损失项,用于稳定优势估计。17/299.1.3PPO算法伪代码(Actor-Critic)图9.3PPO算法伪代码外层迭代:actor=1…N,在环境中运行策略π(θ(old))T次,计算预估值A(1)…A(T)。根据θ优化代理损失,随后θ(old)←θ,进入下一轮迭代。18/29AI9.2RLHF9.2RLHF:基于人类反馈的强化学习RLHF通过引入人工对生成文本的评价作为模型性能的衡量指标,进一步将该反馈信号建模为奖励函数或损失函数,用于引导策略优化过程,使模型行为更符合人类预期与价值判断。相较于传统的强化学习,RLHF使智能体能够更好地学习人类思考的习惯,使得在一般文本语料库上训练的语言模型能和复杂的人类价值观对齐。RLHF分为三步①预训练一个语言模型②

训练奖励模型③

利用强化学习进行微调图9.4RLHF的关键流程20/299.2第一步:预训练一个语言模型预训练的提示&文本对(Prompts&TextDataset)样本很庞大,模型参数量也随之增加。预训练结束后,可以使用额外的增强样本对模型进行微调,但这一步并不是必须的,重要的是要预训练一个规模较大的语言模型(LanguageModel)。这一步使用了两种不同的提示(Prompt)来源:一些是标注者或研究人员准备的,另一些是从GPT-3用户那里获取的;标注者按要求写下预期输出,最终得到相对较小且高质量的数据集(1.2万~1.5万条数据),并用其微调GPT-3.5模型。图9.5RLHF的第一步:预训练一个语言模型21/299.2第二步:训练奖励模型奖励模型是RLHF的第二步,是区别于其他强化学习方法的重要一环。奖励模型本身也是一个语言模型:输入是一系列文本,输出是这些文本的奖励值。训练时需要人工介入为语言模型生成的回答打分,从而注入人类的偏好。使用第一阶段精调后的模型对每个问题生成多个回答,标注者综合考虑后给出排列顺序;不直接使用人工打分,而是利用相对排名加权评分(不同价值观导致分数未经校准且杂乱),再用文本与加权评分训练奖励模型。图9.6RLHF的第二步:训练奖励模型22/299.2第三步:利用强化学习进行微调利用奖励模型,通过强化学习来微调预训练的语言模型;强化学习策略的更新利用了9.1节介绍的近端策略优化算法(PPO)。PPO模型初始化自微调后的语言模型,奖励值来自第二步的奖励模型;惩罚项来自第一步的微调模型与当前模型的差异值(由KL散度衡量),避免参数大幅偏离初始模型,有助于输出合理、连贯的文本片段。图9.7RLHF的第三步:利用强化学习进行微调23/299.2三步循环:从对齐到持续提升01预训练语言模型大规模提示&文本对预训练;可选地用增强样本微调。只进行一次。02训练奖励模型人工对多个回答排序,以相对排名加权评分训练,输出代表人类偏好的奖励值。03PPO强化学习微调奖励值更新参数,KL散度惩罚项约束模型不偏离初始模型。第一步只进行一次,而第二步和第三步可以持续重复地进行:在当前最佳策略模型上收集更多的对比数据,用于训练新的奖励模型,然后训练新的策略。24/29AI9.3强化Transformer9.3强化Transformer:应用形式Transformer架构强大的特征表示与建模能力,近年来逐渐受到强化学习领域的广泛关注。一方面,它可作为编码器模块,对环境状态序列、多智能体信息或历史交互轨迹进行建模与抽象表示;另一方面,它也可作为策略或价值函数的决策网络,通过对不同时间步轨迹的全局建模,提升策略学习的稳定性与泛化能力。图9.8强化学习中的Transformer模型示意26/299.3强化Transformer:四类应用图9.9强化学习中的Transformer架构的应用分

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论