版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
教育部-华为智能基座课程章节目录章节目录深度Q网络算法•在之前的学习中,我们对强化学习有了初步的认识,知道了什么是马尔可夫链,理解了强化学习中最重要的Q值与V值,学习了蒙特卡罗算法与时序差分算法,了解了Q-learning是如何通过•接下来,我们将完成进一步的探索,学习强化学习领域的几个经典算法,如DQN深度Q网络算深度Q网络算法Q-learning核心是用Q值给‘状态+动作’打立杆任务中,状态是“小车位置、杆的角度”(只有4个数值我们可以用一个表格把所如果遇到复杂任务,比如训练一个RL模型玩深度Q网络算法是Q-learning的“瓶颈”:无法处理高回顾机器学习相关知识,神经网络擅长处理高维数据,且具备拟合复杂映射关系的能力——能够将高维输入(如像素画面)映射为特定输出(如动作评分这一特性恰好能解决表格型Q学习的高维状态存储与计算瓶颈。因此,我们可以用神经网络替代表格来拟深度Q网络算法提出。它通过结合深度神经网络和Q-Learning算法,解决了高维、连续状态空间的问题,具备例如,针对马里奥游戏而言,输入就是彩色游戏画面,输出则是每个可能动作的Q值,神经网络会对各个深度Q网络算法——DQN使用两个独立的神经网络:目标Q网络与当前Q网络,通过最小化损深度Q网络算法——DQN深度Q网络算法——DQN目标。一开始,猫离老鼠很远,所以我们想让猫示,猫和老鼠会在优化空间里面到处乱动,使得训练过程十分不稳定。所以可以固定Q网络,猫就有足够的时间来接近老鼠,它们之间的距离会随着优化过程越来越小,拟合后就可以得到一深度Q网络算法——DQN基于上述问题,研究者在单一网络基础上加入基于上述问题,研究者在单一网络基础上加入目标网络,目标网络与当前网络结构完全一致,但目标网络的参数不随训练实时更新,仅定期从当前网络同步参数。这使得Q值更新的基准在同步周期内保持固定,有效降低了目标值的波动性,为模型学习提供了稳定的参考框架,提升了DQN训练的稳深度Q网络算法——DQN在进行强化学习的时候,往往最花时间的步骤是与环境交互,训练网络反而是放缓冲区可以减少与环境交互的次数,一些过去的策略所得到的经验可以放在回放缓冲区训练时随机采样数据,打破数据的时序关联,使训练数深度Q网络算法——DQN深度Q网络算法——DQN深度Q网络算法——DQN深度Q网络算法——DQN 将其他衍生算法的核心改进策略整合到一个框深度Q网络算法——DQN深度Q网络算法——DQNQ(Sa深度Q网络算法——DQNaaaa深度Q网络算法——DQN深度Q网络算法——DQN)-V(s)价值函数与V(s)与优势函数A(s,a)作为神经网络的两其他动作的Q值保持不变。而DuelingDQN可以学数均会被更新,从而影响所有动作的Q值,使得网络章节目录其他典型算法DQN及其变体虽优化了Q值计算效率,但仍什么是离散动作?就是动作只有有限几个选但如果是机器人控制,比如机械臂转动角度、四足机器人迈腿的力度,这些“连续动作”就没法用DQN处理了——因为DQN要给每个动作算其他典型算法为了解决连续动作问题,研究者提出了一种基于策略的算法,即Policy-based算法,与Value-其他典型算法直接学习“策略函数π(a|s)”——输入当前状态s,直接输出动作选择的概率分布(比如离散动作下“左移60%、右移40%”,连续动作下输出动作分布参数无需先计算Q值/V值,直接个是均值,另一个是方差,有了这两个参数我们就可以其他典型算法如图所示,通过PG网络输出的均值与方差参数构建了一个正态分布函数,其中横坐标表示动作值,纵坐标表示执行某个动作的概率。智能体在与环境交互的过程中获得“奖励”,PG网络通过更其他典型算法离散和连续的动作问题,这么看,相对于DQN算法而言简直PG算法简直是”降维打我们可以把PG网络看成是一个篮球新手我们可以把PG网络看成是一个篮球新手高动作概率投歪了只能瞎调整(低奖励,降低动作概率全程没人指导,不知道动作错在哪(无价值评估进步慢、经常越其他典型算法其他算法如图所示,Critic网络估计相邻状态的V值,由此计算TD-error用于对自身网络的更新。同t+!TD-error即为Critic网络的损失函数,其他算法其他典型算法其他算法其他算法A3C的架构图分为两个主要部分:GlobalNetwork局网络并不直接参加和环境的互动,工人与环境有直接的互全局网络汇总梯度后并应用在全局网络的参数更新后,全局其他典型算法单纯基于策略的算法(如策略梯度)直接学习动作策定、效率低的问题,还存在两个核心痛点——“更新步长敏感”和“样本利用率低”;AC框架虽出的强化学习算法,目前已成为该领域的“业界标准”。PPO是为了解决标准策略梯度算法其他典型算法首先,针对”更新步长敏感“的问题,PPO算法采用“重要性采样”的方法,即引入了KL其他典型算法其他典型算法在PPO算法中,由于我们通过引入KL散度并对其进行裁剪限制了新旧策略之间的差异,因其他典型算法其他典型算法应用场景一:游戏AIPPO能够有效处理由像素构成的高维视觉输入和包含数百个可能动作的复杂离散动作空间,通过与环境的持续交互,学习到接近甚至超越人类专业OpenAIFive是一个由五个AI智能体组成的团队,比赛中击败了当时的世界冠军OG战队,展示了PPOPPO的优势在于其能够学习到长期的、具有预见性的策略,并能快速适应游戏环境中的各种动态应用场景二:机器人控制PPO非常适合处理机器人控制中普遍存在的应用场景三:自动驾驶PPO在自动驾驶领域主要用于优化决策和控制模块。它可以处理从感知到控制的端到端PPO的优势在于其能够在高保真的仿真环境中进行大规模的、安全的训练,然后将学到的策略迁移到真实世界的车辆上,这大大降低章节目录大模型强化学习大模型强化学习(LMRL)是将大规模预训练模型与强化学习(RL)相结合的范式,旨在通过与环大模型强化学习基于人类反馈的强化学习(RLHF)技术是大模型与强化学习融合的重要成果之一。这种创新方法将人类的主观判断转化为机器可理解的信号,从而优化语言模型的输出。RLHF的核心思想预训练语言模型:使用海量文本数据训练出具有良好语言理大模型强化学习在大模型训练中发挥着关键作用。PPO算法通过巧妙的设计,有效解决了传统策略梯度方法中传统RLHF方法的复杂性和不稳定性问题提供了新的思路。DPO的核心思想是通过直接里利用偏大模型强化学习大模型强化学习在自然语言处理、机器人技术、推荐系统的优化、游戏AI等机器人控制、路径规划游戏策略、对手模拟应用场景一:打造更智能的对话助手应用场景二:赋能开发者的代码伙伴早期的代码生成模型虽然能生成代码,但质量参差不齐。生成的代码可能存在语法错误、逻辑漏代码质量更高:生成的代码更正确、更优雅、更安全:能够有效避免一些常见的安全漏洞,如SQL注入、缓冲区溢出、跨站脚本攻击(XSS)等。模型通过学习安全编码规范和常见的漏洞模式,能应用场景三:构建能自主决策的AIAgent之前,AIAgent在完成复杂任务时常常显得力不从心。它们可能无法规划出合理的步骤,不知道该在什么时候使用什么工具,或者在遇到挫折时容规划能力更强:能够将一个复杂的目标,分解成一系列可执行的、循
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 税法基础概述 9
- 2026年职业技能(配镜师资格证)试题及答案
- 光伏支架抗风基础设计规范
- 二年级美术教科版寒假第二单元同步测试卷基础版A卷
- 二年级美术核心考点书法基础色彩题专项训练卷专项精练版
- 2026消费分级趋势下醋包项目高端化与下沉市场双轨并行策略报告
- 2026智能裁切设备普及对PVC刻字膜行业标准重塑的影响深度研究报告
- 2026新中式审美回流下英式衣帽架本土化改良与消费心理深度研究
- 2026小帆布棉服项目生物基涂层替代传统蜡染的碳足迹测算深度研究报告
- 2026云南公开遴选公务员考试(财务工作)历年参考题库含答案详解
- 初中物理实验计划表
- 新建铁路段站前工程架子队管理办法
- 中药湿热敷技术评分标准
- 国家职业技能标准申报表
- 《论语译注》-杨伯峻译注-中华书局
- GB/T 6682-2008分析实验室用水规格和试验方法
- GB/T 19886-2005声学隔声罩和隔声间噪声控制指南
- GB/T 15065-2009电线电缆用黑色聚乙烯塑料
- 农业生物环境工程第 温室设施环境调节与控制1
- 化学品安全技术说明书MSDS(液氨)
- 《建设项目全过程造价咨询规程》2017年1月18日
评论
0/150
提交评论