版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
VGT控制策略研究及实现案例分析目录TOC\o"1-3"\h\u24814VGT控制策略研究及实现案例分析 170621.1深度强化学习算法 1223691.1.1强化学习基本理论 1127781.1.2深度确定性策略梯度算法 2176681.1.3DDPG的VGT控制策略的实现 3323211.2并行深度强化学习控制策略 4109701.2.1分布式边缘计算 4195391.2.2并行深度强化学习算法 685851.3工作小结 61.1深度强化学习算法1.1.1强化学习基本理论无模型强化学习(DRL)算法是一种自动化目标导向的学习和决策技术,它与其他控制算法不同点在于它强调与环境的直接交互来学习代理,它无须一个完整的环境模型。作为一种交互式学习方法,强化学习的主要特点是不断试错和延迟反馈,图3-1为学习代理与环境之间的相互交互过程。强化学习(RL)被认为是三种机器学习范式之一,它从动物学习的试错法中受到启发,将智能体与环境交互得到的奖励值作为反馈信号对智能体进行训练,如图一。强化学习一般可以用马尔可夫决策过程(Markovdecisionprocess,MDP)表示,主要元素包含(S,A,R,T,γ),其中,S表示所处的环境状态,A表示智能体采取的动作,R表示得到的奖励值,T表示状态转移概率,γ表示折扣因子。自主学习代理的策略π表示状态空间到动作空间的一个映射。当智能体状态ts∈S时,根据策略π采取动作ta∈A,进而根据状态转移概率T转移到下一个状态t1s+,同时接收环境反馈的奖励值tr∈R。强化学习的目标是不断地优化智能体的策略,从而得到最大的奖励值。智能体的值函数和动作值函数分别为V(St)和Q(St,At),用来评估智能体在状态ts下所能得到的长期奖励的期望。强化算法(Q-Learning)如下:(St表示状态,At表示动作,Q(St,At)表示对状态S下动作A得到的总体反馈的一个估计,R为此动作的立即回报,γ为折扣因子表示未来回报对当前回报的重要性)①对每一个St,At初始化表项Q(St,At)为0②观察当前状态St③选择一个动作At并执行,该动作为使Q(St,At)最大的At,并接收到立即回报R,之后观察新状态St’。此时Q表更新:Q(St,At)=R(St,At)+γ*maxQ(St’,At’)一直重复此循环图3-1代理与环境交互过程1.1.2深度确定性策略梯度算法目前,深度强化学习算法(DQN)在基于传统的强化学习算法上,有效利用了大型神经网络来解决函数逼近器不稳定这个问题,例如AlphaGo如图1.2。在DQN出现之前,人们普遍认为用非线性函数逼近器用来学习价值函数是不稳定和准确的。它相对于传统强化学习算法有两个方面的创新,一方面是当DQN使用函数逼近器去学习价值函数时可以重复缓冲区样本来进行非策略性训练用以最小化样本之间的相关性,另一方面是使用目标网络(target-Qnetwork)训练时在时间差备份期间提供一致的目标。深度确定性策略梯度算法(DDPG)囊括了深度强化学习算法(DQN)和演员-批评家算法(AC)(图3-2)以及确定性策略梯度算法(DPG)。确定性策略梯度算法维护了一个参数化演员函数μ(虽然DQN算法在Atari游戏和AlphaGo(图3-3)等高维问题上取得了巨大的成功,但实现该算法的动作空间仍然是离散的。然而,对于许多有趣的任务,特别是物理工业控制任务中,动作空间必须是连续的。如果动作空间离散得太精细,控制问题最终会导致过度的运动空间,这使得算法很难学习。DDPG策略使用深度神经网络作为逼近器,以有效地结合深度学习和确定性策略梯度算法。它可以处理高维输入,实现端到端控制,输出连续动作,因此可以应用于具有大状态空间和连续动作空间的更复杂的情况。详细地说,DDPG使用参与者网络来调整策略函数的参数θµ,即决定给定状态的最优操作。一个评论家是被用来进行评价的,由参与者根据时间TD误差来估计。图3-2参与者-批评家算法架构图3-3AlphaGo中的DQN算法1.1.3DDPG的VGT控制策略的实现TensorFlow是一种端到端的机器学习开源平台,它被广泛应用在各种智能化工业中。本文借鉴了DRL在其他研究领域的研究成果,主要是在机器学习中比较重要的程序代码框架,本研究中使用了与TensorFlow相互兼容的Python软件作为算法设计基础驱动语言。以MATLAB/Simulink作为联合仿真接口,将Python中编写的DDPG算法应用于柴油机环境中去,从而达到Python、MATLAB/Simulink和GT-SUITE之间的双向传输。具体的DDPG算法实现和相应的协同仿真平台(图3-4)[20]。图3-4深度确定性策略梯度(DDPG)算法的实现和相应的协同仿真平台1.2并行深度强化学习控制策略1.2.1分布式边缘计算与通过互联网提供的计算资源的集中式云计算方式不同(图3-5),分布式边缘计算将网络计算资源尽可能接近数据来源。它与InternetOfThings(IOTS)相关联,具有网格网络化和小型AI计算设备的应用特点。分布式边缘计算可以通过允许依靠云计算来处理相关数据的设计,边缘计算可以提供更快的响应时间来降低大规模数据传输的成本和要求。另外,边缘设备只需要定期与云服务器通信,在大多数情况下只在边缘部署执行操作,这将提供具有间歇性连接的可靠操作。该边缘计算体系结构如图3-6所示,包含N个不同的边缘设备和一个云端全局服务器。参与者和学习者共享相同的Q网络,为了增加用户的隐私和安全性,使用本地重播内存来存储体验。每个边缘设备中的学习者将其梯度发送到云端全局服务器,并周期性地从云中提取最新的参数。根据不同的动力总成控制问题,该框架具有不同的优势。与单机架构相比,分布式边缘设备可以更有效地探索状态空间,从而使最终学习的控制算法更加健壮。在上一节的深度强化学习算法(DRL)中可以发现,并行式深度强化学习算法十分符合分布式边缘计算框架。本文主要提出一个边缘计算框架,以实现基于并行深度强化学习的发动机增压控制。该控制策略同时囊括了分布式边缘计算和深度强化学习的优点,一是它具有自主学习能力,通过与环境交互快速学习,发展出较好的跟踪瞬态驱动周期下发动机目标增压的控制策略;二是区别于单机体系结构的DRL算法,该控制算法从边缘计算角度出发,首先在边缘设备中对基于DRL算法的参数进行局部训练,然后将更新后的策略梯度发送给位于云端的全局服务器,最后定期同步边缘设备与云端服务器之间的参数。图3-5云计算与边缘计算范式图3-6分布式边缘计算框架1.2.2并行深度强化学习算法相对于单机体系控制行为来说,并行是为了更快更有效率地学习,本研究构建了一个能够分配强化学习任务的分布式边缘计算框架,并将深度确定性策略梯度(DDPG)算法运用其中,构成了一种并行强化学习方式(A3C)。如图3-7所示,A3C的提出是为了解决演员-批评家算法(Actor-Critic)不收敛问题,它会创建多个并行环境,让多个拥有副结构的代理(Agent)同时在这些并行环境上更新主结构中的参数,并行中的Agent互不干扰,而全局服务器的参数更新受到边缘设备提交的更新策略梯度的不连续性干扰所以更新的相关性被降低,收敛性提高[20]。A3C最大的一个好处就是它的全局服务器也就是中央大脑,可以不必像DQN、DDPG算法那样需要一个庞大的记忆库也能更新策略梯度[6]。本文所用A3C算法关键代码如图3-8和图3-9所示,图3-8表明边缘设备和全局服务器使用的是相同的算法结构ACNet,该ACNet能够随时被边缘设备和全局服务器调用。而图3-9则是算法具体结构,从图中可以明显看出Actor-Critic算法运用其中,并且介绍了搭建神经网络的具体步骤。1.3工作小结本节主要详细介绍了强化学习原理(RL)、深度强化学习算法(DQN)、演员-评论家算法(Actor-Critic)、深度确定性策略梯度算法(DDPG)以及A3C算法。A3C算法的提出是为了解决Actor-Critic算法不收敛的问题,并且省略了DQN、DDPG等算法庞大的记忆库,采用并行的方法加快算法学习速度,明显提高效率。分布式边缘计算框架是本节着重介绍的部分,A3C算法搭配边缘计算框架实现并行,这使得该算法既具有强化学习的优点又具有边缘计算的优点。图3-7A3C算法框架图3-8图3-9A3C算法的伪代码如下:AlgorithmS1Asynchronousadvantageactor-critic-pseudocodeforeachactor-learnerthread//Assumeglobalsharedparametervectorθandθν//Assumethread-specifieparametervectorsθ'andInitializethreadstepcountert←1RepeatResetgradients:dθ←0anddθνSynchronizethread-specificparametersθ'=θandθνtstart=GetstatesRepeatPerformataccordingtopolicyReceiverewardrtandnewstatet←t+1T←T+1Untilterminalstort-tstartR=OforterminalFori∈t−1,R←riAccumulategradie
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2025-2026学年不带危险物品入园说课稿
- 2025-2026学年对比法儿歌说课稿
- 2025-2026学年古筝老师备说课稿
- 2025-2026学年初中语文说课稿怎么写
- 2025-2026学年《奇妙的影子》说课稿
- 2025-2026学年传统游戏说课稿视频
- 2026下半年下半年小学数学教资面试计算答案
- 初中历史教资面试文化专题试卷及答案
- 2025-2026学年2015中考数学说课稿
- 《二节乐音和噪声》课件
- 小学主题班会课件:小小少年扣好人生第一粒扣子
- 2025福建厦门国贸集团股份有限公司校园招聘27人笔试历年备考题库附带答案详解
- 2025年检察官入额遴选考试真题及答案
- 2026上海市宝山区卫生健康系统事业单位上半年招聘卫生专业技术人员165人备考题库及参考答案详解一套
- 土地宝忏十王宝忏城隍宝忏地母宝忏
- 储粮机械通风技术规程
- 国开(大连)2025年《农村文化产业概论》形考作业1-4答案
- 固废回收合同简易版范本2025年使用说明
- 公司合署办公协议书
- 《电力数据资产高质量供给管理规范》
- 2025年陪诊师考试题库(附答案)
评论
0/150
提交评论