版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
VGT控制策略实验及结果分析的案例目录TOC\o"1-3"\h\u8585VGT控制策略实验及结果分析的案例 1153241.1实验系统概述 1230091.2结果分析 291591.3工作小结 51.1实验系统概述基于上述关于并行强化学习算法的讨论,提出一种基于A3C算法的可变几何截面涡轮增压器柴油机瞬态增压控制策略。在本研究中将并行强化学习控制策略应用于一个配备VGT的6缸3升的柴油机中,以GT-POWER引擎模型作为引擎环境,并且假设边缘设备到云端全局服务器之间通信可用。经典的无模型强化学习算法(DRL)需要通过大量随机探索来学习才能达到较好控制性能,因此将经典DRL应用于实际控制中是十分困难的,为解决该问题,本研究借鉴一种混合端到端的控制策略[21]。试验中控制动作选择为VGT的叶片位置,采用实际增压、目标增压、发动机转速和当前叶片位置四个参数形成四维的状态空间[20]。该实验的控制目标是通过快速稳定地调节叶片位置,来跟踪瞬态驱动循环下的目标增压。为达到这个目标,对于外部奖励(rt)的选择,定义目标增压与当前增压(e为了提供比较,模型最开始由一个微调的基准控制器控制。算法具体参数如图4-1所示。在A3C算法中的演员-评论家神经网络(图4-2)中,演员网络以上述四个参数形成的四维状态空间作为网络的输入层,在输入层后有三个隐藏层,每层都有120个神经元,输出层只有一个表示控制动作的神经元(叶片位置),这些层全部都完全连接起来。而对于评论家网络来说,输入层有一个额外的神经元(参数化演员函数μ(s/图4-1算法内具体参数图4-2演员网络(a)和评论家网络(b)1.2结果分析本节对上述提出的基于A3C算法的柴油机瞬态增压控制边缘计算框架得到验证。为了模拟现实中的驾驶行为,选择美国FTP-72(联邦测试程序72)驱动周期下发动机目标增压压力作为控制目标(如图4-3)。首先,对PID控制器、基于A3C算法的控制策略之间的跟踪性能进行分析比较。其P和I增益都被映射为速度和请求负载的函数,一般在工业实践中,导数的作用是为了在稳态过程中维持系统的稳定,所以即使它对PI控制系统作用较小,但依然必不可少。为了简化实验,训练数据集由100个数据集组成,每个集表示FTP-72驱动周期中的900-945s之间的数据。该周期模拟了一条12.07公里的城市路线,经常停靠和快速加速,最高时速91.25km/h,平均时速31.5km/h。选择这种瞬态驱动周期是因为它模拟了具有大滞后、强耦合和非线性的真实VGT环境系统。因此,如果在这种环境中建立了良好的控制策略,它应该在其他具有更稳态区域的驱动周期中表现良好。本研究采用积分绝对误差(IAE),将绝对误差随时间的推移集成在一起,测量PID控制器与所提出的A3C算法之间的控制性能。图4-4中可以看出微调PID控制器的控制性能,可以看出,在刚开始时实际增压压力可很好地跟踪目标增压压力。但是,在对一些细节放大后,我们很明显地可以看到一个很大的差距。这可能是由于涡轮本身的缺点涡轮迟滞所造成的,无法从涡轮增压器控制策略的角度加以改进。以920s到945s为例,PID控制器控制性能仍可能有进步的可能性。但是我们在这里注意到,图4-4中的结果只是控制性能和调整工作相互作用的结果,也就是说,如果以更加精确细节的方式进行优化,则可以实现更好的控制行为,但需要更多的努力和资源。在本实验中可以看出,由于每种控制策略背后的控制结构是不同的,控制性能很受控制参数的调整的影响,所以本文不强调PID和DRL理论之间的最终控制性能比较。更多的注重点是尝试以自主学习的方式解决控制问题,并展示了深度强化学习算法策略的良好控制适应性。在图4-5中也可以看出基于A3C算法的学习过程中的累积奖励。在学习刚开始时A3C算法中无论是4worker还是2worker(边缘设备数量,也就是并行机体数量)代理累积奖励非常低,这是因为代理(Agent)(VGT叶片位置执行器)只是随机选择动作来进行广泛的学习过程,而不进入局部最优,另一方面是因为代理对于特定状态应该做什么没有先行经验,代理只能根据初始参数选择。大约在10个数据集后,具有4个worker的算法和具有2个worker的算法已经基本达到累积奖励基准值,并且可以明显看出4worker完成的速度更快。在20个数据集后,4worker已经完成了累积奖励收敛达到了很高的奖励值,这就表明了该代理已经学习完了控制增压经验。反观单机体系的1worker在40个数据集后累计奖励才达到基准值,在80个数据集后完成累计奖励收敛,远远慢于4worker和2worker。通过三组曲线对比,可也明显看出并行设备数量越多,完成同一目标速度越快。从图4-4中可以看出,A3C算法比PID控制策略整体上更加贴近目标曲线,尤其在910s-920s和930s-945s这两段区间内,A3C算法曲线几乎完美贴近目标增压曲线。我们因该知道的是,算法在学习过程中与环境的直接交互(在本文研究下,仿真软件作为环境)来进行,而不依赖于模型监督或完整的环境模型,并开发了一种行为良好的控制策略,并从零开始自主形成[20]。从图4-4中可以看出,PID控制器和所提出的A3C算法在大体上去都很符合目标增压曲线,但在对一些细节放大后,仍然可以看到两种控制策略有较大差异。虽然PID控制器似乎是以相对较小的误差跟踪升压,基于所提出的A3C算法的控制性能优于PID控制器,具有几乎优良的跟踪性能。图4-3美国FTP-72驱动周期下柴油机的目标增压图4-4基准、PID控制器、A3C算法之间最终控制行为比较图4-5不同边缘设备的A3C算法学习过程图1.3工作小结本节主要详细介绍了并行深度强化学习的VGT增压控制实验,并以微调PID控制器控制作为对照组,很明显的看出了A3C算法的优势之处。经上述实验结果证明,基于所提出的A3C算法的控制性能可以通过自主学习与环境交互,而不依赖与整体环境模型,从零开始实现良好的瞬态控制性能,此外通过边缘计算
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 中小学《网络安全知识培训》课件完整版
- 中国银行间市场债券回购交易主协议(2026版)简介
- 中国银行方案招标演讲稿鸡年大吉
- 大一ai试题及答案
- 三年级下册道德与法治教学设计-4.1社区是人们共同生活的地方 第一课时 北师大版
- 人教版美术 八年级下册第一单元 第2课 弘扬真善美 教学设计
- 鲁科版高中化学选修4第二章3节 化学反应的速率第2课时教学设计1
- 高中语文 第一单元 二 当仁不让于师教案4 新人教版选修《先秦诸子选读》
- 高中物理 第10章 热力学定律 2 热和内能教学设计3 新人教版选修3-3
- 2026下半年江苏省南通市事业单位考试招聘易考易错模拟试题(共500题)试卷后附参考答案
- GB/T 21387-2025供水系统用轴流式止回阀
- 设备除锈与刷漆标准规范手册
- 铁路工务安全教育课件
- 前列腺疾病课件
- 2025-2030年中国药食同源行业市场现状调查及未来趋势研判报告
- 装修电话营销培训
- 2025年澳洲amc9年级竞赛题库及答案
- 晋江大神合同
- 合同支付条款补充协议
- 钢丝绳安全使用培训课件
- 马克思主义理论前沿探索
评论
0/150
提交评论