CN114967676B 基于强化学习的模型预测控制轨迹跟踪控制系统及方法方法 (苏州感测通信息科技有限公司)_第1页
CN114967676B 基于强化学习的模型预测控制轨迹跟踪控制系统及方法方法 (苏州感测通信息科技有限公司)_第2页
CN114967676B 基于强化学习的模型预测控制轨迹跟踪控制系统及方法方法 (苏州感测通信息科技有限公司)_第3页
CN114967676B 基于强化学习的模型预测控制轨迹跟踪控制系统及方法方法 (苏州感测通信息科技有限公司)_第4页
CN114967676B 基于强化学习的模型预测控制轨迹跟踪控制系统及方法方法 (苏州感测通信息科技有限公司)_第5页
已阅读5页,还剩32页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

湖大道99号苏州纳米城西北区13幢基于强化学习的模型预测控制轨迹跟踪控本发明涉及一种基于强化学习的模型预测预测模型的预测轨迹结合规划模块的参考轨迹行求解,计算出最优控制量发送给被控车辆执辆位置差值调整车辆MPC控制误差权重参数,适2所述目标函数+约束条件模块,用来确定MPC控制器控制车辆进行轨迹跟发的最优控制量的数值范围以及相隔控制时域内控制量的增量大小;目标函数的定义如t+i时刻之间的控制增量序列;3min为车辆前轮最小转角,δmax为车辆前轮最大转角,Δδmin为车辆前轮单位时间内最小的增量,Δδmax为车辆前轮单位所述规划模块,用来根据车辆反馈的状态量及时发布局部规划路径轨迹所述状态估计模块,用来矫正理论建立的车辆动力学模型与实际车辆所述强化学习模块,用来根据车辆与参考轨迹之间的控制误差,及时调定义强化学习模块的观测状态为横摆角偏差、横向偏差,动Actor网络更新策略为确定性策略梯度加Ornstein-Uhlenbeck过程噪声,增加随机探2.基于权利要求1所述一种基于强化学习的模型预测控制轨迹跟踪控制系统的方法,步骤2、线性时变模型预测控制器的优化求解模块根据目标函数以及约束条件求解出4实际的车辆轨迹状态与规划模块重新规划的参考轨迹之间的差值来调整线性时变模型预3.根据权利要求2所述一种基于强化学习的模型预测控制轨迹跟踪控制方法,其特征t+i时刻之间的控制增量序列;4.根据权利要求2所述一种基于强化学习的模型预测控制轨迹跟踪控制方法,其特征min为车辆前轮最小转角,δmax为车辆前轮最大转角,Δδmin为车辆前轮单位时间5内最小的增量,Δδmax为车辆前轮单位5.根据权利要求2所述一种基于强化学习的模型预测控制轨迹跟踪控制方法,其特征e与Re:p至t+i时刻之间的控制增量序列矩阵,ct均为系数矩阵,Ht为表征Qe的66.根据权利要求2所述一种基于强化学习的模型预测控制轨迹跟踪控制方法,其特征7.根据权利要求2所述一种基于强化学习的模型预测控制轨迹跟踪控制方法,其特征定义强化学习模块的观测状态为横摆角偏差、横向偏差,动Actor网络更新策略为确定性策略梯度加Ornstein-Uhlenbeck过程噪声,增加随机探8.根据权利要求2所述一种基于强化学习的模型预测控制轨迹跟踪控制方法,其特征r表示t7τθμ+(1-τ)θμ′,τ<<1其中,Esr-pa-pr-e表示当前Critic网络与另一个Critic网络β时之间损失函数的期望值,ω表示当前Critic网络的网络参数,yt表示另一个Critic网络β的计算价值,EX-pf表示当前actor网络的损失函数期望值,vaQ(sr,alw)表示当前价值的梯度,a=μ8模型预测控制(ModelPredictiveControl,MPC)器、纯跟踪控制器、线性二次调节器[0005]检索发现,CN110221611A公开了一种轨迹跟踪控制方法CN110568760A公开了一种适用于换道及车道保持的参数化学习决策控制系统及方法。其开的专利表述的是有一种基于强化学习的决策行为模块,当感知信号输入给该决策模块,9[0013]本发明公开了一种基于强化学习的模型预测控制(ModelPredictiveControl,辆状态空间的预测模型;优化求解模块基于约束条件对MPC成本函数求解,计算最优控制量;针对MPC控制器固定的误差权重矩阵,采用强化学习的深度确定性策略梯度(Deep轨迹的对地坐标系绝对坐标值数据发送给线性时变模型根据实际的车辆轨迹状态与规划模块重新规划的参考轨迹之间的差值来调整线性时变模时间内最小的增量,Δδmax为车辆前轮单位时间内最大的增量,Δδ[0037]式中,elatmin为车辆最小的横向轨迹误差,elatmax为车辆最大的横向轨迹误差,Ψe[0060]奖励函数设置分成横向误差范围与横摆角误差范围,横向误差范围分成小于横摆角误差范围分成小于0.05rad、小于0.10rad、小于0.20rad、小于0.25rad、大于t+1′θμ,τ<<1[0070]其中,EX-psa-r-g表示当前Critic网络与另一个Critic网络β时之间损失函位置信息通过其内预测模型预测未来预测时域内的行驶轨迹作为反馈环节将预测轨迹发[0085]步骤2、线性时变模型预测控制器的优化求解模块接收规划模块的参考轨迹和预测模块的预测轨迹后结合目标函数+约束条件模块根据目标函数以及约束条件求解出最优时间内最小的增量,Δδmax为车辆前轮单位时间内最大的增量,Δδ[0102]式中,elatmin为车辆最小的横向轨迹误差,elatmax为车辆最大的横向轨迹误差,Ψ[0103]优化求解模块将MPC控制问题转换成二次规划求解问题,求解最优车辆前轮转角[0119]步骤3、优化求解模块将求出的最优车辆前轮转角控制量发送给被控车辆的执行器执行,车辆执行操作之后得到的状态量(t)将被反馈到状态估计模块、强化学习模块和误差后再次预测车辆未来预测时域内的行驶轨迹并将预测轨迹输入给优化[0122]步骤5、规划模块根据下一时刻的状态信息重新规划车辆参考轨迹并将参考轨迹[0129]奖励函数设置分成横向误差范围与横摆角误差范围,根据表1可以看到划分的误t+1t+1)′θμ,τ<<1之间损失函数的期望值、当前Critic网络的网络参数、另一个Critic网络β的计

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论