CN115016496B 基于深度强化学习的水面无人艇路径跟踪方法 (重庆大学)_第1页
CN115016496B 基于深度强化学习的水面无人艇路径跟踪方法 (重庆大学)_第2页
CN115016496B 基于深度强化学习的水面无人艇路径跟踪方法 (重庆大学)_第3页
CN115016496B 基于深度强化学习的水面无人艇路径跟踪方法 (重庆大学)_第4页
CN115016496B 基于深度强化学习的水面无人艇路径跟踪方法 (重庆大学)_第5页
已阅读5页,还剩53页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于深度强化学习的水面无人艇路径跟踪本发明具体涉及基于深度强化学习的水面算法构建;将最优动作值发送给目标无人艇执进行环境和无人艇运动建模并且具备自适应能2i2;ct)为目标无人艇在t时间的位置坐标表示;c表示曲线规划路径下目标无人艇的方位角;df表示曲线规划路径下目标无人S3:根据目标无人艇的规划路径结合实时位姿信步骤S3中,通过矢量场算法根据目标无人艇的规划路3训练时,基于状态空间、动作空间和奖励函数计算S402:获取目标无人艇规划路径的当前路径点信息S404:再次获取目标无人艇规划路径的当前路步骤S406中,策略模型需更新的网络参数包括Q网络和π网络的网络参数以及温度参φ表示状态价值函数;4更新目标Q网络的网络参数:F-tB:+(1-t)bie{1,2}:5起的在Δt时间内航向角改变量;根据航向角改变量和当前无人艇航向角计算得到期望航[0005]上述现有方案中的水面无人艇路径跟踪控制方法不依赖扰控制方法,这类算法通过环境和无人艇动力学建立准确的模型才能获得较好的控制精6[0022]A={6na};σδ表示预设时段内20次舵角命w23表示设置的每部分奖励项的权重系数。7pi+12;)2=Rc;[0044]df=Ipill-Re:8φ表示状态价值函数;9施例的详细描述并非旨在限制要求保护的本发明的范围,而是仅表示本发明的选定实施2;)2=Rc;[0133]df=lpill-RC:[0136]本发明考虑了直线规划路径和曲线规划路径对无人艇路据目标无人艇的规划路径结合实时位姿信息计算[0156]本发明通过矢量场算法结合目标无人艇的规划路径和实时位姿信息计算参考航艇航向控制参考相比,能够避免因为地图比例尺不同带来的绝对距离表示范围变化问题,[0157]具体实施过程中,柔性演员评论家算法用样本经验回放池存储每回合的采样数φ表示状态价值函数;跟踪误差和上一个时刻跟踪误差的差值Δd=dt-dt-1,使得状态空间可以更好的体现出无[0179]S=ixd,d表示舵角指令大小;AX表示目标无人艇当前航向误差和上一时刻的为无人艇的舵角指令大小即δnd,其值的取值范围和最大变化速度根据现有技术中对无人σδ表示预设时段内20次舵角命w23表示设置的每部分奖励项的权重系数。在跟踪误差为0时最大,也随着跟踪误差绝对值的增大而减小;舵角命令奖励值的范围为[0195]本发明将目标无人艇的路径跟踪问题转换为具有自适应[0199]VRX仿真环境是RoboNation和海军研究办公室(ONR)与海军研究生院(NPS)合作开发的一款为Robotx比赛提供的基于ROS和Gazebo的虚拟仿真环境,通过添加额外的插件扩[0201]本实验选择16英尺的波浪自适应模块化无人艇(WAM-V)平台作为进行算法开发和操作。本实验使用简化的三自由度动力学模型对WAM-V无人艇在仿真环境中进行运动学和;;[0209]MV+c(v)v+D(v)v=f:nstbd分别为无人艇左右推进器RPM指令,δnmax=为左右推进RPM的最大差值,值为2。因为[0225]原有的VRX仿真环境实现了足够保真度的水上的仿真环境,但是并不适合直接当个软件包框架抽象成了TaskEnvironmentRobotEnvironment和GazeboEnvironment三个所需的接口函数,管理强化学习算法与VRX环境之间的通信;RobotEnvironment继承自适用于WAM-V无人艇水上环境的路径跟踪任务强化学习训练,还可以方便地替换不同型号使用ROS实现强化学习算法和VRX仿真环境之间的通讯,实现了GYM环境中的随机种子设置[0229]RobotEnvironment:实现无人艇控制和感知周围环境所需并且在每次启动无人艇控制之前,对无人艇功能进行检查(检查控制和感知所需要的ROS[0230]TaskEnvironment负责加载任务场景地图到VRX环境中,并提供智能学习的特定水面无人艇的路径跟踪任务和自主避障任务两个任务[0237]为了体现本发明提出的基于柔性演员评论家算法无人艇据这个误差计算出舵角控制指令进行路径跟踪控制。具体的控制参数设置如下:kp=3,ki=0.01,kd=3。[0242]在无人艇的路径跟踪实验中,我们选择跟踪误差和航向角误差的平均值(Mean各种路径拐角变换情况,算法每回合采用一条航向角随机且长度为60m直线路径去进行航的参数为gain=0.1,period=5,direction_x=1.0,direction_y=0.0,angle=0.4,[0246]图8是三种基于强化学习的无人艇路径跟踪训练过程中平均回报奖励变化曲线和更鼓励对环境的探索动作,在训练初期可以更快的找到较好的无人艇路径跟踪控制策略;[0249]我们设计了一条直线路径作为规在一定海浪干扰的环境下可以取得比传统PID控制算法更好的路径跟踪效果。同时观察在存在海浪干扰的情况下PID算法在跟踪过程中无人艇航向角误差的变化,可以发现其始终[0252]从表2中可以得出,基于PID的路径跟踪控制虽然航向角原因是我们实现的PID控制算法是针对单输入和单输出系统,舵角控制指令的选取只于当行优化产生更好的控制效果;并且在训练过程中可以隐式的建模环境干扰到算法模型中,都最小。基于DDPG和基于PPO的路径跟踪控制算法在路径转角比较大的场景下会有更多的[0255]本实验实现的PID算法在直线路径场景跟踪实验中,已经表现出了较差的控制性线路径场景中我们就不再对PID算法与基于强化学习的路径跟踪[0265]为了体现出本发明提出的无人艇路径跟踪算法中马尔可夫决策过程的设计有效跟踪误差的平均值和均方根值结果,及舵角值变化的标准差结果如表4所示。其中,No_Heading代表删除航向角相关奖励后的奖励函数设计,No_Cross代表删除路径跟踪误差相训练环境的海风的干扰参数设置为mean=5,var_gain=2,var_time=5,update_time=1,[0275]最后需要说明的是,以上实施例仅用以说明本发明的技术方案而非限制技术方

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论