CN119439993A 一种基于两阶段安全强化学习的船舶避碰决策方法 (大连海事大学)_第1页
CN119439993A 一种基于两阶段安全强化学习的船舶避碰决策方法 (大连海事大学)_第2页
CN119439993A 一种基于两阶段安全强化学习的船舶避碰决策方法 (大连海事大学)_第3页
CN119439993A 一种基于两阶段安全强化学习的船舶避碰决策方法 (大连海事大学)_第4页
CN119439993A 一种基于两阶段安全强化学习的船舶避碰决策方法 (大连海事大学)_第5页
已阅读5页,还剩31页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种基于两阶段安全强化学习的船舶避碰本发明一种基于两阶段安全强化学习的船强化学习船舶避碰决策模型进行船舶行驶过程化学习船舶避碰决策模型进行船舶行驶过程中经济性,为强化学习避碰算法提供一种安全保2对第一阶段强化学习船舶避碰决策模型进行训练,得到训练好的基于船舶运动模型、第一阶段强化学习船舶避碰决策模型的动作概对第二阶段安全强化学习船舶避碰决策模型进行训练,得到训练好2.根据权利要求1所述的一种基于两阶段安全强化学习的船舶避碰决策方法,其特征3.根据权利要求1所述的一种基于两阶段安全强化学习的船舶避碰决策方法,其特征4.根据权利要求1所述的一种基于两阶段安全强化学习的船舶避碰决策方法,其特征economyreward=_|Cdest_Cownship|xα5.根据权利要求1所述的一种基于两阶段安全强化学习的船舶避碰决策方法,其特征36.根据权利要求1所述的一种基于两阶段安全强化学习的船舶避碰决策方法,其特征第一阶段奖励函数模块:用于根据多个奖励项即国际海第一阶段强化学习算法模块:用于基于所述第一阶段奖励函第一阶段更新环境模块:用于基于所述强化学习算法模块输出的决7.根据权利要求1所述的一种基于两阶段安全强化学习的船舶避碰决策方法,其特征第二阶段状态识别模块:用于对初始环境中的他船进行分类第二阶段安全强化学习的奖励函数模块:用于基于三级树决第二阶段奖励统计模块:用于对所述第二阶段安全强化学第二阶段强化学习算法模块:用于基于所述第二阶段安全4更新环境模块:用于基于船舶运动模型、所述第二阶段状态及所述第二阶段强化学习算法模块输出的是否对当前空间进行更新的决策对当前的船舶8.根据权利要求1所述的一种基于两阶段安全强化学习的船舶避碰决策方法,其特征9.根据权利要求7所述的一种基于两阶段安全强化学习的船舶避碰决策方法,其特征针对当前场景构建三级决策树模型并遍历计算;以三级节点为统若某节点的所有子节点均为碰撞节点,则该节点本身也被判定5航行面临越来越大的挑战和风险。海上事故对人员生命安全和财产造成的危害也日益凸强化学习在实际生产环境中推广应用时面临的最大挑6度等方面进行多维度对比分析,可以发现现有的避碰算法从很大程度上忽略了航行经济[0010]综上所述可以发现,如果避碰算法需要投入实际生产应用需要解决以下几个问[0013]③在未来很长一段时间内海上自主水面船舶和人工驾驶船舶混行的时期需要考[0014]④构建避碰算法时需要尽可能多的将真实航行情况考虑进去,包括船舶运动模7[0024]第二阈值条件指的是:通过本船舶与其他船舶或障碍物之间碰撞风险值进行确[0032]式中:economyreward表示航行经济性奖励函数;Cdest为终点相对于本船的方向;[0041]第一阶段奖励函数模块:用于根据多个奖励项即国际海上避碰规则遵守奖励函[0043]第一阶段强化学习算法模块:用于基于所述第一阶段奖励函数模块输出的奖励8场景及所述第二阶段强化学习算法模块输出的是否对当前空间进行更新的决策对当前的[0056]式中:Reward代表一级动作对应的奖励函数值;β代表此三级动作是否有碰撞风9[0064]本发明提供的一种基于两阶段安全强化学习的船舶避碰决策方法,具有以下优为将强化学习避碰算法应用于工程实践提供了一种切[0069]本发明提出了一种基于强化学习的船舶自主避碰决策方法,其具有以下有益效[0089]S2:基于船舶运动模型,结合强化学习算法,设计国际海上避碰规则遵守奖励函[0090]S3:对第一阶段强化学习船舶避碰决策模型进行训练,得到训练好的第一阶段强[0091]S4:基于船舶运动模型、第一阶段强化学习船舶避碰决策模型的动作概率分布确阶段安全强化学习船舶避碰决策模型,用于船舶在周围第二阈值内有其他船舶或障碍时,[0092]S5:对第二阶段安全强化学习船舶避碰决策模型进行训练,得到训练好的第二阶[0097]第二阈值条件指的是:通过本船舶与其他船舶或障碍物之间碰撞风险值进行确[0102]第一阶段奖励函数模块:用于根据多个奖励项即国际海上避碰规则遵守奖励函[0104]第一阶段强化学习算法模块:用于基于所述第一阶段奖励函数模块输出的奖励[0115]根据国际海上避碰规则的描述所述国际海上避碰规则遵守奖励函数用于表征当[0123]式中:economyreward表示航行经济性奖励函数;Cdest为终点相对于本船的方向;场景及所述第二阶段强化学习算法模块输出的是否对当前空间进行更新的决策对当前的[0143]式中:Reward代表一级动作对应的奖励函数值;β代表此三级动作是否有碰撞风[0144]所述三级树决策模块以三级节点为统计依据利用碰撞检测模块计算出有碰撞风[0166]船舶运动模型采用基于四阶Runge_Kutta数值积分方法的Nomoto模型模拟船舶的[0168]k=ucos(J)-vsin(0)[0172]根据Nomoto模型的动力学方程和PID控制方程。船舶的横向速度v和角速度r由如a12212211δmin和δmax分别代表了船舶可输入舵角的最小值和最大值。[0176]模型采用了四阶Runge_Kutta方法来近似求解微分方程,这个数值方法能够提供nn)n+k3)k34分别代表了龙格_库塔方法中的四个斜率的估计值;h是时间步[0184]S4:基于船舶运动模型、第一阶段强化学习船舶避碰决策模型的动作概率分布确阶段安全强化学习船舶避碰决策模型,用于船舶在周围第二阈值内有其他船舶或障碍时,[0191]在第二阶段安全强化学习中,若船舶周围2海里没有其他障碍和船舶或船舶发生[0192]S5:对第二阶段安全强化学习船舶避碰决策模型进行训练,得到训练好的第二阶

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论