CN115686031B 一种基于学习和采样的auv信息性路径规划方法 (余姚市机器人研究中心)_第1页
CN115686031B 一种基于学习和采样的auv信息性路径规划方法 (余姚市机器人研究中心)_第2页
CN115686031B 一种基于学习和采样的auv信息性路径规划方法 (余姚市机器人研究中心)_第3页
CN115686031B 一种基于学习和采样的auv信息性路径规划方法 (余姚市机器人研究中心)_第4页
CN115686031B 一种基于学习和采样的auv信息性路径规划方法 (余姚市机器人研究中心)_第5页
已阅读5页,还剩40页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种基于学习和采样的AUV信息性路径规划本发明公开了一种基于学习和采样的AUV信路径规划。然后,完成基于概率路线图的Q-度,通过混合路径规划方法实现洋流场中的IPP动返航功能。本发明不仅能解决多目标优化问2j)表示从当前状态si执行动作aj达到下一3在图的搜索阶段,将Q-learning算法与生成的概率路线处的采样信息值r"以及由状态sl转移到状态sh时的能量消耗",将初始奖励矩阵中的非负值RMaI(s,an)(l,h=1,2,…,N)重新设计为:通过和洋流速度的矢量合成得到:4矩阵RW如下:AUV返回到起始点,因此将原来的起始状态s1设置为目标状态,奖励矩阵5i为子路径段上的能量消耗;2.根据权利要求1所述一种基于学习和采样的AUV信息性路径规划方法,其特征在于:3.根据权利要求1所述一种基于学习和采样的AUV信息性路径规划方法,其特征在于:4.根据权利要求1或3所述一种基于学习和采样的AUV信息性路径规划方法,其特征在5.根据权利要求1所述一种基于学习和采样的AUV信息性路径规划方法,其特征在于:67产生局部最优解并且不能考虑所有的洋流变量。粒子群优化方法也被应用于路径规划研于大规模问题实例。同时考虑预算约束和信息增益的IPP问题可以使用组合优化问题来表[0005]基于采样的方法由于在处理高维问题方面具有优势,也被广泛应用于AUV的路径8[0006]为了解决现有AUV路径规划研究中没有综合考虑洋流影响、信息采集以及静态避态的一系列动作。最优的目标策略π*能够指导AUV选择使累积奖励期望Q值最大化的动作,此时AUV能够以一种最节能的方式安全到达刻i所获得的奖励值。Gt=rt+1+γrt+2+γ2rt+3+…+γm-1rt9[0021]通过Q-table中的累积奖励期望Q值的学习和更新这个过程,能够得到收敛的Q*,雨(i=1.2,…,n-1)表示从路径点vi到路径点nisr的子路径段。[0036]AUV需要沿前进路径Pf对环境信息进行采样,同时要考虑洋流对其能量消耗的影始奖励矩阵中的非负值RMta.(s,an)(l,h=1,2,…,N)重新设计为:路径Pr返回起始点。由于在返回路径Pr上AUV不进行采样,只考虑洋流对AUV能量消耗的影于海底的速度大小,即推进速度,可由公式(9)计算得到。经过重新设计得到的奖励矩阵[0051]在对奖励矩阵进行系统的设计后,可以利用重新设计得到的Raw和Riew,根据公aQ'(s,a)(11)[0067]提出的基于概率路线图的Q-learning混合路径规划方法,可用于AUV进行高效地的实现提供了极大的便利。本发明在计算资源和决策时间有限的AUV上具有很大的应用潜[0077]本发明提出一种基于学习和采样的AUV信息性路径规划方法,同时考虑障碍物的AUV规划一条满足预算约束的采样信息最大化的安全路径的问题。本发明使用强化学习中Q-table进行学习和更新直至收敛,通过遍历收敛的Q-table来为AUV构建一条信息丰富的够搜索到任意两个位置节点之间的路径,利用这一特性本发明设计了AUV在其能量不足时[0087]使用时间差分法学习目标策略π。Q-table中的累积奖励期望Q值的学习和更新过环(i=1.2,…,n-1)表示从路径点pi到路径点的子路径段。路径表示形式如图1所示。骤将对基于学习和采样的AUV信息性路径规划方法进行详细说明。首先,为了提高计算效了所提出的混合路径规划方法如何方便地实现AUV的自动返[0103]Q-learning中Q-table学习和更新的效率与状态空间和动作空间的维度有关。当节点集合设置为Q-learning中的状态空间。更具体地说,假设构建的概率路线图如图3所[0108]由于奖励矩阵不关心每个状态位置的信[0109]AUV需要沿前进路径Pf对环境信息进行采样,同时要考虑洋流对其能量消耗的影Raea进行重新设计。考虑在状态sh处的采样信息值以及由状态sl转移到状态sh时的能量消耗将初始奖励矩阵中的非负值RMa(s,an)(,h=1,2,…,N)重新设计为:路径Pr返回起始点。由于在返回路径Pr上AUV不进行采样,只考虑洋流对AUV能量消耗的影维坐标为[xj,yj])所花费的航行时间,lcell为环境空间(如图1所示)中单位网格的长度,[0125]在对奖励矩阵进行系统的设计后,可以利用重新设计得到的Raw和Riew,根据公温度梯度信息最丰富的3×3区域的中心点[8,8]。这两个点将以与生成概率路线图相同的用所提出的基于学习和采样的路径规划方法规划的前进路径和返回路径如图4所示。图中[0147]由于在构建概率路线图时采样的节点是随机生成的,所以设置了不同的随机种[0148](2)AUV的能量储备不足Eo2200J或2000J,此时AUV的能量储备不足以支撑其达到有必要通过合理设置采样节点的数量来平衡算法效性。通过对各种场景的模拟,AUV能够很好地完成信息性路径规划任务。与单独的Q-时间有限的AUV上具有很大的应用潜力。此外,所提出的混合算法不仅局限于所考虑的场

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论